agent架构师
用人方:远程团队(名称在约面时告知)
AI 平台架构师 / AI 基础设施架构师 岗位方向:AI Platform / Agent Infrastructure / Cloud Native / GPU Infrastructure 经验要求:8 年以上开发/架构经验,3 年以上 AI 相关项目经验优先 岗位职责 负责公司 AI 平台及 AI 应用基础设施的整体架构设计与技术落地,支撑 AI Agent、AIGC 图像/视频、大模型 API、模型推理等业务稳定运行。 不仅要求具备传统后端及云原生架构能力,还需要理解当前 AI 应用的技术体系,能够完成从: AI 应用 → Agent → 模型服务 → GPU 算力 → Kubernetes → DevOps → 可观测性 的完整技术架构设计。 1. AI 平台架构 负责公司 AI 平台整体技术架构设计、技术选型及核心模块建设。 负责 AI Agent、LLM、AIGC 图像/视频等业务的基础架构设计。 建设统一 AI Gateway,对接 OpenAI、Claude、Gemini、DeepSeek、Qwen、MiniMax 及私有部署模型。 设计统一模型调用层,实现模型路由、Fallback、负载均衡、限流、熔断、重试及成本控制。 设计 Agent Runtime / Tool Runtime,支撑 Tool Calling、MCP、Workflow、异步任务等能力。 建设模型、Prompt、Agent、Workflow 的版本管理和发布体系。 负责 AI 服务高可用、高并发、可扩展架构设计。 2. Python / Go 后端架构 熟练使用 Python + Go 进行后端及基础设施开发。 Python 方向熟悉 FastAPI、Pydantic、AsyncIO、Celery 等常见技术。 Go 方向熟悉 Gin、Fiber、gRPC 等技术体系。 熟悉 REST API、WebSocket、SSE、gRPC 等通信方式。 熟悉微服务、分布式系统、任务队列、缓存、数据库及对象存储等基础架构。 能够针对 AI 长任务、GPU 任务设计异步任务系统。 具备高并发、限流、熔断、降级、幂等、重试、分布式锁等实际工程经验。 3. Kubernetes / 云原生 精通 Kubernetes 生产环境部署及运维。 熟悉 Deployment、StatefulSet、DaemonSet、Job、CronJob、Service、Ingress、HPA、PVC 等核心资源。 熟悉 Helm / Kustomize。 能够设计多 Namespace、多环境、多集群部署架构。 熟悉 Pod 调度、资源限制、健康检查、滚动更新、自动扩缩容。 能够快速定位 Pod Pending、OOMKilled、CrashLoopBackOff、MinimumReplicasUnavailable 等常见问题。 熟悉 GPU Kubernetes 调度,包括 NVIDIA Device Plugin、GPU Resource、Node Selector、Affinity/Taint/Toleration 等。 有 EKS / ACK / GKE / Azure AKS 等公有云 Kubernetes 生产经验优先。 4. GPU / AI Infra 理解 GPU 推理服务的部署和资源管理。 熟悉 NVIDIA GPU、CUDA、显存、GPU Utilization 等基本概念。 能够设计 GPU 资源池及任务调度机制。 熟悉多 GPU / 多节点推理场景。 熟悉模型加
咨询时报上岗位编号 JD-0032,顺手附上简历,匹配更快。全程不收任何费用。