About the job
团队介绍:字节跳动基础设施计算团队,专注构建面向大模型与 AI Agent 时代的 AI-Native Infra。我们从算力、系统到平台,围绕“AI 如何高效运行、持续进化、规模化落地”这一核心问题,重构计算基础设施。我们管理着数十万台服务器组成的超大规模集群,构建统一的异构算力调度与云原生运行体系;通过软硬协同与自研框架,持续突破大模型训练与推理的性能瓶颈;并进一步向上,打造企业级 AI Agent Infra,让 Agent 具备身份、权限、记忆、观测与治理能力,真正成为可运行在生产环境中的新型“应用形态”。
从云服务器、容器、函数,到 AI 网关、可观测与弹性体系,我们构建的是一个为 AI 而生、由 AI 驱动进化的基础设施平台,支撑集团核心业务与企业级客户的智能化升级。
如果你希望参与定义 AI 时代的 Infra 范式,而不仅是优化一个模块或服务——欢迎加入我们,一起构建下一代 AI 云原生基础设施。
Responsibilities
1、负责火山引擎Agent基础设施的整体技术架构与演进路线,定义开发面、控制面、执行面和治理面的系统边界、核心抽象及关键接口;
2、主导Agent Runtime与安全执行架构设计,覆盖Sandbox、容器/虚拟化、长任务、状态持久化、Checkpoint、故障恢复、网络与数据访问控制等关键能力;主导大规模Agent调度与资源体系建设,解决高并发、弹性伸缩、多租户隔离、跨地域容灾及异构资源利用问题,在性能、稳定性和成本之间形成可量化的最优方案;
3、规划Tool、Skill、Plugin、MCP/A2A、Memory、多Agent协同和企业系统连接等通用能力,建立开放、可扩展且向后兼容的平台标准;建立企业级Agent安全与治理体系,包括委托身份、细粒度授权、凭证托管、策略控制、数据边界、行为审计、风险拦截和安全沙箱;
4、建设统一的Agent Observability、Evaluation和AgentOps体系,定义任务成功率、可恢复性、延迟、资源效率和单位任务成本等核心指标,形成从运行轨迹到产品和模型改进的闭环;面向公有云、专有云和混合环境,设计标准化产品架构与交付体系,保障SLA、可运维性、版本兼容性和跨环境一致性;
5、深入重点行业和标杆客户,识别定制需求背后的平台共性,将客户实践沉淀为产品能力、技术标准和参考架构;推动计算、容器、网络、存储、安全、模型、Agent平台及SRE等团队形成一致的技术方案,主导复杂项目和关键技术风险的决策与落地;
6、建设团队技术梯队和工程标准,通过架构评审、技术规划、人才培养、开源与行业交流,提升火山引擎在Agent Infra领域的技术影响力。
Qualifications
Minimum
1、具备分布式系统、云计算、PaaS/Serverless、容器平台或AI Infra领域的深厚经验;主导过至少一个复杂基础设施或平台从0到1的架构及规模化落地,并对其稳定性、性能、成本和长期演进结果负责;
2、深入理解操作系统、网络、存储、调度、容器或虚拟化中的至少两个领域,能够识别跨层系统瓶颈并完成架构取舍;深入理解Agent系统的核心工作负载和技术挑战,包括长任务、不确定性执行、工具调用、状态与记忆、安全边界、评测和故障归因;
3、在以下至少一个方向具备业界领先的技术深度:Agent Runtime、Sandbox或安全执行环境;Kubernetes、Serverless、分布式调度或资源管理;Agent Gateway、AI中间件、MCP/A2A和工具生态;企业身份权限、多租户安全和可信执行;Agent Observability、Evaluation、AgentOps;生产平台的稳定性、性能和成本优化;
4、具备优秀的抽象与架构能力,能够在技术快速变化、需求不完全明确的情况下定义正确问题,并形成可分阶段落地的技术路线;具备较强的跨团队影响力和客户沟通能力,能够推动多个研发团队、产品团队及重点客户围绕统一目标完成复杂项目;
5、保持足够的技术动手能力,能够通过原型、代码、性能数据和线上问题验证架构判断,而非仅停留在方案层面。
Preferred
1、主导过生产级Agent Platform、Agent Runtime、代码执行平台、Serverless或工作流平台;
2、有云产品商业化、私有化部署、混合云、多地域容灾或重点行业客户交付经验;
3、参与过Kubernetes、Firecracker、Kata、gVisor、LangGraph、AgentScope、Dify、MCP/A2A等相关开源项目或标准建设;
4、有Agent强化学习环境、Rollout、自动评测、轨迹数据平台或Context Engineering经验;
5、在开源社区、技术大会、标准组织或行业客户中具有较强技术影响力。