About the job
团队介绍:字节跳动基础设施计算团队,专注构建面向大模型与 AI Agent 时代的 AI-Native Infra。我们从算力、系统到平台,围绕“AI 如何高效运行、持续进化、规模化落地”这一核心问题,重构计算基础设施。我们管理着数十万台服务器组成的超大规模集群,构建统一的异构算力调度与云原生运行体系;通过软硬协同与自研框架,持续突破大模型训练与推理的性能瓶颈;并进一步向上,打造企业级 AI Agent Infra,让 Agent 具备身份、权限、记忆、观测与治理能力,真正成为可运行在生产环境中的新型“应用形态”。
从云服务器、容器、函数,到 AI 网关、可观测与弹性体系,我们构建的是一个为 AI 而生、由 AI 驱动进化的基础设施平台,支撑集团核心业务与企业级客户的智能化升级。
如果你希望参与定义 AI 时代的 Infra 范式,而不仅是优化一个模块或服务——欢迎加入我们,一起构建下一代 AI 云原生基础设施。
Responsibilities
1、参与企业级Agent Runtime建设,负责Agent任务执行、状态管理、长任务运行、Checkpoint、重试恢复和生命周期管理等核心能力,使Agent能够在生产环境中稳定完成复杂任务;
2、参与Agent安全执行环境建设,围绕容器、虚拟机或轻量级Sandbox,完善环境创建、镜像与依赖管理、资源限制、网络控制、文件系统隔离和运行时安全等能力;
3、建设Agent任务编排与资源调度能力,支持高并发任务、弹性伸缩、优先级与配额管理、多租户隔离以及CPU/GPU等异构资源的高效使用,参与Tool、Skill、Plugin、MCP/A2A、Computer Use等连接能力建设,将企业数据、API和应用系统以安全、标准化的方式提供给Agent使用;
4、建设Agent可观测与评测基础设施,完善对模型调用、工具调用、任务轨迹、资源消耗和失败原因的追踪、诊断与度量,持续优化任务成功率、延迟、稳定性与成本,面向企业级交付要求,参与身份权限、凭证管理、审计、配额、灰度、容灾、版本兼容及公有云/专有环境适配等能力建设;
5、深入客户实际场景,与产品、算法、安全、SRE和解决方案团队协作,将客户共性需求抽象为稳定、易用、可复用的平台能力;
6、基于AI-Native SDLC实践,使用AI Coding、自动化测试和智能诊断等方式提升研发效率,并将工具、排障方法和最佳实践沉淀为团队可复用的工程资产。
Qualifications
Minimum
1、本科及以上学历,计算机、软件工程、人工智能或相关专业;计算机基础扎实,理解操作系统、网络、数据结构、数据库和分布式系统基本原理;
2、熟练掌握Go、Python、Java、C++或Rust中至少一门语言,具备良好的代码质量、测试与工程化意识;具备后端、云原生、分布式系统或基础设施研发经验,能够独立完成模块设计、开发、上线与问题闭环;
3、熟悉以下至少一个方向:Kubernetes、容器、虚拟化或Sandbox;分布式任务调度、工作流或资源管理;API Gateway、Service Mesh、微服务或中间件;可观测性、SRE、故障诊断或性能优化;IAM、网络安全、多租户或运行时隔离;
4、对AI Agent的运行机制有深刻理解,深入工具调用、工作流、Memory、RAG、MCP、Multi-Agent或评测等概念,深入Agent设计模式和实践;
5、具备良好的产品和客户意识,可以基于市场和客户来洞察能力建设,能够从企业用户任务出发理解需求,并兼顾易用性、稳定性、安全性与成本;
6、具备较强的责任心和协作能力,愿意看监控、追问题、做复盘,并推动复杂问题落地闭环。
Preferred
1、有Agent Runtime、代码执行平台、Serverless、CI/CD Runner、在线IDE、Notebook、RPA或自动化执行平台经验;
2、熟悉Firecracker、Kata Containers、gVisor、Wasm、Docker或其他隔离技术;
3、使用或研究过Claude Code、Codex、OpenClaw、LangGraph、Dify、AgentScope、MCP/A2A等Agent产品、协议或框架;
4、有任务调度、多租户平台、企业权限体系、私有化交付或云产品研发经验;
5、有开源贡献、技术博客、竞赛、科研成果或高质量个人项目。