从大模型训练、推理加速,到 AI 流量接入与调度,再到 Agent 的开发、部署与运行,我们正在寻找对 AI 基础设施充满热情的技术伙伴,一起解决大模型走向规模化应用的工程问题。欢迎对系统研发、性能优化和 AI 工程充满热情的你加入。
如果你喜欢钻研系统底层,愿意追问一次请求为什么慢、一个集群为什么跑不满、一个长任务怎样才能可靠完成,欢迎来聊聊。
在 AI 的关键链路上,解决有挑战的技术问题
大模型的能力,需要高效、稳定的系统来承载。这里的技术挑战覆盖千卡、万卡规模的计算基础设施,训练与推理性能优化,低延迟、高并发的 AI 网关,以及安全、可扩展的 Agent 运行平台。你可以深入算子、通信、调度和系统架构,让工程优化体现在训练效率、请求时延、资源利用率和服务稳定性上。
从底层原理到平台交付,拓宽自己的技术边界
这些方向需要系统、算法和软硬件协同,也需要把技术能力做成好用的平台、SDK 和 API。你将有机会与不同领域的同学合作,理解模型从训练到上线、Agent 从构建到运行的完整链路,在具体方向上深入,也建立对整体系统的判断力。
让开源实践和技术探索,成为你的优势
我们关注真实的工程能力,也重视持续的技术投入。无论你钻研过训练与推理框架、参与过网关或云原生项目,还是搭建过 Agent 平台,都欢迎带着代码、实验结果和自己的思考来交流。开源贡献、研究成果和竞赛经历,都可以成为展示你的方式。
招聘层级:P6/P7/P8,同时欢迎优秀应届毕业生。
工作地点覆盖北京、杭州、深圳、上海、广州、成都,具体以对应岗位为准。
| 招聘方向 | 主要工作 |
|---|---|
| 百炼 MaaS 网关工程师 | AI 原生网关、多模态与多协议接入、安全防护、智能流控、全球与本地流量调度 |
| 大模型 Infra 研发工程师(训练/推理) | 分布式训练优化、推理引擎、算子优化、量化压缩、软硬件联合优化 |
| AI Infra 工程师 | 大规模 GPU 集群、训练与推理加速、资源调度、通信与存储、研发平台 |
| Agent Infra 工程师 | Agent 框架、沙箱与安全隔离、任务调度与状态管理、上下文与检索、AgentOps |
构建高性能 AI 原生网关,支持多模态、多协议接入,完善数据面控制与可观测能力;通过安全防护、柔性流控、就近接入和 Global/Local 调度,优化 AI 请求的传输与响应体验。
希望你具备: 熟练掌握 C++ / Go 至少一门语言;熟悉 Linux / POSIX、多线程与异步编程,理解微服务和分布式系统,追求系统性能与稳定性。
加分项: 有网关、调度系统、Kubernetes 或云原生平台开发经验;熟悉 Higress、SGLang Gateway、Nginx、Envoy 等项目,持续关注推理引擎,或有高性能计算相关论文成果。
优化大模型训练全链路,突破分布式性能瓶颈,提升算力利用率与训练稳定性;研发推理引擎,通过算子融合、动态图优化、FP8 / INT4 量化及 CUDA 算子开发,降低推理时延与计算成本,探索从预训练、SFT、RLHF 到部署的端到端优化。
希望你具备: 精通 C++ / Python,熟练掌握 PyTorch 或 TensorFlow 并理解内部机制;熟悉 GPU 架构、并行计算、主流训练或推理框架及 Transformer,对量化、蒸馏、剪枝或 CUDA / Triton 算子优化至少一项有深入研究或实践。计算机、人工智能、软件工程、数学相关专业优先。
加分项: 以第一作者在 NeurIPS、ICLR、ICML、ACL、OSDI、SOSP 等顶会发表论文;深度参与 vLLM、OpenRLHF、Megatron 等 MLSys 开源项目,或在 ACM / ICPC、Kaggle 等竞赛中取得突出成绩。
参与支撑千卡、万卡规模的 AI 计算基础设施建设,围绕分布式训练、推理加速、GPU 资源调度、高性能通信与存储,以及模型研发平台中的一个或多个方向,提升计算效率与研发效能。
希望你具备: 良好的系统工程基础,熟悉 Linux,掌握 Python、Go、Java 等至少一门语言,了解分布式系统的一致性、容错与扩展性;在 AI 与训练流程、主流训练推理框架、异构或高性能计算等领域中,至少具备一项相关能力。计算机、软件工程等相关专业优先。
加分项: 有 GPU 优化经验、优秀算法竞赛成绩、顶会论文、高影响力项目或开源贡献。喜欢分析性能、从底层拆解问题,愿意跨领域学习和协作。
构建支撑 Agent 全生命周期的基础设施,覆盖沙箱执行、容器编排、任务调度与状态管理;通过委托身份认证、安全 API 调用和检查点恢复,提升安全性与长任务可靠性;将上下文预计算、知识检索和观测能力封装为 SDK、API 与开发工具,支持 Agent 规模化落地。
希望你具备: 扎实的操作系统、网络、数据库基础,精通 Go / Python / Java / C++ / Rust / TypeScript 至少一门语言,熟悉后端技术栈,以及云原生或安全隔离技术;深入理解大模型原理,熟悉至少一种 Agent 框架或 RAG、工具调用、Skills 等核心组件,具备训练、评测、部署等生命周期管理经验。
同时,希望你掌握 LLMOps、AgentOps 和可观测性实践,善用 AI Coding 开发原型,熟悉测试与变更管理,并有高并发优化或多租户隔离经验。计算机、软件工程、人工智能等相关专业优先。
加分项: 有 Agent 优化或平台开发经验,熟悉上下文工程、多 Agent 协同,有强化学习或规划算法背景,或有顶会论文、高影响力项目、开源贡献。
欢迎根据自己的积累和兴趣选择匹配的方向,具体要求以对应岗位为准。
简历投递至 jimin.jm@alibaba-inc.com
建议邮件标题:意向方向-姓名。
如果有 GitHub 项目、开源贡献、论文或技术博客,也欢迎随简历附上。我们期待了解你做过什么、解决过什么问题,以及你最想继续探索的方向。
一起把 AI 背后的系统做得更快、更稳、更好用。期待你的加入!






