← 发现更多职位
阿里国际数字商业集团
社会招聘

阿里国际站/Alibaba.com-AI Infra大模型训练/分布式训练工程师(后训练/RL)-Accio Work

面议
北京 / 杭州 / 上海 · 2年以上
技术类-算法本科社会招聘

关于这个机会

Accio work 自研的 Agentic RL Infra —— Dressage 开源啦!也被放到了 Slime 的 README 里,欢迎大家来交流~ Github: https://github.com/Accio-Lab/Dressage 岗位职责: 1、支撑模型团队使用 Megatron 框架进行大规模分布式训练,处理 tensor parallel、pipeline parallel、data parallel、expert parallel、sequence/context parallel 等并行策略相关问题; 2、支撑模型团队使用 SGLang 进行高吞吐推理和 rollout,优化 batching、KV cache、prefill/decode 调度、长上下文稳定性和在线训练链路; 3、设计和实现面向更大模型规模的 post-training infra,降低训练资源成本,提高实验迭代效率和系统稳定性; 4、建设 profiling、benchmark、monitoring 和 debugging 工具,提升训练吞吐、GPU utilization、rollout 稳定性和故障定位效率; 5、与研究员和模型工程师紧密合作,把新的训练想法快速落地成可复现、可扩展、可长期维护的系统能力。

任职要求

1、扎实的工程能力,熟悉 Python,最好熟悉一种系统语言或高性能计算相关语言,例如 C++、CUDA、Rust 或 Go; 2、熟悉 PyTorch 生态,理解大模型训练的基本流程,包括 forward/backward、optimizer、checkpoint、activation checkpointing、mixed precision 等; 3、有分布式系统或大规模训练经验,理解 GPU 集群、NCCL、通信开销、显存瓶颈、吞吐优化和故障恢复; 4、对 Megatron、DeepSpeed、FSDP、SGLang、vLLM、TensorRT-LLM、Ray 等训练或推理系统中的至少一类有实际使用或开发经验; 5、理解大模型 post-training 的基本范式,例如 SFT、DPO、PPO、GRPO、RLHF、RLAIF 或 agentic RL; 6、能够在复杂系统中定位问题:从日志、metric、profile、checkpoint、到分布式 rank 行为,都愿意追到根因; 7、有强 ownership,能把一次性的实验脚本沉淀成可复用的工具、模板、文档和稳定接口; 8、能和研究团队高效协作,既尊重研究速度,也重视系统正确性和长期可维护性。 加分项:做过 LLM training infra、RLHF infra、online RL、agent training、tool-use training、MoE 训练、低精度训练/推理、PEFT 或高质量开源 infra 项目。

官方来源与核验

阿里巴巴官方招聘 · 职位编号 100023695010

最近核验:2026-09-16T10:05:41.942033+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。