← 发现更多职位
千问事业部
社会招聘

千问事业部-大模型训练专家-强化学习方向

面议
北京 / 杭州 · 1年以上
本科社会招聘

关于这个机会

1、负责千卡以上大规模混合模态大模型强化学习训练框架建设,调研和实现业界先进的强化学习方法,并探索算法工程结合的训练方法创新设计,实现模型性能和训练效率的双提升; 2、打通复杂工具调用场景的高性能推理与Agent训练系统,攻克长程数据训练中的训练效率、训推一致性等难点,显著提升千问模型基于多种阿里生态工具(如闪购、飞猪等)的用户真实任务解决率; 3、参与奖励系统、工具系统交互的设计与研发,打造高效率的可持续扩展架构;并通过线上链路的联合设计保障模型训练效果的对齐,保障模型在事实性、复杂任务规划解决等方面的能力提点可以落地千问App。

任职要求

1、1年及以上大模型训练工程经验,有扎实的深度学习算法基础,精通各类大模型常用训练框架,熟练掌握各种编译、调试、性能分析工具; 2、熟悉强化学习算法PPO、DPO、GRPO、DAPO等以及相应的高效工程实现,有大模型强化学习工程支持经验和效果优化经验; 3、精通ray分布式计算框架开发实现,掌握一种或多种分布式训练框架(verl、slime、areal、openRLHF、roll)详细系统实现,并具备二次开发能力; 4、熟练掌握开源大模型训练框架(megatron、fsdp)、推理框架(vllm、sglang),具备大模型训练、推理性能分析和优化能力; 5、有大规模强化学习算法和工程结合的训练效率优化经验(尤其是agentic训练),或大规模分布式强化学习系统开发应用经验者优先。 加分项: 1、有强化学习算法调优经验者优先; 2、有强化学习方向顶会论文经验者优先; 3、如果有训练引擎、推理引擎开发经验优先。

官方来源与核验

阿里巴巴官方招聘 · 职位编号 100023020004

最近核验:2026-09-16T10:06:37.958475+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。