← 发现更多职位
菜鸟
社会招聘

菜鸟-具身智能强化学习算法工程师-杭州

面议
杭州 · 3年以上
技术类-算法本科社会招聘

关于这个机会

1. 策略后训练:负责 VLA / 基础操作模型的后训练全流程,在预训练/模仿学习得到的基座策略之上,通过强化学习微调(RLFT)、离线 RL、DAgger、HIL-SERL 、RECAP 等手段持续提升真实仓储任务的成功率与鲁棒性。 2. 奖励与数据闭环:设计任务奖励函数与自动成功判定,搭建 Reward Model / 偏好数据标注流程,构建"部署→失败挖掘→补采/在线交互→后训练→自动评测→再部署"的策略迭代闭环。 3. 大规模训练:在仿真并行环境与真机上开展大规模 Rollout 与 RL 训练,负责采样、经验回放、分布式训练框架的搭建与吞吐优化。 4. 评测与安全:建立后训练前后的量化 Benchmark(成功率、恢复能力、碰撞率、泛化性),管控灾难性遗忘与安全约束,保障策略上真机的稳定性。

任职要求

1. 计算机/自动化/机器人相关专业,扎实的 Python 工程能力。 2. 系统掌握强化学习原理,熟悉各类 On/Off-Policy 等强化学习算法及其调参与稳定性问题。 3. 了解模仿学习与 VLA 训练范式,理解预训练与后训练的分工与衔接。 4. 熟悉至少一种仿真/训练平台(Isaac Lab/Isaac Gym/MuJoCo),具备真机或仿真 RL 落地经验。 加分项: 1. 有大模型/VLA 后训练经验(RLHF/RLAIF、偏好优化、奖励建模)。 2. 有 HIL-SERL、RECAP、Diffusion Policy、π 系列、GR00T、OpenVLA 等实践经验。 3. 有 Sim2Real 迁移或在线 RL 真机部署的完整案例。 4. 有分布式/GPU 并行训练基础设施经验。 5. 有仓储物流自动化背景,或 CoRL/RSS/ICRA/IROS 论文、优质开源项目。

官方来源与核验

阿里巴巴官方招聘 · 职位编号 100002466009

最近核验:2026-09-16T10:07:35.321795+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。