← 发现更多职位
字节跳动
社招 · 正式

豆包大模型算法工程师(火山方舟)-RL Infra

面议
Beijing(北京) · 经验要求见详情
研发算法社招 · 正式A182402A

关于这个机会

1、负责改进RL训练系统,包括基于Ray的RL Trainer功能拓展、Rollout/采样策略探索、Reward系统集成、Agent Loop复杂任务下轨迹管理等; 2、负责大模型SFT/RL训练性能和稳定性优化,支持Reasoning,Agent,VLM等各类Post-Training任务; 3、探索前沿大模型算法和训练技术,包括Off-Policy RL训练效果和效率、SRFT、OnPolicy Distillation等。

任职要求

1、计算机相关专业本科及以上学历,具有一年及以上大模型算法工作经验,算法与工程能力兼备者优先; 2、熟悉大模型强化学习系统,有OpenRLHF、VeRL使用和开发经验者优先; 3、深入理解Post-Training全流程与核心算法,包括但不限于DPO,PPO,GRPO,Reward Modeling等; 4、熟悉大规模分布式训练框架和分布式并行概念,如PyTorch FSDP2的原理与应用、DeviceMesh抽象、DTensor语义等; 5、掌握高性能推理引擎(如vLLM,SGLang)的原理与优化方法(如Continuous Batching,PagedAttention,Prefix Caching)等; 6、熟练掌握Python,至少熟练使用一种编译型语言(C/C++/Rust/Golang/Java等),拥有扎实的数据结构与算法功底,代码风格规范且高效;出色的分析和解决问题的能力;具备良好的自驱力和沟通协作能力,能和团队一起探索新技术,推动技术进步。

官方来源与核验

字节跳动官方招聘 · 职位编号 7530634694203984136

官方发布时间:

最近核验:2026-09-16T12:33:12.416632+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。