字节跳动
社招 · 正式豆包大模型算法工程师(火山方舟)-RL Infra
面议
关于这个机会
1、负责改进RL训练系统,包括基于Ray的RL Trainer功能拓展、Rollout/采样策略探索、Reward系统集成、Agent Loop复杂任务下轨迹管理等; 2、负责大模型SFT/RL训练性能和稳定性优化,支持Reasoning,Agent,VLM等各类Post-Training任务; 3、探索前沿大模型算法和训练技术,包括Off-Policy RL训练效果和效率、SRFT、OnPolicy Distillation等。
任职要求
1、计算机相关专业本科及以上学历,具有一年及以上大模型算法工作经验,算法与工程能力兼备者优先; 2、熟悉大模型强化学习系统,有OpenRLHF、VeRL使用和开发经验者优先; 3、深入理解Post-Training全流程与核心算法,包括但不限于DPO,PPO,GRPO,Reward Modeling等; 4、熟悉大规模分布式训练框架和分布式并行概念,如PyTorch FSDP2的原理与应用、DeviceMesh抽象、DTensor语义等; 5、掌握高性能推理引擎(如vLLM,SGLang)的原理与优化方法(如Continuous Batching,PagedAttention,Prefix Caching)等; 6、熟练掌握Python,至少熟练使用一种编译型语言(C/C++/Rust/Golang/Java等),拥有扎实的数据结构与算法功底,代码风格规范且高效;出色的分析和解决问题的能力;具备良好的自驱力和沟通协作能力,能和团队一起探索新技术,推动技术进步。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。