字节跳动
社招 · 正式强化学习训练框架工程师(火山引擎机器学习平台)-Data AML
面议
关于这个机会
1、veRL框架研发与优化:主导veRL架的核心功能设计与开发,聚焦性能优化与稳定性提升,推动框架在复杂场景(如Agent、Compute Use)下的规模化应用;同时深度参与开源社区生态建设(如技术贡献、文档维护、社区活动组织); 2、veOmini LLM/DiT训练框架研发与优化:负责veOmini中LLM与DiT训练模块的开发与优化,支持Wan2.1/Qwen/DeepSeek等热点模型的高效后训练和强化学习。
任职要求
1、熟练掌握Linux环境下C/C++、Python编程,具备高效的代码实现与调试能力; 2、深度掌握PyTorch框架,掌握Profiling、调优方式,了解其底层原理; 3、具备训练框架(如Megatron-LM、DeepSpeed、TorchTuner)或推理框架(如vLLM、SG-Lang、TensorRT)的开发和优化经验; 4、熟悉大模型(LLM、DiT)的训练特性,具备模型训练性能瓶颈分析与调优能力; 5、有大规模分布式系统开发或运维经验,熟悉分布式通信库(RPC、NCCL、MPI)的使用与调优。 加分项 1、有GitHub开源社区技术热门项目贡献经验(代码提交、问题解决、文档维护等); 2、熟悉强化学习(RL)任务特点,具备RL框架或算法优化经验。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。