腾讯
校园招聘 · 青云计划-应届生多模态强化学习训练系统构建与优化
面议
关于这个机会
随着视频生成模型与世界模型从预训练迈向强化学习后训练(RLHF/RL Post-Training)阶段,工业界对模型物理一致性、长程时空连贯性及指令遵循能力的要求显著提升。然而,视频模态相较于文本具有帧间连续性要求高、算力消耗呈指数级增长的特性,导致传统RLHF流水线在应对大规模视频模型训练时面临严峻的工程瓶颈。 本课题聚焦视频生成模型/世界模型RLHF训练的工程落地,解决数据生产慢、资源争抢、计算编排及训练不稳定的痛点。通过设计模块解耦的异步流水线,优化奖励模型批处理与显存调度,构建高并发推理服务与容错回滚机制,显著提升系统吞吐与稳定性,降低大规模视频模型强化学习训练门槛。
任职要求
1.计算机相关专业,具备较强的动手能力;熟悉 Python ,具备扎实的系统编程功底和优秀的复杂系统 Debug 能力; 2.深入理解大模型分布式训练原理,具备 Megatron-LM、DeepSpeed 或FSDP 等主流框架研发经验; 3.熟悉大模型后训练与对齐技术(PPO、GRPO、DPO等),熟悉 Verl、ROLL,AReal 等强化学习/分布式计算框架,可以理解并解决 RL过程中的工程痛点; 4.熟悉主流生成模型的原理,在AIGC相关领域具备实际项目经验; 5.具备极强的技术好奇心与自驱力,面对业界无先例的技术难题,能独立思考并推动解决。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。