混元多模态-多模态强化学习研究
关于这个机会
课题背景: 近年来,多模态模型快速发展,包括生成模型(Diffusion Models)和理解模型(VLMs),但如何通过强化学习(RL)实现高质量后训练(post-training)来提升模型能力仍是开放问题。本课题将探索面向多模态生成与理解模型的强化学习训练框架,包括生成模型(文生图/视频)与视觉语言理解模型的RL后训练方法,并构建可扩展的RL Infra与Reward系统,以提升模型生成质量、推理效率与任务泛化能力。 课题挑战: 1. 多模态RL训练框架搭建(基于UniRL仓库):构建可扩展的RL Infra,统一训练引擎、推理引擎与reward server,支持生成模型与VLM的高效后训练; 2. 生成模型RL算法研究:设计适用于diffusion/生成模型的RL算法,例如dense reward、multi-reward优化及off-policy稳定训练; 3. 多任务reward系统构建:设计reward hub与pipeline,为不同任务构建高质量reward信号。 具体工作: 参与多模态强化学习研究,包括RL Infra搭建、生成模型RL算法设计,以及多任务reward系统构建与实验验证。
任职要求
1. 计算机相关专业的博士、硕士、以及特别优秀的高年级本科生; 2. 工程代码能力强或理论功底扎实; 3. 发表过一作顶会论文,包括ICML/NeurIPS/ICLR、CVPR/ICCV/ECCV; 4. (加分项) 有diffusion models (image/video generation) 相关工作发表,并具备一定的大规模训练经验; 5. (加分项) 有RL infra相关工程搭建经验,熟悉常用的training engine (FSDP/Megatron)和inference engine (vllm/SGLang),并对生成模型有一定的了解; 6. (加分项) 有reward model相关数据标注链路经验
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。