腾讯
校园招聘 · 青云计划-应届生面向多模态生成的强化学习研究
面议
关于这个机会
研究面向多模态生成模型的强化学习算法。重点包括但不限于: 1. 研究强化学习RL算法,使得模型能够根据任务目标和人类偏好得到持续优化; 2. 研究视频生成和多模态生成中的奖励模型(Reward Model)系统,使得在复杂场景、实际应用场景中可泛化,可给出准确可靠的奖励信号; 3. 研究强化学习新方案,比如结合RL和蒸馏,模型的自进化等。
任职要求
1. 对于多模态生成、强化学习RL、奖励模型(Reward Model)等至少一个方向有深入项目经历和经验; 2. 具备大模型训练、调参、实验分析和问题排查能力; 3. 对数据有感觉、认同数据价值,能够深入分析数据、构建数据方案; 4. 好奇心强,思路灵活,做事认真负责,愿意挑战开放问题; 5. 熟练使用 AI 工具提升研发效率。 加分项 1. 有大规模强化学习、奖励模型直接训练和交付经验; 2. 有顶会论文、开源项目、产品落地经验等; 3. 在ACM、NOI等竞赛中取得优秀成绩。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。