腾讯
校园招聘 · 青云计划-应届生混元多模态-基于Verifiable Reward的多模态强化学习
面议
关于这个机会
课题背景:大语言模型(LLM)在文本领域通过RLHF取得了显著进展,但多模态场景——尤其是语音交互——面临独特挑战。当前主流方案依赖人工标注的Reward Model(RM)数据来训练奖励模型,再通过强化学习优化。这种对RM偏好数据标注的依赖制约了模型的迭代。 课题挑战: 文本域的Verifiable Reward成立依赖于答案可验证(如数学题有标准解、代码可执行)。但语音交互的质量评估缺乏客观验证基准,因此verify更加复杂。 在多模态交互LM场景下,设计verifiable reward的链路更加复杂 具体工作: 设计基于多个verifiable reward的agentic system最终实现对于多模态交互任务的准确verifiable信号提取
任职要求
学历与专业: 来自计算机科学、人工智能、电子信息、信号处理等相关专业的博士/硕士同学,具备扎实的机器学习理论基础,有多模态方向研究经验者优先。 技能要求:精通 PyTorch 框架与 Python 编程;深度掌握 Transformer 架构及主流 MLLM(如 LLaVA, Qwen-Audio, Qwen-Omni) 原理;熟悉 PPO、GRPO 等强化学习算法及 DeepSpeed/Megatron 分布式训练工具。 软性素质: 具备较强的问题分解与独立研究能力;能在模糊问题定义上给出清晰的拆解思路和方法。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。