← 发现更多职位
腾讯
校园招聘 · 青云计划-实习生

混元多模态-基于Verifiable Reward的多模态强化学习

面议
北京 · 经验要求见详情
青云课题青云计划-实习生TEG

关于这个机会

课题背景:大语言模型(LLM)在文本领域通过RLHF取得了显著进展,但多模态场景——尤其是语音交互——面临独特挑战。当前主流方案依赖人工标注的Reward Model(RM)数据来训练奖励模型,再通过强化学习优化。这种对RM偏好数据标注的依赖制约了模型的迭代。 课题挑战: 文本域的Verifiable Reward成立依赖于答案可验证(如数学题有标准解、代码可执行)。但语音交互的质量评估缺乏客观验证基准,因此verify更加复杂。 在多模态交互LM场景下,设计verifiable reward的链路更加复杂 具体工作: 设计基于多个verifiable reward的agentic system最终实现对于多模态交互任务的准确verifiable信号提取

任职要求

学历与专业: 来自计算机科学、人工智能、电子信息、信号处理等相关专业的博士/硕士同学,具备扎实的机器学习理论基础,有多模态方向研究经验者优先。 技能要求:精通 PyTorch 框架与 Python 编程;深度掌握 Transformer 架构及主流 MLLM(如 LLaVA, Qwen-Audio, Qwen-Omni) 原理;熟悉 PPO、GRPO 等强化学习算法及 DeepSpeed/Megatron 分布式训练工具。 软性素质: 具备较强的问题分解与独立研究能力;能在模糊问题定义上给出清晰的拆解思路和方法。

官方来源与核验

腾讯官方招聘 · 职位编号 1231829074687944738

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。