← 发现更多职位
腾讯
校园招聘 · 青云计划-应届生

混元多模态-原生多模态后训练技术研究

面议
深圳总部 · 经验要求见详情
青云课题青云计划-应届生TEG

关于这个机会

课题背景:原生多模态架构逐渐成为生图的主流方案,例如混元发布的Hunyuan-Image-3.0就是一个原生多模态模型,在文生图和图生图都取得了不错的效果。模态统一是大势所趋,但理解与生成的强化范式仍存在较大差异,如何在统一架构上同时做好理解和生成的强化学习仍是一个亟需探索的问题。 课题挑战:1)构建跨模态的强化学习范式,兼容理解与生成,弥合离散和连续动作空间差异,搭建端到端强化框架;2)探索生成领域的RLVR范式 ,设计可验证的生成任务和奖励系统,并提升模型通用指令遵循能力;3)reward hacking: 图像生成在强化阶段极易出现reward hacking,无法训更久,解决不断涌现的hacking pattern对于RL scaling至关重要;4)multiple reward system:除了理解和生成各自的rm之外,对于生成任务,同时会有美学,语义,畸形,id一致性等多个reward,一个robust的reward system要能平衡多奖励模型做到各维度同时提升;5)多轮反思生成:即模型具备自我反思能力,通过生成后反思再生成提升模型的生成效果。 具体工作:1)理解和生成统一的强化算法研发;2)reward system/reward hacking/multiple reward 设计;3)生成RLVR范式探索;4)主模型的数据建设和算法实验,成为关键贡献者。

任职要求

学历和专业要求:来自计算机、人工智能、自动化、数学等相关专业的优秀博士/硕士。 技术技能要求:熟悉图像/视频/文本等后训练技术与方法,有相关实践经验和相关顶会论文发表;代码能力强,熟练掌握PyTorch/verl/Megatron;有相关实习经验者优先,有竞赛获奖经历优先。

官方来源与核验

腾讯官方招聘 · 职位编号 1274481034578500627

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。