← 发现更多职位
腾讯
校园招聘 · 青云计划-应届生

混元基座模型-Reward System研究

面议
北京 · 经验要求见详情
青云课题青云计划-应届生TEG

关于这个机会

课题背景: 奖励系统(Reward System)是一种在人工智能,尤其是大模型RLHF训练中,为模型提供关键奖励信号的核心组件。奖励系统主要通过构建一个Reward Model,模拟人类的价值观和偏好,对大模型生成的候选回答进行自动打分与排序。它不是让模型在海量数据中盲目模仿,而是通过精确的奖惩反馈机制,引导大模型朝着更符合人类期望的方向演进。通过奖励系统,大模型显著提升了人类对齐水平、增强了输出的安全性和有用性、更好地适应了复杂的交互场景。不过,随着模型能力的提升,当前的奖励系统正面临严峻挑战,例如“Reward Hacking”现象导致模型学会了迎合打分规则而非真正解决问题;同时,高质量人类偏好数据的标注成本极其高昂且带有主观偏见,容易引发过度优化(Over-optimization),极大限制了模型综合能力的上限。 课题挑战: 如何构建更加鲁棒、低成本且能精准反映复杂价值判断的奖励系统(如探索基于规则或过程的奖励机制),已经成为大模型对齐技术进一步突破上限的当务之急,目前业界仍缺乏能够有效解决奖励失效的成熟方案,亟待我们攻坚突破。 具体工作: 针对上述挑战,本课题具体工作包括: 引入大模型辅助反馈(RLAIF)与自动化规则约束,大幅降低人工标注成本并减少主观偏见;2) 研发动态对抗与多目标奖励融合机制,通过迭代更新有效识别并抑制“Reward Hacking”现象;3) 构建多维度价值评价体系,平衡安全性与有用性,缓解过度优化,全面提升奖励系统的鲁棒性与对齐上限。

任职要求

学历和专业要求: 自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士以上学历; 技术技能要求: 1.在NLP、LLM、深度学习、强化学习方面有一定研究基础,熟悉主流模型和算法,并有一定的实践经验; 2. 较强的工程实现能力,熟练掌握C/C++,Python等至少一种语言,有实际编程项目经验,熟悉DeepSpeed、Megatron等分布式训练框架,熟练使用至少一种深度学习框架(如TensorFlow,PyTorch等); 3. 有高质量论文发表者优先(如ACL、EMNLP、NeurIPS、ICML、ICLR等); 软性素质要求: 具备强烈的进取心、自驱力及团队合作精神,热衷于追求技术创新。

官方来源与核验

腾讯官方招聘 · 职位编号 1274481034578500702

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。