← 发现更多职位
腾讯
校园招聘 · 青云计划-应届生

混元基座模型-强化学习生产范式研究

面议
北京 · 经验要求见详情
青云课题青云计划-应届生TEG

关于这个机会

课题背景: 强化学习已成为突破大模型智能上限与构建统一多维能力的核心技术。随着应用场景逐渐从单一文本模态扩展至多模态、任务类型从简单聊天扩展至长思维链的复杂推理,以及与环境产生复杂交互的agent任务,探索面向多样化异构任务的高效RL训练与融合生产范式,实现大模型全场景能力的统一,已成为通往AGI的关键命题。 课题挑战: 1. agent等任务依赖环境反馈和长上下文交互,在RL学习与on-policy distillation(opd)中极易出现训推不一致以及奖励稀疏的问题,如何RL及OPD稳定性以及提升效果上限。 2. 统一模型需要兼容跨模态理解与生成、agent与非agent任务、长超上下文与长期记忆等,跨任务的融合容易出现效果冲突,如何实现多样化异构任务的无损融合和蒸馏。 3. 当前基于模型合并及OPD的融合范式,其在复杂OOD任务上的真实泛化能力仍缺乏系统性验证,其理论局限性尚未被完全揭示。 具体工作: 你将参与agent任务的RL及OPD的训练稳定性及算法效果优化,以及异构任务的能力融合与蒸馏及其泛化性研究。

任职要求

学历和专业要求: 计算机、人工智能、机器学习、自然语言处理、自动化、数学、统计学等相关专业硕士及以上学历,博士优先。 技术技能要求: 1. 熟练掌握 Python,熟悉 PyTorch 等深度学习框架,有较强实验设计与工程实现能力。 2. 具备良好的技术视野,理解大模型相关技术原理,熟悉大模型 SFT、RL 及 reward 建模等训练范式,对 RL/OPD 等有深入的实践和研究经验; 3. 有高质量论文发表者优先(如ACL、EMNLP、NeurIPS、ICML、ICLR等); 软性素质要求: 1.具备较强的问题分析能力、自驱力和协作意识,对前沿算法研究有持续热情,能够独立推进研究问题分析、实验验证与方案迭代; 2. 具备强烈的进取心、自驱力及团队合作精神,热衷于追求技术创新。

官方来源与核验

腾讯官方招聘 · 职位编号 1274481034578500700

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。