← 发现更多职位
腾讯
校园招聘 · 青云计划-实习生

混元-面向复杂指令与智能体场景的大模型后训练数据飞轮构建研究

面议
深圳总部 · 经验要求见详情
青云课题青云计划-实习生TEG

关于这个机会

课题背景: 随着前沿模型基础能力持续提升,后训练阶段的核心问题逐步集中到复杂场景数据供给。长篇生成、多约束复杂指令、多轮交互、工具调用与长链路任务,对数据覆盖深度、结构质量、评价标准和迭代效率提出了更高要求。围绕高难样本发现、失败模式归因、自动化质检与定向补强构建数据飞轮,已成为复杂能力持续优化的关键路径。 课题挑战: 复杂场景数据具有长上下文、多约束、多步骤和动态交互等特征,数据复杂度高;模型复杂能力提升依赖任务类型、约束组合、工具链路和异常路径的充分覆盖,数据多样性要求高;数据提质不能停留在单次质检或局部修补,而需要构建“评测发现问题—错误归因分析—数据定向补强—配方迭代优化—效果回流验证”的飞轮闭环,持续提升数据质量与能力收益转化效率。 具体工作: 参与大模型后训练(SFT+RL)阶段长文、复杂指令与智能体数据的全链路研发,建立高难样本挖掘、场景分类与难度分层体系;设计长文本与长轨迹数据生产、反例构造和定向修复方案,保障长程连贯性、结构完整性与指令遵循精度;搭建 Rubrics 生成、自动评分、结果验证与多层质量校验 pipeline;沉淀失败模式归因框架,形成“评测发现问题—数据补强—配方迭代—效果回流”的闭环。

任职要求

1、计算机科学、人工智能、自然语言处理等相关专业硕士及以上; 2、在大模型评测、数据质量、Agent/RL 训练、对话系统等方向有深入研究经验者优先; 3、有 ICLR、NeurIPS 和 ICML等顶会论文或高影响力开源贡献者优先; 4、熟练掌握claude code等 ai工具,有基于此落地的soild工作者优先;深入理解 Transformer 架构及 SFT/RL 后训练原理;熟悉Rubric-based Evaluation 等前沿评测方法论; 5、具备从海量数据与实验结果中发现隐含规律的洞察力,以及从 insight 到落地的全链路推动力。

官方来源与核验

腾讯官方招聘 · 职位编号 1243708556705035269

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。