← 发现更多职位
腾讯
校园招聘 · 青云计划-实习生

混元-面向大语言模型能力提升的高价值训练数据挖掘与合成

面议
深圳总部 · 经验要求见详情
青云课题青云计划-实习生TEG

关于这个机会

课题背景: 训练数据的质量与结构是决定大模型能力边界的核心因素。本课题以提升大语言模型在 STEM 推理、长文理解、复杂知识关联三类关键能力为目标,围绕高价值数据的挖掘与合成展开研究,构建轻量、可扩展、可控的数据合成框架。 课题挑战: 三类目标能力在数据层面均面临显著瓶颈:超高难度 STEM 数据极度稀缺且难以验证;长文训练数据缺乏有效的长程依赖结构;跨文档的多跳知识关联数据覆盖度不足、构造成本高。现有通用合成方案难以同时兼顾数据质量、任务多样性与规模化生产效率。 具体工作: 本课题以提升大语言模型在 STEM 推理、长文理解、复杂知识关联三类关键能力为目标,围绕高价值数据的挖掘与合成展开研究,构建轻量化、可扩展、高可控的数据合成框架体系。具体工作包含但不限于以下子方向: 1、STEM 数据合成:针对超高难度 STEM 数据稀缺问题,定向构造具备强推理逻辑、高复杂度、多维知识关联的合成数据,实现竞赛级难题的规模化生产与可验证质量控制; 2、长文数据合成:从预训练语料中挖掘并重组具备目标依赖关系的文本单元,结合基于模型反馈的动态难度调节合成机制,渐进式引导模型建模更复杂的长程依赖关系; 3、知识与领域数据合成:构建基于图游走(Graph Walk)的多文档多跳推理合成框架,结合反馈驱动的迭代优化机制,系统化生成覆盖广、关联密度高的大规模知识训练数据。

任职要求

1、计算机/软件工程等相关专业硕士以上学历,拥有博士学位者优先,熟悉python/c++编程语言,熟练掌握大数据技术栈,包括Hadoop/Spark等; 2、深入理解大语言模型预训练原理、预训练目标及数据构建流程,拥有发表顶会论文、大模型研究工作、知名竞赛获奖、顶级研究机构或一线互联网工作经验者优先。

官方来源与核验

腾讯官方招聘 · 职位编号 1231829074687944799

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。