← 发现更多职位
腾讯
校园招聘 · 青云计划-应届生

混元基座模型-预训练数据效率优化研究

面议
北京 · 经验要求见详情
青云课题青云计划-应届生TEG

关于这个机会

课题背景: 预训练数据是基座模型能力的基石。随着模型参数量剧增,高质量自然语料濒临枯竭,单纯扩大规模的收益递减。现有清洗与静态配比方案难以高效剔除隐蔽噪声,且缺乏动态调度机制,导致长尾知识吸收不足,制约模型能力上限。因此,攻克大模型数据清洗与调度机制是破局关键。 课题挑战: 1. 规模与质量的博弈:在百TB级语料中进行深度清洗计算开销巨大,难以在过滤低质噪声的同时避免高价值长尾知识的误杀。 2. 配比空间的组合爆炸:数据领域繁杂,传统启发式搜索无法有效寻优,精准建立数据分布与模型下游维度的映射规律极具挑战。 3. 动态调度的指标盲区:训练过程中缺乏低成本、高置信度的即时评估指标,难以准确评估模型实时状态并实施精准的数据调度。 具体工作: 1. 负责在PB级预训练语料中筛选有价值的部分,设计数据策略并验证其效果; 2. 探究多领域数据科学配比规律; 3. 设计并落地符合大模型认知规律的训练数据动态调度策略。

任职要求

学历和专业要求: 自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士以上学历; 技术技能要求: 1,相信 Scaling Law,认可数据、算力与模型规模化带来的长期价值,善于通过系统实验验证规律; 2,具备较强的工程能力,对于更高效更稳定的工具有持续追求; 软性素质要求: 认真仔细,对指标与数据中的蛛丝马迹高度敏感,不轻易放过任何异常与偏差。

官方来源与核验

腾讯官方招聘 · 职位编号 1274481034578500695

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。