← 发现更多职位
腾讯
校园招聘 · 青云计划-应届生

混元基座模型-大模型预训练Scaling Law研究

面议
北京 · 经验要求见详情
青云课题青云计划-应届生TEG

关于这个机会

课题背景: Scaling Law 揭示了模型性能随算力、参数量及数据规模增长的定量规律,是深度学习领域的核心基础理论之一。它为大模型研发提供了宏观指引,使得在有限算力预算下进行科学的资源配置成为可能。随着模型规模持续扩大,深入探索训练动态与 scaling 行为的内在机理,建立更普适的预测与优化框架,对于突破模型能力上限、降低预训练成本具有重要的科学意义与工程价值。 课题挑战: 1. 多变量耦合下的性能预测:​ 模型性能受模型规模、优化过程及系统实现等多维因素交织影响。建立高保真的代理模型(Proxy Model)以精准预测训练损失与收敛趋势,是该领域长期关注的开放性问题。 2. 跨规模泛化的机制探索:​ 训练损失与下游任务表现之间的相关性随规模演变呈现出复杂规律。系统研究这种跨尺度的关联机制,构建具备强解释性的映射理论,是推动Scaling Law理论体系完善的重要方向。 具体工作: 你将参与混元基座模型预训练的核心算法研发,负责Scaling Law的理论建模与实证验证。具体包括:设计并执行大规模消融实验,探究模型规模、计算量与训练策略的耦合机制;构建性能预测模型,量化训练动态对泛化能力的影响,输出最优训练配置方案;探索面向MoE架构的稳定训练策略。你将有机会沉淀业界领先的训练方法论,发表顶级学术论文或申请核心技术专利,直接指导混元大模型的训练效率优化与能力升级。

任职要求

学历和专业要求: 自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士以上学历; 技术技能要求: 1.在NLP、LLM、深度学习、强化学习方面有一定研究基础,熟悉主流模型和算法,并有一定的实践经验; 2.较强的工程实现能力,熟练掌握C/C++,Python等至少一种语言,有实际编程项目经验,熟悉DeepSpeed、Megatron等分布式训练框架,熟练使用至少一种深度学习框架(如TensorFlow,PyTorch等); 3.有高质量论文发表者优先(如ACL、EMNLP、NeurIPS、ICML、ICLR等); 软性素质要求: 具备强烈的进取心、自驱力及团队合作精神,热衷于追求技术创新。

官方来源与核验

腾讯官方招聘 · 职位编号 1277774706287944716

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。