混元基座模型——模型结构设计
关于这个机会
课题背景 随着大语言模型规模不断增长,模型结构设计已成为决定模型能力、训练效率和推理成本的核心因素。如何突破传统Transformer架构瓶颈,在Attention、MoE、记忆机制等关键模块上持续创新,构建兼具性能、效率与可扩展性的新一代模型架构,已成为大模型领域的重要研究方向。本课题聚焦前沿模型结构创新,探索更具潜力的大模型架构设计。 课题挑战 模型结构设计需要同时兼顾模型效果、训练稳定性、推理效率和工程可部署性,多个目标之间存在复杂权衡。Attention、MoE、Engram等模块之间相互耦合,单一模块优化可能带来整体性能退化,需要从系统角度进行协同设计。同时,新架构往往缺乏成熟经验,每次验证均需要大规模预训练实验,实验成本高、迭代周期长;此外,新结构还需具备良好的跨规模扩展能力,在不同模型尺寸和训练阶段保持稳定收益,才能真正应用于新一代基础模型。 具体工作 参与大模型核心架构设计,研究Attention、MoE、Engram等关键模块,完成算法设计、实现与大规模训练验证,分析实验结果,持续优化模型性能与训练效率,并推动创新成果落地。
任职要求
1、自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士以上学历; 2、在NLP、LLM、深度学习、强化学习方面有一定研究基础,熟悉主流模型和算法,并有一定的实践经验; 3、较强的工程实现能力,熟练掌握C/C++,Python等至少一种语言,有实际编程项目经验,熟悉DeepSpeed、Megatron等分布式训练框架,熟练使用至少一种深度学习框架(如TensorFlow,PyTorch等); 4、有高质量论文发表者优先(如ACL、EMNLP、NeurIPS、ICML、ICLR等); 5、具备强烈的进取心、自驱力及团队合作精神,热衷于追求技术创新。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。