混元基座模型-Mid-Train数据的高效筛选与合成研究
关于这个机会
课题背景: 中期训练是衔接预训练与对齐阶段的核心,直接决定模型在代码、数理逻辑等复杂任务上的上限。由于高质量垂直领域人工数据极度稀缺,利用模型合成数据成为主流。但现有方案面临生成多样性坍塌及跨领域能力干扰等问题,亟待突破多领域数据精细筛选与高质量合成技术。 课题挑战: 1. 模型退化危机:利用模型合成数据极易导致分布收敛与多样性丧失,在代码、数理等严谨领域合成出突破现有能力边界的“增量新知识”是核心难点。 2. 能力跷跷板效应:多领域(如逻辑类与发散类)数据混合训练时易产生能力负迁移,通过提纯与组合策略实现各领域能力全面正向增益极具研究难度。 3. 质量评估黑盒化:面对海量合成的垂直领域数据,缺乏高效且普适的自动化难度与质量评估标准,构建精准的打分体系面临巨大困难。 具体工作: 负责代码、数理、Agent、文创等核心领域数据的深度挖掘与筛选;设计高多样性的数据合成链路并在生产级别的模型上验证效果
任职要求
学历和专业要求: 自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士以上学历; 技术技能要求: 1,在NLP、LLM领域有深入实践,对生成式AI、复杂推理或特定垂域(如代码生成、数学定理证明等)有丰富的数据构建与模型调优经验; 2,具备较强的工程实现能力,熟练掌握Python、C/C++等至少一种语言,熟悉指令演化(如Self-Instruct等)及合成数据Pipeline架构; 3,熟悉DeepSpeed、Megatron等分布式训练框架,熟练使用至少一种深度学习框架(如PyTorch等); 4,有高质量论文发表者优先(如ACL、EMNLP、NeurIPS、ICML、ICLR等),特别是在数据合成、模型微调或特定垂域能力突破方向; 软性素质要求: 具备强烈的进取心、自驱力及跨领域学习能力,团队合作精神极佳,对实现AGI核心能力跃迁充满热情。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。