混元基座模型-原生 VLM 预训练与Midtrain
关于这个机会
课题背景 原生 VLM 需要从预训练阶段统一学习文本、图像、文档、图表和视频等多模态知识,并在中期训练阶段进一步强化视觉理解、跨模态推理和任务执行能力。 当前,多模态预训练数据普遍存在质量低、图文错配和长尾知识不足等问题;文档、图表、空间推理、GUI、Agent 等高质量能力数据又较为稀缺。如何打通多模态数据清洗、科学配比、高质量合成和动态调度链路,是提升 VLM 能力上限的关键。 课题挑战 1、多模态数据质量参差: 在 PB 级数据中高效识别低质、重复和错配样本,同时保留高价值长尾知识。 2、多领域训练相互干扰: 视觉、语言及不同任务领域学习规律差异较大,混合训练容易出现能力退化和负迁移,如何在保证文本能力的前提下追求视觉能力的极致优化。 3、高质量能力数据稀缺: 合成数据容易模板化、难度不足和错误累积,缺乏高效可靠的质量评估与调度指标。 具体工作 1、负责图像、网页、文档、图表和视频等多模态数据的挖掘、清洗、筛选与质量评估; 2、探索原生 VLM 预训练及中期训练的数据配比、训练目标和阶段衔接策略; 3、负责 OCR、文档、图表、空间推理、GUI、Agent 等领域数据的挖掘与高质量合成; 4、设计多领域数据动态调度策略,并在生产级模型上验证训练效果。
任职要求
1、自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士以上学历; 2、相信 Scaling Law,认可数据、算力与模型规模化带来的长期价值,善于通过系统实验验证规律; 3、具备较强的工程能力,能够搭建高效、稳定、可复现的数据与训练链路,并持续优化工具和研发效率; 4、对数据和指标高度敏感,认真严谨,能够从细微异常中发现问题并追溯根因; 5、兼具研究探索能力与落地意识,能够独立推进方案设计、工程实现和生产级模型验证。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。