混元-大规模轨迹质量评估与价值挖掘研究
关于这个机会
课题背景 真实用户与模型的交互数据,是模型训练、评测和能力归因的重要数据来源。但现网日志天然存在噪声高、重复多、质量不均、任务边界模糊等问题,同时“高价值数据”并不一定等价于“高质量数据”:一次失败交互可能不适合作为直接训练数据,却可能非常适合用于发现模型缺陷、构造评测集或生成后续训练样本。 因此,需要研究一套数据的质量与价值评估方法,从海量日志中自动识别适用于训练、评测和模型分析的高价值数据,并进一步形成数据驱动的模型能力洞察。 课题挑战 1)真实数据质量难以统一建模 真实交互场景复杂,既包含知识问答、Coding、Agent、长文本、创作等不同任务,也存在闲聊、无效请求、截断、重复和异常调用等噪声。需要建立跨任务通用、同时兼顾不同场景差异的数据质量评价体系。 2)数据价值与数据质量并不等价 高满意度轨迹可能适合作为 SFT 数据,而低满意度、用户纠正、反复尝试等轨迹虽然本身质量不高,却可能具有很高的评测和问题挖掘价值。需要研究面向不同下游用途的数据价值建模方法。 3)模型失败模式难以自动归因 仅依赖成功率或用户反馈难以解释模型为什么失败,需要从完整轨迹中定位需求理解、规划、工具调用、推理、代码修改、结果验证等关键环节,并形成稳定、可扩展的失败模式分类体系。 4)千万级日志下的算法效率与稳定性 真实线上数据规模巨大,需要在效果、成本和吞吐之间取得平衡,研究规则、小模型、大模型 Agent 等不同策略的组合方式,并支持大规模离线数据处理。 具体工作 构建面向真实用户交互数据的质量与价值分层标准,覆盖数据完整性、任务有效性、交互质量、用户满意度、任务难度、可训练性、可验证性等维度; 研究基于规则、小模型和 LLM Agent 的多阶段数据筛选与打标方法,自动识别高质量训练数据、高价值失败数据和典型模型问题; 研究基于用户纠正、重复尝试、任务放弃等行为信号的模型失败检测和关键步骤归因方法; 结合 Topic、任务类型、用户画像和模型版本,对真实线上数据进行切片分析,构建模型在真实场景中的能力画像; 最终形成“日志回流—质量筛选—价值评估—失败归因—精选数据/能力洞察”的自动化数据流水线,并应用于混元实际训练、评测
任职要求
1、计算机/软件工程等相关专业硕士及博士; 2、熟悉大语言模型数据领域的相关研究工作和算法,拥有发表顶会论文、大模型研究工作、知名竞赛获奖、顶级研究机构或一线互联网工作经验者优先; 3、熟练使用Python、PyTorch和CUDA等语言及工具,具备快速阅读和复现论文的能力,熟练使用AI工具 vibe coding提效者优先; 4、具备优秀的分析和解决问题能力,良好的团队合作精神及沟通意识; 5、有大模型数据研发相关公司的实践经验或者科研成果,有深入的 data insight,丰富的通过数据优化提升LLM效果经验者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。