混元-基于轨迹的大模型过程级能力评估研究
关于这个机会
课题背景 随着大模型进入 Coding、Agent、Deep Research 等复杂任务场景,任务完成往往需要经历需求理解、规划、工具调用、执行、验证和纠错等多个步骤。传统评测更多关注最终结果是否正确,难以解释模型“为什么成功、为什么失败”。用户轨迹记录了完整任务过程,为建立更细粒度、可解释的过程级能力评估体系提供了重要基础。 课题挑战 1)过程结构难统一:不同任务的执行路径差异较大,需要研究跨任务的轨迹分阶段和能力表示方法。 2)中间步骤缺少真值:复杂任务通常存在多条合理路径,需要结合结果、环境反馈、用户行为和 LLM Judge 等信号判断过程质量。 3)关键错误难归因:需要从长轨迹中识别真正导致失败的关键步骤,并区分需求理解、规划、推理、工具调用、执行和验证等不同能力问题。 4)大规模评估成本高:需要兼顾评估准确性、可解释性和千万级真实轨迹下的计算效率。 具体工作 研究真实交互轨迹的结构化表示与自动分阶段方法;构建需求理解、规划、工具使用、执行、验证、纠错等过程级能力评价体系;研究基于多信号融合的关键错误检测和失败归因方法;进一步对不同模型版本、任务类型和业务场景形成过程级能力画像,并探索将评估结果用于训练数据筛选、专项评测和模型优化。
任职要求
1.计算机/软件工程等相关专业硕士及博士; 2.熟悉大语言模型数据领域的相关研究工作和算法,拥有发表顶会论文、大模型研究工作、知名竞赛获奖、顶级研究机构或一线互联网工作经验者优先; 3.熟练使用Python、PyTorch和CUDA等语言及工具,具备快速阅读和复现论文的能力,熟练使用AI工具 vibe coding提效者优先; 4.具备优秀的分析和解决问题能力,良好的团队合作精神及沟通意识; 5.有大模型数据研发相关公司的实践经验或者科研成果,有深入的 data insight,丰富的通过数据优化提升LLM效果经验者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。