混元基座模型-Agent评测方法与评测体系研究
关于这个机会
课题背景 Agent 是大模型能力演进的主战场,业界与团队内部已构建大量 Agent Benchmark。但造出尺子只是第一步——每把尺子究竟在量什么、量得准不准、不同尺子之间是否重复、如何用最小代价获得可信结论,这些"评测本身的科学问题"远未解决。本课题不以构建新 Benchmark 为目标,而是研究 Agent 评测的有效性、完备性与经济性,为模型训练、版本对分与生产监控提供准、快、稳的度量基础,与 Benchmark 构建团队形成上下游互补。 课题挑战 (1)度量的有效性:Agent 评测涉及多步轨迹、环境交互与复杂判分逻辑,Harness 实现细节对分数影响巨大;每个 Bench 实际考察什么能力、彼此是否正交、判分引入了哪些系统性偏差,需要建立元评测(能力归因、正交性分析、偏差诊断)的方法论;(2)度量的完备性:许多关键能力(如 coding 的细分子维度、长程规划、工具使用的鲁棒性)处于现有 Bench 的观测盲区,需要设计新的 metric 与自动化分析手段,扩展"可被度量"的能力边界;(3)度量的经济性与可靠性:Agent 评测天然高方差、高成本,如何量化评测置信度、构建高代表性的高效评测子集,并在大批量生产监控场景下保障评测链路的准确与稳定,是统计方法与系统工程结合的难点。 具体工作 深度解析前沿 Agent Benchmark,建立能力归因与正交性分析方法;设计面向观测盲区的新 metric 与自动化诊断手段;研究评测方差量化与高效评测方法,建设规模化可信评测体系,产出评测科学研究成果。
任职要求
学历和专业要求: 计算机科学、人工智能、机器学习等相关专业的博士同学(优秀硕士亦可);同时也欢迎物理学、数学、统计学等自然科学背景、有志于转向大模型研究的博士同学,有实验设计与数据分析经验者优先。 技术技能要求: 1.熟悉大模型及Agent训练评测流程,了解主流Agent Benchmark、Harness或环境沙箱; 2.具备扎实的实验设计、统计推断与误差分析能力,能从复杂数据中提炼规律; 3.熟练使用 Python,具备较强的编程与工程实现能力; 软性素质要求: 1.具备自然科学式的研究品味:对现象保持好奇、对结论保持怀疑,追求可复现、可解释的严谨发现; 2.能深入细节,沟通协作能力强,有跨团队推动事项的主动性与快速落地能力。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。