大模型前沿能力、体验与可信度评测研究
关于这个机会
课题背景: 大模型正从单点问答走向复杂任务、Agent 与真实工作流,并开始以自我迭代的方式改进自身。这两个变化同时抬高了评测的难度:能力边界不再能由单轮问答刻画,用户是否愿意持续使用也不再由准确率决定,而当模型开始自我改进,它自报的提升更不能被直接采信。评测因此从结果核对转变为一项需要独立设计与独立验证的研究工作,直接决定模型迭代的方向与速度。 课题挑战: 第一,长程任务的失败通常源于中间环节的错误累积,最终成功率无法定位问题,需要可复现环境与轨迹级的过程度量。第二,用户体感缺乏客观真值,开放式主观任务上标注一致性天然偏低,少量低质量或对抗性标注即可显著扰动模型排序,常规一致性过滤在此失效。第三,离线评测结论与线上真实行为经常背离,两者之间缺少可信的验证闭环。第四,模型自我迭代会快速耗尽评测集的信息量,静态题库的有效寿命大幅缩短,靠扩大同质题量无法解决。第五,在有限评测下模型会系统性地对未被测量的维度投资不足,需要能识别分数上涨但能力未涨的诊断方法。 具体工作:负责下列一个或多个课题方向的评测体系设计与落地,包括评测集与环境建设、指标与标注协议定义、结论归因与验证,并推动结论进入训练与发布决策。 课题方向(可选其一或多个) 方向一 · Agent 长程任务可靠性评测 构建可复现的长程任务环境与评测集,定义轨迹级过程指标与可靠性度量,定位错误累积与恢复失败的发生位置,输出模型能力边界与失败模式的归因结论。 方向二 · 用户体感度量与偏好评测 建设体感评测方法学,设计标注协议与偏好聚合模型,建立标注质量控制与人群代表性机制,打通离线评测与线上行为数据之间的验证闭环。 方向三 · 自进化模型能力审计与可信度量 为自迭代训练建立独立的外部测量通道,设计抗拟合的动态题目再生与难度校准机制,研究奖励作弊、能力退化与多样性收窄的检测方法,产出可信的准入判据。
任职要求
学历和专业:机器学习、人工智能、统计学、计算机科学等相关专业博士或优秀硕士;有 Agent、强化学习、评测方法学或实验设计相关研究与工程经历者优先。 技术技能:熟悉大模型训练与推理全链路,具备评测集构建、指标设计与实验分析能力,掌握统计推断与标注质量控制方法,精通 Python 与 PyTorch,有沙箱环境或评测平台开发经验者优先。 软性素质:能把"是否真的变强"这类模糊问题转化为可检验的命题;在结论与预期不符时坚持独立判断,敢于给出否定意见;对产品体验敏感,与训练、数据和产品团队协作顺畅。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。