评测度量科学与有效性研究
关于这个机会
课题背景 评测结论要用于发布与投入决策,但支撑这些结论的测量工具本身很少被检验。2026 年大规模研究显示,业界通用的原始一致率未做随机校正,相比 Cohen's kappa 虚高三到四成,同一批裁判在不同基准上排序最多可差十四位;主观评测侧,约一成低质量或对抗性投票就足以让排名变动数位。与此同时,几乎没有团队能回答"这个结论需要多少题才够"。该岗位负责评测的准确性、效率与有效性,是全公司评测结论的质量底座。 课题挑战 第一,裁判的可靠性与有效性是两件事,重复打分稳定不等于判断正确,需一整套随机校正、位置互换与重复采样的验证协议,并能检测同源模型的自我偏好。第二,人类与专家评分需把评价者建模为有能力差异的测量仪器,并区分"评价者能力不足"与"问题本身有分歧",前者可过滤后者不能。第三,题量与置信度的关系几乎未被量化,需要基于项目反应理论与信息量的题目筛选乃至自适应测试,用最少的题达到目标判别力。第四,评测集入库前需信度、区分度与污染的有效性审计,且该门禁不能由生产方自己把守。第五,postEval 侧缺乏方法:排名稳定性、指标间冗余、失败归因与跨版本可比性都需专门分析,饱和与退役也需可操作判据。第六,托管裁判与评测环境会在无版本通知的情况下变化,需版本治理与纵向稳定性监测。 具体工作 负责裁判与人类评分的可信度验证协议、题量与置信度的量化方法、评测集入库前的有效性审计,以及 postEval 的结果分析、饱和判定与退役建议,并制定全公司评测复现与版本治理规范。
任职要求
学历和专业 统计学、心理测量、计量方法、机器学习或自然语言处理等相关专业博士;有测量理论、项目反应理论、实验设计、可复现性研究或众包质量控制背景者优先。 技术技能 掌握一致性与信度效度分析、假设检验与置信区间估计、项目反应理论与偏好聚合模型,熟悉 LLM-as-judge 校准与偏差审计、数据污染检测方法,具备因果推断基础,精通 Python 与统计工具。 软性素质 有强烈证据意识,习惯先怀疑测量工具再相信结论;敢于在业务或训练团队报出提升时给出否定判断;能把方法学要求转化为其他团队可执行的规范,推动标准落地时有耐心和说服力。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。