评测集高效生产与合成研究
关于这个机会
课题背景 评测集已经成为整个评测体系的产能瓶颈。一方面,以可验证奖励驱动的自我迭代进入工业实践后,闭环消耗题目信息量的速度远超人工产出,静态题库有效寿命从年缩短到周;另一方面,多产品线并行要求同一套方法学在不同业务场景反复实例化,靠人工逐题撰写无法支撑。该岗位是评测集规模化生产团队的技术内核,目标是把题目与环境从手工产物变成可持续再生的资产。 课题挑战: 第一,题量增长与区分度提升是两件事,增加同质题目无法解决信息量衰减,需要能控制难度分布与覆盖度的生成机制。第二,Agent 类评测的"题目"其实是可复现、可重置、有状态的环境,生产成本与验证难度都远高于静态问答,且需支持中途变化与模拟用户注入。第三,合成题目必须自带可验证的正确性判据,否则规模化生产的同时也在规模化引入噪声,需要验证器设计与自动质检。第四,生成过程本身会引入分布偏斜与模式重复,多样性与长尾覆盖需要主动度量和控制。第五,题目有生命周期,饱和与污染需被持续监测并触发退役,而退役会破坏纵向可比性,需设计新旧题库的锚定与换算机制。第六,产量目标天然会侵蚀质量标准,因此入库门禁必须由生产方之外的角色把守。 具体工作: 负责题目与环境的自动化生成、变体再生与难度分层机制建设,设计合成内容的验证器与自动质检,建立饱和监测、版本维护与退役换算流程,为各产品线提供可持续再生的评测资产
任职要求
学历和专业 机器学习、人工智能、计算机科学、统计学等相关专业博士或硕士;有合成数据生成、自动题目生成、程序化环境构建或大规模数据流水线经历者优先。 技术技能 掌握合成数据与自动题目生成技术、验证器与过程奖励模型设计,熟悉难度校准与项目反应理论、污染检测方法,具备程序化环境与沙箱构建能力,精通 Python,熟悉容器化与数据流水线。 软性素质 兼具研究品味与工程交付能力,愿意把方法沉淀成他人可复用的机制;对质量与产量的天然冲突有清醒认识,能主动接受外部质量门禁;与前沿评测、平台和标注运营团队协作顺畅。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。