千问事业部
社会招聘千问事业部-大模型自动化评测集建设运营-北京/杭州
面议
关于这个机会
核心职责:自动化评测集建设能力 1. 建设面向产品Agentic场景(Search Agent、Office Agent、对话Agent、生活服务Agent等)的端到端评测集,量化模型在真实产品链路中的表现,并拆解到模型原子能力,确保评测粒度可拆解至独立能力维度; 2. 基于评测数据产出结构化的模型能力诊断报告,明确优势与短板,形成可执行的优化建议,辅助算法团队确定模型迭代方向; 3. 持续追踪业界前沿Benchmark与评测方法论,保持评测集的先进性和行业对标能力;
任职要求
1. 有1年以上大语言模型评测、AI产品质量评估或相关领域工作经验优先 2. 深入理解大语言模型的能力边界与常见评测范式,具备独立设计完整评测方案的能力 3. 熟悉Agent/Agentic应用场景的评测方法,了解工具调用、多轮对话、任务规划等能力的评估要点 4. 优秀的逻辑思维和结构化表达能力,能将评测发现转化为清晰的诊断报告和可执行建议 5. 有计算机科学、人工智能、自然语言处理、统计学相关专业本科及以上学历优先
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。