AI 评测工程师(大模型 / 智能体方向)
关于这个机会
大模型项目最难的问题之一,是如何判断它在真实业务里到底有没有变好。你将负责建立从数据集、任务环境、评测方法到上线监控的完整评测体系,让团队能用事实回答“模型哪里好、哪里不够好、下一步该怎么改”。你的评测对象不只是单轮问答,还包括长文档理解、知识库问答、工具调用、多轮对话、长程任务、多智能体协同、视觉理解和端侧推理。你会与算法、产品、研发和客户团队一起定义真实任务,把一次项目中的难例沉淀成下一轮模型和产品迭代的燃料。 岗位职责 1. 负责大语言模型、多模态模型、智能体和行业 AI 应用的评测方案设计,明确任务、数据、指标、基线和验收标准。 建设覆盖能力、可靠性、安全性、可解释性和工程性能的评测集,支持问答、长文档、RAG、工具调用、报告生成、视觉理解等任务。 2. 设计人工评测、自动评测、模型评审、规则校验和抽样复核流程,提升评测结果的稳定性、一致性和可复现性。 建立智能体任务环境和轨迹分析方法,评估任务完成率、步骤有效性、工具调用正确率、证据引用、错误恢复和长程执行能力。 3. 负责准确率、召回率、事实一致性、引用可追溯性、幻觉率、响应时延、吞吐、显存及成本等指标分析,建设回归评测、版本对比、难例挖掘和线上质量监控机制。 4. 与算法、研发和产品团队协作定位问题根因,提出模型、数据、提示词、流程或系统优化建议,并面向客户项目输出评测报告和验收材料。
任职要求
1. 本科及以上学历,计算机、人工智能、数学、统计学、语言学等相关专业优先。 2. 理解大语言模型、RAG、智能体、多模态模型或传统机器学习中的至少一个方向。 3. 具备较强的数据分析和实验设计能力,能够使用 Python、SQL 或其他工具完成数据处理和结果分析。 4. 能够设计清晰的评测任务、指标和实验对照,具备严谨的记录、复盘和复现习惯。 5. 对模型输出中的事实错误、逻辑漏洞、边界问题和业务风险保持敏感,具备良好的沟通能力,能与算法、工程、产品和业务人员共同定义质量标准。 加分项 1. 有大模型评测、Benchmark、Agent 评测、自动化测试或模型安全评测经验。 2. 熟悉 DeepEval、OpenCompass、lm-evaluation-harness 或类似评测工具和框架。 3. 有政企知识库、公文审查、情报研判、工业质检、医疗、法律或科研场景经验。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。