← 发现更多职位
字节跳动
社招 · 正式

Agent评测专家(To B方向) - AI数据与安全

面议
Beijing(北京) · 经验要求见详情
运营社招 · 正式A10134

关于这个机会

团队介绍:AI 数据与安全团队为 Seed 基座模型及 AI 原生应用提供跨模态数据服务,覆盖数据生产全流程,包含模型评估标准的制定、数据规模化生产、数据飞轮搭建,不断提升数据质量,支持模型快速迭代。 团队由产品经理、数据工程、数据运营等跨职能人才组成,并通过与 Seed 研究员、行业专家、全球顶尖数据供应商紧密合作,从真实场景中收集反馈并分析模型表现数据,解决 AI 前沿突破过程中的复杂数据问题,推动模型性能与用户体验的双重提升。我们既是帮助模型技术迭代的一线贡献者,也是模型和 AI 产品的一手用户。 1、负责Agent、Coding等方向的模型评测项目,理解业务目标和模型能力边界,将抽象的能力诉求拆解为具体、可触发、可观测、可判定的评测问题及测试点,形成可执行的评测方案; 2、组织外部专家开展评测数据生产,根据不同评测方向定义专家画像和准入标准,完成专家筛选、试做、培训、校准、任务派发和质量验收,将专家的非标准知识转化为稳定、可规模化交付的评测资产; 3、推动自动评估链路工程化落地,使用Python等编程语言搭建和维护评估任务,将数据集、模型调用、Agent运行环境、Judge、评分逻辑及结果分析接入司内评估平台,确保评估流程可复现、可追踪、可扩展; 4、与算法研究员、产品、工程团队紧密协作,准确理解模型迭代需求,以评测数据和典型案例推动问题定位、能力改进及版本决策。

任职要求

1、本科及以上学历,计算机科学与技术、人工智能、信息科学、大数据科学与技术、软件工程等相关专业优先; 2、熟悉大模型/Agent工作原理,能读懂Agent执行过程的完整轨迹;能拆解问题类型,并明确可判定的问题表现,可以总结出相对应的高发场景、触发条件和可观测信号; 3、能分析模型得分和负面案例分布,识别题目、Judge及评分标准问题,并针对性优化题目、样例和评判规则; 4、能将模型问题拆解为可观测、可触发、可判定的类型;熟悉Python等编程语言,具备评估链路工程化能力者优先; 5、具备良好的沟通和项目管理能力,能设计评测集生产协作链路,明确分工并完成产能、排期和风险管理; 6、善于发现流程卡点,能运用Python、自动化工具或轻量产品提升效率,推动生产流程可追踪、可度量。

官方来源与核验

字节跳动官方招聘 · 职位编号 7681137418037168389

官方发布时间:

最近核验:2026-09-16T12:33:12.416632+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。