← 发现更多职位
字节跳动
社招 · 正式

AI Agent评测资深工程师/架构师-计算

面议
Beijing(北京) · 经验要求见详情
研发后端社招 · 正式A173956

关于这个机会

1、负责AI Agent评测体系的整体架构设计与建设,结合真实业务场景,构建覆盖任务成功率、工具调用准确性、多轮对话、推理链路、安全合规等维度的评测框架,持续提升Agent质量与迭代效率; 2、负责评测集、评测用例与数据的体系化建设,设计评测集的分层结构与覆盖策略(核心场景、长尾案例、对抗样本、边界条件等),建立用例的采集、标注、清洗、版本管理与质量校验机制,保障评测数据的代表性、准确性与可持续更新; 3、设计和建设面向企业级Agent应用的自动化评测平台与工具链,包含但不限于评测集管理、用例编排、自动化打分、人工标注、A/B对比、回归测试、线上负面案例回流与数据闭环等能力,推动评测能力与Agent研发流程深度融合; 4、定义Agent效果评估的量化指标与评测方法论,识别高价值评测场景,推进评测能力从方案设计、试点验证到规模化落地,形成可复用的评测集标准、标注规范与最佳实践; 5、持续跟踪大模型、Agent评测(Evaluation)、LLM-as-a-Judge、Benchmark构建、合成数据等前沿技术趋势,结合团队实际业务场景引入合适的新方法与新方案,持续优化评测的准确性、效率与成本。

任职要求

1、本科及以上学历,计算机相关专业优先,3年及以上AI/ML、模型评测、质量工程、测试平台或后端研发相关工作经验; 2、熟悉大模型与Agent技术原理,对Prompt工程、工具调用(Function Calling)、RAG、多轮对话、推理规划等环节有较好理解; 3、了解主流评测方法与体系,如自动化指标、人工标注、LLM-as-a-Judge、Benchmark构建等,有Agent或模型效果评测的实践经验者优先; 4、具备良好的工程实现能力,熟练掌握一门及以上开发语言(如Golang/Python/Java),能够独立推进评测系统或工具建设; 5、具备较好的沟通协作和问题推动能力,能够与算法、研发、产品、标注等角色协同推进评测项目落地。 具备以下条件者优先: 1、有企业内部Agent评测平台、模型评估平台或质量工程平台建设经验者优先; 2、有评测集/Benchmark从0到1构建、标注体系搭建、合成数据或数据闭环体系建设经验者优先; 3、有LLM-as-a-Judge、自动化评测、线上负面案例回流与数据挖掘等相关实践经验者优先; 4、熟悉大模型训练/推理、RAG、Agent框架或AI Infra相关技术者优先。

官方来源与核验

字节跳动官方招聘 · 职位编号 7658971083101718837

官方发布时间:

最近核验:2026-09-16T12:33:12.416632+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。