← 发现更多职位
字节跳动
社招 · 正式

Agent策略产品(评测方向) - 豆包

面议
Beijing(北京) · 经验要求见详情
产品社招 · 正式A163716A

关于这个机会

团队介绍:字节跳动豆包产品团队,在这里你将有机会参与到行业前沿产品的规划设计,开拓自己的行业视野,与先进团队共同成长。 1、负责Agent评测体系建设,规划重点场景、任务分层、评估指标和验收标准,持续跟踪行业进展并引入有效的评测方法; 2、深入企业和行业场景,与行业专家、客户、业务、产品及算法团队协作,理解真实工作流、交付物和验收方式,将高价值工作转化为可复现、可验证、有区分度的评测任务; 3、设计和维护高质量评测集,完整建设任务描述、输入材料、执行环境、参考产物、Rubrics、Verifier和隐藏测试,保障题目的真实性、覆盖度、难度、稳定性和可追溯性;建设高效的数据生产管线,打通线上任务与用户反馈、专家出题、企业共建、供应商采购和数据合成等来源,完成数据采集、清洗、改写、标注、质检、去重、分层及版本管理; 4、建设规模化自动评测能力,综合使用规则、代码、程序化验证、Agent Judger和专家评审,完成任务执行、产物解析、自动评分、人工校准、回归评测和评测集动态更新,持续提升评测的准确性、一致性和效率; 5、系统分析评测结果和失败案例,定位模型、Harness、Skill、工具、环境等环节的能力缺口,将结论转化为数据生产、模型训练和产品优化建议,并协同相关团队推动落地。

任职要求

1、本科及以上学历,具备大模型或Agent评测、数据建设、测试开发、AI产品质量、行业数字化等相关经验; 2、对真实业务场景有较强的理解和抽象能力,能够快速进入陌生行业,梳理复杂工作流并判断任务的业务价值、真实性和验收方式; 3、熟悉自动评测、评分量表、成对比较、Pass@K、程序化验证和LLM-as-a-Judge等常见评测方法,能够设计合理的评测实验; 4、具备数据分析和基础编程能力,能够使用Python、SQL等工具完成数据处理、评测实验及自动化流程建设; 5、具备优秀的结构化分析、沟通和项目推动能力,能够与行业专家、算法、数据、产品、平台及外部合作伙伴高效协作; 6、对Agent发展有持续热情,能够主动发现问题、验证假设,并在快速变化的领域中持续学习。 加分项: 1、在金融、医药、零售电商、增长营销、法律、工程等至少一个复杂行业拥有深入经验; 2、建设过真实任务Benchmark、自动化评测流水线或大规模数据生产管线; 3、有复杂端到端Agent、Computer Use、多工具执行、长程任务或任务环境构建经验; 4、有企业客户、行业专家、供应商或数据合作项目经验; 5、了解SFT、RL、数据合成和Reward设计,能够理解评测数据与模型优化之间的关系。

官方来源与核验

字节跳动官方招聘 · 职位编号 7680450684751808821

官方发布时间:

最近核验:2026-09-16T12:33:12.416632+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。