← 发现更多职位
字节跳动
社招 · 正式

大模型与Agent评测基础设施算法工程师-Commercial AI

面议
Shanghai(上海) · 经验要求见详情
研发算法社招 · 正式A54248B

关于这个机会

1、参与建设面向大模型与Agent的评测基础设施,将评估设计转化为稳定、可扩展、可观测、可复用的执行系统; 2、负责已定义评估方法的稳定运行及结果接入研发流程,重点建设可复用的评测流水线与任务编排能力,持续完善Judge、Sandbox、风险检测等关键执行组件,提升实验执行的稳定性、可观测性与结果追溯能力; 3、参与将复杂任务流程和Agent交互过程抽象为可执行评估环境,设计并实现大模型/Agent自动评测流水线,工程化落地Judge system、Sandbox、风险检测等关键组件,支撑多模型、多策略、多环境配置下的大规模实验执行; 4、日常工作中定位失败任务、排查模型调用链路、修复评分流程和提升实验可复现性,与研究员协作将评估想法拆分为任务定义、输入输出协议、执行逻辑和监控指标,在研究需求和系统稳定性间寻找平衡。

任职要求

1、计算机相关专业,具备扎实软件系统与工程实现基础; 2、熟练使用Python,有服务/平台开发、数据处理或Pipeline建设经验; 3、有大模型、Agent、评测平台、仿真环境或复杂后端系统开发经验; 4、重视代码质量、系统设计、稳定性、可维护性与线上可观测; 5、能将研究方案工程化落地,擅长跨团队协作推进复杂项目; 6、愿意长期建设评估基础设施,相关领域经验与开源成果优先。

官方来源与核验

字节跳动官方招聘 · 职位编号 7594714925887621381

官方发布时间:

最近核验:2026-09-16T12:33:12.416632+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。