字节跳动
社招 · 正式大模型与Agent评测基础设施算法工程师-Commercial AI
面议
关于这个机会
1、参与建设面向大模型与Agent的评测基础设施,将评估设计转化为稳定、可扩展、可观测、可复用的执行系统; 2、负责已定义评估方法的稳定运行及结果接入研发流程,重点建设可复用的评测流水线与任务编排能力,持续完善Judge、Sandbox、风险检测等关键执行组件,提升实验执行的稳定性、可观测性与结果追溯能力; 3、参与将复杂任务流程和Agent交互过程抽象为可执行评估环境,设计并实现大模型/Agent自动评测流水线,工程化落地Judge system、Sandbox、风险检测等关键组件,支撑多模型、多策略、多环境配置下的大规模实验执行; 4、日常工作中定位失败任务、排查模型调用链路、修复评分流程和提升实验可复现性,与研究员协作将评估想法拆分为任务定义、输入输出协议、执行逻辑和监控指标,在研究需求和系统稳定性间寻找平衡。
任职要求
1、计算机相关专业,具备扎实软件系统与工程实现基础; 2、熟练使用Python,有服务/平台开发、数据处理或Pipeline建设经验; 3、有大模型、Agent、评测平台、仿真环境或复杂后端系统开发经验; 4、重视代码质量、系统设计、稳定性、可维护性与线上可观测; 5、能将研究方案工程化落地,擅长跨团队协作推进复杂项目; 6、愿意长期建设评估基础设施,相关领域经验与开源成果优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。