← 发现更多职位
字节跳动
社招 · 正式

大模型训练稳定性和容错系统专家-Seed

面议
Hangzhou(杭州) · 经验要求见详情
研发机器学习社招 · 正式A234778

关于这个机会

团队介绍:字节跳动 Seed 团队成立于 2023 年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。 Seed 团队在 AI 领域拥有长期愿景与决心,团队研究方向涵盖 MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE 等超过 50 个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包 App 用户量在中国市场排名第一,豆包大模型日均 Token 调用量行业领先。 1、训练稳定性体系搭建与架构优化:负责超大规模分布式训练集群的稳定性架构设计与迭代,定义可量化的稳定性指标,梳理全链路稳定性风险点,建立覆盖全流程的稳定保障体系; 2、容错机制研发与能力落地:主导训练系统容错能力建设,设计并实现秒级异常发现,分钟级自动故障定位和自动恢复的容错机制,大幅提升大规模训练任务有效训练时长; 3、故障根因分析与治理:搭建训练故障智能RCA根因分析体系,常态化复盘各类训练稳定性问题,精准定位计算、通信、存储、内核、框架、调度等各层级故障根源,并形成自动化/智能化分析机制; 4、保持技术敏锐度:深度跟进PyTorch、Megatron-LM、DeepSpeed等主流训练框架特性,调研业界前沿的大规模训练容错、稳定优化技术,持续提升训练系统的可靠性与扩展性。

任职要求

1、本科及以上学历,计算机、软件工程、人工智能、电子信息、微电子等相关专业优先; 2、有扎实的操作系统原理,熟练掌握Python/C++/Go任意一种开发语言,具备扎实的后端研发与问题排查能力; 3、熟悉分布式训练原理,具备千卡及以上规模集群训练稳定性保障实战经验; 4、熟练掌握PyTorch、NCCL、RDMA等核心技术,能够独立排查训练中的通信异常、性能瓶颈等复杂问题; 5、具备训练容错、断点续训、故障自愈、慢节点治理等相关功能的研发或落地经验,熟悉大模型训练全链路故障场景与解决方案。 加分项: 1、熟悉Megatron-LM、DeepSpeed、PyTorch等主流训练框架原理和实现; 2、熟悉GPU硬件特性、国产异构算力,有训练性能优化实战经验。

官方来源与核验

字节跳动官方招聘 · 职位编号 7655625365965670661

官方发布时间:

最近核验:2026-09-16T12:33:12.416632+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。