AI异构硬件训练优化专家-Seed
关于这个机会
团队介绍:字节跳动Seed团队成立于2023年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。 Seed团队在AI领域拥有长期愿景与决心,团队研究方向涵盖MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位;目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE等超过50个应用场景,并通过火山引擎开放给企业客户;第三方数据显示,豆包App用户量在中国市场排名第一,豆包大模型日均Token调用量行业领先。 1、该岗位面向超大规模AI加速卡集群,负责豆包Seed自研LLM模型训练任务的性能优化与稳定性建设,深度参与训练框架、通信链路、算子库和集群调度等核心环节,支撑万卡规模训练任务高效、稳定运行; 2、训练框架优化:优化数据并行、张量并行、流水并行、专家并行和混合并行策略,提升端到端训练吞吐与扩展效率; 3、集群性能与稳定性:围绕计算、通信、显存、调度、Checkpoint、容错恢复等链路,解决静默数据错误、网络抖动、通信瓶颈和异常定位问题; 4、软硬件协同优化:推动训练框架、算子库、通信网络、编译栈和计算架构协同,使超大规模AI加速卡集群稳定承载LLM训练。
任职要求
1、计算机、软件工程、人工智能、电子信息、微电子等相关专业优先; 2、熟悉Linux环境下的C/C++或Python,具备扎实的编程能力和工程习惯; 3、熟悉计算机体系结构、芯片微架构、高性能计算、分布式系统、并行计算中的至少一个方向; 4、了解PyTorch、Megatron、DeepSpeed、FSDP、TorchTitan等训练框架或分布式训练系统中的至少一种; 5、关注训练中的吞吐、显存、通信、扩展效率、任务稳定性和异常定位问题。 加分项: 1、有GPU/NPU集群LLM训练优化、分布式训练框架、通信库优化经验; 2、熟悉NCCL、HCCL、RDMA、RoCE、集合通信、通信计算融合或网络性能分析; 3、了解MoE训练、混合精度训练、ZeRO、Checkpoint优化、容错恢复、长周期稳定训练相关技术; 4、有静默数据错误定位、硬件故障分析、集群稳定性建设、训练任务调优经验; 5、有OI/ACM、HPC竞赛、系统竞赛、科研项目或开源项目经历。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。