字节跳动
社招 · 正式大模型训练框架开发工程师-抖音研发
面议
关于这个机会
1、设计与优化大模型的分布式训练架构,包括FSDP/ZeRO、TP、PP、EP、SP等策略; 2、提升GPU/NPU平台的训练性能与资源利用率,优化通信、调度与内存使用; 3、构建高可靠的训练管线(Checkpoint、混合精度、容错、Profiling等); 4、参与模型在不同硬件平台的适配与性能对齐; 5、为模型团队提供训练支持、调优方案和工具链建设。
任职要求
1、计算机或相关专业背景,本科及以上学历; 2、2年以上深度学习或分布式训练相关经验;熟悉PyTorch/DeepSpeed/Megatron/MindSpore等训练框架原理与实现; 3、深入理解多机多卡通信机制与并行策略(NCCL、HCCL、FSDP、TP、PP等); 4、具备GPU/NPU平台的性能调优经验,能识别并解决性能瓶颈; 5、有较大尺寸模型(如32B+Dense或100B+MoE)训练经验者优先; 6、具备良好的代码能力、系统分析能力与协作沟通能力。 加分项: 1、实战经验:完成过百卡级以上大模型训练任务; 2、框架贡献:参与过Megatron-LM、DeepSpeed、ColossalAI、MindSpore等开源项目; 3、系统优化:具备CUDA/C++/通信调度/算子优化能力。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。