字节跳动
社招 · 正式硬件加速训练AI Infra工程师-Data
面议
关于这个机会
1、负责自研硬件训练框架开发(Torch、Megatron、Dtensor等); 2、对接业务大模型例如豆包、Seedance等模型在自研硬件上训练任务支持; 3、开发DP、SP、TP、PP等分布式并行方式并且优化; 4、训练业务通信、计算、通算融合算子研发以及性能优化。
任职要求
1、1-5年异构硬件、GPU相关领域训练开发经验,熟悉PyTorch、FSDP、Megatron-LM、VeRL分布式训练框架; 2、对数据并行、模型并行、分布式数据并行等常见训练模式有深入理解; 3、参与过硬件加速器训练相关研发工作,包含Torch Compiler、算子开发、编译调度优化等; 4、有主动学习、快速解决问题的能力和自我驱动力。 以下为加分项: 1、有大模型训练百、千卡以上集群训练落地经验; 2、有异构硬件、NPU等训练、推理开发经验,对硬件比较了解; 3、熟悉计算机体系结构和并行计算; 4、有GPU、FPGA或AI芯片相关的开发和评测经验。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。