阿里巴巴控股集团
社会招聘基础设施与稳定性工程-大规模训练调度及效率优化工程师-杭州
面议
关于这个机会
1.负责多模态生成、LLM 等核心模型的万卡级训练编排与调度系统建设,包括任务生命周期管理、资源调度、拓扑感知及排队策略优化; 2.建设训练稳定性与容错能力,覆盖软硬件异常检测、故障定位、自动恢复和断点续训; 3.完善训练可观测与效率分析体系,识别计算、通信、存储及资源调度等环节的性能瓶颈,推动资源利用率和训练效率极致优化; 4.参与核心模型在国产异构卡上的训练适配与效率调优工作。
任职要求
1. 计算机相关专业本科及以上学历,熟练掌握 Golang/Python,具备良好的算法、数据结构及工程能力,熟悉分布式系统基本原理,有高性能系统研发经验者优先; 2. 自驱、务实,对系统底层问题有钻研热情,具备复杂问题分析与排查能力,探索简洁高效的优化办法并推进落地解决; 3. 了解并行计算、GPU 架构、网络通信、系统优化、集群架构等 HPC 相关的知识;有Megatron-LM/DeepSpeed/FSDP/NCCL 等训练框架或组件的优化经验者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。