腾讯
社会招聘大模型训练生产SRE工程师(深圳/上海/ 北京)
面议
关于这个机会
1.负责大模型训练链路的稳定性治理和模型生产保障; 2.协同包括框架、算力、网络、存储等基础设施,系统建设大模型训练的诊断、可视化、自愈能力; 3.负责大模型训练生产的oncall、排障和流程优化建设。
任职要求
1.熟悉大模型预训练、后训练流程,熟悉Megatron/PyTorch等框架原理; 2.熟悉GPU、NCCL集合通信和k8s/docker容器技术原理,有GPU硬件、驱动、Cuda、RDMA等调优经验; 3.有大规模任务系统故障排查、分析解决经验者优先; 4.具有强烈的工作责任心和自驱力,有良好的学习沟通能力。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。