面壁智能
社招 · 全职多模态Infra负责人
面议
关于这个机会
1. 负责多模态训练基础设施的整体架构设计与技术规划,主导Infra方案的落地实施; 2. 搭建并优化大规模训练系统,确保千/万卡级别集群的高效稳定运行; 3. 主导训练框架的选型、优化与二次开发,持续提升训练效率与资源利用率; 4. 带领团队解决训练过程中的系统瓶颈问题,包括通信、存储、调度等关键环节; 5. 与算法团队紧密协作,推动训练流程的工程化与自动化建设。
任职要求
1. 本科及以上学历,计算机、软件工程等相关专业,有大规模训练项目经验; 2. 深入理解大模型预训练原理,熟悉Transformer架构及主流大模型训练流程; 3. 精通分布式训练原理,熟悉Megatron-LM、FSDP等主流分布式训练框架; 4. 熟悉GPU集群架构、高性能网络(RDMA/InfiniBand)、并行存储系统; 5. 熟悉NCCL/Gloo等通信库原理,有通信优化经验; 6. 具备较强的技术视野和团队管理能力,能够带领团队攻克技术难题。 加分项 1. 有开源社区贡献或技术影响力。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。