多模态大模型推理框架优化工程师-Data AML(北京/上海/杭州/深圳)
关于这个机会
1、推理性能优化:负责Seedance、Seedream、Seed3D等SOTA模型推理链路的端到端性能优化,围绕GPU利用率、推理吞吐(tokens/s)、延迟(TTFT/TPOT)、显存效率等核心指标,系统性地定位瓶颈并推动优化落地; 2、多卡通信优化:设计与优化多卡推理场景下的通信策略(TP/PP/EP),降低集合通信开销,实现通信与计算的高效Overlap,提升多卡线性扩展效率; 3、GPU架构理解与适配:深入理解GPU硬件架构特性,针对新硬件能力做推理策略适配与性能调优,充分释放硬件算力; 4、多模型推理加速:支持多模态(VLM)/视频生成(DiT/VAE)/MoE等多种模型架构的推理加速,设计通用可扩展的优化方案; 5、前沿技术预研:跟踪推理加速前沿方向,推动技术选型与生产落地。
任职要求
1、计算机相关专业本科及以上学历,精通C++/Python中的至少一门,有扎实的系统编程与性能优化基础; 2、熟悉GPU体系结构:理解SM调度、显存层次(HBM/L2/Shared Memory)、计算与访存瓶颈分析模型(如Roofline Model); 3、熟悉Transformer模型推理流程,理解KV Cache、Attention计算模式、Tensor Parallelism通信拓扑等核心概念; 4、具备较强的性能分析能力:能熟练使用性能分析工具,系统性定位计算、访存、通信瓶颈; 5、对推理加速有浓厚兴趣,善于从硬件原理和系统全局出发思考优化策略,有较强的分析和解决问题的能力。 加分项: 1、有大模型推理优化实战经验、有多卡通信优化经验、熟悉多代GPU微架构差异、有跨硬件性能适配经验; 2、有视频生成模型(DiT/VAE)或MoE模型的推理加速经验; 3、熟悉Kubernetes/Docker,有GPU集群资源调度与推理服务部署经验。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。