大模型推理优化工程师-Data语音
关于这个机会
1、负责构建新一代大模型推理引擎并主导性能优化,涵盖CUDA/Triton算子开发、vLLM/SGLang框架升级、分布式推理策略优化、量化/稀疏化等模型效能加速技术,优化多模态语音理解/语音生成等多模态生成大模型在GPU集群上的推理性能,实现低延迟、高吞吐的工业级部署; 2、研发GPU推理加速技术栈,设计最佳分布式通算结合方案,搭建PCIe通信与高并发推理架构; 3、负责高性能方案前瞻性建设,构建基于C++/Python研发的高性能推理系统; 4、与上下游部门深度合作,分析性能瓶颈,通过软硬结合提升模型训推效率,优化和部署语音大模型,支撑语音多模态场景下的性能优化需求并推动业务落地,支持AI工具链和技术生态建设,推动AI关键业务发展。
任职要求
1、精通Python,熟悉C++特性,具备高性能代码开发能力和高性能代码开发相关经验; 2、至少具备以下一个领域经验:GPU编程(CUDA/Triton/AscendC/TileLang开发)、模型量化/稀疏化/蒸馏、基于vLLM的框架研发、并行计算通算结合(多卡/多机推理优化); 3、符合以下条件者优先:拥有推理系统经验、具备vLLM/SGLang开发经验、Tilelang/Tritton开发经验,深入了解Transformer架构,有量化/稀疏化等相关技术落地或者论文发表等相关经验。 加分项: 1、在ACM/NOI/IOI/TopCoder获奖者优先; 2、有定点量化、指令集优化、深度模型优化等相关项目经验者优先; 3、有CPU、GPU、NPU、ARM、OpenCL、DSP等高性能计算优化经验者优先; 4、有相关语音信号处理,语音识别、语音合成或者自然语言处理经验的优先; 5、有相关语音算法引擎开发经验的优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。