千问事业部-大模型算子技术专家/高级技术专家-杭州/北京/广州
关于这个机会
1. 参与大模型训练、推理核心算子的设计、开发与性能优化,覆盖Attention、MLP、MoE GEMM、RMSNorm、RoPE、Sampling、KV Cache读写、量化/反量化等关键算子,支撑千亿/万亿参数模型的低延迟、高吞吐推理; 2. 面向NVIDIA、AMD及其他通用AI加速硬件,研发高性能Kernel实现方案,充分利用Tensor Core、Shared Memory、异步流水、Persistent Kernel等硬件能力,持续提升算子吞吐、延迟和资源利用率; 3. 参与FP8、FP4、INT8、INT4等低比特推理相关算子研发与优化,推动量化算子、算子融合、图级优化与推理框架协同落地,降低端到端推理成本; 4. 针对线上真实负载开展系统化性能分析、Benchmark、性能归因与问题定位,解决算子性能瓶颈、稳定性和工程化落地问题,沉淀可复用的优化方法和工程实践。
任职要求
1. 精通C++/CUDA/Python,具备扎实的计算机体系结构、并行计算和高性能计算基础,能够独立完成复杂GPU Kernel的设计、实现、调优和工程化落地; 2. 深入理解GPU硬件架构与性能优化方法,熟悉Tensor Core、Memory Hierarchy、Shared Memory、Register、Warp Scheduling、异步流水等机制,具备系统化性能分析和瓶颈定位能力; 3. 熟悉大模型推理核心算子,包括Attention、MLP、MoE GEMM、RMSNorm、RoPE、Sampling、KV Cache读写、量化/反量化等,有实际优化经验者优先; 4. 熟练使用Nsight Compute、Nsight Systems、Nsys等性能分析工具,能够针对真实业务负载开展性能归因、Benchmark建设和端到端优化; 5. 熟悉Triton、CUTLASS/CuTe、FlashAttention、FlashInfer、TensorRT-LLM、vLLM、SGLang等生态中的任一技术栈,有开源贡献或生产级优化经验者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。