阿里巴巴控股集团
社会招聘AI推理平台-大模型异构芯片适配与推理优化工程师-杭州/北京
面议
关于这个机会
负责主流大模型在多种 AI 加速芯片和推理后端上的适配、优化与工程落地,覆盖 Qwen、DeepSeek、GLM、Kimi等文本、多模态与图像生成模型,目标平台包括 TPU、NPU 等各类 AI 加速芯片。该岗位需要深入理解模型结构、推理框架、算子/kernel、编译栈与分布式推理机制,推动模型在不同硬件平台上稳定、高效、可规模化运行。
任职要求
1. 负责 Qwen、DeepSeek、GLM、Kimi等主流模型在 TPU、NPU 等各类AI 加速芯片上的适配、验证和性能优化。 2. 分析模型结构与硬件特性,完成 attention、KV cache、MoE、多模态模块、DiT/扩散模型等关键链路的推理打通与优化。 3. 基于 vLLM、SGLang 或自研推理框架,推进模型部署、算子替换、图编译、kernel 调优和端到端性能优化。 4. 建立模型适配流程,包括精度对齐、性能 benchmark、长上下文验证、并发压测、稳定性回归和版本发布。 5. 与上下游团队紧密协作,定位并解决动态 shape、通信瓶颈、内存布局、算子缺失、图编译失败、精度漂移等跨层问题。 6. 沉淀通用适配能力和工具链,提升新模型、新硬件平台的接入效率,推动多硬件后端的标准化和平台化。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。