阿里巴巴控股集团
社会招聘AI推理平台-Qwen推理优化专家-上海
面议
关于这个机会
1、面向 NVIDIA GPU等主流AI 加速硬件,对大模型核心算子进行深度性能优化,极致压榨计算与访存带宽资源,显著提升端到端推理吞吐量与延迟表现。 2、设计并实现高精度、极低比特量化内核,在保障推理精度的前提下,大幅降低模型存储占用与计算开销,推动大模型在资源受限场景下的高效部署。 3、针对大规模分布式推理场景,研发计算-通信协同优化技术,有效隐藏通信延迟,提升多卡/多节点系统的可扩展性与资源利用率。 4、和基模算法团队紧密配合,联合设计下一代Qwen模型结构,通过端到端性能建模、算子定制与框架优化,确保下一代模型结构的推理效能。
任职要求
1、具备扎实的工程实现能力与良好的代码规范,熟练掌握 Python 和 C++,熟悉常用设计模式,能够独立完成复杂系统的架构设计、开发与调试。 2、拥有丰富的高性能计算内核(Kernel)开发经验,精通 CUDA / Triton / ROCm 等异构编程模型,有基于 CUTLASS、CUTE 等框架进行算子开发与极致性能调优的实战经验,并已在生产环境中成功落地。 3、熟悉计算机体系结构核心原理,具备大模型推理引擎(如 vLLM、SGLang 等)优化经验,或在模型压缩(如低比特量化、稀疏化)、AI资源调度、计算图优化等方向有深入实践。 4、具备优秀的沟通协作能力与团队合作精神,学习能力强,对技术有热情,能深入钻研底层性能瓶颈并提出创新性解决方案。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。