腾讯混元-LLM异构卡统一推理框架、算子精度和性能调优和统一图编译优化
关于这个机会
课题背景 伴随大模型的规模和应用持续增长,异构卡在推理侧扮演越来越重要的流量支持作用,如何针对多种异构进行性能、精度、框架侧的统一优化、减少版本更新和验证成本,提升部署效率是推理的关键 课题挑战 1、统一的异构推理框架,一套代码支持多芯部署和演进 2、统一的Torch Compile Graph编译优化,一套图编译系统支持多芯优化 3、统一Triton/TileLang跨平台算子开发和优化,统一单算子精度验证标准覆盖多种芯片和定制化算子精度场景 具体工作: 1、统一推理框架研发,推进图和算子级的高效精度和性能验证流程 2、图编译能力研发,支持多种芯片编译和优化流程 3、DSL语言跨平台性能优化和支持
任职要求
1.熟练掌握C/C++、Python编程语言,具备良好的coding和调试能力,具备计算机体系架构功底和大型分布式系统开发调优经验优先; 2.熟悉和调优NVIDIA GPU和各种AI芯片至少一种,包括AMD、海光/摩尔/沐曦/ GPGPU架构、Ascend、寒武纪、昆仑芯等,两种以上优先; 3.熟悉和调优GPU和各种AI芯片底层算子编程方式至少一种,包括CUDA、Triton、TileLang、AscendC、BangC等,两种以上优先; 4.精通和具备vllm/sglang 等推理引擎深度实践经验,参与过基于上述引擎的大模型推理系统定制化开发与性能调优;精通推理引擎底层优化技术; 5.熟悉和了解业界主流大模型如DeepSeek、Qwen系列模型结构,常见切分方式,有针对性的分布式推理调优原理分析和实践经验优先; 6.熟悉和了解模型适配异构芯片的流程,具备适配经验,有端到端完成模型推理适配,精度/性能调优者优先; 7.熟悉和了解集合通信原理和常见互联形态,如NCCL、NVLink、RoCE等; 8.针对大EP通算融合算子Dispatch/Combine 开发调优者优先; 9.针对关键算子,Attention MLA/GQA/, Sparse Attention DSA, Linear Attetnion等,GEMM/Group GEMM,有深入分析和最佳优化实践者优先; 10.熟悉和了解PD分离架构,有异构PD分离实践经验优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。