腾讯
校园招聘 · 青云计划-应届生元宝搜索—搜索大模型推理加速研究
面议
关于这个机会
大规模搜索系统面临长序列建模、高计算开销与异构资源约束的挑战,传统稠密注意力模型在效率、存储及部署层面存在显著瓶颈,制约系统性能与扩展性 1、高效推理注意力机制 研究并设计高性能注意力机制(线性注意力、稀疏注意力),针对搜索长序列短输出场景定制算子,将计算复杂度从 O(n^2) 降至 O(n) ,在保障排序精度的前提下显著提升推理吞吐与响应速度 2、高精度结构化模型压缩 构建融合结构化稀疏、动态路由与非均匀量化的联合压缩范式,以排序指标为约束优化模型体量,实现计算与存储的协同压缩,确保轻量化后精度无损 3、异构分布式推理架构 设计混合并行策略与通信原语融合机制,优化跨节点传输与动态调度能力,打通从算子内核到集群的全栈链路,挖掘异构资源潜力以触达系统性能边界
任职要求
1、计算机、人工智能、高性能计算或相关专业硕士/博士同学,需具备扎实的深度学习理论基础,在高性能计算、编译器优化或大模型架构领域有深入研究背景; 2、精通PyTorch/TensorRT等框架,熟练掌握CUDA编程与分布式训练推理技术,深入理解Transformer/SSM架构,拥有模型剪枝、量化及大规模搜索系统落地经验者优先; 3、具备极强的技术追求与系统架构思维,善于跨算法与系统工程边界协同攻关,拥有优秀的沟通协作能力,能在高并发、低延迟的生产环境下高效解决复杂工程难题。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。