← 发现更多职位
腾讯
校园招聘 · 青云计划-实习生

腾讯云—高性能大模型训练/推理网络

面议
上海 · 经验要求见详情
青云课题青云计划-实习生CSIG

关于这个机会

课题背景: 随着大语言模型(LLM)参数量级的爆炸式增长,超大规模 AI 集群的算力瓶颈已逐渐从单卡算力转移到集群通信能力上。本项目聚焦于“高性能大模型训练/推理网络”,基于腾讯自研的星脉网络 2.0,致力于打通端侧计算节点与网侧交换机,构建端到端的高性能网络架构。通过在芯片、硬件、软件及集群网络算法等关键技术上的全栈自研,全面提升 GPU 集群的数据吞吐与协同效率,为腾讯内部应用及公有云业务的 AI 大模型训练与推理场景提供坚实的底层网络支撑。 课题挑战: 1、端网协同的极致性能优化:如何在硬件网卡、驱动、传输层协议与网侧交换机之间进行全栈协同设计,打破传统网络协议瓶颈,实现底层通信效率的极限突破; 2、复杂流量下的动态拥塞控制:在大模型训练的 All-to-All、All-Reduce 等高频突发流量场景下,如何设计并实现高效、灵活的网卡可编程拥塞控制(CC)算法,避免网络拥堵导致的算力闲置; 3、vRDMA 协议栈的深度定制与虚拟化:在云原生环境下,如何兼顾 RDMA 的高性能与虚拟化的灵活性,解决 vRDMA 在多租户隔离、连接大规模扩展及高可靠传输上的技术挑战; 4、全路径性能瓶颈定位与观测:在复杂的分布式环境下,如何建立从底层网络协议到上层 AI 框架的端到端观测体系,实现对网络波动、协议异常及计算通信重叠问题的精准识别与快速定位。 具体工作: 你将深入参与到超大规模 AI 集群高性能网络的架构设计、协议开发与端到端优化中,具体包括: 1、vRDMA 核心传输协议开发:深入参与vRDMA传输层的设计与实现,涵盖多路径负载均衡、快速重传机制、大规模连接状态机管理逻辑优化; 2、端到端训练性能优化:基于 vRDMA 平台及商业网卡(如 NVIDIA ConnectX 系列),优化大模型训练中的集合通信库(如 NCCL/RCCL),提升有效带宽与并行效率; 3、低延迟推理网络优化:针对大语言模型推理场景,利用 vRDMA 的硬件卸载与轻量化协议栈特性,优化 Prefill 与 Decode 阶段的通信逻辑,并结合商业网卡技术栈实现高并发场景下的端到端推理加速; 4、全路径观测与性能分析体系建设:构建跨层次的性能监控方案,打通从网卡硬件计数器、驱动层、传输层协议到 AI 框架通信算子的全路径数据,实现对训练/推理任务中性能瓶颈的准确识别与根因分析; 5、可编程拥塞控制与闭环调优:参与自研可编程拥塞控制模块(如 DCQCN 或新型 CC 协议)的开发与在线调优,针对不同业务流量特征实现精细化的带宽分配。

任职要求

1、包含但不限于计算机、软件工程、人工智能等相关专业博士或优秀硕士; 2、熟悉高性能网络相关技术,包括RDMA, IB, libfabric, mpi等; 3、熟悉机器学习训练过程,特别是训练中的网络通信过程及相关技术和组件。包括NCCL, DP/PP/TP, Megatron等; 4、追求极致性能,主动寻求突破。

官方来源与核验

腾讯官方招聘 · 职位编号 1231829074692139110

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。