← 发现更多职位
腾讯
校园招聘 · 青云计划-应届生

面向AI集群业务的高性能网络

面议
北京 · 经验要求见详情
青云课题青云计划-应届生TEG

关于这个机会

课题背景: 随着千亿/万亿级参数规模的LLM大模型不断涌现,以及语料库的爆炸式增长,训练算力需要万卡级GPU集群来支撑,训练时间也持续数周或更长,这对集群网络的性能和稳定性提出了非常高的要求。一方面,大规模GPU集群训练的性能瓶颈在于如何优化网络集合通信来让万卡GPU之间保持高效地传输同步;另一方面,GPU集群通常按训练时间计算成本,价格昂贵,网络频繁故障/中断会导致整个训练任务耗时大增。因此如何优化网络集合通信性能,保证网络运营的可靠,是GPU集群网络研发的重要内容。 课题挑战: 通过突破GPU间通信性能瓶颈,提升大模型训练效率与降低模型推理成本。 具体工作: 1. 面向AI大模型的网络架构/协议设计、拓扑感知流量规划调度、集合通信性能优化、在网计算等GPU训练加速方案; 2. 网卡-计算卸载,内存池、存储通信加速; 3. Tile-based 集合通信库研发; 4. 超节点Scale-up高带宽域的通信加速、协议优化、可靠性运维; 5. 异构GPU互联通信加速(异构训练、异构PD分离传输等); 6. 支持KV cache复用的内存池化/storage池化的通信加速。

任职要求

1.计算机、通信、网络空间安全、电子工程、高性能计算等相关专业的博士; 2.有GPU集群通信相关经验,主导或参与过AI训练/推理平台的通信优化项目;有GPU通信库开发经验者优先; 3.加分项:发表过GPU通信、分布式计算领域的高质量论文或专利;具备GPU虚拟化、FPGA异构加速等跨领域经验。

官方来源与核验

腾讯官方招聘 · 职位编号 1277774706262778883

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。