← 发现更多职位
腾讯
校园招聘 · 青云计划-应届生

大规模资源调度技术研究

面议
深圳总部 · 经验要求见详情
青云课题青云计划-应届生TEG

关于这个机会

课题背景 AI领域任务对异构算力的需求急剧增长,且常依赖跨地域分布的存储、数据等资源。传统的、局限于单个数据中心或单一硬件类型的集中式调度器,已难以满足调度此类复杂作业的需求。 本项目基于联邦集群架构,研究大规模 AI 场景下资源调度能力。通过刻画不同任务在不同卡型的计算能力、不同任务其他依赖其他资源(包括异地存储等资源),研究一体化联邦调度方案。最终实现资源利用率和用户任务执行效率最优。 课题挑战 1. 复杂约束下的跨域调度建模:AI任务调度决策不仅需考虑计算资源,还需统筹网络带宽(用于梯度同步)、跨地域数据访问延迟、存储I/O性能以及作业内部的亲和性约束。在联邦环境下,将这些异构、跨域的软硬件约束统一建模为一个可解的优化问题。 2, 多卡型算力的归一化与效能评估:不同型号卡在各类上的实际算力与能效比差异显著。难点在于建立一套精准、通用的“算力归一化”模型,将不同卡型的计算能力与业务特性精确匹配。 具体工作: 1. 研究跨集群场景下,计算任务跨集群、跨卡型、跨地域调度。 2. 解决超大规模调度场景下的规模、性能问题。 3. 多卡型算力归一化

任职要求

1、强烈的技术自驱力,能快速学习GPU/NPU新硬件架构及前沿论文技术 2、熟悉Kubernetes核心组件(调度器/网络/存储)、容器运行时及CRD开发,具备大规模集群调优经验 3、具备OpenMP/MPI/RDMA高性能计算开发经验 4、熟悉主流AI框架及训练加速技术(算子优化/显存管理) ​​5、加分项​​: 有万卡级GPU集群调度实战经验(如弹性任务抢占、跨集群资源池化) 熟悉分布式训练框架、大规模训练推理等技术 在MLSys/ATC等顶会发表过资源调度相关论文

官方来源与核验

腾讯官方招聘 · 职位编号 1274481034578500666

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。