← 发现更多职位
腾讯
校园招聘 · 青云计划-实习生

混元多模态-面向多模态强化的全异步训推解耦系统与极致分布式架构的研究

面议
深圳总部 · 经验要求见详情
青云课题青云计划-实习生TEG

关于这个机会

在多模态大模型(如高分辨长图文问答、超长视频解析)的强化学习对齐中,传统的同步PPO架构强制推理与训练串行执行。由于多模态数据(如不同时长的视频)和不同难度的任务带来的推理延迟差异极大,同步架构会产生严重的GPU空转气泡(Bubble)与流水线阻塞。为实现多模态理解模型的高效迭代,亟需打破同步壁垒。本课题旨在构建一套全异步的多模态RL底层架构,将海量多模态张量的生成与训练深度解耦,实现异构计算资源的高效并发,极致提升多模态强化的综合吞吐。 课题挑战:该课题面临三大极具挑战的系统与算法协同难题:第一,全异步架构下的多模态算法收敛稳定性。异步训练不可避免地引入策略延迟(Staleness),导致经验生成策略与更新策略产生严重偏差(Off-policy)。在多模态理解(如长视频)高方差的Reward下,陈旧数据的异步更新极易打破PPO的信任域(Trust Region),导致KL散度爆炸和模型崩溃;第二,高频参数同步与无阻塞流水的博弈。训练节点需将更新后的千亿参数高频异步下发至推理节点,如何在不中断大并发生成(无阻塞)的前提下完成参数的高效热更新,是全异步架构的核心挑战;第三,海量多模态特征流转与网络风暴。训推节点隔离后,跨节点高频并发传输海量高清视频张量、中间态Logits等异构数据,极易耗尽RDMA带宽。 具体工作:构建训推解耦的全异步多模态强化编排与调度框架;研发基于RDMA的高吞吐多模态数据管道与无阻塞参数热更新机制;设计并实现补偿策略延迟(Staleness)的异步对齐算法与稳定训练Infra。

任职要求

学历专业要求: 应届博士毕业生,计算机体系结构、分布式系统、高性能计算或人工智能等相关专业。 技能要求: 精通C++/Python与高并发系统开发;深入理解Ray、Megatron、vLLM等分布式框架底层机制;熟悉异步RL/PPO算法逻辑及延迟补偿数学原理;具备大规模异步架构设计与RDMA通信优化经验。

官方来源与核验

腾讯官方招聘 · 职位编号 1231829074687944744

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。