← 发现更多职位
腾讯
校园招聘 · 青云计划-应届生

游戏AI-大模型强化后训练框架及Rollout加速研究

面议
深圳总部 · 经验要求见详情
青云课题青云计划-应届生TEG

关于这个机会

课题背景: 在游戏AI大模型强化后训练(例如Agent场景)中,Rollout生成阶段占据了极大的算力和时间开销,是当前最核心的性能瓶颈。现有框架在训练和推理引擎中通常使用同等规模的模型,效率严重受限。本项目旨在探索参照投机解码思路,彻底解耦训练与推理引擎,利用更小规模的模型加速Rollout推理过程,从而大幅提升强化后训练的整体吞吐,突破算力瓶颈。 课题挑战: 1. 训推不一致与收敛稳定性:小模型Rollout会引入数据分布偏移,极易破坏RL算法的稳定性导致崩溃。需从理论和实验双向探索误差边界与算法修正方案; 2. 极致的分布式系统通信:彻底解耦训练与推理引擎后,跨引擎/节点的模型权重、隐藏状态、梯度的同步会带来巨大通信延迟,需设计创新的计算-通信重叠机制; 3. 动态投机接受率保障:随着大模型在训练中持续更新,固定的小模型投机准确率会快速衰减。需设计轻量级、低延迟的大小模型在线同步或高效蒸馏策略以维持高接受率。 具体工作: 你将主导分离式投机解码系统的架构设计,探索小模型Rollout对强化学习收敛性的影响,攻克大小模型高效通信与动态对齐难题,并在核心模型训练中验证其实用性与加速效果。

任职要求

1、包含但不限于计算机、信息工程、模式识别、人工智能、自动化、软件工程、电子工程、统计学、应用数学、物理学/量子计算、信息安全、信号与信息处理等专业的博士和优秀硕士; 2、深入理解VeRL等强化后训练框架、GRPO/PPO等强化学习算法及投机解码原理; 3、较强的工程实现能力,熟悉Tensorflow,PyTorch等至少一个深度学习框架,熟悉Megatron-LM, DeepSpeed, vLLM等主流训练/推理框架。

官方来源与核验

腾讯官方招聘 · 职位编号 1277774706266973184

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。