← 发现更多职位
腾讯
校园招聘 · 青云计划-实习生

混元多模态-视觉智能体强化学习关键技术研究

面议
深圳总部 · 经验要求见详情
青云课题青云计划-实习生TEG

关于这个机会

课题背景: 近年来,强化学习后训练技术持续推动大模型在复杂推理、工具调用与智能体任务上的能力飞跃,多模态大模型也正在从“看懂画面的语言模型”演变为“理解环境、规划决策、执行操作、获取反馈”的通用智能体。围绕 GUI Agent、通用视觉智能体等方向,模型需要在网页、桌面、移动端及开放环境中完成感知、推理、动作与反馈闭环,这对多步决策、环境交互、工具使用和长程任务求解能力提出了更高要求。如何构建适用于视觉智能体的强化学习关键技术与系统能力,仍处于快速演进阶段,也是下一阶段多模态模型能力突破的重要方向。 课题挑战: 1. Agentic RL范式探索:如何在多模态环境下构建高效的Agentic RL流程,使视觉智能体能够基于视觉和语言的混合反馈进行高效感知、推理,并自主规划工具调用。 2. 训练稳定性与探索-利用权衡:视觉智能体的强化学习训练容易出现模式坍缩、策略退化等问题,影响长期训练的收敛性。需要设计有效的正则化机制、熵控制策略与 Off-Policy 修正算法,实现可扩展的 RL 训练。 3. 优化过程的可解释性与白盒诊断工具:视觉智能体强化学习的优化过程涉及多模态输入、复杂网络结构和时序决策,其内部机制常被视为黑盒,缺乏有效的分析工具来诊断优化瓶颈。例如,难以量化基模先验的影响、数据质量与分布偏移的影响、训练与推理一致性、Off-Policy 算法的偏差与方差、梯度异常等。这阻碍了研究者定位问题根源,限制了算法的稳定提升与高效迭代。因此,亟需构建白盒化的可解释性分析框架与诊断工具,以揭示优化过程中的关键影响因素,指导算法设计与系统优化。 具体工作: 你将深度参与视觉智能体强化学习核心算法研究,结合大规模多模态强化学习系统开展 co-design,支撑模型提升关键 Benchmark 与实际业务场景中的智能水平;探索可解释性分析工具,提升训练过程的透明度与调试效率,沉淀中长期技术路线与框架迭代需求。

任职要求

1、计算机、人工智能、自动化、软件工程、数学等相关专业博士,或特别优秀的硕士;在多模态模型训练、强化学习等方向有研究积累或相关实践经验者优先。 2. 扎实的深度学习基础,深入理解经典强化学习算法及大模型后训练范式;具备极强的工程实现能力,熟悉Megatron-LM, DeepSpeed或Ray等分布式训练及RL框架者优先。 3、具备较强的问题抽象、科研探索与工程落地能力,能够将模型迭代中的真实痛点转化为系统化技术方案;沟通协作能力强,对视觉理解、视觉智能体的技术发展有持续热情和独到见解。

官方来源与核验

腾讯官方招聘 · 职位编号 1231829074687944746

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。