Agentic RL技术研究
关于这个机会
Agentic RL(智能体强化学习)——让模型在真实/模拟环境中通过多步试错、工具调用获得反馈并持续自我改进——正成为突破智能体能力上限的核心技术路线,其应用范畴已覆盖编程研发、3D 内容生成、动画、特效及游戏研发(Unity/Unreal)等方向。 核心工作是针对上述挑战,从算法层面进行诊断、优化与创新: Agentic RL 算法研究:深入分析编程、3D、动画、特效等不同任务中策略学习的特有瓶颈(如超长轨迹的信用分配、多模态动作空间的探索效率、跨任务泛化等),设计/改进RL 算法,解决通用方法在 Agentic 场景下失效的问题。 多步推理与规划的 RL 建模:针对长程任务中模型规划能力不足、错误累积难以纠正等问题,研究如何通过 RL 训练增强智能体的自我反思、回溯与动态策略调整能力。 跨模态内容生成的策略优化:探索在代码、3D、动画、特效等异构任务中统一/迁移 RL 策略的方法,研究 RL 算法在不同验证信号形态下的适配性与泛化性。 价值:直接决定智能体在复杂创作与研发任务上的能力天花板;兼具学术前沿性(NeurIPS/ICML/ICLR 等方向)与产品落地价值。
任职要求
研究基础: 系统掌握强化学习核心理论,能从算法层面分析主流方法在长程、稀疏奖励、大动作空间等场景下的局限性; 理解大模型训练全流程及 RL 在其中的定位,具备从方法论层面判断何时以及如何改进 RL 算法的能力; 具备 Agent 范式认知:多步推理、工具调用、长程规划,理解 Agentic 任务对 RL 算法提出的特殊要求; 对至少一类目标内容形态(代码、3D、动画或特效)有基本的生成与评估研究积累,能识别该领域算法优化的核心难点; 加分:相关方向一作论文或开源工作;游戏/数字内容研究经历。 实操能力: 具备扎实的算法实现能力,能独立完成从方法设计到实验验证的全流程; 有 RL 训练的实操经验,能诊断并排查训练不收敛、策略退化等问题,而非仅会调用现成框架; 熟悉 Unity或Unreal 至少一种引擎的基本项目结构,对 3D/动画/特效生成工具链有基本认知者优先。 攻坚资质与条件: 有完整的 RL 或智能体相关科研项目经历,能清晰说明"发现了什么问题、提出了什么方法、带来了什么改进"; 具备独立跑通"问题诊断→算法设计→实验验证→迭代改进"闭环的能力; 对算法层面有真实的好奇心与钻研欲,而非只关注工程落地;能在复杂场景下识别问题本质并提出有洞察的解法; 有可验证的实战产出(开源项目、竞赛、论文预印本、游戏/内容作品等)。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。