← 发现更多职位
腾讯
校园招聘 · 青云计划-应届生

面向金融场景的长程交互 Agentic 强化学习训练稳定性研究

面议
深圳总部 · 经验要求见详情
青云课题青云计划-应届生CDG

关于这个机会

研究问题: 1.本项目旨在系统研究真实金融场景下、结合长上下文条件的 Agentic RL 训练稳定性问题,重点包括:面向长上下文的长程信用分配机制研究,探索分层 RL、轨迹级价值分解等方法,在稀疏奖励和超长序列下实现低方差、可解释的步进式信用分配。 2.长上下文交互环境下的策略稳健性与熵约束方法,研究在环境反馈剧烈波动和上下文噪声累积条件下的方差缩减与策略更新裁剪机制,防止策略熵崩并提升训练可持续性。 工作内容: 核心算法研发:负责金融垂直领域 Agent 模型的算法开发,深耕投资、理财、研究等业务场景,打造行业领先的智能体应用。 后训练全链路优化:主导大模型的 Post-training 流程,包括高质量数据合成(Data Synthesis)、指令微调(SFT)、强化学习(RL)及模型推理能力的针对性提升。 Agent 技能进化:负责 Agent 在工具调用(Tool-use)、复杂逻辑推理、多轮对话流及多模态信息处理能力的研发与迭代。 前沿技术转化:跟踪领域内顶级学术进展(如推理缩放定律、长文本理解等),将前沿技术快速落地于实际业务,提升产品竞争力和团队技术影响力。

任职要求

1、专业背景:计算机、AI、数学等相关专业硕士及以上学历; 2、核心功底:精通大规模语言模型(LLM)的训练机制,对强化学习(PPO/GRPO)有深度理解及实战经验; 3、工程能力:扎实的 Python 功底,熟悉 PyTorch/DeepSpeed/Megatron 等主流分布式训练框架,具备优秀的工程实现能力; 4、加分项:在 ICLR, NeurIPS, ICML, CVPR 等顶会发表过高水平论文; 5、软素质:对金融领域有好奇心,具备优秀的逻辑分析能力和跨团队协作意识。

官方来源与核验

腾讯官方招聘 · 职位编号 1296891635279560704

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。