← 发现更多职位
腾讯
校园招聘 · 青云计划-应届生

元宝-面向复杂搜索的自适应深度决策与推理效率优化

面议
深圳总部 / 北京 / 上海 · 经验要求见详情
青云课题青云计划-应届生CSIG

关于这个机会

真实搜索场景中,模型常面临两难困境:简单问题执行多轮搜索造成计算浪费,长尾高难问题却因搜索深度不足导致答案质量欠佳。随着资源放开,更需让模型内生学会“该停则停、该深则深”。本课题计划从信息论视角出发,将每轮搜索视为一次信息获取行为,研究如何让模型根据任务难度与当前信息状态自主决策搜索深度。 核心探索方向包括: 1. 信息增益感知的搜索价值评估——设计可计算的边际信息增益度量方法(如基于模型置信度变化、知识覆盖增量、不确定性缩减等),量化每轮搜索对最终答案的真实贡献,识别“有效搜索”与“无效搜索”的边界; 2. 难度感知的动态预算分配:构建问题难度预判模块,在搜索启动前输出初始难度评分与搜索预算建议,结合信息增益动态调整预算,既防止简单问题过搜,也保障高难问题有充足探索空间; 3. 自适应早停决策机制——在信息增益显著衰减时由模型自主触发停止,并可结合问题难度预判设定差异化搜索预算,防止简单问题过搜,保障高难问题深度探索; 4. 强化学习驱动的策略学习——采用GRPO/PPO等算法进行端到端训练,设计兼顾答案准确率与搜索效率的奖励函数(如信息增益阈值动态惩罚机制),让模型在探索与利用之间习得最优平衡策略,在保证长尾高难问题解决率的前提下最小化整体推理成本。

任职要求

1. 计算机、人工智能、机器学习、自然语言处理等相关专业,熟悉深度学习及大语言模型基本原理; 2. 熟练使用Python、PyTorch等常用开发与深度学习框架,具备较强的模型训练、实验分析和工程实践能力,能够熟练使用主流AI编程工具开展研发工作; 3. 在SFT、RLHF/RL、Agent、Tool Use等方向具有研究或项目经验者优先,熟悉PPO、GRPO等Post-training方法或具有相关实践经验者优先; 4. 在推理效率优化、自适应计算、Early Exit等方向有相关研究或项目经验者优先,了解信息增益、主动学习等相关方法论; 5. 具备较强的模型行为分析能力,能够从实际问题出发定义可验证指标、设计优化方案,并通过实验持续迭代; 6. 具备较强的论文阅读、独立思考和实验分析能力,持续关注大模型推理优化与Agentic RL前沿研究; 7. 具备良好的沟通协作能力和Owner意识,能够主动推动开放性研究课题取得实质进展,具备高质量论文撰写能力。

官方来源与核验

腾讯官方招聘 · 职位编号 1291815825879448580

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。