元宝-搜索智能体的动态工具选择与多工具编排学习
关于这个机会
真实搜索场景中,单一的网页搜索远不足以应对所有需求——复杂任务往往需要通用搜索、内部知识库、数值计算引擎、代码解释器等多类工具的协同配合。然而现有模型大多面向固定工具集训练,既缺乏对工具能力的深层认知,也无法灵活编排多工具协同完成复杂任务。本课题旨在构建一个具备工具意识与编排能力的搜索智能体。 核心探索方向包括: 1. 工具选择策略学习:构建覆盖多工具的高质量训练数据(含工具选择理由与反例),通过SFT+RL培养模型的工具意识(Tool-Awareness),使其清晰理解各工具的功能边界、适用场景与局限,学会根据任务特征做出精准选择; 2. 工具调用时机优化:研究工具调用不应仅依赖当前轮次,还需结合历史上下文判断调用必要性,探索基于历史轨迹的工具调用决策,避免重复调用与无效调用; 3. 多工具协同编排框架:设计支持串行依赖与并行执行并存的编排框架,能根据任务结构自动拆解为子任务并分配合适工具,灵活应对搜索-计算-验证等复杂多步流程,同时支持工具链的动态重规划(re-planning); 4. 动态工具集泛化能力:探索模型对动态变化工具集(新工具上线、旧工具下线)的零样本/少样本适应能力,使智能体在工具生态持续演化的真实环境中保持鲁棒性; 5. 工具执行结果验证与纠偏:研究对工具返回结果的可靠性评估机制,当结果异常或与已有证据冲突时触发重试或切换工具策略,确保推理链条的准确性。
任职要求
1. 计算机、人工智能、机器学习、自然语言处理等相关专业,熟悉深度学习及大语言模型基本原理; 2. 熟练使用Python、PyTorch等常用开发与深度学习框架,具备较强的模型训练、实验分析和工程实践能力,能够熟练使用主流AI编程工具开展研发工作; 3. 在SFT、RLHF/RL、Agent、Tool Use等方向具有研究或项目经验者优先;熟悉Function Calling、Tool-Augmented LLM等相关技术者优先; 4. 在工具学习、多智能体系统、任务规划等方向有相关研究或项目经验者优先,了解MCTS、ReAct、Plan-and-Solve等推理范式; 5. 具备较强的模型行为分析能力,能够从实际问题出发定义可验证指标、设计优化方案,并通过实验持续迭代; 6. 具备较强的论文阅读、独立思考和实验分析能力,持续关注Agentic AI与Tool Learning前沿研究; 7. 具备良好的沟通协作能力和Owner意识,能够主动推动开放性研究课题取得实质进展,具备高质量论文撰写能力。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。