微信搜索-Agent研究
关于这个机会
课题背景: 大模型正在从"知识对齐 (Alignment)"迈入"世界交互 (Interaction)"的新范式。仅依赖预训练知识与后训练对齐 (SFT / RLHF / DPO),已难以满足海量真实用户在多步推理、跨系统协作、动态环境决策上的诉求。Agent 正是大模型走向物理与数字世界的关键载体:它通过工具协议 (Tool Protocol)、规划 (Planning)、反思 (Reflection) 与记忆 (Memory) 构成的闭环,把模型能力外延到真实业务链路。微信天然的内生态工具,为构建连接微信内部资源的 Agent 系统服务好海量用户需求奠定了基础,也是模型向与真实世界交互的关键一步。在这里,我们围绕工具协议标准化 (MCP / Harness)、Agentic 数据合成、Agentic RL、多轮 Tool-Use 训练、可信评测 五大支柱,系统性地把模型在真实 Agentic 任务上的能力上限推向新的 SOTA,并在微信生态中实现规模化落地。 课题挑战: 在多步、多工具 (Multi-Tool, Multi-Turn) 场景下,模型输出的 tool-call schema 必须与工具真实签名严格对齐——参数类型、必填项、命名一致性、JSON / XML / Function-Calling 格式、错误恢复策略均需鲁棒。长上下文下的 schema drift:随着工具数量线性增长,工具描述被稀释、模型出现幻觉调用。同时Tool Selection under Ambiguity:Query 意图不清时的澄清 / 探索 / 试错策略也需要探索。 Agentic RL 的研究。信用分配 (Credit Assignment):多轮 rollout 中稀疏且延迟的奖励如何回传到早期决策。Rollout 成本爆炸:真实工具调用带来的时延、同步采样的空等,都制约了 rollout 的高效性。On-policy vs Off-policy 权衡:GSPO / Reinforce++ / VAPO 等算法在多轮 tool-use 场景的稳定性也需要验证。 评测是模型迭代的指北针。当前公开 benchmark (τ-bench、BFCL v3、AgentBench、GAIA、WebArena、ToolBench) 各有偏侧,均无法完整刻画真实业务链路。内部需要构建针对工具调用格式、效率、鲁棒性(错误调用时的纠偏)的评估。 具体工作: 负责模型 Agentic 能力的端到端提升,覆盖但不限于: 工具协议与 Harness 建设:设计并维护统一的工具封装协议 (MCP-aligned Harness),抽象微信内异构工具 (RPC / OpenAPI / MCP Server) 为一致的调用接口。主导工具描述规范 (schema 编写指南、few-shot 范本、错误码规范) 的落地。 Agentic 数据合成与质量过滤:大规模 tool-call / response 数据的清洗、去重、质量过滤、难度分层 (curriculum);合成数据 pipeline:基于强模型 self-play、AI Feedback (RLAIF)、反事实增广、失败案例挖掘 (hard negatives) 构建多样化训练集; Agentic 训练算法:完成 SFT、Rejection Sampling 的训练,稳定多轮 Agentic RL 在 tool-use 场景下的持久 scaling。进行 PRM、ORM 的联合训练和消融,结合 OPD 方法高效训练 RL。 评测体系与迭代闭环:构建微信 Agent 强相关任务 bench,覆盖真实用户 query 分布、单/多工具、串/并行、长/短程任务。建立离线自动评测 + 在线 A/B + 人评校准的三级评测流水线,反哺数据与算法迭代。 前沿探索:探究多 Agent 协同 (Multi-Agent Society)、在线持续学习(Continue Learning)、智能体记忆系统(Agentic Memory)的架构与训练协同。
任职要求
面向计算机科学、人工智能、机器学习、应用数学等相关专业的硕士或博士同学;在顶级学术会议(如ICML, ICLR, NeurIPS, COLM, RLC等)有相关论文发表经验者优先。 深入理解 MCP (Model Context Protocol)、Harness 等工具封装抽象,并有落地实践; 熟悉主流模型的多轮工具调用协议 (OpenAI FC、Anthropic Tool Use、Gemini FC、Qwen / DeepSeek 私有协议) 及 Interleaved Thinking (Claude 3.7 Extended Thinking / OpenAI o-series / DeepSeek-R1) 的技术细节; 熟悉 veRL / OpenRLHF / slime / Nemo-Aligner 等 RL 训练框架,有多轮 RL / GRPO / DAPO / Async RL 落地经验; 具备极强的数据直觉,有大规模 tool-call/response 数据清洗、质量过滤以及数据合成的实战经验。具备一定的工程代码能力。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。