阿里健康-AI 搜索大模型后训练算法专家-杭州/北京
关于这个机会
AI 搜索场景下的大模型后训练与效果优化。 职位描述 1、负责 AI 搜索场景大模型的后训练与效果优化,提升模型在内容理解、复杂推理、答案生成及工具使用等方面的能力。 2、建设 AI 搜索大模型的数据、评测与奖励体系,包括高质量 SFT 数据构造、偏好数据生产、自动与人工评测、Query-specific Rubric 设计及 Reward Model 训练。 3、探索并落地 SFT、DPO、PPO/GRPO、Rubric RL、Agentic RL 等后训练方法,持续优化模型的指令遵循、事实准确性、推理能力、搜索决策与结果生成质量。 4、面向 LLM Search、GenSearch、RAG 和 Agentic Search 等场景,优化工具调用、自我反思和动态决策等关键能力。 5、协同搜索算法、产品、数据与工程团队推进模型上线,确保模型在实际业务中的效果、稳定性、时延与成本,并建立持续迭代机制。
任职要求
1、计算机、人工智能、数学、自然语言处理等相关专业本科及以上学历,具备扎实的机器学习、深度学习和大语言模型基础。 2、熟练使用 Python、PyTorch,熟悉 Transformer 及大模型训练、推理框架;有 DeepSpeed、Megatron-LM、LLaMA-Factory、vLLM、Ray 等工具使用经验者优先。 3、精通 SFT、DPO、Reward Model、PPO/GRPO、Rubric RL 或 Agentic RL 中的一项或多项,具备完整的模型训练、实验设计、效果分析与问题定位经验。 4、对数据和评测敏感,能够从真实 Query 和 Badcase 中识别模型问题,并将分析结论转化为数据构造、奖励设计或训练策略等可落地的优化方案。 5、熟悉 AI 搜索、信息检索、RAG 或搜索 Agent,理解查询改写、意图识别、召回、重排、答案生成与工具调用等关键环节者优先。 6、具备良好的学习能力和协作能力,能够快速跟进大模型后训练、推理与 Agent 领域的前沿进展,并推动技术方案在业务中落地
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。