多模态大模型/AI算子智能评测体系构建与Agent自动化升级
关于这个机会
【课题背景】 驱动大模型快速迭代优化的核心要素是“自知”,即全面评测其智能水平与短板,同时相关AI算子的评测也是影响模型效果的关键。为此,首先需要针对大模型和AI算子构建一套全面且科学的全模态智能评测体系(标准/BMK/评测算子)。在此基础上,针对当前评测流程高度依赖半自动化工具链、主观评测难以对齐等瓶颈,亟需将该评测体系进行“自治化”升级。通过引入 Agent(智能体)架构与强化学习机制,实现从任务理解、算子调度到主观标准对齐的端到端无人工干预闭环,真正做到以评测高效牵引模型迭代优化。 【课题内容】 1. 构建全模态与跨模态的智能评测基准体系(打基础):面向大模型与AI算子,构建覆盖多领域知识融合、自主适应与学习、高级认知推理、情感理解及社会交互等维度的全面评测标准与多层次 BMK。 2. 研发多维度评测算子与大模型化抽象(造工具):针对不同评测维度开发相应的评测算子。随着体系演进,逐步将碎片化的传统规则算子抽象、整合为统一的“评测大模型”,提升算子在复杂多模态任务中的泛化能力与评测上限。 3. 构建基于 Agent 的端到端自治评测架构(做升级):在评测基建基础上进行智能化升级,研发具备任务意图理解、动态规划与工具调用(Tool-use)能力的评测智能体。实现根据任务描述(如数字人生成评测)自动编排数据集、调度评测算子并生成报告的全链路自动化。 4. 基于强化学习的主观对齐与协同自进化(攻难点):针对美学、生成自然度等难以规则化的主观评测场景,引入强化学习(RLHF/RLAIF)机制,使 Agent 能够动态学习并逼近人类专家的主观偏好;同时实现评测 BMK 与评测算子的自动化扩充与协同自进化。
任职要求
1、具备扎实的 NLP/CV/多模态领域算法基础,深刻理解大模型(LLM/VLM)的基本原理与演进趋势,对大模型能力评测方法论、评测基准(Benchmark)设计以及“以模型评测模型(LLM-as-a-Judge)”深入理解和研究; 2、熟练掌握大模型评测核心技术,有高质量评测数据集构建、评测算子开发经验;熟悉并实践过 Agent 核心技术(如 Tool-use、复杂任务规划 Planning),了解强化学习(RLHF/RLAIF)在主观偏好对齐中的应用者优先; 3、熟练掌握 PyTorch 等主流深度学习框架,熟悉 LangChain、AutoGen 等主流 Agent 开发框架,代码熟练,具备优秀的端到端评测系统工程化落地能力; 4、在 ACL、CVPR、ICLR、NeurIPS、EMNLP 等顶会发表过高质量论文(尤其是大模型评测基准、多模态理解、Agent 架构、强化学习对齐等相关方向),或在相关知名开源评测项目(如 OpenCompass、HELM、Chatbot Arena等)、算法竞赛中获得优异成绩。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。