元宝-大模型效果评估的自我迭代与自动进化
关于这个机会
本课题希望探索面向大模型的Evaluation Evolution 与 Iterative Self-Refinement:一方面研究评测体系如何随着模型能力、用户需求和真实 Badcase 持续自我迭代,自动发现新的能力边界、问题模式和评测维度;另一方面研究如何利用评测反馈,在不依赖额外模型训练或尽量减少训练成本的前提下,通过推理策略、上下文组织、反馈反思、自我修正等方式,实现模型效果的自主迭代与提升。 可能探索的方向包括但不限于: 1. Evaluation Evolution:基于线上真实问题、模型能力变化及自动化分析,动态发现新的评测维度、生成高质量评测样本,并持续演进 Benchmark; 2. 自动化评测与归因:研究 LLM-as-a-Judge、自动 Badcase 聚类与归因、评测结果可信度校准等方法,提升评测体系的自动化程度与可靠性; 3. Iterative Self-Refinement:利用评测反馈驱动模型进行反思、重规划、答案修正和多轮自主优化,探索 Training-Free 的模型效果提升方法; 4. Evaluation-to-Improvement 闭环:研究如何将“发现问题—评估问题—理解原因—产生改进策略—验证改进效果”连接成自动化闭环,使 Evaluation 从静态测量工具进一步演化为推动模型持续进化的核心机制。 课题将结合真实大模型应用场景与大规模评测数据开展研究,既关注算法和方法创新,也关注其在实际大模型系统中的有效性与可扩展性。
任职要求
希望候选人具备较强的研究兴趣和独立思考能力,对大模型 Evaluation、Agent、Self-Refinement 等方向有兴趣,并愿意探索开放性较强的问题。 具体希望具备: 1. 计算机、人工智能、机器学习、自然语言处理等相关专业背景; 熟悉机器学习、深度学习及大语言模型基本原理,具备良好的算法基础; 2. 熟练使用 Python,熟悉 PyTorch 等常用深度学习框架,具备较好的工程实践能力; 3. 有 LLM、NLP、Agent、Evaluation、Reasoning、RL、数据挖掘等相关研究或项目经历者优先; 4. 能够阅读和跟进前沿论文,并具备从问题定义、方法设计、实验验证到结果分析的完整研究能力; 5. 对真实模型 Case 有敏感度,能够从大量现象中抽象问题、形成假设并通过实验验证,而不仅停留在指标调优层面; 6. 具备良好的沟通协作能力和 Ownership,能够主动推进开放性课题。 尤其欢迎对“如何让大模型知道自己哪里不好,并进一步自主变好”这一问题感兴趣的同学。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。