← 发现更多职位
阿里巴巴控股集团
社会招聘

晓天衡宇-大模型评测工程师-多模态方向(北京)

面议
北京 · 3年以上
本科社会招聘

关于这个机会

1、负责多模态评测框架的整体设计,围绕跨模态一致性、时空连续性、物理常识等核心内核拆解可量化子指标,并建立子指标至能力维度的聚合口径。 2、负责 Omni 理解方向评测集的建设与迭代,覆盖图文、视频、音频、文档等混合输入场景下的跨模态对齐、长视频理解、音视频联合理解及多模态指令遵循等能力。 3、负责世界模型生成方向评测方案的设计与落地,覆盖文生视频、图生视频、长时序一致性、物理规律遵循、镜头与运镜控制、可交互世界模拟等评测维度。 4、搭建自动化指标与人工 GSB/Arena 对战相结合的评测链路,制定打分协议与质检机制,控制主观评测的偏差与平局问题。 持续跟踪 GPT、Gemini、Qwen-Omni、Sora、Veo、可灵、Genie 等主流模型的能力演进,输出能力榜与性价比榜。 5、负责 badcase 的结构化归因分析,定位模型在感知、对齐、推理、幻觉及物理真实性、可控性等方面的短板,形成可执行的改进结论。

任职要求

1、计算机、人工智能、电子信息等相关专业本科及以上学历,具备大模型评测、算法或数据相关工作经验。 2、熟悉多模态大模型的主流架构与输入形态,理解视觉编码器、跨模态对齐、时序建模的基本原理,了解扩散模型、视频生成及世界模型的技术脉络。 3、熟悉 MMBench、MMMU、Video-MME、OmniBench 等理解类评测集及主流视频生成榜单,能够客观判断其区分度与适用边界。 4、掌握 GSB、Elo/BT 等主观评测方法,具备打分协议设计与标注一致性管理能力。 5、具备良好的 Python 工程能力,能够独立搭建数据处理管线及生成、采样、打分的完整评测链路。 6、对样本代表性、指标加权聚合、结果可复现性具备清晰认知,具备较强的数据分析与报告输出能力。

官方来源与核验

阿里巴巴官方招聘 · 职位编号 100032180003

最近核验:2026-09-16T10:04:11.465664+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。