面向游戏领域的长程VLM训练和优化
关于这个机会
课题背景: 游戏 QA 是 3A 研发中人力消耗最大的环节之一,也是 Agent 技术最有价值的落地场景之一,腾讯已经建立了Agent进行游戏测试的各种技术底座。但真正的科学问题尚未解决:Agent 如何"看懂"游戏画面并自主完成测试闭环—— 即"观察截图 → 理解游戏状态 → 规划并执行操作 → 判断是否达成测试目标或发现缺陷 → 生成证据 → 修复后自动回归对比"的完整链路。现有 GUI Agent 研究多面向网页 / 桌面软件,游戏场景带来全新挑战:实时性、画面高动态、无结构化可访问性树(没有 DOM)、目标开放式、验证标准模糊。 研究内容: 1. 游戏状态感知与理解:基于课题一的 Game-domain VLM(或通用 VLM 的领域适配),实现从原始画面 + 运行时 Probe 信号到结构化游戏状态的融合感知; 2. 测试任务规划与执行: - 从自然语言测试用例 / 策划文档自动生成可执行的测试计划; - 长程操作序列规划:在实时游戏环境中完成多步骤任务(寻路、交互、战斗、UI 遍历),处理失败重试与异常恢复; - 探索式测试:无显式用例下的自主探索、状态空间覆盖与边界行为挖掘; 3. 闭环验证与证据生成:测试结果判定(截图基线对比、状态断言、异常检测)、缺陷自动定位与可复现证据链生成、修复后自动回归与前后对比; 4. Agent 能力提升方法:基于真实与合成轨迹的 Agent SFT;利用测试闭环天然的可验证信号(测试通过 / 失败、覆盖率、缺陷发现)进行强化学习(RL from verifiable rewards);Memory 与经验复用机制。 预期成果: - 一个能在真实 UE 游戏项目中完成 L2/L3 级自动化测试闭环的多模态 Agent 系统,并中产品化落地; - 游戏 Agent 的评测基准(benchmark)与训练数据管线; - 高质量学术论文(NeurIPS / ICML / ICLR / ACL / CVPR 等)
任职要求
1、计算机、人工智能等相关专业博士; 2、扎实的多模态大模型 / VLM 训练经验,熟悉主流 VLM 架构(LLaVA / Qwen-VL / InternVL 等)与训练框架,有完整的预训练或 SFT 项目经验; 3、熟悉 LLM / VLM Agent 技术栈:工具使用(tool use)、规划(planning)、ReAct / Reflexion 等 Agent 范式,有 Agent 系统完整研发经验; 4、熟悉多模态模型应用,有 GUI Agent / 具身智能 / 视觉决策相关研究经历者优先; 5、具备良好的学术创新能力,在顶级会议 / 期刊发表过高质量论文; 6、具备优秀的系统工程能力,能把研究方法落到真实复杂系统中; 7、加分项:有强化学习(RLHF / RLVR / 环境交互 RL)经验;有游戏 AI、自动化测试、程序分析相关经历;熟悉 Unreal Engine;热爱游戏。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。