腾讯
校园招聘 · 青云计划-应届生GUIAgent Bench及数据构建方式研究
面议
关于这个机会
课题背景: 多模态Agent的发展正经历从命令行界面(CLI)向直接操作图形用户界面(GUI)的跨越。然而,高质量、真实的“视觉-动作”轨迹数据极度匮乏,导致Agent难以在真实复杂的屏幕交互中实现精准理解和操作,亟需突破数据瓶颈。 课题挑战: 1)自动化数据合成范式:真实GUI交互轨迹收集成本极高,基于大模型及DOM树解析技术,探索出一条高效自动化合成GUI-ACTION指令的数据范式是首要难点。 2)全场景定位与操作:构建具有高指令密度的训练集及评测基准,并确保视觉Agent在Web、Office、PC及Mobile等异构设备与复杂场景下,均能实现极高准确率的UI元素定位(Grounding)与操作。 具体工作: 研发自动化GUI-ACTION数据合成方法;构建高指令密度的GUI训练数据集及评测Benchmark;提升视觉Agent在多端场景下的UI定位与操作准确率
任职要求
学历和专业:计算机视觉、VLM、计算机图形学或机器学习相关方向;在ICLR、NeurlPS,ICML、KDD、AAAI,IJCAI等机器学习领域会议或者期刊有第一作者发表过至少一篇文章。 技术技能:熟悉模型开发&训练常见框架,具备快速阅读和复现论文的能力,熟悉常见Agent框架及Agentic Workflow
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。