腾讯
校园招聘 · 青云计划-应届生元宝—VLM think with image研究
面议
关于这个机会
本课题旨在构建一个具备 “Think with Images” 能力的高阶视觉问答系统,使其能够像人类专家一样通过视觉化的思维路径解决复杂的认知难题。我们不仅挑战基础的视觉识别,更创新性地引入主动视觉推理范式。不同于被动接收视觉信息,本框架允许模型通过生成可执行代码(如 Python 图像处理脚本)主动干预视觉输入,例如进行动态裁剪聚焦、视角矫正、色彩增强或绘制辅助参考线,将隐性的思维过程具象化为中间态的“视觉草稿”。 课题将重点攻克多步视觉逻辑推演中的一致性难题,聚焦于模型在处理几何推理解析、物理规律判断等高难度任务时的思维留痕与自我修正,解决传统 VQA 在复杂场景下因缺乏中间步骤导致的判断失真,通过在教育辅助、精密设计评估等场景中的实战演进,实现从“视觉感知”向“主动视觉思考”的跨越,打造具备深度逻辑解释力的多模态认知中枢。
任职要求
1、计算机、信息工程、模式识别、人工智能、自动化、软件工程、电子工程、统计学、应用数学、物理学/量子计算、信息安全、信号与信息处理等专业的博士和优秀硕士; 2、熟练掌握大模型、多模态相关的基本算法及应用,熟悉caffe、tensorflow,pytorch等至少一个深度学习框架; 3、较强的工程实现能力,熟练掌握 C/C++ 编程,熟悉 Shell/Python/Matlab 至少一种编程语言。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。