优图实验室—图文(含OCR)多模态视觉细粒度理解研究
关于这个机会
课题背景: 随着多模态大模型能力的持续跃升,视觉理解的边界正从粗粒度的图像描述向细粒度的精准感知与深度语义理解加速拓展。真实业务场景——如文档智能处理、工业质检、遥感解析、医疗影像分析——对模型的细粒度视觉能力提出了严苛要求:精确识别与定位图像中的文字、符号、微小目标、密集物体及复杂版式结构。然而,现有多模态模型在视觉细粒度感知方面仍存在显著短板,难以在高分辨率、复杂场景下稳定输出精准的结构化理解结果。本课题旨在系统性突破多模态模型的细粒度视觉理解能力,覆盖文字识别、文档解析、视觉定位与精细属性理解等核心子任务。 课题挑战: 1、细粒度视觉感知与高分辨率建模:针对密集文字、微小目标和高分辨率输入时存在语义损失,如何设计兼顾全局上下文与局部精细特征的视觉感知能力,使模型在保持高效推理的同时实现像素级精度的视觉理解; 2、复杂场景 OCR 与文档结构化解析:真实文档涵盖多栏排版、嵌套表格、图文混排、手写印刷混合等复杂版式,如何实现文字识别与文档逻辑结构的联合建模,输出保留层次语义的结构化内容,支撑下游 RAG、信息抽取等高价值应用; 3、视觉定位与细粒度属性理解:Referring、Grounding、计数、关系推理等细粒度任务要求模型在视觉空间与语义空间之间建立精准映射,如何设计统一的细粒度理解框架,在单一模型内协同解决定位、识别与属性描述等多类子任务; 4、细粒度理解的数据构建与自动化评估:细粒度任务对标注质量要求极高且人工成本巨大,如何设计高效的自动化数据合成流水线与可扩展的评估体系,覆盖多样场景与任务类型,驱动模型能力的持续迭代。 具体工作: 你将参与细粒度视觉 Encoder 架构设计、复杂场景 OCR 与文档解析算法研究、多任务细粒度理解框架构建、训练数据自动合成与评估系统建设,推动原生多模态大模型在视觉细粒度理解方向的能力突破。
任职要求
1、计算机科学、人工智能、模式识别、计算机视觉、自然语言处理等相关专业的博士及优秀硕士;具有目标检测、OCR、文档理解、视觉定位或细粒度识别方向研究背景者优先; 2、深入理解多模态细粒度理解前沿进展,熟悉 ViT、CLIP、Grounding DINO、SAM、InternVL、Donut 等技术路径;精通 PyTorch,熟悉分布式训练框架(DeepSpeed、Megatron-LM);在 CVPR、ICLR、NeurIPS、ECCV、ICDAR 等顶会有相关成果者优先;熟悉 Python 编程,有 CUDA 优化经验者更佳; 3、对细粒度视觉理解技术有强烈研究热情,具备将复杂视觉问题抽象为可量化技术命题的能力;沟通协作能力强,能在多方向交叉的大型项目中高效推进;具备面对开放性难题的韧性与独立攻坚精神。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。