腾讯地图-多模态大模型融合建图研究
关于这个机会
1. 课题背景 高精度地图与环境感知是自动驾驶、机器人导航、智能交通与数字孪生场景的核心基础设施。传统建图方案多依赖激光雷达、视觉、IMU 等单一或简单融合的传感器数据,在复杂城市场景、极端光照、动态遮挡、无纹理区域等条件下,存在鲁棒性不足、精度受限、语义信息缺失、建图效率低等问题。 随着多模态大模型与端到端感知技术的快速发展,基于视觉、激光、文本语义、先验地图、GPS / 北斗位置信息等多源异构数据的联合建图成为下一代主流技术方向。但当前行业仍面临三大核心瓶颈: 1)多模态数据难以深度对齐:图像、点云、位置、文本等数据在时空、特征、语义层面缺乏统一表征与融合机制; 2)环境语义理解能力薄弱:现有建图系统以几何重建为主,缺乏对道路、设施、障碍物、交通规则的语义理解与结构化表达; 3)泛化与鲁棒性不足:在长尾场景、陌生环境、动态干扰下易失效,难以实现大规模、低成本、自动化的地图更新与维护。 本课题旨在突破传统几何建图范式,构建多模态原生融合的端到端建图体系,实现高精度、高鲁棒、高语义的自动化地图构建与持续更新。 2. 课题挑战 1)多源异构数据融合建模:视觉、激光、惯性、位置、文本等模态差异大,时空校准与特征融合难度高,业界缺乏统一的融合表征框架; 2)语义与几何联合优化:同时满足地图的几何精度、拓扑一致性与语义完整性,存在多目标约束与优化冲突问题; 3)动态环境与在线建图:在动态障碍物干扰下实现稳定建图,支持低算力平台实时推理与增量更新; 4)大模型与传统 SLAM 深度结合:如何将多模态大模型的感知与理解能力,注入到经典 SLAM 流程中,提升泛化性与鲁棒性,是前沿且开放的难题。 3. 具体工作 你将参与下一代多模态融合建图系统的核心研发,主要内容包括: 多模态(图像 / 点云 / IMU / 位置 / 文本)时空对齐与深度融合模型设计; 面向建图的多模态基座模型预训练、特征提取与跨模态表征学习; 视觉 - 激光融合定位、SLAM、里程计与后端优化算法研发; 语义分割、目标检测、场景理解与地图结构化信息抽取; 语义与几何联合约束的图优化、束调整与地图一致性校正; 大模型驱动的自动化建图、标注、校验与增量更新闭环系统; 多任务联合训练策略、蒸馏量化、端侧部署与完整评估体系建设。
任职要求
1. 学历和专业要求 包括但不限于:计算机科学与技术、人工智能、自动化、机器人、模式识别、遥感与地理信息工程(GIS)、测绘工程、应用数学、统计学等相关专业博士及优秀硕士。 2. 技术技能要求 熟练掌握多模态模型、SLAM、三维重建、深度学习基础理论与主流方法; 具备扎实的工程能力,熟悉 PyTorch/TensorFlow 等训练框架,有模型训练、优化与部署经验; 有以下任一经验者优先: 多模态融合、VLM 大模型、特征对齐与跨模态表征学习; 视觉 / 激光 SLAM、视觉里程计、点云处理、传感器标定与融合; 三维重建、语义建图、数字孪生、自动驾驶环境感知; 模型优化、蒸馏、量化、端侧部署与系统落地经验。 3. 软性素质要求 具备极强的自驱力与科研探索精神,能够在前沿方向上独立拆解问题、设计方案并落地; 具备良好的论文阅读、算法复现与创新能力,善于在无成熟方案的场景下推进迭代; 具备优秀的跨团队协作与沟通能力,能够快速理解业务场景并将技术转化为实际产品价值。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。