面向通用机器人操作的具身多模态模型
关于这个机会
课题背景: 随着视觉大模型和多模态模型的发展,机器已经基本具备“看得懂、听得懂”的能力,但在真实世界中“稳定干活”仍明显不足。现实中存在形态各异的机器人,分布在家庭、商用、工业等不同场景,当前主流仍是“单本体、单场景、单任务”的定制方案。因此亟需一个统一视觉、语言与动作决策的通用 VLA 基础操作模型,作为跨本体、跨场景具身智能应用的共性底座。 课题价值: 通用、稳定的 具身操作模型(如VLA) 基础操作模型可以像“操作层 GPT”一样,为多种机器人本体提供统一的感知–理解–操作能力,让不同厂商和不同类型机器人在同一模型之上复用抓取、搬运、装配、服务等基础技能,实现生活与工业场景之间的知识迁移与任务泛化 课题挑战: ●泛化性 / 通用性:对特定数据和本体依赖重,难以在新本体、新物体组合和新任务指令上做到可靠的零/少样本视觉–语言到行动迁移。 ●准确率:非结构化环境下的光照、遮挡和动态干扰会放大为执行偏差,抓取、插拔、装配等操作成功率和精度仍不足。 ●节拍慢 / 时延高:大模型推理开销大,响应速度难以满足工业节拍和高频实时交互需求。 ●缺乏记忆:多为短时上下文,缺少对历史状态和子任务的长期记忆,易在多步、长周期任务中丢步骤、难恢复。 ●力触融合难:将力觉、触觉与视觉、语言有效融合以理解力度、摩擦和约束并保证安全,同时控制数据成本、模型复杂度和推理延迟,工程实现难度高。 具体工作(一项或多项) 1 - 通用VLA模型研发:参与视觉-语言-动作(VLA)基础模型的架构设计与训练,探索跨本体统一动作表征与零/少样本迁移方法 2 - 世界模型与视频生成驱动的操作学习:探索基于视频生成模型/世界模型(World Model)的操作策略学习路线 3 - 模型推理加速与部署:研究模型量化、蒸馏、动作chunk并行预测及分层异步决策等加速方案,推动模型在边缘端的实时部署 4 - 长时记忆与多步任务执行:设计面向长周期任务的记忆机制与层次化规划策略,提升多步骤复杂任务的鲁棒执行与异常恢复能力 5 - 多模态感知融合:研究力觉、触觉与视觉、语言的对齐融合方法,支撑精密操作与安全交互场景 6 - 仿真与真机实验:在主流仿真平台搭建评测环境,完成sim-to-real验证;撰写技术报告
任职要求
岗位要求 1 - 基本要求 计算机、人工智能、机器人、自动化等相关专业在读硕士/博士 扎实的数学基础与良好的编程能力(Python/PyTorch) 2 - 技能要求(满足一项或多项即可) 有Transformer、扩散模型、VQ-VAE等生成模型的训练经验 有LLM/VLM预训练、微调或推理优化经验,熟悉DeepSpeed、vLLM等框架 有模仿学习、强化学习或机器人操作策略学习经验,了解ACT、Diffusion Policy、RT系列、OpenVLA、π₀等工作 有视频生成模型(Sora、SVD、CogVideo等)或世界模型(UniSim、GAIA-1、GameGen等)相关研究或项目经验 熟悉ROS/ROS2,有真实机械臂或移动操作平台实验经验 有3D视觉、触觉/力觉传感或机器人仿真(Isaac Sim、MuJoCo等)经验 3 - 加分项 在CoRL、RSS、ICRA、NeurIPS、ICML、CVPR等顶会/顶刊发表过论文 有开源项目贡献或大规模模型部署工程经验 具备跨学科背景(机械、控制 × 深度学习) 4- 素质要求 对具身智能方向有浓厚兴趣,具备自驱力与独立研究能力 良好的团队协作、沟通能力与英文学术写作能力
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。