腾讯
校园招聘 · 青云计划-实习生复杂3D场景的多模态理解与生成
面议
关于这个机会
课题背景: 大模型的深层语义理解需超越"看图说话"的表层认知。当前主流方案(如UnrealLLM等)依赖多视角渲染或资产元数据匹配,难以捕获空间拓扑、物理约束与交互可用性(Affordance),导致视觉感知与物理逻辑割裂。本课题旨在建立3D原生数据结构与大模型高维语义空间的精准对齐机制,打通"视觉-物理"的认知壁垒。 课题价值: 1、理论范式:构建多模态场景语义图(Multimodal Scene Graph),实现视觉特征、物理属性与逻辑约束的统一表征,为下一步的生成和编辑提供高维推理认知基座; 2、应用突破:攻克"知其形而不知其理"的认知瓶颈,使大模型深度理解资产间的空间关联与交互机制,支撑3D场景的动态生成与复杂推理; 3、引擎验证:基于游戏引擎或3D制作工具理解场景,进一步根据用户指令生成场景。
任职要求
1、包含但不限于计算机、人工智能、图形学等相关专业的硕士或优秀本科生; 2、深入理解UE底层架构(UObject体系、渲染管线),熟练掌握C++/Python编程; 3、熟悉多模态大模型(MLLM)、3D表征学习或图神经网络(GNN)的前沿进展,具备较强的模态对齐算法落地能力。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。