腾讯
校园招聘 · 青云计划-实习生混元多模态-图音视频理解技术研究
面议
关于这个机会
课题背景:多模态大模型正向着原生图音视频融合方向演进。本课题旨在提升腾讯混元大模型对复杂视频、长音视频、复杂图片、多图以及图文交错等场景的深度理解能力,为下一代原生多模态大模型奠定算法基础。 课题挑战:1. 跨模态对齐与联合建模:高分辨率高帧率视频、音频、文本的细粒度跨模态对齐与联合建模;2. 幻觉控制与长上下文建模:在超长视频或音频流中保持理解的准确性,降低模型幻觉,突破现有架构的上下文长度瓶颈;3. Agentic探索:原生多模态单模型存在先天短板,通过Agentic弥补短板实现综合提升;4. 理解生成一体化下的理解任务,探索生成如何帮助理解 具体工作:面向生图生视频场景,研究如何提升多模态大模型的图音视频的理解能力,为图音视频提供全面准确的caption描述,工作包括后训练、强化、架构设计优化、数据管线搭建等。
任职要求
学历和专业要求:来自计算机、人工智能、自动化等相关专业的博士/优秀硕士同学。 技术技能要求:扎实的深度学习基础,熟练掌握PyTorch、transformers、verl、Megatron、ms-swift等主流框架;熟悉主流多模态大模型的结构与预训练后训练方法,有相关实践经验和相关top论文。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。