腾讯
校园招聘 · 青云计划-实习生混元多模态-全模态音视频理解研究
面议
关于这个机会
课题背景: 随着多模态大模型的发展,内容理解任务正由单一模态建模逐步演进为对视频、语音、背景声及上下文等多源异构信息的统一建模。面向真实复杂场景,构建具备跨模态感知、对齐、推理与表达能力的全模态音视频理解框架,已成为多模态智能领域的重要研究方向。 课题挑战: 本课题的主要挑战在于构建面向全模态音视频理解的高质量数据生产与验证链路,涵盖多模态信息对齐、全模态 caption 构造、Query-Answer 数据设计,以及数据有效性评估。同时,还需解决多模态长时序依赖建模、跨模态语义融合及复杂场景泛化等关键问题,以提升模型对复杂音视频内容的综合理解能力。 具体工作: 参与全模态 caption 与 Query-Answer 数据构建,设计并完善数据生产与验证链路,开展全模态理解模型的预训练与后训练,并支持模型评测与实验分析。
任职要求
学历与专业: 来自计算机科学、人工智能、电子信息、信号处理等相关专业的博士/硕士同学,具备扎实的机器学习理论基础,有多模态方向研究经验者优先。 技能要求:精通 PyTorch 框架与 Python 编程;深度掌握 Transformer 架构及主流 MLLM(如 LLaVA, Qwen-Audio, Qwen-Omni)原理;熟悉 PPO、GRPO 等强化学习算法及 DeepSpeed/Megatron 分布式训练工具。 软性素质: 具备较强的问题分解与独立研究能力;能在模糊问题定义上给出清晰的拆解思路和方法。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。