← 发现更多职位
腾讯
校园招聘 · 青云计划-应届生

混元多模态-音视频表征学习

面议
北京 · 经验要求见详情
青云课题青云计划-应届生TEG

关于这个机会

课题背景: 随着多模态大模型的发展,多模态理解任务正逐步演进为对视频、语音、背景声及上下文等多源异构信息的统一建模。面向真实复杂场景,全模态表征已成为多模态智能领域的重要研究方向。 课题挑战: 本课题的主要挑战在于构建面向全模态音视频理解的编码器,从编码效率和表征维度上实现任意时长的音视频联合编码。 具体工作: 参与全模态表征学习的研究,编码器架构的设计,完善编码器的数据生产和性能评测。

任职要求

1、来自计算机科学、人工智能、电子信息、信号处理等相关专业的博士/硕士同学,具备扎实的机器学习理论基础,有多模态方向研究经验者优先。 2、精通 PyTorch 框架与 Python 编程;深度掌握 Transformer 架构及主流图像和音视频表征模型(如 CLIP,SigLIP,Perception Encoder,RAE,AutoEncoder、VAE等) 原理;熟悉图像和音视频自监督算法及 DeepSpeed/Megatron 分布式训练工具。 3、具备较强的问题分解与独立研究能力;能在模糊问题定义上给出清晰的拆解思路和方法。

官方来源与核验

腾讯官方招聘 · 职位编号 1277774706287944722

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。