← 发现更多职位
腾讯
校园招聘 · 青云计划-实习生

混元-视频生成 SOTA 开源数据集

面议
深圳总部 · 经验要求见详情
青云课题青云计划-实习生TEG

关于这个机会

课题背景: 当前视频大模型在处理复杂一致性与音视频协同任务时泛化性不足,核心瓶颈在于缺乏高质量、大规模且任务多样化的数据集。现存开源视频数据不仅规模受限,且往往仅聚焦于单/多镜头或视频编辑等单一特征。为弥补工业界与学术界在海量视频数据上的鸿沟,并为未来多模态视频生成的统一建模提供坚实底座,亟需构建一个涵盖全任务维度的超大规模视频数据集。 课题挑战: 1)全场景海量数据构建难度大:打造规模达 50M+ 且涵盖单/多镜头切换、音画同步、时空一致性及精细编辑等多维度的全场景数据集,对底层数据的动态打分、多维清洗及对齐算法提出了极高的工程挑战。 2)统一 Caption 范式设计复杂:针对极其多样的视频形态,需从零构建一套能精准融合并描述视频动态演化、空间一致性、声学特征以及 Meta/ASR 等多模态信息的全能描述范式,实现文本与视频内容的极高质量对齐。 3)Omni 统一建模与极致指标追求:在复杂多任务数据底座上训练全能型生成模型,使其在时空一致性、视频质量(FVD、IS)及跨任务迁移能力上全面超越当前 SOTA 模型,存在巨大的架构调优与模型收敛挑战。 具体工作: 参与 50M+ 超大规模视频数据集(OmniVideo-50M)的构建、清洗与多维打分;设计并实现全场景统一 Caption 范式及多模态对齐;协助训练 Omni 视频生成大模型,跑通评测链路并冲击 SOTA 指标。

任职要求

1.计算机/软件工程等相关专业硕士以上学历,拥有博士学位者优先; 2.熟悉计算机视觉、多模态领域的相关研究工作和算法,以第一作者身份发表顶会论文、顶级研究机构或一线互联网工作经验加分; 3.熟练使用Python、PyTorch和CUDA等语言及工具,具备快速阅读和复现论文的能力; 4.具备优秀的分析和解决问题能力,良好的团队合作精神及沟通意识。

官方来源与核验

腾讯官方招聘 · 职位编号 1231829074687944807

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。