腾讯
校园招聘 · 青云计划-应届生光子AI-Omni 模态实时可控游戏视频生成研究
面议
关于这个机会
本课题面向下一代实时 Omni 生成基础模型,研究文本、图像、视频、语音、音效及交互控制信号的统一理解与生成。重点探索高效多模态表征、长时序建模、跨模态语义对齐、音画同步、大规模预训练及 Scaling Law,突破长视频生成中的内容一致性、状态记忆和连续演化等关键问题;同时研究流式生成、并行解码、KV Cache 优化和轻量化推理等技术,降低首帧延迟与持续生成时延,实现对轨迹、相机、姿态、语音等控制信号的实时响应,并保证交互过程中音画同步、帧间连贯与状态一致,为游戏、数字人、智能内容创作等实时交互场景提供技术基础。
任职要求
1. 人工智能、计算机视觉或多模态相关方向博士,有顶会一作论文; 2. 精通扩散模型、自回归模型及多模态生成模型的原理与工程实现; 3. 有图像、视频或音频生成模型从零训练经验,精通 PyTorch 及大规模分布式训练; 4. 深度理解 Video VAE、视觉 Tokenizer、Audio Codec、跨模态对齐与音画同步技术; 5. 熟悉流式推理、KV Cache、模型压缩、并行解码或推理加速中的一项或多项技术; 6. 有可控视频生成、实时交互生成、3D注入或Omni 模型或多模态预训练项目经验者优先; 7. 主导过端到端生成基础模型,或具备训练、推理、系统联合优化经验者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。