光子AI-Omni 模态实时可控游戏视频生成训练及推理infra研究
关于这个机会
本课题面向下一代实时 Omni 生成基础模型,研究 Diffusion、自回归等生成模型的高效推理、部署与系统优化。重点探索模型量化、蒸馏、剪枝、计算图优化、高性能算子及并行采样等关键技术,持续降低视频、语音和音效生成的首帧延迟、持续生成时延与显存开销;同时面向消费级 GPU、端侧设备及云端高并发场景,构建覆盖请求调度、显存复用、流式生成、硬件编解码、音画同步和实时传输的端到端推理管线,推动模型与推理系统协同设计,为游戏、数字人、智能内容创作等实时交互应用提供低成本、可扩展的部署基础。
任职要求
1. 计算机系统、人工智能、分布式计算或音视频相关方向博士,具备扎实的系统研究与工程能力; 2. 深入理解超大规模生成模型训练系统,精通数据、张量、流水线、序列及专家并行,具备并行策略设计、通信优化、负载均衡和容错恢复经验; 3. 精通生成模型推理架构,能够围绕 Diffusion、Flow Matching、自回归及 Omni 模型设计并行采样、增量计算、缓存复用和流式生成方案; 4. 熟悉 PyTorch、Megatron-LM、DeepSpeed、FSDP 等训练系统,以及 TensorRT、ONNX Runtime 等推理引擎,具备框架源码级开发与性能优化能力; 5. 精通 C++、CUDA 或 Triton,深入理解 GPU 体系结构、显存层级、计算通信重叠及算子融合,具备高性能算子和分布式通信内核开发能力; 6. 熟悉量化、蒸馏、稀疏化、模型编译及软硬件协同优化,具备从模型结构、计算图、算子到运行时的全栈性能分析与优化能力; 7. 深入理解实时音视频系统,熟悉硬件编解码、音画同步及 WebRTC、SRT、QUIC 等传输技术,具备端到端毫秒级交互链路设计经验者优先; 8. 主导过大规模训练平台、生成模型推理引擎或实时交互系统建设,或在NeurIPS、ICML等会议发表过分布式训练、推理系统、CUDA 算子优化或大模型/扩散模型加速相关论文者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。