优图实验室-原生多模态预训练技术研究
关于这个机会
课题背景: 随着多模态大模型发展,它的架构已向原生多模态架构演进,实现不同模态在同一模型架构下的深度融合已成为当前 AI 研究的前沿。原生多模态模型通过统一的架构,直接处理图像、视频、音频及文本等多种模态输入与输出,能够显著降低跨模态信息损耗,提升对复杂多模态场景的推理与生成能力。本课题旨在探索大模型在原生多模态方向的演进策略,目标是构建具备全模态理解与高质量生成能力的基础模型。 课题挑战: 1、统一模态表示设计: 如何设计高效的视觉、音频 Tokenizer,将高维连续信号转化为可与文本 Token 联合建模的特征空间,并保持语义一致性; 2、多模态大规模预训练策略: 针对原生架构,如何设计合理的混合训练策略,平衡不同模态间的训练速度与收敛目标,避免单一模态退化; 3、多尺度与长视频序列建模: 原生模型面临极高的计算复杂度,如何在统一架构下实现对超高分辨率图像及长视频序列的高效建模与长程依赖捕捉; 4、高质量多模态数据合成与清洗: 如何从海量互联网数据中自动化筛选、交织并合成具有逻辑性、高质量的图文视频语料,构建亿级数据集; 5、原生多模态生成一致性: 探索如何在同一套权重下,实现从理解到生成的闭环,并确保生成的视觉内容在空间、时间与语义上与指令高度一致。 具体工作: 你将参与原生多模态基座模型的研发,包括但不限于:多模态算法优化、亿级多模态语料的清洗与工程化、模型架构优化等。
任职要求
1、计算机科学、人工智能、视觉计算、自然语言处理等相关专业的博士; 2、深度理解多模态前沿进展,熟悉 ViT, Diffusion Models, Autoregressive Models 等技术路径,在 CVPR, ICLR, NeurIPS 等顶会有相关研究成果者优先; 3、具备极强的工程能力,精通 PyTorch 框架,熟悉分布式训练技术(如 DeepSpeed, Megatron-LM),有超大规模参数模型训练经验者优先; 4、熟练掌握 Python 编程,熟悉高性能算子开发或底层架构优化(如 CUDA 编程)者更佳; 5、对技术有强烈的好奇心,具备解决底层复杂系统问题的韧性与出色的团队协作能力。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。