腾讯
校园招聘 · 青云计划-实习生混元多模态-视觉编码器技术研究
面议
关于这个机会
课题背景: 视觉编码器作为多模态模型的核心基础组件,直接决定了生成质量与模态融合效率。但当前视觉编码器仍存在诸多局限:难以兼顾细粒度视觉特征提取与模型训练效率,跨模态语义对齐精度不足等。视觉编码器的性能升级的突破,将直接提升混元多模态模型的核心竞争力,相关核心技术亟需深入探索与攻克。 课题挑战:当前多模态大模型视觉编码器的技术研发仍面临诸多亟待突破的难题,具体包括:1)如何设计高效的视觉编码器架构,在保证高频信息保持能力的前提下,同时兼顾生成模型训练效率,实现两者的平衡;2)如何优化视觉编码器的跨模态语义对齐能力,让视觉特征与文本、语音等模态特征实现更精准的映射,提升多模态生成的一致性;3)如何探索适配新一代原生多模态架构的视觉编码器方案,支持视觉理解与生成的统一表征。 具体工作:将参与上述课题的前沿学术研究,并且深度参与混元多模态基模视觉编码器的版本迭代与性能优化,全程参与工业级多模态大模型核心组件从研发、调试到落地应用的完整流程。
任职要求
学历和专业要求:来自计算机、人工智能、自动化、数学等相关专业的优秀博士/硕士。 技术技能要求:熟悉图像/视频等后训练技术与方法,有相关实践经验和相关顶会论文发表;代码能力强,熟练掌握 PyTorch/verl/Megatron;有相关实习经验者优先,有竞赛获奖经历优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。