腾讯
校园招聘 · 青云计划-实习生混元基座模型 - 视觉理解大模型研究
面议
关于这个机会
课题背景: 视觉理解能力是大模型感知真实世界和走向物理世界的基础,本青云课题主要探索面向未来的视觉理解技术,包括O3类图像推理方法,视觉Agent能力等。 课题挑战: 目前整个领域的视觉理解能力在全面性和可靠性上还有较大的提升空间,如何进一步提升能力以及展现新的特性仍旧是一个开放性问题。 具体工作: 帮助持续提升混元在视觉理解模型的能力,包括全面性和可靠性,以及探索面向未来的视觉理解技术,包括类O3的推理能力建设,以及视觉Agent能力等。
任职要求
学历和专业要求:计算机科学、机器学习、人工智能、应用数学等相关专业; 技术技能要求: 1.在多模态理解相关领域(包括自然语言处理、计算机视觉、语音理解/生成等)有扎实的研究基础 2.熟悉一个或多个模态领域的主流模型和算法,如CLIP、LLaVA、VALL-E等; 3.熟悉深度学习框架,如TensorFlow或PyTorch;了解分布式训练框架,如DeepSpeed和Megatron-LM等,并有一定的多机多卡分布式训练经验; 4.较强的工程实现能力,熟练掌握C/C++, Java,Python等至少一种语言; 5.有高质量论文发表者优先(如ICLR,NeurIPS,CVPR,ICCV,ECCV,ACL,EMNLP,等); 软性素质要求: 具备极强的学习能力和技术追求,良好的团队合作和沟通能力。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。