Token Foundry-多模态生成模型算法专家-万相Wan
关于这个机会
【部门介绍】 随着大模型技术的飞速发展,理解和生成多模态数据(图像、视频、音频、3D素材等)的能力日益增强。目前,构建能够同时进行输入和输出的多模态世界模型已成为业界的研究热点,也是实现通用人工智能(AGI)的重要技术路径之一。 万相Wan将持续在世界模型、原生多模态预训练、理解-生成融合范式、统一Tokenizer研究、人类反馈与强化学习等前沿技术方向上进行探索,始终追求在多模态世界模型领域的领先研究地位,致力于建立世界级的技术影响力。 【工作内容】 1、负责原生多模态模型研究和开发,结合多模态能力(支持文本、图像、语音输入)实现复杂指令生成,包括但不限于文生图、图生图、文档生成、可控编辑等核心方向。 2、负责图像生成模型效果优化,探索扩散模型、自回归模型结构和策略优化等核心技术课题。 3、负责人类反馈与强化学习,聚焦于更加精细的RL算法设计,并基于万相用户反馈的RLHF图像生成质量提升。
任职要求
1. 计算机科学、人工智能、机器学习能等领域的博士/硕士毕业生,具备计算机视觉等领域的扎实理论基础。 2. 掌握机器学习和深度学习基础知识,熟悉常用视觉生成算法,熟悉Pytorch、Tensorflow等至少一种深度学习框架。 3. 具备良好的科研能力,有大规模视觉生成算法相关研究经历和具有影响力科研工作(高引论文、知名开源项目等)者优先,有成果发表在CVPR、ICCV、NeurIPS、ICLR、TPAMI等国际顶级会议、期刊者优先。 4. 对生成方向具有技术热情,具备视觉生成大模型研发经验,有对话系统、多模态生成等落地项目经验者优先。 5. 具备良好的技术洞察力和优秀的业务分析能力,能应对复杂的业务算法需求,能够与工程、产品等多学科团队紧密合作,推动研究成果快速落地并产生实际影响。 6. 关注技术影响力,具有开源开放精神,对基础模型的前沿问题有持续热情,有追求,渴望做出有极大影响力的工作。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。