腾讯
校园招聘 · 青云计划-应届生混元多模态-音频生成理解统一模型研究
面议
关于这个机会
课题背景: 随着音频大模型的发展,研究重点正由单一的音频理解或音频生成任务,逐步拓展至统一建模框架。面向真实应用场景,构建同时支持自由音频理解、音频生成与音频编辑的基础模型,实现感知、表征与生成能力的一体化,已成为音频智能领域的重要研究方向。 课题挑战: 本课题的主要挑战在于,如何设计同时适用于音频理解与音频生成的统一表征形式,包括连续表征或离散 tokenizer 的建模选择与优化;如何构建覆盖音频理解、生成与编辑任务的 interleave 数据,以支撑模型在统一框架下学习多任务协同能力;此外,还需探索适用于该类统一模型的训练与优化方法,尤其是面向复杂生成与编辑目标的强化学习算法设计,以提升模型的可控性、一致性与泛化能力。 具体工作: 参与统一音频表征设计,构建音频理解、生成与编辑 interleave 数据,研究相关后训练与强化学习方法,并完成实验评测与结果分析。
任职要求
学历与专业: 来自计算机科学、人工智能、电子信息、信号处理等相关专业的博士/硕士同学,具备扎实的机器学习理论基础,有多模态方向研究经验者优先。 技能要求:精通 PyTorch 框架与 Python 编程;深度掌握 Transformer 架构及主流 MLLM(如 LLaVA, Qwen-Audio, Qwen-Omni) 原理;熟悉 PPO、GRPO 等强化学习算法及 DeepSpeed/Megatron 分布式训练工具。 软性素质: 具备较强的问题分解与独立研究能力;能在模糊问题定义上给出清晰的拆解思路和方法。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。