腾讯
社会招聘光子 AI-高级研究员-语音合成与多模态大模型
面议
关于这个机会
1.基于大语言模型(LLM)及多模态/全模态大模型,研究和开发前沿语音合成与生成算法(如 TTS、语音转换、声音/音乐生成等); 2.开发和优化面向线上应用的语音及音频合成系统,提升效果、效率和可扩展性; 3.探索并推进全双工/流式多模态大模型在语音理解、语音生成及实时语音交互方面的能力; 4.与研究和工程团队跨职能协作,推动项目从原型验证到生产落地。
任职要求
1.计算机科学、电子工程、信号处理或相关领域博士学位; 2.具备扎实的语音/音频处理基础,熟悉现代生成模型(如扩散模型、流匹配、自回归模型、基于编解码器的方法等); 3.具有将大语言模型扩展至语音/音频模态的实际经验(如语音分词器、多模态适配器、语音-文本联合训练等);有全双工或流式语音对话系统及实时交互建模经验者优先; 4.熟练使用 Python 及深度学习框架(如 PyTorch);有分布式训练经验者优先; 5.在顶级学术会议发表过论文(如 ICML、NeurIPS、ICLR、ACL、ICASSP、Interspeech 等)。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。