腾讯
校园招聘 · 青云计划-实习生微信小微-支持多方言的音频生成模型
面议
关于这个机会
课题背景: 微信语音消息、语音播报、数字人交互等场景对自然、拟真且具有地域亲和力的语音生成能力需求不断提升。普通话语音生成已较成熟,但在类似客家话等小语种方言场景中,现有模型常存在发音不准、韵律不自然、风格不稳定等问题,因此需要研发支持多方言的音频生成模型,提升用户体验与表达丰富度。 课题挑战: 多方言语音生成面临发音体系差异大、方言文本表示不统一、训练数据稀缺等问题。部分方言存在多音、多读法和强地域差异,导致模型难以准确学习语音映射关系。同时,真实业务还要求模型兼顾自然度、可懂度、情感表现力和说话人一致性,在长文本、口语化表达及跨方言迁移场景下都保持稳定生成,这对数据、建模和评测都提出了较高要求。 具体工作: 参与多方言语音数据清洗与标注,探索音频生成模型训练与优化方案,提升发音准确性和自然度,并完成评测分析与效果迭代。
任职要求
学历和专业要求: 来自计算机、人工智能、自动化、电子信息、信号处理、数学等相关专业的博士/硕士同学。 技术技能要求: 掌握深度学习、生成模型、序列建模等算法及应用,熟悉Python,了解PyTorch/TensorFlow等训练框架。 软性素质要求: 具备良好的沟通协作与问题分析能力,对音乐、音频或AIGC方向有兴趣,学习能力和执行力强。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。