← 发现更多职位
腾讯
校园招聘 · 青云计划-应届生

混元多模态-语音生成大模型研究

面议
深圳总部 · 经验要求见详情
青云课题青云计划-应届生TEG

关于这个机会

课题背景: 当前主流的语音合成(TTS)技术已在语音播报场景中取得了极高的清晰度与自然度。然而,随着大语言模型和智能体的爆发,人机交互正在向深度对话、情感陪伴和复杂任务执行演进。传统的TTS模型由于缺乏对对话上下文的理解,且无法灵活响应外部控制指令,生成的语音往往显得机械、脱离语境,成为了制约拟真自然交互的瓶颈。 为了突破这一局限,构建具备“指令遵循(Instruction-following)”与“上下文感知(Context-awareness)”能力的下一代TTS模型已成为语音生成领域的核心趋势。该模型不仅能“读出”文字,更能“理解”文字背后的语境与用户输入的自然语言指令,从而动态调整发音人的情感、语速、重音甚至副语言现象(如笑声、叹气)。该模型将极大提升各场景的交互体验,是推动语音交互从“工具属性”向“类人属性”跨越的关键一步。 课题挑战: 1. 复杂指令的理解与精准控制: 如何让模型理解开放式的自然语言指令(如“用一种神秘且略带沙哑的声音低语”),并将其精准映射到声学特征上?这要求模型在音色、情感、语速、韵律等多个维度上实现精细控制。 2. 多模态上下文的联合建模: 在多轮对话中,当前的回复语气高度依赖于历史文本(Text Context)和历史语音(Audio Context)。如何设计高效的模型架构,使其能够同时处理长序列的历史文本与声学特征,保持跨句子、跨轮次语音在音色和情绪上的连贯性与自然过渡,是一个重大挑战。 3. 基于强化学习的语音偏好对齐: 传统的监督微调难以解决语音生成中的“自然度”和“指令贴合度”等主观感受问题。如何构建符合人类偏好的鲁棒的音频奖励模型,并解决强化学习在连续/离散声学表征生成中的训练不稳定性,是当前的技术深水区。 4. 多维交互式评测体系的建立: 传统的客观指标(如WER)和主观指标(如单句MOS)已无法衡量交互式TTS的能力。如何针对“指令遵循准确率”、“上下文情绪一致性”、“对话自然度”等维度,建立一套结合客观声学特征分析、LLM/Audio-LLM自动评估(Auto-Eval)以及多轮对话主观听感的综合评测体系,是验证模型能力的前提。 具体工作: 你将参与到下一代交互式TTS模型的核心研发中,具体包括: 1. 数据工程: 负责复杂指令-语音对的合成与挖掘,以及多轮对话上下文语音数据集的构建与清洗。 2. 模型架构设计: 参与设计支持长上下文输入与Prompt指令注入的自回归/扩散TTS模型框架。 3. 强化学习与对齐: 建设音频偏好数据集,训练多维度的音频奖励模型,并探索不同强化学习策略在语音生成中的应用,优化模型的自然度与指令遵循能力。 4. 评测与迭代: 搭建针对指令控制与上下文感知的自动化评估流水线,通过数据飞轮持续驱动模型能力的迭代升级。

任职要求

基本要求: 1. 计算机科学、电子工程、人工智能、自动化或相关专业的在读硕士或博士生。 2. 扎实的编程基础和动手能力。 3. 对深度学习有深入理解,熟悉主流生成式模型的基本原理和实现。 4. 具备优秀的英文文献阅读和理解能力,能够快速跟进前沿技术并复现算法。 5. 积极主动,有良好的沟通能力和团队协作精神,对解决挑战性问题充满热情。 加分项: 1. 在 NeurIPS、ICML、ICLR、ICASSP、Interspeech等顶级会议或期刊上发表过相关论文者优先。 2. 有语音合成、音乐生成、音效生成、音视频生成等音频生成相关项目经验者优先。 3. 有大规模模型训练或性能优化经验者优先。 4. 在相关领域的学术竞赛中取得优异成绩,或有相关开源项目贡献者优先。 5. 具备扎实的数学基础,包括但不限于线性代数、概率论、最优化方法。

官方来源与核验

腾讯官方招聘 · 职位编号 1277774706287944728

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。