← 发现更多职位
腾讯
校园招聘 · 青云计划-实习生

游戏AI-语境感知与多模态指令可控语音生成研究

面议
深圳总部 · 经验要求见详情
青云课题青云计划-实习生TEG

关于这个机会

【课题背景】 近年来,语音大模型显著提升了合成语音的流畅度,但传统的文本驱动模式已进入瓶颈期:模型虽能“说准”,却不“懂说”,缺少“活人感”。尤其是在游戏、数字人等真实场景中,语音输出需要根据环境状态(如游戏盘面、战况、氛围)、历史对话上下文、以及用户的细粒度指令(如“带点轻蔑的笑意”)进行动态调整。本课题旨在突破单一文本驱动的局限,探索语音大模型与多模态环境的深度融合,实现从“机械复读”向“情境共鸣”的质变。 【课题挑战】 1. 多模态语义解耦与对齐:如何在海量无序数据中,解耦音色、情感、语调与内容,实现多模态信息(环境状态、历史文本)与声学特性的精准对齐。 2. 情境建模:在长对话或实时交互场景下,如何设计高效的上下文窗口,使模型具备“记忆力”,保持音色一致性的同时实现情绪的自然起伏。 3. 复杂指令的精准遵循:针对“稍微快一点,带点期待感”这种模糊且复杂的自然语言指令,如何构建高效的 Instruct-TTS 架构,提升指令遵循率。 4. 基于强化学习的“活人感”对齐: 探索将 DPO/GRPO 等强化学习算法应用于语音领域,设计针对“拟人度”和“表现力”的 Reward Model。 【具体工作】 参与语音大模型的架构设计与开发,重点负责:多模态感知模块的搭建、复杂指令数据集的自动化合成、基于 RL 的模型后训练(Post-training)优化,以及探索语音模型在复杂交互场景(如 MOBA 游戏解说、拟人化 AI 助手)中的落地表现。

任职要求

1.来自计算机、人工智能、模式识别、通信工程、应用数学等相关专业的博士或优秀硕士 2.熟悉 LLM/LSM (Large Speech Model) 相关架构(如 VALLE, Qwen3-TTS等),对自回归生成模型有深厚理解。 3.在 Speech (TTS/ASR)、NLP 或 Reinforcement Learning 领域有实战经验,了解 DPO/PPO/GRPO 等算法原理。 4.在 NeurIPS、ICLR、ACL、ICASSP、InterSpeech 等顶会有论文发表,或在知名开源项目、算法竞赛中取得顶尖成绩者优先。 5.具备极强的底层思考能力和技术好奇心,不满足于指标的微调,致力于追求极致的“声音灵魂”与交互体验。

官方来源与核验

腾讯官方招聘 · 职位编号 1231829074687944791

最近核验:2026-09-16T14:46:00.874288+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。