← 发现更多职位
腾讯
社会招聘

微信-语音全双工对话大模型预训练算法工程师

面议
北京 · 不限
技术WXG微信AI助手中国

关于这个机会

1.负责语音全双工对话大模型的架构设计与预训练,构建边听边说、实时打断、自然接话和连续对话能力; 2.负责音频理解模型预训练,提升语音内容、说话人、情感语气、副语言信息、环境声音及多人重叠语音的理解能力; 3.负责音频生成模型预训练,研究基于 Audio Token、Neural Codec、自回归、Diffusion 或 Flow Matching 的语音生成方案,提升音质、自然度、情感表现和生成稳定性; 4.负责全双工交互行为建模,包括回复时机、用户打断、抢话与让话、Backchannel、重叠语音和流式生成; 5.负责大规模音频预训练数据建设,包括数据清洗、去重、质量过滤、伪标注、Token 化及数据配比; 6.负责模型规模化训练、效果分析及训练稳定性优化,推动预训练模型的后训练、评测和产品落地。

任职要求

1.计算机、人工智能、语音信号处理等相关专业,硕士及以上学历; 2.具备全双工语音对话模型预训练经验,参与过端到端 Speech-to-Speech、Audio LLM、Omni Model 或类似模型研发; 3.具备音频理解模型或音频生成模型预训练经验,能够负责模型架构、数据建设、训练策略和效果分析; 4.熟悉全双工对话核心问题,包括 Turn-taking、End-of-turn Detection、User Interruption、Overlapping Speech、Backchannel 和 Streaming Generation; 5.熟悉 Audio Encoder、Conformer、Transformer、Audio Tokenizer、Neural Codec、自回归、Diffusion 或 Flow Matching 等技术; 6.熟练使用 PyTorch,具备大规模分布式训练经验,熟悉 DeepSpeed、Megatron-LM、FSDP 等训练框架; 7.具备较强的实验设计、问题定位和跨团队协作能力。

官方来源与核验

腾讯官方招聘 · 职位编号 2089544603412901888

最近核验:2026-09-16T14:24:32.302972+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。