腾讯
校园招聘 · 青云计划-应届生腾讯会议-鸡尾酒场景下的多模态说话人分离技术研究
面议
关于这个机会
真实多人对话场景中,多个说话人语音交叠、伴随噪声与混响,形成"鸡尾酒会"效应。本课题围绕该场景,从单麦到多麦、从纯音频到多模态,研究以下方向: 说话人日志:判断"谁在什么时候说话",探索流式/在线方案 语音分离与目标说话人提取:从混合信号中分离各说话人语音流或定向提取目标人语音 多麦克风阵列处理:利用空间信息(波束成形、DOA)增强目标信号,研究多通道与深度模型联合建模 多模态融合:引入视觉线索(唇动、人脸、姿态)辅助说话人日志与语音分离
任职要求
1.有说话人日志、语音分离、说话人验证/识别等相关方向的研究经验 2.在语音领域顶会(ICASSP、Interspeech)期刊发表过论文优先 3.有音视频多模态融合、视听语音处理相关经验优先 4.参加过 CHiME / VoxSRC / DIHARD / MISP 等竞赛优先 5.有自监督模型(WavLM、W2V-BERT、AV-HuBERT)使用经验优先
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。