腾讯会议—语音理解大模型方向研究
关于这个机会
课题背景: 会议内容理解是一项艰巨的课题,难点主要在于超长音频,超长上下文,多说话人,多距离,多语种,多方言,多轮,连续语流,还需要利用会议中出现的各类视觉,文本多模态信息,辅助音频理解达到理想的效果。 课题挑战: 会议是一个连续,长时音频输入,又涉及多人对话,远场场景,还有文档分享这些外部输入源。本研究旨在研发超长音频,超长上下文,多说话人,连续语流场景下,全面理解会议内容的大模型方案;更好的识别会议内容(semantic info)和富信息(paralinguistic info)。与此同时,如何更好的利用会议进行时的实时in context learning:充分利用会议的会前文档,会中屏幕文档共享,会议历史信息,提升模型的输出质量,最后,研发会议reward model,通过和参会用户不断的交互,建立价值体系,在交互中不断提升模型的能力。 具体工作: 本职位承接腾讯会议实时字幕,会后流式和离线纪要,上传文件,录音笔,实时和离线多语种语音内容理解等工作。在当前已有模型下,需要进一步提升内容识别和理解质量,这里就需要针对会议的特点,从长度和内容的丰富度上,研发超长音频,超长上下文,多说话人,多语种,多方言,多轮,连续语流场景下,全面理解会议内容的大模型方案;同时,从可利用的信息上,充分利用会中会外各类多媒体信息,通过和用户不断的交互,提升会议场景内容理解的质量。
任职要求
1、具有语音识别、说话人识别等方向的研究经验; 2、具备一定的LLM理论基础和调优实践经验; 3、熟悉端到端语音大模型的训练和调优技术; 4、在Interspeech、ICASSP等会议中投稿者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。