游戏实时多模态交互系统研究
关于这个机会
近年来,深度学习技术的持续演进,尤其是大语言模型(LLM)的快速发展,推动语音处理领域取得了一系列关键突破。实时语音增强技术已显著提升,但在手机游戏等复杂声学环境(多源干扰、强非平稳噪声、回声与混响叠加、设备与链路差异显著)下,仍面临诸多工程与算法挑战。同时,自动语音识别(ASR)与语音合成(TTS)能力也在近年实现跨越式进展,其中合成语音在自然度、可懂度与表现力方面的提升尤为突出。 更为重要的是,LLM与视觉理解、实时语音处理等能力的深度融合,正在重塑语音交互范式:系统不仅能够理解文本语义,还可在语音与视觉输入的共同约束下实现实时感知、推理与自然对话,从而支撑更高质量的多模态交互体验。在此背景下,游戏场景中的多模态交互需求持续扩展、新玩法不断涌现,这既对视觉处理与语音增强等底层能力提出更高标准,也为多模态交互技术在游戏中的落地应用打开了更广阔的空间。 我们诚邀具备图像与视觉处理、语音信号处理、语音增强、语音识别、语音合成或大模型相关研究与工程背景,并具备扎实科研素养与落地实践能力的候选人加入团队,共同探索面向游戏场景的语音大模型及覆盖全链路的语音增强、识别与合成关键技术。
任职要求
1、学历专业:博士研究生或优秀硕士研究生,人工智能、计算机科学与技术等相关专业,,具有较强的深度学习相关背景技能和学习功底; 2、有图像与视觉处理/自然语言处理/语音信号处理/语音合成/语音识别等相关背景知识;有相关项目落地经验的优先; 3、有预训练技术,包括但不限于高效训练、强化学习,参与过研发音频、NLP相关的预训练模型及其下游应用者优先; 4、熟练掌握PyTorch等深度学习框架,Python编程语言; 5、发表过领域顶级会议文章(NeurIPS、ICML、ICLR、ACL、Interspeech、ICASSP等)、相关实习经验或者ACM竞赛获奖者优先。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。