腾讯
校园招聘 · 青云计划-实习生腾讯云—音视频语音识别大模型研究
面议
关于这个机会
课题背景: 针对ASR在复杂场景(多轮对话、噪声、口音)的识别瓶颈及传统模型迭代慢、响应滞后问题,利用LLM的上下文推理与热词感知能力,构建可敏捷适应线上变化、快速修复识别缺陷的新一代架构。 课题挑战: 1、实时响应滞后:传统模型无法即时吸收新热词、适应主题切换,线上问题修复不及时。 2、语境歧义难解:缺乏长上下文参考,易混淆同音词或在噪声中丢失关键语义。 3、LLM流式效果不佳:低延迟流式场景下,音频特征与LLM动态文本特征的维度高效对齐困难,影响实时识别效果。 具体工作: 1、构建动态上下文修复机制:研发LLM推理模块捕捉对话主题演变,设计动态提示工程注入实时主题与热词,修正语境缺失错误。 2、开发热词自适应与在线纠偏方案:建立热词库与解码器毫秒级联动,生成候选修正列表,实现无需全量重训的热修复能力。 3、实现跨模态特征高效对齐:研究音文特征维度映射算法,验证最优融合架构,平衡开销与效果,保障复杂场景高准确率。
任职要求
1、计算机、人工智能、数学等相关专业的全日制研究生及以上学历; 2、熟悉ASR语音识别、LLM模型项目; 3、具备 Python/C++ 的算法实现能力,有深度学习框架 PyTorch/TensorFlow 经验。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。