腾讯游戏-语音大模型数据策略产品经理-端到端同传
关于这个机会
1.建设多语种语音大模型(端到端同传、ASR、TTS等)训练数据体系,覆盖中文、英语、阿拉伯语、俄语、土耳其语、泰语、印尼语、越南语等20余个语种。与算法/产品团队协同,评估数据缺口,针对语种特点和模型需求制定数据建设路线与优先级; 2.统筹标注标准和标注资源,定义语音模型高表现力指标,为提升模型在音色多样性、韵律表现、副语言信息、情感表达、表达张力、流式自然度等方面表现提供数据方案;解决多语种在语音同传、翻译场景下的表达习惯、文化适配等问题; 3.建立数据生产规范,搭建智能化数据生产管线,覆盖清洗、预处理、加工、精标、验收等环节,提升中/低资源数据获取效率和质量;主导数据合成、Agent驱动数据生成等智能化数据生产技术的探索和应用,持续生产高质量训练数据,并把控数据合成与采集的合规风险。统筹数据供应商,负责供应商选型、交付标准制定与质量审计; 4.建立主客观结合的数据评价体系,统筹高质量评测集,开展数据质量评估和分析调优。跟踪数据配比与血缘,通过训练效果、离线评测、用户反馈及 Bad Case分析进行模型效果的数据归因,持续优化数据策略、结构与分布; 5.持续关注语音大模型前沿技术发展,沉淀多语种适配经验与数据方法论,形成可复用的标准,持续提升数据生产质量与效率。
任职要求
1.本科及以上学历,语言学、计算语言学、计算机、数据科学、统计学或相关专业; 2.2年及以上数据策略、数据生产或语音大模型数据相关经验; 3.熟悉语音大模型训练数据生产逻辑,掌握数据标注、预处理、质量评估的核心方法,具备搭建多语种数据生产框架的实操能力; 4.清楚 ASR、MT、TTS、S2S 等模块所需的数据形态及其对模型表现的影响,能独立分析模型能力问题并设计对应的数据解决方案; 5.具备优秀的数据审美和鉴赏能力,能系统性评价语音模型表现力,形成方法论和评测体系; 6.熟悉目标语种使用区域表达习惯,对多语种模型优化、语音表现优化有认知,具备解决多语言场景下的表达习惯、文化适配问题的相关能力或落地经验; 7.具备良好的跨团队协作及项目推动能力、结构化思考能力、工程理解力,能高效推进多语种数据生产任务,擅长解决不同语种的差异化协作问题。
内推申请说明
本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。