← 发现更多职位
字节跳动
校招 · 实习

豆包语音合成大模型算法实习生 - Data语音

面议
Shenzhen(深圳) / Beijing(北京) / Shanghai(上海) / Hangzhou(杭州) · 经验要求见详情
研发算法校招 · 实习A245120日常实习

关于这个机会

团队介绍:Data-语音团队致力于语音、音乐等大模型AIGC技术的研发和产品创新,我们的使命是通过多模态AIGC音频技术赋能内容创作和语音交互,让内容生产、消费与互动变得更加简单、沉浸、多元化。当前团队已有成熟的大模型语音合成、语音理解、音乐生成等多模态音频技术,并持续迭代大模型端到端语音交互方案等,一方面通过中台形式服务于公司众多业务线,例如豆包/Dola、抖音/TikTok、剪映/CapCut、番茄小说、海绵音乐等产品;另一方面,团队已经通过字节跳动旗下的火山引擎开放平台-语音技术和火山方舟平台,向众多企业开放技术成熟稳定的能力和服务。 日常实习:面向全体在校生,为符合岗位要求的同学提供为期3个月及以上的项目实践机会。 1、参与下一代语音合成(TTS)、音频生成大模型(Seed Audio)与语音大模型核心技术的研发,包括但不限于Zero-Shot TTS、声音克隆(Voice Cloning)、跨语种合成及高表现力语音生成; 2、持续优化合成语音的音质、自然度、情感表现力,并针对端/云侧业务需求,进行模型轻量化、稳定性调优与推理加速; 3、参与音频生成技术在字节跳动场景的落地与交付,跟进并解决真实复杂场景下的业务诉求,包括豆包、抖音、剪映、番茄小说等; 4、进行音频生成技术的Model-as-a-Service应用探索,通过火山方舟进行国内和国外重点场景的业务应用能力建设,让语音技术从研究走向应用。

任职要求

1、本科及以上学历在读,计算机、软件工程等相关专业优先; 2、有自然语言处理、语音合成与识别、音乐生成等研究或者技术背景优先; 3、有预训练技术,包括但不限于高效训练、强化学习,参与过研发音频、NLP相关的预训练模型及其下游应用者优先; 4、熟练掌握PyTorch等深度学习框架,Python编程语言; 5、发表过领域顶级会议文章(NeurIPS、ICML、ICLR、ACL、Interspeech、ICASSP等)、相关实习经验或者ACM竞赛获奖者优先。

官方来源与核验

字节跳动官方招聘 · 职位编号 7663054012167129349

官方发布时间:

最近核验:2026-09-16T12:38:26.947923+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。