← 发现更多职位
字节跳动
社招 · 正式

音频大模型算法专家 - 音视频技术

面议
Shenzhen(深圳) · 经验要求见详情
研发算法社招 · 正式A32877A

关于这个机会

团队介绍:视频与边缘部门承载了字节跳动的媒体内容分发基建及技术中台,支持了字节跳动全系产品,如抖音、今日头条、番茄小说、西瓜视频等APP的点播、直播、实时通信、图片等多媒体业务发展,同时将业务发展过程中沉淀下来的技术能力和工具,通过火山引擎对外输出,面向各行各业用户提供视频云产品和服务,愿景是为内外部业务伙伴提供最低成本、最优画质、最低延时、最安全可靠的富媒体内容分发解决方案,助力业务伙伴降本提效实现持续增长。 1、负责流式通用音频大模型的架构设计,推动语音识别(ASR)、说话人日志(SD)、情感分析和音频问答等多任务统一建模,提升语音合成(TTS)、音频生成、音色与韵律等副语言信息建模和音视频协同,打造行业领先的音频理解与生成能力; 2、负责流式音频生成模型与音频编码增强算法研发,探索高质量、低算力的实时音频生成方案,支撑语音合成与音频增强等业务场景落地; 3、设计并落地大规模多模态音频数据Pipeline,覆盖数据采集、跨模态对齐、质量评估与自动标注,构建高质量、可复用的训练数据飞轮; 4、研究音频编码器与大语言模型(LLM)的融合架构,优化跨模态注意力机制与统一特征表示,提升模型的指令遵循、情感表达与复杂音频理解能力; 5、跟踪音频大模型与多模态前沿技术,结合业务场景开展后训练(SFT/RLHF/DPO等)与领域适配,推动技术成果在产品中快速落地并形成业务价值。

任职要求

1、计算机科学、电子工程、信号处理、人工智能、声学等相关专业博士学位; 2、扎实的机器学习与深度学习理论基础,精通传统音频信号处理,并能与深度学习方法深度结合; 3、熟练掌握PyTorch/TensorFlow等深度学习框架,具备丰富的音频表征模型(自监督/半监督/有监督)设计、预训练与微调经验; 4、扎实的编程能力,熟练使用Python/C++,能够独立完成算法原型开发、实验验证与工程化落地; 5、优秀的问题分析与解决能力,对技术有追求,具备良好的沟通协作与跨团队技术推动力。 加分项: 1、有(万小时级以上)音频数据集构建、清洗与自动标注的实战经验; 2、熟悉模型压缩、量化、蒸馏与部署优化,有服务端或端侧(手机/IoT设备)音频模型落地经验; 3、在ICML、NeurIPS、ICASSP、Interspeech等顶会或核心期刊发表过音频大模型相关论文或参加相关比赛并获得TOP名次; 4、具备声学工程、心理声学背景,能够结合听觉感知原理优化模型设计; 5、有语音合成(TTS)、语音增强、音频编码等生成类模型的研发经验。

官方来源与核验

字节跳动官方招聘 · 职位编号 7639627455731435829

官方发布时间:

最近核验:2026-09-16T12:33:12.416632+00:00

查看官方职位详情 ↗

内推申请说明

本站为独立内推协助平台。申请会交由管理员核实岗位与内推渠道,不等于已在公司官网投递;薪资、岗位状态和实际招聘流程以官方信息为准。