arXiv'24 | Seed-ASR:字节跳动把 ASR 做成了'给 LLM 喂音频',上下文感知才是杀手锏
arXiv’24 | Seed-ASR:字节跳动把 ASR 做成了”给 LLM 喂音频”,上下文感知才是杀手锏
原文:Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
1. 前言
大厂 ASR 技术报告系列第三篇,聊聊字节跳动 2024 年 7 月的 Seed-ASR。虽然按时间它是这个系列里最早的,但它某种意义上是后面所有工作的”参照系”——FireRedASR 拿它当 SOTA 对标,Qwen3-ASR、StepAudio 2.5 的框架设计里都能看到它的影子。
先交代下背景:2024 年中,端到端 ASR(transducer、AED)已经在数据充足的场景里摸到瓶颈——继续堆数据,收益越来越薄。而豆包/抖音的业务场景恰恰是端到端模型最难受的:多域(短视频、直播、会议)、多方言口音、大量专有名词,还有一个端到端模型根本无从下手的需求——结合上下文转写(比如聊天历史里出现过的人名,转写时要能认出来)。
Seed-ASR 的回答是一个很纯粹的判断:这些问题本质上都是语言理解问题,那就交给 LLM。整篇报告就是把”怎么把一个十亿级 MoE LLM 改造成 ASR 引擎”讲清楚。
2. AcLLM 框架:ASR 变成条件生成

框架叫 AcLLM(Audio Conditioned LLM),如上图,输入序列的组织是:
instruction + contexts (可选) + speech representations → transcript
有上下文时 instruction 是 “There are relevant contexts, transcribe the speech into text:”,没有就是普通的 “Transcribe the speech into text:”。ASR 彻底变成了一个 prompt 里带音频的条件生成任务。
三个组件:
- Audio Encoder:LUISE,约 2B 参数的 Conformer,自监督预训练(下一节展开)
- Converter:frame splicing,4 帧拼 1 帧再线性投影,把 40ms/帧压到 160ms/帧——注意这个数字,比 FireRedASR 的 80ms 还要激进一倍,LLM 侧的序列长度被压得很短
- LLM:超过 10B 参数的 MoE LLM(豆包系底座),SFT 阶段完全冻结
冻结 LLM 这个选择和 FireRedASR 的 LoRA 略有不同,但哲学一致:语音侧模块负责对齐,LLM 的语义知识不能动。Seed-ASR 更极端,LLM 一个参数都不训,全靠 encoder + converter 把语音”翻译”到 LLM 能懂的表示空间。
3. LUISE:800 万小时喂出来的声学底座

LUISE 的训练是 BERT 式的 masked prediction(BEST-RQ 一脉):
- mel-filterbank 特征过 tokenizer 得到离散标签
- mask 掉一部分输入,让 encoder 预测被 mask 位置的标签
- tokenizer 用迭代固定的方式训练:第一轮随机投影初始化,第二轮用 K-means 重新聚出 codebook
数据规模是这篇报告的震撼点:中文版 SSL 用了 770 万小时普通话+方言语音,多语言版用了 1240 万小时。什么概念——FireRedASR 全部训练数据(70K 小时)只有它的 1%。
还有个很实用的 probing 实验:他们逐层探测 LUISE 的语义表征质量,发现 32 层里第 25 层的语义相关性最好——不是最后一层。做过 SSL encoder 下游任务的同学应该都有体感:最后几层过度特化于预训练目标,中间偏后的层才是语义甜点区。这种细节愿意写进报告里,说明确实是踩过坑的。
4. 训练流程:SFT → Context SFT → RL

Stage 1,SFT:562K 小时(中文版)语音-文本对,训 encoder + converter,冻 LLM。建立语音到文本的映射。
Stage 2,Context SFT:混入 context-speech-text 三元组,context 是用内部 LLM 生成的自然语言上下文(对话历史、会议参与者、视频剪辑历史等)。这一步教会模型”什么时候该看上下文”。
Stage 3,RL:几千小时高质量数据,用 MWER(minimum word error rate)作为 reward 直接优化错误率,还加了一个变体 weighted WER——关键词(人名、专名)的错误加更高权重。消融很清晰:Context SFT 后 multidomain WER 2.02% → RL (WER reward) 1.98% → RL (WWER reward) 1.94%。
RL 这步值得多说一句:ASR 的训练目标(cross-entropy)和评估目标(WER)天然错位,MWER 训练就是直接把 N-best 假设的错误率当 loss(和 CE 插值)。这是传统 ASR 里的老技术,但放到 LLM-based ASR 里配合”关键词加权”,就成了对齐业务指标的 RLHF——reward 不一定要来自人类偏好,业务指标本身就是最好的 reward。
5. 上下文感知:这才是业务真正要的东西
看一个论文里的例子:

用户对话里出现了生僻短语 “the seething sea ceaseth…“,无上下文转写把 “ceaseth” 听成 “seethed”、”sufficeth us” 听成 “surfaced out”——声学上完全合理,但语义上驴唇不对马嘴。带上下文后全部转对。
量化结果:对话上下文测试集上,关键词召回从端到端模型的 72.77% 提升到 80.63%。
为了防止上下文”带偏”模型(context 里的词强行出现在转写里,即幻觉),他们还设计了 joint beam search 解码策略来平衡。这一点非常工业——学术论文往往只报”加了 context 提升多少”,工业系统必须处理”context 是噪声时会不会变差”。
6. 实验结果:全面碾压式的数字

挑关键的说:
- 中文多域测试集:CER 1.94%,比 Paraformer-large(5.23%)相对低 47%+
- 6 个中文公开集平均:2.98%,比 Paraformer-large(4.07%)低 24-40%,AISHELL-1 0.68%、WenetSpeech testnet 4.66%
- 13 种方言平均 WER 19.09%(Whisper Medium-v2 是 21.68%),11 种口音 4.96% vs 端到端基线的 13.74%
- 英文多域 WER 5.34%,比 Whisper Large-v3(10.41%)低 42%,也比 AssemblyAI 的 Universal-1(9.95%)低不少
- 7 语言多域 12.16% vs Whisper Large-v3 的 20.55%
- 长音频:5 分钟长音频不分段直接转,比切段转写相对好 8.8%——LLM 的长上下文能力白送的福利
另外报告给了一组 scaling law 实验(75M → 5B 的 encoder),预训练 loss 和模型规模近似线性相关,下游 WER 也随之近似线性下降。这为”往大了堆”提供了依据——虽然现在回头看,FireRedASR 用 1.1B 打赢它,说明 scaling 不是唯一变量(数据质量、任务聚焦同样重要)。
7. 我的 take
-
Seed-ASR 最大的贡献是范式宣言:ASR 从”声学建模问题”重构为”给 LLM 喂音频的条件生成问题”。上下文感知、长音频、多任务 instruction——这些能力不是模块化地”加”上去的,而是 LLM 框架天然携带的。2024 年之后各家报告清一色 Encoder-Adapter-LLM,源头就在这。
-
它也是”大力出奇迹”路线的代表:770 万小时 SSL + 10B+ MoE LLM + 56 万小时 SFT,全链路闭源。对比后来 FireRedASR 用 1% 的数据在公开集上反超,两条路线的分歧很值得玩味——benchmark 上的差距可以靠数据质量抹平,但方言、口音、上下文感知这些长尾能力,恐怕还是得靠规模喂出来(FireRedASR 也确实没在这些维度上和 Seed-ASR 正面交锋)。
-
MWER-as-reward 是被低估的设计。相比通用 RLHF 需要训 reward model,ASR 的 reward 是可计算的(WER),加权版本还能直接对齐业务优先级(人名错了比”的地得”错了严重得多)。这个思路对一切”输出可自动评分”的任务都适用。
-
报告完全没提推理成本——10B+ MoE 挂一个 2B encoder,RTF 是多少、怎么部署到豆包这种亿级 DAU 的产品上,一个字没有。这大概就是闭源报告的默契:能力秀肌肉,成本是商业机密。后来 2026 年的报告(Qwen3-ASR、StepAudio 2.5)把 RTF 卷成主表指标,算是把这块补上了。
系列下一篇写 Qwen3-ASR,1.7B 小模型对线 10B+ 大模型的故事。最后会有一篇横向对比总结,欢迎关注。
题外话:Seed-ASR 的 probing 实验(第 25 层语义最优)和 scaling 实验(75M→5B 五个规格)本质上都是在回答”给定任务,什么样的架构/规模配置最优”——这正是 AutoML 关心的问题,只是这里用人工网格代替了自动搜索。我们把这套方法论写成了一本书《动手学 AutoML:从 NAS 到大语言模型优化实战》,架构评估那章讲的免训练评估、权重共享技术,就是想把这类实验的成本降下来。感兴趣的朋友可以看看。
