大厂 ASR 技术报告横评:从 Seed-ASR 到 StepAudio 2.5,两年时间行业共识是怎么形成的
大厂 ASR 技术报告横评:从 Seed-ASR 到 StepAudio 2.5,两年时间行业共识是怎么形成的
本文是大厂 ASR 技术报告解读系列的收官篇。前七篇解读: Seed-ASR(字节)、SenseVoice(阿里通义)、FireRedASR(小红书)、Kimi-Audio(月之暗面)、MiMo-Audio(小米)、Qwen3-ASR(阿里 Qwen)、StepAudio 2.5(阶跃星辰)
1. 前言
过去几周我把 2024 年中到 2026 年中各大厂发布的 ASR / 音频大模型技术报告系统读了一遍,每篇写了单独的解读。这篇收官文把七份报告放到一条时间线上,回答三个问题:
- 各家的技术路线到底差在哪?
- 两年里行业共识是怎么一步步形成的?
- 下一步会卷什么?
先交代一个调研中的发现:百度、腾讯、讯飞这三家传统语音强厂,在这个时间窗口内没有发布过对标级别的 ASR 技术报告。百度上一份重量级报告还是 Deep Speech(2014/2015),腾讯只有零散的单点论文(语音 tokenizer 等),讯飞的技术基本以产品和比赛系统形式存在。这本身就是个信号:这一轮 ASR 军备竞赛的主角,是 LLM 时代的新玩家(字节、阶跃、月之暗面、小米)和转型成功的老玩家(阿里),而不是上一代语音巨头。
2. 时间线全景

七份报告按时间排开,能清晰看到三波浪潮:
- 2024.07:路线分岔点。同一个月,字节 Seed-ASR 宣告”ASR 归入 LLM”,阿里 SenseVoice 坚持”NAR 小模型 + 系统级组合”。两条路线的对峙贯穿了后面两年。
- 2025:数据与底座之年。FireRedASR 用数据质量掀翻参数量神话;Kimi-Audio、MiMo-Audio 把战场从 ASR 抬到通用音频底座,数据规模从百万小时卷到一亿小时。
- 2026:效率收敛之年。Qwen3-ASR 和 StepAudio 2.5 殊途同归——底座统一、模型瘦身、把 RTF/TTFT/并发吞吐写进主表。精度竞赛基本结束,成本竞赛开始。
3. 逐维度对比
3.1 架构路线:Encoder-Adapter-LLM 的胜利与例外
| 系统 | 路线 | 声学侧 | 语言侧 | 参数量 |
|---|---|---|---|---|
| Seed-ASR | LLM-based | LUISE 2B (Conformer, SSL) | 10B+ MoE(冻结) | ~12B+ |
| SenseVoice-S | NAR | SAN-M encoder + CTC | 无 | 234M |
| FireRedASR-AED | AED | Conformer 16L | Transformer decoder 16L | 1.1B |
| FireRedASR-LLM | LLM-based | AED encoder 复用 710M | Qwen2-7B + LoRA | 8.3B |
| Kimi-Audio | 通用底座 | Whisper 特征 + GLM-4-Voice tokenizer | Qwen2.5-7B 改双头 | ~9B |
| MiMo-Audio | 通用底座 | 自研 1.2B RVQ tokenizer + patch | MiMo-7B | ~9B |
| Qwen3-ASR | LLM-based | AuT 180M/300M | Qwen3 0.6B/1.7B | 0.8B/2B |
| StepAudio 2.5 | 底座+模式分化 | 冻结 encoder + adaptor | MoE LLM + MTP | 未披露 |
几个结论:
Encoder-Adapter-LLM 成了绝对主流,但内部分化出了两个关键参数的共识:
-
LLM 侧音频帧率收敛到 6.25-12.5Hz。Seed-ASR 160ms/帧(6.25Hz)、FireRedASR 80ms(12.5Hz)、Qwen3-ASR 和 Kimi-Audio 12.5Hz、MiMo-Audio patch 后 6.25Hz。两年里各家独立摸索,最后都落在这个区间——这基本就是”语义不丢、序列最短”的物理甜点区,后来者可以直接抄。
-
“冻结 LLM / LoRA”是训练配方的共识:语音侧模块负责把声学翻译到 LLM 语义空间,LLM 的文本能力碰都不要碰。Seed-ASR 全冻结、FireRedASR 用 LoRA、通用底座们用文本任务高权重(Kimi 1:7、MiMo 权重 100)保底,手段不同,恐惧相同——多模态训练毁掉语言能力,是所有人都踩过或怕踩的坑。
例外者 SenseVoice 活得很好。NAR + CTC 的 234M 模型,10 秒音频 70ms,今天仍是”海量短音频、成本敏感”场景的默认选择。它证明了行业不是单线程进化——LLM 化解决的是难场景(口语、方言、上下文),不是所有场景。
3.2 数据:三种哲学
| 系统 | 规模 | 哲学 |
|---|---|---|
| FireRedASR | 7 万小时 | 人工标注,质量至上:”一千小时高质量好过一万小时弱标注” |
| Seed-ASR | 770 万小时 SSL + 56 万 SFT | 自监督规模 + 监督精调 |
| Kimi-Audio | 1300 万小时 | 全自动流水线(BSRNN 增强→diarization→双系统转写),240 张 L20 日产 20 万小时 |
| StepAudio 2.5 | 2.2T token 续训 + 50K 小时长音频伪标签 | 多系统投票(ROVER + 分歧率过滤 ê>0.05) |
| MiMo-Audio | 1 亿小时 | 规模换涌现 |
这是分歧最大的维度,但仔细看是场景决定哲学:
- FireRedASR 只做中文普通话+唱歌,任务面窄,人工标注花得起,公开 benchmark 上 7 万小时打赢 770 万小时;
- Seed/Kimi/MiMo 要的是方言、口音、多语言、副语言的长尾覆盖,这些长尾能力只能靠规模喂出来,人工标不动;
- StepAudio 的多系统投票流水线是中间路线:用已有 ASR 系统的一致性代替人工置信度,把伪标签质量做到可控。
我的判断:benchmark 精度已经证明可以靠数据质量以小博大,但产品端的长尾鲁棒性仍然是规模的领地。两条路线都不会死。
3.3 推理效率:2026 年的主战场
把各家公布的效率数字放一起(注意硬件和口径不完全可比,看量级):
| 系统 | 单并发 RTF | 首包延迟 | 高并发数据 |
|---|---|---|---|
| SenseVoice-S (2024) | 10s 音频 70ms(≈0.007) | 天然低(NAR) | 未公布 |
| Seed-ASR (2024) | 未公布 | 未公布 | 未公布 |
| FireRedASR (2025) | 未公布 | 未公布 | 未公布 |
| Qwen3-ASR-0.6B (2026) | 0.00923 | TTFT 92ms | 128 并发吞吐 2000 秒/秒 |
| StepAudio 2.5 (2026) | 0.0053(H800) | 未公布 | 未公布 |
趋势一目了然:2024-2025 年的报告根本不谈效率,2026 年的报告把效率当主菜。原因很简单——精度差距缩小到 benchmark 上 0.1-0.3 个点之后,商业竞争的变量就只剩下每小时音频的转写成本。
两家的加速武器还不一样,而且都源自文本 LLM 的推理优化工具箱:
- StepAudio 2.5 用 MTP-5(multi-token prediction + 自回归验证),吃的是”ASR 输出被音频锚死、语义分支少、投机接受率高”的红利——第一位置接受率 0.95+,平均一次接受 5 个 token;
- Qwen3-ASR 用系统工程:vLLM + CUDA Graph + bf16 + 动态 attention 窗口,靠小模型 + 成熟 serving 栈拿吞吐。
ASR 推理优化已经和文本 LLM 推理优化完全同源了——speculative decoding、KV cache 管理、continuous batching,一套工具箱通吃。这对做推理系统的同学是好消息:你的技能栈直接迁移。
3.4 能力半径:专才与通才的分界线
七份报告按目标可以切成两个阵营:
专用 ASR(Seed-ASR、FireRedASR、Qwen3-ASR、StepAudio-ASR 模式):目标是转写这一件事的极致——WER、RTF、方言、热词。
通用音频底座(Kimi-Audio、MiMo-Audio,以及作为系统的 StepAudio 2.5):ASR 只是能力之一,目标是理解+生成+对话的统一。
数据不会说谎,把 AISHELL-1 和 LibriSpeech test-clean 拉出来看:
| AISHELL-1 CER | LibriSpeech clean WER | |
|---|---|---|
| 专用:FireRedASR-AED | 0.55 | — |
| 专用:StepAudio 2.5 ASR | 0.71 | 1.27(long)/1.38 |
| 通用:Kimi-Audio | 0.60 | 1.28 |
| 通用:MiMo-Audio | 1.65 | 3.50 |
| 专用:Qwen3-ASR-1.7B | 1.49* | 1.63 |
(*Qwen3-ASR 的对比表来自 StepAudio 2.5 报告)
Kimi-Audio 证明通用模型的 ASR 可以摸到专用第一梯队;MiMo-Audio 证明如果主攻方向是通用智能(它的 MMAU 74.9、模态差距 3.4 分是全场最佳),ASR 会付出 1-2 倍错误率的代价。“什么都要”在音频领域目前仍然做不到,你必须选。
有意思的是 StepAudio 2.5 给出的第三种答案:底座通用,模式特化——同一个底座上用不同的后训练和解码策略分化出 ASR/TTS/Realtime 三个”人格”,每个单项都打专用系统。如果这条路线被验证可持续,专才/通才的二分法就过时了。
3.5 商业策略:开源成了中国厂商的集体选择
七份报告里,只有 Seed-ASR 完全闭源。FireRedASR、SenseVoice、Kimi-Audio、MiMo-Audio、Qwen3-ASR 全部开源(Qwen3-ASR 直接 Apache 2.0),StepAudio 2.5 部分开源。
对照 Qwen3-ASR 报告里的数字:GPT-4o-Transcribe 在 WenetSpeech 上 15.30/32.27,Qwen3-ASR-1.7B 是 4.97/5.88——国际闭源 API 在中文场景差 3-6 倍,而中文最强的模型是免费的。中文 ASR API 这个市场基本被开源模型定价归零了,商业空间被挤压到私有化部署、定制热词、行业合规这些服务层。字节的闭源策略能撑多久,取决于豆包生态的内部消化能力。
4. 两年共识清单
把七份报告沉淀下来的行业共识列一遍,2026 年入场做 ASR 的团队可以直接拿走:
- 架构:Encoder-Adapter-LLM,encoder 用 Conformer/Transformer 系 + 大规模(伪标签或 SSL)预训练,adapter 做帧率压缩,LLM 冻结或 LoRA
- 帧率:LLM 侧 6.25-12.5Hz
- 数据:伪标签流水线(多系统投票 + 一致性过滤)是规模化正解,人工标注留给核心域
- 训练:SFT → context/功能 SFT → RL(reward 直接用 WER/加权 WER,不需要 reward model)
- 推理:vLLM 系 serving + speculative decoding/MTP,ASR 的投机接受率天然高于自由文本
- 评测:WER 之外必须报 RTF/TTFT/并发吞吐,通用模型加报模态差距
- 产品:热词/上下文注入是工业刚需,时间戳对齐用 NAR 小模型单独解决更香
5. 下一步卷什么?我的四个判断
-
成本战争进入深水区。单并发 RTF 已经卷到 0.005 量级,下一个战场是高并发下的单卡吞吐和 MTP/speculative 在 batch 场景的收益保持——StepAudio 2.5 没公布并发数据不是忘了,是这块还没做好。
-
流式与离线的界限会彻底消失。Qwen3-ASR 的动态 attention 窗口、Uni-ASR 的统一训练范式都在指向同一个终点:一个模型、一份权重,延迟-精度按需调节。维护两套模型的时代结束了。
-
富转写(rich transcription)会成为标配。SenseVoice 的情感/事件标签、Qwen3-ForcedAligner 的时间戳、Seed-ASR 的上下文感知——转写的定义正在从”文字”扩展到”文字+时间+说话人+情绪+场景”。纯 WER 的竞争叙事已经讲完了。
-
通用底座的 ASR 会继续逼近专用系统。Kimi-Audio 已经摸到第一梯队,StepAudio 2.5 的”模式分化”给出了工程路径。两三年内,”专门训一个 ASR 模型”可能会变成”从音频底座上后训练出一个 ASR 模式”——就像今天没人从零训文本分类模型一样。
这个系列到此完结。七篇单篇解读都在博客里,欢迎交叉阅读,也欢迎评论区拍砖——尤其是一线做 ASR 落地的同学,你们对”benchmark 数字 vs 真实场景”的体感比论文更有说服力。
最后扯一句题外话:写完这个系列最大的感受是,ASR 的技术演化正在变成一个”配置搜索”问题——帧率选多少、encoder 多大、LLM 冻不冻、MTP 挂几个头、任务权重怎么配,每家报告本质上都是在这个高维空间里给出自己的采样点。把这类问题做系统化,正是我们在《动手学 AutoML:从 NAS 到大语言模型优化实战》里讨论的主题——从架构搜索到 LLM 压缩,方法论是通的。对这个视角感兴趣的朋友可以翻翻。
