大厂 ASR 技术报告横评:从 Seed-ASR 到 StepAudio 2.5,两年时间行业共识是怎么形成的

大厂 ASR 技术报告横评:从 Seed-ASR 到 StepAudio 2.5,两年时间行业共识是怎么形成的

本文是大厂 ASR 技术报告解读系列的收官篇。前七篇解读: Seed-ASR(字节)SenseVoice(阿里通义)FireRedASR(小红书)Kimi-Audio(月之暗面)MiMo-Audio(小米)Qwen3-ASR(阿里 Qwen)StepAudio 2.5(阶跃星辰)


1. 前言

过去几周我把 2024 年中到 2026 年中各大厂发布的 ASR / 音频大模型技术报告系统读了一遍,每篇写了单独的解读。这篇收官文把七份报告放到一条时间线上,回答三个问题:

  1. 各家的技术路线到底差在哪?
  2. 两年里行业共识是怎么一步步形成的?
  3. 下一步会卷什么?

先交代一个调研中的发现:百度、腾讯、讯飞这三家传统语音强厂,在这个时间窗口内没有发布过对标级别的 ASR 技术报告。百度上一份重量级报告还是 Deep Speech(2014/2015),腾讯只有零散的单点论文(语音 tokenizer 等),讯飞的技术基本以产品和比赛系统形式存在。这本身就是个信号:这一轮 ASR 军备竞赛的主角,是 LLM 时代的新玩家(字节、阶跃、月之暗面、小米)和转型成功的老玩家(阿里),而不是上一代语音巨头。

2. 时间线全景

大厂 ASR/音频大模型技术报告时间线

七份报告按时间排开,能清晰看到三波浪潮:

  • 2024.07:路线分岔点。同一个月,字节 Seed-ASR 宣告”ASR 归入 LLM”,阿里 SenseVoice 坚持”NAR 小模型 + 系统级组合”。两条路线的对峙贯穿了后面两年。
  • 2025:数据与底座之年。FireRedASR 用数据质量掀翻参数量神话;Kimi-Audio、MiMo-Audio 把战场从 ASR 抬到通用音频底座,数据规模从百万小时卷到一亿小时。
  • 2026:效率收敛之年。Qwen3-ASR 和 StepAudio 2.5 殊途同归——底座统一、模型瘦身、把 RTF/TTFT/并发吞吐写进主表。精度竞赛基本结束,成本竞赛开始

3. 逐维度对比

3.1 架构路线:Encoder-Adapter-LLM 的胜利与例外

系统 路线 声学侧 语言侧 参数量
Seed-ASR LLM-based LUISE 2B (Conformer, SSL) 10B+ MoE(冻结) ~12B+
SenseVoice-S NAR SAN-M encoder + CTC 234M
FireRedASR-AED AED Conformer 16L Transformer decoder 16L 1.1B
FireRedASR-LLM LLM-based AED encoder 复用 710M Qwen2-7B + LoRA 8.3B
Kimi-Audio 通用底座 Whisper 特征 + GLM-4-Voice tokenizer Qwen2.5-7B 改双头 ~9B
MiMo-Audio 通用底座 自研 1.2B RVQ tokenizer + patch MiMo-7B ~9B
Qwen3-ASR LLM-based AuT 180M/300M Qwen3 0.6B/1.7B 0.8B/2B
StepAudio 2.5 底座+模式分化 冻结 encoder + adaptor MoE LLM + MTP 未披露

几个结论:

Encoder-Adapter-LLM 成了绝对主流,但内部分化出了两个关键参数的共识:

  1. LLM 侧音频帧率收敛到 6.25-12.5Hz。Seed-ASR 160ms/帧(6.25Hz)、FireRedASR 80ms(12.5Hz)、Qwen3-ASR 和 Kimi-Audio 12.5Hz、MiMo-Audio patch 后 6.25Hz。两年里各家独立摸索,最后都落在这个区间——这基本就是”语义不丢、序列最短”的物理甜点区,后来者可以直接抄。

  2. “冻结 LLM / LoRA”是训练配方的共识:语音侧模块负责把声学翻译到 LLM 语义空间,LLM 的文本能力碰都不要碰。Seed-ASR 全冻结、FireRedASR 用 LoRA、通用底座们用文本任务高权重(Kimi 1:7、MiMo 权重 100)保底,手段不同,恐惧相同——多模态训练毁掉语言能力,是所有人都踩过或怕踩的坑

例外者 SenseVoice 活得很好。NAR + CTC 的 234M 模型,10 秒音频 70ms,今天仍是”海量短音频、成本敏感”场景的默认选择。它证明了行业不是单线程进化——LLM 化解决的是难场景(口语、方言、上下文),不是所有场景

3.2 数据:三种哲学

系统 规模 哲学
FireRedASR 7 万小时 人工标注,质量至上:”一千小时高质量好过一万小时弱标注”
Seed-ASR 770 万小时 SSL + 56 万 SFT 自监督规模 + 监督精调
Kimi-Audio 1300 万小时 全自动流水线(BSRNN 增强→diarization→双系统转写),240 张 L20 日产 20 万小时
StepAudio 2.5 2.2T token 续训 + 50K 小时长音频伪标签 多系统投票(ROVER + 分歧率过滤 ê>0.05)
MiMo-Audio 1 亿小时 规模换涌现

这是分歧最大的维度,但仔细看是场景决定哲学

  • FireRedASR 只做中文普通话+唱歌,任务面窄,人工标注花得起,公开 benchmark 上 7 万小时打赢 770 万小时;
  • Seed/Kimi/MiMo 要的是方言、口音、多语言、副语言的长尾覆盖,这些长尾能力只能靠规模喂出来,人工标不动;
  • StepAudio 的多系统投票流水线是中间路线:用已有 ASR 系统的一致性代替人工置信度,把伪标签质量做到可控。

我的判断:benchmark 精度已经证明可以靠数据质量以小博大,但产品端的长尾鲁棒性仍然是规模的领地。两条路线都不会死。

3.3 推理效率:2026 年的主战场

把各家公布的效率数字放一起(注意硬件和口径不完全可比,看量级):

系统 单并发 RTF 首包延迟 高并发数据
SenseVoice-S (2024) 10s 音频 70ms(≈0.007) 天然低(NAR) 未公布
Seed-ASR (2024) 未公布 未公布 未公布
FireRedASR (2025) 未公布 未公布 未公布
Qwen3-ASR-0.6B (2026) 0.00923 TTFT 92ms 128 并发吞吐 2000 秒/秒
StepAudio 2.5 (2026) 0.0053(H800) 未公布 未公布

趋势一目了然:2024-2025 年的报告根本不谈效率,2026 年的报告把效率当主菜。原因很简单——精度差距缩小到 benchmark 上 0.1-0.3 个点之后,商业竞争的变量就只剩下每小时音频的转写成本。

两家的加速武器还不一样,而且都源自文本 LLM 的推理优化工具箱:

  • StepAudio 2.5 用 MTP-5(multi-token prediction + 自回归验证),吃的是”ASR 输出被音频锚死、语义分支少、投机接受率高”的红利——第一位置接受率 0.95+,平均一次接受 5 个 token;
  • Qwen3-ASR 用系统工程:vLLM + CUDA Graph + bf16 + 动态 attention 窗口,靠小模型 + 成熟 serving 栈拿吞吐。

ASR 推理优化已经和文本 LLM 推理优化完全同源了——speculative decoding、KV cache 管理、continuous batching,一套工具箱通吃。这对做推理系统的同学是好消息:你的技能栈直接迁移。

3.4 能力半径:专才与通才的分界线

七份报告按目标可以切成两个阵营:

专用 ASR(Seed-ASR、FireRedASR、Qwen3-ASR、StepAudio-ASR 模式):目标是转写这一件事的极致——WER、RTF、方言、热词。

通用音频底座(Kimi-Audio、MiMo-Audio,以及作为系统的 StepAudio 2.5):ASR 只是能力之一,目标是理解+生成+对话的统一。

数据不会说谎,把 AISHELL-1 和 LibriSpeech test-clean 拉出来看:

  AISHELL-1 CER LibriSpeech clean WER
专用:FireRedASR-AED 0.55
专用:StepAudio 2.5 ASR 0.71 1.27(long)/1.38
通用:Kimi-Audio 0.60 1.28
通用:MiMo-Audio 1.65 3.50
专用:Qwen3-ASR-1.7B 1.49* 1.63

(*Qwen3-ASR 的对比表来自 StepAudio 2.5 报告)

Kimi-Audio 证明通用模型的 ASR 可以摸到专用第一梯队;MiMo-Audio 证明如果主攻方向是通用智能(它的 MMAU 74.9、模态差距 3.4 分是全场最佳),ASR 会付出 1-2 倍错误率的代价。“什么都要”在音频领域目前仍然做不到,你必须选

有意思的是 StepAudio 2.5 给出的第三种答案:底座通用,模式特化——同一个底座上用不同的后训练和解码策略分化出 ASR/TTS/Realtime 三个”人格”,每个单项都打专用系统。如果这条路线被验证可持续,专才/通才的二分法就过时了。

3.5 商业策略:开源成了中国厂商的集体选择

七份报告里,只有 Seed-ASR 完全闭源。FireRedASR、SenseVoice、Kimi-Audio、MiMo-Audio、Qwen3-ASR 全部开源(Qwen3-ASR 直接 Apache 2.0),StepAudio 2.5 部分开源。

对照 Qwen3-ASR 报告里的数字:GPT-4o-Transcribe 在 WenetSpeech 上 15.30/32.27,Qwen3-ASR-1.7B 是 4.97/5.88——国际闭源 API 在中文场景差 3-6 倍,而中文最强的模型是免费的。中文 ASR API 这个市场基本被开源模型定价归零了,商业空间被挤压到私有化部署、定制热词、行业合规这些服务层。字节的闭源策略能撑多久,取决于豆包生态的内部消化能力。

4. 两年共识清单

把七份报告沉淀下来的行业共识列一遍,2026 年入场做 ASR 的团队可以直接拿走:

  1. 架构:Encoder-Adapter-LLM,encoder 用 Conformer/Transformer 系 + 大规模(伪标签或 SSL)预训练,adapter 做帧率压缩,LLM 冻结或 LoRA
  2. 帧率:LLM 侧 6.25-12.5Hz
  3. 数据:伪标签流水线(多系统投票 + 一致性过滤)是规模化正解,人工标注留给核心域
  4. 训练:SFT → context/功能 SFT → RL(reward 直接用 WER/加权 WER,不需要 reward model)
  5. 推理:vLLM 系 serving + speculative decoding/MTP,ASR 的投机接受率天然高于自由文本
  6. 评测:WER 之外必须报 RTF/TTFT/并发吞吐,通用模型加报模态差距
  7. 产品:热词/上下文注入是工业刚需,时间戳对齐用 NAR 小模型单独解决更香

5. 下一步卷什么?我的四个判断

  1. 成本战争进入深水区。单并发 RTF 已经卷到 0.005 量级,下一个战场是高并发下的单卡吞吐和 MTP/speculative 在 batch 场景的收益保持——StepAudio 2.5 没公布并发数据不是忘了,是这块还没做好。

  2. 流式与离线的界限会彻底消失。Qwen3-ASR 的动态 attention 窗口、Uni-ASR 的统一训练范式都在指向同一个终点:一个模型、一份权重,延迟-精度按需调节。维护两套模型的时代结束了。

  3. 富转写(rich transcription)会成为标配。SenseVoice 的情感/事件标签、Qwen3-ForcedAligner 的时间戳、Seed-ASR 的上下文感知——转写的定义正在从”文字”扩展到”文字+时间+说话人+情绪+场景”。纯 WER 的竞争叙事已经讲完了。

  4. 通用底座的 ASR 会继续逼近专用系统。Kimi-Audio 已经摸到第一梯队,StepAudio 2.5 的”模式分化”给出了工程路径。两三年内,”专门训一个 ASR 模型”可能会变成”从音频底座上后训练出一个 ASR 模式”——就像今天没人从零训文本分类模型一样。

这个系列到此完结。七篇单篇解读都在博客里,欢迎交叉阅读,也欢迎评论区拍砖——尤其是一线做 ASR 落地的同学,你们对”benchmark 数字 vs 真实场景”的体感比论文更有说服力。


最后扯一句题外话:写完这个系列最大的感受是,ASR 的技术演化正在变成一个”配置搜索”问题——帧率选多少、encoder 多大、LLM 冻不冻、MTP 挂几个头、任务权重怎么配,每家报告本质上都是在这个高维空间里给出自己的采样点。把这类问题做系统化,正是我们在《动手学 AutoML:从 NAS 到大语言模型优化实战》里讨论的主题——从架构搜索到 LLM 压缩,方法论是通的。对这个视角感兴趣的朋友可以翻翻。

动手学AutoML书籍封面

Flag Counter