arXiv'25 | FireRedASR:小红书用 7 万小时人工标注告诉你,数据质量能打赢参数量

arXiv’25 | FireRedASR:小红书用 7 万小时人工标注告诉你,数据质量能打赢参数量

原文:FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration


1. 前言

继续大厂 ASR 技术报告系列。今天这篇是小红书 FireRed 团队 2025 年 1 月放出的 FireRedASR,一篇非常”实诚”的工业报告——模型开源、架构常规、数字硬核

它最抓眼球的结论有两个:

  1. FireRedASR-LLM(8.3B)在四个中文公开 benchmark 上平均 CER 3.05%,把当时的 SOTA、字节的 Seed-ASR(12B+,闭源)拉下马,相对降低 8.4%
  2. FireRedASR-AED 只有 1.1B 参数,平均 CER 3.18%,也比 Seed-ASR 好——用不到十分之一的参数量打赢了 12B+ 的模型

一个团队同时放出两条技术路线(传统 AED 和 LLM-based),还都开源,这在中文 ASR 圈里是头一份。更有意思的是,这篇报告用结果暗示了一个朴素但经常被忽略的道理:当你的数据足够好,参数量的差距是可以被抹平的

2. 两条路线:AED 和 LLM

先看架构全景图,一张图把两个模型都画清楚了:

FireRedASR-LLM(左)与 FireRedASR-AED(右下)架构

2.1 FireRedASR-AED:常规但扎实的 Encoder-Decoder

AED(Attention-based Encoder-Decoder)就是最经典的端到端 ASR 范式:

  • Encoder:Conformer,16 层。先用两层步长为 2 的卷积做下采样,把时间分辨率从 10ms/帧 降到 40ms/帧,再过 Conformer block(Macaron 式 FFN + 相对位置编码的 self-attention + GLU 卷积模块,卷积核 33)
  • Decoder:标准 Transformer,16 层,正弦位置编码,输入输出 embedding 权重共享
  • 输入特征:80 维 log Mel filterbank,25ms 窗,10ms 帧移
  • 建模单元:混合 tokenization——中文用字(6827 个汉字),英文用 BPE(1000 个),总词表 7832

没有任何花活,就是把每一个组件都做扎实。模型从 XS 到 L 四个规格:

两个模型的架构规格

2.2 FireRedASR-LLM:Encoder-Adapter-LLM 三件套

LLM 路线也是现在的标准配方:

  • Encoder:直接用训练好的 FireRedASR-AED 的 encoder 初始化(710M)
  • Adapter:Linear-ReLU-Linear,把 encoder 输出投影到 LLM 的 embedding 维度。这里有个实用细节:encoder 输出 40ms/帧 对 LLM 还是太长,adapter 前面加了 frame splicing,把分辨率进一步压到 80ms/帧,直接砍半序列长度
  • LLM:Qwen2-7B-Instruct

训练策略是这篇报告的关键细节:encoder 和 adapter 全量训练,LLM 冻结主体、只加 LoRA。训练输入是 (prompt, speech, transcript) 三元组,loss 只算 transcript 部分。这个配比的逻辑是:让语音侧的模块负责”把声学特征翻译到 LLM 的语义空间”,LLM 自己的文本能力尽量不动

整个 8.3B 里,真正为 ASR 训练的参数只有 encoder 710M + adapter 22M + LoRA,不到 10%。

3. 数据:一句话价值百万

报告在数据部分说了一句很有态度的话,大意是:一千小时高质量人工标注数据,好过一万小时弱标注数据

FireRedASR 的训练数据约 70K 小时,其中中文部分绝大多数是专业标注员手工转录的真实场景音频(不是朗读式录音),另有约 11K 小时英文数据。

对比一下同行的数据规模:

  • Whisper:680K 小时弱监督数据(爬来的网络字幕对)
  • Seed-ASR:自监督阶段 7.7M 小时 + 监督微调 562K 小时
  • FireRedASR:70K 小时,人工标注

数据量差了一到两个数量级,但公开 benchmark 上 FireRedASR 全面领先。当然这里有个隐藏变量:FireRedASR 主攻中文普通话,任务面比 Whisper(99 种语言)和 Seed-ASR(多域多语言上下文感知)窄很多。聚焦本身就是一种优化。

另一个训练细节:Progressive Regularization Training。1.1B 的 AED 模型不好训,他们的做法是先不加正则快速收敛,再逐步引入 dropout 和 SpecAugment。之前用 Two-pass Transducer 架构时过拟合和内存开销都有问题,换 AED + 渐进正则才把 1.1B 训稳。

4. 实验结果

4.1 公开 benchmark:双双超过 Seed-ASR

四个公开中文测试集上的 CER 对比

关键数字:

  • FireRedASR-LLM 平均 3.05%,比 Seed-ASR 的 3.33% 相对降低 8.4%
  • FireRedASR-AED 平均 3.18%,1.1B 参数打赢 12B+ 的 Seed-ASR
  • 对比其它开源模型更是碾压:Qwen-Audio (8.4B) 6.19%、SenseVoice-L (1.6B) 4.47%、Whisper-Large-v3 9.86%、Paraformer-Large 4.56%
  • 细看单项很有意思:aishell1 上 AED(0.55)比 LLM(0.76)还好,朗读式干净语音里 LLM 的语义先验帮不上忙;但 ws_meeting(会议场景)上 LLM 明显占优(4.67 vs 5.69 的 Seed-ASR),越难、越口语化的场景,LLM 的语言建模能力越值钱

脚注里还有一个数字:如果按 Seed-ASR 报告的六个测试集平均(Average-6)算,FireRedASR-LLM 是 2.86% vs Seed-ASR 的 2.98%,依然领先。

4.2 Scaling 规律:两条路线都还没到头

不同规模下的平均 CER

  • AED 从 140M 一路扩到 1.1B:3.79% → 3.56% → 3.37% → 3.18%,每次翻倍稳定拿 5-6% 的相对提升
  • LLM 路线固定 Qwen2-7B 不动,只扩 encoder(86M → 710M):3.29% → 3.05%,整体 7.3% CERR

adapter 参数几乎不变(17M → 22M),收益全部来自 encoder 变大。这个消融很说明问题:LLM-based ASR 的瓶颈不在语言模型,而在声学表征的质量。

4.3 真实场景和唱歌识别:工业模型的”私货”

公开 benchmark 之外,报告还测了自建的多源场景测试集(短视频、直播、自动字幕、语音输入、智能助手五个场景)和唱歌歌词识别

多源场景与唱歌识别的 CER 对比

  • 语音场景:FireRedASR-LLM 3.48%,比某头部商业 API(ProviderA-Large)的 4.56% 相对好 23.7%,比 Paraformer-Large 好 40%
  • 唱歌场景差距直接拉爆:7.05% vs ProviderA 的 14.16%、Paraformer 的 21.19%,相对提升 50-67%

唱歌识别这个测试项很”小红书”——短视频平台的核心场景就是带 BGM 的人声和唱歌内容,这是通用 ASR 模型的盲区,也是自建数据的价值所在。工业报告和学术论文的区别就在这:benchmark 是拿来对外交代的,自家场景的测试集才是模型真正被优化的方向

4.4 泛化:方言和英文

  • KeSpeech 中文方言:FireRedASR-LLM 3.56%,远好于 Baichuan-omni 的 6.7%
  • LibriSpeech 英文:test-clean 1.73% / test-other 3.67%,和 Whisper-Large-v3(1.82% / 3.50%)基本打平——考虑到英文训练数据只有 11K 小时(Whisper 的英文数据是它的几十倍),这个结果算相当能打

5. 我的 take

  1. AED 1.1B 打赢 12B+ 这个结果,比 LLM 版本夺冠更值得琢磨。它说明在数据质量足够高、任务域聚焦的前提下,传统架构的天花板远没到。直接结论:不是所有场景都需要为 ASR 挂一个 7B 的 LLM——AED 版本推理成本低得多,精度只差 4%(3.18 vs 3.05),生产环境里这笔账很好算。

  2. LLM 路线的收益是”场景选择性”的。干净朗读语音(aishell1)里 LLM 反而更差,嘈杂口语场景(会议、唱歌)里 LLM 优势巨大。LLM 带来的不是均匀提升,而是用语言先验补声学信号的洞——信号越烂,先验越值钱。

  3. encoder scaling 消融是给后来者的路标:固定 LLM 扩 encoder 有效,说明声学表征仍是第一瓶颈。后面 Qwen3-ASR 用 AuT encoder、StepAudio 2.5 用大规模 audio 续训,本质上都在回应同一个判断。

  4. 报告没讲推理效率(RTF、延迟),这是和后来的 Qwen3-ASR、StepAudio 2.5 报告比明显缺的一块——2025 年初大家还在卷精度,2026 年的报告已经把 RTF 放进主表了,一年时间竞争维度就变了。

这个系列的最后我会写一篇横向对比,把 Seed-ASR、FireRedASR、Qwen3-ASR、StepAudio 2.5、Kimi-Audio 这些放一起讲发展脉络,欢迎关注。


顺带提一句,FireRedASR 的 scaling 实验(AED 四个尺寸、encoder 四个尺寸)本质上是一次手动的架构-规模搜索,这类”在给定预算下找最优模型配置”的问题正是 AutoML/NAS 的经典命题。我们把这个方向的方法论整理成了一本书《动手学 AutoML:从 NAS 到大语言模型优化实战》,里面搜索空间设计、架构评估那几章讲的就是怎么把这种实验做得更系统,感兴趣可以翻翻。

动手学AutoML书籍封面

Flag Counter