arXiv'24 | SenseVoice:10 秒音频 70ms 转完,阿里在 LLM 化浪潮里逆行的 non-autoregressive 路线
arXiv’24 | SenseVoice:10 秒音频 70ms 转完,阿里在 LLM 化浪潮里逆行的 non-autoregressive 路线
1. 前言
大厂 ASR 报告系列第六篇,回到 2024 年 7 月——和 Seed-ASR 同一个月发布的阿里 FunAudioLLM(SenseVoice + CosyVoice)。
这个时间点很微妙:字节在同月发布 Seed-ASR,宣告”ASR 归入 LLM”;阿里通义实验室却在 FunAudioLLM 里给出了另一个答案——语音理解模型 SenseVoice 走的是 encoder-only、non-autoregressive 路线,和 LLM 的结合放在系统层而不是模型层。
两年后回头看,这两条路线都活得很好,而且恰好覆盖了两类场景。SenseVoice-Small 的核心卖点今天依然无人超越:10 秒音频,70ms 出结果。
2. 定位:LLM 的耳朵,不是 LLM 本身
FunAudioLLM 是个组合拳:SenseVoice 负责听(多语言 ASR + 情感 + 音频事件),CosyVoice 负责说(多语言 TTS + 音色克隆),中间接一个文本 LLM 组成语音交互系统。
这个”外挂式”设计和 Seed-ASR 的”内化式”设计(音频直接进 LLM)是 2024 年语音交互两大流派的分野。外挂式的好处:每个组件独立演进、独立部署、延迟可控;代价:语音里的副语言信息(情绪、语气)传给 LLM 时只剩文本标签。
本文重点讲 SenseVoice(CosyVoice 是 TTS,一句话带过:speech token + flow matching 的两段式合成,支持 zero-shot 音色克隆和跨语言克隆,后来演化成了 CosyVoice 2/3 系列)。
3. SenseVoice:一个任务 token 驱动的多面手

两个版本,架构路线完全不同:
SenseVoice-Small(234M):encoder-only + CTC,non-autoregressive
- 主干是 SAN-M(memory-equipped self-attention)encoder
- 输入侧塞任务 embedding:
<LID>(语种识别)、<SER>(情感识别)、<AED>(音频事件检测)、<ITN>(是否做数字规整),每个任务 token 在输出侧对应各自的分类 loss,ASR 部分走 CTC loss - 没有 decoder,没有自回归——所有输出一次并行算完,这是 70ms 延迟的根源
- 支持 5 种语言(中、粤、英、日、韩),训练数据约 30 万小时
SenseVoice-Large(1587M):encoder-decoder,autoregressive
- 标准 Transformer AED,输出格式是
<LID><SER><AED>+ 转写 token 的统一序列(看架构图下半部分:语种、情感、bgm 事件标签和文字混在一个自回归序列里生成) - 支持 50+ 语言,训练数据约 40 万小时,支持时间戳
rich transcription 是这套设计的灵魂:一次推理,同时拿到”说了什么(ASR)+ 谁的语言(LID)+ 什么情绪(SER)+ 什么声音事件(AED,如背景音乐、掌声、笑声)”。情感数据用了 3000 万条伪标签、事件数据 1.5 亿条——用伪标签数据把副语言任务喂进同一个模型,这是 2024 年”一个模型多个头”的典型做法。
4. 关键数字
4.1 速度:70ms 的含金量
- SenseVoice-Small:10 秒音频推理只要 70ms——比 Whisper-Small 快 5 倍以上,比 Whisper-Large 快 15 倍以上
- 注意这是 2024 年的数字,但即使放到 2026 年,它依然比 Qwen3-ASR-0.6B 的流式 TTFT 92ms 更快——因为 NAR 没有逐 token 生成这回事,长度不敏感
4.2 精度:大版本能打 Whisper,小版本够用

- Common Voice zh-CN:SenseVoice-Large 7.68% vs Whisper-Large 12.55%;SenseVoice-Small 10.78% 也比 Whisper-Large 好
- 中日韩粤这些”亚洲主场”语言全面优于 Whisper;欧洲语言互有胜负
- 上图还有个有意思的对照:带不带 LID 提示对 WER 影响显著,说明多语言模型里”先知道是什么语言”仍然是重要先验
4.3 情感识别:白送的能力比专用模型还强

SenseVoice-Large 在 ESD 上加权准确率 93.2%,casia、cremad 等集上大幅超过专用 SER 模型(XLSR-SER)和音频 LLM(Qwen-Audio、SALMONN)。ASR 顺手做的情感识别打赢了专门做情感的模型——大规模伪标签 + 共享声学表征的威力。
5. 我的 take
-
SenseVoice-Small 证明了 NAR 路线在”够用精度”下的速度是碾压性的。今天所有 LLM-based ASR 的推理优化(MTP、speculative decoding、流式 chunk)本质上都在逼近 NAR 天然就有的东西。如果你的场景是海量短音频、要求极致吞吐、能接受 5 种语言和略低的精度,2026 年 SenseVoice-Small 依然是性价比之王——这也是它在 GitHub 上长期霸榜的原因。
-
“任务 token 驱动多任务”是 prompt engineering 的声学版。
<SER>、<AED>这些 token 本质上就是硬编码的 prompt。后来 Qwen3-ASR 的 context biasing、Seed-ASR 的 instruction,都是把这个思路泛化成自然语言——从固定任务集合到开放指令,正好是 pre-LLM 到 LLM 时代的过渡化石。 -
阿里内部的路线赛马很值得注意:通义实验室 2024 年做 SenseVoice(NAR、小、快),Qwen 团队 2026 年做 Qwen3-ASR(LLM-based、精度高、也不慢)。同一家公司两条路线并行两年,最后 Qwen3-ASR 的对比表里 FunASR-Nano 还作为 baseline 出现——大厂内部的技术演化不是替代关系,而是场景分层:SenseVoice 吃走了”便宜大碗”的市场,Qwen3-ASR 吃走了”精度敏感”的市场。
-
rich transcription 的产品意义被低估了。字幕场景里
<bgm>、<laughter>这些事件标签直接对应弹幕/花字的自动化,情感标签对应配音和二创——从”转写文字”到”转写场景”,这是 ASR 产品形态的一次静默升级。
下一篇是系列收官的横向对比总结,把这六篇报告放到一条时间线上,讲清楚大厂 ASR 的路线分化和收敛。
题外话:SenseVoice-Small 的 NAR + 多任务头设计,和我们书里讲的多任务架构搜索是同一个问题空间——什么任务该共享主干、什么任务该独立分支,其实可以搜出来而不是拍脑袋。《动手学 AutoML:从 NAS 到大语言模型优化实战》的搜索空间设计章节对这类问题有系统讨论,感兴趣的朋友可以翻翻。
