arXiv'26 | Qwen3-ASR:1.7B 对线 GPT-4o,阿里把 ASR 卷成了'又小又快又开源'

arXiv’26 | Qwen3-ASR:1.7B 对线 GPT-4o,阿里把 ASR 卷成了”又小又快又开源”

原文:Qwen3-ASR Technical Report


1. 前言

大厂 ASR 报告系列第四篇,Qwen3-ASR,阿里 Qwen 团队 2026 年 1 月发布。

如果说 Seed-ASR 定义了”LLM-based ASR 该长什么样”,那 Qwen3-ASR 回答的是一个更商业的问题:这套东西怎么做到又小、又快、又便宜,还能全部开源?

一句话总结这份报告的战略:别人卷精度,Qwen 卷精度/成本比。三个模型全家桶——Qwen3-ASR-1.7B、Qwen3-ASR-0.6B、Qwen3-ForcedAligner-0.6B——全部 Apache 2.0 开源,支持 30 种语言 + 22 种中文方言,0.6B 版本首包延迟 92ms,1.7B 版本在一票 benchmark 上和 GPT-4o-Transcribe、Gemini-2.5-Pro 正面掰手腕。

Qwen3-ASR 的五大能力

2. 架构:AuT encoder + Qwen3 LM

AuT 架构(左)与 Qwen3-ASR 总览(右)

还是熟悉的 Encoder + LLM 配方,但每个组件都有自己的讲究:

AuT(Audio Transformer)encoder

  • 输入 128 维 Fbank(100Hz),3 层 Conv2d 下采样 8 倍,得到 12.5Hz 的 token rate——每秒音频只产生 12.5 个 token,这是控制 LLM 侧计算量的关键
  • 32 层 self-attention,1.7B 版配 300M encoder,0.6B 版配 180M
  • 动态 attention 窗口(1-8 秒):训练时窗口大小随机变化,让同一个 encoder 既能低延迟流式(小窗口)又能高精度离线(大窗口)——一个模型两种部署形态,不用维护两套
  • AuT 先用 4000 万小时伪标签 ASR 数据以 AED 方式预训练(图左侧的 AuT Decoder 只在预训练阶段用,之后扔掉)

LLM 侧:Qwen3-0.6B / 1.7B。注意规模——Seed-ASR 用 10B+ MoE,FireRedASR 用 7B,Qwen3-ASR 直接砍到 2B 以内。

Context biasing 机制:用户把任意文本(热词表、专有名词、领域背景)塞进 system prompt,模型学会把这些 token 当背景知识用。相比 Seed-ASR 的 context 机制,Qwen3-ASR 把它产品化成了”用户可自定义”的接口——不需要重训、不限语言、不限格式。

3. 训练流程:站在 Qwen3-Omni 的肩膀上

四阶段:

  1. AuT 预训练:40M 小时伪标签数据(以中英文为主)
  2. Omni 预训练:AuT 和 Qwen3 LM 拼起来,随 Qwen3-Omni 一起吃 3T token 的多模态数据(音频、视觉、文本)
  3. ASR SFT:多语言 ASR 数据,外加三类专项数据——non-speech(拒识静音/噪声)、streaming-enhancement(流式补强)、context biasing
  4. RL:约 5 万条数据,用 GSPO(Group Sequence Policy Optimization)算法,数据配比 35% 中英 + 35% 多语言 + 30% 功能性数据

和前辈们对比很有意思:Seed-ASR 用 MWER-as-reward 的 RL,Qwen3-ASR 用的是 2025 年之后 LLM 圈流行的 group-based policy optimization(GSPO 是 GRPO 的序列级变体,也是 Qwen 自家提出的)。ASR 的 RL 已经完全融入 LLM post-training 的技术栈了

另一个值得注意的点:ASR 模型不是从零训的,而是从 Qwen3-Omni 多模态底座分化出来的专用模型。这和 StepAudio 2.5 的”一个底座分化三个模式”是同一个思路——2026 年的共识是:先养一个通用 audio-language 底座,再收割各个垂直任务。

4. 关键结果

4.1 精度:开源模型第一梯队,直面商业 API

英文、中文、方言 benchmark 全面对比

几个观察:

  • WenetSpeech(嘈杂网络语音+会议):Qwen3-ASR-1.7B 4.97/5.88,GPT-4o-Transcribe 是 15.30/32.27,Gemini-2.5-Pro 14.43/13.47——国际大模型 API 在中文难场景直接崩盘,差 3-6 倍
  • 英文侧:LibriSpeech clean 1.63(GPT-4o 1.39 略好),但 GigaSpeech 8.45 vs GPT-4o 的 25.50,真实场景数据分布偏移越大,Qwen3-ASR 优势越明显
  • 方言:KeSpeech 5.10、粤语 Fleurs-yue 3.98,全面领先所有对手;四川话 hard 集 21.63,只有 Doubao-ASR(20.20)能打
  • 0.6B 版本的精度只比 1.7B 差 10-20%,但很多单项仍然吊打 Whisper-large-v3(1.6B)

语言识别也内置了:Fleurs 30 语言 LID 准确率 98.7%(Whisper 94.6%)。极端噪声场景 16.17 WER vs Whisper 的 63.17。M4Singer 唱歌识别 5.98,还支持带 BGM 的整首歌转写(EntireSongs-zh 13.91),这在之前只有 FireRedASR 认真做过。

4.2 效率:这才是报告的主战场

三个模型在不同并发下的 RTF/吞吐/TTFT

这张表值得细看,它是我见过的 ASR 技术报告里第一次把并发扫描(1→512)作为主表发布的:

  • 单并发:0.6B 离线 RTF 0.00923(1 小时音频 33 秒转完),流式 TTFT 平均 92ms / p95 105ms——百毫秒级首包,人耳基本无感
  • 高并发:0.6B 在 128 并发下在线吞吐 2000 秒音频/秒,RTF 0.064;一张卡每秒能处理 2000 秒的音频流入
  • 1.7B 也不慢:单并发 RTF 0.01482,128 并发吞吐 1219 秒/秒
  • 部署栈直接写明:vLLM + CUDA Graph + bfloat16——工业报告开始把推理框架配置当成果发布,这是 2026 年的新风气

对比 StepAudio 2.5 的单并发 RTF 0.0053(H800):StepAudio 靠 MTP 在单并发上更快,但它没给并发扫描数据;Qwen3-ASR 直接把 512 并发的曲线拍出来。做过 serving 的都懂,单并发 RTF 是 demo 指标,并发下的吞吐才是成本指标

4.3 ForcedAligner:被低估的第三个模型

Qwen3-ForcedAligner-0.6B 解决时间戳对齐,思路很巧:把 forced alignment 重构成 slot-filling 问题——

  1. 在转写文本的每个词/字后面插入特殊 token [time]
  2. 音频 + 带槽文本一起输入 Qwen3-0.6B
  3. 时间戳预测层对所有 [time] 槽位一次性并行输出离散时间索引(80ms 一格,3750 类对应 300 秒)

因为槽位数量已知,完全不需要自回归——NAR 推理,RTF 低到 0.001 量级(批量下吞吐 900+ 秒/秒)。精度也够硬:人工标注集上累计平均偏移 27.8ms,比 NFA(88.6ms)、WhisperX 好 67-77%。训练标签用 MFA 生成的伪标签就够。

这个设计对做 ASR 后处理的同学很有参考价值:字幕轴、口播剪辑、K 歌评分这些场景,时间戳往往比转写本身更难拿,一个 0.6B 的 NAR 模型直接把这个问题工程化解决了。

5. 我的 take

  1. Qwen3-ASR 是”效率军备竞赛”的定调之作。从 Seed-ASR(2024,秀能力)到 FireRedASR(2025 初,秀数据质量)再到 Qwen3-ASR(2026 初,秀 RTF/TTFT/并发曲线),技术报告的主表从 WER 变成了 WER + 吞吐。ASR 已经从”能不能做对”进入”多少钱做对”的阶段。

  2. 12.5Hz token rate 是全篇最重要的单一设计决策。LLM-based ASR 的成本大头在 LLM 侧的序列长度,把音频压到每秒 12.5 个 token(Seed-ASR 是 160ms/帧 = 6.25Hz,更激进但精度有代价;FireRedASR 是 80ms = 12.5Hz,殊途同归),几家在这个数字上收敛,说明 10-15Hz 大概就是当前”精度不掉、序列最短”的甜点区

  3. 动态 attention 窗口值得抄。一个 encoder 同时支持流式/离线,靠训练时随机化窗口实现——比 Uni-ASR 用训练范式统一两种模式的做法更轻。这类”训练时多样化、部署时特化”的技巧成本极低,收益是砍掉一半的模型维护。

  4. 开源是战略而不是慈善。GPT-4o/Gemini 在中文场景的崩盘数字摆在那,Qwen 用 Apache 2.0 的 1.7B 模型直接把”中文 ASR API”这个市场的定价权拿走了。接下来预期会看到大量下游产品直接内嵌 Qwen3-ASR——而它们都在 Qwen 生态里。

系列最后一篇横向对比马上来,把 Seed-ASR、FireRedASR、Qwen3-ASR、StepAudio 2.5、Kimi-Audio 放到一张时间线上讲。


题外话:Qwen3-ASR 里 0.6B/1.7B 两个尺寸的精度-效率 trade-off 曲线,以及 12.5Hz token rate 的选择,本质上都是”多目标下的模型配置优化”问题——这正是 AutoML 的经典应用场景。我们在《动手学 AutoML:从 NAS 到大语言模型优化实战》里专门讲过 LLM 压缩(剪枝/量化)和架构搜索怎么系统化地做这类决策(第 8、11 章),比逐个手动实验省不少算力,感兴趣的朋友可以翻翻。

动手学AutoML书籍封面

Flag Counter