arXiv'26 | StepAudio 2.5:一个底座三种人格,ASR 模式把 RTF 干到 0.0053

arXiv’26 | StepAudio 2.5:一个底座三种人格,ASR 模式把 RTF 干到 0.0053

原文:StepAudio 2.5 Technical Report


1. 前言

最近在系统性地翻各家大厂的 ASR 技术报告,今天想和大家聊聊阶跃星辰(StepFun)2026 年 5 月放出的 StepAudio 2.5。

这篇报告要回答的问题很有野心:一个统一的 audio-language 底座,能不能同时在 ASR、TTS、实时语音交互三个赛道上都打赢各自的专用系统?

过去的答案基本是”不能”。统一模型什么都会一点,但拿去和专门优化的 ASR 系统或 TTS 系统硬碰硬,往往每一项都差口气。所以工业界的常态是各养各的:ASR 一套、TTS 一套、实时对话再来一套,三套模型三套基建。

StepAudio 2.5 给出的解法是一句挺漂亮的话:一旦文本和音频共享了同一个多模态表示空间,”任务专门化”就不再是模型问题,而是”运行模式”问题。底座只有一个,靠任务定制的 RLHF 和解码约束,把它塑造成三种不同的”操作模式”。

这篇文章我会重点讲 ASR 模式——因为它给出了我近期看到的最激进的 ASR 解码加速数字:RTF 0.0053,意思是转 1 小时录音只要约 19 秒,比 Qwen3-ASR-1.7B 还快 1.8 倍。而它用的武器,是 LLM 圈子里大家很熟的 MTP(Multi-Token Prediction)。

2. 整体架构:一个底座,三种人格

先看全家福:

StepAudio 2.5 模型家族总览

共享的 audio-language stack 是经典的三段式:

  • Audio Encoder:冻结的音频编码器,把波形变成紧凑的声学 embedding
  • Adaptor:轻量适配器,把声学 embedding 映射到 LLM 的隐空间
  • LLM Decoder:从文本 MoE LLM 初始化的解码器,负责语义理解和生成

这个”encoder-adaptor-LLM”的非对称设计现在几乎是 LLM-based ASR 的标准范式(Seed-ASR、FireRedASR-LLM 都是这个路子),StepAudio 2.5 的差异化在于底座的训练规模和统一性

  • 从文本 MoE LLM 出发,持续预训练 2.2T token 的文本 + 音频混合数据
  • 主预训练阶段 800B text + 800B speech token,序列长度 16K
  • 冷却阶段再喂 600B 高质量数据,序列拉到 32K

然后同一个底座分化出三个模型:ASR(识别)、TTS(合成)、Realtime(实时对话)。分化的手段不是改架构,而是 SFT + 任务定制 RLHF + 解码约束。

3. ASR 模式:MTP 才是主角

3.1 为什么 ASR 适合激进的并行解码

LLM-based ASR 有个天然的推理瓶颈:转写是自回归逐 token 生成的,一小时的会议录音可能要生成上万个 token,一个一个吐实在太慢。

Speculative decoding 的思路大家都熟:想办法一次猜多个 token,再验证。但 StepAudio 2.5 在报告里点出了一个更本质的观察,我觉得是全文最有味道的一句:

Grounded generation tasks can sometimes be accelerated more aggressively than free-form text generation, precisely because the external modality reduces semantic branching.

说人话:ASR 的输出是被音频”锚死”的。自由文本生成时,下一个 token 有很多合理分支(”今天天气”后面可以接”不错”、”很热”、”怎么样”……),投机猜测容易猜错;但转写任务里说话人说了什么就是什么,语义分支被外部模态压到极小,猜中率自然高。Grounding 不只是信息来源,它本身就是一种算法结构

3.2 MTP 的具体设计

ASR 模式的 MTP 架构

如上图,主干之外挂了若干个 MTP module。以 MTP-5 为例,每个解码位置 t 会同时提出 6 个 token:主分支预测 x_{t+1},5 个 future 分支分别预测 x_{t+2} 到 x_{t+6}。

几个工程细节值得记:

  • 权重共享:所有分支共享 Embedding 层和 LM Head,每个 MTP module 只加一个 Linear + Transformer Block,参数开销很小
  • hidden state 串联:第 h 个分支拿第 h-1 个分支的 hidden state 拼上 shifted token embedding 作为输入(图里的 H-Norm / E-Norm / Concatenate),这是 DeepSeek-V3 式的 sequential MTP,不是各分支独立瞎猜
  • 训练 loss 加权:第 h 个分支权重 w_h ∝ α^{h-1},α=0.9,离当前位置越远的预测权重越低
  • 自回归验证:推理时 MTP 提出的 token 必须和正常解码路径一致才被接受,所以精度无损——这是 speculative decoding 的标准保证

训练分两步走:先冻住主干只训新加的 MTP blocks(学习率 2e-4),再解冻 adapter 和 decoder 联合校准(2e-5)。先对齐再联调,避免新分支把主干带崩。

3.3 接受率数字:为什么选 MTP-5 而不是 MTP-7

MTP 每个位置的严格接受率

这张表很有信息量:

  • 第 1 个位置接受率 0.95-0.96,之后每往后一个位置大约衰减 0.9 倍(0.88 → 0.80 → 0.71 → 0.64…)
  • MTP-3 平均接受长度 3.6/4,MTP-5 是 5.0/6(比 MTP-3 提升 39%),MTP-7 是 6.1/8(只再提升 22%)

为什么不上 MTP-7?报告说得很实在:第 6、7 个位置接受率已经掉到 0.59/0.53,频繁的验证失败会触发 KV cache 回滚、打断解码流,这部分开销吃掉了更长 lookahead 的边际收益。所以 MTP-5 是刻意选择的效率-复杂度平衡点。

这个”acceptance rate 按固定因子衰减 → 存在最优分支数”的规律,对做 LLM speculative decoding 的同学应该很眼熟——ASR 场景只是把这条曲线整体抬高了(文本场景第一个位置能有 0.95 的接受率是很奢侈的)。

3.4 效果:精度不掉,速度起飞

先看精度:

中英文及长音频 benchmark 的错误率对比

几个关键数字:

  • 中文平均 CER 2.97%,比 Qwen3-ASR-1.7B 的 3.17% 好;AISHELL-1 上 0.71% 是断层领先(第二名 1.49%)
  • 英文平均 WER 3.68%,和 Qwen3-ASR 的 3.85% 相比小幅领先
  • 长音频平均 3.70%,同样是第一
  • 最右列是关键消融:不带 MTP 训练的版本平均只差 0.03-0.06%,说明 MTP 加速几乎是白拿的,不用精度换

再看速度:

RTF 对比

RTF 0.0053(H800 单并发),什么概念:

  • 比 Qwen3-ASR-1.7B(0.0094)快 1.8 倍
  • 比 FunASR-Nano(0.0591)快 11 倍
  • 比 VibeVoice-ASR(0.1039)快 19.6 倍
  • 换算下来,1 小时音频约 19 秒转完

精度第一梯队 + 速度断层第一,这就是”grounded generation 可以更激进加速”这个洞察落到工程上的样子。

4. 长音频数据 pipeline:伪标签的工业化流水线

模型效果好,一半功劳在数据。长音频(会议、播客、直播)的高质量标注太贵,StepAudio 2.5 用了一条全自动伪标签流水线,产出了 50K 小时长音频训练数据:

长音频 ASR 数据构建流水线

走读一遍:

  1. VAD Segmentation:原始长录音按语音活动检测切成 ≤30s 的片段
  2. Multi-system Transcription:用 3 个不同的 ASR 系统独立转写每个片段
  3. ROVER Voting:token 级投票融合三份转写(ROVER 是个上古但好用的技术)
  4. Quality Filtering:算分歧率 ê = 分歧位置数 / 总 token 数,ê > 0.05 的片段直接扔
  5. Session Re-composition:把通过筛选的相邻片段重新拼回长音频样本
  6. LLM Refinement:最后用 LLM 恢复标点、做 inverse text normalization、保证跨片段风格一致

这条流水线本质上是”用多系统一致性代替人工标注置信度“——三个系统都转出一样的结果,那大概率就是对的。这个思路不新,但把它和 session 级重组、LLM 后处理串成一条自动化生产线,是把学术 trick 变成数据工厂的典型工业操作。

另外 SFT 阶段还有约 100K 小时的短音频监督数据打底,长短结合。

5. TTS 和 Realtime:一句话带过

本文重点在 ASR,另外两个模式简单说:

  • TTS 模式:干脆把 encoder-adapter 扔了,audio token 当成一门”新语言”,纯 next-token prediction 建模,配 Generative Reward Model 做 RLHF,Arena 胜率 67.6%
  • Realtime 模式:三阶段训练(audio mid-training → 渐进式 SFT → GRM-based RLHF,PPO 风格 + KL 正则),五项实时交互 benchmark 全面领先

实时交互评测结果

有意思的是三个模式对”对齐机制”的用法完全不同:ASR 模式靠解码约束(MTP + 自回归验证),TTS 和 Realtime 靠 RLHF。同一个底座,专门化的手段是模式定制的——这正是开头那句”specialization becomes a matter of operating modes”的落地。

6. 我的 take

  1. “grounded generation 可以更激进加速”是这篇报告最值得带走的洞察。它不只适用于 ASR——翻译、OCR、结构化抽取,一切输出被输入强约束的任务,理论上都能享受比自由生成更高的投机接受率。做推理优化的同学可以把”任务的语义分支度”作为一个显式的设计维度。

  2. MTP-5 的选择过程展示了很标准的系统工程思维:不是”越多越好”,而是把 KV cache 回滚开销放进账本里算总账。acceptance rate 0.9 的几何衰减 + 回滚成本,共同决定了最优分支数。

  3. 和 Qwen3-ASR 的对比很微妙。Qwen3-ASR 走的是”小模型 + 极致工程”路线(1.7B/0.6B,开源),StepAudio 2.5 走的是”大底座 + 模式分化”路线(MoE 底座,2.2T token 续训)。精度上 StepAudio 略胜,速度上 MTP 帮它反超了参数量劣势。两条路线的分野后面我会专门写一篇对比文章展开。

  4. 报告没披露底座具体参数量,RTF 也只给了单并发数字,高并发下 MTP 的收益会被 batch 内的验证失败摊薄多少,是个没回答的问题——毕竟单并发 RTF 对云端服务的成本参考意义有限。

欢迎评论区交流,尤其是有人实测过 MTP 在 ASR 高并发场景收益的,求分享数据。


顺带扯一句题外话:我自己的研究主线是 LLM 推理效率(MoE 推理优化方向),ASR 这波 LLM 化之后,推理加速的玩法(speculative decoding、MTP、KV cache 管理)和文本 LLM 越来越同源了,这也是我最近集中翻 ASR 技术报告的原因。之前我们把 AutoML / 模型压缩方向的积累整理成了一本书《动手学 AutoML:从 NAS 到大语言模型优化实战》,里面 LLM 剪枝、量化那几章和这类”效率优先”的工程思路一脉相承,感兴趣的朋友可以翻翻。

动手学AutoML书籍封面

Flag Counter