arXiv'26 | StepAudio 2.5:一个底座三种人格,ASR 模式把 RTF 干到 0.0053
arXiv’26 | StepAudio 2.5:一个底座三种人格,ASR 模式把 RTF 干到 0.0053
1. 前言
最近在系统性地翻各家大厂的 ASR 技术报告,今天想和大家聊聊阶跃星辰(StepFun)2026 年 5 月放出的 StepAudio 2.5。
这篇报告要回答的问题很有野心:一个统一的 audio-language 底座,能不能同时在 ASR、TTS、实时语音交互三个赛道上都打赢各自的专用系统?
过去的答案基本是”不能”。统一模型什么都会一点,但拿去和专门优化的 ASR 系统或 TTS 系统硬碰硬,往往每一项都差口气。所以工业界的常态是各养各的:ASR 一套、TTS 一套、实时对话再来一套,三套模型三套基建。
StepAudio 2.5 给出的解法是一句挺漂亮的话:一旦文本和音频共享了同一个多模态表示空间,”任务专门化”就不再是模型问题,而是”运行模式”问题。底座只有一个,靠任务定制的 RLHF 和解码约束,把它塑造成三种不同的”操作模式”。
这篇文章我会重点讲 ASR 模式——因为它给出了我近期看到的最激进的 ASR 解码加速数字:RTF 0.0053,意思是转 1 小时录音只要约 19 秒,比 Qwen3-ASR-1.7B 还快 1.8 倍。而它用的武器,是 LLM 圈子里大家很熟的 MTP(Multi-Token Prediction)。
2. 整体架构:一个底座,三种人格
先看全家福:

共享的 audio-language stack 是经典的三段式:
- Audio Encoder:冻结的音频编码器,把波形变成紧凑的声学 embedding
- Adaptor:轻量适配器,把声学 embedding 映射到 LLM 的隐空间
- LLM Decoder:从文本 MoE LLM 初始化的解码器,负责语义理解和生成
这个”encoder-adaptor-LLM”的非对称设计现在几乎是 LLM-based ASR 的标准范式(Seed-ASR、FireRedASR-LLM 都是这个路子),StepAudio 2.5 的差异化在于底座的训练规模和统一性:
- 从文本 MoE LLM 出发,持续预训练 2.2T token 的文本 + 音频混合数据
- 主预训练阶段 800B text + 800B speech token,序列长度 16K
- 冷却阶段再喂 600B 高质量数据,序列拉到 32K
然后同一个底座分化出三个模型:ASR(识别)、TTS(合成)、Realtime(实时对话)。分化的手段不是改架构,而是 SFT + 任务定制 RLHF + 解码约束。
3. ASR 模式:MTP 才是主角
3.1 为什么 ASR 适合激进的并行解码
LLM-based ASR 有个天然的推理瓶颈:转写是自回归逐 token 生成的,一小时的会议录音可能要生成上万个 token,一个一个吐实在太慢。
Speculative decoding 的思路大家都熟:想办法一次猜多个 token,再验证。但 StepAudio 2.5 在报告里点出了一个更本质的观察,我觉得是全文最有味道的一句:
Grounded generation tasks can sometimes be accelerated more aggressively than free-form text generation, precisely because the external modality reduces semantic branching.
说人话:ASR 的输出是被音频”锚死”的。自由文本生成时,下一个 token 有很多合理分支(”今天天气”后面可以接”不错”、”很热”、”怎么样”……),投机猜测容易猜错;但转写任务里说话人说了什么就是什么,语义分支被外部模态压到极小,猜中率自然高。Grounding 不只是信息来源,它本身就是一种算法结构。
3.2 MTP 的具体设计

如上图,主干之外挂了若干个 MTP module。以 MTP-5 为例,每个解码位置 t 会同时提出 6 个 token:主分支预测 x_{t+1},5 个 future 分支分别预测 x_{t+2} 到 x_{t+6}。
几个工程细节值得记:
- 权重共享:所有分支共享 Embedding 层和 LM Head,每个 MTP module 只加一个 Linear + Transformer Block,参数开销很小
- hidden state 串联:第 h 个分支拿第 h-1 个分支的 hidden state 拼上 shifted token embedding 作为输入(图里的 H-Norm / E-Norm / Concatenate),这是 DeepSeek-V3 式的 sequential MTP,不是各分支独立瞎猜
- 训练 loss 加权:第 h 个分支权重 w_h ∝ α^{h-1},α=0.9,离当前位置越远的预测权重越低
- 自回归验证:推理时 MTP 提出的 token 必须和正常解码路径一致才被接受,所以精度无损——这是 speculative decoding 的标准保证
训练分两步走:先冻住主干只训新加的 MTP blocks(学习率 2e-4),再解冻 adapter 和 decoder 联合校准(2e-5)。先对齐再联调,避免新分支把主干带崩。
3.3 接受率数字:为什么选 MTP-5 而不是 MTP-7

这张表很有信息量:
- 第 1 个位置接受率 0.95-0.96,之后每往后一个位置大约衰减 0.9 倍(0.88 → 0.80 → 0.71 → 0.64…)
- MTP-3 平均接受长度 3.6/4,MTP-5 是 5.0/6(比 MTP-3 提升 39%),MTP-7 是 6.1/8(只再提升 22%)
为什么不上 MTP-7?报告说得很实在:第 6、7 个位置接受率已经掉到 0.59/0.53,频繁的验证失败会触发 KV cache 回滚、打断解码流,这部分开销吃掉了更长 lookahead 的边际收益。所以 MTP-5 是刻意选择的效率-复杂度平衡点。
这个”acceptance rate 按固定因子衰减 → 存在最优分支数”的规律,对做 LLM speculative decoding 的同学应该很眼熟——ASR 场景只是把这条曲线整体抬高了(文本场景第一个位置能有 0.95 的接受率是很奢侈的)。
3.4 效果:精度不掉,速度起飞
先看精度:

几个关键数字:
- 中文平均 CER 2.97%,比 Qwen3-ASR-1.7B 的 3.17% 好;AISHELL-1 上 0.71% 是断层领先(第二名 1.49%)
- 英文平均 WER 3.68%,和 Qwen3-ASR 的 3.85% 相比小幅领先
- 长音频平均 3.70%,同样是第一
- 最右列是关键消融:不带 MTP 训练的版本平均只差 0.03-0.06%,说明 MTP 加速几乎是白拿的,不用精度换
再看速度:

RTF 0.0053(H800 单并发),什么概念:
- 比 Qwen3-ASR-1.7B(0.0094)快 1.8 倍
- 比 FunASR-Nano(0.0591)快 11 倍
- 比 VibeVoice-ASR(0.1039)快 19.6 倍
- 换算下来,1 小时音频约 19 秒转完
精度第一梯队 + 速度断层第一,这就是”grounded generation 可以更激进加速”这个洞察落到工程上的样子。
4. 长音频数据 pipeline:伪标签的工业化流水线
模型效果好,一半功劳在数据。长音频(会议、播客、直播)的高质量标注太贵,StepAudio 2.5 用了一条全自动伪标签流水线,产出了 50K 小时长音频训练数据:

走读一遍:
- VAD Segmentation:原始长录音按语音活动检测切成 ≤30s 的片段
- Multi-system Transcription:用 3 个不同的 ASR 系统独立转写每个片段
- ROVER Voting:token 级投票融合三份转写(ROVER 是个上古但好用的技术)
- Quality Filtering:算分歧率 ê = 分歧位置数 / 总 token 数,ê > 0.05 的片段直接扔
- Session Re-composition:把通过筛选的相邻片段重新拼回长音频样本
- LLM Refinement:最后用 LLM 恢复标点、做 inverse text normalization、保证跨片段风格一致
这条流水线本质上是”用多系统一致性代替人工标注置信度“——三个系统都转出一样的结果,那大概率就是对的。这个思路不新,但把它和 session 级重组、LLM 后处理串成一条自动化生产线,是把学术 trick 变成数据工厂的典型工业操作。
另外 SFT 阶段还有约 100K 小时的短音频监督数据打底,长短结合。
5. TTS 和 Realtime:一句话带过
本文重点在 ASR,另外两个模式简单说:
- TTS 模式:干脆把 encoder-adapter 扔了,audio token 当成一门”新语言”,纯 next-token prediction 建模,配 Generative Reward Model 做 RLHF,Arena 胜率 67.6%
- Realtime 模式:三阶段训练(audio mid-training → 渐进式 SFT → GRM-based RLHF,PPO 风格 + KL 正则),五项实时交互 benchmark 全面领先

有意思的是三个模式对”对齐机制”的用法完全不同:ASR 模式靠解码约束(MTP + 自回归验证),TTS 和 Realtime 靠 RLHF。同一个底座,专门化的手段是模式定制的——这正是开头那句”specialization becomes a matter of operating modes”的落地。
6. 我的 take
-
“grounded generation 可以更激进加速”是这篇报告最值得带走的洞察。它不只适用于 ASR——翻译、OCR、结构化抽取,一切输出被输入强约束的任务,理论上都能享受比自由生成更高的投机接受率。做推理优化的同学可以把”任务的语义分支度”作为一个显式的设计维度。
-
MTP-5 的选择过程展示了很标准的系统工程思维:不是”越多越好”,而是把 KV cache 回滚开销放进账本里算总账。acceptance rate 0.9 的几何衰减 + 回滚成本,共同决定了最优分支数。
-
和 Qwen3-ASR 的对比很微妙。Qwen3-ASR 走的是”小模型 + 极致工程”路线(1.7B/0.6B,开源),StepAudio 2.5 走的是”大底座 + 模式分化”路线(MoE 底座,2.2T token 续训)。精度上 StepAudio 略胜,速度上 MTP 帮它反超了参数量劣势。两条路线的分野后面我会专门写一篇对比文章展开。
-
报告没披露底座具体参数量,RTF 也只给了单并发数字,高并发下 MTP 的收益会被 batch 内的验证失败摊薄多少,是个没回答的问题——毕竟单并发 RTF 对云端服务的成本参考意义有限。
欢迎评论区交流,尤其是有人实测过 MTP 在 ASR 高并发场景收益的,求分享数据。
顺带扯一句题外话:我自己的研究主线是 LLM 推理效率(MoE 推理优化方向),ASR 这波 LLM 化之后,推理加速的玩法(speculative decoding、MTP、KV cache 管理)和文本 LLM 越来越同源了,这也是我最近集中翻 ASR 技术报告的原因。之前我们把 AutoML / 模型压缩方向的积累整理成了一本书《动手学 AutoML:从 NAS 到大语言模型优化实战》,里面 LLM 剪枝、量化那几章和这类”效率优先”的工程思路一脉相承,感兴趣的朋友可以翻翻。
