arXiv'25 | MiMo-Audio:小米用 1 亿小时音频复刻 GPT-3 时刻,few-shot 能力真的涌现了

arXiv’25 | MiMo-Audio:小米用 1 亿小时音频复刻 GPT-3 时刻,few-shot 能力真的涌现了

原文:MiMo-Audio: Audio Language Models are Few-Shot Learners


1. 前言

大厂 ASR/音频报告系列第七篇,小米 LLM-Core 团队 2025 年 12 月的 MiMo-Audio。

标题就很挑衅——”Audio Language Models are Few-Shot Learners”,直接致敬 GPT-3 那篇 “Language Models are Few-Shot Learners”。它想验证的假设也一样:文本 LLM 在规模跨过临界点后涌现了 in-context learning,音频模型把数据堆到足够大,会不会也涌现?

答案是会。预训练语料超过 1 亿小时(比 Kimi-Audio 的 1300 万小时又高一个数量级),训练量跨过约 0.7T token 后,模型性能出现”急剧非线性增长”——声音转换、情感转换、语音去噪这些训练时从没教过的任务,靠 prompt 里塞 16 个示例就能做

这篇严格说不是 ASR 报告(它的 ASR 成绩甚至不算顶尖),但它代表了音频模型的另一个演化方向,放在系列里做对照非常有价值。

2. Tokenizer:1.2B 参数的重型分词器

MiMo-Audio-Tokenizer 架构

MiMo-Audio-Tokenizer 本身就是个 1.2B 的模型:32 层 Transformer encoder + RVQ 离散化 + decoder + vocoder,25Hz 帧率、8 层 RVQ(完整配置 20 层,LLM 只用前 8 层)。

关键在训练目标:除了重构损失(多尺度 mel L1)和 commitment loss,还加了一个 A2T(audio-to-text)的 next-token prediction 损失,权重高达 10.0(重构只有 1.0)。说人话:这个 tokenizer 被强制要求”离散 token 里必须装着语义”,不只是能还原波形就行。语义和声学联合编码,一个 tokenizer 同时服务理解和生成——这是和 Kimi-Audio”离散语义 token + 连续声学特征”双路方案的直接对照,MiMo 选择把两者压进同一套 RVQ 里。

3. 主模型:patch 化解决音频序列爆炸

MiMo-Audio 主模型的 patch encoder-LLM-patch decoder 架构

25Hz × 8 层 RVQ 意味着每秒音频产生 200 个 token,直接喂 LLM 序列长度爆炸。MiMo-Audio 的解法是 patch 聚合

  • Patch Encoder(6 层 Transformer):把连续 4 帧的 RVQ token 聚合成一个 patch 向量,LLM 侧的有效帧率降到 6.25Hz
  • LLM 主干:MiMo-7B-Base(36 层、4096 维,小米自家的文本模型)
  • Patch Decoder(16 层 Transformer):自回归地把 patch 还原成 25Hz 的完整 RVQ 序列,并用 0-1-2-3-4-5-6-7 的逐层延迟处理 RVQ 层间依赖

注意 6.25Hz 这个数字——比 Qwen3-ASR/Kimi-Audio 的 12.5Hz 又砍了一半,和 Seed-ASR 的 160ms/帧(6.25Hz)殊途同归。“LLM 侧看到的音频帧率”正在全行业收敛到 6-12.5Hz 这个区间

4. 预训练:1 亿小时 + 两阶段课程

  • 第一阶段(理解):2.6T token(1.2T 文本 + 1.4T 语音),只算文本损失——先让模型学会”听懂”
  • 第二阶段(理解+生成联合):5T token(2.6T 文本 + 2.4T 音频),文本和音频损失都算,文本权重 100、8 层 RVQ 权重 12-8-6-4-2-2-1-1 递减,配合”文本引导交错生成”(5:5 比例)

和 Kimi-Audio 的 1:7 音频文本比一样,文本的超高权重都是在防多模态训练毁掉语言能力

涌现的证据是全文最大的卖点:训练量跨过 ~0.7T token 后,few-shot 任务性能非线性起跳。声音转换、情感转换、语速控制、语音翻译、语音去噪——这些任务预训练里没有一个被显式训练过,全靠上下文里的 16 个示例。这是音频领域第一次有人拿出 scaling 涌现曲线的完整证据。

5. 结果:通用能力封神,ASR 中规中矩

与开源/闭源音频模型的 benchmark 对比

通用音频智能

  • MMAU 74.9,超过 Gemini-2.5-Flash(71.8);MMAU-Pro 56.8,同尺寸开源模型里断层第一
  • Big Bench Audio S2T 72.9,超过 GPT-4o-audio(70.2)
  • 最能说明问题的指标是模态差距:同样的 MMLU 题目,文本问(T2T)72.5 分 vs 语音问语音答(S2S)69.1 分,只差 3.4 分;Kimi-Audio 的这个差距是 58.9 分——大多数音频模型”听到问题”后智商暴跌,MiMo-Audio 基本没跌

ASR(该批评就批评):LibriSpeech test-clean 3.50、AISHELL-1 1.65,明显不如 Kimi-Audio(1.28 / 0.60)和 Step-Audio2-mini(1.87 / 0.95)。通才的代价清清楚楚摆在这——25Hz 语义声学混合 token 对生成友好,但对纯转写任务,不如 Whisper 系连续特征直给。

6. 我的 take

  1. 这篇报告最大的贡献是把”音频 GPT-3 假设”做实了。1 亿小时 + 涌现曲线 + 16-shot 泛化到未见任务,三件套齐全。之前大家默认音频任务要靠 SFT 逐个教,MiMo-Audio 证明规模到位后 ICL 是白送的——这会改变后续所有音频模型的预训练预算决策。

  2. ASR 成绩单反过来印证了专用/通用的分界。同期的专用 ASR(FireRedASR、Qwen3-ASR)在 1-2B 就能打出 0.6-3% 的错误率,7B 的 MiMo-Audio 反而更差。转写是”低熵映射”任务,不需要涌现,需要的是干净的声学-文本对齐——这条战线上通才永远打不过专才,而且差距不会随规模缩小。

  3. 模态差距 3.4 分是被低估的硬指标。语音交互产品的核心痛点从来不是”听不清”,而是”听清了但变傻”。建议后续所有 audio LLM 报告都把 T2T vs S2S 的差距当主表指标——这比 WER 更能预测产品体验。

  4. 小米入局补全了大厂版图。手机+汽车+IoT 的语音入口是天然场景,MiMo-Audio 选”通用对话智能”而不是”极致 ASR”作为主攻方向,和它的产品矩阵是自洽的——车里的语音助手宁可 WER 高 1%,也不能答非所问。

至此七篇解读完毕,下一篇是系列收官的横向对比总结。


题外话:MiMo-Audio 的 RVQ 层权重 12-8-6-4-2-2-1-1、patch 大小 G=4、两阶段数据配比,这些超参每一个都影响最终能力,报告里没讲搜索过程。这类高维超参优化正是 AutoML 的主场,《动手学 AutoML:从 NAS 到大语言模型优化实战》里贝叶斯优化和进化搜索的章节讨论的就是怎么在这种昂贵实验设定下高效搜参,感兴趣的朋友可以翻翻。

动手学AutoML书籍封面

Flag Counter