Aug 03, 2026 AmphionASR | 热词、目标说话人、耳语——四种条件化 ASR 塞进一个 1.7B SpeechLLM Jul 28, 2026 106K star 的开源 ASR 老祖宗 | 重读 Whisper 原论文的每一个技术细节 Jul 27, 2026 ICML'26 Workshop | 韩英混说训好了,韩日混说能白拿吗?答案是:几乎不能 Jul 15, 2026 arXiv'26 | StepAudio 2.5:一个底座三种人格,ASR 模式把 RTF 干到 0.0053 Jul 15, 2026 arXiv'24 | SenseVoice:10 秒音频 70ms 转完,阿里在 LLM 化浪潮里逆行的 non-autoregressive 路线 Jul 15, 2026 arXiv'24 | Seed-ASR:字节跳动把 ASR 做成了'给 LLM 喂音频',上下文感知才是杀手锏 Jul 15, 2026 arXiv'26 | Qwen3-ASR:1.7B 对线 GPT-4o,阿里把 ASR 卷成了'又小又快又开源' Jul 15, 2026 arXiv'25 | MiMo-Audio:小米用 1 亿小时音频复刻 GPT-3 时刻,few-shot 能力真的涌现了 Jul 15, 2026 arXiv'25 | Kimi-Audio:1300 万小时音频 + 混合 token 输入,月之暗面的通用音频底座怎么搭 Jul 15, 2026 arXiv'25 | FireRedASR:小红书用 7 万小时人工标注告诉你,数据质量能打赢参数量 Jul 15, 2026 大厂 ASR 技术报告横评:从 Seed-ASR 到 StepAudio 2.5,两年时间行业共识是怎么形成的 Jul 13, 2026 长音频转写慢 10 倍、99% 的 Attention 在白做功——MURMUR 是怎么解决的 Jun 30, 2026 arXiv'26 | SSD for ASR:用 CTC 编码器打草稿,LLM 验证,语音识别也能推测解码 Jun 26, 2026 长音频转写慢 10 倍,99% 的 Attention 在白做功——MURMUR 如何破解这道难题 Jun 26, 2026 2026 | dLLM-ASR 让语音识别推理快 4.44 倍,还不掉精度 Jun 25, 2026 SpecASR:ASR 专属 Speculative Decoding,让 LLM 语音识别快 3.79 倍 Jun 24, 2026 从零理解 ASR:音频基础、Qwen3-ASR 架构,以及离线 vs 流式推理原理