语音识别
an archive of posts with this tag
| Sep 12, 2026 | arXiv'26 | 小米 CocktailASR-1 给 ASR 装上“选择性听觉”:参考语音当声纹 prompt,一个模型只录你一个人 |
|---|---|
| Aug 26, 2026 | arXiv'26 | TurboBias 2.0 让流式 ASR 的个性化词表真正跑进生产环境 |
| Aug 20, 2026 | AgenticASR:语音识别不用等你说完一整句话,就能边听边改 |
| Aug 03, 2026 | AmphionASR | 热词、目标说话人、耳语——四种条件化 ASR 塞进一个 1.7B SpeechLLM |
| Jul 28, 2026 | 106K star 的开源 ASR 老祖宗 | 重读 Whisper 原论文的每一个技术细节 |
| Jul 27, 2026 | ICML'26 Workshop | 韩英混说训好了,韩日混说能白拿吗?答案是:几乎不能 |
| Jun 30, 2026 | arXiv'26 | SSD for ASR:用 CTC 编码器打草稿,LLM 验证,语音识别也能推测解码 |
| Jun 24, 2026 | 从零理解 ASR:音频基础、Qwen3-ASR 架构,以及离线 vs 流式推理原理 |