Jul 07, 2026 推理模型做 decode,GPU 只有 3% 在干活——SparseSpec 把稀疏 Attention 变成了 2.1× 加速 Jun 30, 2026 ICLR'25 | SWIFT:不训练不搜索,Self-Speculative Decoding 的即插即用版 Jun 30, 2026 2025 | SSD for dLLMs:扩散语言模型也能用推测解码,最高 3.46× Jun 30, 2026 arXiv'26 | SSD for ASR:用 CTC 编码器打草稿,LLM 验证,语音识别也能推测解码 Jun 30, 2026 WWW'26 | SS-MoE:显存墙下的 MoE 推理,Self-Speculative Decoding 怎么救场? Jun 30, 2026 ACL'24 | LayerSkip:Meta 把 Self-Speculative Decoding 从头训到尾,直接干到 2.16×