Jul 15, 2026 Self-Speculative Decoding 简史:不引入额外模型,用自己给自己打草稿这件事到底能走多远 Jul 07, 2026 推理模型做 decode,GPU 只有 3% 在干活——SparseSpec 把稀疏 Attention 变成了 2.1× 加速 Jun 30, 2026 ICLR'25 | SWIFT:不训练不搜索,Self-Speculative Decoding 的即插即用版 Jun 30, 2026 ACL'24 | LayerSkip:Meta 把 Self-Speculative Decoding 从头训到尾,直接干到 2.16×