Jul 22, 2026 arXiv'26 | Cassandra:不训练、不加显存,把 draft model 从 target 模型的 bit 里抠出来 Jul 15, 2026 Self-Speculative Decoding 简史:不引入额外模型,用自己给自己打草稿这件事到底能走多远 Jul 09, 2026 vllm v1 源码精读(五):从 generate() 到 Speculative Decoding 的完整计算流 Jun 30, 2026 EMNLP'23 | 不用额外模型,LLM 自己给自己加速——Self-Speculative Decoding 原理详解 Jun 25, 2026 SpecASR:ASR 专属 Speculative Decoding,让 LLM 语音识别快 3.79 倍 May 14, 2026 EuroSys'26 | MFS 把整个 model family 融进一套嵌套模型,KVCache 跨 tier 直接共享