| Sep 23, 2026 | HiSparse | 稀疏注意力省了算力却没省显存,长上下文推理的容量墙怎么破 |
| Sep 10, 2026 | DeepSeek V4.1 Flash | 后训练没有新算法,Agent 能力从哪来? |
| Sep 02, 2026 | Kimi K3技术详解系列(一):KDA 与 Hybrid Attention |
| Sep 02, 2026 | Kimi K3技术详解系列(三):训练与 Serving Infra |
| Aug 16, 2026 | arXiv'26 | Cross-Model KV Transfer:小模型算好的 KV Cache,大模型直接接着用 |
| Aug 15, 2026 | arXiv'25 | DSA 让 DeepSeek-V3.2 的长上下文 attention 少读一些 KV |
| Aug 14, 2026 | arXiv'26 | vToken:KV Cache 淘汰后,为什么显存还是回收不回来? |
| Aug 13, 2026 | ICML'24 | Quest:不用扫描全部 KV Cache,Query-aware Sparsity 如何加速长上下文推理 |
| Aug 13, 2026 | arXiv'26 | OasisKV:KV Cache 超出 HBM 后,如何用 Lookahead Sparse Prefetch 把等待藏起来 |
| Aug 12, 2026 | ASPLOS'26 | SpeContext 让小模型先圈出重要 KV Cache,长上下文推理吞吐最高提升 24.89 倍 |
| Jul 29, 2026 | EuroSys'26 | eLLM:显存被 KV Cache 榨干的时候,SM 却在摸鱼 |
| Jul 29, 2026 | OSDI'26 | ECHO:稀疏 attention 省了算力,却把 HBM 撑爆了 |
| Jul 13, 2026 | 长音频转写慢 10 倍、99% 的 Attention 在白做功——MURMUR 是怎么解决的 |
| Jul 06, 2026 | vllm v1 源码精读(三):KV Cache 管理、Chunked Prefill 与异步架构 |
| Jun 26, 2026 | 长音频转写慢 10 倍,99% 的 Attention 在白做功——MURMUR 如何破解这道难题 |
| Jun 12, 2026 | ICML'26 | Transformer 真的需要三个投影矩阵吗?Q-K=V 让 KV Cache 直接砍半 |
| Jun 11, 2026 | arXiv'26 | FlashMemory-DeepSeek-V4:用 13.5% 的显存干 100% 的活,超长上下文推理的 less is more |
| May 19, 2026 | LLM Agent Memory 全景拆解:从 RAG 到 KV Cache 到参数写入,100+ 篇工作的方法演进与真实取舍 |
| May 17, 2026 | EuroSys'26 | TokenFlow:让 LLM 流式输出真正「流」起来 |
| May 14, 2026 | EuroSys'26 | MFS 把整个 model family 融进一套嵌套模型,KVCache 跨 tier 直接共享 |
| May 14, 2026 | EuroSys'26 | KUNSERVE 把冗余参数副本临时让给 KVCache,P99 TTFT 最快降 72× |
| May 14, 2026 | FAST'26 | SolidAttention 把 SSD 搬进 LLM 推理,笔记本也能跑 128k 上下文 |
| May 14, 2026 | KV Cache 的两层存储到底卡在哪?FAST'26 这篇论文给出了答案 |
| May 12, 2026 | MoE 推理的 KV Cache 问题,PiKV 是怎么解的 |
| May 10, 2026 | 说人话理解 EPIC:KV Cache 复用的「编译-链接」范式(附可运行代码复现) |
| Apr 27, 2026 | KV Cache 也能「语义共享」?SemShareKV 用 LSH 做到了 |
| Apr 27, 2026 | 多 Agent 协作不需要说「人话」?LatentMAS 让 LLM 在隐空间里直接协作 |
| Apr 26, 2026 | KVCOMM:让多 Agent 系统的 KV Cache 真正“通起来”,TTFT 直接砍掉 7.8 倍 |
| Apr 26, 2026 | KV Cache 复用的第三条路:FAST 2026 CacheSlide 是怎么解决 Agent 推理的位置漂移问题的 |
| Apr 26, 2026 | 让不同 LLM 之间共享 KV Cache?DroidSpeak 是怎么做到的 |