稀疏注意力
an archive of posts with this tag
| Sep 23, 2026 | HiSparse | 稀疏注意力省了算力却没省显存,长上下文推理的容量墙怎么破 |
|---|---|
| Aug 15, 2026 | arXiv'25 | DSA 让 DeepSeek-V3.2 的长上下文 attention 少读一些 KV |
| Aug 13, 2026 | arXiv'26 | OasisKV:KV Cache 超出 HBM 后,如何用 Lookahead Sparse Prefetch 把等待藏起来 |
| Aug 12, 2026 | ASPLOS'26 | SpeContext 让小模型先圈出重要 KV Cache,长上下文推理吞吐最高提升 24.89 倍 |
| Jul 29, 2026 | OSDI'26 | ECHO:稀疏 attention 省了算力,却把 HBM 撑爆了 |