Aug 15, 2026 DeepSeek V3.2 | DSA:Sparse Attention 这次真正写进了生产模型 Aug 13, 2026 arXiv'26 | OasisKV:KV Cache 超出 HBM 后,如何用 Lookahead Sparse Prefetch 把等待藏起来 Aug 12, 2026 ASPLOS'26 | SpeContext 让小模型先圈出重要 KV Cache,长上下文推理吞吐最高提升 24.89 倍 Jul 29, 2026 OSDI'26 | ECHO:稀疏 attention 省了算力,却把 HBM 撑爆了