| Aug 16, 2026 | arXiv'26 | Wind-MTP:百万上下文里,MTP 草稿头才是那个隐形税 |
| Aug 16, 2026 | arXiv'26 | Cross-Model KV Transfer:小模型算好的 KV Cache,大模型直接接着用 |
| Aug 16, 2026 | arXiv'26 | EcoSpec:MoE 投机解码别只顾接受率,草稿会把专家撒得到处都是 |
| Aug 16, 2026 | arXiv'26 | APEX:端侧 MoE 的专家预取,别再 top-k 一刀切了 |
| Aug 15, 2026 | DeepSeek V3.2 | DSA:Sparse Attention 这次真正写进了生产模型 |
| Aug 15, 2026 | arXiv'26 | DARTree:给 Diffusion Drafter 填一棵 AR 树,投机解码飙到 9.7× |
| Aug 15, 2026 | arXiv'26 | PCTree:DSpark 的草稿链换成树,接受长度白赚 30% |
| Aug 14, 2026 | DeepSeek NSA:Sparse Attention 不是新概念,但这次真的做对了 |
| Aug 14, 2026 | DSpark:DeepSeek 线上跑的投机解码,半自回归 + 置信度调度怎么做到的 |
| Aug 14, 2026 | ICML'26 | DFlash:用 Diffusion 模型干掉 AR Drafter,投机解码提速 6× |
| Aug 12, 2026 | LMSYS'26 | Unified Radix Cache:同一个 prefix,为什么不能只用一个 cache boundary? |
| Jul 30, 2026 | ISCA'26 最佳论文 | MoE 专家选择不是随机的,所以数据搬运可以提前预测 |
| Jul 29, 2026 | EuroSys'26 | eLLM:显存被 KV Cache 榨干的时候,SM 却在摸鱼 |
| Jul 29, 2026 | OSDI'26 | ECHO:稀疏 attention 省了算力,却把 HBM 撑爆了 |
| Jul 28, 2026 | DAC'26 | ExpertFlow 让 MoE 推理不再被显存卡脖子:单卡跑 Mixtral-8x7B,吞吐最高提升 10 倍 |
| Jul 27, 2026 | arXiv'26 | Foundry 把 LLM 冷启动的 CUDA Graph 捕获从 10 分钟压到 3.9 秒 |
| Jul 22, 2026 | arXiv'26 | 无损压缩逼近 Shannon 极限:你的 LLM 权重里一半以上的 bit 是白存的 |
| Jul 13, 2026 | 长音频转写慢 10 倍、99% 的 Attention 在白做功——MURMUR 是怎么解决的 |
| Jul 09, 2026 | vllm v1 源码精读(五):从 generate() 到 Speculative Decoding 的完整计算流 |
| Jul 07, 2026 | 投机解码到底能快多少?从理论建模到 closed-form 的完整推导 |
| Jun 25, 2026 | COLM'25 | PredGen:你还在说话,LLM 已经想好怎么回了 |
| Jun 24, 2026 | 从零理解 ASR:音频基础、Qwen3-ASR 架构,以及离线 vs 流式推理原理 |
| Jun 12, 2026 | ICML'26 | Transformer 真的需要三个投影矩阵吗?Q-K=V 让 KV Cache 直接砍半 |
| Jun 12, 2026 | UPenn & Meta | NF-CoT:当 LLM 的思维链不再是文字,而是连续概率流 |
| Jun 03, 2026 | ReMoE:只动 Router 就让 MoE 推理快 2 倍?这才是端侧 MoE 部署该有的姿势 |
| May 26, 2026 | arXiv'26 | Frontier:LLM 推理仿真器,端到端误差从 51.7% 降到 2.6% |
| May 17, 2026 | DAC'26 | ExpertFlow:让 MoE 大模型在单卡上跑起来,内存省 93%、速度快 10 倍 |
| May 14, 2026 | EuroSys'26 | LLMFolder 用常量折叠把 FFN 参数砍 80%,精度反超剪枝方法 65% |
| May 14, 2026 | FAST'26 | SolidAttention 把 SSD 搬进 LLM 推理,笔记本也能跑 128k 上下文 |
| May 14, 2026 | LLM 推理启动慢?华为用一个「可编程 Page Cache」把模型加载砍了 79% |
| May 14, 2026 | 延迟降47%!FineMoE如何用「细粒度」打破MoE推理的显存-延迟死局 |
| May 10, 2026 | 把 Dense LLM 变成 MoE 还能推理提速?NeurIPS 2024 Read-ME 做到了 |
| May 10, 2026 | 说人话理解 EPIC:KV Cache 复用的「编译-链接」范式(附可运行代码复现) |
| Apr 29, 2026 | MoE 推理的内存墙,被一块多芯粒芯片打穿了? |
| Apr 27, 2026 | KV Cache 也能「语义共享」?SemShareKV 用 LSH 做到了 |
| Apr 27, 2026 | 多 Agent 协作不需要说「人话」?LatentMAS 让 LLM 在隐空间里直接协作 |