DeepSeek V3.2 | DSA:Sparse Attention 这次真正写进了生产模型

DeepSeek V3.2 | DSA:Sparse Attention 这次真正写进了生产模型

原文:DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models


1. 前言:先把背景交代清楚

你有没有想过一个问题:NSA 那类”trainable sparse attention”论文里说的”可以直接从零预训练”,和”全球头部模型真的换掉 attention”之间,隔了多少步?

上个月聊 NSA 时我给的判断是:它证明了两件事,一是稀疏模式可以训出来不掉点,二是硬件对齐的 kernel 能让稀疏真正快起来。但”论文里能训”离”生产 API 默认开稀疏”还有一道天堑——你动的是 attention,是全模型每个 token 都要过的最核心计算,改坏了性能用户直接跑路,而且训练成本是几千万美元的级别,没人敢赌。

DeepSeek-V3.2 的回答是:赌了,而且赌赢了。 这是目前第一个(至少是目前最公开的)把训练时的稀疏 attention(DSA,DeepSeek Sparse Attention)写进主力开源大模型的技术报告:

  • 相比 V3.1-Terminus,构架的唯一改动就是 attention——其他全部不动;
  • 推理时核心 attention 复杂度从 $O(L^2)$ 降到 $O(L \cdot k)$,$k=2048$;
  • 训练分两步走:先用 21 亿 token 把”检索器”(lightning indexer)对齐到完整 attention 的分布,再在 943.7B token 上训练带稀疏 attention 的全体模型;
  • 最终效果不只是”没变慢”——常规版对标 GPT-5,高算力版 DeepSeek-V3.2-Speciale 超越 GPT-5、追平 Gemini-3.0-Pro,还拿了 IMO 2025 和 IOI 2025 的双金。

数据说话之前,先把最重要的架构问题讲清楚:稀疏 selection 这件事,DSA 具体是怎么做的。


2. DSA:Lightning Indexer + 动态 top-k 选择

DSA 的总体结构一句话:在标准 attention 之外,加一个轻量”打分器”(indexer),按它给的分数为每个 query 动态挑 top-k 个历史 KV,然后只在这 k 个上做 attention。

拆分结构:

  • Lightning Indexer:极轻的多头 ReLU 网络,对每个 (query token, 前序 token) 算一个标量 index score,全部浮点在 FP8 上算、head 数很少——作者明确说它的计算量远小于 V3.1-Terminus 里 MLA 本身;
  • Fine-grained 选择:每个 query 独立取出 top-k(k=2048)个 index score 最高的 KV 条目,其他一律不看。这是动态的、query 相关的选择,不是固定图样(窗口/全局 anchor 那种)——这是和 2020 年那批 sparse attention 最根本的分野;
  • 在 MLA 上的实例化:MLA 的 MQA 模式下,所有 query head 共享同一份 latent key-value,所以 indexer 只需要对”这份共享 latent”打分一次,检索出来的 top-k 天然被所有 head 复用,省查询次数也省带宽。

一句话总结 DSA 的精髓:把”稀疏模式”从手工设计的静态结构,降级成一个可以用梯度训练的小网络。 模式本身是学出来的,所以不需要你手写 “which tokens are important” 的启发式。

架构长这样(论文 Figure 2,DSA 挂在 MLA 上,右下角就是 indexer/top-k 检索那条小径):

DSA 注意力架构

我喜欢把 DSA 和 NSA 放在一起看构图:NSA 强调”hardware-aligned”(kernel 一起设计),DSA 强调”indexer + top-k 检索直接对到矩阵乘/检索硬件”——学术上是用两套说法,工程上其实是同一个目标:让稀疏 pattern 真的变成 GPU 上的高效内存访问,而不是理论 FLOPs


3. 怎么训:两阶段,把”稀疏”当成训练目标本身

DSA 的训练协议是我认为全篇最有工程价值的地方,它回答了直觉性疑问——”排名网络自己还没训好,稀疏 attention 怎么敢回传梯度?”答案是:两个阶段解耦。

阶段一:indexer 对齐(dense warm-up)。冻结整个主模型,只训 lightning indexer,用 KL 散度让它的打分分布收敛到完整 attention 的分布。量级:1000 步 × 每步 16 条 128K 序列 ≈ 2.1B token,学习率 1e-3。此时模型主体完全不稀疏。

阶段二:稀疏训练(sparse training)。解冻所有参数,主模型在”每 query 只看 indexer 挑出的 top-2048 个 KV”的条件下继续预训练,LM loss 只算主模型那路。量级:15,000 步 × 每步 480 条 128K 序列 ≈ 943.7B token,学习率 7.3e-6。

两个细节值得划重点:

  • 任何 step 都不存在”满了再稀疏”:模型从头到尾在稀疏约束下训练,训练分布 ≈ 推理分布——这正是 NSA 那篇说的”natively trainable”的题中之义,也是把 H2O/StreamingLLM 那种”训练完再硬剪”甩开一个时代的原因;
  • 没有 load-balancing 辅助 loss(就我读到的架构描述):准确性全部压在 indexer 对齐的质量上,训练能收敛,说明”用一个小模型预测 attention 冲量”这条路的假设是成立的。这也从侧面说明:sparse attention 的难点根本不在 kernel,在 selection 的训练信号怎么设计——和 MoE router 的训练是如出一辙的题。

4. 效率账:从 $O(L^2)$ 到 $O(Lk)$,看图说明一切

论文 Figure 3 直接放了推理成本随序列位置的曲线,对比 V3.1-Terminus(紫,dense MLA)和 V3.2(青,DSA)。两条线的差别不只是”矮了一点”,而是斜率的差别:dense 侧每 token 成本随 context 长度线性涨(要走全量 KV),稀疏侧涨的梯度明显平——长上下文吃掉的墙钟时间,一小段话就能看出来。

推理成本对比:dense MLA vs DSA

数字上:核心 attention 从 $O(L^2)$ 变成 $O(L \cdot 2048)$。也就是说,64K context 时 32K 个 KV 只需要检索 2K 个,剩下 30K 的 HBM 读取直接免单——decode 阶段每个 token 把过去的 KV 全从 HBM 读一遍的伤,终于不再随上下文线性爆炸。配合 MLA 的 latent 共享,检索返回的还是压缩后的 k 语义向量,带宽又省一层。

顺带一提:论文把 RL 的后训练 compute 提到了 预训练成本的 10%+,这也是 V3.2 相比 V3.1 提升的主因之一——但这不是本文重点,略过。


5. 效果与 Takeaway

5.1 性能没掉,还更好了

V3.2 在主流 benchmark 上追平 GPT-5;高算力变体 Speciale 超过 GPT-5、逼近 Gemini-3.0-Pro,IMO 2025 与 IOI 2025 双金。更值得玩味的对比是:DeepSeek-V3.2-Exp 上一代(九月的 sparse 实验版)ChatbotArena Elo 只比 V3.1-Terminus 高一点,AA-LCR 在 reasoning 模式下 +4 分——也就是说稀疏不是”保住了性能”,而是”顺手更好了”,因为整个 pipeline(更长 RL、更高效上下文)都因此受益。

5.2 个人 take(私货时间)

每次写这种生产型 tech report,最值钱的不是它又刷了几个榜,而是它暴露的”工程常识”:

  1. “只改 attention”是 blockbuster 级的产品决策。MoE、MLA、FP8,DeepSeek 都验证过了;最后一块要动刀的地方就是 attention,而 sparse 是被证明了”能训”之后才敢动的。NSA → DSA 这条线把”稀疏”从有论文争议推进到”旗舰模型默认配置”。
  2. 训练信号决定一切:indexer 用 KL 对齐、稀疏训练期 top-k 是 checkpoint 友好的,整个架构没有任何”硬凑”的辅助 loss。技术报告里每一处 math 都极俭省,这是很典型”系统出活”的气质。
  3. 对想跟风做 sparse 的工作室:直接抄 DSA 不一定行——它吃 128K 长序列预训练预算(943.7B token 稀疏训练 + 更早的 dense warm-up)。小预算团队想复刻,得默认”训练顺序 + 对齐方式”整套搬走,少哪一块都会掉点。

一句话:NSA 证明稀疏 attention “可以做对”,DSA 证明”生产线上也确实用起了”。 这中间差的那一大截,才是这一两年 LLM 推理论文最好写的地方。


如果这篇文章涉及的 Long Context、稀疏注意力、LLM 推理效率优化你想系统深入,可以看看我之前推出的《动手学AutoML:从 NAS 到大语言模型优化实战》,书里有专门章节系统讲 LLM 推理效率、KV Cache 与注意力机制优化,和本文分析的 DSA 是同一张蓝图上的内容。

动手学AutoML书籍封面

Flag Counter