DeepSeek-V3.2 技术报告解读:稀疏注意力与专家蒸馏

DeepSeek-V3.2 在 V3.1-Terminus 的 128K 上下文 checkpoint 上继续预训练,核心是引入 DeepSeek 稀疏注意力(DSA):用轻量索引器为每个 query token 挑选关键上下文。本文梳理其预训练与后训练配方、专家蒸馏与基础设施设计。

DeepSeek-V3.2 技术报告摘要

论文:DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
团队:DeepSeek-AI
时间:2025.12(arXiv:2512.02556)
页数:23页


1. 预训练 Recipe(Continued Pre-Training)

注:V3.2 不是从头训练,而是从 DeepSeek-V3.1-Terminus(已扩展到128K上下文)的checkpoint做continued pre-training,核心目的是引入 DSA 稀疏注意力。

训练策略

项目详情
基座DeepSeek-V3.1-Terminus(128K上下文)
架构改动唯一变化:引入 DeepSeek Sparse Attention (DSA)
训练阶段两阶段 continued pre-training
训练数据分布完全对齐 V3.1-Terminus 的 128K 长上下文扩展数据

关键设计:DeepSeek Sparse Attention (DSA)

DSA 由两个组件构成:

① Lightning Indexer(轻量索引器)

  • 为每个 query token 计算其对所有前序token 的 index score
  • 公式:I_{t,s} = Σ{j=1}^{H_I} w{t,j}^I · ReLU(q_{t,j}^I · k_s^I)
  • H_I 为 indexer head 数量(少量),支持 FP8 计算,计算效率极高
  • 复杂度仍为 O(L²),但计算量远小于完整 MLA

② Fine-grained Token Selection(细粒度token选择)

  • 根据 index score 选出top-k 个 token
  • 仅对选中的 k 个 token 执行完整 attention
  • 主模型注意力复杂度降至 O(Lk),k≪ L

基于 MLA 的实现:DSA 在 MLA 的MQA 模式下实现,每个 latent vector(KV entry)共享给所有 query head,确保 kernel 层面的计算效率。

短序列优化:短序列 prefilling 场景下使用 masked MHA 模式模拟 DSA,效率更高。

Infra 设计

项目详情
部署硬件H800 GPU 集群
推理成本长上下文场景显著降低(Figure 3 对比)

2. 后训练 Recipe (SFT - Specialist Distillation)

训练策略

项目详情
方法Specialist Distillation
机制为每个任务域训练一个专家模型(specialist),再用专家模型生成数据蒸馏到最终模型
覆盖域数学、编程、通用逻辑推理、通用Agent任务、Agentic Coding、Agentic Search(6个域)
模式每个域同时支持 thinking mode(长CoT)和 non-thinking mode(直接回答)
效果蒸馏数据训练的模型接近专家模型性能,后续RL可弥合剩余差距

训练数据

项目详情
来源各域专家模型生成(每个specialist经过大规模RL训练)
thinking数据使用 system prompt 显式要求推理,用<think></think> 标注推理路径
non-thinking数据system prompt 包含 tool call 指引,直接生成回答

3. RL Recipe

训练策略

项目详情
算法GRPO
训练模式MixedRL Training:reasoning + agent + human alignment合并到一个RL 阶段(避免多阶段的灾难性遗忘)
奖励设计reasoning/agent 任务:rule-based outcome reward + length penalty + language consistency reward;通用任务:generative reward model(每个 prompt 有独立评估 rubrics)

关键设计:Scaling GRPO

① Unbiased KL Estimate

  • 问题:原始 K3 estimator 当π_θ ≪ π_ref 时梯度权重无界,导致训练不稳定
  • 做法:利用 importance-sampling ratio (π_θ/π_old) 校正 K3 estimator,使 KL 梯度无偏
  • 效果:消除系统性估计误差,稳定收敛

② 不同域使用不同 KL 强度

  • 原文提到不同 domain 受益于不同的 β(KL penalty strength)

关键设计:Agentic Task Synthesis Pipeline

① Search Agent数据合成

  • 多agent pipeline:先从大规模web语料中采样 informative long-tail entities
  • Question-construction agent 使用搜索工具(可配深度/广度)探索 entity 并构造QA pairs
  • 多个异构 answer-generation agents(不同checkpoint/prompt)生成多样化候选回答
  • Verification agent 多轮搜索验证答案正确性,仅保留ground-truth正确且所有候选都可验证错误的样本
  • 跨多语言、多领域、多难度

② 合成通用 Agent任务

  • 环境和prompt 均为合成构造
  • 验证:frontier closed-source models 在这些合成任务上最高只有 62% 准确率,证明任务足够难
  • 泛化性:仅在合成数据上做 RL 即可泛化到不同下游任务和真实环境

③ Agentic 任务规模

任务类型数量环境Prompt来源
code agent24,667realextracted
search agent50,275realsynthesized
general agent4,417synthesizedsynthesized
code interpreter5,908realextracted

关键设计:DeepSeek-V3.2-Speciale

  • 仅使用 reasoning 数据做 RL,降低 length penalty
  • 引入 DeepSeekMath-V2的数据集和 reward method增强数学证明能力
  • 结果:IMO 2025 Gold (35/42),IOI 2025 Gold (492/600),ICPC WF 2025 Gold (10/12)

    Infra 设计

项目详情
原文未详述RL Infra 细节-

4. 关键亮点

  1. DSA (DeepSeek Sparse Attention):lightning indexer + top-k token selection,主模型注意力从 O(L²) 降至 O(Lk),长上下文推理成本大幅降低,性能不退化
  2. Specialist Distillation + Mixed RL:6域专家模型蒸馏 + 单阶段混合RL,避免灾难性遗忘
  3. Unbiased KL Estimate:校正 GRPO 的 KL 梯度偏差,稳定大规模 RL scaling
  4. Large-Scale Agentic Task Synthesis:多agent pipeline 合成 8.5万+ agentic 任务,泛化到真实环境
  5. Speciale 变体:放宽 length penalty +纯 reasoning RL → IMO/IOI/ICPC 三金
本文结束 感谢您的阅读