DeepSeek-V3.2 在 V3.1-Terminus 的 128K 上下文 checkpoint 上继续预训练,核心是引入 DeepSeek 稀疏注意力(DSA):用轻量索引器为每个 query token 挑选关键上下文。本文梳理其预训练与后训练配方、专家蒸馏与基础设施设计。
DeepSeek-V3.2 技术报告摘要
论文:DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
团队:DeepSeek-AI
时间:2025.12(arXiv:2512.02556)
页数:23页
1. 预训练 Recipe(Continued Pre-Training)
注:V3.2 不是从头训练,而是从 DeepSeek-V3.1-Terminus(已扩展到128K上下文)的checkpoint做continued pre-training,核心目的是引入 DSA 稀疏注意力。
训练策略
| 项目 | 详情 |
|---|---|
| 基座 | DeepSeek-V3.1-Terminus(128K上下文) |
| 架构改动 | 唯一变化:引入 DeepSeek Sparse Attention (DSA) |
| 训练阶段 | 两阶段 continued pre-training |
| 训练数据分布 | 完全对齐 V3.1-Terminus 的 128K 长上下文扩展数据 |
关键设计:DeepSeek Sparse Attention (DSA)
DSA 由两个组件构成:
① Lightning Indexer(轻量索引器)
- 为每个 query token 计算其对所有前序token 的 index score
- 公式:I_{t,s} = Σ{j=1}^{H_I} w{t,j}^I · ReLU(q_{t,j}^I · k_s^I)
- H_I 为 indexer head 数量(少量),支持 FP8 计算,计算效率极高
- 复杂度仍为 O(L²),但计算量远小于完整 MLA
② Fine-grained Token Selection(细粒度token选择)
- 根据 index score 选出top-k 个 token
- 仅对选中的 k 个 token 执行完整 attention
- 主模型注意力复杂度降至 O(Lk),k≪ L
基于 MLA 的实现:DSA 在 MLA 的MQA 模式下实现,每个 latent vector(KV entry)共享给所有 query head,确保 kernel 层面的计算效率。
短序列优化:短序列 prefilling 场景下使用 masked MHA 模式模拟 DSA,效率更高。
Infra 设计
| 项目 | 详情 |
|---|---|
| 部署硬件 | H800 GPU 集群 |
| 推理成本 | 长上下文场景显著降低(Figure 3 对比) |
2. 后训练 Recipe (SFT - Specialist Distillation)
训练策略
| 项目 | 详情 |
|---|---|
| 方法 | Specialist Distillation |
| 机制 | 为每个任务域训练一个专家模型(specialist),再用专家模型生成数据蒸馏到最终模型 |
| 覆盖域 | 数学、编程、通用逻辑推理、通用Agent任务、Agentic Coding、Agentic Search(6个域) |
| 模式 | 每个域同时支持 thinking mode(长CoT)和 non-thinking mode(直接回答) |
| 效果 | 蒸馏数据训练的模型接近专家模型性能,后续RL可弥合剩余差距 |
训练数据
| 项目 | 详情 |
|---|---|
| 来源 | 各域专家模型生成(每个specialist经过大规模RL训练) |
| thinking数据 | 使用 system prompt 显式要求推理,用<think></think> 标注推理路径 |
| non-thinking数据 | system prompt 包含 tool call 指引,直接生成回答 |
3. RL Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 算法 | GRPO |
| 训练模式 | MixedRL Training:reasoning + agent + human alignment合并到一个RL 阶段(避免多阶段的灾难性遗忘) |
| 奖励设计 | reasoning/agent 任务:rule-based outcome reward + length penalty + language consistency reward;通用任务:generative reward model(每个 prompt 有独立评估 rubrics) |
关键设计:Scaling GRPO
① Unbiased KL Estimate
- 问题:原始 K3 estimator 当π_θ ≪ π_ref 时梯度权重无界,导致训练不稳定
- 做法:利用 importance-sampling ratio (π_θ/π_old) 校正 K3 estimator,使 KL 梯度无偏
- 效果:消除系统性估计误差,稳定收敛
② 不同域使用不同 KL 强度
- 原文提到不同 domain 受益于不同的 β(KL penalty strength)
关键设计:Agentic Task Synthesis Pipeline
① Search Agent数据合成
- 多agent pipeline:先从大规模web语料中采样 informative long-tail entities
- Question-construction agent 使用搜索工具(可配深度/广度)探索 entity 并构造QA pairs
- 多个异构 answer-generation agents(不同checkpoint/prompt)生成多样化候选回答
- Verification agent 多轮搜索验证答案正确性,仅保留ground-truth正确且所有候选都可验证错误的样本
- 跨多语言、多领域、多难度
② 合成通用 Agent任务
- 环境和prompt 均为合成构造
- 验证:frontier closed-source models 在这些合成任务上最高只有 62% 准确率,证明任务足够难
- 泛化性:仅在合成数据上做 RL 即可泛化到不同下游任务和真实环境
③ Agentic 任务规模
| 任务类型 | 数量 | 环境 | Prompt来源 |
|---|---|---|---|
| code agent | 24,667 | real | extracted |
| search agent | 50,275 | real | synthesized |
| general agent | 4,417 | synthesized | synthesized |
| code interpreter | 5,908 | real | extracted |
关键设计:DeepSeek-V3.2-Speciale
- 仅使用 reasoning 数据做 RL,降低 length penalty
- 引入 DeepSeekMath-V2的数据集和 reward method增强数学证明能力
- 结果:IMO 2025 Gold (35/42),IOI 2025 Gold (492/600),ICPC WF 2025 Gold (10/12)
Infra 设计
| 项目 | 详情 |
|---|---|
| 原文未详述RL Infra 细节 | - |
4. 关键亮点
- DSA (DeepSeek Sparse Attention):lightning indexer + top-k token selection,主模型注意力从 O(L²) 降至 O(Lk),长上下文推理成本大幅降低,性能不退化
- Specialist Distillation + Mixed RL:6域专家模型蒸馏 + 单阶段混合RL,避免灾难性遗忘
- Unbiased KL Estimate:校正 GRPO 的 KL 梯度偏差,稳定大规模 RL scaling
- Large-Scale Agentic Task Synthesis:多agent pipeline 合成 8.5万+ agentic 任务,泛化到真实环境
- Speciale 变体:放宽 length penalty +纯 reasoning RL → IMO/IOI/ICPC 三金

