DeepSeek-V4 技术报告解读:混合注意力与百万 Token 上下文

梳理 DeepSeek-V4 面向百万 token 上下文的架构设计:压缩稀疏注意力 CSA 与 HCA 交替的混合注意力、V4-Pro 的架构参数、预训练与后训练的 On-Policy 蒸馏配方,以及支撑超长上下文的基础设施设计。

DeepSeek-V4 技术报告摘要

论文:DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
团队:DeepSeek-AI
时间:2026.04(arXiv)
页数:58页


1. 预训练 Recipe

训练策略

项目详情
模型V4-Pro: 1.6T总参/49B激活; V4-Flash: 284B总参/13B激活
架构MoE +混合注意力(CSA+HCA交替) + mHC + MTP
上下文原生支持 1M tokens
优化器Muon(大部分参数)+ AdamW(embedding/head/RMSNorm)
训练Token32T+
序列长度调度4K → 16K → 64K → 1M 渐进扩展
注意力稀疏化调度前1T tokens使用dense attention → 64K阶段引入sparse attention → warmup lightning indexer后固定为sparse
Batch调度小batch起步 → 逐步增至75.5M tokens/batch
LRwarmup 2000步 → 2.7e-4 → cosine decay到2.7e-5
MTP depth1

关键架构设计

① Hybrid Attention: CSA + HCA 交替

  • CSA (Compressed Sparse Attention):先将每m=4个token的KV压缩为1个entry(Token-Level Compressor),再在压缩后的entry上应用DSA(lightning indexer + top-k=1024选择)。额外保留sliding window(128tokens)的未压缩KV用于局部细粒度依赖
  • HCA (Heavily Compressed Attention):更激进压缩,每m’=128个token压缩为1个entry,不做sparse selection,直接全量attention(因为压缩后数量已很少)
  • 交替排列:前2层用HCA,后续层CSA和HCA交替
  • 效果:V4-Pro在1M context下仅需V3.2的27% FLOPs和10% KV cache

② Manifold-Constrained Hyper-Connections (mHC)

  • 改进残差连接:将残差映射矩阵B_l约束到双随机矩阵流形(Birkhoff polytope)
  • 保证谱范数 ≤1,信号传播非扩张(non-expansive),增强数值稳定性
  • 使用 Sinkhorn-Knopp算法(20次迭代)投影到双随机矩阵
  • 输入/输出映射使用Sigmoid约束为非负有界
  • 参数为 dynamic(input-dependent)+ static分解
  • 扩展因子 n_hc=4
  • Wall-time overhead仅6.7%

③ Muon优化器

  • 对MoE参数:独立优化每个expert,flatten所有expert的down/up/gate矩阵后分布到所有rank
  • Newton-Schulz迭代在BF16下仍稳定,利用此特性将MoE梯度量化到BF16同步(通信量减半)
  • 使用two-phase approach(all-to-all + FP32local sum)替代传统reduce-scatter,保持数值鲁棒性

    V4-Pro 架构参数

参数
Layers61
Hidden dim7168
Query heads128
Head dim512
Query compression dim1536
Experts1shared + 384 routed, top-6 activated
CSA compression rate m4
HCA compression rate m’128
Indexer heads64, dim=128
Attention top-k1024
SWA window128
mHC expansion4

训练数据

项目详情
总量V4-Flash: 32T tokens; V4-Pro: 33T tokens
基础在 DeepSeek-V3 预训练数据基础上扩展
数据组成数学、代码、网页、长文档、多语言等
Web数据改进新增过滤策略去除 batched auto-generated 和templated content,缓解 model collapse
代码增强mid-training阶段引入 agentic data 增强编码能力
多语言扩大多语言语料规模,改善long-tail knowledge跨文化覆盖
长文档重点策展科学论文、技术报告等体现学术价值的长文档
预处理沿用V3策略:token-splitting、FIM (Fill-in-Middle)、跨来源文档pack减少截断
与V3的区别引入 sample-level attention masking(V3未使用)
Tokenizer沿用V3(128K词表),新增少量special tokens用于context construction
数据配比细节原文未详述各类数据的具体配比

Infra设计

项目详情
硬件NVIDIA GPU +华为昇腾 NPU 双平台验证
EP方案细粒度通信-计算 overlap:将experts切分为waves,Dispatch/Combine与Linear-1/Linear-2 在统一pipeline中融合执行
EP加速通用推理 1.50~1.73×, latency-sensitive(RL rollout/agent) up to 1.96×
开源kernelMegaMoE(CUDA mega-kernel,作为DeepGEMM组件)
激活checkpointTensor-level细粒度checkpoint:基于TorchFX trace计算图,自动识别最小recomputation subgraph,无额外overhead
mHC优化fused kernel + selective recomputation + DualPipe 1F1B调整
长上下文CPContextual Parallelism:CSA/HCA的压缩KV在CP rank间all-gather后重组
KV cache存储On-disk KV cache:CSA/HCA压缩entry直接存盘;SWA entry支持3种策略(Full Caching / Periodic Checkpointing / 第3种未截取)

2. 后训练 Recipe (SFT - On-Policy Distillation)

训练策略

项目详情
方法Multi-teacher On-Policy Distillation (OPD)
机制训练N个domain-specific expert → student在自身生成的trajectory上学习teacher的输出分布
目标函数L_OPD(θ) = Σ w_i · D_KL(π_θ‖ π_Ei)
覆盖域数学、编程、逻辑推理、Agent任务、Code Agent、Search Agent +写作/通用QA
模式thinking mode(标记)+ non-thinking mode
Logits存储优化仅缓存hidden states到集中buffer,训练时on-the-fly通过prediction head重建logits,避免显式logits物化的内存负担
Teacher head内存优化按teacher index排序训练样本,确保每个mini-batch最多加载一个teacher head

关键设计:Quick Instruction

  • 在输入序列末尾追加特殊token,每个token对应一个辅助任务(是否搜索、意图识别、生成title等)
  • 复用已计算的KV cache,无需为辅助任务重复prefilling
  • 多个辅助任务可并行执行
  • 效果:显著降低TTFT,消除维护额外小模型的工程开销

3. RL Recipe

训练策略

项目详情
算法GRPO
训练模式MixedRL:reasoning + agent + human alignment单阶段
奖励设计easy-to-verify 任务:rule-based verifiers;hard-to-verify 任务:Generative Reward Model (GRM)
推理控制ThinkMax mode:通过system prompt注入指令要求最大推理深度
Speciale变体V4-Pro-Max:最大推理effort

关键设计:Generative Reward Model (GRM)

  • 不使用传统scalar reward model
  • 为hard-to-verify任务构造rubric-guidedRL数据
  • 使用 GRM 评估 policy trajectory
  • 关键:对GRM本身也施加RL优化——actor网络同时充当GRM
  • 联合优化模型的评判能力和生成能力
  • 效果:仅需少量diverse人工标注即可泛化到复杂任务

    训练数据

项目详情
Agent任务同V3.2类似的agentic task合成pipeline
原文未详述RL数据量-

Infra 设计

项目详情
RL框架支持百万token context的RL
Rollout可抢占+容错 rollout service
数据格式分解为lightweight metadata + heavy per-token fields;metadata全局shuffle,heavy fields shared-memory加载+即用即释
SandboxDSec (DeepSeek Elastic Compute):Rust实现的API gateway + per-host agent + cluster monitor,单集群管理数十万并发sandbox实例
Token-level WALWrite-Ahead Log for token-level fault tolerance(rollout中断时无需重新decode)

4. 关键亮点

  1. CSA+HCA混合注意力:压缩+稀疏双管齐下,1M context仅需V3.2的27% FLOPs和10% KV cache
  2. mHC (Manifold-Constrained Hyper-Connections):双随机矩阵流形约束残差连接,增强深层网络稳定性,仅6.7% overhead
  3. Muon优化器:BF16 Newton-Schulz + 通信量减半,支持MoE高效训练
  4. 细粒度EP fusion:communication hidden under computation,1.5~1.96× 加速
  5. GRM:actor即evaluator,联合优化生成+评判能力,少量标注泛化
  6. OPD多teacher蒸馏:在student自身trajectory上学teacher分布,logits on-the-fly重建
  7. Quick Instruction:复用KV cache并行执行辅助任务,降低TTFT
  8. DSec sandbox:Rust实现,10万+并发sandbox支撑agentic RL
本文结束 感谢您的阅读