梳理 DeepSeek-V4 面向百万 token 上下文的架构设计:压缩稀疏注意力 CSA 与 HCA 交替的混合注意力、V4-Pro 的架构参数、预训练与后训练的 On-Policy 蒸馏配方,以及支撑超长上下文的基础设施设计。
DeepSeek-V4 技术报告摘要
论文:DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
团队:DeepSeek-AI
时间:2026.04(arXiv)
页数:58页
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 模型 | V4-Pro: 1.6T总参/49B激活; V4-Flash: 284B总参/13B激活 |
| 架构 | MoE +混合注意力(CSA+HCA交替) + mHC + MTP |
| 上下文 | 原生支持 1M tokens |
| 优化器 | Muon(大部分参数)+ AdamW(embedding/head/RMSNorm) |
| 训练Token | 32T+ |
| 序列长度调度 | 4K → 16K → 64K → 1M 渐进扩展 |
| 注意力稀疏化调度 | 前1T tokens使用dense attention → 64K阶段引入sparse attention → warmup lightning indexer后固定为sparse |
| Batch调度 | 小batch起步 → 逐步增至75.5M tokens/batch |
| LR | warmup 2000步 → 2.7e-4 → cosine decay到2.7e-5 |
| MTP depth | 1 |
关键架构设计
① Hybrid Attention: CSA + HCA 交替
- CSA (Compressed Sparse Attention):先将每m=4个token的KV压缩为1个entry(Token-Level Compressor),再在压缩后的entry上应用DSA(lightning indexer + top-k=1024选择)。额外保留sliding window(128tokens)的未压缩KV用于局部细粒度依赖
- HCA (Heavily Compressed Attention):更激进压缩,每m’=128个token压缩为1个entry,不做sparse selection,直接全量attention(因为压缩后数量已很少)
- 交替排列:前2层用HCA,后续层CSA和HCA交替
- 效果:V4-Pro在1M context下仅需V3.2的27% FLOPs和10% KV cache
② Manifold-Constrained Hyper-Connections (mHC)
- 改进残差连接:将残差映射矩阵B_l约束到双随机矩阵流形(Birkhoff polytope)
- 保证谱范数 ≤1,信号传播非扩张(non-expansive),增强数值稳定性
- 使用 Sinkhorn-Knopp算法(20次迭代)投影到双随机矩阵
- 输入/输出映射使用Sigmoid约束为非负有界
- 参数为 dynamic(input-dependent)+ static分解
- 扩展因子 n_hc=4
- Wall-time overhead仅6.7%
③ Muon优化器
- 对MoE参数:独立优化每个expert,flatten所有expert的down/up/gate矩阵后分布到所有rank
- Newton-Schulz迭代在BF16下仍稳定,利用此特性将MoE梯度量化到BF16同步(通信量减半)
- 使用two-phase approach(all-to-all + FP32local sum)替代传统reduce-scatter,保持数值鲁棒性
V4-Pro 架构参数
| 参数 | 值 |
|---|---|
| Layers | 61 |
| Hidden dim | 7168 |
| Query heads | 128 |
| Head dim | 512 |
| Query compression dim | 1536 |
| Experts | 1shared + 384 routed, top-6 activated |
| CSA compression rate m | 4 |
| HCA compression rate m’ | 128 |
| Indexer heads | 64, dim=128 |
| Attention top-k | 1024 |
| SWA window | 128 |
| mHC expansion | 4 |
训练数据
| 项目 | 详情 |
|---|---|
| 总量 | V4-Flash: 32T tokens; V4-Pro: 33T tokens |
| 基础 | 在 DeepSeek-V3 预训练数据基础上扩展 |
| 数据组成 | 数学、代码、网页、长文档、多语言等 |
| Web数据改进 | 新增过滤策略去除 batched auto-generated 和templated content,缓解 model collapse |
| 代码增强 | mid-training阶段引入 agentic data 增强编码能力 |
| 多语言 | 扩大多语言语料规模,改善long-tail knowledge跨文化覆盖 |
| 长文档 | 重点策展科学论文、技术报告等体现学术价值的长文档 |
| 预处理 | 沿用V3策略:token-splitting、FIM (Fill-in-Middle)、跨来源文档pack减少截断 |
| 与V3的区别 | 引入 sample-level attention masking(V3未使用) |
| Tokenizer | 沿用V3(128K词表),新增少量special tokens用于context construction |
| 数据配比细节 | 原文未详述各类数据的具体配比 |
Infra设计
| 项目 | 详情 |
|---|---|
| 硬件 | NVIDIA GPU +华为昇腾 NPU 双平台验证 |
| EP方案 | 细粒度通信-计算 overlap:将experts切分为waves,Dispatch/Combine与Linear-1/Linear-2 在统一pipeline中融合执行 |
| EP加速 | 通用推理 1.50~1.73×, latency-sensitive(RL rollout/agent) up to 1.96× |
| 开源kernel | MegaMoE(CUDA mega-kernel,作为DeepGEMM组件) |
| 激活checkpoint | Tensor-level细粒度checkpoint:基于TorchFX trace计算图,自动识别最小recomputation subgraph,无额外overhead |
| mHC优化 | fused kernel + selective recomputation + DualPipe 1F1B调整 |
| 长上下文CP | Contextual Parallelism:CSA/HCA的压缩KV在CP rank间all-gather后重组 |
| KV cache存储 | On-disk KV cache:CSA/HCA压缩entry直接存盘;SWA entry支持3种策略(Full Caching / Periodic Checkpointing / 第3种未截取) |
2. 后训练 Recipe (SFT - On-Policy Distillation)
训练策略
| 项目 | 详情 |
|---|---|
| 方法 | Multi-teacher On-Policy Distillation (OPD) |
| 机制 | 训练N个domain-specific expert → student在自身生成的trajectory上学习teacher的输出分布 |
| 目标函数 | L_OPD(θ) = Σ w_i · D_KL(π_θ‖ π_Ei) |
| 覆盖域 | 数学、编程、逻辑推理、Agent任务、Code Agent、Search Agent +写作/通用QA |
| 模式 | thinking mode(标记)+ non-thinking mode |
| Logits存储优化 | 仅缓存hidden states到集中buffer,训练时on-the-fly通过prediction head重建logits,避免显式logits物化的内存负担 |
| Teacher head内存优化 | 按teacher index排序训练样本,确保每个mini-batch最多加载一个teacher head |
关键设计:Quick Instruction
- 在输入序列末尾追加特殊token,每个token对应一个辅助任务(是否搜索、意图识别、生成title等)
- 复用已计算的KV cache,无需为辅助任务重复prefilling
- 多个辅助任务可并行执行
- 效果:显著降低TTFT,消除维护额外小模型的工程开销
3. RL Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 算法 | GRPO |
| 训练模式 | MixedRL:reasoning + agent + human alignment单阶段 |
| 奖励设计 | easy-to-verify 任务:rule-based verifiers;hard-to-verify 任务:Generative Reward Model (GRM) |
| 推理控制 | ThinkMax mode:通过system prompt注入指令要求最大推理深度 |
| Speciale变体 | V4-Pro-Max:最大推理effort |
关键设计:Generative Reward Model (GRM)
- 不使用传统scalar reward model
- 为hard-to-verify任务构造rubric-guidedRL数据
- 使用 GRM 评估 policy trajectory
- 关键:对GRM本身也施加RL优化——actor网络同时充当GRM
- 联合优化模型的评判能力和生成能力
- 效果:仅需少量diverse人工标注即可泛化到复杂任务
训练数据
| 项目 | 详情 |
|---|---|
| Agent任务 | 同V3.2类似的agentic task合成pipeline |
| 原文未详述RL数据量 | - |
Infra 设计
| 项目 | 详情 |
|---|---|
| RL框架 | 支持百万token context的RL |
| Rollout | 可抢占+容错 rollout service |
| 数据格式 | 分解为lightweight metadata + heavy per-token fields;metadata全局shuffle,heavy fields shared-memory加载+即用即释 |
| Sandbox | DSec (DeepSeek Elastic Compute):Rust实现的API gateway + per-host agent + cluster monitor,单集群管理数十万并发sandbox实例 |
| Token-level WAL | Write-Ahead Log for token-level fault tolerance(rollout中断时无需重新decode) |
4. 关键亮点
- CSA+HCA混合注意力:压缩+稀疏双管齐下,1M context仅需V3.2的27% FLOPs和10% KV cache
- mHC (Manifold-Constrained Hyper-Connections):双随机矩阵流形约束残差连接,增强深层网络稳定性,仅6.7% overhead
- Muon优化器:BF16 Newton-Schulz + 通信量减半,支持MoE高效训练
- 细粒度EP fusion:communication hidden under computation,1.5~1.96× 加速
- GRM:actor即evaluator,联合优化生成+评判能力,少量标注泛化
- OPD多teacher蒸馏:在student自身trajectory上学teacher分布,logits on-the-fly重建
- Quick Instruction:复用KV cache并行执行辅助任务,降低TTFT
- DSec sandbox:Rust实现,10万+并发sandbox支撑agentic RL

