DeepSeek-V4预览版架构调研报告:CSA+HCA混合注意力、Manifold超连接与V3升级全景

调研日期: 2026-07-28

数据来源: DeepSeek 官网、微信公众号公告、arXiv 技术报告 (2606.19348)、DeepSeek API 文档
版本说明: V4 当前为预览版 (Preview),部分技术细节可能在未来正式版中调整


一、模型概览

1.1 发布背景

DeepSeek-V4 预览版于 2026年4月24日 正式发布并同步开源,标志着 DeepSeek 进入百万上下文普惠时代。技术报告于同年4月26日上传至 arXiv (编号 2606.19348)。

1.2 模型版本

V4 系列采用双版本策略,满足不同场景需求:

维度DeepSeek-V4-ProDeepSeek-V4-Flash
定位性能旗舰版高效经济版
总参数量1.6T (1.6万亿)284B (2840亿)
激活参数49B (490亿)13B (130亿)
上下文长度1M tokens1M tokens
最大输出长度384K tokens384K tokens
并发限制 (API)5002500
推理模式思考/非思考 (可切换)思考/非思考 (可切换)
reasoning_efforthigh / maxhigh / max

1.3 API 定价 (人民币 / 百万 tokens)

计费项V4-FlashV4-Pro
输入 (缓存命中)¥0.02¥0.025
输入 (缓存未命中)¥1¥3
输出¥2¥6

二、核心架构创新

2.1 整体架构

DeepSeek-V4 延续了 MoE (Mixture-of-Experts) 架构路线,但在注意力机制、残差连接和优化器三个核心维度进行了重大创新。

text
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
┌─────────────────────────────────────────────────────┐
│ DeepSeek-V4 架构 │
├─────────────────────────────────────────────────────┤
│ │
│ ┌─────────────┐ ┌─────────────┐ ┌───────────┐ │
│ │ 混合注意力 │ │ Manifold- │ │ MoE │ │
│ │ 机制 │ │ Constrained│ │ 专家路由 │ │
│ │ CSA + HCA │ │ Hyper-Conn │ │ │ │
│ └─────────────┘ └─────────────┘ └───────────┘ │
│ ↕ ↕ ↕ │
│ ┌─────────────────────────────────────────────┐ │
│ │ Muon 优化器 │ │
│ │ (加速收敛 + 训练稳定性) │ │
│ └─────────────────────────────────────────────┘ │
│ ↕ │
│ ┌─────────────────────────────────────────────┐ │
│ │ 32T+ tokens 高质量预训练 │ │
│ │ + 全面的后训练管线 │ │
│ └─────────────────────────────────────────────┘ │
└─────────────────────────────────────────────────────┘

2.2 混合注意力机制 (CSA + HCA)

这是 V4 最核心的架构突破。V4 放弃了 V3 时期的单一 MLA (Multi-head Latent Attention),转而采用混合注意力架构

2.2.1 Compressed Sparse Attention (CSA) — 压缩稀疏注意力

  • token 维度进行压缩,大幅减少长上下文场景下的计算量
  • 稀疏注意力模式,只关注关键 token 子集,而非全局注意力
  • 目标:将 1M 上下文的计算开销降至可承受范围

2.2.2 Heavily Compressed Attention (HCA) — 高度压缩注意力

  • 更激进的压缩策略,进一步缩减 KV 缓存占用
  • 与 CSA 配合形成”轻重两级”注意力体系
  • 专为大跨度上下文检索设计

2.2.3 效率对比 (vs V3.2, 在 1M token 上下文下)

指标V4 相对 V3.2 的效率
单 token 推理 FLOPs仅需 27% (降低 73%)
KV 缓存显存占用仅需 10% (降低 90%)

关键意义: 这不是渐进式优化,而是数量级跃迁。1M 上下文从”理论可行”变为”经济可行”,使长程推理任务和测试时扩展 (test-time scaling) 成为常态。

2.3 Manifold-Constrained Hyper-Connections (mHC)

  • 对传统 Transformer 残差连接的增强机制
  • 在流形空间中约束超连接 (hyper-connections),增强信息流动
  • 目标:改善深层网络中的梯度传播与特征融合

2.4 Muon 优化器

  • 全新训练优化器,替代传统 AdamW
  • 加速收敛:减少训练所需的步数/数据量
  • 提升训练稳定性:避免损失尖峰和训练回滚
  • V3 时期训练已较为稳定 (全程无不可恢复尖峰),V4 进一步巩固这一优势

2.5 MoE 设计延续

维度V3V4-ProV4-Flash
架构DeepSeekMoEMoE (延续)MoE (延续)
总参数671B1.6T284B
激活参数37B49B13B
激活率5.5%3.1%4.6%
负载均衡无辅助损失策略预计延续 (未明确)预计延续

观察: V4-Pro 的激活率 (3.1%) 低于 V3 (5.5%),意味着在更大的总参数池中实现了更精准的专家选择,以更少的计算代价获取更强的能力。


三、训练数据与流程

3.1 预训练数据

维度V3V4
预训练数据量14.8T tokens32T+ tokens (翻倍以上)
数据质量高质量多样化“多样化高质量” (定性描述)

3.2 后训练管线

V4 采用了”全面的后训练管线” (comprehensive post-training pipeline),具体包括:

  • 有监督微调 (SFT)
  • 强化学习 (RL)
  • 可能包含多轮对齐与能力增强

3.3 训练成本对比

指标V3V4
GPU 小时2.788M H800 hours未披露
训练稳定性全程无不可恢复尖峰使用 Muon 优化器进一步保障

四、推理能力与思考模式

4.1 双模式设计

V4 同时支持非思考模式思考模式

text
1
2
3
4
5
6
7
8
┌──────────────────┐     ┌──────────────────┐
│ 非思考模式 │ │ 思考模式 │
│ │ │ │
│ • 快速响应 │ │ • reasoning_effort: high/max │
│ • 低延迟 │ │ • 深度推理链 │
│ • 简单任务 │ │ • 复杂Agent场景 │
│ • 经济成本 │ │ • 数学/代码/STEM │
└──────────────────┘ └──────────────────┘

4.2 V4-Pro-Max

  • Pro 版本的最大推理努力模式 (maximum reasoning effort)
  • 论文摘要称其”重新定义了开源模型的 SOTA
  • 在核心任务上优于前代模型 (V3 系列)

4.3 性能定性评价

能力维度V4-Pro 表现对比对象
数学/STEM超越所有已公开评测的开源模型比肩世界顶级闭源模型
竞赛型代码开源 SOTA比肩顶级闭源
推理能力接近 Pro 版本
世界知识大幅领先开源模型仅稍逊于 Gemini-Pro-3.1

注意: 官方公告中未给出具体评测分数 (如 MMLU、MATH、HumanEval 等),目前仅有定性描述。


五、Agent 能力 — 重大升级

5.1 Agentic Coding 评测

V4-Pro 的 Agent 能力相比 V3 系列大幅提高,在 Agentic Coding 评测中达到开源模型最佳水平

5.2 内部对标对比

对比对象V4-Pro 表现
Claude Sonnet 4.5优于 Sonnet 4.5
Claude Opus 4.6 (非思考模式)交付质量接近
Claude Opus 4.6 (思考模式)仍存在一定差距

5.3 Agent 生态适配

V4 对多个主流 Agent 产品进行了专项适配优化:

  • Claude Code
  • OpenClaw
  • OpenCode
  • CodeBuddy

在代码任务、文档生成等方面均有显著提升。

5.4 V4-Flash 的 Agent 定位

  • 简单 Agent 任务:与 V4-Pro 旗鼓相当
  • 高难度 Agent 任务:仍有差距

六、V3 → V4 升级点全景对比

6.1 架构升级总结

维度DeepSeek-V3DeepSeek-V4升级幅度
总参数671B1.6T (Pro) / 284B (Flash)2.4x / 0.42x
激活参数37B49B (Pro) / 13B (Flash)1.32x / 0.35x
注意力机制MLA (Multi-head Latent Attention)CSA + HCA 混合注意力全新设计
残差连接标准残差连接mHC (流形约束超连接)新增
优化器AdamW (推测)Muon全新
上下文长度128K (V3 原始)1M7.8x
最大输出8K (V3 原始)384K48x
训练数据14.8T tokens32T+ tokens2.16x
多 token 预测✅ 引入预计延续
负载均衡无辅助损失策略预计延续

6.2 效率升级

效率指标 (1M 上下文)V3.2 基准V4
单 token 推理 FLOPs100%27% (-73%)
KV 缓存占用100%10% (-90%)

6.3 能力升级

能力维度V3 水平V4 水平
推理 (数学/STEM/代码)开源领先开源 SOTA,比肩顶级闭源
Agent/Coding开源最佳,优于 Sonnet 4.5
世界知识大幅领先开源,仅逊 Gemini-Pro-3.1
长上下文128K1M (普惠标配)
推理模式思考/非思考双模式

6.4 产品策略升级

维度V3V4
版本策略单一模型双版本 (Pro + Flash)
API 并发500 (Pro) / 2500 (Flash)
旧模型迁移deepseek-chat → v4-flash (非思考), deepseek-reasoner → v4-flash (思考)
API 兼容OpenAIOpenAI + Anthropic
缓存机制输入缓存命中价格仅为未命中的 2%-2.5%

七、技术路线演进分析

7.1 注意力机制三代演进

text
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
V2: MLA (Multi-head Latent Attention)
└── 首次引入潜变量压缩 KV 缓存


V3: MLA (延续) + DeepSeekMoE
└── 无辅助损失负载均衡 + 多 token 预测


V3.2: 引入 DSA (DeepSeek Sparse Attention)
└── 稀疏注意力,降低长序列开销


V4: CSA + HCA 混合注意力
└── Token 维度压缩 + 两级稀疏策略
└── 1M 上下文下 FLOPs 仅 27%、KV 缓存仅 10%

7.2 规模演进

text
1
2
3
4
参数规模 (总/激活):
V3: 671B / 37B (激活率 5.5%)
V4-Pro: 1.6T / 49B (激活率 3.1%) ← 更大模型池, 更精准专家选择
V4-Flash: 284B / 13B (激活率 4.6%) ← 轻量经济版

7.3 DeepSeek 的核心技术哲学

  1. 极致的上下文效率: 从 MLA → DSA → CSA+HCA,持续降低长序列的算力门槛
  2. 稀疏激活 + 大参数池: MoE 路线越走越深,用更大总参数换取更小激活代价
  3. 双版本覆盖: Pro 打性能天花板,Flash 打经济性,覆盖全场景
  4. 开源 SOTA 持续推进: 每一代都以”超越所有开源模型”为基准线

八、API 接入信息

8.1 模型名称

text
1
2
deepseek-v4-pro      # 旗舰版
deepseek-v4-flash # 经济版

8.2 端点

格式URL
OpenAI 兼容https://api.deepseek.com
Anthropic 兼容https://api.deepseek.com/anthropic

8.3 旧模型迁移

旧模型名映射规则停用日期
deepseek-chatdeepseek-v4-flash (非思考模式)2026-07-24
deepseek-reasonerdeepseek-v4-flash (思考模式)2026-07-24

8.4 功能支持

功能V4-FlashV4-Pro
思考模式 (默认开启)
JSON Output
Tool Calls
对话前缀续写 (Beta)
FIM 补全 (Beta)✅ 仅非思考✅ 仅非思考

九、待确认与局限

9.1 当前预览版未披露的信息

缺失信息说明
具体评测分数官方仅给出定性描述,未公布 MMLU/MATH/HumanEval 等具体分值
MoE 专家数量/配置未说明专家总数、Top-K 路由策略
CSA/HCA 详细结构论文摘要未展开,需查阅全文 PDF
mHC 实现细节仅提及名称和目的
Muon 优化器原理需查阅论文正文
训练超参数学习率、batch size、调度器等
训练成本GPU 小时数未披露
消融实验各组件贡献的量化分析

9.2 已知限制

  1. Flash 版知识储备: V4-Flash 的世界知识稍逊于 V4-Pro
  2. Flash 版高难度 Agent: 与 Pro 版在高难度 Agent 任务上仍有差距
  3. 与顶级闭源模型的差距: Agent 能力仍不及 Opus 4.6 思考模式
  4. 价格竞争力: V4-Pro 输出价格 (¥6/M) 高于 V3 时期,但换取了 1M 上下文

十、对用户业务的启示

10.1 ALNS 调度场景适用性

场景需求V4 匹配度建议
长上下文 (复杂调度约束)⭐⭐⭐⭐⭐1M 上下文适合传入完整约束集+历史方案
推理优化 (多目标权衡)⭐⭐⭐⭐思考模式 max,建议复杂决策使用 reasoning_effort=max
代码生成 (Python 实现)⭐⭐⭐⭐⭐Agentic Coding SOTA,适合代码生成与调试
Agent 集成 (工具调用)⭐⭐⭐⭐⭐Tool Calls 支持,可直接集成到调度工具链
成本控制⭐⭐⭐⭐Flash 经济版,常规推理用 Flash, 关键决策用 Pro

10.2 LLM 评测对比维度建议

在当前 LLM 对比评测 (Qwen/GLM/Kimi/DeepSeek) 中,V4 的加入带来新的对比维度:

  1. 长上下文能力: 1M 上下文是 V4 的独有优势,应纳入评测
  2. Agent/Coding: V4 在此领域号称开源 SOTA,需与其他模型的最新版本对比
  3. 推理模式切换: 思考/非思考双模式 + reasoning_effort 调节,提供了更灵活的评测矩阵
  4. API 成本: Flash 版的极低缓存命中价格 (¥0.02/M) 适合大规模推理任务

附录: 信息来源索引


报告完成于 2026-07-28。DeepSeek-V4 目前为预览版,后续正式版可能补充更多技术细节和评测数据。

本文结束 感谢您的阅读