调研日期: 2026-07-28
数据来源: DeepSeek 官网、微信公众号公告、arXiv 技术报告 (2606.19348)、DeepSeek API 文档
版本说明: V4 当前为预览版 (Preview),部分技术细节可能在未来正式版中调整
一、模型概览
1.1 发布背景
DeepSeek-V4 预览版于 2026年4月24日 正式发布并同步开源,标志着 DeepSeek 进入百万上下文普惠时代。技术报告于同年4月26日上传至 arXiv (编号 2606.19348)。
- 论文标题: DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
- 开源地址: HuggingFace / ModelScope
- 技术报告: arXiv:2606.19348
1.2 模型版本
V4 系列采用双版本策略,满足不同场景需求:
| 维度 | DeepSeek-V4-Pro | DeepSeek-V4-Flash |
|---|---|---|
| 定位 | 性能旗舰版 | 高效经济版 |
| 总参数量 | 1.6T (1.6万亿) | 284B (2840亿) |
| 激活参数 | 49B (490亿) | 13B (130亿) |
| 上下文长度 | 1M tokens | 1M tokens |
| 最大输出长度 | 384K tokens | 384K tokens |
| 并发限制 (API) | 500 | 2500 |
| 推理模式 | 思考/非思考 (可切换) | 思考/非思考 (可切换) |
| reasoning_effort | high / max | high / max |
1.3 API 定价 (人民币 / 百万 tokens)
| 计费项 | V4-Flash | V4-Pro |
|---|---|---|
| 输入 (缓存命中) | ¥0.02 | ¥0.025 |
| 输入 (缓存未命中) | ¥1 | ¥3 |
| 输出 | ¥2 | ¥6 |
二、核心架构创新
2.1 整体架构
DeepSeek-V4 延续了 MoE (Mixture-of-Experts) 架构路线,但在注意力机制、残差连接和优化器三个核心维度进行了重大创新。
1 | ┌─────────────────────────────────────────────────────┐ |
2.2 混合注意力机制 (CSA + HCA)
这是 V4 最核心的架构突破。V4 放弃了 V3 时期的单一 MLA (Multi-head Latent Attention),转而采用混合注意力架构:
2.2.1 Compressed Sparse Attention (CSA) — 压缩稀疏注意力
- 在 token 维度进行压缩,大幅减少长上下文场景下的计算量
- 稀疏注意力模式,只关注关键 token 子集,而非全局注意力
- 目标:将 1M 上下文的计算开销降至可承受范围
2.2.2 Heavily Compressed Attention (HCA) — 高度压缩注意力
- 更激进的压缩策略,进一步缩减 KV 缓存占用
- 与 CSA 配合形成”轻重两级”注意力体系
- 专为大跨度上下文检索设计
2.2.3 效率对比 (vs V3.2, 在 1M token 上下文下)
| 指标 | V4 相对 V3.2 的效率 |
|---|---|
| 单 token 推理 FLOPs | 仅需 27% (降低 73%) |
| KV 缓存显存占用 | 仅需 10% (降低 90%) |
关键意义: 这不是渐进式优化,而是数量级跃迁。1M 上下文从”理论可行”变为”经济可行”,使长程推理任务和测试时扩展 (test-time scaling) 成为常态。
2.3 Manifold-Constrained Hyper-Connections (mHC)
- 对传统 Transformer 残差连接的增强机制
- 在流形空间中约束超连接 (hyper-connections),增强信息流动
- 目标:改善深层网络中的梯度传播与特征融合
2.4 Muon 优化器
- 全新训练优化器,替代传统 AdamW
- 加速收敛:减少训练所需的步数/数据量
- 提升训练稳定性:避免损失尖峰和训练回滚
- V3 时期训练已较为稳定 (全程无不可恢复尖峰),V4 进一步巩固这一优势
2.5 MoE 设计延续
| 维度 | V3 | V4-Pro | V4-Flash |
|---|---|---|---|
| 架构 | DeepSeekMoE | MoE (延续) | MoE (延续) |
| 总参数 | 671B | 1.6T | 284B |
| 激活参数 | 37B | 49B | 13B |
| 激活率 | 5.5% | 3.1% | 4.6% |
| 负载均衡 | 无辅助损失策略 | 预计延续 (未明确) | 预计延续 |
观察: V4-Pro 的激活率 (3.1%) 低于 V3 (5.5%),意味着在更大的总参数池中实现了更精准的专家选择,以更少的计算代价获取更强的能力。
三、训练数据与流程
3.1 预训练数据
| 维度 | V3 | V4 |
|---|---|---|
| 预训练数据量 | 14.8T tokens | 32T+ tokens (翻倍以上) |
| 数据质量 | 高质量多样化 | “多样化高质量” (定性描述) |
3.2 后训练管线
V4 采用了”全面的后训练管线” (comprehensive post-training pipeline),具体包括:
- 有监督微调 (SFT)
- 强化学习 (RL)
- 可能包含多轮对齐与能力增强
3.3 训练成本对比
| 指标 | V3 | V4 |
|---|---|---|
| GPU 小时 | 2.788M H800 hours | 未披露 |
| 训练稳定性 | 全程无不可恢复尖峰 | 使用 Muon 优化器进一步保障 |
四、推理能力与思考模式
4.1 双模式设计
V4 同时支持非思考模式与思考模式:
1 | ┌──────────────────┐ ┌──────────────────┐ |
4.2 V4-Pro-Max
- Pro 版本的最大推理努力模式 (maximum reasoning effort)
- 论文摘要称其”重新定义了开源模型的 SOTA“
- 在核心任务上优于前代模型 (V3 系列)
4.3 性能定性评价
| 能力维度 | V4-Pro 表现 | 对比对象 |
|---|---|---|
| 数学/STEM | 超越所有已公开评测的开源模型 | 比肩世界顶级闭源模型 |
| 竞赛型代码 | 开源 SOTA | 比肩顶级闭源 |
| 推理能力 | 接近 Pro 版本 | — |
| 世界知识 | 大幅领先开源模型 | 仅稍逊于 Gemini-Pro-3.1 |
注意: 官方公告中未给出具体评测分数 (如 MMLU、MATH、HumanEval 等),目前仅有定性描述。
五、Agent 能力 — 重大升级
5.1 Agentic Coding 评测
V4-Pro 的 Agent 能力相比 V3 系列大幅提高,在 Agentic Coding 评测中达到开源模型最佳水平。
5.2 内部对标对比
| 对比对象 | V4-Pro 表现 |
|---|---|
| Claude Sonnet 4.5 | 优于 Sonnet 4.5 |
| Claude Opus 4.6 (非思考模式) | 交付质量接近 |
| Claude Opus 4.6 (思考模式) | 仍存在一定差距 |
5.3 Agent 生态适配
V4 对多个主流 Agent 产品进行了专项适配优化:
- Claude Code
- OpenClaw
- OpenCode
- CodeBuddy
在代码任务、文档生成等方面均有显著提升。
5.4 V4-Flash 的 Agent 定位
- 简单 Agent 任务:与 V4-Pro 旗鼓相当
- 高难度 Agent 任务:仍有差距
六、V3 → V4 升级点全景对比
6.1 架构升级总结
| 维度 | DeepSeek-V3 | DeepSeek-V4 | 升级幅度 |
|---|---|---|---|
| 总参数 | 671B | 1.6T (Pro) / 284B (Flash) | 2.4x / 0.42x |
| 激活参数 | 37B | 49B (Pro) / 13B (Flash) | 1.32x / 0.35x |
| 注意力机制 | MLA (Multi-head Latent Attention) | CSA + HCA 混合注意力 | 全新设计 |
| 残差连接 | 标准残差连接 | mHC (流形约束超连接) | 新增 |
| 优化器 | AdamW (推测) | Muon | 全新 |
| 上下文长度 | 128K (V3 原始) | 1M | 7.8x |
| 最大输出 | 8K (V3 原始) | 384K | 48x |
| 训练数据 | 14.8T tokens | 32T+ tokens | 2.16x |
| 多 token 预测 | ✅ 引入 | 预计延续 | — |
| 负载均衡 | 无辅助损失策略 | 预计延续 | — |
6.2 效率升级
| 效率指标 (1M 上下文) | V3.2 基准 | V4 |
|---|---|---|
| 单 token 推理 FLOPs | 100% | 27% (-73%) |
| KV 缓存占用 | 100% | 10% (-90%) |
6.3 能力升级
| 能力维度 | V3 水平 | V4 水平 |
|---|---|---|
| 推理 (数学/STEM/代码) | 开源领先 | 开源 SOTA,比肩顶级闭源 |
| Agent/Coding | — | 开源最佳,优于 Sonnet 4.5 |
| 世界知识 | — | 大幅领先开源,仅逊 Gemini-Pro-3.1 |
| 长上下文 | 128K | 1M (普惠标配) |
| 推理模式 | — | 思考/非思考双模式 |
6.4 产品策略升级
| 维度 | V3 | V4 |
|---|---|---|
| 版本策略 | 单一模型 | 双版本 (Pro + Flash) |
| API 并发 | — | 500 (Pro) / 2500 (Flash) |
| 旧模型迁移 | — | deepseek-chat → v4-flash (非思考), deepseek-reasoner → v4-flash (思考) |
| API 兼容 | OpenAI | OpenAI + Anthropic |
| 缓存机制 | — | 输入缓存命中价格仅为未命中的 2%-2.5% |
七、技术路线演进分析
7.1 注意力机制三代演进
1 | V2: MLA (Multi-head Latent Attention) |
7.2 规模演进
1 | 参数规模 (总/激活): |
7.3 DeepSeek 的核心技术哲学
- 极致的上下文效率: 从 MLA → DSA → CSA+HCA,持续降低长序列的算力门槛
- 稀疏激活 + 大参数池: MoE 路线越走越深,用更大总参数换取更小激活代价
- 双版本覆盖: Pro 打性能天花板,Flash 打经济性,覆盖全场景
- 开源 SOTA 持续推进: 每一代都以”超越所有开源模型”为基准线
八、API 接入信息
8.1 模型名称
1 | deepseek-v4-pro # 旗舰版 |
8.2 端点
| 格式 | URL |
|---|---|
| OpenAI 兼容 | https://api.deepseek.com |
| Anthropic 兼容 | https://api.deepseek.com/anthropic |
8.3 旧模型迁移
| 旧模型名 | 映射规则 | 停用日期 |
|---|---|---|
deepseek-chat | → deepseek-v4-flash (非思考模式) | 2026-07-24 |
deepseek-reasoner | → deepseek-v4-flash (思考模式) | 2026-07-24 |
8.4 功能支持
| 功能 | V4-Flash | V4-Pro |
|---|---|---|
| 思考模式 (默认开启) | ✅ | ✅ |
| JSON Output | ✅ | ✅ |
| Tool Calls | ✅ | ✅ |
| 对话前缀续写 (Beta) | ✅ | ✅ |
| FIM 补全 (Beta) | ✅ 仅非思考 | ✅ 仅非思考 |
九、待确认与局限
9.1 当前预览版未披露的信息
| 缺失信息 | 说明 |
|---|---|
| 具体评测分数 | 官方仅给出定性描述,未公布 MMLU/MATH/HumanEval 等具体分值 |
| MoE 专家数量/配置 | 未说明专家总数、Top-K 路由策略 |
| CSA/HCA 详细结构 | 论文摘要未展开,需查阅全文 PDF |
| mHC 实现细节 | 仅提及名称和目的 |
| Muon 优化器原理 | 需查阅论文正文 |
| 训练超参数 | 学习率、batch size、调度器等 |
| 训练成本 | GPU 小时数未披露 |
| 消融实验 | 各组件贡献的量化分析 |
9.2 已知限制
- Flash 版知识储备: V4-Flash 的世界知识稍逊于 V4-Pro
- Flash 版高难度 Agent: 与 Pro 版在高难度 Agent 任务上仍有差距
- 与顶级闭源模型的差距: Agent 能力仍不及 Opus 4.6 思考模式
- 价格竞争力: V4-Pro 输出价格 (¥6/M) 高于 V3 时期,但换取了 1M 上下文
十、对用户业务的启示
10.1 ALNS 调度场景适用性
| 场景需求 | V4 匹配度 | 建议 |
|---|---|---|
| 长上下文 (复杂调度约束) | ⭐⭐⭐⭐⭐ | 1M 上下文适合传入完整约束集+历史方案 |
| 推理优化 (多目标权衡) | ⭐⭐⭐⭐ | 思考模式 max,建议复杂决策使用 reasoning_effort=max |
| 代码生成 (Python 实现) | ⭐⭐⭐⭐⭐ | Agentic Coding SOTA,适合代码生成与调试 |
| Agent 集成 (工具调用) | ⭐⭐⭐⭐⭐ | Tool Calls 支持,可直接集成到调度工具链 |
| 成本控制 | ⭐⭐⭐⭐ | Flash 经济版,常规推理用 Flash, 关键决策用 Pro |
10.2 LLM 评测对比维度建议
在当前 LLM 对比评测 (Qwen/GLM/Kimi/DeepSeek) 中,V4 的加入带来新的对比维度:
- 长上下文能力: 1M 上下文是 V4 的独有优势,应纳入评测
- Agent/Coding: V4 在此领域号称开源 SOTA,需与其他模型的最新版本对比
- 推理模式切换: 思考/非思考双模式 + reasoning_effort 调节,提供了更灵活的评测矩阵
- API 成本: Flash 版的极低缓存命中价格 (¥0.02/M) 适合大规模推理任务
附录: 信息来源索引

报告完成于 2026-07-28。DeepSeek-V4 目前为预览版,后续正式版可能补充更多技术细节和评测数据。

