所属主题: LLM 大模型 · 模型架构 · 训练对齐 · 推理优化

DeepSeek-V4.1-Flash技术调研报告:CED编解码架构、CSA2跨层缓存压缩与KV Cache极致优化

DeepSeek-V4.1-Flash 技术调研报告,梳理 CED 因果编解码架构、CSA2 跨层 KV Cache 压缩、Hierarchical Sparse Indexer 分层稀疏索引器、Single-Pass mHC + Mega-mHC 内核等核心架构创新,以及 45T token 预训练、规模化 RL 后训练与 Agent 基准性能全景对比。

DeepSeek-V4.1-Flash 技术调研报告,梳理 CED(Causal Encoder-Decoder)因果编解码架构、CSA2(Compressed Sparse Attention 2)跨层 KV Cache 压缩、Hierarchical Sparse Indexer 分层稀疏索引器、Single-Pass mHC + Mega-mHC 内核等核心架构创新,以及 45T token 预训练、规模化 RL 后训练管线与 Agent 基准性能全景对比。

调研日期:2026-09-11

数据来源:DeepSeek 官方 HuggingFace 模型卡片、DeepSeek_V41_Tech_Report 技术报告、HuggingFace 模型权重仓库

版本说明:V4.1-Flash 为 V4.1 架构家族最小模型,已开源(MIT 协议),支持 1M token 上下文与原生多模态

一、模型概览

1.1 发布背景

DeepSeek-V4.1-Flash 于 2026 年 9 月正式发布并同步开源,是 DeepSeek V4.1 架构家族中定位高效经济的最小模型。论文核心命题为:在 Agent 时代上下文动辄数十万至上百万 token 的场景下,如何将 KV Cache(记忆)的存储与计算成本降至极致。

论文标题:DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression

开源地址:HuggingFace(deepseek-ai/DeepSeek-V4.1-Flash)

协议:MIT License

1.2 核心配置

配置项参数
架构类型MoE(Mixture-of-Experts)+ CED(Causal Encoder-Decoder)
主干参数552B
专家配置1 共享专家 + 384 路由专家,每 token 激活 6 个
激活参数(Prefill)8B
激活参数(Decode)16B
网络层数40 层(20 层因果编码器 + 20 层解码器)
上下文长度1M tokens
模态支持原生图文多模态(DeepSeek-ViT + 2 层 MLP 投影器)
全局 KV Cache890 字节 / token
推理强度连续可调 reasoning_effort(1-100)

1.3 与前代模型对比

维度V4-FlashV4-ProV4.1-Flash
主干参数284B1.6T552B
激活参数13B49B8B(Prefill)/ 16B(Decode)
KV Cache / token~3560 字节890 字节(V4-Flash 的 1/4)
上下文长度1M1M1M
架构标准 Decoder标准 DecoderCED 编解码

V4.1-Flash 仅用 V4-Pro 约 1/3 的总参数和 1/4 的激活参数,即在基座评测上打平甚至反超 V4-Pro。

二、核心架构创新

2.1 CED(Causal Encoder-Decoder)因果编解码架构

CED 是 V4.1 系列的核心架构变革,灵感来自微软的 YoCo 工作,但做了结构性升级。其目标是降低 input-heavy 场景(如 Agent 工具调用)下的 Prefill 计算量。

设计思路

  • 下半截当编码器:40 层 Transformer 的底部 20 层为因果编码器(Causal Encoder)
  • 上半截解码器共享全局 KV:第 20 层以上的所有解码器层,其全局 KV 不再由各自隐状态独立生成,而是直接由第 20 层(编码器最后一层)的隐状态通过专属投影权重生成

效果:当序列长度 N 远大于滑动窗口大小时,Prefill 复杂度从 O(N·L) 降至约 O(N·L/2),计算量直接减半。

配套设计 SWA Bounded Replay:缺失的滑动窗口 KV 状态仅需重放最近 n_win 个 token 即可重建,无需将 SWA KV 持久化到 SSD,持久化 KV Cache 体积降至 V4-Flash 的 1/8。

DeepSeek-V4.1-Flash 整体架构图

图3:DeepSeek-V4.1-Flash 整体架构图(来源:官方技术报告 Figure 3)

2.2 CSA2(Compressed Sparse Attention 2)跨层 KV Cache 压缩

CSA2 是本篇论文的核心贡献,目标是将 KV Cache 的存储体积压到极致。它是首个同时在三个维度上进行 KV Cache 压缩的方案。

2.2.1 三个压缩维度

维度技术手段说明
条目大小GQA / MLA减少 KV 头数、共享隐向量
序列维度CSA / HCA每 m 个 token 压缩为 1 个条目(V4 已有)
层的维度跨层复用(新增)部分层直接复用其他层的缓存和稀疏选择结果

此前方案(IndexCache、YOIO、HySparse 等)仅覆盖其中一至两个维度,CSA2 首次实现三维度联合压缩。配合 FP4 主 KV 缓存(E2M1 格式,每 16 通道配一个 E4M3 缩放因子),最终将全局 KV Cache 压至 890 字节/token。

2.2.2 Full / Reindex / Reuse 三档模式

CSA2 为每一层静态分配三种运行模式之一:

模式main KVindexer Kindexer QTop-K 索引
Full(全量)自己计算自己计算自己计算自己选择
Reindex(重索引)复用前层复用前层自己计算重新选择
Reuse(纯复用)复用前层复用前层自己计算复用前层

Reindex 模式在共享缓存的同时,仍允许稀疏选择结果逐层变化;Reuse 模式则完全复用前层的 Top-K 索引,仅计算 Q 和 SWA KV,索引器完全跳过。

CSA2 三种运行模式对比

图4:CSA2 三种运行模式对比(来源:官方技术报告 Figure 4)

2.2.3 Hierarchical Sparse Indexer 分层稀疏索引器

跨层复用减少了索引器运行次数,但剩余索引器仍需对整个可见上下文打分——上下文达 1M 时,索引本身成为瓶颈。

分层稀疏索引器的核心思路:浅层 Full Mode 索引器的选择结果天然可作为深层 Reindex Mode 索引器的搜索范围,无需引入额外状态。候选池大小固定后,深层索引器的单查询成本从 O(N)(随上下文线性增长)降为 O(K)(常数)。

该机制为训练感知设计:后训练阶段即按相同候选域训练,确保训推一致。

Hierarchical Sparse Indexer 分层稀疏索引器

图5:Hierarchical Sparse Indexer 分层稀疏索引器(来源:官方技术报告 Figure 5)

2.3 Single-Pass mHC + Mega-mHC 内核

V4 引入的 mHC(multi-head Hybrid Convolution)在相邻 Transformer 块间维护 n 条残差流,以逐 token 预测系数进行混合。其理论下界为 (2n+2)d 的激活访存量,但 V4 的三内核实现实际需 (4n+4)d,存在一倍冗余。

V4.1 的解法为依赖消除:将输入混合系数平移一个块——每个块消耗上一个块算出的混合系数。数据依赖消除后,残差更新、输入混合、系数预测三件事可融合进单个 Mega-mHC 内核一次完成,激活访存量直接压至理论下界 (2n+2)d。

2.4 其他架构设计

模块参数量说明
Engram 条件记忆196B基于 token 查找的稀疏访问记忆模块,不占常规激活参数
DSpark 投机解码半自回归草稿生成 + 置信度调度验证,加速长文本生成
DeepSeek-ViT从零训练的视觉编码器,2D-RoPE + 3×3 pixel-unshuffle 下采样

三、预训练与后训练

3.1 预训练

配置项参数
训练数据45T tokens 多模态语料,从零训练
稀疏注意力训练长度64K
上下文扩展节点训练至 34T tokens 时扩展至 1M
多模态联合训练视觉嵌入从预训练开始即与文本嵌入联合处理(非后期嫁接)

3.2 后训练数据管线

后训练采用标准 SFT → RL → OPD(On-Policy Distillation)范式,无算法层面创新,全部提升来自数据与环境管线的规模化。

每个任务被形式化为 (问题、环境、验证系统) 三元组,以”难度”和”正确性”为奖励信号迭代训练模型的造题能力:

  • 通用 Agent:收集内部员工与外部伙伴真实工作流,批量构建复刻真实 SaaS / 企业系统接口的 mock 工具;将真实失败案例系统化重放进行针对性 RL
  • Coding Agent:从高难度真实会话 + 达标 GitHub 仓库出发,由多个专职 Agent 流水线协作构建

推理强度支持 reasoning_effort 1-100 连续调节,用户可按任务难度自由权衡推理成本与准确率。

3.3 RL Scaling 与跨脚手架联合训练

RL 训练步数与各代码 Agent 基准 Pass@1 关系

图7:RL 训练步数与各代码 Agent 基准 Pass@1 关系(来源:官方技术报告 Figure 7)

随累计 RL 步数增长,DeepSWE v1.1、SWE-Bench Pro、Terminal-Bench v2.1/v3.0 的 Pass@1 均稳定上涨。上下文从 512K 扩展至 1M 后,超长程任务(Terminal-Bench v3.0)性能继续提升。曲线断开段对应模型合并后重新初始化的后续 RL run。

跨脚手架联合 RL 效果

图8:跨脚手架联合 RL 效果(来源:官方技术报告 Figure 8)

跨多个 Claude Code 版本、以及跨 OpenCode / Pi / DeepSeek Harness 等异构脚手架联合 RL,平均 Pass@1 均持续提升,证明训练环境多样性可增强模型鲁棒性。

四、性能评测

4.1 基座模型评测亮点

基准V4-Flash-BaseV4-Pro-BaseV4.1-Flash-Base
MMLU-Pro68.373.574.1
HumanEval69.576.879.4
BigCodeBench56.859.260.6
GSM8K90.892.693.0
AGIEval83.984.483.4

V4.1-Flash 在 MMLU-Pro、HumanEval、BigCodeBench、GSM8K 等核心基准上反超 V4-Pro,而激活参数仅为 V4-Pro 的约 1/3。

4.2 Agent 基准评测(Instruct,最大推理强度)

基准Opus-5GPT-5.6 SolKimi-K3V4-ProV4.1-Flash
Codeforces(Rating)33483471
MathArena Apex65.6%65.3%65.6%
DeepSWE v1.174.0%73.0%67.5%62.7%74.2%
Terminal-Bench 2.189.1%88.8%88.3%87.9%90.6%
CyberGym84.5%80.0%83.3%88.1%
AutomationBench50.3%45.8%46.7%43.2%54.8%
Agent’s Last Exam28.6%26.7%27.6%25.7%31.8%

DeepSWE v1.1 74.2% 力压 Opus-5(74.0%)与 GPT-5.6 Sol(73.0%),相比 V4-Flash 的 54.4% 为质变提升。Terminal-Bench 2.1、CyberGym、AutomationBench、Agent’s Last Exam 均为全场最高。

4.3 跨脚手架鲁棒性

在 Claude Code、Codex、OpenCode、Pi、mini-SWE、DeepSeek Harness(Minimal / Standard / PTC)共 8 种配置下:

  • DeepSWE v1.1:65.5% – 74.2% 波动
  • Terminal-Bench 2.1:84.1% – 90.6% 波动

模型能力不绑定特定脚手架,归因于训练时合成环境的多样性。

4.4 多智能体(Agent Team)

多智能体 vs 单智能体性能对比

图10:多智能体 vs 单智能体性能对比(来源:官方技术报告 Figure 10)

基准单 AgentAgent Team提升幅度
ProgramBench 8h Almost@120.39%30.04%+47.3%
FrontierSWE v2 20h Mean@528.20%32.90%+16.7%

每个时限档多智能体均占优。训练信号包含任务奖励 + 协作奖励 + 基于 DAG 关键路径的衍生时延惩罚。

五、KV Cache 效率对比

历代 DeepSeek 模型全局 KV Cache 体积演进

图1b:历代 DeepSeek 模型全局 KV Cache 体积演进(来源:官方技术报告 Figure 1b)

单 token Decode FLOPs 与上下文长度关系

图2:单 token Decode FLOPs 与上下文长度关系(来源:官方技术报告 Figure 2)

指标(1M 上下文)DeepSeek-V1V4-FlashV4.1-Flash
全局 KV Cache / token~389 KB~3.56 KB890 字节
相对 V1 压缩比1x~109x~437x
相对 V4-Flash 压缩比1x~4x
4K→1M Decode FLOPs 增长显著上涨上涨仅 +25%

六、V4 → V4.1 升级点全景对比

维度DeepSeek-V4DeepSeek-V4.1升级性质
整体架构标准 Decoder-OnlyCED 因果编解码架构变革
注意力机制CSA(压缩稀疏注意力)CSA2(三维度联合压缩 + 三档模式)核心升级
索引器标准稀疏索引Hierarchical Sparse Indexer(分层)新增
KV 量化FP4 main KV(E2M1)新增
mHC 内核三内核实现(4n+4)dSingle-Pass + Mega-mHC(2n+2)d效率优化
条件记忆Engram(196B,稀疏访问)新增
投机解码DSparkDSpark(延续)延续
预训练数据32T+ tokens45T tokens规模扩大
RL 训练标准 RL跨脚手架联合 RL + 环境规模化管线升级
推理强度high / max 两档1-100 连续可调精细控制

七、技术路线演进分析

注意力机制与 KV Cache 压缩四代演进

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
V1: 标准 MHA / MLA
└── 全局注意力,KV Cache 体积大(~389KB/token)


V3 / V3.2: MLA + DSA 稀疏注意力
└── 引入稀疏注意力降低长序列计算量


V4: CSA + HCA 混合注意力
└── token 维度压缩 + 头维度压缩,KV Cache ~3.56KB/token


V4.1: CSA2 + CED + FP4 + 分层索引器
└── 三维度联合压缩 + 编解码共享KV + 4bit量化 + 索引成本常数化
└── KV Cache 890字节/token(V1 的 1/437)

核心趋势判断:DeepSeek 的技术路线从”降低计算量”(V3/V4 的稀疏注意力)转向”降低存储与搬运成本”(V4.1 的 KV Cache 极致压缩)。在 Agent 长上下文场景下,存储与带宽已取代算力成为主要瓶颈,CED + CSA2 + FP4 的组合正是针对这一瓶颈的系统性解决方案。

八、总结与展望

DeepSeek-V4.1-Flash 的核心贡献可归纳为四点:

  1. CED 架构将 Prefill 计算量减半,通过编码器-解码器共享全局 KV 实现结构级效率提升
  2. CSA2 + FP4 + 分层索引器将全局 KV Cache 压至 890 字节/token(前代的 1/4,V1 的 1/437),是首个三维度联合压缩方案
  3. Mega-mHC 内核将激活访存量压至理论下界,消除了 V4 实现中的一倍冗余
  4. 45T token 预训练 + 规模化 RL 数据管线保证在参数大幅减少的前提下性能不降反升,Agent 基准正面刚 Opus-5 与 GPT-5.6

用 1/3 的总参数、1/4 的激活参数实现旗舰级 Agent 性能,V4.1-Flash 证明了”记忆成本优化”是 Agent 时代模型架构演进的关键方向。其 CED 架构与 CSA2 三档模式设计预计将成为后续开源模型的重要参考。


参考资料:DeepSeek-AI 官方 HuggingFace 模型卡片(deepseek-ai/DeepSeek-V4.1-Flash)|DeepSeek_V41_Tech_Report 技术报告|2026-09-11 核验

本文结束 感谢您的阅读