DeepSeek-V4.1-Flash 技术调研报告,梳理 CED(Causal Encoder-Decoder)因果编解码架构、CSA2(Compressed Sparse Attention 2)跨层 KV Cache 压缩、Hierarchical Sparse Indexer 分层稀疏索引器、Single-Pass mHC + Mega-mHC 内核等核心架构创新,以及 45T token 预训练、规模化 RL 后训练管线与 Agent 基准性能全景对比。
调研日期:2026-09-11
数据来源:DeepSeek 官方 HuggingFace 模型卡片、DeepSeek_V41_Tech_Report 技术报告、HuggingFace 模型权重仓库
版本说明:V4.1-Flash 为 V4.1 架构家族最小模型,已开源(MIT 协议),支持 1M token 上下文与原生多模态
一、模型概览
1.1 发布背景
DeepSeek-V4.1-Flash 于 2026 年 9 月正式发布并同步开源,是 DeepSeek V4.1 架构家族中定位高效经济的最小模型。论文核心命题为:在 Agent 时代上下文动辄数十万至上百万 token 的场景下,如何将 KV Cache(记忆)的存储与计算成本降至极致。
论文标题:DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
开源地址:HuggingFace(deepseek-ai/DeepSeek-V4.1-Flash)
协议:MIT License
1.2 核心配置
| 配置项 | 参数 |
|---|---|
| 架构类型 | MoE(Mixture-of-Experts)+ CED(Causal Encoder-Decoder) |
| 主干参数 | 552B |
| 专家配置 | 1 共享专家 + 384 路由专家,每 token 激活 6 个 |
| 激活参数(Prefill) | 8B |
| 激活参数(Decode) | 16B |
| 网络层数 | 40 层(20 层因果编码器 + 20 层解码器) |
| 上下文长度 | 1M tokens |
| 模态支持 | 原生图文多模态(DeepSeek-ViT + 2 层 MLP 投影器) |
| 全局 KV Cache | 890 字节 / token |
| 推理强度 | 连续可调 reasoning_effort(1-100) |
1.3 与前代模型对比
| 维度 | V4-Flash | V4-Pro | V4.1-Flash |
|---|---|---|---|
| 主干参数 | 284B | 1.6T | 552B |
| 激活参数 | 13B | 49B | 8B(Prefill)/ 16B(Decode) |
| KV Cache / token | ~3560 字节 | — | 890 字节(V4-Flash 的 1/4) |
| 上下文长度 | 1M | 1M | 1M |
| 架构 | 标准 Decoder | 标准 Decoder | CED 编解码 |
V4.1-Flash 仅用 V4-Pro 约 1/3 的总参数和 1/4 的激活参数,即在基座评测上打平甚至反超 V4-Pro。
二、核心架构创新
2.1 CED(Causal Encoder-Decoder)因果编解码架构
CED 是 V4.1 系列的核心架构变革,灵感来自微软的 YoCo 工作,但做了结构性升级。其目标是降低 input-heavy 场景(如 Agent 工具调用)下的 Prefill 计算量。
设计思路:
- 下半截当编码器:40 层 Transformer 的底部 20 层为因果编码器(Causal Encoder)
- 上半截解码器共享全局 KV:第 20 层以上的所有解码器层,其全局 KV 不再由各自隐状态独立生成,而是直接由第 20 层(编码器最后一层)的隐状态通过专属投影权重生成
效果:当序列长度 N 远大于滑动窗口大小时,Prefill 复杂度从 O(N·L) 降至约 O(N·L/2),计算量直接减半。
配套设计 SWA Bounded Replay:缺失的滑动窗口 KV 状态仅需重放最近 n_win 个 token 即可重建,无需将 SWA KV 持久化到 SSD,持久化 KV Cache 体积降至 V4-Flash 的 1/8。

图3:DeepSeek-V4.1-Flash 整体架构图(来源:官方技术报告 Figure 3)
2.2 CSA2(Compressed Sparse Attention 2)跨层 KV Cache 压缩
CSA2 是本篇论文的核心贡献,目标是将 KV Cache 的存储体积压到极致。它是首个同时在三个维度上进行 KV Cache 压缩的方案。
2.2.1 三个压缩维度
| 维度 | 技术手段 | 说明 |
|---|---|---|
| 条目大小 | GQA / MLA | 减少 KV 头数、共享隐向量 |
| 序列维度 | CSA / HCA | 每 m 个 token 压缩为 1 个条目(V4 已有) |
| 层的维度 | 跨层复用(新增) | 部分层直接复用其他层的缓存和稀疏选择结果 |
此前方案(IndexCache、YOIO、HySparse 等)仅覆盖其中一至两个维度,CSA2 首次实现三维度联合压缩。配合 FP4 主 KV 缓存(E2M1 格式,每 16 通道配一个 E4M3 缩放因子),最终将全局 KV Cache 压至 890 字节/token。
2.2.2 Full / Reindex / Reuse 三档模式
CSA2 为每一层静态分配三种运行模式之一:
| 模式 | main KV | indexer K | indexer Q | Top-K 索引 |
|---|---|---|---|---|
| Full(全量) | 自己计算 | 自己计算 | 自己计算 | 自己选择 |
| Reindex(重索引) | 复用前层 | 复用前层 | 自己计算 | 重新选择 |
| Reuse(纯复用) | 复用前层 | 复用前层 | 自己计算 | 复用前层 |
Reindex 模式在共享缓存的同时,仍允许稀疏选择结果逐层变化;Reuse 模式则完全复用前层的 Top-K 索引,仅计算 Q 和 SWA KV,索引器完全跳过。

图4:CSA2 三种运行模式对比(来源:官方技术报告 Figure 4)
2.2.3 Hierarchical Sparse Indexer 分层稀疏索引器
跨层复用减少了索引器运行次数,但剩余索引器仍需对整个可见上下文打分——上下文达 1M 时,索引本身成为瓶颈。
分层稀疏索引器的核心思路:浅层 Full Mode 索引器的选择结果天然可作为深层 Reindex Mode 索引器的搜索范围,无需引入额外状态。候选池大小固定后,深层索引器的单查询成本从 O(N)(随上下文线性增长)降为 O(K)(常数)。
该机制为训练感知设计:后训练阶段即按相同候选域训练,确保训推一致。

图5:Hierarchical Sparse Indexer 分层稀疏索引器(来源:官方技术报告 Figure 5)
2.3 Single-Pass mHC + Mega-mHC 内核
V4 引入的 mHC(multi-head Hybrid Convolution)在相邻 Transformer 块间维护 n 条残差流,以逐 token 预测系数进行混合。其理论下界为 (2n+2)d 的激活访存量,但 V4 的三内核实现实际需 (4n+4)d,存在一倍冗余。
V4.1 的解法为依赖消除:将输入混合系数平移一个块——每个块消耗上一个块算出的混合系数。数据依赖消除后,残差更新、输入混合、系数预测三件事可融合进单个 Mega-mHC 内核一次完成,激活访存量直接压至理论下界 (2n+2)d。
2.4 其他架构设计
| 模块 | 参数量 | 说明 |
|---|---|---|
| Engram 条件记忆 | 196B | 基于 token 查找的稀疏访问记忆模块,不占常规激活参数 |
| DSpark 投机解码 | — | 半自回归草稿生成 + 置信度调度验证,加速长文本生成 |
| DeepSeek-ViT | — | 从零训练的视觉编码器,2D-RoPE + 3×3 pixel-unshuffle 下采样 |
三、预训练与后训练
3.1 预训练
| 配置项 | 参数 |
|---|---|
| 训练数据 | 45T tokens 多模态语料,从零训练 |
| 稀疏注意力训练长度 | 64K |
| 上下文扩展节点 | 训练至 34T tokens 时扩展至 1M |
| 多模态联合训练 | 视觉嵌入从预训练开始即与文本嵌入联合处理(非后期嫁接) |
3.2 后训练数据管线
后训练采用标准 SFT → RL → OPD(On-Policy Distillation)范式,无算法层面创新,全部提升来自数据与环境管线的规模化。
每个任务被形式化为 (问题、环境、验证系统) 三元组,以”难度”和”正确性”为奖励信号迭代训练模型的造题能力:
- 通用 Agent:收集内部员工与外部伙伴真实工作流,批量构建复刻真实 SaaS / 企业系统接口的 mock 工具;将真实失败案例系统化重放进行针对性 RL
- Coding Agent:从高难度真实会话 + 达标 GitHub 仓库出发,由多个专职 Agent 流水线协作构建
推理强度支持 reasoning_effort 1-100 连续调节,用户可按任务难度自由权衡推理成本与准确率。
3.3 RL Scaling 与跨脚手架联合训练

图7:RL 训练步数与各代码 Agent 基准 Pass@1 关系(来源:官方技术报告 Figure 7)
随累计 RL 步数增长,DeepSWE v1.1、SWE-Bench Pro、Terminal-Bench v2.1/v3.0 的 Pass@1 均稳定上涨。上下文从 512K 扩展至 1M 后,超长程任务(Terminal-Bench v3.0)性能继续提升。曲线断开段对应模型合并后重新初始化的后续 RL run。

图8:跨脚手架联合 RL 效果(来源:官方技术报告 Figure 8)
跨多个 Claude Code 版本、以及跨 OpenCode / Pi / DeepSeek Harness 等异构脚手架联合 RL,平均 Pass@1 均持续提升,证明训练环境多样性可增强模型鲁棒性。
四、性能评测
4.1 基座模型评测亮点
| 基准 | V4-Flash-Base | V4-Pro-Base | V4.1-Flash-Base |
|---|---|---|---|
| MMLU-Pro | 68.3 | 73.5 | 74.1 |
| HumanEval | 69.5 | 76.8 | 79.4 |
| BigCodeBench | 56.8 | 59.2 | 60.6 |
| GSM8K | 90.8 | 92.6 | 93.0 |
| AGIEval | 83.9 | 84.4 | 83.4 |
V4.1-Flash 在 MMLU-Pro、HumanEval、BigCodeBench、GSM8K 等核心基准上反超 V4-Pro,而激活参数仅为 V4-Pro 的约 1/3。
4.2 Agent 基准评测(Instruct,最大推理强度)
| 基准 | Opus-5 | GPT-5.6 Sol | Kimi-K3 | V4-Pro | V4.1-Flash |
|---|---|---|---|---|---|
| Codeforces(Rating) | — | — | — | 3348 | 3471 |
| MathArena Apex | — | — | 65.6% | 65.3% | 65.6% |
| DeepSWE v1.1 | 74.0% | 73.0% | 67.5% | 62.7% | 74.2% |
| Terminal-Bench 2.1 | 89.1% | 88.8% | 88.3% | 87.9% | 90.6% |
| CyberGym | — | 84.5% | 80.0% | 83.3% | 88.1% |
| AutomationBench | 50.3% | 45.8% | 46.7% | 43.2% | 54.8% |
| Agent’s Last Exam | 28.6% | 26.7% | 27.6% | 25.7% | 31.8% |
DeepSWE v1.1 74.2% 力压 Opus-5(74.0%)与 GPT-5.6 Sol(73.0%),相比 V4-Flash 的 54.4% 为质变提升。Terminal-Bench 2.1、CyberGym、AutomationBench、Agent’s Last Exam 均为全场最高。
4.3 跨脚手架鲁棒性
在 Claude Code、Codex、OpenCode、Pi、mini-SWE、DeepSeek Harness(Minimal / Standard / PTC)共 8 种配置下:
- DeepSWE v1.1:65.5% – 74.2% 波动
- Terminal-Bench 2.1:84.1% – 90.6% 波动
模型能力不绑定特定脚手架,归因于训练时合成环境的多样性。
4.4 多智能体(Agent Team)

图10:多智能体 vs 单智能体性能对比(来源:官方技术报告 Figure 10)
| 基准 | 单 Agent | Agent Team | 提升幅度 |
|---|---|---|---|
| ProgramBench 8h Almost@1 | 20.39% | 30.04% | +47.3% |
| FrontierSWE v2 20h Mean@5 | 28.20% | 32.90% | +16.7% |
每个时限档多智能体均占优。训练信号包含任务奖励 + 协作奖励 + 基于 DAG 关键路径的衍生时延惩罚。
五、KV Cache 效率对比

图1b:历代 DeepSeek 模型全局 KV Cache 体积演进(来源:官方技术报告 Figure 1b)

图2:单 token Decode FLOPs 与上下文长度关系(来源:官方技术报告 Figure 2)
| 指标(1M 上下文) | DeepSeek-V1 | V4-Flash | V4.1-Flash |
|---|---|---|---|
| 全局 KV Cache / token | ~389 KB | ~3.56 KB | 890 字节 |
| 相对 V1 压缩比 | 1x | ~109x | ~437x |
| 相对 V4-Flash 压缩比 | — | 1x | ~4x |
| 4K→1M Decode FLOPs 增长 | 显著上涨 | 上涨 | 仅 +25% |
六、V4 → V4.1 升级点全景对比
| 维度 | DeepSeek-V4 | DeepSeek-V4.1 | 升级性质 |
|---|---|---|---|
| 整体架构 | 标准 Decoder-Only | CED 因果编解码 | 架构变革 |
| 注意力机制 | CSA(压缩稀疏注意力) | CSA2(三维度联合压缩 + 三档模式) | 核心升级 |
| 索引器 | 标准稀疏索引 | Hierarchical Sparse Indexer(分层) | 新增 |
| KV 量化 | — | FP4 main KV(E2M1) | 新增 |
| mHC 内核 | 三内核实现(4n+4)d | Single-Pass + Mega-mHC(2n+2)d | 效率优化 |
| 条件记忆 | — | Engram(196B,稀疏访问) | 新增 |
| 投机解码 | DSpark | DSpark(延续) | 延续 |
| 预训练数据 | 32T+ tokens | 45T tokens | 规模扩大 |
| RL 训练 | 标准 RL | 跨脚手架联合 RL + 环境规模化 | 管线升级 |
| 推理强度 | high / max 两档 | 1-100 连续可调 | 精细控制 |
七、技术路线演进分析
注意力机制与 KV Cache 压缩四代演进:
1 | V1: 标准 MHA / MLA |
核心趋势判断:DeepSeek 的技术路线从”降低计算量”(V3/V4 的稀疏注意力)转向”降低存储与搬运成本”(V4.1 的 KV Cache 极致压缩)。在 Agent 长上下文场景下,存储与带宽已取代算力成为主要瓶颈,CED + CSA2 + FP4 的组合正是针对这一瓶颈的系统性解决方案。
八、总结与展望
DeepSeek-V4.1-Flash 的核心贡献可归纳为四点:
- CED 架构将 Prefill 计算量减半,通过编码器-解码器共享全局 KV 实现结构级效率提升
- CSA2 + FP4 + 分层索引器将全局 KV Cache 压至 890 字节/token(前代的 1/4,V1 的 1/437),是首个三维度联合压缩方案
- Mega-mHC 内核将激活访存量压至理论下界,消除了 V4 实现中的一倍冗余
- 45T token 预训练 + 规模化 RL 数据管线保证在参数大幅减少的前提下性能不降反升,Agent 基准正面刚 Opus-5 与 GPT-5.6
用 1/3 的总参数、1/4 的激活参数实现旗舰级 Agent 性能,V4.1-Flash 证明了”记忆成本优化”是 Agent 时代模型架构演进的关键方向。其 CED 架构与 CSA2 三档模式设计预计将成为后续开源模型的重要参考。
参考资料:DeepSeek-AI 官方 HuggingFace 模型卡片(deepseek-ai/DeepSeek-V4.1-Flash)|DeepSeek_V41_Tech_Report 技术报告|2026-09-11 核验

