阅读笔记

DeepSeek V4.1 Flash: Pushing the Limits of KV Cache Compression

DeepSeek-V4.1-Flash 将因果编码器与解码器分工、跨层稀疏 KV 复用、四位全局缓存和近似窗口重放组合起来,把长输入的预填充主干计算近似减半、全局 KV 降至每 token 890 字节,并在发布方评测中显著提升多项 agent 能力;端到端服务收益和近似重放的极端条件可靠性仍缺少充分公开验证。

作者 DeepSeek AI(团队署名);Appendix A 中已核验并复用已有档案的成员包括 Xin Cheng、Wangding Zeng、Damai Dai、Xingkai Yu、Zhenda Xie 和 Wenfeng Liang。完整名单见附录。

待审阅 归档 2026-09-10 15:12 更新 2026-09-10 16:52 原文 ↗

所读版本 Hugging Face revision fb2764a5cf321eaa5070ca8f9e892818f477c16d;固定 PDF、同 revision 的模型卡、配置、评测说明和参考推理代码。PDF 共 51 页,SHA 256 为 ba68e2e40408125ae6d2f63a9a241b61c73910691c74ec1a2a7023c851eac08d。

论文脉络

贡献与方法总览

长时程 agent 会反复读取工具输出、代码、文档与历史交互。处理这些输入要付出三种不同成本:新输入与未命中前缀的预填充(prefill)计算,正在服务的请求在 GPU 高带宽显存(HBM)中保留的 KV,以及为后续前缀复用而长期保留在 SSD 或主机内存中的状态。DeepSeek-V4 已经降低了长上下文注意力计算,V4.1 进一步把缓存容量、搬运和恢复计算作为联合设计对象。首要贡献是让一个更大的多模态 MoE,在保留逐层局部处理的同时,用很少的全局状态支撑百万 token 上下文。问题与设计目标,§1,pp.4–6

完整执行链是:图像经视觉编码器和投影器转成视觉 embedding,与文本进入一个 40 层主干;前 20 层因果编码器处理输入,产生自身的压缩全局 KV,并由最后一层输出构造后 20 层解码器共享的全局 KV。解码器因而可以跳过大部分输入位置的完整计算,只为最近 128 个位置重建逐层滑动窗口状态。生成新 token 时,编码器和解码器都参与计算;每层用自己的 query 读取本层局部 KV 和跨层共享的全局 KV,再经过 MoE 更新表示,最终输出下一个文本 token 的分布。总体结构与 CED,§2.1–2.2,pp.7–9

这条路径还包含三个相互配合的改变。CSA2 将“生成 KV”“重新选择位置”“复用已选位置”分开安排,使全局 KV 只在少量层生成。主 KV 与索引器缓存使用不同的四位格式降低字节数。SWA Bounded Replay 接受窗口状态的近似恢复,使局部 KV 可以采用短期缓存,减少持久存储。Engram、Single-Pass mHC 和 DSpark 分别补充条件记忆容量、降低残差读写、加速草稿生成与验证;多模态预训练、任务环境生产、RL 与多教师 OPD 则形成最终模型能力。架构、缓存和训练概述,pp.7–20、25–32

CED、CSA2 与辅助模块在四十层主干中的关系
Image Source: 固定版本技术报告 Figure 3,PDF p.7 的原图区域裁取,保留层组重复次数与连接方向。原始 PDF

CED:让解码器的全局历史由编码器一次提供

普通逐层注意力需要从每层自己的 hidden state 生成历史 KV,因此要建立高层 KV,就必须计算输入在所有低层和高层的表示。因果编码器—解码器(Causal Encoder-Decoder,CED)把这条依赖改为:解码器的全局 KV 来自编码器最终输出;解码器本层只需提供随深度变化的 query,以及本层局部窗口 KV。

H20H^{20} 表示前 20 层处理后的输入表示,报告的一般形式是:

Cl=H20WKVl,Zl=H20WZl. C^l=H^{20}W_{\mathrm{KV}}^l,\qquad Z^l=H^{20}W_Z^l.

ClC^l 是用于构造全局 KV 的条目,ZlZ^l 是压缩权重。一般 CED 可以使用不同投影;本次实际配置进一步通过 CSA2,让全部解码器层共享第一个解码器层生成的全局 KV。解码器的压缩率为 1,因此仍保留逐位置的全局表示。每个新生成 token 依旧通过全部 40 层,所谓 8B / 16B 激活参数是 prefill / decode 的不同执行口径。CED 定义,§2.2;实际配置,§4.2.1

局部窗口是提前结束 prefill 的剩余依赖。 解码器每层的 SWA KV 来自本层表示,无法仅由编码器输出直接替代。作者保留这条较深的局部处理路径,再用最近 W=128W=128 个 token 的近似重放建立窗口。对长度 NWN\gg W 的输入,忽略不同层的实际算子成本和少量投影开销,计算位置与层数的乘积由 40N40N 变成约 20N+20W20N+20W

例如,示意输入含 100,000 个 token,按上述计数,比例为 (20N+20W)/(40N)=0.50064(20N+20W)/(40N)=0.50064;输入只有 256 个 token 时,比例为 0.75。这个演算说明收益依赖输入长度,不能直接当作实测时延,更不能解释成全请求成本固定减半。复杂度与窗口重放,§2.2、§3.2.2

这一设计明确继承了 YOCO 的“下半部生成共享历史,上半部按自身 query 读取”的依赖分解。YOCO 的上半部主要使用共享全局交叉注意力,支持提前退出 prefill;CED 在上半部保留逐层 SWA,增加局部 KV 的生成深度,同时引入重放问题。这个差异解释了 V4.1 为什么需要架构和缓存恢复联合设计。YOCO §2.1–2.3本报告 §2.2

CSA2:共享存储、刷新选择和逐层计算分别控制

CSA2 的主 KV(Main KV)缓存由供所有 query heads 共享的 latent 条目组成,覆盖全局历史位置;Selected Main KV 是某层按选中位置读取的主 KV 子集。索引器使用索引器 query 与索引器 K 为位置打分,主注意力再使用本层主 query、选中的全局条目与本层 SWA KV 计算输出。三种模式是静态分配的,每层都有自己的主 query 与局部 KV:

模式 主 KV 与索引器 K 全局位置选择 保留下来的逐层能力
Full 当前源层生成 当前索引器选择 Top-512 新全局表示、新选择、新 query 和局部状态
Reindex 复用最近的 Full 源层 使用本层索引器 query 重新选择 Top-512 同一组历史表示上的新检索
Reuse 复用最近的 Full 源层的主 KV 复用最近一次 Full / Reindex 的选择 本层主 query 重新计算注意力,本层局部状态继续更新

Full 表示具备完整的 CSA2 组件;其主注意力仍然是稀疏选择。Reuse 复用的是 KV 和位置集合,注意力输出仍随本层 query 改变。由此,状态共享不要求所有层进行相同的计算,重新检索也不要求重新保存一份历史。 三种模式与数据路径,§2.3.1,pp.10–11

CSA2 的 Full、Reindex 与 Reuse 三种模式
Image Source: 固定版本技术报告 Figure 4,PDF p.10 原图区域。绿色为本层生成,黄色为复用的主 KV / 索引器 K,红色为复用的位置集合。原始 PDF

Figure 4 的颜色说明各组件由本层生成还是从前层复用。沿 Reindex 面板读取:底部黄色 Main KV 是共享的全局缓存,黄色 Indexer K 与本层绿色 Indexer Q 一起产生新的 Top-K Indices;Selection 按这些位置从共享 Main KV 取得本层的 Selected Main KV,再与 SWA KV 拼接交给 Core Attention。Reuse 面板则输入共享 Main KV 和已有 Top-K Indices,直接按位置取出条目。Figure 4 说明 KV 与索引的生成、复用和读取关系;Figure 5 在此基础上进一步限制解码器索引器的搜索范围。 Reindex 的基本定义是对共享 KV 重新选择,候选池是解码器额外采用的分层索引机制。Figure 4–5 与 §2.3.1–2.3.2,pp.10–12

按代码的零起始层号,具体安排如下:

位置 全局 KV 压缩率 模式安排
编码器 0–1 层 无全局分支 纯 SWA
编码器 2–19 层 每 2 个 token 形成 1 个全局条目 2、8、14 层为 Full,每个 Full 后接 5 个 Reuse
解码器 20–39 层 每 token 1 个全局条目 20 层为 Full;24、28、32、36 层为 Reindex;其余为 Reuse

因此,38 层含全局注意力,4 个源层分别生成并保存全局 KV,其余层复用相应源层的缓存;8 层执行索引,30 层复用索引。CSA2 还去掉了 V4 压缩器的重叠窗口及绝对位置 embedding,索引器 K 直接由主 KV 投影得到,减少一条单独的压缩路径。配置,§4.2.1,p.22固定版推理配置

解码器的分层稀疏索引器进一步减少后续 Reindex 的候选数。第 20 层先对所有因果可见位置打分,再从同一份全局分数产生两项选择:一项直接选出 Top-512,供本层主注意力使用;另一项以每块的最高位置分数为块分数,选择最多 2,048 个块,将块内全部位置纳入共享候选池。每块包含 8 个独立的 KV 位置,因此候选池最多包含 16,384 个位置。两项选择在逻辑上独立,选块直接使用全局位置分数。这个候选限制在后训练与推理中一致启用。分层索引,§2.3.2、Figure 5,pp.11–12

分层稀疏索引器从全局位置构建共享候选池,各 Reindex 层在池内分别选择 Top-512
Image Source: 固定版本技术报告 Figure 5,PDF p.11 原图区域裁取,保留全局打分、共享候选池、各层 Top-512 与跨层连线。蓝框标记选中的位置块,绿色小格标记当前层选中的位置。原始 PDF

Figure 4 已经展示 Selection 之后的 Selected Main KV;Figure 5 进一步展示生成 Top-K 索引时采用的共享候选池。蓝框内的全部位置都进入候选池,包括当前层尚未选中的白色小格;后续 Reindex 层可以将这些位置选入自己的 Top-512,再读取对应的 Selected Main KV。

索引器的搜索范围与主注意力读取范围需要分开。 下表描述启用分层索引的解码器路径:

解码器层类型 索引器搜索范围 主注意力读取的全局 KV
Full 全部因果可见位置 本层选出的最多 512 个位置对应的 Selected Main KV
Reindex 共享候选池,最多 16,384 个位置 本层用自己的索引器 query 重新选出的最多 512 个位置对应的 Selected Main KV
Reuse 沿用最近一次 Full / Reindex 的位置选择 最近一次选出的最多 512 个位置对应的 Selected Main KV

三种模式的主注意力还同时读取本层 SWA 局部窗口。Full 层的全局搜索由索引器完成,其主注意力也只读取选中的全局子集。候选池规定 Reindex 层选择之前的搜索范围,Selected Main KV 则是选择之后读取的数据;各解码器层共享的完整主 KV 缓存继续保留。搜索与读取路径,§2.3.1–2.3.2、Figure 4–5,pp.10–12

对于同一个 query/token,各 Reindex 层都在同一个候选池内独立重选。比如第 28 层可以选中候选池中未被第 24 层选入 Top-512 的位置。共享发生在本次 query 的后续解码器层之间,新的 query 会构建自己的候选池。跨层候选池与重新选择,§2.3.2,p.12

以一个百万 token 历史为例,较深层可以从 16,384 个候选中选择不同证据;第一个索引器漏掉的块,在本次 query 的后续解码器检索中便无法重新进入。后续索引成本对上下文长度有固定上界,首次全范围扫描仍然存在,编码器索引也未使用这项候选限制。因此全模型 decode 的渐近成本仍含随上下文增长的部分。

四位缓存:890 字节究竟由什么组成

报告把主 KV 的用途限定为存储后再反量化参与注意力,因此格式选择不必完全服从原生四位矩阵乘硬件。主 KV 采用 E2M1,每 16 个通道配置一个 E4M3 scale,省去 NVFP4 中第二级全局 scale;对 RoPE 之后的全部 512 个通道量化,包括旋转位置部分。该方案在后训练中引入量化感知训练(QAT)。索引器 query / K 延续 MXFP4,SWA KV 因对量化更敏感而保留 FP8。缓存格式与 QAT,§2.4.4,p.14

结合配置和参考代码可以重建全局 KV 的字节账本:

单个全局位置的保存内容 字节计算 字节数
主 KV latent,512 通道四位值 512/2512/2 256
主 KV scale,每 16 通道一个八位 scale 512/16512/16 32
索引器 K,128 通道四位值 128/2128/2 64
索引器 K scale,每 32 通道一个八位 scale 128/32128/32 4
合计 上述四项相加 356

编码器的三个源层各保存半个序列长度,解码器的一个源层保存完整序列长度,所以每个输入 token 对应的全局存储为:

(32+1)×356=890 bytes/token. \left(\frac{3}{2}+1\right)\times356=890\ \text{bytes/token}.

这是根据已披露布局的本地演算,与报告给出的 890 一致;它没有额外乘以 query head 数,也没有把同一个 latent 重复算成独立 K、V 两份。按 1,048,576 个 token 计算,单序列全局 KV 约为 0.87 GiB。模型权重、SWA、临时激活、运行时缓冲、页表、对齐及并行副本均需另外计入。报告 §2.4.4、§4.2.1参考代码 Indexer、Attention 与量化布局

SWA Bounded Replay:按状态的复用寿命安排保存与恢复

SWA 的窗口只有 128 个 token,但局部依赖会跨层累积。按报告的理论感受野估计,恢复 LL 层的精确窗口状态需要重放约 LWLW 个 token。有限窗口重放只处理最后 WW 个位置,并在重放起点截断各层 SWA,接受一个近似状态。其两条路径分别服务前缀缓存与 CED:

  • 编码器恢复: 全局前缀 KV 命中、编码器局部 KV 缺失时,重放缓存前缀最后 128 个 token,再处理尚未缓存的后缀。重放段复用已有全局 KV,只重新生成 SWA;新增后缀才写入新的全局 KV 和 SWA。
  • 解码器恢复: 每次 prefill 只把完整提示最后 128 个位置的编码器输出送入解码器,以重建解码器局部 KV。解码器全局 KV 已由编码器输出构造;恢复的局部状态只服务当前 decode,不进入前缀缓存。

例如,缓存命中了前 100,000 个 token,新增工具输出为 2,000 个 token,而局部缓存已过期。编码器从命中边界前 128 个位置开始恢复局部状态,再处理新增内容;原有全局前缀保持不变。解码器只处理整个新提示最后 128 个位置。这个例子也说明:缓存命中边界会影响恢复状态,继而影响新增后缀的 KV。 报告明确承认不同命中位置的结果不具备数学等价性,并在后训练中模拟解码器重放进行适配。两条恢复路径,§3.2.2,p.20

部署策略据此区分状态寿命。全局 KV 保留在长周期持久缓存中,作者配置至少 72 小时;编码器 SWA 使用约占各机器主机 DRAM 10% 的分布式内存池,只保留分钟级 TTL。局部状态缺失时可以低成本重建,因而无需随全局历史一起长期存放。报告称 V4 持久缓存中局部状态约占一半,移除这部分,再把全局部分压至原来的约四分之一,得到同类负载下约八分之一的持久容量。这一比例依赖原有负载、回合长度和缓存组成。持久缓存管理,§3.2.1,p.19

辅助结构如何补足容量和执行效率

Engram 扩展可查表的参数容量。 本模型额外配置 196B Engram 参数,均分到零起始第 1、14 层。对文本后缀的 2、3、4-gram,先进行 token 规范化,再按每阶 8 个哈希头查表;每阶共得到 2,048 维 embedding,由当前 hidden state 调制各残差分支的注入强度。查表地址只依赖 token,门控依赖上下文,两者分开后可以在前序主干计算期间预取表项。本次删除原 Engram 的短因果卷积,表和投影使用 FP8,表更新改用动量加 Sinkhorn 平衡。参考实现对图像位置关闭 Engram 注入。报告 §2.4.2、§3.1.3Engram 原论文 §2本版 Engram 与图像 mask

推理中的主机表预取并不意味着所有阶段都把 Engram 放在 CPU。训练时表按行切分,预取和梯度回传与视觉编码计算重叠;报告特别说明 RL rollout 的表常驻 GPU,以减少主机内存压力及碎片导致的失败。容量位置是运行阶段的配置,196B 查表参数仍然占用实际存储。Engram 系统实现,§3.1.3,p.18

Single-Pass mHC 改变一次依赖,消除残差的重复遍历。 mHC 保留四条残差流,输入混合系数原本由当前残差计算;必须等归约完成,才能再次读取残差并混合。新版让当前计算块使用前一块已经产生的输入混合系数:

Xl+1=BlXl+ClFl(Al1Xl),(Al,Bl,Cl)=H(Xl). X_{l+1}=B_lX_l+C_lF_l(A_{l-1}X_l), \qquad (A_l,B_l,C_l)=\mathcal H(X_l).

于是同一块残差数据加载后,可以同时用于本次输入混合和下一次系数预测。部署用 Mega-mHC 融合残差更新、混合、系数预测、输入归一化及 FP8 转换,将该操作的激活读写量从原实现的 (4n+4)d(4n+4)d 降为 (2n+2)d(2n+2)d。这是明确的局部数据流收益;报告只定性说明混合系数错移一块的能力损失很小,未给出完整独立消融表。Single-Pass mHC,§2.4.1,pp.12–13

DSpark 把草稿长度选择交给接受率和执行成本。 三个草稿 Transformer 块一次产生五个位置的基础 logits,轻量 Markov head 描述草稿 token 间依赖,置信度头预测条件接受概率,再由调度器结合引擎吞吐曲线决定验证多长的前缀。五个草稿位置并不对应固定五倍加速。主干预训练时没有联合训练 MTP;预训练后先冻结主干训练 DSpark,后训练中继续更新 DSpark,但其目标的梯度不传入主干。DSpark 与梯度边界,§2.4.3,pp.13–14

从原生多模态预训练到可验证的任务环境

图像先经过从头训练的 DeepSeek-ViT,使用 2D-RoPE、线性 patch 投影、RMSNorm 和 SwiGLU。3×33\times3 pixel-unshuffle 将视觉 token 数降为九分之一,再通过两层 MLP 投到语言主干维度。视觉编码器先用约 47B 图文对进行 SigLIP 式对比训练,再接一个 4B MoE 语言模型,以约 236B token 的生成目标训练细粒度视觉能力;随后移除这一个辅助语言模型,将视觉编码器接入 V4.1 主干。这是视觉模块的准备阶段。视觉结构与准备训练,§2.1.1、§4.2.2

主干从预训练起就混入图文数据,总计 45T token,纯文本与多模态数据的 token 比为 7:1;这个比例不等于纯文本 token 与图像 token 的比例。稀疏注意力从 64K 序列长度起训,在累计 34T token 时扩至 1M。batch 固定为约 100.6M token;视觉编码器在学习率衰减开始前冻结,最后归一化层和投影器保持可训练,衰减开始后才联合更新视觉编码器。数据整合与训练设置,§4.1–4.2

参数更新也按对象分工:线性矩阵主要使用 Muon,query / key 权重采用按头 Muon;归一化和其他非矩阵参数使用 AdamW;Engram 表、token embedding 和预测头使用 Nesterov 动量后交替进行行、列归一化的 Sinkhorn 更新。后者只保存动量,避免为大表保存 Adam 的两份矩状态;其行列归一化针对“token / n-gram 身份 × 隐藏特征”的矩阵结构。作者报告经验优势,未在本文给出匹配预算的完整优化器比较。优化器与 Algorithm 1,§2.5,pp.14–16

后训练沿用 SFT、RL、OPD 的既有范式,主要工作投入任务和环境。一个训练任务被组织为“问题、环境、验证系统”三元组,同时审核难度与正确性。通用 agent 环境从自愿返回的真实交互、工具接口和失败案例构造;代码任务从复杂工作会话和公开仓库出发,经过可运行性判断、任务与测试设计、隔离环境构建、多次试解、独立质检、修复及重新验证。代码测试同时包含目标变化的 fail-to-pass 项和既有行为的 pass-to-pass 项,任务在后续 RL 使用中继续接受轨迹审计。任务生产链,§5.1.1,pp.25–26

异步 RL 用样本完成事件维护并发:累计完成的样本数达到下一个 prompt 的 GRPO 分组大小,就分派该 prompt,不要求这些完成样本来自同一组。训练数据积累足够时暂停 rollout,训练后恢复。系统保存跨 checkpoint 轨迹的 KV 与专家路由,在训练中拼接各段真实采样时的路由;分别用数据集并发约束、启动阶段短样本处理、陈旧性限制和 token loss mask 缓解长度偏差与 off-policy 问题。最后以 40 多个、可以异构的教师在学生轨迹上提供全词表 OPD 监督,整合不同领域能力。异步 RL 与 OPD,§5.2,pp.30–32

这套调度维持的是长轨迹执行进度;跨 checkpoint 复用旧 KV 不具备“用最新参数重新计算整个前缀”的数值等价性。报告没有披露足以独立重建全套 RL 的任务量、总训练预算、所有奖励权重、陈旧性阈值和教师清单。任务和环境的重要性有运行结果支持,独立因果贡献仍需匹配训练预算的比较。

Reasoning effort:学习不同的推理长度代价

模型接收 1–100 的 effort 数值 bb。训练时,对同一问题 xx 在若干 effort 下采样,并且只在相同 (x,b)(x,b) 的子组内中心化奖励,避免把不同目标长度的回答直接混为一组。每条轨迹加入长度惩罚:

rlen(,b)=min(Cmax,k(b)Lnorm),k(b)=k0exp(bbminτ). r_{\mathrm{len}}(\ell,b) =-\min\left(C_{\max},k(b)\frac{\ell}{L_{\mathrm{norm}}}\right), \qquad k(b)=k_0\exp\left(-\frac{b-b_{\min}}{\tau}\right).

\ell 是推理 token 数,LnormL_{\mathrm{norm}} 为归一化长度,CmaxC_{\max} 限制最多扣分。effort 越高,每增加推理 token 的惩罚越低,模型可以使用更长的推理或探索轨迹。有限训练档位之间可以输入中间数值;公开 API 的 low / high / max 分别映射到 50 / 75 / 100。这是条件化的行为控制,并非硬性 token 上限。分组、奖励与 API 映射,§5.1.4,pp.29–30

附录用“额外推理的边际成功收益近似指数衰减”来解释这个惩罚形式:当最优点位于内部且惩罚未触及上限时,指数下降的 token 成本可产生随 effort 近似线性增加的偏好长度。该推导是局部奖励模型;随机生成、策略变化、多轮交互及惩罚截顶都会改变实际曲线。推导条件,Appendix C,pp.49–51

证据与结论

存储账本与执行依赖支持降本方向,生产速度仍需单独测量

全局 KV 的 890 字节可以由四个源层的数量、压缩率和量化布局重建;CED 提前结束大部分输入位置计算的依赖也明确。这些材料足以支持相应的缓存布局和执行成本判断。持久容量约八分之一则结合了 V4 部署中 SWA 约占一半的具体组成,不能作为所有缓存策略的固定比例。缓存布局与部署,§2.4.4、§3.2.1

报告 Figure 2 显示从 4K 扩到 1M,上下文长度增加 256 倍,单 token decode FLOPs 只增加约四分之一。但图中对 BF16、FP8、FP4 运算分别使用 1、0.5、0.25 权重。这是考虑精度权重的计算量曲线,不是统一硬件上的时间测量。本文也没有给出覆盖硬件、并发、输入输出长度、缓存命中率及网络搬运的完整服务吞吐—延迟曲线,因此不能由此推导四倍吞吐、八倍并发或整机成本同倍下降。Figure 2 与计数口径,p.5

近似重放、跨层复用、候选池限制和低精度共同启用后,作者报告能力良好,并说明内部测试中没有观察到系统性退化。但各项移除或替换后的独立损失、缓存边界压力测试及误差分布没有完整公开。证据支持这套联合配置已经取得较强结果,独立组件的能力代价与极端恢复边界仍待检验。重放说明,p.20;局限,p.37

基座能力提升有具体分布,知识与长上下文仍存在差距

下表选取报告内部统一评测设置下的基座结果;每行均使用报告相同的 few-shot 数与指标。

基座评测 V4-Flash V4-Pro V4.1-Flash 本项观察
MMLU-Pro,5-shot EM 68.3 73.5 74.1 接近 Pro 并略高
SimpleQA-Verified,25-shot EM 30.1 55.2 42.3 较 Flash 提升,仍低于 Pro
BigCodeBench,3-shot Pass@1 56.8 59.2 60.6 本配置代码成绩更高
HumanEval,0-shot Pass@1 69.5 76.8 79.4 本配置代码成绩更高
GSM8K,8-shot EM 90.8 92.6 93.0 接近 Pro 并略高
MGSM,8-shot EM 85.7 84.4 80.2 低于两个前序模型
LongBench-V2,1-shot EM 44.7 51.5 45.2 与 Flash 接近,低于 Pro

这些结果支持“部分知识、代码与数学能力达到或接近更大基座的水平”,同时保留 MGSM、SimpleQA 和 LongBench-V2 的边界。1M 上下文容量没有直接证明在百万长度下所有远程依赖都被可靠利用。完整基座结果,Table 1,p.24

内部保留语料上,V4-Pro → V4.1 的 BPB 分别为:内部文档 0.590 → 0.564,内部代码 0.1494 → 0.1443,学术材料 0.4677 → 0.4305。本地计算的相对下降约为 4.4%、3.4%、8.0%。这是三份未公开语料的语言建模结果,不能直接变成科研任务成功率。架构、数据、总训练量与参数组成同时变化,也无法据此单独归因于 CED 或 Engram。内部语料与 Figure 6,pp.24–25

参数比较还须保持口径:552B 指 backbone,此外有 196B Engram;报告所用约“三分之一 Pro 参数”的表述采用 backbone 对 backbone。8B / 16B 激活量必须随 prefill / decode 分开使用,不能给所有工作负载指定同一个平均压缩比。参数定义,§2.1,p.7

发布方 agent 评测进步显著,困难任务仍拉开差距

以下为报告 Table 3 的 Max effort 结果,数值为相应百分比;DeepSWE 使用 Resolved,其余所列使用 Pass@1。比较来自发布方汇总,本地未运行复测。

评测 V4-Flash V4-Pro V4.1-Flash Opus-5 Max
Terminal-Bench 2.1 82.7 87.9 90.6 89.1
Terminal-Bench 3.0 7.6 11.8 30.0 43.3
Terminal-Bench 4.0 7.0 12.4 31.2 51.8
DeepSWE v1.1 54.4 62.7 74.2 74.0
AutomationBench 37.7 43.2 54.8 50.3
Agents' Last Exam 25.2 25.7 31.8 28.6
GPQA Diamond 89.9 92.4 90.9 93.4
Chartography,带工具 78.9 84.0

V4.1 相对 V4-Flash 在 DeepSWE 提高 19.8 个百分点,在 Terminal-Bench 2.1 提高 7.9 个百分点,后续更难版本也有较大提升;Table 3 同时显示其与领先闭源配置在 TB 3.0 / 4.0、视觉任务和部分纯推理项目上的差距。DeepSWE 的 74.2 对 74.0 只表示该表中的数值接近,缺少置信区间时不能据 0.2 个百分点建立稳定领先判断。主要结果,Table 3,p.33

评测中的代码 agent 主要使用 DeepSeek Harness Minimal 和 1M 上下文,DeepSWE 使用 mini-SWE;视觉 agent 使用 Claude Code 与 512K 上下文。代码与视觉 agent 设置为 temperature 1.0、top-p 0.95;报告对单轮推理评测写的是 temperature 和 top-p 均为 1.0。HLE 全集 36.8 与文本子集 39.1 是不同分母;ZeroBench 的 Pass@5 也不与 Pass@1 混比。模型、工具、框架和预算共同决定这些结果。评测设置,§5.3.1,p.32

作者将后训练收益主要归于数据和环境生产,Figure 7–8 展示累计 RL steps 增加时的成绩提升;曲线也混入上下文扩展、跨运行 checkpoint 合并和不同框架配置。它们支持持续扩大这套训练流程能够改善结果,尚未形成“环境工程的边际收益普遍超过算法研究”的受控因果证据。引言所称可完成超过 95% 现实任务,也未提供可审计的任务总体、样本分母和成功标准。RL scaling,pp.25–28;引言表述,p.6

同一个 checkpoint 的框架差距足以改变部署判断

报告固定模型、任务和采样配置,改变框架的系统提示、工具定义与交互逻辑,得到:

框架 DeepSWE v1.1 Resolved Terminal-Bench 2.1 Pass@1
Claude Code v2.1.251 69.8 88.0
Codex v0.147.0 65.6 84.1
OpenCode v1.18.15 65.5 85.0
Pi v0.84.2 66.2 86.1
mini-SWE 74.2 90.3
DeepSeek Harness Minimal 72.6 90.6
DeepSeek Harness Standard 70.5 85.8
DeepSeek Harness PTC 67.6 85.8

DeepSWE 最高与最低相差 8.7 个百分点,TB 2.1 相差 6.5 个百分点。DeepSWE 每任务 8 次采样,TB 每任务 3 次,均为 1M 上下文、最多 500 次模型生成轮,temperature 1.0、top-p 0.95;多次采样没有把表中指标改成“多次尝试只要一次成功”的 Pass@8 / Pass@3。结果说明模型在多个框架中都具备能力,同时框架选择仍有实质影响。表中的 Codex、Claude Code 是运行框架,本行所有实验的模型均为 V4.1-Flash。Table 4,p.35;框架版本,Appendix B.1

effort 也须按框架校准。正文选定设置中,effort 25 → 100 时,DeepSWE 为 66.0 → 74.2,TB 2.1 为 82.4 → 90.6,代价是约 2.5 倍输出 token;但附录同一 checkpoint 的跨框架曲线存在准确率平台和回落。可以判断 effort 控制了总体计算投入,不能保证每个框架、任务、相邻档位的成功率单调上升。Figure 9,p.35;Appendix B.2、Figure 11,pp.48–49

同一 checkpoint 在不同框架下的 effort、准确率与输出长度
Image Source: 固定版本技术报告 Figure 11,PDF p.49 原图区域,完整保留六个面板、双轴及图例。实线为 Pass@1,虚线为平均输出 token;各面板坐标范围不同。原始 PDF

多 agent 是有希望的初步结果,证据限定在实际协议内

Agent Team 训练把任务表现、鼓励协作的奖励和派生时延惩罚组合起来。派生时延将执行事件及协作依赖表示为有向无环图,用固定 prefill / decode 速率换算 token 成本、加入实测工具时间,再计算关键路径。这样的训练信号鼓励能缩短依赖链的并行工作,同时降低服务排队噪声对奖励的影响。多 agent 训练,§5.3.5,p.36

在 ProgramBench 中,作者筛选出参考解通过率至少 95% 的 172 个任务,每任务最多 3 次 rollout;Almost@1 统计单条 rollout 达到至少 0.95 测试分的比例。8 小时截止时,所报告多 agent 配置为 30.04%,单 agent 为 20.39%;FrontierSWE v2 的公开 no-GPU 子集在 20 小时截止时 Mean@5 为 32.90 对 28.20。任务选择、指标与 Figure 10,p.36

这些实验匹配墙钟截止时间,未匹配总 token、并行设备或总计算预算,而且选择了已观察到的较强配置。它们支持在所测协议下利用并行协作提高限时成绩;不能识别纯粹增加代理数的独立效应,也不能直接推广至未筛选的完整 ProgramBench 或包含 GPU 的任务。

抽象与迁移

将“形成可复用历史”与“读取历史进行新计算”拆开

有直接依据的认识是:高层计算每次都需要历史信息,并不必然要求每层单独保存一份历史。CED 将全局表示集中在较早的计算边界,CSA2 保留各层 query 和局部更新,使计算深度与全局 KV 副本数部分解耦。

对应到反复读取大量仓库文件的代码 agent,输入文件与工具输出对应编码对象,生成补丁对应解码阶段。若新输入占总负载较大、全局表示已足以支持后续读取,编码阶段节省会更明显;若主要开销来自长输出、工具执行或队列等待,prefill 改造对端到端时延的影响会减小。前述不同输入长度的计数给出了这个预测的来源。这是架构设计上的条件性迁移,直接套用到每层都必须生成独立 KV 的既有 checkpoint 需要额外训练验证。

近似重建把缓存边界变成模型行为的一部分

SWA 重放说明,状态是否需要长期保存,取决于保存成本、未来复用概率、恢复代价和允许误差。全局表示承担长周期复用,局部状态通过短期缓存和有限计算恢复;较低的恢复代价使不同 TTL 成为可行设计。

可迁移到可暂停 agent 的前缀恢复设计,但应把命中边界纳入验证变量。待验证实验可以固定输入和后缀,逐步移动命中位置,比较完整前向、精确窗口恢复、128-token 近似恢复;同时记录后缀 logits 差异、任务成功率和连续多次恢复后的变化。若答案依赖边界附近的精确顺序、逐字符复制或被截断的局部组合,近似误差可能更明显。持续增长的误差、边界相关失败或全局检索不能补回的信息,会否定“该恢复长度足够”的迁移假设。

共享表示与共享候选池分别产生容量和召回约束

CSA2 的 Reindex 保留了在相同历史表示中改变关注位置的能力;分层索引则进一步限定所有深层搜索必须落在第一个候选池中。二者对表达和召回的影响不同。

在跨文档证据组合中,若浅层索引能保留后续所需的多个证据块,后续 query 可以低成本重新组织这些信息;若后续才显现的条件对应一个初始低分块,所有后续 Reindex 都无法选到它。待验证比较应同时测量候选池召回与最终任务质量,并与不限制候选池的版本对照。只观察最终 Top-512 数量或整体成绩,无法区分共享 KV 的损失和首次筛选的损失。

可验证任务的生产规模必须与验证器质量共同增长

本报告具体可迁移的关系是:任务、可执行环境和验证系统共同定义 RL 的学习信号。环境构造扩大覆盖,独立试解和质检暴露描述—测试不一致,后续训练轨迹又成为重新审计任务的材料。扩大其中一项会改变另外两项的失效方式。

对于自动构造仓库修复任务的训练流程,可对应保留行为测试、目标功能测试、参考解隔离和失败轨迹审核。若增加任务数时验证错误率上升,或 agent 能通过改变评测环境提高奖励,成功率增长就无法直接解释为目标能力增长。该报告提供了这条工程路径与失效观察,尚未给出验证器错误率随规模变化的定量规律。

effort 和协作规模需要按同一任务成本校准

同一个 checkpoint 的框架差距和 effort 非单调曲线表明,部署选择应考察“模型、框架、推理档位、任务分布”的组合。可测试先以较低投入处理常规任务,再在可观察失败或验证不充分时增加投入;这里的升级策略是待验证方案,报告没有直接测过它。

若比较单 agent 与多 agent,应同时约束截止时间和总 token / 计算,再观察复杂任务收益是否保留。任务容易分解时,依赖图关键路径可能缩短;任务高度串行、共享文件冲突频繁或验证必须集中完成时,更多协作可能增加等待和总成本。该预测来自报告采用关键路径时延奖励的具体设计。

Source

  • Workflow version: v3
  • Material type: technical-report
  • Analysis modules: model-report, system, experiment
  • Canonical source: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
  • Title: DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
  • Authors: DeepSeek-AI(团队署名);Appendix A 中已核验并复用已有档案的成员包括 Xin ChengWangding ZengDamai DaiXingkai YuZhenda XieWenfeng Liang。完整名单见附录。
  • Responsible organization: DeepSeek-AI
  • Affiliation: 团队署名为 DeepSeek-AI;附录 A 列出 Research & Engineering 与 Business & Compliance 成员,未提供逐人论文时机构映射。
  • Published / updated: 2026-09-10 正式发布;模型仓库当日创建。所读仓库 revision 最后更新时间为 2026-09-10 06:25:21 UTC。
  • Version / revision read: Hugging Face revision fb2764a5cf321eaa5070ca8f9e892818f477c16d固定 PDF、同 revision 的模型卡、配置、评测说明和参考推理代码。PDF 共 51 页,SHA-256 为 ba68e2e40408125ae6d2f63a9a241b61c73910691c74ec1a2a7023c851eac08d
  • Accessed: 2026-09-10
  • Reading scope: 已读正文 §1–6(pp.4–37)、附录 A–C(pp.46–51),核对 Figure 3、4、5、6、9、11 和 Table 3 等原始版面;参考文献用于定位 YOCO、Engram 等必要前作。已读同 revision 的 README、两份 config、evaluation/README、inference/README;选读 inference/model.py 的 Engram、索引器、注意力、mHC 与主前向路径。另核验官方更新日志、SGLang 部署文档及适配 PR、vLLM 适配 PR。未运行权重、训练或 benchmark;完整训练数据、生产服务栈和若干消融未披露。
  • Key figure decision: include
  • Key figure rationale: 总体图和三种 CSA2 模式用于核对跨层数据依赖;分层索引图用于区分共享候选位置与各层最终选择;effort 原图用于呈现不同框架下的性能回落与预算变化。
  • Review status: page-type=not-checked; match-confidence=not-applicable; observed-at=2026-09-10; venue-status=unknown
  • License: 模型仓库及权重的 MIT 许可

发布与部署补充

以下补充按 2026-09-10 的发布状态记录,核心数值以固定 PDF 为准;检索定位结果均回到原始网页或代码核验。

官方 API 名称已经变化。 更新日志确认 V4.1-Flash 正式发布,调用名为 deepseek-flash;旧的 Flash 和 Vision Exp 名称暂时重定向到新模型。官方另宣布 9 月 14 日北京时间 12:00 后,将 deepseek-v4-pro 暂路由至 V4.1-Flash,直到未来 V4.1-Pro 发布。因此仅保存 API 模型别名不足以确定复现实验的模型身份,还需要调用时间及服务方版本信息。2026-09-10 官方更新日志

发布材料存在两处需要保留的差异。 固定 PDF Table 3 与官方日志的 NL2Repo-Bench 均为 65.4,同 revision 模型卡为 64.0,原因未说明;本笔记不合并为一个无条件分数。模型卡把 instruct 采样统一写为 top-p 0.95,而 PDF §5.3.1 将单轮推理设为 top-p 1.0;正文按 PDF 的分任务协议记录。固定模型卡PDF 评测设置与表格

材料或实现 核验到的状态 对复现和部署判断的影响
DeepSeek 最小推理 提供权重转换、模型前向与普通自回归生成;README 明确说明是可读参考实现 主前向遍历全部层;索引器先生成全范围分数再做候选 mask。它体现模型计算语义,不能用来确认 CED 的 prefill 跳过或生产索引器的复杂度收益
SGLang 当日部署文档已发布,使用 dev-dsv41 / dev-dsv41-mi35x 预览镜像;文档明确尚未进入正式 release 文档提供部署配方,适配主 PR 当次核验仍未合并;有配方不等于所有平台、组合和性能已稳定验证
vLLM 当日已存在模型适配 PR #56201 和 SWA bounded replay PR #56205,当次核验均未合并 开发中的支持可以确认;正式 release 可用性和完整服务收益尚未由这些 PR 证明
DeepSWE 复现材料 固定了 Pier 和任务仓库 commit,并给出 mini-SWE / dsh-minimal 运行说明及适配 patch 为外部复测提供了具体起点;本次未执行,也未把命令说明当作独立复现结果

来源:参考实现说明主前向路径索引器路径SGLang 部署文档SGLang 文档 PR #38802SGLang 模型 PR #38798vLLM 模型 PR #56201vLLM 重放 PR #56205固定版 DeepSWE 复现说明。PR 状态核验时间为 2026-09-10 15:06(UTC+8)。

SGLang 的补充尤其有助于理解生产条件:解码器窗口重放为显式启用项,不支持 prompt logprobs,且不与完整 prefill 数值等价;预览版还有 prefill CUDA graph、DP attention 等组合限制。文档说明当前后端不保证跨 batch 组成的逐位一致性,并拒绝 deterministic-inference 选项。DSpark 的高吞吐配方会关闭投机,说明草稿验证收益依赖批量与实际接受率;文档同时限制 PD 分离与投机组合。以上均为所读预览版声明,本地未做运行验证。SGLang 架构限制、配置与 DSpark / PD 说明

本次检索未取得可以与正式 V4.1 权重及同一评测协议对应的第三方完整基准复测。框架适配 PR 中的局部分数与发布前 beta 的使用反馈,均不足以替代这种证据;因此本文主要成绩保留发布方报告属性。

Model Summary

下表合并报告 §2 / §4.2 与固定版配置。B 表示十亿参数;“总量”与“每 token 激活量”分开记录。

Field Value
Architecture 原生图文 MoE;CED 因果编码器 + 解码器,CSA2 / SWA,Single-Pass mHC,Engram,DSpark
Total Parameters 官方报告 552B backbone + 196B Engram;两项合计约 748B。辅助模块的独立参数账本未单列,不把量化张量元素数当作精确参数总数
Activated Parameters Prefill 约 8B / token;decode 约 16B / token;prefill 窗口重放和视觉编码另有开销
Number of Layers 主干 40,编码器 20 + 解码器 20;DSpark 另有 3 个块
Number of Dense Layers 主干 FFN 中为 0;40 层均使用 MoE
Attention-Layer Composition 2 层纯 SWA + 38 层 CSA2/SWA;全局分支共 4 Full、4 Reindex、30 Reuse
Model Hidden Dimension 5120
Attention Hidden Dimension 每头 512;全部 query 头投影维度为 64×512=3276864\times512=32768(本地计算),query 压缩维度 1280;RoPE 子维度 64
Number of Attention Heads 主 query heads 64,共享 KV latent;索引器 query heads 32、每头维度 128
Attention Output Projection 8 组,每组中间输出维度 1024
MoE Hidden Dimension (per Expert) 2304
Number of Experts 每层 384 个路由专家,另有 1 个共享专家
Selected Experts per Token 每 token 选 6 个路由专家,另计算共享专家
Number of Shared Experts 每层 1
Vocabulary Size 129280
Context Length 1,048,576 token;预训练初始 65,536,后扩展
Attention Mechanism CSA2 全局分支 + 128-token SWA;编码器压缩率 2、解码器压缩率 1;Top-512;解码器后续索引最多搜索 16,384 个候选
Activation Function SwiGLU,clamping 阈值 10
Engram 196B,两个模块;2/3/4-gram,每阶 8 个 hash heads、2048 维;每头表约 16M 项
Vision Encoder DeepSeek-ViT,32 层,hidden 1024,16 heads,patch 14,2D-RoPE,3×3 pixel-unshuffle;两层 MLP 投影至语言主干
Parameters of Vision Encoder 未单独披露
Quantization 发布配置为主体 FP8、专家 FP4,相应量化线性层的激活采用动态 FP8;Engram 表及投影 FP8。主 KV 为 E2M1 + 每 16 通道一个 E4M3 scale,后训练引入 QAT;索引器使用 MXFP4,SWA KV 保留 FP8。专家权重的 QAT 配方未在本报告单独展开
Modality 图像、文本输入;自回归文本输出

配置来源:HF config.jsoninference/config.json报告 §4.2.1,p.22

作者与跨论文关系

论文以 DeepSeek-AI 团队署名。附录 A 按名字字母序分别列出研发与业务合规成员,星号表示已离队人员;这种排序不提供第一作者、共同一作或各模块负责人的依据。成员列表中存在重复的 Xinyu Yang、Yao Li 和 Zhixuan Chen,逐人身份不能仅凭姓名唯一确定。作者名单,Appendix A,pp.46–47

结合附录和已有 DeepSeek 作品记录,可复用本站的 Xin ChengWangding ZengDamai DaiXingkai YuZhenda XieWenfeng Liang 档案;未依据附录给同名的其他机构研究者建立新关联。本篇未扩展个人资料,也未从成员重叠推断具体模块归属。

与已有笔记的可核验联系包括:

  • DeepSeek-V4 提供 CSA/HCA、mHC 和多领域后训练的直接前序背景;V4.1 改为纯 CSA2,并改变 prefill 与持久缓存路径。
  • Engram 是报告明确采用的条件记忆模块;本版落实了大表集成,删除短卷积并更换大表优化器。
  • DSpark 是报告明确采用的草稿与置信度调度设计;本版说明了其独立预训练与后训练梯度边界。
  • IndexCache 是报告讨论的跨层位置复用前作;CSA2 同时共享主 KV 与索引器 K,并增加重新检索层。此处关系来自本报告的直接引用,不把“同为索引复用”视为所有方法等价。