2606.09079-flashmemory-deepseek-v4-lookahead-sparse-attention

FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

FlashMemory-DeepSeek-V4 在 DeepSeek-V4-Flash 的 HCA / CSA 结构上增加一个 lookahead Neural Memory Indexer,把历史 CSA chunk 放入 CPU cold pool,再按未来约 64 个 token 的预测需求取回少量 chunk;它把平均物理 KV 占用降到 full-context baseline 的 13.5%,平均分数从 76.9 提到 77.5,但证据主要来自技术报告、内部 SGLang 日志和未完整释放的生产 KV swap 路径。

已审阅 Archived 2026-07-05 12:58 Updated 2026-07-14 10:19 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Yan Wang:Independent Researchers;Tencent。
  • Qifan Zhang:Tencent;The Hong Kong University of Science and Technology (Guangzhou)。
  • Jiachen Yu:Tencent;Tsinghua University。
  • Tian Liang:Tencent;Tsinghua University Shenzhen International Graduate School;Wuhan University。
  • Dongyang Ma:Independent Researchers。
  • Xiang Hu:Tencent。
  • Zibo Lin:Tencent。
  • Chunyang Li:Tencent。
  • Zhichao Wang:Tencent。
  • Miao Peng:Tencent;The Hong Kong University of Science and Technology (Guangzhou);Wuhan University;Northeastern University。
  • Nuo Chen:Tencent;The Hong Kong University of Science and Technology (Guangzhou);Peking University;Beijing University of Posts and Telecommunications。
  • Jia Li:The Hong Kong University of Science and Technology (Guangzhou);The Chinese University of Hong Kong;Google AI;Tencent AI Lab。
  • Yujiu Yang:Tsinghua University;Chinese Academy of Sciences Institute of Automation / National Laboratory of Pattern Recognition。
  • Haitao Mi:Tencent。
  • Dong Yu:Tencent。

阅读目标与判断边界

  • 关注点:它如何训练 indexer、如何把未来窗口标签构造成 chunk-level 监督、如何和 DeepSeek-V4 的 CSA/HCA 既有 top-k selector 组合。
  • 评估重点:KV memory 降幅、准确率保持、MRCR / no-context / 超训练长度失败边界,以及 release 后能否复现生产结论。
  • 判断边界:本文是 arXiv technical report,未找到公开 peer review;代码仓库主要释放 Neural Memory Indexer 和 toy loop,生产 SGLang 集成、CPU-GPU swap scheduler、MRCR fallback 没有完整公开。

论文脉络

1. 背景:DeepSeek-V4 已经压缩 KV,但 CSA 仍然消耗历史 residency

DeepSeek-V4 通过 interleaved HCA / CSA 支撑 million-token context:

  • HCA 以约 128:1128{:}1 的粒度保留全局压缩上下文,承担低频全局信号。
  • CSA 继承 DeepSeek-V3.2 / DSA 的 lightning indexer,在每步从压缩 KV entry 中选 top-k,以恢复局部和稀疏精确信息。
  • 真实 serving 中,长上下文的瓶颈会从 attention FLOPs 转向物理 KV cache residency:即使每步只访问少数 chunk,系统仍可能把大量历史 CSA KV 留在 GPU 上,等待未来可能访问。

FlashMemory 的切入点是把“哪个 chunk 未来会被用到”独立建模,让 GPU 上只保留预测会被 CSA selector 使用的候选集合。

2. 核心设定:lookahead sparse attention

论文把 Lookahead Sparse Attention (LSA) 定义为两阶段选择:

  1. Memory Indexer 从当前 hidden state 预测未来窗口 [t,t+τ1][t,t+\tau-1] 需要哪些历史 chunk。
  2. DeepSeek-V4 原生 lightning indexer / top-k selector 在这些被取回的 chunk 内继续做细粒度选择。

因此 LSA 是一个 residency predictor。它不替换原始 CSA selector,而是缩小 selector 可访问的 GPU resident candidate set。

推理路径可以概括为:

  • HCA 保留全局压缩表示。
  • 最近窗口和正在 decode 的 token 保留在 GPU。
  • 历史 CSA chunk 默认在 CPU cold pool。
  • 每隔 τ=64\tau=64 个 decode step,Memory Indexer 对历史 chunk 打分。
  • 分数超过阈值的 chunk 被取回 GPU。
  • 每个 token 的 CSA 仍使用 DeepSeek-V4 原生 top-k 逻辑。
Figure 2: LSA architecture compared with the original CSA pipeline
Figure 2: LSA 与 CSA 的架构对比。黑线表示标准逐步 CSA pipeline,红线表示 LSA 机制:Memory Indexer 每隔 τ\tau steps 动态取回历史 KV chunks,把 GPU memory footprint 从全量历史驻留中解耦出来。Image Source: arXiv HTML x2.png.

3. Memory Indexer 打分函数

论文把 indexer 做成 dual-encoder 风格:query side 可训练,key side 使用冻结的 compressed key 表示。对第 ll 层,当前 hidden state ht\mathbf h_t 先经过低秩 query 投影:

ctQ=htWDQ \mathbf c_t^Q=\mathbf h_t W^{DQ}
qtl=ctQWIUQ=[qt,1l;;qt,nhll] \mathbf q_t^l=\mathbf c_t^Q W^{IUQ}=[\mathbf q_{t,1}^l;\ldots;\mathbf q_{t,n_h^l}^l]

同时生成 head-wise 权重:

wtl=htWw=[wt,1l;;wt,nhll] \mathbf w_t^l=\mathbf h_t W^w=[\mathbf w_{t,1}^l;\ldots;\mathbf w_{t,n_h^l}^l]

对历史 chunk ss 的 compressed key KsICompK_s^{\mathrm{IComp}},indexer 得分为:

It,s=σ(h=1nhlwt,hlReLU(qt,hl(KsIComp))) I_{t,s}=\sigma\left(\sum_{h=1}^{n_h^l}\mathbf w_{t,h}^l\cdot \operatorname{ReLU}\left(\mathbf q_{t,h}^l (K_s^{\mathrm{IComp}})^\top\right)\right)

阈值选择:

CtMemComp={CsCompIt,s0.5} C_t^{\mathrm{MemComp}}=\{C_s^{\mathrm{Comp}}\mid I_{t,s}\ge 0.5\}

随后每个 token 的原生 selector 在取回集合内继续做 top-k:

CiCoreComp={CsCompCtMemCompScorenative(i,s)Top-k} C_i^{\mathrm{CoreComp}}=\{C_s^{\mathrm{Comp}}\in C_t^{\mathrm{MemComp}}\mid \operatorname{Score}_{\mathrm{native}}(i,s)\in \operatorname{Top-}k\}

生产配置使用第 101012122020 层的三路 indexer,并取并集:

CtMemComp=l{10,12,20}{CsCompIt,s(l)0.5} C_t^{\mathrm{MemComp}}=\bigcup_{l\in\{10,12,20\}}\{C_s^{\mathrm{Comp}}\mid I_{t,s}^{(l)}\ge 0.5\}

这里的 101012122020 是 Transformer / CSA layer id。checkpoint 为三层分别保存独立 query encoder 权重,三路 indexer 对相同的历史 chunk id 打分。默认 OR-mode routing 等价于逐 chunk 取三路 sigmoid score 的最大值:

Rt[s]=I ⁣(maxl{10,12,20}It,s(l)0.5). R_t[s]=\mathbb I\!\left(\max_{l\in\{10,12,20\}}I_{t,s}^{(l)}\ge 0.5\right).

当前公开仓库 main@39fe54d 用这组结果生成一份全局布尔 resident_set。只要任一路选中 chunk ss,该历史位置就进入 GPU resident candidate set;所有 2121 个 c4 / CSA 层的原生 Lightning Indexer 随后只能在该集合内各自执行 top-512512。共享的是 chunk-position mask,各层仍保留独立的 Ks(j)K_s^{(j)}Vs(j)V_s^{(j)} 张量。取回表示该位置对各层可访问,具体某层是否使用它仍由该层自己的 native selector 决定。

因此,一个 target layer 的正预测可能触发同一历史位置在多个 CSA 层上的 layer-specific KV page recall。OR routing 优先降低漏取关键 chunk 的风险,同时会放大 false positive 带来的 CPU-GPU 传输和 HBM 占用。三层选择是质量与取回比例的经验 Pareto 折中;论文提到 88 层 ensemble 会取回约 30%30\%49%49\% 的历史 CSA chunk,memory saving 明显下降。

4. 标签构造:从未来真实 attention/top-k 反推 chunk 监督

训练的关键是把未来窗口中哪些 chunk 被 DeepSeek-V4 原生 selector 访问过,变成当前时刻 tt 的正样本。直接合并未来 top-k 会产生非常多正例,论文报告 naive union 约有 10,00010{,}000 个正 chunk / token window,因此先做 layer-wise softmax、top-p 和投票过滤。

对未来 token ii、层 ll、chunk ss 的原生 selector score Si,l,sS_{i,l,s},先归一化:

Pi,l,s=exp(Si,l,s)jexp(Si,l,j) P_{i,l,s}=\frac{\exp(S_{i,l,s})}{\sum_j \exp(S_{i,l,j})}

论文使用 p=0.6p=0.6 的 nucleus set 近似保留主要 mass:

Mi,l={ss belongs to the sorted prefix whose cumulative mass is at most p} \mathcal M_{i,l}=\{s\mid s\ \text{belongs to the sorted prefix whose cumulative mass is at most } p\}

再跨 CSA 层投票:

Vi,s=l=1LI(sMi,l) V_{i,s}=\sum_{l=1}^{L}\mathbb I(s\in\mathcal M_{i,l})
Aigolden={sVi,s3} \mathcal A_i^{\mathrm{golden}}=\{s\mid V_{i,s}\ge 3\}

最后把未来 τ\tau 个 token 的 golden chunk 合并为当前时刻的正标签:

Yt+=i=tt+τ1Aigolden \mathcal Y_t^+=\bigcup_{i=t}^{t+\tau-1}\mathcal A_i^{\mathrm{golden}}

这个标签管线把正样本规模从约 10,00010{,}000 降到约 10010010001000,使二分类训练更接近线上“取回少量 chunk”的目标。

5. 训练目标:冻结 key encoder,只训练 query-side projection

训练数据来自约 10,00010{,}000 篇长文档,长度覆盖 16K16\mathrm{K}512K512\mathrm{K}。DeepSeek-V4-Flash 冻结,离线跑出 compressed keys 和 golden labels。训练时冻结 KsICompK_s^{\mathrm{IComp}},只更新 query side 低秩投影矩阵,包括 WDQW^{DQ}WIUQW^{IUQ}WwW^w

基础二分类损失:

BCE(p,y)=(ylogp+(1y)log(1p)) \ell_{\mathrm{BCE}}(p,y)=-\left(y\log p+(1-y)\log(1-p)\right)

最终使用 focal loss 处理正负样本不平衡:

pt,s(correct)=pt,syt,s+(1pt,s)(1yt,s) p_{t,s}^{(\mathrm{correct})}=p_{t,s}y_{t,s}+(1-p_{t,s})(1-y_{t,s})
LFL=1SsSwt,s(1pt,s(correct))γBCE(It,s,yt,s) \mathcal L_{\mathrm{FL}}=\frac{1}{|\mathcal S|}\sum_{s\in\mathcal S}w_{t,s}(1-p_{t,s}^{(\mathrm{correct})})^\gamma\ell_{\mathrm{BCE}}(I_{t,s},y_{t,s})

论文采用 γ=2\gamma=2、负样本采样比例 3:13{:}1,没有单独使用 alpha weighting。模型使用 random initialization、rank r=2048r=2048。作者报告单次训练约 11 个 H20 GPU 小时收敛;一周内用 88 张 H20 运行约 500500 次训练来探索层组合、阈值和正例定义。

6. 实现边界:公开仓库包含两级 recall,复现仍耦合 DS-V4 / SGLang

截至 2026-07-13,GitHub main@39fe54d 已包含 retriever、modified SGLang 和 high-concurrency launch path:

  • retriever 输入 layer-specific hidden state 与 compressed key,输出逐 chunk sigmoid score;compressed_k 使用 128128 bytes float8_e4m3 key values 加 44 bytes float32 scale,共 132132 bytes per chunk。
  • Mode A 将非 resident chunk 的 score 置为 -\infty,完整 KV 仍在 GPU,适合复验选择逻辑,不能验证真实 offload memory saving。
  • Mode B 使用 prefill / decode disaggregation,在 decode 侧把 c4 KV 与部分 index-K 放入 CPU mirror;每 6464 step 更新全局 resident_set,通过 page recall、GPU reserve 和 asynchronous recall 恢复选中位置。
  • Level 2 在所有 2121 个 c4 层上运行原生 top-512512,并用 resident_set 屏蔽未取回 chunk。README 还记录了 MRCR threshold fallback 和 256K 到 1M 的参考吞吐。

因此,公开代码已经覆盖从三层 ensemble 到 page-level offload / recall 的主要路径。论文表格与 README 性能数字仍来自作者环境,复现需要匹配 DeepSeek-V4、modified SGLang、PD 拓扑、checkpoint、阈值和 GPU/CPU memory 配置;当前证据还不足以确定其他 serving stack 上的吞吐、tail latency 与互连压力。

关键实验/定理

结果 1:平均物理 KV 降到 13.5%13.5\%,平均准确率略高于 DS-V4-Flash

论文主表用 DS-V4-Flash full-context baseline、FM-DS-V4、Recency Only 和 Random 10% 对比。所有方案都保留 HCA、最近 8K8\mathrm{K} CSA local window 和 decoded tokens。

Figure 1: FlashMemory-DeepSeek-V4 accuracy and KV cache overhead
Figure 1: FlashMemory-DeepSeek-V4 的性能与硬件效率。在 LongBench-v2 和 RULER 上,FM-DS-V4 匹配或超过 DS-V4-Flash,同时把平均 KV cache overhead 降到 13.5%13.5\%。KV cache memory footprints 来自 8H20 GPU server 上的 SGLang deployment logs。Image Source: arXiv HTML x1.png.
Benchmark DS-V4-Flash FM-DS-V4 Recency Only Random 10%
LongBench-v2-S 46K 68.9 / 0.17 GB 70.2 / 0.04 GB 50.0 / 0.03 GB 53.3 / 0.04 GB
LongBench-v2-M 179K 67.6 / 0.65 GB 68.9 / 0.08 GB 54.4 / 0.03 GB 48.9 / 0.09 GB
LongBench-v2-L 493K 68.1 / 1.80 GB 70.0 / 0.18 GB 54.3 / 0.04 GB 46.9 / 0.22 GB
LongMemEval-S 125K 80.6 / 0.46 GB 82.0 / 0.06 GB 19.2 / 0.04 GB 20.1 / 0.07 GB
LongMemEval-M 500K 39.3 / 1.82 GB 40.2 / 0.17 GB 23.1 / 0.04 GB 25.7 / 0.22 GB
RULER 64K 94.7 / 0.23 GB 95.0 / 0.04 GB 36.6 / 0.03 GB 52.8 / 0.05 GB
RULER 128K 94.3 / 0.47 GB 93.2 / 0.06 GB 21.6 / 0.03 GB 32.3 / 0.08 GB
RULER 256K 90.5 / 0.94 GB 88.2 / 0.09 GB 20.6 / 0.04 GB 41.2 / 0.12 GB
RULER 512K 88.3 / 1.87 GB 89.6 / 0.18 GB 18.8 / 0.04 GB 27.2 / 0.22 GB
Avg 76.9 / 0.93 GB 77.5 / 0.10 GB 33.3 / 0.04 GB 38.7 / 0.12 GB

解读:

  • 平均分数 77.577.576.976.9,说明 Memory Indexer 在这些任务上没有明显破坏原生 CSA 的选择质量。
  • 平均 physical KV footprint 从 0.930.93 GB 到 0.100.10 GB,约为 baseline 的 13.5%13.5\%
  • 500K 左右任务上保持约 90%90\% KV reduction。
  • RULER 128K / 256K 中 FM-DS-V4 低于 DS-V4-Flash,显示 sparse residency predictor 在某些精确定位任务上会丢 chunk。

结果 2:No-Context 诊断暴露 O(1) memory 目标尚未达成

Benchmark DS-V4-Flash FM-DS-V4
LongMemEval-S no context 96.7 / 0.46 GB 95.0 / 0.06 GB
LongMemEval-M no context 91.2 / 1.82 GB 92.5 / 0.16 GB

作者用 no-context setting 检查 false positive chunk retention。理想情况下,当答案不依赖长上下文时,历史 CSA chunk 应接近常数级保留。结果显示长度从 125K 到 500K 时,占 baseline 的比例从约 13.1%13.1\% 下降到 8.4%8.4\%,但绝对 KV footprint 从 0.060.06 GB 到 0.160.16 GB,仍随上下文变长增长约 2.52.5 倍。

这说明固定阈值 sigmoid classifier 会积累 false positives,LSA 在当前形态下更接近“强压缩线性增长”,还没有达到 O(1) historical CSA residency。

结果 3:MRCR 是主要失败案例

论文报告 Multi-Round Coreference Recall (MRCR) 从 DS-V4-Flash 的 76.076.0 降到 FM-DS-V4 的 48.048.0。作者进一步做 oracle 实验:

  • LongBench、LongMemEval、RULER 中,只保留 10%10\%25%25\% golden CSA chunk 仍能保持 baseline 质量。
  • MRCR 即使保留 50%50\% true golden chunk,准确率仍下降约 2%2\%

论文给出三个原因:

  • 冻结 key 表示缺少任务特定 adaptation。
  • 浅层 dual-encoder cross interaction 不足以处理复杂多跳指代。
  • decoupled training 隔离于 generation dynamics,indexer 的局部二分类目标没有直接优化多轮消解质量。

这也是 release model card 提醒“精确 needle-retrieval 需要额外 fallback”的背景。

结果 4:长度泛化安全范围约到训练长度的 2×2\times

作者发现 indexer 可以安全泛化到训练上下文长度的约 2×2\times,超过后性能会明显下降。最终训练覆盖到 512K512\mathrm{K},因此 1M1\mathrm{M} 以上 context 需要重新训练或校准,不能直接从 512K512\mathrm{K} 实验外推。

结果 5:简单 baseline 被明显击败,强系统 baseline 仍不足

Recency Only 与 Random 10% 在多数任务上大幅低于 FM-DS-V4,说明长上下文访存不能用纯近因或随机采样解释。更严格的对比仍然缺失:

  • 没有和通用 sparse-attention serving framework 做 end-to-end throughput 对比。
  • 没有和 RetrievalAttention、RazorAttention、StreamingLLM、H2O 等历史 KV sparsification baseline 做系统化同环境比较。
  • 论文正文没有报告 decode latency、prefetch overlap、PCIe / NVLink bandwidth pressure、tail latency 和 batch-level scheduling;当前仓库 README 补充了 256K 到 1M 的参考吞吐,仍缺少误差范围、tail latency 与链路流量。

证据链强度评估

  • 强证据:主表覆盖 LongBench-v2、LongMemEval、RULER,并使用 DS-V4-Flash 原生 baseline;代码和 Hugging Face 释放了 retriever 权重,当前仓库还提供 modified SGLang 的两级 recall 与 offload path。
  • 中等证据:训练标签、focal loss、层 ensemble、阈值选择有清晰描述,且作者报告约 500500 次内部训练探索;细节足以理解 recipe,但缺少 ablation table。
  • 弱证据:production memory / throughput 仍来自作者 SGLang 日志与 README;代码虽已公开,尚无独立复现,延迟分布、互连流量和强 serving baseline 仍不足。
  • 风险证据:MRCR 失败、no-context false positives、长度外推边界都说明 LSA 当前还需要 fallback / recalibration / dynamic threshold 才能用于强精确召回 workload。

OpenReview / 审稿意见吸收

  • 未找到公开 OpenReview 或会议审稿页面;当前按 arXiv technical report 处理。
  • 没有 reviewer rebuttal、acceptance decision、官方 revision log 可吸收。
  • 后续若出现会议版本,应重点检查:MRCR fallback 是否公开、层选择与阈值是否有 ablation、end-to-end latency 是否补齐、1M+ context 是否重新训练并验证。

本地讨论补充

  • 对“通过时间预测相关 token 并预取 KV cache”的更精确表述:在时刻 tt,Memory Indexer 根据当前 hidden state 预测接下来 τ64\tau\approx64 个解码步可能访问的历史 KV chunk,并提前将这些 chunk 从 CPU cold pool 调回 GPU。预测目标是未来窗口的 chunk-level 访存集合,未来输出 token 的身份不在预测目标中;每个解码步实际访问哪些历史 entry,仍由原生 CSA selector 在 resident set 内执行 top-kk 决定。
  • 本文是 DeepSeek-V4 的外部附加 memory-indexing 节点,重点在 GPU KV residency 管理。
  • MiniMax Sparse Attention 的关系:MiniMax MSA 把 trainable sparse selector 放进模型架构和训练流程;FlashMemory 在 frozen DeepSeek-V4-Flash 上离线训练一个 lookahead retriever,用于服务阶段决定历史 CSA chunk 是否回到 GPU。
  • GLM-5.2 的关系:把当前解码步 tt、第 \ell 层的选择集合写成 St,\mathcal S_{t,\ell}。GLM-5.2 的 IndexShare 沿层深轴复用 anchor layer 的 top-kk indices,FlashMemory 沿解码时间轴预测未来窗口需要驻留的历史 KV chunk;前者减少 indexer FLOPs,后者管理物理 KV residency 与 CPU--GPU 预取。
  • 三路 indexer 的并集发生在历史 chunk position 层面。若第 1010 层单独选中 chunk 4242,全局 resident_set[42] 也会置为 true,runtime 随后恢复该位置所需的 layer-specific KV pages。各层不会共享同一份 KV 数值,恢复也不代表所有层都会 attention 到该 chunk;每个 CSA 层仍在 resident set 内独立执行 native top-512512

主要启发

  1. 长上下文推理可以拆成两个独立决策:本 token 看哪些 entry,以及未来一小段时间哪些 entry 值得留在快存储中。前者是 attention selection,后者是 KV residency prediction。
  2. Lookahead label 比即时 top-k label 更适合 serving,因为 swap / prefetch 需要提前量;τ=64\tau=64 把模型预测目标对齐到系统调度周期。
  3. 冻结 key、训练 query projection 是实用工程折中:训练便宜、部署轻量、对 base model 干扰小,但复杂检索任务会暴露 cross interaction 不足。
  4. 固定阈值二分类会导致长上下文 false positive 累积。后续更值得尝试 dynamic budget、top-k-by-memory、calibrated threshold、length-aware threshold 或 per-layer quota。
  5. 对 agentic serving,Memory Indexer 可以作为 KV prefetch / eviction policy 的学习组件;但多轮 tool-use 会改变未来访问分布,训练标签需要覆盖 tool result、conversation turn 和 retrieval-heavy prompt。

局限

  • 技术报告没有 peer review 证据,也没有种子、误差条或统计显著性。
  • 当前仓库已公开 modified SGLang 的 KV offload / recall path,但实现与 DeepSeek-V4 c4/CSA、PD 拓扑和特定 checkpoint 紧耦合,尚缺独立复现。
  • MRCR 与精确多跳指代是明显短板,需要 fallback。
  • no-context 结果说明 false positive 随 context 增长累积,O(1) historical CSA residency 尚未成立。
  • 训练到 512K512\mathrm{K} 后最多安全外推到约 2×2\times1M1\mathrm{M} 以上需要重新验证。
  • 没有系统比较不同 sparse attention serving / KV eviction 方法的 end-to-end latency、吞吐和 tail behavior。

跨论文关系

  • DeepSeek-V4:FlashMemory 复用 DeepSeek-V4-Flash 的 HCA / CSA 结构,新增独立 Memory Indexer 预测未来窗口需要的 CSA chunk,是 V4 heterogeneous KV cache 方向的外部补充。
  • DeepSeek-V3.2 / DSA:DSA 处理 token-level MLA latent KV entry top-k;FlashMemory 处理 chunk-level GPU residency,二者上下游组合。
  • IndexCache:IndexCache 沿网络深度复用 top-kk token positions,Shared 层仍读取各自的 KV,主要减少 indexer FLOPs;FlashMemory 沿生成时间预测未来窗口需要驻留的 KV chunks,主要减少 HBM residency 与无效搬运。两者优化轴互补。
  • Conditional Memory / Engram:Engram 把条件 lookup 做成模型能力和参数容量扩展;FlashMemory 把条件 lookup 用于 serving-time KV cache 管理。
  • MiniMax Sparse Attention:两者都训练 selector/indexer;MSA 是架构内 block sparse attention,FlashMemory 是冻结模型上的 lookahead dual-encoder retriever。
  • GLM-5.2:两者都围绕 DSA/long-context indexer 成本做工程化优化;GLM-5.2 强调 indexer/KV 共享复用,FlashMemory 强调 CPU cold pool 和未来窗口取回。
  • Span Query / Parrot:这些工作从 application structure 暴露 locality,FlashMemory 从模型 hidden state 预测 future locality,二者可在 agentic serving 中形成上下层信号。

Reference Intake Brief

  • Primary artifact: arXiv v2 technical report, TeX source, GitHub retriever code, Hugging Face model card。
  • Core concepts to index: FlashMemory, Lookahead Sparse Attention, Neural Memory Indexer, future-window chunk label, frozen compressed key, query-side low-rank projection, focal loss, CSA chunk CPU cold pool, DeepSeek-V4-Flash, HCA/CSA, SGLang integration。
  • Quantitative anchors: average accuracy 77.577.5 vs 76.976.9; average physical KV 0.100.10 GB vs 0.930.93 GB; average footprint 13.5%13.5\%; >90%>90\% KV reduction near 500K; MRCR 48.048.0 vs 76.076.0; no-context FM-DS-V4 0.060.06 GB at 125K and 0.160.16 GB at 500K。
  • Reusable equations: indexer sigmoid score, future-window golden label, focal loss, three-layer union routing。
  • Follow-up checks: public review status, production SGLang integration release, MRCR fallback, 1M+ retraining, latency / throughput / tail latency measurements。