2603.12201-indexcache-cross-layer-index-reuse
IndexCache: Accelerating Sparse Attention via Cross Layer Index Reuse
IndexCache 将 DSA 层划分为运行 selector 的 Full 层和继承最近 Full 层 top-k token positions 的 Shared 层,再用 loss-guided layer search 或 multi-layer index distillation 决定共享模式,从而在不复制 KV、也不改变 sparse core attention 的条件下跳过最多 75% 的逐层 indexer 计算;论文先在 30B 模型验证质量与速度,再以 training-free 方式扩展到 744B GLM-5,GLM-5.2 随后将同一跨层 index reuse 思路固化为每四层一次选择的 IndexShare 配置。
Source
- Workflow version: v2
- Material type: research-paper
- Canonical source: https://arxiv.org/abs/2603.12201
- Title: IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse
- Authors: Yushi Bai, Qian Dong, Ting Jiang, Xin Lv, Zhengxiao Du, Aohan Zeng, Jie Tang, Juanzi Li
- Responsible organization: Tsinghua University; Z.ai
- arXiv: https://arxiv.org/abs/2603.12201
- HTML: https://arxiv.org/html/2603.12201
- PDF: https://arxiv.org/pdf/2603.12201
- Code/Project: https://github.com/THUDM/IndexCache
- Code snapshot read:
08d22d69b1aa2aa0a3de23df6d6b88dbd5b5d044 - Related production material: GLM-5.2 model card; GLM-5.2 config; GLM-5.2 release note
- OpenReview / Review page: 未发现与当前版本可靠匹配的官方公开审稿页
- Submitted: 2026-03-12
- Current version read: arXiv v1
- Version / revision read: 2026-03-12
- Accessed: 2026-07-14
- Subjects: Machine Learning (cs.LG); Computation and Language (cs.CL)
作者与关系
- Yushi Bai: Tsinghua University。
- Qian Dong: Tsinghua University。
- Ting Jiang: Z.ai。
- Xin Lv: Z.ai;历史机构:Tsinghua University。
- Zhengxiao Du: Z.ai;历史机构:Tsinghua University。
- Aohan Zeng: Tsinghua University;Z.ai。
- Jie Tang: Tsinghua University,Knowledge Engineering Group (KEG)。
- Juanzi Li: Tsinghua University,Knowledge Engineering Group (KEG)。
- 机构关系:作者结构连接 Tsinghua THUIR / KEG 与 Z.ai 的 GLM 基座模型团队。论文脚注说明 Yushi Bai、Qian Dong 的工作在 Z.ai 实习期间完成。Qian Dong、Zhengxiao Du、Aohan Zeng 等同时进入 GLM-5 技术线,Yushi Bai、Jie Tang、Juanzi Li 形成清华长上下文与知识工程研究线。
- 已存档作者重叠:Yushi Bai 后续出现在 HiLS-Attention;Jie Tang 同时参与 SAO 与 CompactionRL。Xin Lv 同时参与 slime 官方项目,该关系保留为外部工程参照。
阅读目标与判断边界
本笔记关注:
- DSA 已将 core attention 稀疏化后,indexer 为什么仍会成为长上下文瓶颈。
- IndexCache 具体复用了什么状态,以及它对 FLOPs、KV cache、参数和显存分别有什么影响。
- training-free layer search 与 training-aware multi-layer distillation 各自如何工作。
- 30B 实验、744B GLM-5 验证与 GLM-5.2 IndexShare 生产配置之间可以建立多强的联系。
判断边界:
- 论文主体只报告 arXiv v1,尚无公开同行评审记录。
- 30B training-aware 实验使用由 GLM-4.7-Flash 转换得到的 DSA 模型;744B GLM-5 只报告 training-free 结果。
- GLM-5.2 官方材料确认固定四层共享、
和 MTP index sharing。公开材料没有披露它是否完整复用论文的 multi-layer distillation loss,因此相关训练路线只作机制相似性判断。 - 官方仓库提供针对特定 SGLang / vLLM commit 的补丁。它证明了可执行路径,不能直接代表上游框架已原生集成或不同硬件上的通用收益。
证据写法:
- 论文事实来自 arXiv v1 的正文、表格、图和附录。
- 代码事实来自 THUDM/IndexCache 快照
08d22d6中的 SGLang / vLLM patch。 - GLM-5.2 配置事实来自官方模型卡、release note 与
config.json。 - 从 IndexCache 训练方法推断 GLM-5.2 训练 recipe 的部分均明确标记为本地分析。
论文脉络
1. 研究问题、背景和价值
DeepSeek Sparse Attention (DSA) 把每层 attention 分成两段:轻量 indexer 先扫描全部历史位置并选择 top-
indexer 仍然要在每个 sparse layer 上为每个 query 扫描全历史。若模型有
IndexCache 处理的具体问题是:相邻层经常选中高度重叠的 token positions,逐层重新计算 indexer 含有可复用工作。若少数层生成新的 top-
2. 已有解决方案与不足
论文之前可以采用三类直接方案:
- 每层独立运行 indexer:质量路径完整,selector 成本随 sparse layer 数量线性叠加。
- 均匀间隔保留 indexer:实现简单,例如每四层运行一次;不同层对共享误差的敏感度分布不均,固定 pattern 可能集中损害长上下文检索。
- 用局部 top-
overlap 或 score similarity 选共享层:它们只比较当前两层 selector 的相似度,无法测量一次 token-set 替换经过后续 residual blocks 累积后的语言模型损失。
IndexCache 的改进方向对应两个部署约束。已有权重需要低成本适配时,用最终 LM loss 搜索 Full / Shared pattern;模型仍可训练时,让每个保留 indexer 学习其服务层组的平均 dense-attention target。
3. 作者可能的思考路径
可以从三个观察顺承得到该方法:
- DSA 已把昂贵 core attention 限制到 top-
,因此 indexer 的全历史扫描成为新的优化对象。 - 图 4 显示连续层的 top-
集合存在明显局部重叠,说明 indices 具备跨层复用基础。 - 均匀共享在高压缩率下会明显损害长上下文指标,说明“复用多少”与“在哪些层复用”需要共同优化。
于是推理侧可以把 pattern search 写成离散 layer selection;训练侧可以把一个 Full indexer 的监督目标扩展为后续多个层的 attention distributions。两条路径共享同一个 F/S 执行结构。
4. 核心假设或切入点
IndexCache 依赖以下条件:
- 相邻若干 sparse layers 的重要 token positions 存在足够冗余。
- 少量关键层需要保留 fresh selection,且这些层可以通过 end-to-end loss 或训练过程识别。
- Shared 层使用继承的 positions 读取自身 KV 后,模型仍能维持任务所需的信息流。
- selector 计算在目标 context length 和 runtime 中占有可观比例,跳过 selector forward 能转化为端到端收益。
这些条件都具有模型、任务和 runtime 依赖性。较高 overlap 提供可行性信号,最终质量仍需要 end-to-end 评测。
5. 方法 / 系统 / 理论框架
5.1 Full / Shared 执行语义
设第
- Full (F) 层运行本层 indexer,得到新的
。 - Shared (S) 层跳过本层 indexer,直接使用最近一个 Full 层生成的 top-
indices。
若 Full 层比例为

5.2 共享对象:position indices
IndexCache 沿网络深度共享的是 top-
因此它的资源影响可以拆开理解:
| 对象 | 是否共享 / 减少 | 原因 |
|---|---|---|
| top- |
共享 | S 层继承最近 F 层的 selection result |
| 每层 K/V vectors | 不共享 | 每层 hidden states 与 projection 参数不同,S 层只复用位置 |
| core sparse attention | 不跳过 | 每层仍需对选中 positions 完成本层 attention |
| KV-cache footprint | 基本不变 | 所有层的 KV 仍需保存;IndexCache 没有 eviction 或 compression |
| indexer forward FLOPs | 按 F 层比例减少 | S 层不运行本层 selector |
| 已加载 indexer 参数 | 公开补丁中基本不变 | 模块仍被构造和加载,运行时通过 pattern 跳过 forward |
| 跨时间 selection cache | 没有 | 每个新 query token 仍从 F 层生成新 top- |
实现只需向后传递一个当前 top-
5.3 Training-free:用 LM loss 搜索 layer pattern
training-free 路径从全 F pattern 开始。每一步对仍为 F 的候选层逐个尝试改成 S,在固定 calibration data 上计算语言模型损失,选择 loss 增量最小的候选并永久改为 S。重复执行直到达到目标 Full ratio。
对
次 forward evaluation。论文按 pipeline-parallel blocks 分段搜索,可将 wall-clock 近似降低
这个 search 的优点是直接测量最终模型 loss,并且不修改权重。它的代价是离散搜索仍然较重,pattern 对校准分布和模型版本具有依赖性。
5.4 为什么 overlap 只能作为观察信号
两层 top-
论文的 greedy loss search 用完整 LM loss 评估一次 F 到 S 的改动,覆盖了后续层的传播结果。表 2 也给出直接证据:同样保留四分之一 indexers 时,uniform pattern 的 Long Avg 从 DSA 的 50.2 降到 43.0,searched pattern 为 49.9。层间 overlap 支持“可以共享”,end-to-end loss 决定“在哪些层共享”。
5.5 Training-aware:一个 indexer 对齐多个层
当第
论文同时定义平均 target:
命题 1 证明,两者对 indexer 参数的梯度相同。直观上,一个 F indexer 学习其服务层组的平均 attention preference,从而生成兼顾多个层的共享 indices。
训练 recipe 先做 1,000 steps dense warm-up,只训练保留的 F indexers、冻结其余模型;随后进行 4,000 steps sparse training,以 multi-layer index loss 与 LM loss 共同优化。训练使用 SFT data 和 200K context。
梯度等价只覆盖分布蒸馏目标。top-
5.6 公开 runtime patch
官方仓库提供 SGLang 与 vLLM patch。两条路径都把 prev_topk_indices 沿 decoder layers 传递:F 层计算并更新 indices,S 层设置 skip_topk 后复用已有 tensor。SGLang patch 额外暴露 index_topk_freq 和 index_topk_pattern,分别支持固定频率和显式 pattern。
仓库快照基于 SGLang commit b638b25b 与 vLLM commit 4508532fb,属于针对特定基线的 patch package。公开 patch 对 next-token-prediction / MTP 分支通过 is_nextn 关闭这一路共享;GLM-5.2 官方配置后续加入 index_share_for_mtp_iteration=true。这说明 GLM-5.2 的 MTP IndexShare 已超出论文仓库当时公开 patch 的执行范围。
证据定位:官方仓库 README;sglang.patch 与 vllm.patch 中 decoder layer 的 prev_topk_indices、skip_topk、index_topk_freq、index_topk_pattern 和 is_nextn 路径,快照 08d22d6。
5.7 GLM-5 -> IndexCache -> GLM-5.2 IndexShare
三份材料形成清晰时间线:
| 时间 | 材料 | 能确认的关系 |
|---|---|---|
| 2026-02-17 | GLM-5 | 744B-A40B 模型采用 DSA;IndexCache 论文随后把该 checkpoint 用作 production-scale training-free 验证对象 |
| 2026-03-12 | IndexCache | 提出统一的 F/S 执行结构、training-free loss search 与 30B training-aware multi-layer distillation |
| 2026-06-16 | GLM-5.2 | 官方将生产机制称为 IndexShare,固定每四个 sparse layers 生成一次 top- |
GLM-5.2 的官方 config.json 给出 index_topk=2048、index_topk_freq=4、index_skip_topk_offset=3、index_topk_pattern=null 与 index_share_for_mtp_iteration=true。在 offset 之后,indexer_types 呈周期性的 full, shared, shared, shared,对应 FSSS pattern。这里共享的是 selector 输出的 positions;模型卡中 “same indexer result” 应按这一执行语义理解。
GLM-5.2 模型卡报告 IndexShare 在 1M context 下将 per-token FLOPs 降低 2.9 倍,并称该机制从 128K sequence length 的 mid-training 阶段引入。论文的 training-free 30B 实验显示 uniform 1/4 会显著掉点,training-aware uniform 1/4 则接近 DSA baseline。由此可以推断,GLM-5.2 的固定 FSSS 需要训练期适配;官方材料尚未披露它使用的具体 index loss,也没有确认完整采用 IndexCache 命题 1 对应的 multi-layer distillation recipe。
IndexCache 和 IndexShare 可以按“方法族 / 生产配置”区分:IndexCache 给出搜索、训练与执行框架;IndexShare 是 GLM-5.2 对四层固定共享及 MTP extension 的发布名称。
6. 结论链条
- DSA 的 sparse core attention 将主要计算从全历史多头 attention 转向 top-
,逐层 indexer 的全历史扫描随之成为长上下文瓶颈。 - 相邻层 top-
positions 存在复用空间,F/S pattern 可以跳过部分 selector forward。 - Shared 层只继承 positions,每层 KV 和 core attention 保持独立,因此 FLOPs 收益与 KV-memory 收益需要分开核算。
- 直接均匀共享会遇到 layer sensitivity;training-free 路径用 end-to-end LM loss 搜索 pattern,training-aware 路径把多个层的 attention targets 蒸馏到共享 anchor indexer。
- 30B 实验支持 1/4 Full ratio 下的质量保持和端到端加速;744B GLM-5 验证支持 training-free 扩展性。
- GLM-5.2 把跨层 index reuse 固化为 FSSS IndexShare,并扩展到 MTP,但其具体训练目标仍未公开。
关键实验/定理
结果 1:30B 模型的长上下文速度收益

- 设置:GLM-4.7-Flash 30B-A3B、47 layers,转换为 DSA;SGLang
dp_attention、data parallel size 8、单个 8xH100 节点;测量 10K、60K、120K、200K contexts。 - Baseline:每层运行 indexer 的 DSA。
- 指标:prefill latency、single-request decode tokens/s、full-KV-cache throughput。
- 结果:200K context 下,prefill 从 19.5s 降到 10.7s,约
;single-request decode 从 58 提升到 86 tokens/s,约 ;full-KV-cache throughput 从 197 提升到 297 tokens/s,约 。 - 证据定位:Section 4.2,Figure 3。
- 对照是否可比:同一模型、runtime、硬件和 context sweep,属于较强 implementation-matched 对照;公开仓库仍需应用指定 patch 才能复验。
- 支持的最窄结论:在该 30B DSA 模型与 H100/SGLang 配置中,保留四分之一 Full indexers 能显著降低 200K prefill 与 decode 成本。
- 解读:prefill 加速更高,符合 selector 在 prefill 中保留二次扫描量级的成本结构。端到端速度低于理论
selector reduction,因为 core attention、MoE、通信和其它层计算保持不变。
结果 2:training-free search 避免 uniform 1/4 的主要质量损失
- 设置:30B DSA checkpoint;固定 calibration data 上执行 greedy layer search;评测 5 个 long-context tasks 与 4 个 general/reasoning tasks。
- Baseline:原始 DSA,以及相同 Full ratio 的 uniform pattern。
- 指标:Long Avg 与 General/Reasoning Avg。
- 结果:DSA 为 50.2 / 74.6;uniform 1/4 为 43.0 / 73.8;searched 1/4 为 49.9 / 74.9。searched 1/8 降到 46.1 / 73.7。
- 证据定位:Section 4.3,Table 2。
- 对照是否可比:Full ratio 对齐,能隔离 layer pattern 的影响;search 使用额外 calibration compute。
- 支持的最窄结论:在该 checkpoint 上,LM-loss-guided pattern 能在 1/4 ratio 下恢复 uniform pattern 丢失的大部分长上下文质量;1/8 已出现明确退化。
- 解读:layer placement 是核心变量,uniform sharing 的实现简洁性无法替代 sensitivity search。
结果 3:training-aware distillation 支持固定共享 pattern
- 设置:先 1,000-step dense indexer warm-up,再 4,000-step sparse training;SFT data、200K context。
- Baseline:DSA、uniform 1/2 与 1/4,以及移除 cross-layer index loss 的 ablation。
- 指标:Long Avg 与 General/Reasoning Avg。
- 结果:DSA 为 51.0 / 74.2;training-aware uniform 1/2 为 51.6 / 74.5;uniform 1/4 为 50.6 / 74.1。1/2 配置移除 cross-layer loss 后,Long Avg 降到 49.8,AA-LCR 从 49.8 降到 44.0。
- 证据定位:Section 4.4,Table 3。
- 对照是否可比:训练步数与 pattern 对照较清楚;论文未报告多 seed 或置信区间。
- 支持的最窄结论:在该 30B 训练 recipe 中,多层 index distillation 对固定共享 pattern 的质量保持具有实证贡献。
- 解读:这个结果解释了生产模型为何可能采用固定 FSSS,同时也留下 GLM-5.2 是否采用同一 loss 的信息缺口。
结果 4:744B GLM-5 的 training-free 扩展
- 设置:GLM-5 744B-A40B checkpoint,只执行 training-free pattern search。
- Baseline:原始 DSA 与 uniform pattern。
- 指标:Long Avg,以及论文报告的长上下文 prefill/decode acceleration。
- 结果:DSA Long Avg 为 78.4;1/2 uniform / searched 为 78.1 / 78.7;1/4 uniform / searched 为 72.7 / 78.0。论文报告 100K 以上的 1/4 pattern 至少约
prefill 与 decode 加速;仓库另在 Artificial Analysis workload 下汇总 1/2 pattern 约 end-to-end speedup,两组条件不同。 - 证据定位:Section 4.5、对应 GLM-5 quality / efficiency 表图;官方仓库 README。
- 对照是否可比:同 checkpoint 内的 quality 对照可比;两组速度数字来自不同 pattern 与 workload,不能合并成一个统一性能结论。
- 支持的最窄结论:training-free search 能迁移到 744B GLM-5,并在 1/4 ratio 下显著优于 uniform placement;论文没有在 744B 上验证 training-aware recipe。
- 解读:这一实验是 IndexCache 与 GLM-5 的直接技术连接,也为后续 GLM-5.2 IndexShare 提供规模证据。
命题 1:multi-target KL 与平均 target KL 的 indexer 梯度等价
- 命题:对共享 indexer 分布
,分别最小化多个 target KL 的均值与平均 target 对 的 KL,对 indexer parameters 产生相同梯度。 - 证据定位:Section 3.3,Proposition 1 及证明。
- 对照是否可比:这是同一组 target distributions 与同一 indexer distribution 下的解析梯度等价,不依赖实验 baseline;比较范围只覆盖对 indexer 参数的梯度。
- 支持的最窄结论:multi-layer distillation 可以实现为对多个层 target 的平均监督,而不会改变 indexer 参数梯度。
- 边界:命题不覆盖 top-
离散集合相等、下游 LM loss 相等或任意共享跨度下的任务质量。
实验设置与 baseline 审计
| 维度 | 记录 |
|---|---|
| 评测协议 | 5 个 long-context 与 4 个 general/reasoning benchmarks;系统侧 sweep 10K 到 200K context |
| 统计报告 | 主要报告单点均值与速度;未见多 seed、置信区间或显著性检验 |
| Baseline 是否 tuned | DSA 为直接基线;uniform patterns 与 searched / trained patterns 对齐 Full ratio |
| Baseline 是否 compute-matched | inference compute 按 Full ratio 对齐;training-free search 需要额外 calibration forward,training-aware 需要 5,000-step 适配 |
| Baseline 是否 implementation-matched | 30B speed 对照在同一 SGLang/H100 路径;744B 仓库补充数字的 workload 不完全一致 |
| Baseline 是否覆盖强替代方案 | 覆盖原始 DSA、uniform reuse 和自身两种路线;缺少其它 selector compression、learned layer gating 与完整 sparse-serving framework 对照 |
| Baseline 是否存在弱化风险 | uniform pattern 是自然基线,但其大幅掉点会放大 search 优势;论文用 training-aware uniform 结果补足了固定 pattern 的可行性 |
| 结论边界 | 强结论集中在 GLM-family DSA models、200K 左右 context 与指定 runtime;跨架构、跨硬件和 1M production 效果需要另证 |
| 模型与初始化 | GLM-4.7-Flash 30B-A3B、47 layers,转为 DSA;另测 GLM-5 744B-A40B |
| 数据与任务 | calibration / adaptation 使用 SFT data;具体数据组成未披露 |
| RL / 训练配置 | 无 RL;training-aware 为 1,000-step warm-up + 4,000-step sparse training,200K context |
| 系统配置 | SGLang dp_attention、DP=8、8xH100;公开 SGLang/vLLM patches |
| 框架基座 / paper base | DSA model architecture;SGLang / vLLM serving;GLM-family checkpoints |
| 框架版本与证据来源 | SGLang b638b25b、vLLM 4508532fb,IndexCache repo snapshot 08d22d6 |
| 框架改动范围 | decoder layer 增加 F/S pattern、top-k tensor 跨层传递与 skip-indexer control;未重写 core sparse attention |
| 训练硬件与拓扑 | 训练硬件、并行拓扑与总训练时长未完整披露 |
| 训练数据规模与组成 | SFT source 与总 token 数未披露;只给 batch size / context 等局部信息 |
| 训练时间 / GPU hours / 成本 | 未披露 |
| 未披露项 | 多 seed、calibration corpus composition、744B training-aware 结果、GLM-5.2 exact index loss、1M end-to-end breakdown |
证据链强度评估
强证据
- 论文的 matched 30B 系统对照直接显示 200K prefill、decode 与 full-KV throughput 收益。
- Table 2 在相同 1/4 ratio 下比较 uniform 与 searched pattern,清楚支持 layer placement 的重要性。
- Table 3 的 cross-layer loss ablation 与命题 1 共同支持 multi-layer distillation 的训练逻辑。
- 官方补丁直接展示 top-k tensor 的跨层传递,并确认每层 KV 与 core attention path 仍然独立。
- GLM-5.2 官方 config 直接确认
index_topk_freq=4、index_topk=2048、FSSSindexer_types与 MTP index sharing。
中等强度证据
- 744B GLM-5 结果支持 training-free 方法的模型规模扩展;测试面和速度披露弱于 30B 主实验。
- GLM-5.2 模型卡的 2.9 倍 per-token FLOPs 属于官方生产声明,缺少公开脚本与逐组件 latency breakdown。
- 图 4 的 overlap heatmap支持相邻层冗余,但 overlap 与任务质量之间缺少一般性定量映射。
需要谨慎的推论
- GLM-5.2 固定 FSSS 很可能经过训练期适配;现有来源无法确认它采用 IndexCache 原文的完整 multi-layer KL objective。
- 75% indexer skip 表示 selector forward 的减少比例,端到端 FLOPs、latency 与成本收益取决于 indexer 在目标 runtime 中的占比。
- 参数模块仍在公开 patch 中构造,因而不能把计算跳过直接写成 75% indexer parameter-memory reduction。
- IndexCache 不降低 KV cache 大小;million-token serving 仍需 KV compression、offloading、paging 或 residency policy。
OpenReview / 审稿意见吸收
- Page type: not-found
- Match confidence: high
- Observed at: 2026-07-14
- Venue status: arXiv preprint
- Public reviews: 未发现与 arXiv
2603.12201可靠匹配的官方 OpenReview / conference review page。 - Ratings / confidence: 不适用。
- Reviewer consensus: 不适用。
- Main criticisms: 无公开 reviewer 意见可吸收;本地审计重点放在 calibration dependence、跨模型外推、多 seed、1M runtime 与 GLM-5.2 训练细节。
- Author response: 未发现。
- 对可信度的影响: 当前可信度主要来自直接实验、公开 patch 和后续 GLM-5.2 官方配置互证;缺少同行评审使理论边界与跨架构泛化仍需独立复验。
本地讨论补充
1. 讨论收敛点
- IndexCache 复用的是同一 query token 在不同层的 top-
position IDs。各层仍从自身 KV cache 取回这些 positions 对应的 vectors。 - 该方法沿网络深度轴减少 selector 重算。FlashMemory 沿生成时间轴预测未来窗口需要驻留的 KV chunks,两者分别处理 indexer FLOPs 与物理 KV residency。
- GLM-5.2 的 FSSS IndexShare 与 IndexCache 执行结构直接对应;MTP index sharing 是后续 production extension。
- uniform 1/4 在 training-free 30B 实验中的退化说明固定 pattern 需要训练期适配或额外验证。公开 GLM-5.2 材料只披露了结果配置,没有披露 indexer loss。
2. 修正后的理解
- “每四层共享一个 indexer”容易被理解成参数共享。更精确的表述是:每四个 sparse layers 只在 anchor layer 运行一次 indexer,后续三层复用该次 top-
selection result。 - “75% indexer reduction”描述 forward 调用比例。端到端加速由 selector 占比、context length、kernel、batch 和通信共同决定。
- IndexCache 是方法框架;IndexShare 是 GLM-5.2 的固定 pattern 与产品命名。两者共享跨层 index reuse 机制,训练 recipe 的对应范围需要保留证据边界。
3. 后续复验指标
- 不同模型、任务与 context lengths 下的 per-layer overlap、greedy pattern stability 和 Long Avg。
- selector、top-k、gather、core attention、MoE 与通信的 wall-clock breakdown。
- 1M context 下的 prefill latency、decode throughput、KV footprint 与额外 index tensor memory。
- GLM-5.2 的实际 FSSS training loss、warm-up length、pattern offset 与 MTP sharing ablation。
- pattern search 对 calibration dataset、batch size、seed 与 model checkpoint 的敏感度。
主要启发
- 一个高效模型算子常会暴露下一层瓶颈:DSA 降低 core attention 后,selector 的全历史扫描进入主要优化面。
- 稀疏模式的共享需要同时核算选择质量与系统成本;局部 overlap 适合发现候选,end-to-end loss 适合决定最终 layer pattern。
- 跨层共享 indices 可以保留每层表征能力,同时避免共享全部 KV 或 attention outputs 带来的更大语义约束。
- 训练期 multi-target distillation 能把固定、易部署的 pattern 变成可学习结构,这为 production config 与搜索所得 irregular pattern 提供了不同路径。
- 模型报告中应分别写清方法族、实验 checkpoint 与生产配置,避免把 30B training-aware、744B training-free 和 GLM-5.2 FSSS 汇总成一个未经区分的结论。
局限
- 方法与主要实验集中在 GLM-family DSA 模型,尚未证明对其它 token/block selector、GQA 或不同 layer topology 普遍有效。
- training-free greedy search 是局部离散优化,可能遗漏需要联合替换多层才能得到的更优 pattern,也依赖 calibration distribution。
- training-aware 实验只有 30B 规模;744B GLM-5 的训练期适配与 GLM-5.2 的 exact recipe 均未公开。
- 速度结果集中在 H100 与指定 SGLang 配置,缺少多硬件、多 runtime、能耗和成本测量。
- 论文没有降低 KV cache footprint,百万 token 场景的内存容量与搬运问题仍需独立机制处理。
- 单点结果缺少多 seed 与置信区间,1/4 附近的微小质量差异需要重复实验确认。
跨论文关系
- 与 DeepSeek-V3.2 / DSA:DSA 用轻量 dense indexer 选择 token positions,再执行 sparse core attention;IndexCache 保持这套 selector / core 结构,并沿 depth 复用 selector 输出,处理剩余的逐层 indexer 成本。
- 与 GLM-5:论文直接在 744B-A40B GLM-5 上做 training-free scaling。searched 1/4 的 Long Avg 为 78.0,接近 DSA 的 78.4,并明显高于 uniform 1/4 的 72.7;这构成方法与 GLM-5 的直接实验关系。
- 与 GLM-5.2:GLM-5.2 将跨层 index reuse 发布为 IndexShare,采用
index_topk_freq=4的 FSSS 配置,并把 sharing 扩展到 MTP iteration。官方材料未披露 exact multi-layer distillation loss。 - 与 HiLS-Attention:两者共享 Yushi Bai。HiLS 学习 chunk hierarchy 与 token selection;IndexCache 复用已有 DSA selector 的跨层结果,分别作用于 selector architecture 与 selector execution redundancy。
- 与 FlashMemory:IndexCache 沿层深共享 token positions,减少 indexer FLOPs;FlashMemory 沿生成时间预测未来窗口需要的 KV chunks,减少 HBM residency。Shared 层仍读取自己的 KV,因此两者优化轴互补。
- 与 slime 官方项目、SAO 和 CompactionRL:Xin Lv、Jie Tang 等作者连接 Z.ai 的长上下文模型效率与 agentic RL 系统线。当前关系是人员和生产模型栈重叠,IndexCache 本身不包含 RL 算法。
Reference Intake Brief
Target
- Intended target system: 新增 IndexCache 独立论文笔记,并收紧 GLM-5 / GLM-5.2、DSA、HiLS 与 FlashMemory 的方法关系。
- Existing related assets:
content/utility/papers-index.md;GLM-5;GLM-5.2;DeepSeek-V3.2 / DSA;FlashMemory;HiLS-Attention。 - Proposed form: 新建独立 Markdown 文档,更新索引行、作者档案与标签,并在对应论文的关系章节维护双向关系。
Reusable Elements
- F/S execution model:Full 层生成 top-
,Shared 层继承 positions 并读取自身 KV。 - 双路线适配:training-free LM-loss search 与 training-aware multi-layer index distillation。
- 证据分层:30B training-aware、744B GLM-5 training-free、GLM-5.2 FSSS production config。
- 资源核算:selector FLOPs 降低,core attention 与 KV-cache footprint 保持独立。
Risks
- Copyright/over-copying: 只缓存两张官方论文原图,正文采用机制重建和数字摘要。
- Unsourced or unverifiable claims: GLM-5.2 exact training recipe 保持为未披露;配置字段来自官方模型仓库。
- Tone/brand mismatch: 使用论文档案的技术分析语气,官方性能声明与本地推论分开记录。
- Safety/compliance issues: 无直接双用途风险。
- Overlap with existing assets: GLM-5.2 旧笔记已有一段 IndexShare 概述;本笔记承接完整方法,旧笔记保留 production mapping。
Skipped
| Material | Reason |
|---|---|
| 公开 reviewer comments | 未发现 OpenReview / conference 官方审稿页。 |
| 非官方社交媒体性能解读 | 无法提供强于论文、代码与官方模型配置的证据。 |
| GLM-5.2 multi-layer distillation 细节 | 官方 release、model card 与 config 均未披露,避免从固定 FSSS pattern 反推具体训练 loss。 |
Recommendation
Decision: merge
Why: IndexCache 补齐 DSA selector cost 到 GLM-5.2 IndexShare 的关键方法节点,并提供可审计的训练、搜索、runtime patch 与规模边界。