2606.10650-dynamic-linear-attention
Dynamic Linear Attention
DLA 认为 long-context linear attention 的核心损失来自固定 state merging 策略把信息密度不同的 token 压进同一个 summary state;它用 token-level representation drift 动态决定 state 边界,并在固定容量 cache 中合并低信息密度的相邻 state,让 multi-state linear attention 同时具备自适应分辨率和可预测推理成本,在 Mamba-2 与 Gated DeltaNet 两个 backbone 上显著超过 Log-Linear Attention。
Source
- Title: Dynamic Linear Attention
- alphaXiv: https://www.alphaxiv.org/abs/2606.10650
- arXiv: https://arxiv.org/abs/2606.10650
- HTML v1: https://arxiv.org/html/2606.10650v1
- PDF: https://arxiv.org/pdf/2606.10650
- Code/Project: 未在 arXiv v1 或 alphaXiv 页面发现官方代码链接。
- Authors: Xin Wang, Hui Shen, Boyuan Zheng, Xueshen Liu, Minkyoung Cho, Zhongwei Wan, Zesen Zhao, Zhuoqing Mao, Shen Yan, Mi Zhang
- Submitted: 2026-06-09
- Current version read: v1, submitted 2026-06-09
- Subjects: Computation and Language (cs.CL)
- Institutions: The Ohio State University; University of Michigan; ByteDance Seed
作者与关系
- Xin Wang: The Ohio State University.
- Hui Shen: University of Michigan.
- Boyuan Zheng: University of Michigan.
- Xueshen Liu: University of Michigan.
- Minkyoung Cho: University of Michigan.
- Zhongwei Wan: The Ohio State University.
- Zesen Zhao: University of Michigan.
- Zhuoqing Mao: University of Michigan.
- Shen Yan: ByteDance Seed.
- Mi Zhang: The Ohio State University.
阅读目标与判断边界
本笔记关注:
- DLA 要解决 linear attention / multi-state memory 的哪个结构性问题。
- Information-Aware Dynamic State Merging 与 Capacity-Bounded Memory Modeling 分别如何工作。
- DLA 与 Lightning Attention、compressed attention、sparse attention、KV/cache locality 等已存档路线的关系。
- 实验结果能支撑哪些结论,哪些结论仍依赖小规模预训练和特定 backbone。
判断边界:
- 论文评估的是 academic-scale pretraining,从 scratch 训练 50B tokens,模型规模为 Mamba-2-780M 与 Gated DeltaNet-1.3B;不能直接外推到 10B/100B 级生产模型。
- DLA 改的是 linear attention 的 memory state construction;softmax attention 的精确等价替代需要另行证明。
- 论文主要比较 vanilla linear attention、Log-Linear Attention 和 DLA;没有覆盖大规模 hybrid architecture 中的 softmax block、MoE、KV cache system 或 serving scheduler。
- 效率实验在单张 A100 上做 prefill/decode microbenchmark,真实 serving 收益仍取决于 kernel、batching、并行策略和系统实现。
论文脉络
1. 研究问题、背景和价值
标准 self-attention 在长度
最简单的 linear attention 只维护一个 state:
这个 state 把全部历史累积到一个矩阵中,成本低,但表达能力会被历史压缩限制。长上下文里有些 token 是结构转折、问题答案、代码变量、文档边界或指令变更;有些 token 属于局部冗余描述。如果全部压进同一个 state,重要变化会被平均掉,干扰会长期累积。
multi-state linear attention 的动机是给历史保留多个 summary states。它把长历史分成多个块,每个块维护一个 state,然后当前 query 读取这些 states。这样可以在成本可控的前提下提高表示能力。DLA 的问题定义更进一步:state 的边界应该由信息变化决定,而不应完全由固定时间表决定。
这个问题重要的原因在于,linear attention 想进入真实 long-context LLM,必须同时满足三件事:
- 长序列成本低。
- 关键 token 和语义转折不被过早压缩。
- 推理时 memory/cache 大小可预测,方便 batching 和 serving。
DLA 正是在这三个目标之间做设计。
2. 已有解决方案与不足
已有路线可以分成几类。
第一类是 single-state linear attention / SSM,例如 Mamba、Mamba-2、DeltaNet、Gated DeltaNet。它们用 recurrent state 实现长序列低成本推理。问题是单一 state 容量固定,长历史会不断混合,细粒度 token contribution 难以恢复。
第二类是带遗忘或门控的 linear attention,例如 Delta rule、Gated DeltaNet。它们通过 data-dependent step size 或 gate 控制新旧信息写入。它们改善 state tracking,但核心结构仍然是一条主 state 路径,对非均匀信息密度的长历史仍然有限。
第三类是 multi-state linear attention,例如 Log-Linear Attention。它用 Fenwick-tree / log-scale decomposition 保留多个时间尺度的 states,使 prefix 被分解为最多
这条路线的优点是成本和 memory 都很规整,训练复杂度约
3. 作者可能的思考路径
可以重建作者可能的思路:
- linear attention 的单 state 表达能力不足,multi-state memory 是自然扩展。
- Log-Linear Attention 证明了“多 state + 固定成本”有价值,但它的 state construction 依赖固定 schedule。
- 长文本的信息密度高度非均匀:段落开头、实体变更、检索答案、代码作用域变化都可能带来突然的 representation drift。
- 如果固定 block 恰好跨过 semantic transition,summary state 会混合两个不同分布的 token。这个错误一旦写入 state,后续 query 只能读到混合后的 summary。
- 因此需要一个在线、轻量、可推理执行的指标来判断“当前 token 是否应该和上一个 state 合并”。
- 仅动态切分会让 state 数量随长度增长,serving 成本不可控;所以还需要一个固定容量机制,在 cache 满时选择损失较小的 states 合并。
- 自然得到 DLA:用 representation drift 触发新 state,用低信息密度相邻合并控制 cache 容量。
4. 核心假设或切入点
DLA 的核心假设是:multi-state linear attention 的 summary error 主要受 block 内部异质性控制。若一个 block 内 token contribution 差异很大,summary 后对任意 query 的偏差上界会变大;若 boundary 能对齐语义变化点,同等 state budget 下可以减少 summary error。
论文把 per-token contribution 记为
summary deviation 有上界:
这个式子说明,block 内 token 与 summary 的离散程度越大,误差上界越大。DLA 的动态切分就是尝试在线减少这个 dominant term。
5. 方法 / 系统 / 理论框架
5.1 Information-Aware Dynamic State Merging
DLA 对每个新 token 构造 per-token state:
它与当前最后一个 memory state
论文实现中会对
推理时用阈值
若
若
直觉上,低变化 token 属于同一局部 regime,可以压进已有 state;高变化 token 代表语义转折或信息突变,应该保留更高分辨率。
训练时作者使用 soft gating 保持 differentiability;推理时切换为 hard segmentation,得到离散 state cache。
5.2 Capacity-Bounded Memory Modeling
动态切分会带来 state 数量增长。为了让推理成本可预测,DLA 维护固定容量 state cache:
其中
当 cache 达到容量
合并操作:
只允许相邻合并,保证 chronological order 和位置语义不被打乱。
5.3 Reading from bounded states
当前 query 从固定容量 cache 中读取多个 states:
5.4 与 Log-Linear Attention 的关键差异
Log-Linear Attention 的 state granularity 是固定时间结构:近处细、远处粗,按照 Fenwick-tree / log schedule 合并。DLA 的 granularity 由 token representation drift 决定:信息变化大的地方更细,稳定区更粗。两者都想用多个 states 提升 linear attention 表达能力,差异在于 state boundary 的来源。
更直观地说:
- Log-Linear Attention 按时间位置分配 memory resolution。
- DLA 按信息变化分配 memory resolution。
6. 结论链条
论文证据链可以概括为:
- standard attention 长上下文成本高,linear attention 提供低复杂度路径。
- single-state linear attention 会过度压缩历史,multi-state memory 可以提升表达能力。
- 现有 multi-state 方法依赖固定合并策略,容易混合语义转折附近的异质 token。
- summary deviation 上界受 block 内异质性控制,因此动态 boundary 有理论动机。
- DLA 用 State Information Score 在线检测 representation drift,并在 drift 高处开新 state。
- 为了固定推理成本,DLA 维持容量
的 chronological cache,并合并低信息密度相邻 states。 - 在 Mamba-2-780M 和 Gated DeltaNet-1.3B 上从 scratch 预训练后,DLA 在 commonsense reasoning、in-context retrieval、RULER、LongBench 上普遍超过 vanilla 和 Log-Linear variants。
- 消融显示 dynamic merging 和 capacity-bounded modeling 均有贡献,且
与 的局部变化影响较小。
关键实验/定理
定理 1:State deviation bound
- 设置:将 token contribution
按 policy 切成连续 block,每个 block 用 summary。 - 结果:summary error 被 query norm 与 block 内 heterogeneity 控制:
- 解读:如果固定 block 横跨两个不同语义段,block 内 variance 会变大;adaptive boundary 对齐 change point 时可以降低该项。
推论 1:固定 blocking 在非平稳序列上次优
- 设置:构造两个连续 segment
、 ,均值分别为 、 。 - 结果:任何跨越两个 segment 的固定 block 都会产生正的 heterogeneity:
- 解读:这给 DLA 的 boundary-by-drift 提供理论直觉。语义变化点附近应该提高 state resolution。
结果 1:Commonsense reasoning
- 设置:Mamba-2-780M、Gated DeltaNet-1.3B、对应 Log-Linear variant、对应 DLA variant;从 scratch 预训练 50B tokens,seq len 16K。
- 数据集:LAMBADA、PIQA、HellaSwag、WinoGrande、ARC-e、ARC-c、OpenBookQA、CommonsenseQA。
- 结果:
| Model | LMB | PIQA | Hella | Wino | ARC-e | ARC-c | OBQA | CSQA | Avg |
|---|---|---|---|---|---|---|---|---|---|
| Transformer | 21.8 | 63.1 | 30.3 | 50.9 | 44.2 | 17.7 | 16.8 | 18.0 | 32.9 |
| Mamba-2 | 15.7 | 58.9 | 29.3 | 50.1 | 46.0 | 18.9 | 15.4 | 20.3 | 31.8 |
| Mamba-2 + Log-linear | 13.2 | 59.7 | 27.8 | 49.5 | 42.3 | 20.1 | 16.0 | 19.1 | 31.0 |
| Mamba-2 + DLA | 18.7 | 63.7 | 30.8 | 51.5 | 48.1 | 22.1 | 17.4 | 21.1 | 34.2 |
| Gated DeltaNet | 20.3 | 58.8 | 29.6 | 51.3 | 44.7 | 20.2 | 16.0 | 21.3 | 32.8 |
| Gated DeltaNet + Log-linear | 19.0 | 60.4 | 28.4 | 51.9 | 44.3 | 20.5 | 15.4 | 21.0 | 32.6 |
| Gated DeltaNet + DLA | 20.8 | 62.7 | 30.3 | 52.4 | 45.0 | 23.0 | 17.4 | 22.9 | 34.8 |
- 解读:DLA 在两个 backbone 上都提高平均分;Mamba-2 + DLA 平均分 34.2,高于同规模 Transformer 的 32.9。
结果 2:In-context retrieval
- 设置:六个 retrieval 数据集,准确率指标。
- 结果:
| Model | SQuAD | TriviaQA | SWDE | FDA | NQ | Drop | Avg |
|---|---|---|---|---|---|---|---|
| Mamba-2 | 22.4 | 13.6 | 17.4 | 0.0 | 0.2 | 3.4 | 9.5 |
| Mamba-2 + Log-linear | 7.1 | 9.1 | 15.2 | 0.0 | 0.0 | 6.6 | 6.3 |
| Mamba-2 + DLA | 28.1 | 20.2 | 26.3 | 0.0 | 1.0 | 6.6 | 13.7 |
| Gated DeltaNet | 15.8 | 29.4 | 20.3 | 16.9 | 10.7 | 13.5 | 17.8 |
| Gated DeltaNet + Log-linear | 21.7 | 25.3 | 28.8 | 17.7 | 10.1 | 18.3 | 20.3 |
| Gated DeltaNet + DLA | 27.3 | 33.8 | 51.7 | 22.2 | 12.1 | 25.8 | 28.8 |
- 解读:retrieval task 对关键信息保留更敏感,因此 DLA 的 adaptive resolution 更容易体现价值。Mamba-2 在 FDA/NQ 上仍很低,说明 DLA 不能完全补齐 backbone 的检索能力短板。
结果 3:RULER long-context retrieval
- 设置:4K context 下的 single-needle 和 multi-needle RULER 子任务。
- 结果:
| Model | S-NIAH-1 | S-NIAH-2 | S-NIAH-3 | MK-NIAH-1 | MQ-NIAH | MV-NIAH |
|---|---|---|---|---|---|---|
| Transformer | 91.4 | 71.4 | 73.3 | 62.1 | 54.5 | 36.9 |
| Mamba-2 | 80.5 | 31.0 | 4.7 | 14.8 | 19.3 | 19.4 |
| Mamba-2 + Log-linear | 88.7 | 39.4 | 10.6 | 41.6 | 25.2 | 28.3 |
| Mamba-2 + DLA | 100.0 | 69.2 | 37.1 | 60.3 | 42.5 | 37.6 |
| Gated DeltaNet | 100.0 | 74.0 | 53.2 | 19.1 | 19.5 | 14.8 |
| Gated DeltaNet + Log-linear | 100.0 | 81.6 | 48.8 | 43.8 | 31.3 | 26.6 |
| Gated DeltaNet + DLA | 100.0 | 98.6 | 65.9 | 49.3 | 34.2 | 30.5 |
- 解读:DLA 对 harder retrieval 有明显提升,尤其 Mamba-2 的 S-NIAH-3 从 10.6 提到 37.1。它仍然没有让 Mamba-2 在所有多针任务上追平 Transformer。
结果 4:LongBench
- 设置:LongBench 的 single-doc QA、multi-doc QA、summarization、few-shot learning。
- 结果:DLA 在两个 backbone 上对所有列均超过 vanilla 与 Log-Linear baselines。
- 代表性数值:
- Mamba-2 + DLA 在 Musique 为 8.7,高于 Mamba-2 的 4.7 和 Log-Linear 的 4.4。
- Mamba-2 + DLA 在 MultiNews 为 9.3,高于 Mamba-2 的 3.3 和 Log-Linear 的 3.5。
- Gated DeltaNet + DLA 在 TREC 为 31.2,高于 Gated DeltaNet 的 16.5 和 Log-Linear 的 11.0。
- Gated DeltaNet + DLA 在 TriviaQA 为 41.5,高于 Gated DeltaNet 的 25.3 和 Log-Linear 的 27.7。
- 解读:DLA 的收益覆盖 retrieval 之外的问答、摘要和 few-shot,但绝对分数仍属于小模型区间。
结果 5:效率
- 设置:Mamba-2-780M 的 vanilla、Log-Linear 和 DLA variants;单张 A100;prefill stage;比较不同 batch size 和 context length。
- 指标:throughput tokens/sec 与 runtime memory consumption。
- 结果:DLA 相比 Log-Linear consistently higher throughput,并且 memory consumption 更低、更稳定。
- 解读:DLA 的动态策略没有让推理成本失控;capacity-bounded cache 使它在保持多 state 的同时优于 Log-Linear 的 memory/throughput 曲线。论文没有给出完整数值表,主要证据来自 Figure 3。
结果 6:模块消融
- 设置:比较 Log-Linear、DLA(I) 和完整 DLA。DLA(I) 只包含 information-aware dynamic state merging。
- 结果:
| Model | LMB | PIQA | Hella | Wino | RULER |
|---|---|---|---|---|---|
| Mamba-2 + Log-linear | 13.2 | 59.7 | 27.8 | 49.5 | 39.0 |
| Mamba-2 + DLA(I) | 20.1 | 61.5 | 30.3 | 50.9 | 44.0 |
| Mamba-2 + DLA | 23.9 | 63.7 | 30.8 | 51.5 | 57.8 |
| Gated DeltaNet + Log-linear | 19.0 | 60.4 | 28.4 | 51.9 | 55.4 |
| Gated DeltaNet + DLA(I) | 22.2 | 61.3 | 29.7 | 52.0 | 58.4 |
| Gated DeltaNet + DLA | 24.8 | 62.7 | 30.3 | 52.4 | 63.1 |
- 解读:动态 state merging 已经带来收益,capacity-bounded modeling 进一步提升,尤其对 RULER 提升明显。
结果 7:容量和阈值鲁棒性
- 设置:Mamba-2 + DLA;调整 memory budget
和 boundary threshold 。 - 结果:
| Setting | LMB | PIQA | Hella | Wino | RULER |
|---|---|---|---|---|---|
| 22.7 | 64.9 | 29.3 | 50.1 | 56.3 | |
| 23.9 | 63.7 | 30.8 | 51.5 | 57.8 | |
| 24.2 | 63.3 | 29.8 | 50.9 | 57.7 | |
| 20.1 | 63.6 | 29.7 | 51.3 | 57.3 | |
| 23.9 | 63.7 | 30.8 | 51.5 | 57.8 | |
| 22.5 | 61.7 | 30.1 | 52.3 | 55.9 |
- 解读:
是默认值;局部变动影响有限,说明方法对这两个 hyperparameters 有一定鲁棒性。
证据链强度评估
强证据
- 方法与问题归因一致:理论 bound 指向 block 内 heterogeneity,算法用 representation drift 决定 boundary。
- 两个不同 linear-attention backbone 都获得提升,说明 DLA 的收益具有一定 backbone 泛化性。
- 实验覆盖 commonsense reasoning、retrieval、RULER、LongBench,收益覆盖面较广。
- 消融清楚区分了 dynamic merging 与 capacity-bounded modeling 的贡献。
中等强度证据
- 效率结论来自 figure 和单 GPU setting,支持 DLA 优于 Log-Linear,但生产 serving 结论还需要更多端到端实验。
- “semantic transition” 由 representation drift 间接刻画。这个代理指标合理,但论文没有展示人工标注语义边界或可视化对齐分析。
- DLA 与 full attention Transformer 的比较只在 778M 参数级别,且训练配置按 Log-Linear Attention 论文对齐;更大规模模型需复验。
需要谨慎的推论
- DLA 提升 multi-state linear attention 表达能力,但不能证明 pure linear attention 可以全面替代 softmax attention。
- 4K/16K 级别结果不能直接推出 1M context 能力。
- cache capacity 固定为 30 与 Log-Linear 最大 state 数对齐,真实系统中不同 batch size、layer 数、hidden size、并行策略会改变最优容量。
- 论文未提供代码,外部复现依赖实现细节,尤其 soft gate 训练、hard segmentation 推理和 kernel 路径。
OpenReview / 审稿意见吸收
- Venue status: 当前档案未记录公开 peer-review 状态。
- Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
- Ratings / confidence: 无公开评分可用于校准。
- Reviewer consensus: 暂无。
- Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
- Author response: 暂无公开 rebuttal 记录。
- 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。
本地讨论补充
1. 讨论收敛点
- 初始归档结论:DLA 是 multi-state linear attention 的 memory construction 论文。它把问题从“如何多保留几个历史 state”推进到“这些 state 的边界和合并应由信息密度决定”。
2. 修正后的理解
- DLA 与 Lightning Attention 处在不同层面:Lightning Attention 更偏把 causal linear attention 做成 GPU 友好的 block-wise kernel;DLA 更偏在 linear attention 内部维护多个动态 memory states。
- DLA 与 sparse attention / compressed attention 的共同点是给长历史做选择性保真;差异是 DLA 的选择发生在 recurrent state cache 上。
- DLA 适合解释为什么 fixed chunk / fixed schedule 在长上下文中会出现不可逆信息混合。
3. 后续复验指标
- 不同层、不同 head 的
分布与 boundary 数量。 - boundary 是否与 paragraph boundary、代码作用域、retrieval answer span、tool message boundary 对齐。
- state cache 中每个 state 的 token count、information density 和被合并频率。
增大时 throughput、memory、RULER/LongBench 的 Pareto curve。 - soft gate training 和 hard segmentation inference 的一致性误差。
主要启发
- linear attention 的瓶颈不只在 kernel 或复杂度,也在历史压缩策略。state boundary 是 architecture quality 的关键变量。
- 长上下文具有非均匀信息密度。稳定片段可以粗粒度总结,转折片段需要高分辨率保留。
- fixed memory budget 与 adaptive resolution 可以同时存在:先按信息变化切分,再按低信息密度合并。
- 对 long-context serving 来说,动态机制必须带 capacity bound;否则 batching 和 memory planning 会变复杂。
- 后续可以把 DLA 的 state information score 用作 long-context observability 指标,帮助诊断模型在哪些位置压缩过度。
局限
- 实验规模仍是 780M/1.3B,训练 token 为 50B;对大模型、MoE、hybrid attention 的外部有效性仍需验证。
- 论文未开源代码;soft gating、RMSNorm score、hard boundary 和 cache merge 的实现细节会影响复现。
- 效率实验主要是单 GPU microbenchmark,没有完整 serving system、multi-GPU、continuous batching、KV/cache allocator 结果。
- 信息分数基于 Frobenius norm drift,可能受 layer scale、normalization、token distribution shift 影响;虽然论文用 RMSNorm 稳定尺度,仍需更细分析。
- capacity-bounded merge 采用 greedy local rule,未证明在全局 memory allocation 上最优。
- LongBench/RULER 结果显示提升明显,但 absolute scores 在小模型上仍有限,不能直接等同于生产级长上下文能力。
跨论文关系
- 与 2405.17381:Lightning Attention 解决 causal linear attention 的 GPU 友好实现问题,通过 block-wise left/right product 和 IO-aware tiling 改善训练与推理路径;DLA 解决 multi-state linear attention 的 memory boundary 与 state merge 问题。两者可被理解为 linear attention 的系统层与记忆建模层互补。
- 与 2506.13585:MiniMax-M1 展示 Lightning Attention 在 long-output reasoning RL 中的工程价值;DLA 提供另一条 long-context efficiency 路线,强调动态 memory resolution。若 long-output RL 使用 pure/hybrid linear attention,DLA 的 boundary/cache 监控可以成为 rollout 长上下文能力诊断工具。
- 与 2026-04-24:DeepSeek-V4 用 CSA/HCA hybrid compressed attention 支撑 million-token context;DLA 用 bounded multi-state linear memory 做动态压缩。二者共同关心“哪些历史应该保留高分辨率,哪些历史可以压缩”。
- 与 2602.15763:GLM-5 的 DSA 在 long-context agentic engineering 中处理 sparse/compressed attention;DLA 是 linear attention family 中的动态 memory compression 方案,二者都针对固定窗口或固定压缩策略在长上下文中的信息损失。
- 与 2511.02749 和 2405.19888:Span Query / Parrot 从 workload 结构、cache locality、application DAG 暴露可复用上下文;DLA 从 token representation drift 自动形成 state segmentation。两者都把“上下文具有结构”作为优化入口。
Reference Intake Brief
Target
- Intended target system: 新增论文笔记;更新
content/utility/papers-index.md。 - Existing related assets: 2405.17381、2506.13585、2026-04-24、2602.15763。
- Proposed form: 新建独立 Markdown 文档;更新当前收录,并在跨论文关系中补充 Dynamic Linear Attention 主题。
Reusable Elements
- State Information Score
。 - fixed-capacity state cache
与 low-information-density adjacent merge。 - summary deviation bound,用于解释 fixed block 在 non-stationary sequence 上的误差来源。
- linear attention / Lightning Attention / compressed attention / sparse serving 的跨论文关系。
Risks
- Copyright/over-copying: 本笔记只保留必要公式、表格数字和方法结构,未长段复制论文文本。
- Unsourced or unverifiable claims: 代码发布状态、生产可用性和大规模模型外推需后续来源确认。
- Tone/brand mismatch: 以机制分析和证据链评估为主,不写成模型宣传。
- Safety/compliance issues: 无直接安全或双用途操作细节。
- Overlap with existing assets: 与 Lightning Attention、MiniMax-M1、DeepSeek-V4、Span Query 的关系已在跨论文关系中区分。
Skipped
| Material | Reason |
|---|---|
| Figure 3 具体 throughput/memory 数值 | 论文 HTML/source 未提供表格化数值,笔记保留相对结论 |
| Log-Linear Attention 原论文完整分析 | 当前任务只分析 DLA;Log-Linear 可作为后续单独归档对象 |
Recommendation
Decision: merge
Why: DLA 补齐本地 long-context architecture 图谱中 linear attention memory construction 这一块,能与 Lightning Attention、MiniMax-M1、DeepSeek-V4 和 Span Query 形成稳定关系。