2606.20097-hydrahead-head-wise-hybrid-attention

HydraHead: From Head Level Functional Heterogeneity to Specialized Attention Hybridization

HydraHead 把 Full Attention (FA) 和 Linear Attention (LA) 的混合粒度从 layer 推进到 attention head:先用 activation patching 和 path patching 找到 retrieval-critical heads,只给这些头保留 FA,其余头换成 Gated DeltaNet (GDN),再用独立 RMSNorm 与 head-wise scale modulation 缓解 FA/LA 输出分布差异;在 Qwen3-1.7B 上,它用较少迁移训练把长上下文检索能力拉到明显高于 layer-wise、token-wise 和普通 head-wise 混合的水平,同时保留较强 general reasoning。

Authors Zhentao Tan, Wei Chen, Jingyi Shen, Yao Liu, Xu Shen, Yue Wu, Jieping Ye

已审阅 Archived 2026-07-02 12:20 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Zhentao Tan: Alibaba Group;历史机构:Alibaba Cloud, University of Science and Technology of China.
  • Wei Chen: Alibaba Group.
  • Jingyi Shen: Alibaba Group.
  • Yao Liu: Alibaba Group.
  • Xu Shen: Alibaba Group;历史机构:Tongyi Large Model Business Unit, Alibaba Token Hub, University of Science and Technology of China.
  • Yue Wu: Alibaba Group;历史机构:Alibaba Cloud, University of Science and Technology of China.
  • Jieping Ye: Alibaba Group;历史机构:Data to Intelligence Lab, Alibaba Cloud Intelligence Group, University of Michigan.

阅读目标与判断边界

本笔记关注:

  1. HydraHead 为什么选择 head 作为 FA/LA hybrid 的最小结构单元。
  2. index-free 的 head selection 如何通过 causal intervention 得到,并和在线 router 路线区分开。
  3. FA/GDN 两类 head 输出如何融合,为什么 scale-normalized fusion 是关键模块。
  4. 三阶段迁移训练如何把 Qwen3-1.7B dense Transformer 转成 hybrid architecture。
  5. 它与 Lightning Attention、Dynamic Linear Attention、DeepSeek / GLM / MiniMax 稀疏或压缩 attention 路线的差异。

判断边界:

  • 主实验基座是 Qwen3-1.7B,一个 28 层、448 个 query heads 的 compact dense Transformer;7B/13B+、MoE 和 multimodal 模型上仍需验证。
  • HydraHead 的选择机制来自离线可解释性分析,推理时没有动态 per-token router;部署行为比动态 sparse selector 更稳定,但 head 配置会绑定到某个 checkpoint 和目标能力集。
  • 长上下文证据主要来自 RULER / NIAH retrieval;agentic workflow、repository-scale code、长视频或 instruction following 场景还缺少完整验证。
  • 论文没有公开代码、模型权重、完整训练数据配方或第三方复现;高比例 GDN 配置下的质量边界仍依赖作者实验。

论文脉络

1. 研究问题、背景和价值

标准 FA 的主成本来自 O(T2)O(T^2) attention interaction 和长上下文 KV 访问。为了支持 128K、256K、512K 甚至 1M context,近期模型常把 FA 和低成本 attention 混合起来:部分层保留 FA,其余层换成 linear attention、SSM、sparse attention 或 compressed attention。

主流 open-source hybrid model 多采用 layer-wise strategy。这个粒度实现简单,也方便继承已有 Transformer block,但它隐含一个假设:一个 layer 内的 heads 功能相近,可以整体保留 FA 或整体替换成 LA。HydraHead 的起点是反查这个假设。作者用 Qwen3-1.7B 做 interpretability analysis 后发现:layer 之间确实有 block-wise functional similarity,但同一 layer 内 heads 的功能差异很大;检索能力通常由少数 scattered heads 承载,同层许多 heads 对 retrieval 的 causal contribution 很低。

因此,HydraHead 想解决的问题是:如果 long-context retrieval 只依赖少量 heads,能否把 FA budget 分配给这些 heads,把其他 heads 换成更便宜的 GDN,从而在质量和效率之间获得比 layer-wise hybrid 更好的 Pareto 点。

2. 已有解决方案与不足

已有路线可以分为几类。

  • Layer-wise hybrid:HypeNet / HALO 类方法把若干层保留为 FA 层,其余层换成 linear attention 或 SSM。优点是结构规整、迁移训练较成熟;不足是整层分配会把 FA 用在同层无关 heads 上,也可能把关键 heads 一并替换掉。
  • Token-wise hybrid:STILL、Liger 等方法按 token 或局部窗口分配 FA 与 LA/SWA。粒度更细,但异构路径会让序列表示一致性更难维持;部分方法在 32K 以上缺少充分评估,sparse variant 还可能保留完整 KV cache。
  • Naive head-wise mixing:并行跑 FA/GDN 两个分支后做 feature fusion,能保留 within-layer 交互,但如果所有 heads 都混合或随机分配,长上下文检索能力仍不稳定。
  • Pure linear / recurrent attention:Lightning Attention、GDN、Mamba 类路线成本低,但 recall-intensive task 容易受固定状态压缩影响。
  • Native sparse / compressed attention:DeepSeek DSA、DeepSeek-V4 CSA/HCA、MiniMax MSA 通过 selector、compressed entries 或 block sparse softmax 保留可寻址性。它们通常需要额外 indexer、sparse kernels 或层级交错配置。

HydraHead 的增量是把可解释性分析变成结构分配工具:它不训练在线 selector,而是一次性定位哪些 pretrained heads 需要保留 FA。

3. 作者可能的思考路径

可以重建为六步:

  1. LA/GDN 适合长上下文成本控制,但 recall fidelity 弱于 FA。
  2. Layer-wise hybrid 的主要损耗来自粒度粗:一层里既有 retrieval-critical heads,也有可替换 heads。
  3. 需要先证明 head-level heterogeneity 是 causal,再和 attention pattern 或 logit lens 的相关现象区分开。
  4. Activation patching 可以测单个 head 被替换后目标行为下降多少;path patching 可以补到上游 sender heads。
  5. 拿到 head ranking 后,把 FA budget 给 top critical heads,把剩余 heads 交给 GDN。
  6. FA 和 GDN 的输出分布不同,直接拼接会造成优化压力;需要独立 normalization、保持原 head index,再给每个 head 一个可学习 scale。

4. 核心假设或切入点

HydraHead 的核心假设有三条:

  1. Long-context retrieval 的关键计算由少量 heads 承载,并且这些 heads 在 layer 内分布不均匀。
  2. 这些 heads 可以通过离线 causal intervention 稳定定位;小 calibration set 上得到的 head set 能迁移到更长 context。
  3. 对可替换 heads 使用 GDN,不会显著破坏一般能力,只要迁移训练和 FA/GDN fusion 足够稳定。

这使 HydraHead 的架构选择可以写成固定 partition:

H=HFHL,HFHL= \mathcal{H}=\mathcal{H}_F\cup\mathcal{H}_L,\qquad \mathcal{H}_F\cap \mathcal{H}_L=\emptyset

其中 HF\mathcal{H}_F 是保留 FA 的 critical heads,HL\mathcal{H}_L 是替换为 GDN 的 heads。

5. 方法 / 系统 / 理论框架

5.1 Head importance estimation

Head selection 分三步。

第一步是构造 clean/corrupt input pairs。对 NIAH 这类检索任务,作者把正确答案替换成类型和 token 长度相同的 counterfactual answer,让输入结构与长度保持一致。读出指标是 span-level logit difference:

m(x)=1ZjAλj(zj[aj+]zj[aj]),Z=jAλj m(x)=\frac{1}{Z}\sum_{j\in\mathcal{A}}\lambda^j \left(z_j[a^+_j]-z_j[a^-_j]\right), \qquad Z=\sum_{j\in\mathcal{A}}\lambda^j

论文默认 λ=0.9\lambda=0.9,较早 answer token 权重更高。

第二步是 activation patching。对 layer ll 的 head hh,把该 head 的 output 替换为 corrupted run 中的 output,并冻结 downstream attention outputs,使 patched signal 只能通过 residual stream 传播。重要性分数是归一化 readout drop:

IEl,h=m(x)m(x;Ol,hOl,h(x))m(x)m(x) \mathrm{IE}_{l,h}= \frac{m(x)-m(x;\mathbf{O}_{l,h}\leftarrow \mathbf{O}_{l,h}(x'))}{m(x)-m(x')}

高分 heads 是 receivers,说明它们直接把能力相关信号写入 residual stream。

第三步是 path patching。某个 head 也可能作为 sender,通过下游 receiver 影响结果。作者记录 corrupted input 中 upstream head 发送给 receiver 的 activation,再在 clean run 中只替换这条 path 上的信号,得到 sender effect。长上下文 retrieval 上这个迭代大约两轮收敛,说明相关 circuit 较浅。

最后,对每个能力 cc,把 receiver effect 与 sender effect 取最大值,再乘以 task-consistency factor:

sh(c)=max(IEhrecv,IEhsend)κh(c) s_h^{(c)}=\max(\mathrm{IE}^{recv}_h,\mathrm{IE}^{send}_h)\cdot \kappa_h^{(c)}

多个能力的分数 min-max normalize 后加权融合:

Sh=cCwcs^h(c) S_h=\sum_{c\in\mathcal{C}}w_c\hat{s}^{(c)}_h

然后按 ShS_h 排序,选 top-KK heads 保留 FA。

5.2 Head-wise hybridization

每个 head 被路由到 FA 或 GDN:

  • hHFh\in\mathcal{H}_F:用标准 softmax attention。
  • hHLh\in\mathcal{H}_L:用 Gated DeltaNet recurrence,维护常量大小 state,长序列推理成本随长度近似线性。

FA 的优势是 token-level precise retrieval,GDN 的优势是长上下文成本低。HydraHead 在每个 layer 内混合二者,因此同一层可以同时保留少数高精度 retrieval heads 和多数低成本 GDN heads。

5.3 Head-wise scale-normalized fusion

FA 和 LA 的输出统计不同。FA 的 softmax 会把 query norm 放进 attention score,输出更 sharp、低熵,常由少数 high-weight tokens 主导;LA/GDN 的 normalization 会弱化 query norm,输出更平滑。直接拼接两类 head output 会让 output projection 面对不稳定尺度。

HydraHead 的 fusion 分三步:

  1. 对每个 head output 独立做 RMSNorm:
O^h=Norm(Oh) \hat{\mathbf{O}}_h=\mathrm{Norm}(\mathbf{O}_h)
  1. 按原始 head index 拼接,保留 head identity:
O^RT×H×dh \hat{\mathbf{O}}\in \mathbb{R}^{T\times H\times d_h}
  1. 用可学习 head-wise scale γh\gamma_h 调整每个 head 的贡献:
O~:,h,:=γhO^:,h,: \tilde{\mathbf{O}}_{:,h,:}=\gamma_h\cdot \hat{\mathbf{O}}_{:,h,:}

这个设计把 FA/GDN 的尺度差异先对齐,再允许训练阶段学习每个 head 的权重。

5.4 Branch-specific refinements

论文还把 HypeNet/HALO 中有效的结构改动迁移到 head-wise setting:

  • FA branch:移除 RoPE,改用 long-context scale coefficient;scale hyperparameter 设为 500;加入 gate branch,初始化时接近 identity。
  • GDN branch:加入 RoPE 增强局部位置感知;把 key-value heads 扩展到 MHA-like 配置,增强表示容量。
  • Query decomposition:FA 与 GDN 分支拆分 QKV projection,减少异构 heads 共享 projection 时的梯度冲突和数值瓶颈。

5.5 三阶段迁移训练

HydraHead 从 pretrained Qwen3-1.7B 出发,不从头预训练。

Stage 1 是 parameter migration 和 layer-wise output alignment。FA heads 继承原 attention weights;GDN heads 复用原 Q/K/V weights,并处理 GQA 到 GDN 维度差异。冻结 backbone,只训练新 hybrid attention layers,用 MSE 对齐原 FA layer hidden states:

Lalign=l=1LHFA(l)(x)HHybrid(l)(x)22 \mathcal{L}_{align}=\sum_{l=1}^L \|\mathbf{H}_{FA}^{(l)}(x)-\mathbf{H}_{Hybrid}^{(l)}(x)\|_2^2

Stage 2 是 global logits distillation。解冻全模型,用 teacher dense model 的 final logits 做 KL distillation,同时保留 next-token cross entropy。

Stage 3 是 long-context fine-tuning。用更长 context 做 NTP 训练,巩固 extrapolation 能力。

默认训练配置为 Stage 1: batch 32、context 512、0.3B tokens、cosine LR 1e-3 到 1e-5;Stage 2: batch 96、context 512、1.0B tokens、cosine LR 1e-4 到 1e-5;Stage 3: batch 128、context 16384、1.0B tokens、constant LR 1e-5。优化版把 Stage 1/2 context 增到 2048,并把 Stage 1/2 tokens 增到 0.8B/4.0B。

6. 结论链条

论文的结论链条是:

  1. Qwen3-1.7B 的 retrieval-critical heads 只占少数,并且在 layer 内分布不均。
  2. Head-level causal score 在少量 NIAH calibration samples 上稳定,top head set 可迁移到更长 context。
  3. Global interpretability screening 显著优于 fixed、random 和 layer-wise screening。
  4. FA/GDN fusion 需要独立 normalization 与 head-wise scale;去掉 normalization 或用动态 gate,长上下文稳定性下降。
  5. 在 3:1 GDN:FA ratio 下,HydraHead 的 long-context retrieval 与 general reasoning 综合表现优于 layer-wise/token-wise/head-wise baselines。
  6. 在 7:1 GDN:FA ratio 下,加上每层至少一个 FA head 的 constraint 后,HydraHead 可以接近 3:1 layer-wise hybrid 的长上下文平均表现,同时保留明显更高的 hard reasoning 分数。

关键实验/定理

结果 1:不同 hybrid architecture 对比

  • 设置:Qwen3-1.7B backbone;GDN 作为 LA;统一三阶段训练;默认保留 25% FA heads。
  • Baseline:layer-wise FA/LA, token-wise SWA+GDN, token-wise Liger-like, full-head mixing。
  • 指标:RULER Single / Multi-Key 的 native 和 extended context accuracy;General Reasoning hard/easy。
  • 结果:
Model LA Cache RULER Single Ext. RULER Multi Ext. Hard Easy
FA & LA layer-wise Lightning 0.25 85.00 24.37 19.80 59.72
FA & LA layer-wise GDN 0.25 7.02 5.53 16.44 58.18
Token-wise GDN 0.25 3.73 2.43 47.31 63.40
Token-wise Liger-like GDN 0.25 58.78 11.03 36.66 63.37
Head-wise Mixing GDN 1.00 60.42 14.53 38.07 62.77
HydraHead GDN 0.35 87.49 27.37 31.03 62.12
  • 解读:HydraHead 的强项是 extended context retrieval。Token-wise 和普通 head-wise mixing 能保留更强 hard reasoning,但长上下文检索明显落后。Layer-wise Lightning baseline 长上下文强,但 hard reasoning 低很多。

结果 2:head selection 策略

  • 设置:3:1 GDN:FA ratio;Basic Model;比较 fixed、random、layer-wise interpretability、global interpretability。
  • 指标:RULER Single / Multi-Key native 和 extended;General Reasoning hard/easy。
  • 结果:
Selection Single Native Single Ext. Multi Native Multi Ext. Hard Easy
Fixed 85.63 62.62 27.35 13.67 28.65 62.59
Layer-Rand 87.07 65.33 27.70 17.37 27.91 62.95
Global-Rand 59.40 32.96 16.55 5.33 26.19 62.40
Layer-Interp 91.13 65.22 35.10 15.97 31.93 62.15
Global-Interp 98.70 81.73 38.35 25.93 31.70 62.68
  • 解读:global random 会破坏跨层结构平衡;layer-wise interpretability 能提升能力,但 global interpretability 更能把 FA budget 集中给最关键 heads。

结果 3:fusion 设计

  • 设置:interpretability-guided global selection;比较 Basic、无 normalization、head-wise scale、head-wise gate。
  • 结果:
Fusion Single Native Single Ext. Multi Native Multi Ext. Hard Easy
Basic Model 98.70 81.73 38.35 25.93 31.70 62.68
w/o Norm 85.07 71.36 41.90 23.93 30.62 62.58
Head-wise Scale 98.47 87.49 37.10 27.37 31.03 62.12
Head-wise Gate 95.80 67.16 41.85 26.87 28.24 61.90
  • 解读:去掉 normalization 后 single-key 检索下降超过 10 点;动态 gate 在 single extended context 上明显弱于静态 scale。作者采用 head-wise scale 作为后续 default。

结果 4:更高 GDN:FA ratio

  • 设置:Basic Model;比较 Global-Interp 和 Global-Interp-C,其中 C 表示每层至少保留一个 FA head。
  • 结果:
Strategy Ratio Single Ext. Multi Ext. Hard Easy
Global-Interp 3:1 81.73 25.93 31.70 62.68
Global-Interp-C 3:1 83.91 25.20 31.83 62.73
Global-Interp 7:1 58.07 18.67 27.75 62.63
Global-Interp-C 7:1 81.04 22.93 29.46 62.65
Global-Interp 9:1 60.58 14.50 26.04 62.65
Global-Interp-C 9:1 72.69 18.63 28.92 62.68
  • 解读:高压缩比例下,单纯按 global importance 排序会让某些层完全失去 FA;每层至少保留一个 FA head 可维持层级信息流。7:1 是较实用的 aggressive point,9:1 已出现明显 multi-key 与 hard reasoning 损失。

结果 5:15B tokens 后与开源模型对比

  • 设置:>15B tokens 训练;统一 evaluation framework;RULER/NIAH 4K 到 256K;general hard benchmark 为 MMLU、BBH、MBPP、GSM8K。
  • 结果:
Model Type Single 256K Multi 256K Hard Avg
Qwen3-1.7B FA 0.00 0.00 54.02
Qwen3-1.7B-yarn FA 40.20 14.20 50.37
MiniCPM5-1B-Base FA 59.53 16.60 36.11
Gemma-3n-E2B Hybrid 0.00 0.00 39.29
HypeNet-2B Hybrid 68.93 16.90 16.35
Hymba-1.5B Hybrid 0.00 0.00 19.04
Jet-Nemotron-2B Hybrid 1.07 0.00 60.31
HydraHead Hybrid 94.53 52.70 50.62
  • 解读:HydraHead 在 256K retrieval 上显著领先同规模 hybrid baselines,也明显超过 Qwen3-1.7B-yarn。Hard Avg 低于 Qwen3-1.7B 3.40 点,低于 Jet-Nemotron-2B 9.69 点,说明 retrieval / general capability 仍有取舍。

实验设置与 baseline 审计

维度 记录
模型与初始化 Qwen3-1.7B dense Transformer;28 layers, 16 heads/layer, 448 query heads;默认 25% FA heads, 75% GDN heads
数据与任务 FineWeb-Edu;RULER NIAH single-key/multi-key;MMLU, BBH, MBPP, GSM8K;easy benchmark 包括 ARC-Challenge, ARC-Easy, HellaSwag, Winogrande, PIQA, LAMBADA-OpenAI
Head calibration 五个 RULER NIAH sub-probes,三类 single-key 和两类 multi-key;每类 8 个 counterfactual pairs;4K context;fp16 scoring;critical threshold 为 IE0.01\lvert\mathrm{IE}\rvert\ge 0.01
训练配置 默认 Stage 1/2/3 分别 0.3B/1.0B/1.0B tokens;优化配置 Stage 1/2/3 为 0.8B/4.0B/1.0B tokens;最终 scaling experiment 使用超过 15B tokens
Baseline Layer-wise FA/LA, token-wise SWA+GDN, Liger-like token-wise, head-wise mixing, Qwen3-1.7B, Qwen3-1.7B-yarn, MiniCPM5-1B, Gemma-3n-E2B, HypeNet-2B, Hymba-1.5B, Jet-Nemotron-2B
主要未公开项 训练数据过滤细节、完整代码、head scores、hybrid model checkpoint、kernel/serving implementation

证据链强度评估

强证据

  • 架构对比、head selection、fusion 设计、高压缩比例和 15B token 训练后对比覆盖了方法的主要设计变量。
  • RULER Single / Multi-Key native 与 extended context 结果直接测量论文关注的长上下文检索能力。
  • Global interpretability selection 与每层至少保留 FA head 的消融,支撑“head 是可分配稀缺 FA budget 的单位”这一主张。

中等强度证据

  • General Reasoning hard/easy 结果揭示 retrieval 与 general capability 的取舍,但尚不足以覆盖代码、数学、工具调用和真实长文任务。
  • 训练配置和 baseline 记录较完整,仍缺少完整代码、checkpoint、head scores 和 kernel/serving 细节。

需要谨慎的推论

  • 主要模型规模是 Qwen3-1.7B,head specialization 在更大 MoE、GQA/MQA 或不同训练语料上需要复验。
  • HydraHead 的优势集中在检索,若部署目标是通用 reasoning 或 agentic tool use,需要重新权衡 FA head 比例。

主要启发

  • 混合注意力的粒度可以下沉到 attention head,用有限 FA 预算保留 retrieval-critical heads。
  • interpretability-guided head selection 可以作为结构压缩前的预算分配工具,但要用消融验证它没有破坏层级信息流。
  • 后续评估 hybrid attention 时,应同时报告 KV/cache 节省、长上下文检索、general reasoning、kernel 实现和服务延迟。

局限

  1. 模型规模较小。Qwen3-1.7B 的 head specialization pattern 可能和 7B/13B/70B、MoE、multimodal 模型不同。
  2. 训练预算仍有限。15B tokens 是迁移训练意义上的 strong signal,但与 frontier pretraining / long-context continued pretraining 仍有数量级差距。
  3. Head selection 依赖 full activation patching。1.7B 规模可承受,frontier-scale 模型上需要 attribution patching 或更高效 estimator,但论文没有系统验证近似精度。
  4. Calibration task 依赖 NIAH。若目标能力从 retrieval 变成 code reasoning、agent memory、multi-hop QA 或 tool use,counterfactual construction、readout metric 和 capability weights 都需要重设。
  5. Critical heads 与可部署 FA budget 之间仍有 gap。论文观察到只有约 6.5% heads 对 retrieval 高度关键,但 FA budget 降到约 10% 时能力已经明显下降,说明当前 importance score 还不能直接给出最小 FA 配置。
  6. 公开复现材料不足。没有代码、模型权重或完整训练 recipe,第三方难以验证 head selection 稳定性、训练成本和真实 serving 收益。

OpenReview / 审稿意见吸收

  • Venue status: 当前档案未记录公开 peer-review 状态。
  • Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
  • Ratings / confidence: 无公开评分可用于校准。
  • Reviewer consensus: 暂无。
  • Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
  • Author response: 暂无公开 rebuttal 记录。
  • 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。

跨论文关系

  • 2405.17381 Lightning Attention:Lightning Attention 关注 causal linear attention 的 GPU-friendly block-wise kernel 和 recurrent state 计算;HydraHead 关注 FA 与 GDN 在 pretrained Transformer 内的结构分配。前者是 LA 路线的执行/架构基础,后者把 FA budget 按 head 功能分配。
  • 2506.13585 MiniMax-M1:MiniMax-M1 展示 Lightning Attention 在 long-output reasoning RL 中的系统价值;HydraHead 展示 hybrid linear attention 也可以通过 head-level FA retention 改善 long-context retrieval。两者都说明长上下文成本需要架构、训练和评测一起处理。
  • 2606.10650 Dynamic Linear Attention:DLA 试图改进 LA 内部 memory state construction,用 representation drift 决定 state boundary;HydraHead 接受 GDN 的压缩局限,通过少量 FA heads 保留精确 retrieval。一个优化 LA 记忆,一个优化 FA/LA 配比。
  • 2606.13392 MiniMax Sparse Attention:MSA 用 trainable Index Branch 做 per-query/per-GQA-group block selection;HydraHead 用离线 causal head selection 做固定结构分配。MSA 的 selector 在 token/block 维度动态选择历史,HydraHead 在 head 维度静态保留 FA。
  • DeepSeek-V4GLM-5:DeepSeek-V4 的 CSA/HCA 和 GLM-5 的 DSA 都属于 compressed/sparse attention 用于 million-token context 的 production route;HydraHead 给出另一种 checkpoint conversion route,即先保留 pretrained retrieval heads,再用 GDN 降低其余 heads 的成本。
  • FlashAttention / FlashAttention-2:FlashAttention family 保持 exact FA 语义并优化 IO;HydraHead 改变 attention 结构,用少量 exact FA heads 加多数 LA heads 换取更低长上下文成本。两类方法可以在保留的 FA heads 上叠加。

Reference Intake Brief

  • Why now: 本地档案已覆盖 Lightning Attention、DLA、MiniMax MSA、DeepSeek DSA/CSA/HCA、GLM DSA 和 long-context serving。HydraHead 补上了 head-wise FA/LA hybrid conversion 这条线,尤其强调 causal head selection。
  • Core evidence: arXiv v1 HTML 与 TeX source;论文包含方法公式、训练阶段表、selection/fusion/ratio ablations 和 open-source model comparison。
  • Review status: 未发现公开审稿页;当前按 arXiv preprint 处理。
  • Code/model status: 未发现官方代码或 checkpoint 链接;后续需要追踪 Alibaba/Tongyi 是否发布实现。
  • Existing related assets: 2405.173812506.135852606.106502606.133922026-04-24 DeepSeek-V42602.15763 GLM-5
  • Archive action: 新建独立 Markdown 笔记,并在 content/utility/papers-index.md当前收录 中新增 HydraHead 索引行。
  • Follow-up watchlist: 代码与权重发布、7B/13B/MoE 复验、Qwen3.5 hybrid details、attribution patching 替代 full activation patching、真实 serving latency 与 KV cache 指标。