2606.20097-hydrahead-head-wise-hybrid-attention
HydraHead: From Head Level Functional Heterogeneity to Specialized Attention Hybridization
HydraHead 把 Full Attention (FA) 和 Linear Attention (LA) 的混合粒度从 layer 推进到 attention head:先用 activation patching 和 path patching 找到 retrieval-critical heads,只给这些头保留 FA,其余头换成 Gated DeltaNet (GDN),再用独立 RMSNorm 与 head-wise scale modulation 缓解 FA/LA 输出分布差异;在 Qwen3-1.7B 上,它用较少迁移训练把长上下文检索能力拉到明显高于 layer-wise、token-wise 和普通 head-wise 混合的水平,同时保留较强 general reasoning。
Source
- Title: HydraHead: From Head-Level Functional Heterogeneity to Specialized Attention Hybridization
- arXiv: https://arxiv.org/abs/2606.20097
- HTML v1: https://arxiv.org/html/2606.20097v1
- PDF: https://arxiv.org/pdf/2606.20097
- TeX Source: https://arxiv.org/e-print/2606.20097
- Code/Project: 未在 arXiv v1 页面发现官方代码或模型链接。
- OpenReview / Review page: 未发现公开审稿页。
- Authors: Zhentao Tan, Wei Chen, Jingyi Shen, Yao Liu, Xu Shen, Yue Wu, Jieping Ye
- Submitted: 2026-06-18
- Current version read: arXiv v1, submitted 2026-06-18; arXiv HTML and TeX source.
- Subjects: Computation and Language (cs.CL)
- Institution: Alibaba Group
作者与关系
- Zhentao Tan: Alibaba Group;历史机构:Alibaba Cloud, University of Science and Technology of China.
- Wei Chen: Alibaba Group.
- Jingyi Shen: Alibaba Group.
- Yao Liu: Alibaba Group.
- Xu Shen: Alibaba Group;历史机构:Tongyi Large Model Business Unit, Alibaba Token Hub, University of Science and Technology of China.
- Yue Wu: Alibaba Group;历史机构:Alibaba Cloud, University of Science and Technology of China.
- Jieping Ye: Alibaba Group;历史机构:Data to Intelligence Lab, Alibaba Cloud Intelligence Group, University of Michigan.
阅读目标与判断边界
本笔记关注:
- HydraHead 为什么选择 head 作为 FA/LA hybrid 的最小结构单元。
- index-free 的 head selection 如何通过 causal intervention 得到,并和在线 router 路线区分开。
- FA/GDN 两类 head 输出如何融合,为什么 scale-normalized fusion 是关键模块。
- 三阶段迁移训练如何把 Qwen3-1.7B dense Transformer 转成 hybrid architecture。
- 它与 Lightning Attention、Dynamic Linear Attention、DeepSeek / GLM / MiniMax 稀疏或压缩 attention 路线的差异。
判断边界:
- 主实验基座是 Qwen3-1.7B,一个 28 层、448 个 query heads 的 compact dense Transformer;7B/13B+、MoE 和 multimodal 模型上仍需验证。
- HydraHead 的选择机制来自离线可解释性分析,推理时没有动态 per-token router;部署行为比动态 sparse selector 更稳定,但 head 配置会绑定到某个 checkpoint 和目标能力集。
- 长上下文证据主要来自 RULER / NIAH retrieval;agentic workflow、repository-scale code、长视频或 instruction following 场景还缺少完整验证。
- 论文没有公开代码、模型权重、完整训练数据配方或第三方复现;高比例 GDN 配置下的质量边界仍依赖作者实验。
论文脉络
1. 研究问题、背景和价值
标准 FA 的主成本来自
主流 open-source hybrid model 多采用 layer-wise strategy。这个粒度实现简单,也方便继承已有 Transformer block,但它隐含一个假设:一个 layer 内的 heads 功能相近,可以整体保留 FA 或整体替换成 LA。HydraHead 的起点是反查这个假设。作者用 Qwen3-1.7B 做 interpretability analysis 后发现:layer 之间确实有 block-wise functional similarity,但同一 layer 内 heads 的功能差异很大;检索能力通常由少数 scattered heads 承载,同层许多 heads 对 retrieval 的 causal contribution 很低。
因此,HydraHead 想解决的问题是:如果 long-context retrieval 只依赖少量 heads,能否把 FA budget 分配给这些 heads,把其他 heads 换成更便宜的 GDN,从而在质量和效率之间获得比 layer-wise hybrid 更好的 Pareto 点。
2. 已有解决方案与不足
已有路线可以分为几类。
- Layer-wise hybrid:HypeNet / HALO 类方法把若干层保留为 FA 层,其余层换成 linear attention 或 SSM。优点是结构规整、迁移训练较成熟;不足是整层分配会把 FA 用在同层无关 heads 上,也可能把关键 heads 一并替换掉。
- Token-wise hybrid:STILL、Liger 等方法按 token 或局部窗口分配 FA 与 LA/SWA。粒度更细,但异构路径会让序列表示一致性更难维持;部分方法在 32K 以上缺少充分评估,sparse variant 还可能保留完整 KV cache。
- Naive head-wise mixing:并行跑 FA/GDN 两个分支后做 feature fusion,能保留 within-layer 交互,但如果所有 heads 都混合或随机分配,长上下文检索能力仍不稳定。
- Pure linear / recurrent attention:Lightning Attention、GDN、Mamba 类路线成本低,但 recall-intensive task 容易受固定状态压缩影响。
- Native sparse / compressed attention:DeepSeek DSA、DeepSeek-V4 CSA/HCA、MiniMax MSA 通过 selector、compressed entries 或 block sparse softmax 保留可寻址性。它们通常需要额外 indexer、sparse kernels 或层级交错配置。
HydraHead 的增量是把可解释性分析变成结构分配工具:它不训练在线 selector,而是一次性定位哪些 pretrained heads 需要保留 FA。
3. 作者可能的思考路径
可以重建为六步:
- LA/GDN 适合长上下文成本控制,但 recall fidelity 弱于 FA。
- Layer-wise hybrid 的主要损耗来自粒度粗:一层里既有 retrieval-critical heads,也有可替换 heads。
- 需要先证明 head-level heterogeneity 是 causal,再和 attention pattern 或 logit lens 的相关现象区分开。
- Activation patching 可以测单个 head 被替换后目标行为下降多少;path patching 可以补到上游 sender heads。
- 拿到 head ranking 后,把 FA budget 给 top critical heads,把剩余 heads 交给 GDN。
- FA 和 GDN 的输出分布不同,直接拼接会造成优化压力;需要独立 normalization、保持原 head index,再给每个 head 一个可学习 scale。
4. 核心假设或切入点
HydraHead 的核心假设有三条:
- Long-context retrieval 的关键计算由少量 heads 承载,并且这些 heads 在 layer 内分布不均匀。
- 这些 heads 可以通过离线 causal intervention 稳定定位;小 calibration set 上得到的 head set 能迁移到更长 context。
- 对可替换 heads 使用 GDN,不会显著破坏一般能力,只要迁移训练和 FA/GDN fusion 足够稳定。
这使 HydraHead 的架构选择可以写成固定 partition:
其中
5. 方法 / 系统 / 理论框架
5.1 Head importance estimation
Head selection 分三步。
第一步是构造 clean/corrupt input pairs。对 NIAH 这类检索任务,作者把正确答案替换成类型和 token 长度相同的 counterfactual answer,让输入结构与长度保持一致。读出指标是 span-level logit difference:
论文默认
第二步是 activation patching。对 layer
高分 heads 是 receivers,说明它们直接把能力相关信号写入 residual stream。
第三步是 path patching。某个 head 也可能作为 sender,通过下游 receiver 影响结果。作者记录 corrupted input 中 upstream head 发送给 receiver 的 activation,再在 clean run 中只替换这条 path 上的信号,得到 sender effect。长上下文 retrieval 上这个迭代大约两轮收敛,说明相关 circuit 较浅。
最后,对每个能力
多个能力的分数 min-max normalize 后加权融合:
然后按
5.2 Head-wise hybridization
每个 head 被路由到 FA 或 GDN:
:用标准 softmax attention。 :用 Gated DeltaNet recurrence,维护常量大小 state,长序列推理成本随长度近似线性。
FA 的优势是 token-level precise retrieval,GDN 的优势是长上下文成本低。HydraHead 在每个 layer 内混合二者,因此同一层可以同时保留少数高精度 retrieval heads 和多数低成本 GDN heads。
5.3 Head-wise scale-normalized fusion
FA 和 LA 的输出统计不同。FA 的 softmax 会把 query norm 放进 attention score,输出更 sharp、低熵,常由少数 high-weight tokens 主导;LA/GDN 的 normalization 会弱化 query norm,输出更平滑。直接拼接两类 head output 会让 output projection 面对不稳定尺度。
HydraHead 的 fusion 分三步:
- 对每个 head output 独立做 RMSNorm:
- 按原始 head index 拼接,保留 head identity:
- 用可学习 head-wise scale
调整每个 head 的贡献:
这个设计把 FA/GDN 的尺度差异先对齐,再允许训练阶段学习每个 head 的权重。
5.4 Branch-specific refinements
论文还把 HypeNet/HALO 中有效的结构改动迁移到 head-wise setting:
- FA branch:移除 RoPE,改用 long-context scale coefficient;scale hyperparameter 设为 500;加入 gate branch,初始化时接近 identity。
- GDN branch:加入 RoPE 增强局部位置感知;把 key-value heads 扩展到 MHA-like 配置,增强表示容量。
- Query decomposition:FA 与 GDN 分支拆分 QKV projection,减少异构 heads 共享 projection 时的梯度冲突和数值瓶颈。
5.5 三阶段迁移训练
HydraHead 从 pretrained Qwen3-1.7B 出发,不从头预训练。
Stage 1 是 parameter migration 和 layer-wise output alignment。FA heads 继承原 attention weights;GDN heads 复用原 Q/K/V weights,并处理 GQA 到 GDN 维度差异。冻结 backbone,只训练新 hybrid attention layers,用 MSE 对齐原 FA layer hidden states:
Stage 2 是 global logits distillation。解冻全模型,用 teacher dense model 的 final logits 做 KL distillation,同时保留 next-token cross entropy。
Stage 3 是 long-context fine-tuning。用更长 context 做 NTP 训练,巩固 extrapolation 能力。
默认训练配置为 Stage 1: batch 32、context 512、0.3B tokens、cosine LR 1e-3 到 1e-5;Stage 2: batch 96、context 512、1.0B tokens、cosine LR 1e-4 到 1e-5;Stage 3: batch 128、context 16384、1.0B tokens、constant LR 1e-5。优化版把 Stage 1/2 context 增到 2048,并把 Stage 1/2 tokens 增到 0.8B/4.0B。
6. 结论链条
论文的结论链条是:
- Qwen3-1.7B 的 retrieval-critical heads 只占少数,并且在 layer 内分布不均。
- Head-level causal score 在少量 NIAH calibration samples 上稳定,top head set 可迁移到更长 context。
- Global interpretability screening 显著优于 fixed、random 和 layer-wise screening。
- FA/GDN fusion 需要独立 normalization 与 head-wise scale;去掉 normalization 或用动态 gate,长上下文稳定性下降。
- 在 3:1 GDN:FA ratio 下,HydraHead 的 long-context retrieval 与 general reasoning 综合表现优于 layer-wise/token-wise/head-wise baselines。
- 在 7:1 GDN:FA ratio 下,加上每层至少一个 FA head 的 constraint 后,HydraHead 可以接近 3:1 layer-wise hybrid 的长上下文平均表现,同时保留明显更高的 hard reasoning 分数。
关键实验/定理
结果 1:不同 hybrid architecture 对比
- 设置:Qwen3-1.7B backbone;GDN 作为 LA;统一三阶段训练;默认保留 25% FA heads。
- Baseline:layer-wise FA/LA, token-wise SWA+GDN, token-wise Liger-like, full-head mixing。
- 指标:RULER Single / Multi-Key 的 native 和 extended context accuracy;General Reasoning hard/easy。
- 结果:
| Model | LA | Cache | RULER Single Ext. | RULER Multi Ext. | Hard | Easy |
|---|---|---|---|---|---|---|
| FA & LA layer-wise | Lightning | 0.25 | 85.00 | 24.37 | 19.80 | 59.72 |
| FA & LA layer-wise | GDN | 0.25 | 7.02 | 5.53 | 16.44 | 58.18 |
| Token-wise | GDN | 0.25 | 3.73 | 2.43 | 47.31 | 63.40 |
| Token-wise Liger-like | GDN | 0.25 | 58.78 | 11.03 | 36.66 | 63.37 |
| Head-wise Mixing | GDN | 1.00 | 60.42 | 14.53 | 38.07 | 62.77 |
| HydraHead | GDN | 0.35 | 87.49 | 27.37 | 31.03 | 62.12 |
- 解读:HydraHead 的强项是 extended context retrieval。Token-wise 和普通 head-wise mixing 能保留更强 hard reasoning,但长上下文检索明显落后。Layer-wise Lightning baseline 长上下文强,但 hard reasoning 低很多。
结果 2:head selection 策略
- 设置:3:1 GDN:FA ratio;Basic Model;比较 fixed、random、layer-wise interpretability、global interpretability。
- 指标:RULER Single / Multi-Key native 和 extended;General Reasoning hard/easy。
- 结果:
| Selection | Single Native | Single Ext. | Multi Native | Multi Ext. | Hard | Easy |
|---|---|---|---|---|---|---|
| Fixed | 85.63 | 62.62 | 27.35 | 13.67 | 28.65 | 62.59 |
| Layer-Rand | 87.07 | 65.33 | 27.70 | 17.37 | 27.91 | 62.95 |
| Global-Rand | 59.40 | 32.96 | 16.55 | 5.33 | 26.19 | 62.40 |
| Layer-Interp | 91.13 | 65.22 | 35.10 | 15.97 | 31.93 | 62.15 |
| Global-Interp | 98.70 | 81.73 | 38.35 | 25.93 | 31.70 | 62.68 |
- 解读:global random 会破坏跨层结构平衡;layer-wise interpretability 能提升能力,但 global interpretability 更能把 FA budget 集中给最关键 heads。
结果 3:fusion 设计
- 设置:interpretability-guided global selection;比较 Basic、无 normalization、head-wise scale、head-wise gate。
- 结果:
| Fusion | Single Native | Single Ext. | Multi Native | Multi Ext. | Hard | Easy |
|---|---|---|---|---|---|---|
| Basic Model | 98.70 | 81.73 | 38.35 | 25.93 | 31.70 | 62.68 |
| w/o Norm | 85.07 | 71.36 | 41.90 | 23.93 | 30.62 | 62.58 |
| Head-wise Scale | 98.47 | 87.49 | 37.10 | 27.37 | 31.03 | 62.12 |
| Head-wise Gate | 95.80 | 67.16 | 41.85 | 26.87 | 28.24 | 61.90 |
- 解读:去掉 normalization 后 single-key 检索下降超过 10 点;动态 gate 在 single extended context 上明显弱于静态 scale。作者采用 head-wise scale 作为后续 default。
结果 4:更高 GDN:FA ratio
- 设置:Basic Model;比较 Global-Interp 和 Global-Interp-C,其中 C 表示每层至少保留一个 FA head。
- 结果:
| Strategy | Ratio | Single Ext. | Multi Ext. | Hard | Easy |
|---|---|---|---|---|---|
| Global-Interp | 3:1 | 81.73 | 25.93 | 31.70 | 62.68 |
| Global-Interp-C | 3:1 | 83.91 | 25.20 | 31.83 | 62.73 |
| Global-Interp | 7:1 | 58.07 | 18.67 | 27.75 | 62.63 |
| Global-Interp-C | 7:1 | 81.04 | 22.93 | 29.46 | 62.65 |
| Global-Interp | 9:1 | 60.58 | 14.50 | 26.04 | 62.65 |
| Global-Interp-C | 9:1 | 72.69 | 18.63 | 28.92 | 62.68 |
- 解读:高压缩比例下,单纯按 global importance 排序会让某些层完全失去 FA;每层至少保留一个 FA head 可维持层级信息流。7:1 是较实用的 aggressive point,9:1 已出现明显 multi-key 与 hard reasoning 损失。
结果 5:15B tokens 后与开源模型对比
- 设置:>15B tokens 训练;统一 evaluation framework;RULER/NIAH 4K 到 256K;general hard benchmark 为 MMLU、BBH、MBPP、GSM8K。
- 结果:
| Model | Type | Single 256K | Multi 256K | Hard Avg |
|---|---|---|---|---|
| Qwen3-1.7B | FA | 0.00 | 0.00 | 54.02 |
| Qwen3-1.7B-yarn | FA | 40.20 | 14.20 | 50.37 |
| MiniCPM5-1B-Base | FA | 59.53 | 16.60 | 36.11 |
| Gemma-3n-E2B | Hybrid | 0.00 | 0.00 | 39.29 |
| HypeNet-2B | Hybrid | 68.93 | 16.90 | 16.35 |
| Hymba-1.5B | Hybrid | 0.00 | 0.00 | 19.04 |
| Jet-Nemotron-2B | Hybrid | 1.07 | 0.00 | 60.31 |
| HydraHead | Hybrid | 94.53 | 52.70 | 50.62 |
- 解读:HydraHead 在 256K retrieval 上显著领先同规模 hybrid baselines,也明显超过 Qwen3-1.7B-yarn。Hard Avg 低于 Qwen3-1.7B 3.40 点,低于 Jet-Nemotron-2B 9.69 点,说明 retrieval / general capability 仍有取舍。
实验设置与 baseline 审计
| 维度 | 记录 |
|---|---|
| 模型与初始化 | Qwen3-1.7B dense Transformer;28 layers, 16 heads/layer, 448 query heads;默认 25% FA heads, 75% GDN heads |
| 数据与任务 | FineWeb-Edu;RULER NIAH single-key/multi-key;MMLU, BBH, MBPP, GSM8K;easy benchmark 包括 ARC-Challenge, ARC-Easy, HellaSwag, Winogrande, PIQA, LAMBADA-OpenAI |
| Head calibration | 五个 RULER NIAH sub-probes,三类 single-key 和两类 multi-key;每类 8 个 counterfactual pairs;4K context;fp16 scoring;critical threshold 为 |
| 训练配置 | 默认 Stage 1/2/3 分别 0.3B/1.0B/1.0B tokens;优化配置 Stage 1/2/3 为 0.8B/4.0B/1.0B tokens;最终 scaling experiment 使用超过 15B tokens |
| Baseline | Layer-wise FA/LA, token-wise SWA+GDN, Liger-like token-wise, head-wise mixing, Qwen3-1.7B, Qwen3-1.7B-yarn, MiniCPM5-1B, Gemma-3n-E2B, HypeNet-2B, Hymba-1.5B, Jet-Nemotron-2B |
| 主要未公开项 | 训练数据过滤细节、完整代码、head scores、hybrid model checkpoint、kernel/serving implementation |
证据链强度评估
强证据
- 架构对比、head selection、fusion 设计、高压缩比例和 15B token 训练后对比覆盖了方法的主要设计变量。
- RULER Single / Multi-Key native 与 extended context 结果直接测量论文关注的长上下文检索能力。
- Global interpretability selection 与每层至少保留 FA head 的消融,支撑“head 是可分配稀缺 FA budget 的单位”这一主张。
中等强度证据
- General Reasoning hard/easy 结果揭示 retrieval 与 general capability 的取舍,但尚不足以覆盖代码、数学、工具调用和真实长文任务。
- 训练配置和 baseline 记录较完整,仍缺少完整代码、checkpoint、head scores 和 kernel/serving 细节。
需要谨慎的推论
- 主要模型规模是 Qwen3-1.7B,head specialization 在更大 MoE、GQA/MQA 或不同训练语料上需要复验。
- HydraHead 的优势集中在检索,若部署目标是通用 reasoning 或 agentic tool use,需要重新权衡 FA head 比例。
主要启发
- 混合注意力的粒度可以下沉到 attention head,用有限 FA 预算保留 retrieval-critical heads。
- interpretability-guided head selection 可以作为结构压缩前的预算分配工具,但要用消融验证它没有破坏层级信息流。
- 后续评估 hybrid attention 时,应同时报告 KV/cache 节省、长上下文检索、general reasoning、kernel 实现和服务延迟。
局限
- 模型规模较小。Qwen3-1.7B 的 head specialization pattern 可能和 7B/13B/70B、MoE、multimodal 模型不同。
- 训练预算仍有限。15B tokens 是迁移训练意义上的 strong signal,但与 frontier pretraining / long-context continued pretraining 仍有数量级差距。
- Head selection 依赖 full activation patching。1.7B 规模可承受,frontier-scale 模型上需要 attribution patching 或更高效 estimator,但论文没有系统验证近似精度。
- Calibration task 依赖 NIAH。若目标能力从 retrieval 变成 code reasoning、agent memory、multi-hop QA 或 tool use,counterfactual construction、readout metric 和 capability weights 都需要重设。
- Critical heads 与可部署 FA budget 之间仍有 gap。论文观察到只有约 6.5% heads 对 retrieval 高度关键,但 FA budget 降到约 10% 时能力已经明显下降,说明当前 importance score 还不能直接给出最小 FA 配置。
- 公开复现材料不足。没有代码、模型权重或完整训练 recipe,第三方难以验证 head selection 稳定性、训练成本和真实 serving 收益。
OpenReview / 审稿意见吸收
- Venue status: 当前档案未记录公开 peer-review 状态。
- Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
- Ratings / confidence: 无公开评分可用于校准。
- Reviewer consensus: 暂无。
- Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
- Author response: 暂无公开 rebuttal 记录。
- 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。
跨论文关系
- 与 2405.17381 Lightning Attention:Lightning Attention 关注 causal linear attention 的 GPU-friendly block-wise kernel 和 recurrent state 计算;HydraHead 关注 FA 与 GDN 在 pretrained Transformer 内的结构分配。前者是 LA 路线的执行/架构基础,后者把 FA budget 按 head 功能分配。
- 与 2506.13585 MiniMax-M1:MiniMax-M1 展示 Lightning Attention 在 long-output reasoning RL 中的系统价值;HydraHead 展示 hybrid linear attention 也可以通过 head-level FA retention 改善 long-context retrieval。两者都说明长上下文成本需要架构、训练和评测一起处理。
- 与 2606.10650 Dynamic Linear Attention:DLA 试图改进 LA 内部 memory state construction,用 representation drift 决定 state boundary;HydraHead 接受 GDN 的压缩局限,通过少量 FA heads 保留精确 retrieval。一个优化 LA 记忆,一个优化 FA/LA 配比。
- 与 2606.13392 MiniMax Sparse Attention:MSA 用 trainable Index Branch 做 per-query/per-GQA-group block selection;HydraHead 用离线 causal head selection 做固定结构分配。MSA 的 selector 在 token/block 维度动态选择历史,HydraHead 在 head 维度静态保留 FA。
- 与 DeepSeek-V4 和 GLM-5:DeepSeek-V4 的 CSA/HCA 和 GLM-5 的 DSA 都属于 compressed/sparse attention 用于 million-token context 的 production route;HydraHead 给出另一种 checkpoint conversion route,即先保留 pretrained retrieval heads,再用 GDN 降低其余 heads 的成本。
- 与 FlashAttention / FlashAttention-2:FlashAttention family 保持 exact FA 语义并优化 IO;HydraHead 改变 attention 结构,用少量 exact FA heads 加多数 LA heads 换取更低长上下文成本。两类方法可以在保留的 FA heads 上叠加。
Reference Intake Brief
- Why now: 本地档案已覆盖 Lightning Attention、DLA、MiniMax MSA、DeepSeek DSA/CSA/HCA、GLM DSA 和 long-context serving。HydraHead 补上了 head-wise FA/LA hybrid conversion 这条线,尤其强调 causal head selection。
- Core evidence: arXiv v1 HTML 与 TeX source;论文包含方法公式、训练阶段表、selection/fusion/ratio ablations 和 open-source model comparison。
- Review status: 未发现公开审稿页;当前按 arXiv preprint 处理。
- Code/model status: 未发现官方代码或 checkpoint 链接;后续需要追踪 Alibaba/Tongyi 是否发布实现。
- Existing related assets: 2405.17381、2506.13585、2606.10650、2606.13392、2026-04-24 DeepSeek-V4、2602.15763 GLM-5。
- Archive action: 新建独立 Markdown 笔记,并在
content/utility/papers-index.md的当前收录中新增 HydraHead 索引行。 - Follow-up watchlist: 代码与权重发布、7B/13B/MoE 复验、Qwen3.5 hybrid details、attribution patching 替代 full activation patching、真实 serving latency 与 KV cache 指标。