2603.15031-attention-residuals
Attention Residuals
AttnRes 将 PreNorm 的单位权重跨层累积改为对嵌入、此前子层输出或块级表示的输入相关 softmax 聚合,并用连续层分块、跨流水线阶段缓存和两阶段推理调度控制历史状态成本;在 Kimi Linear MoE 的五个 194M–528M 激活参数设置中,Full 与 Block 变体均取得低于标准残差的单次报告验证损失,48B 总参数、3B 激活参数的 Block 变体在十五项下游数值中十四项提高、一项持平,但现有证据缺少随机种子、统计区间、大规模 Full 对照和完整系统测量环境,ICML 2025 的 DeepCrossAttention 也已覆盖输入相关的跨层聚合。
Source
- Workflow version: v2.1
- Material type: technical-report
- Analysis modules: experiment, system, theory
- Canonical source: https://arxiv.org/abs/2603.15031v1
- Title: Attention Residuals
- Authors: Guangyu Chen, Yu Zhang, Jianlin Su, Weixin Xu, Siyuan Pan, Yaoyu Wang, Yucheng Wang, Guanduo Chen, Bohong Yin, Yutian Chen, Junjie Yan, Ming Wei, Y. Zhang, Fanqing Meng, Chao Hong, Xiaotong Xie, Shaowei Liu, Enzhe Lu, Yunpeng Tai, Yanru Chen, Xin Men, Haiqing Guo, Y. Charles, Haoyu Lu, Lin Sui, Jinguo Zhu, Zaida Zhou, Weiran He, Weixiao Huang, Xinran Xu, Yuzhi Wang, Guokun Lai, Yulun Du, Yuxin Wu, Zhilin Yang, Xinyu Zhou
- Responsible organization: Kimi Team; Moonshot AI
- arXiv: https://arxiv.org/abs/2603.15031v1
- HTML: https://arxiv.org/html/2603.15031v1
- PDF: https://arxiv.org/pdf/2603.15031v1
- Source package: https://arxiv.org/src/2603.15031v1
- Code/Project: https://github.com/MoonshotAI/Attention-Residuals
- Project snapshot read:
85e22310fe5ee860b4a023de312d791de8a5a5e6 - Related implementation: Flash Linear Attention
fla/ops/attnres - OpenReview / Review page: 通过 OpenReview API v2 按标题、arXiv 标识和 paperhash 检索,未发现可靠匹配的论坛或公开审稿记录
- Submitted: 2026-03-16 09:32:21 UTC
- Published / updated: 2026-03-16(arXiv v1)
- Current version read: arXiv v1
- Version / revision read: 2026-03-16
- Accessed: 2026-08-06
- License: CC BY-NC-ND 4.0
- Key figure decision: include
- Key figure rationale: Figure 1 直接区分标准残差、Full AttnRes 与 Block AttnRes 的来源粒度;Figure 5 给出 48B/3B 激活参数设置中的训练损失、层输出幅度和梯度幅度,是机制解释的主要经验依据。
- Review status: page-type=not-found; match-confidence=high; observed-at=2026-08-06; venue-status=arXiv technical report
- Subjects: Computation and Language (cs.CL)
作者与关系
- Guangyu Chen: Kimi Team;论文未披露逐人机构对应。
- Yu Zhang: Kimi Team;论文未披露逐人机构对应。
- Jianlin Su: Kimi Team;论文未披露逐人机构对应。
- Weixin Xu: Kimi Team;论文未披露逐人机构对应。
- Siyuan Pan: Kimi Team;论文未披露逐人机构对应。
- Yaoyu Wang: Kimi Team;论文未披露逐人机构对应。
- Yucheng Wang: Kimi Team;论文未披露逐人机构对应。
- Guanduo Chen: Kimi Team;论文未披露逐人机构对应。
- Bohong Yin: Kimi Team;论文未披露逐人机构对应。
- Yutian Chen: Kimi Team;论文未披露逐人机构对应。
- Junjie Yan: Kimi Team;论文未披露逐人机构对应。
- Ming Wei: Kimi Team;论文未披露逐人机构对应。
- Y. Zhang: Kimi Team;论文未披露全名和逐人机构对应。
- Fanqing Meng: Kimi Team;论文未披露逐人机构对应。
- Chao Hong: Kimi Team;论文未披露逐人机构对应。
- Xiaotong Xie: Kimi Team;论文未披露逐人机构对应。
- Shaowei Liu: Kimi Team;论文未披露逐人机构对应。
- Enzhe Lu: Kimi Team;论文未披露逐人机构对应。
- Yunpeng Tai: Kimi Team;论文未披露逐人机构对应。
- Yanru Chen: Kimi Team;论文未披露逐人机构对应。
- Xin Men: Kimi Team;论文未披露逐人机构对应。
- Haiqing Guo: Kimi Team;论文未披露逐人机构对应。
- Y. Charles: Kimi Team;论文未披露全名和逐人机构对应。
- Haoyu Lu: Kimi Team;论文未披露逐人机构对应。
- Lin Sui: Kimi Team;论文未披露逐人机构对应。
- Jinguo Zhu: Kimi Team;论文未披露逐人机构对应。
- Zaida Zhou: Kimi Team;论文未披露逐人机构对应。
- Weiran He: Kimi Team;论文未披露逐人机构对应。
- Weixiao Huang: Kimi Team;论文未披露逐人机构对应。
- Xinran Xu: Kimi Team;论文未披露逐人机构对应。
- Yuzhi Wang: Kimi Team;论文未披露逐人机构对应。
- Guokun Lai: Kimi Team;论文未披露逐人机构对应。
- Yulun Du: Kimi Team;论文未披露逐人机构对应。
- Yuxin Wu: Kimi Team;论文未披露逐人机构对应。
- Zhilin Yang: Kimi Team;论文未披露逐人机构对应。
- Xinyu Zhou: Kimi Team;论文未披露逐人机构对应。
- 作者角色:附录明确标注 Guangyu Chen、Yu Zhang、Jianlin Su 为共同贡献作者,并说明作者顺序按贡献重要性排列、项目领导角色列于末尾;材料没有标注通讯作者或项目领导边界,不能据此指定某位末位作者为唯一负责人。Yulun Du 是 arXiv 提交者,该角色不等同于通讯作者。
- 机构关系:论文按 Kimi Team 署名,官方项目由 MoonshotAI 组织发布;共同贡献作者的个人主页和代码主页进一步连接 Kimi Team 与 Moonshot AI。论文没有提供 36 位作者的逐人机构映射。
- 已存档作者重叠:Weiran He、Weixiao Huang、Xinran Xu 同时进入 Seer、Kimi K2.5 与 Kimi K3 研究线;Yulun Du 同时进入 Kimi K2、Kimi K2.5 与 Kimi K3 研究线。Yutian Chen、Yucheng Wang、Ming Wei 还出现在 Kimi K3 的 MoonEP 组件归因中。
阅读目标与判断边界
本笔记回答四个问题:
- AttnRes 在深度方向保存、打分和传递哪些表示,默认查询与输入相关权重分别来自哪里。
- Full 到 Block 的压缩损失、算术量、状态量、流水线通信和推理 I/O 如何变化。
- 五组缩放实验、48B 对照、消融和训练动态分别支持哪些最窄结论。
- 该方法与 DenseFormer、DeepCrossAttention、MUDDFormer 和 HC/mHC 的关系如何限制原创性与外部有效性。
判断边界如下:
- 论文是 arXiv v1 技术报告,当前没有公开同行评审记录。
- 论文中的
隐藏状态增长是作者主张,正文没有给出使其成立的相关性条件或证明;Figure 5 测量的是子层输出幅度,而非隐藏状态范数或相对层贡献。 - “
算力优势”来自五个点的幂律拟合,所需基线算力超过实测上界,属于外推等效量。 - 48B 对照只测试 Block AttnRes 与标准 PreNorm,没有 Full、mHC、DeepCrossAttention 或 MUDDFormer 对照。
- 官方项目快照只含技术报告、图片和伪代码。Flash Linear Attention 后续提供算子与融合内核,仍未公开论文所用的大规模训练系统、配置和检查点。
- 本文把论文事实、作者解释、本地数学重构和源码表述不一致分别标记,避免把结构类比写成已证性质。
论文脉络
1. 研究问题、背景和价值
标准 PreNorm Transformer 把每个注意力或 MLP 子层的输出以单位权重加入残差流。沿深度展开后,当前隐藏状态是嵌入与全部此前子层输出的和。该结构提供直接梯度路径,也把不同深度的表示压缩进一个累计状态;更深的子层只能读取累计结果,无法按当前 token 和目标层重新分配各历史来源的权重。
论文关注由此形成的两类问题。第一类是表示选择:不同 token 和不同目标层可能需要不同的早期特征,固定单位权重缺少这一自由度。第二类是尺度与优化:作者认为残差流幅度随深度增长后,固定尺度的新子层输出对归一化方向的相对影响下降,深层需要增大输出幅度以维持作用。该现象通常称为 PreNorm 的层贡献稀释(dilution)。
显式保存全部历史子层输出可以恢复跨层选择能力,同时会增加训练激活、流水线传输和推理内存读取。论文的价值因此取决于架构机制与系统执行路径能否共同成立:细粒度历史访问提供质量收益,块级压缩和执行调度需要把额外成本控制在大模型训练与推理可接受的范围内。
2. 已有解决方案与不足
已有方法覆盖四种深度混合方式:
| 方法族 | 历史状态 | 混合权重 | 与 AttnRes 的关系 |
|---|---|---|---|
| ReZero、LayerScale、Highway | 前一递归状态 | 静态尺度或门控 | 展开后历史权重受递归乘积约束,通常不显式保存逐层来源 |
| DenseFormer | 先前层输出 | 学习得到的静态标量 | 提供直接跨层访问,权重不随 token 内容变化 |
| HC/mHC | 固定数量的并行状态流 | 输入相关矩阵 | 用常数规模多状态递归提高深度混合秩,保留多路状态而非全部逐层来源 |
| MUDDFormer、DeepCrossAttention | 先前层或块输出 | 输入相关权重 | 已在 AttnRes 之前把动态稠密连接表述为深度注意力 |
DeepCrossAttention 已发表于 ICML 2025。其 GRN-v3 使用学习得到的查询与此前层输出计算输入相关权重,并提供保留输入、中间累计和与最近若干输出的压缩变体。它与 Full AttnRes 的主要差异是 ReLU 加静态逐维项、Q/K/V 分路聚合,以及 AttnRes 使用 RMSNorm 后来源打分与 softmax 标量权重。AttnRes 正文和参考文献没有引用该工作,因此首要贡献需要限定为具体 softmax 参数化、连续块压缩和面向流水线训练与推理 I/O 的规模化共设计。
MUDDFormer 也把动态稠密连接解释为深度注意力,并由当前状态生成多路动态权重。AttnRes 将目标层查询设为静态参数,把输入依赖性放在来源键上;这个分解降低了查询表达能力,也使同一块内的目标层查询能够提前批量计算。
3. 作者可能的思考路径
以下路径属于本地重构:
- 先把标准残差递推展开为所有此前子层输出的固定单位权重和,使“残差连接”转化为深度轴上的历史聚合问题。
- 再把每个早期输出作为 key/value,使用目标层专属查询和 softmax 计算逐 token 权重,形成 Full AttnRes。
- Full 版本暴露出全部历史输出的存储、流水线传输和推理读取成本后,把连续子层输出压缩为块内累计和,形成 Block AttnRes。
- 静态目标层查询允许同一块内的查询提前组成矩阵,由此产生跨阶段缓存与两阶段在线 softmax 合并的执行路径。
- 最后用小模型缩放、48B 对照、组件消融和解析成本模型检查质量与成本的共同边界。
这条路径也说明默认查询为何保持输入无关:当前状态生成查询会等待块内前序计算,并增加每层
4. 核心假设或切入点
AttnRes 依赖以下判断:
- 早期子层输出保留可供更深层直接复用的信息,累计残差状态不足以等价恢复这些来源。
- 目标层的固定查询与 token 相关来源键足以产生有用的输入相关权重,无需让查询读取当前隐藏状态。
- softmax 的归一化尺度、显式跨层访问和新增梯度路径能够改善训练;当前实验没有完全分离三者的因果贡献。
- 连续块内的子层输出可以压缩为一个和,约八至九个块在当前 Kimi Linear 深度范围内保留主要质量增益。
- 历史状态读取是内存访问受限操作,批量查询、跨阶段缓存和序列分片可以把解析成本优势转化为端到端开销控制。
这些判断目前只在 Kimi Linear 的 KDA/MLA 混合注意力、MoE、RMSNorm 和指定训练配方中得到系统验证。
5. 贡献全景与方法总览
首要贡献是一个可扩展的显式跨层 softmax 聚合路径。Full AttnRes 提供逐子层来源选择;Block AttnRes 把已完成块内的子层输出求和为块表示,保留嵌入、此前块和当前块部分和。辅助贡献包括交错流水线缓存、两阶段推理、长上下文序列分片,以及对缩放、架构形状和训练动态的经验分析。
关键对象及其角色如下:
| 对象 | 定义与所属阶段 | 更新与传递关系 |
|---|---|---|
| token 嵌入 | 始终作为独立历史来源 | |
| 第 |
Full 版本逐子层保存;Block 版本加入当前块部分和 | |
| 第 |
输入无关、零初始化;由语言模型损失更新 | |
| 来源 |
查询固定,键由 token 相关来源生成,因此权重随 token 变化 | |
| 第 |
Block 版本跨块保存、通信和读取 | |
| 当前块执行到第 |
块内顺序更新,块完成后固化为 |
端到端执行链分为五个阶段:
| 阶段 | 输入 | 核心操作与传递对象 | 输出与作用 |
|---|---|---|---|
| 1. 深度问题重写 | PreNorm 残差递推 | 展开为嵌入与此前子层输出的深度混合矩阵 | 区分固定单位权重、显式历史来源和尺度边界 |
| 2. Full 聚合 | 全部此前 |
对 RMSNorm 后来源打分,softmax 后对原始来源加权 | 当前子层输入 |
| 3. Block 压缩 | 嵌入、已完成块、当前块部分和 | 以连续块和代替逐子层历史,块内继续加法累计 | |
| 4. 训练系统映射 | 块表示、交错流水线阶段 | 缓存此前虚拟阶段已收到的块,只传递新增块 | 较低的历史转移峰值和复用后的反向路径 |
| 5. 推理系统映射 | 静态查询、跨块历史、当前块部分和 | 先批量计算跨块贡献,再顺序加入当前块来源并在线合并 softmax | 精确聚合结果、较低 HBM 读取和可分片长上下文缓存 |

figures/model.tex,本地无内容改动重编译;CC BY-NC-ND 4.0。6. 从标准残差到深度混合:问题成立到什么程度
为明确被替换的对象,论文把每个自注意力或 MLP 分别计为一层。标准残差的展开式为:
论文把 PreNorm 子层写成累计状态与归一化子层输出的更新。为检查稀释发生的位置,本地分析把忽略增益和
从展开式和有界子层输出只能得到三角不等式上界:
近似不相关的增量通常对应
7. Full AttnRes:逐子层来源的输入相关 softmax
Full AttnRes 先把嵌入与每个子层输出拆成独立来源:
每个 token 都有一组
目标层
RMSNorm 降低来源整体幅度对分数的直接影响,value 仍保留原始幅度。
softmax 权重和为 1,因此来源数量本身不再直接增大加权和范数:
该界只约束凸组合相对来源的幅度;value 未归一化,单个来源仍可能增长。论文没有给出全网幅度或梯度稳定性的理论上界。
训练仍使用语言模型损失,没有新增辅助目标。对单次聚合,令
该式说明来源同时通过 value 路径和打分路径接收更深层梯度;softmax 也可能让部分来源权重接近零,现有材料没有任何来源梯度的下界。
所有
这是本地推导。理想尺度不变的 RMSNorm 满足
Full 版本的历史状态为
8. Block AttnRes:连续块压缩与粒度边界
Block AttnRes 把
这些来源复用 Full 版本的 RMSNorm、静态查询和 softmax。当前子层输出加入
块内输出合并后共享同一个跨块 key、value 和权重,因此已完成块内的逐层可选信息无法恢复。块内仍有长度最多为
按伪代码逐层计算,每块仍有
因此历史状态为
两个极端进一步限定方法族。
9. 训练系统:跨流水线阶段缓存新增块
设交错流水线有
缓存路径让同一物理阶段保留此前虚拟阶段已收到的块,后续虚拟阶段只传递接收方尚未缓存的新增块。论文给出的通信量模型为:
这些公式只计算 AttnRes 历史块,不包含标准流水线必须传递的当前激活。缓存把单次转移的历史峰值从
反向传播复用相同缓存关系,注意力中间量通过激活重计算处理。该路径要求缓存生命周期与微批次严格对齐,并要求同一物理阶段可跨虚拟阶段保留状态。块边界与物理阶段不对齐时,
10. 推理系统:静态查询、两阶段计算和长上下文分片
静态伪查询使同一块内的
- Phase 1 对块内全部查询批量计算嵌入与已完成块的 attention,返回未归一化输出、最大 logit 和 softmax 归一化统计量。
- Phase 2 顺序执行块内子层;首层直接使用 Phase 1 结果,后续层计算当前部分和的单来源贡献,再用在线 softmax 精确合并。
为说明精确合并所需统计量,对一个来源分区定义最大值、移位指数和与未归一化 value 和:
两个互斥且完备的来源分区可以在共同最大值
该式与一次性对全部来源执行 softmax 等价,浮点运算次序仍可能产生数值差异。正文把
论文的解析 I/O 模型排除子层
| 方法 | 每层解析 I/O | 典型值 |
|---|---|---|
| 标准残差 | ||
| mHC | ||
| Full AttnRes,两阶段调度 | ||
| Block AttnRes,两阶段调度 |
Full 的两阶段调度降低 HBM 重复读取,仍保留
长上下文预填充时,Block 历史缓存形状为
论文报告 128K 上下文、8 个块时总缓存约 15 GB,序列分片后约 1.9 GB/设备,结合 16K chunked prefill 后低于 0.3 GB/设备。材料没有披露隐藏维度、数据类型、实际张量并行度、通信拓扑或临时张量口径;这些数字只覆盖块表示缓存,不代表完整推理峰值显存。
11. 深度混合矩阵解释及其边界
- 假设:不同残差方法都可以在固定 token 上写成沿深度轴的线性或输入相关混合,并以历史来源数量、混合矩阵结构和权重依赖性比较。
- 适用域:该表示比较前向聚合结构;它不自动建立不同方法函数类的包含关系、优化稳定性或训练后矩阵的实际秩。
论文用深度混合矩阵统一残差族。标准残差对应下三角单位权重,Highway 类方法对应递归受限的低半可分结构,mHC 使用多状态矩阵混合,Full AttnRes 形成输入相关的稠密下三角标量矩阵,Block AttnRes 让同一已完成块内的来源共享权重。
这一表示说明不同方法在历史粒度、权重依赖性和状态数量上的差异。论文进一步把标准残差类比为深度方向的线性 attention,把 AttnRes 类比为 softmax attention。该类比属于结构解释,无法推出 AttnRes 严格包含 HC/mHC 的函数类:AttnRes 使用通道共享、正且和为 1 的 scalar 权重,HC/mHC 可以保留多路状态并执行矩阵值变换。
在论文的下三角索引下,Full 的有限 softmax 权重在对角线上为正,因此深度混合矩阵
12. 结论链条
- **假设:**累计残差状态压缩了历史来源,逐 token 的显式跨层权重能提供有效自由度。
- **机制:**Full AttnRes 用静态目标层查询和 token 相关来源键计算 softmax;Block AttnRes 将连续层压缩为块和,并用系统调度复用历史读取。
- **直接证据:**五个 194M–528M 激活参数设置中 Full 与 Block 的单次报告验证损失均低于标准残差;436M 设置中输入无关混合、sigmoid 和移除 RMSNorm 的消融值均高于 Full;48B/3B Block 对照在 1T 预训练曲线和下游点估计上占优。
- **最窄结论:**在论文所用 Kimi Linear MoE 与训练配方内,显式跨层 softmax 及其约八块压缩版本改善了报告的验证损失;静态查询支持作者给出的训练与推理调度。
- **边界:**随机方差、数据与评测协议、系统环境和跨架构结果均未披露;大规模实验没有 Full 或强跨层聚合基线,PreNorm 稀释的因果中介尚未识别,缩放指数也没有显示可靠的渐近差异。
关键实验/定理
结果 1:五个 Kimi Linear MoE 规模上的验证损失
- 设置:五个 Kimi Linear MoE 配置,激活参数量排除 embedding;上下文长度 8192,cosine 学习率;同一规模内沿用为基线选择的共享超参数。注意力和 MLP 各计一层,因此表中的 Transformer block 数为残差子层数的一半。
- Baseline:标准 PreNorm、mHC-lite、Full AttnRes、Block AttnRes;mHC-lite 的完整配置和是否同等调优未披露。
- 指标:验证交叉熵损失;验证集组成、评测 token 数和聚合方式未披露。
- 对照是否可比:同一规模内模型宽度、深度、训练 token、学习率和 batch 值一致;参数增量、实际 FLOPs 计算与随机种子未完整披露。
| 激活参数 | 训练 token | Transformer blocks | 计算量(PFLOP/s-day) | Base | Block | Full | mHC-lite |
|---|---|---|---|---|---|---|---|
| 194M | 38.7B | 12 | 0.6916 | 1.931 | 1.909 | 1.899 | 1.906 |
| 241M | 45.4B | 13 | 1.0405 | 1.895 | 1.875 | 1.874 | 1.869 |
| 296M | 62.1B | 14 | 1.6937 | 1.829 | 1.809 | 1.804 | 1.807 |
| 436M | 87.9B | 16 | 3.3528 | 1.766 | 1.746 | 1.737 | 1.747 |
| 528M | 119B | 17 | 5.5974 | 1.719 | 1.693 | 1.692 | 1.694 |
- 结果:Full 与 Block 在五个点均低于 Base。Full 按点估计优于 mHC-lite 4/5,Block 优于 mHC-lite 2/5;241M 时 mHC-lite 的 1.869 低于 Full 的 1.874。
- 拟合:Base 为
,Full 为 ,Block 为 。三个指数均约为 ,主要证据是观测区间内的曲线常数偏移。 - 证据定位:Section 5.1,Figure 4,Table 2。
- 支持的最窄结论:当前五个规模和单次报告点估计支持 Full 与 Block 的一致损失改善。
- 解读:论文的
算力优势来自拟合曲线的水平等效。Block 在最大实测点的拟合损失约需基线 7.1 PFLOP/s-day,超过最大观测算力约 27%;该数字不属于直接训练的 25% 更多算力基线,也不支持更优渐近缩放指数。
结果 2:48B 总参数、3B 激活参数的 Block 对照
- 设置:27 个 Transformer blocks,即 54 个注意力/MLP 子层;256 个路由专家,每 token 激活 8 个路由专家与 1 个共享专家;Block 大小为 6 个子层,对应 9 个块,加嵌入共 10 个来源。上下文 4096,Muon,WSD 学习率,batch 8M tokens。
- Baseline:相同 Kimi Linear 骨干的标准 PreNorm;大规模设置没有 Full 或其它跨层聚合对照。
- 指标:1T 预训练阶段验证损失,随后约 400B 高质量中期训练后的十五项下游点估计。报告还提到渐进扩展到 32K 上下文,但没有单独披露扩展 token 与长上下文评测。
- 对照是否可比:两组报告采用相同训练配方;是否使用逐步相同的数据批次未披露,随机种子、重复运行、checkpoint 选择及评测协议也未披露。
- 结果:1T 训练曲线末端的报告值为 Base 1.1734、Block 1.1551,差值 0.0183。下游表有十四项提高,MMLU-Pro 持平。
| 任务 | Base | Block AttnRes | 差值 |
|---|---|---|---|
| MMLU | 73.5 | 74.6 | +1.1 |
| MMLU-Pro | 52.2 | 52.2 | 0.0 |
| GPQA-Diamond | 36.9 | 44.4 | +7.5 |
| BBH | 76.3 | 78.0 | +1.7 |
| ARC-Challenge | 64.6 | 65.7 | +1.1 |
| HellaSwag | 83.2 | 83.4 | +0.2 |
| TriviaQA | 69.9 | 71.8 | +1.9 |
| GSM8K | 81.7 | 82.4 | +0.7 |
| MGSM | 64.9 | 66.1 | +1.2 |
| MATH | 53.5 | 57.1 | +3.6 |
| CMath | 84.7 | 85.1 | +0.4 |
| HumanEval | 59.1 | 62.2 | +3.1 |
| MBPP | 72.0 | 73.9 | +1.9 |
| CMMLU | 82.0 | 82.9 | +0.9 |
| C-Eval | 79.6 | 82.5 | +2.9 |
- 证据定位:Section 5.2,Figure 5(a),Table 3。
- 支持的最窄结论:一次大规模配对训练中,Block 的损失和全部不降的下游点估计与小规模趋势一致。
- 解读:任务指标定义、shot、prompt、解码参数、样本版本和统计区间均未披露;正文称“MMLU-Pro Hard”,表格写“MMLU-Pro”,名称也不一致。当前证据不能判断差值的统计显著性或归因于哪一机制。
结果 3:输出与梯度幅度支持机制一致性
- 设置:结果 2 的 48B/3B 模型,图中只覆盖 1T 预训练阶段。
- 指标:各 Transformer block 的输出幅度与梯度幅度;幅度对象、范数定义、批次、聚合方式和 checkpoint 未披露。
- 对照是否可比:Base 与 Block 来自结果 2 的同配方配对训练;图中统计口径未定义,也没有重复运行,跨配置幅度只适合描述性比较。
- 结果:Base 输出幅度从约 0.04 增至 12.15;Block AttnRes 在约 0.07–1.91 范围形成随块重置的周期形态。Base 梯度幅度从约
降到 ,Block 从约 变到 ,分布较平缓。

figures/dynamic.tex,本地无内容改动重编译;CC BY-NC-ND 4.0。- 证据定位:Section 5.2,Figure 5(b–c)。
- 支持的最窄结论:Block 结构与较低、周期性输出幅度及较平缓的报告梯度幅度同时出现。
- 解读:Block 每六个子层把累计和改成跨块 softmax,周期性重置部分由结构直接产生。实验同时改变跨层可访问性、混合归一化、残差尺度和梯度拓扑,也未测量隐藏状态范数、相对更新或有效深度;当前结果尚未识别 PreNorm 稀释是质量改善的因果中介。
结果 4:组件消融区分静态混合、内容相关性与系统折中
- 设置:436M 激活参数、87.9B tokens、16 个 Transformer blocks,即 32 个残差子层。正文称该配置为 16-head model;Table 4 与 Figure 6 图注均称 16-layer model,与方法将注意力和 MLP 分别计层的口径不一致。
- Baseline:Base 1.766;DenseFormer 1.767;mHC 1.747;Full 1.737。
- 指标:验证损失,单次报告值。
- 对照是否可比:正文称使用相同训练设置;没有随机种子和误差线。
| 变体 | 验证损失 | 相对 Full 的功能变化 |
|---|---|---|
| Full AttnRes | 1.737 | 默认静态查询、输入相关来源键、softmax、RMSNorm |
| 输入相关查询 | 1.731 | 当前状态经 |
| 输入无关混合 | 1.749 | 移除 token 相关来源打分 |
| sigmoid 权重 | 1.741 | 移除来源间 softmax 竞争与和为 1 约束 |
| 无 key RMSNorm | 1.743 | 来源幅度直接进入打分 |
| 滑动窗口最近 8 层加嵌入 | 1.764 | 限制可访问历史范围 |
| Block, |
1.746 | 同块输出合并为块和 |
| Block,多头 |
1.752 | 增加深度注意力头 |
| Block,无 key RMSNorm | 1.750 | 来源幅度直接进入块级打分 |
- 证据定位:Section 5.3,Table 4。
- 支持的最窄结论:输入无关混合、sigmoid 和移除 RMSNorm 的单次点估计均高于默认 Full;当前状态生成查询进一步降低损失,但增加投影并移除两阶段批处理的关键前提。
- 解读:输入无关混合的 1.749 已低于 Base 的 1.766,Full 又比该变体低 0.012。这个单次点估计差值同时改变内容依赖性与参数化,不能解释为内容相关机制的独立贡献。作者称零查询初始化对避免训练不稳定很重要,材料没有给出非零初始化对照或波动数值。
结果 5:块大小与固定算力架构形状
- 设置:与 436M 消融相同的 32 个残差子层;块大小扫过
。另在约 FLOPs、约 激活参数下组合五个宽深比与五个注意力头深度比,共 25 个架构点。 - 指标:验证损失。
- 对照是否可比:块大小扫描沿用同一 436M 设置;固定算力网格对齐报告 FLOPs 与激活参数。确切模型配置、训练 token、共享超参数和随机种子未披露。
- 结果:块大小曲线为 Full
的 1.737、 的 1.746、 的 1.746、 的 1.748、 的 1.753、 的 1.757,Base 为 1.766。25 个固定算力架构点中 AttnRes 均降低 0.019–0.063;Base 最优点损失 1.847,AttnRes 最优点 1.802,最优形状向更深、更窄移动。 - 证据定位:Section 5.3,Figure 6;Section 5.4,Figure 7。
- 支持的最窄结论:当前 32 子层设置存在清晰的来源粒度—损失折中;当前固定算力网格中的改善不依赖单一深宽配置。
- 解读:
点仍保留嵌入与当前块部分和的二源 softmax,不能当作严格基线。架构网格未披露确切配置、token 数、超参数、AttnRes 版本、随机种子或推理延迟;“更深最优”也增加部署序列延迟。
结果 6:系统开销和缓存成本属于内部测量与解析模型
- 系统条件:论文未披露硬件型号、互连拓扑、并行度、batch、序列长度、精度、软件版本、内核基线或重复次数。
- 指标定义:训练端到端开销低于 4%,推理延迟开销低于 2%;典型每层 I/O 与长上下文缓存数字来自解析模型。
- 成本归因:训练缓存减少 AttnRes 历史块的重复传输;两阶段推理减少历史 K/V 的 HBM 重复读取;这些数字不包含基础子层、完整 KV cache 和所有临时缓冲。
- 对照是否可比:百分比以作者内部标准残差执行路径为基线,报告没有提供可复算的 workload 与测量窗口;解析 I/O 表在统一符号口径下比较历史聚合部分,未对齐完整模型端到端工作量。
- 证据定位:Section 4,Figure 3,Algorithm 1,Table 1,Appendix B。
- 支持的最窄结论:论文给出一条与静态查询和块表示相容的实现路径,并在未披露的内部环境中报告较小相对开销。
- 解读:缺少系统环境使端到端百分比无法独立复验或跨硬件外推。官方仓库没有训练代码、内核、配置或 checkpoint;FLA 后续实现只覆盖算子层。
证据链强度评估
强证据
- Full 与 Block 的公式、伪代码、历史来源粒度和零初始化条件能够从正文与 TeX 源码直接核对。
- 五个规模的 Base、Full 与 Block 单次点估计方向一致,48B 对照的训练曲线方向也一致。
- 436M 消融直接显示输入相关来源键、归一化方式和 query 依赖性的质量—系统折中。
中等强度证据
- 约八个块保留主要质量改善的结论在 32 子层扫参与五个缩放点中成立,尚未覆盖数百层或其它架构。
- 48B 下游表的十四升一平支持整体能力点估计不降,评测协议与统计区间缺失降低了确认程度。
- 训练缓存与两阶段推理的算法路径可复算,端到端百分比缺少测量条件。
需要谨慎的推论
- PreNorm 稀释解释与输出及梯度幅度现象一致,现有干预没有识别因果中介。
- 三条幂律指数接近,当前数据支持有限观测区间内的曲线偏移,无法支持更优渐近指数。
- 深度混合矩阵和序列 attention 的对偶属于结构类比,无法直接推出严格表达能力包含关系。
- DeepCrossAttention 和 MUDDFormer 已覆盖动态跨层聚合,AttnRes 的原创性集中于具体参数化、块压缩和系统共设计。
局限
- 所有主要实验均未报告随机种子、重复运行、方差、置信区间或显著性检验。
- 验证语料、损失聚合口径、评测 token 数、数据切分和污染检查均未披露。
- 下游任务缺少数据版本、metric、shot、prompt、解码参数和 checkpoint 选择;MMLU-Pro 名称还在正文与表格间不一致。
- 缩放律只有五个点,FLOPs 计算、硬件与拟合不确定性未披露;
等效算力使用超出实测区间的基线外推。 - 大规模实验只有 Block 与标准 PreNorm 对照,没有 Full、mHC、DeepCrossAttention、MUDDFormer 或幅度匹配归一化基线。
- Figure 5 测量的是子层输出幅度与未定义口径的梯度幅度,没有直接测量隐藏状态范数、相对更新、层可剪性或有效深度。
- softmax 同时改变历史可访问性、混合尺度和梯度路径;静态混合已解释部分损失差,PreNorm 稀释的因果归因仍待验证。
- 论文从残差展开式直接提出
隐藏状态增长,缺少增量相关性条件;一般情况下只能得到 上界。 - Block 的逐层算术量在方法节写为
,与伪代码和相关工作节的 不一致; 恢复标准残差的表述也缺少均匀权重条件。 - 两阶段算法把
同时描述为 log-sum-exp 和可直接作为除数的指数和,符号定义不一致;最终输出前的附加聚合接口也未完整形式化。 - 训练开销、推理延迟和长上下文缓存缺少硬件、并行、精度与 workload;缓存数字不覆盖完整推理峰值显存。
- 官方仓库没有可运行的大规模训练代码、系统实现、配置或 checkpoint;FLA 的后续算子实现不足以复验 48B 训练和端到端系统数字。
- 所有质量实验属于同一 Kimi Linear 文本 MoE 架构族;Dense Transformer、编码器、视觉、多模态、后训练、量化和不同并行策略尚未验证。
- 48B 报告提到 32K 上下文扩展,缺少长上下文质量评测;当前数据无法判断跨层压缩与长序列任务的交互。
- AttnRes 没有引用最接近的 DeepCrossAttention 先行工作,相关工作边界与“深度 attention”原创性表述需要外部校正。
跨论文关系
- 与已有论文的作者或机构关系:Kimi Team、Yulun Du、Weiran He、Weixiao Huang 和 Xinran Xu 把本报告与 Kimi K3 的模型—系统研究线连接起来。Kimi K3 随后把 Block AttnRes 扩展到 93 层、12 层一块的更大模型;K3 规模仍缺少组件级 Full/Block/基线消融,本报告的 48B 证据没有解除该边界。
- 与已有论文的主题关系:DeepSeek-V4 使用 mHC 维持多路残差状态;AttnRes 显式读取早期层或块表示。论文认为两者可组合,当前没有联合实验。
- 与已有论文的方法关系:DeepCrossAttention 已使用学习查询对先前层输出做输入相关打分,是 Full AttnRes 最接近且正文遗漏的先行工作;MUDDFormer 用当前状态生成四路动态稠密连接。AttnRes 的区别集中在 RMSNorm 后来源与静态目标层查询的 softmax、连续块压缩,以及流水线训练和推理 I/O 调度。
- 与其它归档材料的边界:Engram 使用 mHC 骨干,与 AttnRes 只有“多路残差方案可组合”的二阶关系;IndexCache 复用稀疏注意力的 top-k token positions,AttnRes 聚合跨层表示,两者没有直接方法复用关系。
主要启发
1. 将内容依赖与调度依赖分离,可以保留跨层选择并减少历史状态的重复读取
当前状态生成查询的消融把验证损失从 1.737 降到 1.731,但需要等待当前隐藏状态并增加
抽象关系是:当历史状态数量较少、消费者身份预先确定、消费者当前状态对检索目标的额外信息有限时,把内容依赖放在生产者状态、把消费者查询设为静态参数,应当减少重复内存读取,并保留大部分输入相关质量收益。迁移到其它历史状态聚合系统时,可以比较静态消费者查询与当前状态查询的质量差、HBM 读取和序列延迟;若任务需要依据当前消费者状态大幅改变检索目标,动态查询的质量优势应随任务条件扩大,这一预测可以否定迁移成立。
该启发来自 436M 单点消融与未披露环境中的系统百分比,跨硬件和跨架构验证仍待完成。DeepCrossAttention 已覆盖静态查询与动态来源打分,AttnRes 提供的新增证据主要在块压缩及系统调度共同实现的大规模路径。