阅读笔记
SMELT: Scaling Laws for Compute Matched MoE Looped Transformers
SMELT 在近似匹配每 token FLOPs、非嵌入参数量和 KV cache 的 MoE 对照中,将中间一半层重复执行两次,并通过缩窄隐藏维度、增加专家数和调整注意力头配置补偿三项预算;四个规模、三个稀疏度的独立缩放面拟合估计,在拟合覆盖的十的二十次方至十的二十一次方 FLOPs 区间达到相同验证损失可节省 6.8% 至 18.0% 训练计算,但该结论基于专有数据与训练栈,尚未验证实际时延,第二次执行减弱注意力汇聚点的观测也未建立因果解释。
所读版本 v1, submitted 2026 09 01
Source
- Workflow version: v2.1
- Material type: research-paper
- Analysis modules: experiment, system
- Canonical source: https://arxiv.org/abs/2609.01343v1
- Title: SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
- Authors: Shaowen Wang, Ge Zhang, Kairong Luo, Yuhao Wu, Shaofan Liu, Jiaheng Liu, Wenhao Huang, Shen Yan, Jian Li
- Responsible organization: Tsinghua University, ByteDance Seed, M-A-P, TokenWave.AI
- arXiv: https://arxiv.org/abs/2609.01343v1
- HTML: https://arxiv.org/html/2609.01343v1
- PDF: https://arxiv.org/pdf/2609.01343v1
- TeX source: https://arxiv.org/src/2609.01343v1
- Submitted: 2026-09-01
- Published / updated: arXiv v1, 2026-09-01
- Current version read: arXiv v1
- Version / revision read: v1, submitted 2026-09-01
- Accessed: 2026-09-04
- Key figure decision: omit
- Key figure rationale: Figure 1 将架构、缩放前沿和下游结果并列展示;方法总览表、预算误差和关键数值已经覆盖原图承载的信息。
- Review status: page-type=not-found; match-confidence=high; observed-at=2026-09-04; venue-status=unknown
- Subjects: Machine Learning (cs.LG)
论文首页只列出四家机构,没有给出作者与机构的逐人映射。作者贡献部分将 Shaowen Wang 和 Ge Zhang 列为核心贡献者,将 Shaowen Wang、Ge Zhang、Shen Yan 和 Jian Li 列为通讯作者。本文按论文明确披露的作者顺序、贡献角色和机构集合记录,不补充未经核验的个人机构归属。
作者与关系
- Shaowen Wang:核心贡献者、通讯作者;论文列出的机构集合为清华大学、ByteDance Seed、M-A-P 和 TokenWave.AI,未披露逐人映射。
- Ge Zhang:核心贡献者、通讯作者;本地既有档案记录 M-A-P 与 ByteDance Seed,本文未披露逐人机构映射。
- Kairong Luo:贡献者;论文列出的机构集合为清华大学、ByteDance Seed、M-A-P 和 TokenWave.AI,未披露逐人映射。
- Yuhao Wu:贡献者;论文列出的机构集合为清华大学、ByteDance Seed、M-A-P 和 TokenWave.AI,未披露逐人映射。
- Shaofan Liu:贡献者;论文列出的机构集合为清华大学、ByteDance Seed、M-A-P 和 TokenWave.AI,未披露逐人映射。
- Jiaheng Liu:贡献者;本地存在同名作者记录,本文缺少足以确认身份的逐人机构信息,因此不建立链接。
- Wenhao Huang:贡献者;论文列出的机构集合为清华大学、ByteDance Seed、M-A-P 和 TokenWave.AI,未披露逐人映射。
- Shen Yan:贡献者、通讯作者;本地既有档案记录 ByteDance Seed,本文未披露逐人机构映射。
- Jian Li:贡献者、通讯作者;论文列出的机构集合为清华大学、ByteDance Seed、M-A-P 和 TokenWave.AI,未披露逐人映射。
archive-core 只复用 Ge Zhang 和 Shen Yan 的已有 profile,没有新建或扩充作者档案。
论文脉络
1. 研究问题、背景和价值
循环 Transformer(Looped Transformer)通过多次执行同一组物理层提高有效深度。已有比较经常保持参数量不变,同时让循环模型执行更多层,因此额外 FLOPs 和 KV cache 会与结构收益混合。另一类工作保持执行深度或 FLOPs,却减少循环模型的独立参数量。SMELT 试图回答更窄的问题:当训练与推理计算、存储容量和可服务上下文的主要预算都近似相同时,跨深度共享权重是否仍能改善语言模型。
这项问题对稀疏 MoE 有直接意义。MoE 将总参数量和每 token 激活计算解耦,使循环模型可以先缩窄隐藏维度支付额外层执行的计算,再增加专家总数补回存储容量;注意力头维度和 GQA 比例则用于单独校准 KV cache。由此可以把循环结构从额外资源投入中分离出来,并用缩放律估计这种结构差异随计算预算变化的趋势。
2. 已有解决方案与不足
Huginn、Ouro 和多项局部循环工作表明,共享中间层能够提高参数效率或推理任务表现,但它们通常让循环次数同时增加 FLOPs 与 KV cache。Schwethelm 等人的密集模型研究固定有效深度与 FLOPs,得到重复执行次数只按次线性比例贡献等效独立参数的结果;该设置同时减少循环模型的独立参数量。LoopMoE 已在 3B 和 9B 规模匹配参数与 FLOPs,仍没有匹配 KV cache,也没有建立跨规模缩放面。
SMELT 的区别性工作是同时处理三项预算,并让基线与循环模型分别拟合缩放面。这里的“匹配”保留离散硬件友好配置造成的残余误差:用于缩放拟合的 12 个稀疏网格中,FLOPs、总参数和 KV cache 的最大绝对偏差分别为 3.9%、1.0% 和 3.6%。缩放分析使用每个运行的实测 FLOPs,因此没有把这些配置直接视为严格相等。
3. 作者可能的思考路径
以下为本地重构。第一步把循环模型的比较问题拆成三个可观测预算:每 token FLOPs 对应算术训练与推理成本,非嵌入参数量对应可存储容量,KV cache 对应给定显存下的可服务上下文。第二步利用 MoE 的稀疏激活性质,寻找能分别补偿三项预算的结构变量:隐藏维度控制额外循环的主要计算,专家总数恢复缩窄后损失的参数量,注意力头维度与 GQA 比例控制 KV cache。
预算匹配形成后,作者先在按 Baseline 激活参数量命名的 200M 档位依次选择循环位置、有效深宽比和循环次数。三项消融固定为“中间 50% 层执行两次、物理深度保持与基线相同”,再扩展到四个规模和四个稀疏度。最后用独立缩放面回答计算效率,用下游残差分析判断收益是否只来自验证损失下降,并用路由、残差流和注意力探针描述第二次执行的内部变化。
4. 核心假设或切入点
方法依赖以下条件:MoE 专家数可以在较小计算变化下恢复缩窄隐藏维度造成的总参数损失;三个预算足以覆盖循环结构的主要资源差异;内部专有基线已在深宽比等方面得到合理调优;相同数据、优化器和 token 序列使成对比较主要反映结构变化;所选幂律在观测计算区间内可以描述两种架构的损失变化。
这些条件仍留下三个边界。算术 FLOPs 不包含硬件利用率、串行循环执行和稀疏路由通信形成的实际时延;不同专家数可能改变知识容量、路由多样性和优化行为,因此“结构效果”实际包含循环与其预算补偿配方的联合效果;缩放面来自四个模型规模、三个稀疏度和相关的 WSD 分支终点,计算区间外的预测需要新的训练点校准。
5. 贡献全景与方法总览
首要贡献是一个可比较的稀疏 MoE 循环架构配方:SMELT 保留与 Baseline 相同的物理深度,把中间 50% 的层连续执行两次,使有效深度增加 50%;循环区间内的每个残差更新乘以二分之一。为支付额外执行成本,SMELT 缩窄隐藏维度;为恢复非嵌入参数量,它增加每层专家总数并维持每 token 选择 8 个专家;为恢复 KV cache,它调整注意力头维度与 GQA 比例。
辅助贡献包括三项 Baseline 200M 档位的设计消融、四规模四稀疏度的训练网格、两种架构各自的 Chinchilla 风格缩放面、控制验证损失后的下游残差分析,以及覆盖专家路由、残差更新和注意力汇聚点的内部探针。Baseline 与 SMELT 是两个独立训练的模型族;“第一次执行”和“第二次执行”只指 SMELT 中同一物理中间层在一次前向传播中的两次调用,参数共享但输入残差状态不同。
端到端执行与论证链如下:
| 阶段 | 输入或初始条件 | 核心操作与传递对象 | 输出与作用 |
|---|---|---|---|
| 1. 三预算匹配 | 已调优的稀疏 MoE Baseline、循环范围和次数 | 缩窄隐藏维度,增加专家总数,调整注意力头与 GQA;把相同物理层的更新后残差传入第二次执行 | 得到 FLOPs、参数量与 KV cache 近似匹配的候选循环模型 |
| 2. 配方选择 | Baseline 200M 档位、两个稀疏度与相同训练协议 | 依次比较循环跨度、物理/有效深度和循环次数 | 固定中间 50% 层执行两次、物理深度与 Baseline 相同的 SMELT 配方 |
| 3. 缩放训练 | 四个规模、四个稀疏度、相同 token 序列与 WSD 日程 | 每个网格训练一对模型,并从六个稳定阶段检查点分支余弦衰减 | 得到 96 对终点评估和用于稀疏缩放面的 144 个终点 |
| 4. 独立缩放面 | 稀疏网格中的实测每 token FLOPs、token 数和验证损失 | 分别拟合 Baseline 与 SMELT 的容量项、稀疏项和数据项,在共同损失处反解计算量 | 输出计算最优前沿和相同损失下的训练计算节省比例 |
| 5. 外部与内部检查 | 下游任务、39 个验证来源、长度桶和 100 万 token 探针样本 | 控制验证损失后计算下游残差,并比较两次执行的专家集合、残差写入和注意力分布 | 确定收益分布及第二次执行的描述性内部特征 |
只读本节可以复述完整链条:从近似预算匹配开始,经 200M 消融固定配方,再通过跨规模训练和独立缩放面得到计算效率结论,最后由下游与内部探针限制解释范围。最终输出包括 SMELT 架构、验证损失计算前沿、下游差异和描述性机制证据;论文不提供可复现训练栈或因果机制结论。
6. 三预算匹配与循环配方选择
给定物理深度
论文用计算等效稀疏度统一标记不同配置。它先取同规模、全部专家均激活的 Baseline 作为参照,记该模型每 token FLOPs 和非嵌入参数量为
按 Baseline 激活参数量命名的 200M、约 95% 稀疏度档位展示了具体传递关系。Baseline 采用 12 层、隐藏维度 1280、每层 192 个专家;SMELT 仍保留 12 个物理层,重复中间 6 层,隐藏维度缩至 1056,专家数增至 288。结果从 Baseline 的 1.33 十亿 FLOPs/token 和 38.7 亿参数,变为 SMELT 的 1.37 十亿 FLOPs/token 和 38.9 亿参数;对应偏差为 2.9% 与 0.4%,KV cache 偏差在 4% 内。
配方来自三个顺序消融。循环跨度实验在约 85% 和 95% 稀疏度都以验证损失选出约 50% 的中间层;95% 设置的 DCLM Core 最优点位于 67%,说明下游准确率与选择指标并不完全一致。深宽比实验表明 Baseline 的验证损失在 12 个物理层最低,而循环模型在 12 个物理层、18 个有效层最低。循环次数实验中,两次执行的验证损失为 1.9257,三次与四次分别为 1.9385 和 1.9360;更多执行次数需要进一步缩窄模型,未继续改善结果。直接证据位于 Section 3、Tables 2–5 和 Appendix A。成立边界是三项选择消融都集中在 Baseline 200M 档位,每个配置只训练一次。
7. 独立缩放面与计算效率
缩放阶段把四个规模与四个稀疏度交叉组成 16 个网格,每格训练一对 Baseline 与 SMELT。稳定阶段训练 2050 亿 token,从 1 万、2 万、5 万、10 万、15 万和 196075 步分别分支 100 亿 token 的余弦衰减,最长分支约 2150 亿 token。每个网格产生六个训练时长终点,全部网格合计 96 对终点评估;缩放律排除
为同时表达模型计算、稀疏度和数据量,论文分别为两种架构拟合以下损失面:
给定总训练计算
正值表示 SMELT 用较少训练计算达到同一拟合验证损失。拟合覆盖的计算区间为
这组结果的直接证据位于 Section 4、Tables 6–8 和 Figures 2–4。SMELT 拟合 RMSE 为 0.00952 nats,高于 Baseline 的 0.00554;SMELT 的拟合不可约损失还高出 0.005 nats,该差异小于两者拟合误差,不能据此判断远端渐近下限。两种架构的计算最优 token/等效激活参数分配区间高度重叠,论文支持的主要结论是同一分配附近的损失前沿差异。
8. 下游增益的分布
作者先检查所有 96 个匹配终点:SMELT 在 DCLM Completion 上胜出 96 次,在 DCLM Core 上胜出 83 次;MMLU 只统计 Baseline 至少高于随机水平 10 个百分点的 30 对,其中胜出 29 次。随后用 96 个 Baseline 终点拟合“验证损失到下游分数”的单调 sigmoid,并计算 SMELT 相对该曲线的残差。三个指标在四个规模上的平均残差均为正,说明已报告的下游差异超过 Baseline 曲线对验证损失改进的预测。
按验证来源拟合共享指数、独立截距的缩放面后,在
长度对照进一步把 SMELT 与“增加 Baseline 参数量”和“增加 Baseline 专家数”区分开。SMELT 在四个最长文档桶上的归一化损失增益是四个最短桶的 1.52 倍,两种 Baseline 内部对照的比例为 0.98 和 0.88。16 个少样本任务的平均准确率差从零样本的 0.9 个百分点增加到提供一个示例后的 1.9 个百分点,并维持到 8 个示例。直接证据位于 Section 5、Figures 5–11 和 Appendices C/E;该证据来自相同内部预训练语料与特定任务集合,领域结构、样本长度和可检索示例之间仍可能相关。
9. 第二次执行的内部观测
内部分析在 100 万 token 的留出样本上比较同一物理层的两次执行。随着稀疏度增大,同一 token 两次选择的 Top-8 专家交集从接近 8 降至 2–3,但仍高于独立随机路由。全部 16 个规模—稀疏度网格中,第二次执行的完整残差更新、注意力写入、MoE 写入和下一个子层的 RMSNorm 输出范数均为第一次的 1.2–3.5 倍。1.6B 模型中,同一物理层跨执行残差更新的余弦相似度均值为 0.56,非对应跨执行层对的均值为 0.16,说明第二次更新方向与第一次具有更强一致性。
注意力分解用于区分检索位置和所取内容。两次执行的 Q、K 余弦相似度为 0.89–0.93,V 为 0.65–0.74;Top-8 被关注 token 的交集为 56%–66%,同层不同注意力头的对照为 28%–34%。这些结果表明检索坐标和关注位置大体保留,值表示与最终写入发生更大变化。
Dyck 个案提供可定位的注意力变化。1.6B、约 85% 稀疏度、4-shot 的被选注意力头中,三个目标位置对 BOS 的平均注意力从 0.60 降至 0.02,对示例答案 token 的注意力从 0.24 升至 0.85。全留出样本和四个规模也观察到第二次执行减少分配给文档起始 token 的注意力权重,而普通 Baseline 的该权重通常随深度增加。直接证据位于 Section 6、Figures 12–19 和 Appendix D。这里将原文的 attention sink 写为“注意力汇聚点”。
这些探针形成“保留主要检索位置、改变值表示、增加同向残差写入并降低注意力汇聚点”的描述性组合。论文没有对注意力汇聚点、V 变化或残差更新实施因果干预,因而只能把它们视为与长样本和上下文学习增益一致的机制候选。具体收益由其中哪一项产生,原因未查明。
10. 结论链条
论文从三个条件出发:MoE 可以用专家数补偿缩窄宽度造成的参数损失,注意力头配置可以独立校准 KV cache,且相同数据与优化协议使成对比较具有可解释性。在这些条件下,中间半数层重复执行两次提供更多串行计算;缩窄隐藏维度、增加专家数和调整头配置把额外执行纳入近似相同的三项预算。
200M 消融选定配方,完整网格的每个规模—稀疏度单元都得到更低验证损失;独立缩放面再把观测差异转换为拟合区间内 6.8% 至 18.0% 的同损失计算节省。下游残差、长度和少样本分析显示收益分布与普通增加参数或专家的模式不同。内部探针给出第二次执行的共同特征,但尚未确定其因果贡献。
最窄结论是:在作者的专有 MoE 家族、相同训练语料、四个规模和近似三预算匹配设置中,中间层两次执行的联合配方改善了拟合区间内的验证损失计算前沿,并在已测下游任务上获得一致性较强的增益。该结论不覆盖严格相同实际时延、密集 Transformer、其它循环位置或次数、公开训练栈复现以及观测区间外的缩放行为。
关键实验/定理
结果 1:200M 消融固定中间半层执行两次
- 设置:按 Baseline 激活参数量命名的 200M 档位;循环跨度在约 85% 与 95% 稀疏度比较,深宽比和循环次数在约 85% 稀疏度比较;每个配置训练一次。
- Baseline:相同物理深度的未循环 MoE,以及在三项预算下重新匹配宽度、专家数和注意力头配置的其它循环候选。
- 指标:验证损失、DCLM Core、DCLM Completion。
- 结果:中间 50% 层执行两次在约 85% 稀疏度的验证损失为 1.9257,Baseline 为 1.9445,三次和四次执行分别为 1.9385 和 1.9360;约 95% 稀疏度的最低验证损失位于 50% 跨度,DCLM Core 最优点位于 67% 跨度。
- 对照是否可比:各候选共享训练协议并重新匹配三项预算;离散配置仍有小幅资源偏差,且选择依据来自单次训练的验证损失。
- 证据定位:Sections 3.3–3.5, Tables 3–5, https://arxiv.org/html/2609.01343v1
- 支持的最窄结论:Baseline 200M 档位的已测候选中,中间约一半层执行两次取得最低验证损失;下游指标没有在全部消融中选择同一跨度。
- 解读:这一步确定后续缩放使用的固定配方,没有证明更大模型仍以相同跨度和次数为最优。
结果 2:稀疏网格缩放面给出拟合区间内的训练计算节省
- 设置:按 Baseline 激活参数量命名的 100M、200M、600M 和 1.6B 四个档位;约 85%、95% 和 97% 三个稀疏度;每格一对稳定阶段训练与六个余弦衰减分支,共 144 个稀疏终点;拟合窗口为
至 训练 FLOPs。 - Baseline:在相同数据、token 序列、优化器和训练日程下独立训练的未循环 MoE;Baseline 与 SMELT 分别拟合六参数损失面。
- 系统条件:训练序列打包为 4096 token,上下文内采用文档分段注意力掩码;FLOPs 按打包文档平均长度测量;完整架构和训练栈未公开。
- 指标定义:计算效率增益是在共同拟合验证损失处,SMELT 相对 Baseline 节省的训练 FLOPs 比例。
- 成本归因:比较覆盖实测算术 FLOPs、非嵌入参数和 KV cache;不覆盖实际训练或推理时延、通信效率与串行执行调度。
- 结果:在
FLOPs 处节省 6.8%–10.0%,在 FLOPs 处节省 14.7%–18.0%;12-cell、2000 次 bootstrap 的 95% 区间在这些报告点均高于 0。 - 对照是否可比:缩放面在共同坐标比较,训练数据和协议一致,稀疏网格中的最大 FLOPs、参数和 KV cache 偏差分别为 3.9%、1.0% 和 3.6%;各分支共享此前的稳定训练轨迹。
- 证据定位:Section 4, Tables 6–8, Figures 2–4, Appendices A/B, https://arxiv.org/html/2609.01343v1
- 支持的最窄结论:在观测计算区间及所拟合稀疏度内,SMELT 的验证损失计算最优前沿优于 Baseline;
FLOPs 结果不属于区间内证据。 - 解读:独立拟合允许两种架构具有不同缩放指数,也使结果依赖拟合形式、终点相关性和有限网格覆盖。
结果 3:下游增益超过 Baseline 的验证损失校准曲线
- 设置:全部 96 个匹配终点;DCLM Core 的少样本任务使用 10 个随机示例种子,零样本任务运行一次;MMLU 为 5-shot。
- Baseline:用全部 Baseline 终点拟合验证损失到 DCLM Completion、DCLM Core 和 MMLU 的单调 sigmoid,再测量 SMELT 相对曲线的残差。
- 指标:DCLM Completion 标准答案 token 微平均交叉熵、DCLM Core 22 任务居中准确率、MMLU 原始准确率,以及控制验证损失后的残差。
- 结果:SMELT 在 DCLM Completion 的 96 对中全部胜出,在 DCLM Core 的 96 对中胜出 83 对;MMLU 的 30 个高于随机水平 10 个百分点的有效对中胜出 29 对。三个指标在四个规模上的平均校准残差均为正。
- 对照是否可比:匹配对共享预训练 token;校准曲线只用 Baseline 拟合,三个任务汇总的拟合决定“超出验证损失预测”的口径,DCLM 训练随机性只覆盖评测示例选择。
- 证据定位:Section 5.1, Figures 5–9, Appendix E, https://arxiv.org/html/2609.01343v1
- 支持的最窄结论:在所选任务和校准函数下,SMELT 的下游改善不能由 Baseline 的验证损失—任务分数关系完全解释。
- 解读:结果支持结构相关的任务收益分布;专有语料、基准污染过滤实现和单次训练限制外部有效性。
结果 4:第二次执行降低注意力汇聚点并保留主要检索位置
- 设置:四规模四稀疏度模型在 100 万 token 留出样本上执行路由、残差与注意力探针;Dyck 个案使用约 85% 稀疏度和最多 32 个示例。
- Baseline:相同物理深度的未循环 MoE、SMELT 内同一物理层的第一次执行,以及同层不同注意力头对照。
- 指标:专家集合交集、残差更新范数与余弦相似度、Q/K/V 跨执行余弦、Top-8 注意位置交集、分配给文档起始 token 的注意力权重。
- 结果:Top-8 注意位置跨执行交集为 56%–66%,不同头对照为 28%–34%;Q/K 余弦为 0.89–0.93,V 为 0.65–0.74;Dyck 个案的 BOS 注意力从 0.60 降至 0.02,示例答案注意力从 0.24 升至 0.85。
- 对照是否可比:跨执行比较共享同一组权重但接收不同残差状态;不同头对照控制位置上下文,未控制头功能;Dyck 注意力头按消融后困惑度增幅选择。
- 证据定位:Section 6, Figures 12–19, Appendix D, https://arxiv.org/html/2609.01343v1
- 支持的最窄结论:第二次执行在已测模型中大体保留关注位置,同时改变值表示、增强残差写入并减少分配给文档起始 token 的注意力权重。
- 解读:内部观测与长样本和上下文学习增益一致;各探针与最终性能之间的因果关系尚未验证。
局限
- 三项设计消融只在按 Baseline 激活参数量命名的 200M 档位执行,每项配置只有一次训练;跨规模实验验证固定配方能够继续获益,没有重新搜索各规模的最优循环跨度、有效深宽比或次数。
- 训练语料、完整模型结构和训练栈均为专有内容。论文披露了匹配相关配置、token 数和优化日程,仍不足以独立复现数据构成、路由与训练实现、污染过滤和全部系统条件。
- 三预算匹配保留最多 3.9% FLOPs、1.0% 参数量和 3.6% KV cache 偏差。更高专家总数本身会改变路由组合与知识容量,因此结论对应循环结构和预算补偿配方的联合效果。
- 计算效率增益来自经验缩放面。四个模型规模、三个稀疏度和共享稳定轨迹的分支终点限制了指数估计;
FLOPs 已属于外推,远端不可约损失差异也小于拟合误差。 - FLOPs、参数量和 KV cache 没有覆盖真实硬件时延。循环区间串行重执行、不同 GEMM 形状、更多专家的路由与通信可能改变训练和推理吞吐。
- 下游证据覆盖 DCLM Core 与 MMLU;长度实验最长为 4096 token。Code、长样本和少样本收益不能直接推广到长上下文检索、生成式代码评测或其它语言与数据分布。
- 注意力汇聚点减弱、值表示变化和残差写入增强属于相关性观测。论文没有对这些变量进行定向干预,尚未确定哪项机制产生性能增益。
跨论文关系
- 与已有论文的作者或机构关系:Ge Zhang 也是 OTB 作者,Shen Yan 也是 Dynamic Linear Attention 作者;本文与两篇已有笔记分别共享 M-A-P / ByteDance Seed 和 ByteDance Seed 作者关系,研究问题不同。
- 与已有论文的主题关系:与 DeepSeekMoE 都利用稀疏激活把总参数量与每 token 计算解耦;DeepSeekMoE 关注细粒度与共享专家的专门化,SMELT 将增加专家数作为循环后恢复参数预算的手段。
- 与已有论文的方法或系统关系:缩放面从 Kaplan Scaling Laws 和 Chinchilla 的参数—数据—计算关系扩展而来,以实测每 token FLOPs 和计算等效稀疏度替代单一参数轴,并分别拟合循环与未循环架构。
主要启发
1. 架构比较需要同时约束可相互替代的资源预算
循环模型可以用更多执行层换取更深计算,也会同步改变 FLOPs 与 KV cache;固定 FLOPs 又可能迫使模型减少独立参数。SMELT 借助 MoE 专家数、隐藏维度和注意力头配置分别校准参数、计算与 KV cache,Appendix A 报告缩放网格的最大剩余偏差,并在拟合中使用实测 FLOPs。这组证据把“结构是否更优”改写为资源向量上的受控比较,避免单一参数量或 FLOPs 指标承担超出其口径的归因。
可迁移关系是:当两个架构能在多个资源维度间重新分配成本时,比较协议应先列出决定能力、训练成本和部署约束的最小资源向量,再在共同坐标上评价结果。应用到稀疏注意力、状态空间模型或投机解码时,可证伪预测是:只匹配单一 FLOPs 的优势会在补齐显存、缓存、参数读取或时延约束后发生显著变化。该判断的边界在于资源向量仍需依具体部署目标选择;SMELT 的三项预算没有覆盖通信与实际时延。
2. 共享权重的重复执行可以形成表示细化阶段
SMELT 的第二次执行接收第一次执行后的残差状态,同时复用同一物理层参数。Section 6 的直接证据显示 Q/K 和主要注意位置高度重合,V 与最终输出变化更大,残差写入范数增加且方向保持正相关,分配给文档起始 token 的注意力权重下降。这个组合支持一种有限解释:重复执行可以在大体稳定的检索坐标上更新所取内容和写入强度,使有效深度能够独立于物理层参数量增加。
抽象关系是“共享变换 + 更新后的中间状态”可能产生逐次细化,目标系统需要同时保留跨次稳定对象和跨次变化对象。迁移到迭代解码、循环视觉模块或多步记忆读取时,可证伪预测是:获得收益的重复阶段会在路由或检索坐标上表现出高于独立对照的稳定性,同时在值表示、置信度或残差更新上保持可测变化;两类信号都完全相同或完全无关时,重复计算的边际收益应降低。当前证据仍是相关性探针,注意力汇聚点减弱与性能增益之间的因果关系需要干预实验验证。