2601.18089-latentmoe-accuracy-per-flop-parameter

LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts

LatentMoE 将路由 token 和路由专家计算从模型隐藏维度投影到较窄潜空间,把节省的专家权重读取和全互联通信预算用于增加专家总数及 Top-k;在总参数与激活参数相近的 95B Transformer 和 73B Mamba–Attention 设置中,准确率优先变体在全部已报告下游汇总指标上高于标准 MoE,但现有端到端实测只覆盖两张 H100,万亿参数服务优势仍来自专有模拟器与跨模型缩放拟合。

Authors Venmugil Elango, Nidhi Bhatia, Roger Waleffe, Rasoul Shafipour, Tomer Asida, Abhinav Khattar, Nave Assaf, Maximilian Golub, Joey Guman, Tiyasa Mitra, Ritchie Zhao, Ritika Borkar, Ran Zilberstein, Mostofa Patwary, Mohammad Shoeybi, Bita Rouhani

已审阅 Archived 2026-08-05 09:18 Updated 2026-08-05 11:34 Reviewed 2026-08-05 11:28 Source

Source

本文的机制、公式和实验数字以用户指定的 arXiv v1 为准。ICML 2026 公开论坛中的相同作者列表、摘要、LatentMoE 名称和实验规模支持两份材料为同一工作;论坛使用修订标题,并把 Joey Guman 和 Bita Rouhani 的姓名分别规范为 Joseph Guman 和 Bita Darvish Rouhani。审稿意见和作者回应单独归入后文,不把回应中承诺的增补当作 arXiv v1 已有内容。

作者与关系

  • Venmugil Elango: NVIDIA。
  • Nidhi Bhatia: NVIDIA。
  • Roger Waleffe: NVIDIA。
  • Rasoul Shafipour: NVIDIA。
  • Tomer Asida: NVIDIA。
  • Abhinav Khattar: NVIDIA。
  • Nave Assaf: NVIDIA。
  • Maximilian Golub: NVIDIA。
  • Joey Guman: NVIDIA;ICML 2026 版本作 Joseph Guman。
  • Tiyasa Mitra: NVIDIA。
  • Ritchie Zhao: NVIDIA。
  • Ritika Borkar: NVIDIA。
  • Ran Zilberstein: NVIDIA。
  • Mostofa Patwary: NVIDIA。
  • Mohammad Shoeybi: NVIDIA。
  • Bita Rouhani: NVIDIA;ICML 2026 版本作 Bita Darvish Rouhani。

arXiv v1 使用 NVIDIA 技术报告模板和 NVIDIA 版权声明,NVIDIA Nemotron 官方项目页列出相同作者集合;ICML 2026 OpenReview 页面为全部 16 位作者提供稳定作者标识。论文没有标注共同第一作者或通讯作者。默认建档范围据此只覆盖作者顺序前两位。两位核心作者都长期参与 NVIDIA 的模型—硬件协同与推理系统工作;Venmugil Elango 的公开论文记录还覆盖 GPU 数据移动、分布式训练与通信高效注意力,Nidhi Bhatia 的 NVIDIA 官方简介明确记录其生成式 AI 推理、性能建模和分布式推理方向。

论文脉络

1. 研究问题、背景和价值

标准混合专家模型(Mixture of Experts, MoE)用稀疏激活扩大总参数量,通常以单 token 的激活参数或 FLOPs 说明效率。实际服务还受到参数读取与跨设备数据移动约束:低并发解码时,每个专家分到的 token 很少,专家矩阵乘法难以形成足够高的算术强度;专家并行进入高吞吐区间后,路由 token 的全互联通信又可能占据主要时间。

论文据此把设计目标写成两个互补指标:单位 FLOP 的准确率反映计算效率,单位参数的准确率近似反映模型占用、专家权重读取、分片与通信压力。研究问题是:在不增加主要推理预算的条件下,MoE 中哪个结构维度可以缩小,以及节省的预算如何重新分配,才能提高模型质量。

2. 已有解决方案与不足

传统 MoE 主要通过增加专家总数并保持较小 Top-k,使总参数与单 token 计算解耦。这种设计仍让路由 token、全互联载荷和每个路由专家都使用模型隐藏维度 dd,因此稀疏激活无法直接消除权重读取和通信成本。

DeepSeekMoE 等细粒度方案通过减小专家中间维度并增加专家组合提高专门化程度;MoLAE 等方法对已训练专家做低秩压缩。论文认为这两条路径分别面临中间非线性容量下降、通信载荷仍处于完整隐藏维度或只压缩部分专家矩阵等限制。arXiv v1 对最接近方法的覆盖仍不完整:ICML 评审指出 BigMac 也在全互联前执行低维投影,作者在回应中承诺补充比较。这一遗漏降低了“首次改变 MoE 设计范式”等原创性表述的可信度。

3. 作者可能的思考路径

以下为本地重构。先把部署分成两个受限区间:低并发区间主要受专家权重读取限制,高吞吐区间主要受 token 全互联限制。再检查标准 MoE 的结构变量,可以得到三个方向:减小专家中间维度 mm 会降低每个激活专家的非线性宽度;减小 Top-k KK 会同时降低激活容量和专家组合数量;减小路由路径的输入维度 dd 能同时缩小专家权重和通信载荷。

直接压缩 dd 会形成信息瓶颈并减小模型参数规模。作者随后把压缩节省转成更多专家:先增加专家总数 NN,补偿模型容量和训练稳定性;若目标是在相近推理预算下继续提高准确率,再同步增加 KK,使更多低维专家参与每个 token。由此形成“定位数据移动瓶颈—选择路由维度—低维执行—重新分配预算—跨规模验证”的完整链条。

4. 核心假设或切入点

方法依赖五项判断,其中前两项来自特定硬件与并行配置下的成本模型,后三项属于作者用于缩小设计空间的理论启发:

  1. 低延迟 MoE 的专家计算经常受 HBM 带宽限制,减小专家权重矩阵能够降低权重读取时间。
  2. 高吞吐专家并行经常受全互联通信限制,路由数据量与 Top-k 和路由表示维度近似成正比。
  3. 每个 token 的有效非线性宽度可用 KmK m 近似;保持 mm 与原始 KK 有助于避免直接损失这部分容量。
  4. 任务相关特征存在某个有效秩下界,潜维度 \ell 高于该下界时,路由专家可以在压缩表示上工作。
  5. 同时增加专家总数与激活专家数会扩大可选专家组合,可能提高专门化和表达能力。

第 3 项借用单隐层 Barron 函数近似结果,第 4 项把“有效秩”作为解释性假设,第 5 项使用组合数量增长。它们没有共同构成训练损失或泛化误差定理;论文最终用消融和跨规模训练检查这些判断。

5. 贡献全景与方法总览

首要贡献是把路由专家路径从模型隐藏维度 dd 中解耦:路由器仍读取完整隐藏表示,路由 token 随后下投影到潜维度 \ell,全互联分发、路由专家计算和聚合都在潜空间完成,聚合结果再上投影回 dd。这条结构同时改变专家参数宽度和通信载荷宽度。

辅助贡献包括五项模型—硬件协同设计原则、效率优先与准确率优先两个方法变体,以及从 16B 消融、95B Transformer、73B Mamba–Attention 到 H100 实测和万亿参数模拟的分层证据。全文中的关键对象承担不同角色:

  • 标准 MoE:路由器、路由载荷、路由专家和共享专家都使用完整隐藏维度 dd
  • 路由专家:LatentMoE 中唯一进入潜空间的专家集合;其数量从 NN 扩大为 N=αNN'=\alpha N,其中 α=d/\alpha=d/\ell
  • 共享专家:所有 token 固定经过的专家,继续在 dd 维工作。
  • 路由器:继续从完整输入 xRdx\in\mathbb{R}^d 计算专家分数,压缩不直接改变其输入信息。
  • 效率优先变体 -MoEeff\ell\text{-MoE}_{\mathrm{eff}}:扩大专家总数,保持 Top-k 不变,目标是以较少激活参数和通信维持基线质量。
  • 准确率优先变体 -MoEacc\ell\text{-MoE}_{\mathrm{acc}}:同时扩大专家总数与 Top-k,目标是在路由专家参数、计算和通信近似守恒时提高准确率。

端到端论证与执行链如下:

阶段 输入或初始条件 核心操作与传递对象 输出与作用
1. 部署瓶颈建模 Qwen3-235B-A22B、GB200 NVL72、专家并行与精度假设 用 roofline 估计每专家 token 数对应的算术强度,再比较全互联时间与专家计算时间 得到低并发受 HBM 限制、高吞吐受通信限制的局部成本模型
2. 设计变量筛选 隐藏维度、专家中间维度、专家总数与 Top-k 保持作者假设中的非线性宽度与有效秩条件,选择同时影响权重读取和通信载荷的路由维度 得到把 dd 压到 \ell、随后扩大专家集合的结构约束
3. 潜空间专家执行 完整隐藏表示、路由分数与选中专家索引 下投影后传递潜表示;在潜空间执行分发、专家前向与聚合;上投影回模型隐藏维度 产生与残差路径兼容的 dd 维专家输出,并缩小路由载荷和单专家矩阵
4. 预算重新分配 压缩比 α\alpha、基线 NNKK 两个变体都设 N=αNN'=\alpha N;效率优先变体保持 KK,准确率优先变体再设 K=αKK'=\alpha K 分别得到较低路由成本的模型和相近路由预算下更高容量的模型
5. 证据检查 三种模型规模、验证损失、下游准确率与服务负载 先消融压缩比和专家扩展,再跨骨干与规模训练;最后执行 H100 吞吐实测与万亿参数模拟 形成直接训练证据、实测系统证据和模拟证据三种强度不同的结论

只读本节可以复述首要结构变化、两个变体、路由器与共享专家的完整维度、阶段间传递的表示和最终证据类型。后续章节依次解释成本约束、潜空间执行、预算分配和验证边界。

Figure 1a: Standard MoE expert path
Figure 1a:标准 MoE 在完整隐藏维度中分发并执行路由专家。Image Source: arXiv v1 HTML, Figure 1(a).
Figure 1b: LatentMoE expert path
Figure 1b:LatentMoE 在分发前下投影、聚合后上投影,增加路由专家数量,同时让路由器和共享专家继续使用完整维度。Image Source: arXiv v1 HTML, Figure 1(b).

6. 从部署成本模型筛选路由维度

第一阶段先判断低并发下专家矩阵乘法何时从带宽受限转成计算受限。论文以 Qwen3-235B-A22B 为例,设每个专家接收 texpt_{\mathrm{exp}} 个 token、隐藏维度为 dd、专家中间维度为 mm。在其 FP4 流量口径下,算术强度写为:

I=2texpdmdm+texp(d+m) I= \frac{2t_{\mathrm{exp}}dm} {dm+t_{\mathrm{exp}}(d+m)}

分子是专家矩阵乘法 FLOPs,分母近似包含权重、输入和中间激活流量。GB200 的峰值 FP4 算力与 HBM 带宽之比为 1250 FLOPs/byte;代入 d=4096d=4096m=1536m=1536 后,需要 texp1418t_{\mathrm{exp}}\geq 1418 才进入计算受限区间。论文据此判断典型低延迟小批量仍受权重读取限制。该阈值依赖峰值规格、精度、流量估算、路由均匀性和内核利用率,不能直接迁移到其它 GPU 或实际负载。

第二项成本是专家并行中的全互联通信。论文设 128 个专家分布在 64 张 GPU 上,分发使用 FP4、聚合使用 BF16,单 GPU 每层通信量近似为:

Mcomm=2.5(NEPtexpd)=5texpd M_{\mathrm{comm}} =2.5\left(\frac{N}{\mathrm{EP}}t_{\mathrm{exp}}d\right) =5t_{\mathrm{exp}}d

因子 2.5 对应每个元素 0.5 byte 的分发与 2 byte 的聚合。用峰值算力 FF 和单向 NVLink 带宽 BWNVL\mathrm{BW}_{\mathrm{NVL}} 估算,通信与计算时间之比为:

tcommtcomp=5F4mBWNVL9 \frac{t_{\mathrm{comm}}}{t_{\mathrm{comp}}} =\frac{5F}{4m\,\mathrm{BW}_{\mathrm{NVL}}} \approx 9

该结果使通信载荷宽度 dd 成为高吞吐区间的直接优化变量。模型没有纳入通信—计算重叠、链路竞争、路由偏斜、不同 collective 实现和小矩阵内核利用率,因此它提供设计方向和数量级判断,不能替代端到端测量。

作者随后用质量约束排除其它变量。有效非线性预算被近似为:

UeffKm U_{\mathrm{eff}}\propto Km

这里的 KK 是每个 token 选中的专家数,mm 是单个专家的中间维度,因而 KmKm 近似对应该 token 实际使用的非线性单元数。论文引用 Barron 函数的单隐层逼近结果:当目标函数属于相应函数类时,使用 uu 个非线性单元的均方逼近误差按 O(1/u)\mathcal{O}(1/u) 下降,其收敛阶不显式依赖输入空间维度。该结果支持优先保留 KKmm,但没有给出“输入维度可以任意压缩而不影响能力”的结论;大 O\mathcal{O} 常数仍取决于目标函数的 Barron 范数,投影还可能丢失任务相关信息。

为显式写出这项边界,本地重构先固定路由选择,并把路由专家的内容路径抽象为 Z=PXZ=P_\ell X 和有限宽度网络 gu(Z)g_u(Z)。其均方误差可以分解为:

E[(f(X)gu(Z))2]=E[Var(f(X)Z)]+E[(E[f(X)Z]gu(Z))2] \mathbb{E}\left[\left(f(X)-g_u(Z)\right)^2\right] = \mathbb{E}\left[\operatorname{Var}\left(f(X)\mid Z\right)\right] + \mathbb{E}\left[ \left( \mathbb{E}\left[f(X)\mid Z\right]-g_u(Z) \right)^2 \right]

第一项是潜表示无法区分具有相同 ZZ 的输入时产生的表示误差,即使 uu 无限增大也不会消失;第二项才是有限非线性宽度产生的逼近误差。若压缩后的条件均值仍属于 Barron 类,且其范数记为 BB_\ell,则可以用以下示意关系表达两项约束:

Error(,u)εrepr()+B2u \operatorname{Error}(\ell,u) \lesssim \varepsilon_{\mathrm{repr}}(\ell) + \frac{B_\ell^2}{u}

例如目标只依赖 x1x_1 时,保留 x1x_1 的一维投影已经足够;删除该方向后,增加任意数量的非线性单元也无法恢复这部分信息。固定路由专家计算预算 CexpuC_{\mathrm{exp}}\propto \ell u,并代入 uKmu\approx Km 后,上式进一步给出示意性的维度—宽度关系:

Error()εrepr()+B2Cexp \operatorname{Error}(\ell) \lesssim \varepsilon_{\mathrm{repr}}(\ell) + \frac{B_\ell^2\ell}{C_{\mathrm{exp}}}

减小 \ell 可以在相同路由专家预算下增加 KKmm;论文保持 mm,并依据变体目标决定是否增加 KK\ell 低于任务相关特征的有效维度时,εrepr()\varepsilon_{\mathrm{repr}}(\ell) 会成为主要误差。因此潜维度仍需满足论文提出的启发式条件 reff\ell\geq r_{\mathrm{eff}}。这项分解用于解释设计权衡,并非论文给出的深层 MoE 误差定理;实际 LatentMoE 的路由器、共享专家和残差路径继续使用完整 dd 维表示,会缓解单一路由专家内容路径的信息瓶颈。论文没有直接测量 reffr_{\mathrm{eff}},而是通过 α=4\alpha=4 接近基线、α=8\alpha=8 退化的消融经验确定工作区间。

最后,扩大 NNKK 会增加组合数量:

(αNαK)((NK))α \binom{\alpha N}{\alpha K} \geq \left(\binom{N}{K}\right)^\alpha

组合数量增长只说明可选路由模式增加;专家能否形成有效专门化还取决于训练数据、路由学习、负载均衡和优化稳定性。论文用后续消融检查这一从组合计数到准确率的经验映射。

7. 潜空间路由专家的执行接口

第三阶段把前述结构约束变成可执行层。输入 token xRdx\in\mathbb{R}^d 先经共享下投影 WR×dW_{\downarrow}\in\mathbb{R}^{\ell\times d} 得到潜表示。路由器仍从原始 xx 计算 NN' 个专家的分数,选中索引后才传递潜表示,因此专家选择使用完整维度的信息。

效率优先变体的完整输出用于说明数据路径:

-MoEeff(x)=W(iTK,NpiEi(Wx;))+j=N+1N+SEj(x;d) \ell\text{-MoE}_{\mathrm{eff}}(x) =W_{\uparrow} \left( \sum_{i\in\mathcal{T}_{K,N'}} p'_i E_i(W_{\downarrow}x;\ell) \right) +\sum_{j=N'+1}^{N'+S}E_j(x;d)

N=αNN'=\alpha N 是扩展后的路由专家总数,TK,N\mathcal{T}_{K,N'} 是从中选出的 KK 个专家,pip'_i 是由完整输入计算的路由权重。路由专家的输入、门控前馈层和输出都以 \ell 为输入宽度,共享专家 Ej(;d)E_j(\cdot;d) 则保留在 dd 维。选中专家的潜空间输出完成全互联聚合后,经 WRd×W_{\uparrow}\in\mathbb{R}^{d\times\ell} 回到模型隐藏维度,再与共享专家输出相加。

以 16B 消融模型为具体例子,基线取 d=2048d=2048N=64N=64K=6K=6S=2S=2。论文选择 α=4\alpha=4 时,潜维度为 =512\ell=512,路由专家总数增加到 256;效率优先变体仍选择 6 个专家,准确率优先变体选择 24 个专家。这里的 2048 到 512 对应下投影,64 到 256 对应容量补偿,6 或 24 对应两个预算目标,共享专家数量保持为 2。

这一执行路径的局部收益是:分发与聚合的数据宽度由 dd 降到 \ell,单个路由专家中依赖输入宽度的权重矩阵也缩小。上、下投影增加每层 2d2d\ell 参数及对应计算,路由器和共享专家仍使用完整维度;因此“成本守恒”主要描述路由专家主项,整体层成本是近似关系。

8. 两个变体把同一压缩预算用于不同目标

第四阶段决定压缩收益的用途。两个变体都将专家总数扩大为 N=αNN'=\alpha N。本地代数重构表明,忽略共享专家、路由器和投影后,路由专家总参数主项从 NdmNdm 变为 (αN)m=Ndm(\alpha N)\ell m=Ndm,因此专家总容量近似守恒。

-MoEeff\ell\text{-MoE}_{\mathrm{eff}} 保持激活专家数 KK。其激活专家计算主项从 KdmKdm 变为 Km=Kdm/αK\ell m=Kdm/\alpha,路由通信也随载荷宽度缩小。它适用于带宽或通信预算优先的场景,论文目标是以较少激活参数维持标准 MoE 的质量。

准确率优先变体把 Top-k 同步扩大为 K=αKK'=\alpha K

-MoEacc(x)=W(iTK,NpiEi(Wx;))+j=N+1N+SEj(x;d) \ell\text{-MoE}_{\mathrm{acc}}(x) =W_{\uparrow} \left( \sum_{i\in\mathcal{T}_{K',N'}} p'_i E_i(W_{\downarrow}x;\ell) \right) +\sum_{j=N'+1}^{N'+S}E_j(x;d)

此时路由专家计算主项为 (αK)m=Kdm(\alpha K)\ell m=Kdm,通信主项中的 KK'\ell 也等于基线的 KdKd。它把压缩预算转换为更多被激活的专家和更大的组合空间,目标是在相近路由专家预算下提高准确率。额外投影、实际 GEMM 形状、路由器、共享专家和通信实现会使端到端成本偏离严格相等;Table 5 的 H100 实测正是对这一偏差的检查。

两个变体共同说明 LatentMoE 的首要贡献包含结构与预算分配两部分。只加入低维投影会降低模型参数和训练稳定性;Figure 4 显示在 4×4\times 压缩下保持 64 个专家会明显提高验证损失,把专家数扩到 256 后才恢复基线轨迹。

9. 从压缩消融到系统测量的证据链

第五阶段先在 16B 总参数、2B 激活参数的 Transformer 上训练到约 1T token。Figure 3 比较压缩比,α=4\alpha=4 与基线验证损失接近,α=8\alpha=8 持续较高;Figure 4 再隔离专家扩展,确认低维投影需要配套增加 NN;Figure 5 比较两个变体,效率优先变体接近基线,准确率优先变体取得更低验证损失。三张曲线没有随机种子和误差带,因而支持该训练配置中的结构选择,尚不能估计差异方差。

随后作者把 α=4\alpha=4 固定到 95B 总参数、8B 激活参数 Transformer,并训练 300B token。Table 3 中准确率优先变体在 MMLU Pro、MMLU、代码、数学和常识五个汇总指标上全部高于基线;效率优先变体把激活参数从 8.47B 降到 5.62B,在前三项略高、数学和常识略低。73B 总参数、8B 激活参数的 Mamba–Attention 混合模型训练 1T token 后复现同一排序:准确率优先变体五项全高,效率优先变体在数学和常识上低于基线。

系统证据分为实测和投影。Table 5 在两张 H100、vLLM、FP8 per-tensor 量化下测量 73B 混合模型的每 GPU 吞吐。准确率优先变体随并发度出现正负波动,单并发低约 12%,并发 4 和 64 略高,并发 16 和 128 低约 6%。这组结果支持“额外投影没有造成数量级开销”,同时表明解析成本守恒不能自动转成每个负载点的吞吐守恒。

Figure 7 使用未公开实现的专有模拟器扫描 20 万余个万亿参数服务点。作者先用 Qwen3 Dense 0.6B–32B 的 MMLU 结果拟合对数缩放关系,再把 Kimi-K2-1T-LatentMoE 的准确率映射为约 1.35 倍有效参数量,构造 1.35T 标准 MoE 对照。模拟给出准确率匹配时 1.24–3.46 倍的速度差。这条链同时跨越模型家族、稠密缩放曲线、指标与万亿参数系统模拟,可信度低于 95B/73B 直接训练和 H100 实测。

10. 结论链条

成本模型先指出低并发专家权重读取和高吞吐全互联载荷都含有路由维度 dd。作者用保持 KmKm、满足有效秩下界和扩大专家组合三个判断,把结构选择收缩为压缩路由路径并增加专家。LatentMoE 随后让路由专家在 \ell 维执行,同时保留完整维度的路由器、共享专家和残差接口;两个变体分别把压缩收益用于降低激活成本或增加 Top-k。

16B 消融直接支持 4×4\times 压缩、专家数同步扩大和两个变体的预期排序;95B Transformer 与 73B 混合模型支持该排序跨规模和骨干延续;H100 实测中,准确率优先变体的吞吐较基线低约 12% 至高约 4%。由这些证据可以得到的最窄结论是:在论文给出的模型、训练和部署配置中,低维路由专家配合专家扩展能改善标准 MoE 的准确率—激活参数关系,并在 H100 研究设置中保持相近吞吐。万亿参数下的准确率匹配服务优势仍是模型化投影。

关键实验结果

结果 1:成本模型把两个部署瓶颈定位到路由维度

  • 设置:Qwen3-235B-A22B,128 个专家、Top-8、d=4096d=4096m=1536m=1536;64 张 GB200 组成一个 NVLink 专家并行域,FP4 峰值算力 10 PFLOPs、HBM 带宽 8 TB/s、单向 NVLink 带宽 900 GB/s。
  • 系统条件:假设 token 均匀分配,按峰值硬件规格计算,不含通信—计算重叠、路由偏斜和内核效率损失。
  • 指标定义:算术强度为专家 FLOPs 与近似数据流量之比;通信/计算比为解析时间比。
  • 结果:进入计算受限区间需要每专家至少 1418 个 token;给定参数下通信时间与计算时间之比约为 9。
  • 成本归因:低并发成本归于专家权重读取,高吞吐成本归于完整隐藏维度上的全互联载荷。
  • 对照是否可比:本结果是同一解析模型内的瓶颈分解,没有运行标准 MoE 与 LatentMoE 的端到端硬件对照;后者由结果 5 单独检查。
  • 证据定位:arXiv v1 Section 2.1–2.2,Figure 2 及相邻公式。
  • 支持的最窄结论:在该硬件、精度、拓扑和均匀路由模型下,减小路由表示维度同时作用于 HBM 与全互联流量主项。
  • 解读:这是架构筛选依据,端到端效果需要实测确认。

结果 2:16B 消融确定压缩上限、专家扩展和变体分工

  • 设置:16B 总参数、2B 激活参数 Transformer;基线采用 27 层、d=2048d=2048、64 个路由专家、Top-6、2 个共享专家和 1408 中间维度;训练曲线延伸到约 1T token。
  • 指标:验证损失。
  • Baseline:相同基线架构与训练超参数下的标准 MoE。
  • 结果:Figure 3 中 α=4\alpha=4 接近基线、α=8\alpha=8 较差;Figure 4 中 4×4\times 压缩后保持 64 个专家明显较差,扩到 256 个专家恢复基线;Figure 5 中效率优先变体接近基线,准确率优先变体更低。
  • 对照是否可比:论文说明压缩比扫描保持其它超参数不变,专家扩展消融使用同一基线超参数;没有报告多个随机种子、误差带和曲线末点的精确表格值。
  • 证据定位:arXiv v1 Section 4.1,Figures 3–5。
  • 支持的最窄结论:在该 16B 配置和训练配方中,4×4\times 是论文测试范围内可维持质量的压缩比,增加专家总数是恢复压缩模型训练质量的必要配套,增加 Top-k 可进一步降低验证损失。
  • 解读:消融支持方法内部因果链,尚未证明 α=4\alpha=4 对不同层、任务和模型家族普遍最优。

结果 3:准确率优先变体在两个大规模骨干的全部已报指标上提高

  • 设置:95B Transformer 训练 300B token;73B Mamba–Attention 混合模型训练 1T token;两组都使用 α=4\alpha=4,并在同组内使用相同超参数。
  • 指标:MMLU Pro、MMLU、代码、数学和常识汇总准确率;代码与数学、常识各由论文列出的多个子基准平均得到。
  • Baseline:相同骨干的标准 MoE。
  • 结果:95B 基线到准确率优先变体分别为 29.26→34.91、58.95→62.23、40.33→41.50、64.39→64.88、74.32→75.18;73B 混合模型分别为 48.30→52.87、70.10→72.11、51.95→55.14、78.32→80.19、81.73→82.10。
  • 对照是否可比:组内总参数与激活参数相近,训练超参数一致;论文称 95B LatentMoE 沿用为基线优化的超参数。训练数据组成、随机种子、置信区间和训练计算未披露。
  • 证据定位:arXiv v1 Section 4.2,Tables 3–4;95B 收敛见 Figure 6。
  • 支持的最窄结论:在这两个预训练设置中,准确率优先变体以相近参数规模在五个已报告汇总指标上均高于标准 MoE。
  • 解读:跨 Transformer 与 Mamba–Attention 的一致方向提高了结构可迁移性的可信度;相同训练管线和单次运行限制了统计外推。

结果 4:效率优先变体降低激活参数,但存在任务级回退

  • 设置:与结果 3 相同。
  • 指标:激活参数及五个下游汇总准确率。
  • 结果:95B 设置中激活参数从 8.47B 降到 5.62B,MMLU Pro、MMLU 和代码提高,数学与常识分别低 0.78 和 0.60;73B 设置中从 8.09B 降到 5.91B,前三项提高,数学与常识分别低 1.31 和 0.95。
  • 对照是否可比:总参数相近,训练超参数一致;实际 FLOPs、投影计算和各任务方差没有完整表格。
  • 证据定位:arXiv v1 Section 4.2,Tables 3–4。
  • 支持的最窄结论:效率优先变体在两组设置中用约 27%–34% 更少激活参数维持总体接近或更好的结果,但不能支持“每项任务都不降”的结论。
  • 解读:该变体适合允许小幅任务级回退、优先降低激活成本的部署目标。

结果 5:两张 H100 的吞吐大致相近,负载点之间没有单调优势

  • 设置:Hybrid-73BT-8BA,准确率优先 LatentMoE 与标准 MoE;两张 Hopper H100,vLLM,FP8 per-tensor 量化。
  • 系统条件:论文未披露输入/输出长度、prefill/decode 比例、vLLM commit、内核版本和重复测量方差。
  • 指标定义:并发度 1、4、16、64、128 下的 tokens/s/GPU。
  • 结果:LatentMoE 与标准 MoE 依次为 181.6/206.6、528.5/509.8、1130.8/1204.6、1569.6/1549.3、1625.8/1725.9。
  • 成本归因:额外下/上投影和较小专家 GEMM 形状会产生开销;论文提出分离 CUDA stream 和较小矩阵专用 CUTLASS 内核作为后续优化。
  • 对照是否可比:模型骨干、硬件、运行时和量化口径一致;缺少延迟分位数、显存、网络流量和算子分解。
  • 证据定位:arXiv v1 Section 4.3,Table 5。
  • 支持的最窄结论:该双 H100 设置中,准确率优先变体的每 GPU 吞吐位于基线的约 0.88–1.04 倍,额外结构开销有限且没有在全部并发点达到同速或更快。
  • 解读:这组实测支持“相近吞吐”,无法支持一般性的低延迟或大规模专家并行加速。

结果 6:万亿参数服务优势属于模拟与缩放拟合结论

  • 设置:专有高保真模拟器扫描 20 万余个点;decode-heavy chunked piggybacking 的输入/输出序列长度为 8192/16384,prefill-heavy disaggregated serving 为 50000/2048;比较 Kimi-K2-1T-LatentMoE、原生 Kimi-K2-1T 和按深度扩到 80 层的 Kimi-K2-1.35T。
  • 系统条件:模拟器实现、校准误差、硬件拓扑和主要模型参数未公开。
  • 指标定义:通过 Qwen3 Dense 0.6B–32B 的 MMLU 对数拟合得到有效参数倍率,再构造准确率匹配的标准 MoE;系统图使用归一化 tokens/s/GPU 与 tokens/s/user。
  • 结果:有效参数倍率约 1.35,准确率匹配的标准 MoE 因而增加约 350B 参数;模拟中的标准 MoE 沿 Pareto 前沿慢 1.24–3.46 倍,原生 1T 模型与 1T LatentMoE 的差异不超过约 9%。
  • 成本归因:大部分差异来自为匹配预测准确率而增加的 350B 参数,直接投影开销对应较小的原生 1T 对照差异。
  • 对照是否可比:准确率匹配通过跨模型家族、跨参数区间的拟合构造,没有训练或实测 1.35T 标准 MoE。
  • 证据定位:arXiv v1 Section 4.3.1,Equations 3–5,Figure 7。
  • 支持的最窄结论:在论文的 EPM 假设和专有模拟器中,LatentMoE 比通过增加深度达到预测同准确率的标准 MoE 具有更优吞吐—延迟前沿。
  • 解读:这项结果说明潜在系统收益的量级,不能写成已经测得的万亿参数加速。

OpenReview / 审稿意见吸收

  • Reviewer consensus: 论坛可读到 4 份正式评审,初始 overall_recommendation 依次为 4、3、4、4,confidence 依次为 3、2、3、3。评审普遍认可 roofline 驱动的结构选择、方法改动简洁和 73B/95B 规模训练证据;对理论形式化、相关工作覆盖、系统测量完整性和万亿参数投影的评价更谨慎。
  • Main criticisms: 主要问题包括与 MLA、MoLAE、BigMac 等方法的区别不充分;有效秩与 Barron 函数只提供启发式说明;符号、目标与原则间权衡不够清楚;缺少不同专家并行规模、MFU 或硬件利用率、通信与权重读取分解、路由熵和负载不均衡量化;标准 MoE 之外的对照有限;较小 GEMM 可能需要专用 CUTLASS 内核;统一 α=4\alpha=4 缺少逐层、逐任务敏感性;万亿参数结论依赖专有模拟器和从小型稠密模型外推的 EPM。
  • Author response: 作者区分了两个变体的预算目标,说明路由器使用完整 dd 维输入、共享专家不压缩,并称相同训练超参数下没有观察到收敛问题,辅助损失自由的负载均衡保持了专家分布。回应给出投影计算约占 95B 路由专家计算的 1/161/16、双 H100 单并发约 12% 开销和较高并发最多约 6% 吞吐下降等解释,并承诺补充 BigMac、符号定义、组件成本、模拟局限、社会影响和更大规模 silicon 对照。除 Table 5 已在 v1 中可查的吞吐外,这些新增分解与承诺未全部出现在 arXiv v1,当前笔记保留为回应主张。
  • Decision: ICML 2026 最终决定为 Accept (regular)。领域主席认为工作达到接收标准,指出大规模经验验证是主要优势,同时记录评审对相关工作不足和万亿参数服务分析仍有明显保留;该决定主要来自领域主席对论文的独立评价。
  • 对可信度的影响: 公开评审和正式接收提高了方法与直接训练结果经过外部检查的可信度,也明确暴露了当前证据分层。16B 消融、95B/73B 训练与双 H100 实测可以作为主要证据;万亿参数模拟、理论普遍性和部署可移植性继续保持较低结论强度。

局限

  1. 五项设计原则没有形成统一优化目标或一般性定理。Barron 函数结果到深层 MoE 的映射、任务有效秩和专家组合数量到准确率的映射都属于启发式解释;现有消融只在有限模型与训练配置中验证。
  2. GB200 成本模型假设均匀路由、峰值算力与带宽,并省略通信—计算重叠、链路竞争、内核占用和实际 collective 行为;真实测量使用两张 H100,无法直接验证 64 张 GB200 专家并行模型。
  3. 压缩敏感性主要比较统一的 α=4\alpha=4 与 8,没有逐层、逐任务或逐模型估计 reffr_{\mathrm{eff}},也没有多个随机种子、误差带或显著性报告。
  4. 主要对照是同骨干标准 MoE。arXiv v1 缺少 BigMac 等相邻低维路由方案和更广泛现代 MoE 变体的同预算比较;相同基线超参数提高了控制性,也可能使 LatentMoE 与专门调参后的上限无法比较。
  5. 论文披露了 8B 激活模型的学习率日程、序列长度、batch、warmup 和负载均衡系数,训练数据组成、过滤与去重、优化器完整配置、训练硬件与并行方式、随机种子、GPU-hours、能耗和成本仍未披露。
  6. H100 实测只报告 tokens/s/GPU。输入/输出长度、prefill/decode 分解、首 token 延迟、token 间延迟、尾延迟、显存、网络字节、运行时版本和方差缺失;小矩阵 GEMM 的内核效率可能改变不同硬件上的结论。
  7. 万亿参数结果没有实物模型或公开模拟器。EPM 从 Qwen3 Dense 0.6B–32B 的 MMLU 拟合外推到万亿参数 MoE,再把估计准确率转换为服务规模;任一迁移假设变化都会改变 350B 参数差和 1.24–3.46 倍速度差。
  8. 论文称 LatentMoE 已用于 Nemotron-3 Super 和 Ultra,这一部署事实由 NVIDIA 后续报告与项目页支持;它不能替代在同数据、同训练预算下隔离 LatentMoE 贡献的对照。
  9. 降低大规模模型服务成本可以减少单位请求资源消耗,也会降低高能力模型的部署门槛;公开评审要求补充这项双用途边界,arXiv v1 尚无系统风险分析。

主要启发

1. 高成本数据路径可以使用较窄表示,节省的预算可以增加按需激活的容量

标准 MoE 让路由载荷和路由专家计算都使用模型隐藏维度,模型容量与推理成本因而共同受到这一宽度约束。LatentMoE 在 Section 2 指出的权重读取与全互联通信问题上执行了关键转换:路由器、共享专家和残差路径继续使用完整表示,只有路由专家的通信与计算进入较窄潜空间。Figure 3 中四倍压缩接近基线、八倍压缩出现退化,说明这项转换依赖潜表示仍能保留任务相关信息,压缩比例存在质量边界。

Figures 4–5 提供了区分性证据:只压缩路由维度并保持 64 个专家会提高验证损失,把专家总数增加到 256 后恢复基线轨迹,再把每个 token 激活的专家数从 6 增加到 24 后取得更低损失。这组对照支持的核心判断是,不同数据路径可以使用不同表示宽度;高成本路径只保留完成局部任务所需的信息后,节省的参数、计算与通信预算可以投入更多候选专家或更多激活专家。效率优先变体保留这部分节省,准确率优先变体把节省重新投入按需激活的容量。专家能否形成有效分工仍取决于路由学习和负载均衡,组合数量增加本身不能保证准确率提高。

本地分析把这项判断抽象为一条可迁移关系:当主要成本随某条数据路径的表示宽度增长,而该路径只需要较低维的任务相关信息时,可以压缩这条路径,并把节省的预算投入更直接影响结果的按需容量。注意力可以检查压缩 Key/Value 表示后用相同显存支持更长上下文,跨设备模型可以检查压缩传输激活后增加分支或 token,检索系统可以检查缩小索引表示后扩大候选集合。迁移成立时,相同资源预算下的“压缩并增加容量”应同时优于原设置和“只压缩”设置;潜表示丢失关键信息、实际瓶颈不随宽度变化、投影与小矩阵内核抵消节省,或新增容量没有被有效使用时,该预测会失败。Table 5 的双 H100 结果表明实际吞吐仍随并发点波动,因此这些迁移属于待验证设计方向。

跨论文关系

  • DeepSeekMoE:DeepSeekMoE 通过缩小专家中间维度并增加激活专家数扩大组合粒度,同时用共享专家隔离通用知识;LatentMoE 保持中间维度,缩小路由输入与输出宽度,再扩大专家总数和 Top-k。两者都把计算预算分配给更细的专家组合,修改的是专家矩阵的不同轴。
  • DeepSeek-V2:DeepSeek-V2 的 MLA 压缩注意力 KV 表示,LatentMoE 压缩路由 FFN 的传输与计算表示;两者分别作用于注意力缓存路径和专家并行路径,可以在同一模型中组合。
  • UltraEP:LatentMoE 从架构侧减小路由载荷和单专家矩阵,UltraEP 在 gating 后依据精确负载复制专家并重路由 token;前者改变每条专家路径的成本,后者处理不同路径数量不均造成的设备级负载,两者处于互补层级。
  • Kimi K3:K3 后续使用 Stable LatentMoE,在潜空间路由专家之外加入 RMSNorm、SiTU-GLU 和 Quantile Balancing,分别处理聚合尺度、乘性激活上界和极稀疏路由负载;这条关系显示 LatentMoE 的低维专家路径还需要数值稳定与系统负载机制才能扩展到 896 个路由专家。
  • 与 NVIDIA Nemotron-3:本文和 NVIDIA 官方项目页说明 LatentMoE 已进入 Nemotron-3 Super 与 Ultra;该关系提供后续采用证据,单篇 v1 的组件级因果结论仍由本文消融承担。