2601.18089-latentmoe-accuracy-per-flop-parameter
LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts
LatentMoE 将路由 token 和路由专家计算从模型隐藏维度投影到较窄潜空间,把节省的专家权重读取和全互联通信预算用于增加专家总数及 Top-k;在总参数与激活参数相近的 95B Transformer 和 73B Mamba–Attention 设置中,准确率优先变体在全部已报告下游汇总指标上高于标准 MoE,但现有端到端实测只覆盖两张 H100,万亿参数服务优势仍来自专有模拟器与跨模型缩放拟合。
Source
- Workflow version: v2.1
- Material type: research-paper
- Analysis modules: system, experiment
- Canonical source: https://arxiv.org/abs/2601.18089v1
- Title: LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts
- Authors: Venmugil Elango, Nidhi Bhatia, Roger Waleffe, Rasoul Shafipour, Tomer Asida, Abhinav Khattar, Nave Assaf, Maximilian Golub, Joey Guman, Tiyasa Mitra, Ritchie Zhao, Ritika Borkar, Ran Zilberstein, Mostofa Patwary, Mohammad Shoeybi, Bita Rouhani
- Responsible organization: NVIDIA
- arXiv: https://arxiv.org/abs/2601.18089v1
- HTML: https://arxiv.org/html/2601.18089v1
- PDF: https://arxiv.org/pdf/2601.18089v1
- TeX source: https://arxiv.org/src/2601.18089v1
- Code/Project: https://research.nvidia.com/labs/nemotron/LatentMoE/
- OpenReview / Review page: https://openreview.net/forum?id=iQRy0io4sb
- Submitted: 2026-01-26
- Published / updated: NVIDIA project page published 2026-01-27;ICML 2026 regular paper
- Current version read: arXiv v1, 2026-01-26
- ICML 2026 title: Revisiting Efficiency–Accuracy Scaling in Mixture-of-Experts Architectures
- Accessed: 2026-08-05
- Key figure decision: include
- Review status: page-type=official-review; match-confidence=high; observed-at=2026-08-05; venue-status=ICML 2026 regular
- License: CC BY 4.0
- Subjects: Machine Learning (cs.LG), Artificial Intelligence (cs.AI)
本文的机制、公式和实验数字以用户指定的 arXiv v1 为准。ICML 2026 公开论坛中的相同作者列表、摘要、LatentMoE 名称和实验规模支持两份材料为同一工作;论坛使用修订标题,并把 Joey Guman 和 Bita Rouhani 的姓名分别规范为 Joseph Guman 和 Bita Darvish Rouhani。审稿意见和作者回应单独归入后文,不把回应中承诺的增补当作 arXiv v1 已有内容。
作者与关系
- Venmugil Elango: NVIDIA。
- Nidhi Bhatia: NVIDIA。
- Roger Waleffe: NVIDIA。
- Rasoul Shafipour: NVIDIA。
- Tomer Asida: NVIDIA。
- Abhinav Khattar: NVIDIA。
- Nave Assaf: NVIDIA。
- Maximilian Golub: NVIDIA。
- Joey Guman: NVIDIA;ICML 2026 版本作 Joseph Guman。
- Tiyasa Mitra: NVIDIA。
- Ritchie Zhao: NVIDIA。
- Ritika Borkar: NVIDIA。
- Ran Zilberstein: NVIDIA。
- Mostofa Patwary: NVIDIA。
- Mohammad Shoeybi: NVIDIA。
- Bita Rouhani: NVIDIA;ICML 2026 版本作 Bita Darvish Rouhani。
arXiv v1 使用 NVIDIA 技术报告模板和 NVIDIA 版权声明,NVIDIA Nemotron 官方项目页列出相同作者集合;ICML 2026 OpenReview 页面为全部 16 位作者提供稳定作者标识。论文没有标注共同第一作者或通讯作者。默认建档范围据此只覆盖作者顺序前两位。两位核心作者都长期参与 NVIDIA 的模型—硬件协同与推理系统工作;Venmugil Elango 的公开论文记录还覆盖 GPU 数据移动、分布式训练与通信高效注意力,Nidhi Bhatia 的 NVIDIA 官方简介明确记录其生成式 AI 推理、性能建模和分布式推理方向。
论文脉络
1. 研究问题、背景和价值
标准混合专家模型(Mixture of Experts, MoE)用稀疏激活扩大总参数量,通常以单 token 的激活参数或 FLOPs 说明效率。实际服务还受到参数读取与跨设备数据移动约束:低并发解码时,每个专家分到的 token 很少,专家矩阵乘法难以形成足够高的算术强度;专家并行进入高吞吐区间后,路由 token 的全互联通信又可能占据主要时间。
论文据此把设计目标写成两个互补指标:单位 FLOP 的准确率反映计算效率,单位参数的准确率近似反映模型占用、专家权重读取、分片与通信压力。研究问题是:在不增加主要推理预算的条件下,MoE 中哪个结构维度可以缩小,以及节省的预算如何重新分配,才能提高模型质量。
2. 已有解决方案与不足
传统 MoE 主要通过增加专家总数并保持较小 Top-k,使总参数与单 token 计算解耦。这种设计仍让路由 token、全互联载荷和每个路由专家都使用模型隐藏维度
DeepSeekMoE 等细粒度方案通过减小专家中间维度并增加专家组合提高专门化程度;MoLAE 等方法对已训练专家做低秩压缩。论文认为这两条路径分别面临中间非线性容量下降、通信载荷仍处于完整隐藏维度或只压缩部分专家矩阵等限制。arXiv v1 对最接近方法的覆盖仍不完整:ICML 评审指出 BigMac 也在全互联前执行低维投影,作者在回应中承诺补充比较。这一遗漏降低了“首次改变 MoE 设计范式”等原创性表述的可信度。
3. 作者可能的思考路径
以下为本地重构。先把部署分成两个受限区间:低并发区间主要受专家权重读取限制,高吞吐区间主要受 token 全互联限制。再检查标准 MoE 的结构变量,可以得到三个方向:减小专家中间维度
直接压缩
4. 核心假设或切入点
方法依赖五项判断,其中前两项来自特定硬件与并行配置下的成本模型,后三项属于作者用于缩小设计空间的理论启发:
- 低延迟 MoE 的专家计算经常受 HBM 带宽限制,减小专家权重矩阵能够降低权重读取时间。
- 高吞吐专家并行经常受全互联通信限制,路由数据量与 Top-k 和路由表示维度近似成正比。
- 每个 token 的有效非线性宽度可用
近似;保持 与原始 有助于避免直接损失这部分容量。 - 任务相关特征存在某个有效秩下界,潜维度
高于该下界时,路由专家可以在压缩表示上工作。 - 同时增加专家总数与激活专家数会扩大可选专家组合,可能提高专门化和表达能力。
第 3 项借用单隐层 Barron 函数近似结果,第 4 项把“有效秩”作为解释性假设,第 5 项使用组合数量增长。它们没有共同构成训练损失或泛化误差定理;论文最终用消融和跨规模训练检查这些判断。
5. 贡献全景与方法总览
首要贡献是把路由专家路径从模型隐藏维度
辅助贡献包括五项模型—硬件协同设计原则、效率优先与准确率优先两个方法变体,以及从 16B 消融、95B Transformer、73B Mamba–Attention 到 H100 实测和万亿参数模拟的分层证据。全文中的关键对象承担不同角色:
- 标准 MoE:路由器、路由载荷、路由专家和共享专家都使用完整隐藏维度
。 - 路由专家:LatentMoE 中唯一进入潜空间的专家集合;其数量从
扩大为 ,其中 。 - 共享专家:所有 token 固定经过的专家,继续在
维工作。 - 路由器:继续从完整输入
计算专家分数,压缩不直接改变其输入信息。 - 效率优先变体
:扩大专家总数,保持 Top-k 不变,目标是以较少激活参数和通信维持基线质量。 - 准确率优先变体
:同时扩大专家总数与 Top-k,目标是在路由专家参数、计算和通信近似守恒时提高准确率。
端到端论证与执行链如下:
| 阶段 | 输入或初始条件 | 核心操作与传递对象 | 输出与作用 |
|---|---|---|---|
| 1. 部署瓶颈建模 | Qwen3-235B-A22B、GB200 NVL72、专家并行与精度假设 | 用 roofline 估计每专家 token 数对应的算术强度,再比较全互联时间与专家计算时间 | 得到低并发受 HBM 限制、高吞吐受通信限制的局部成本模型 |
| 2. 设计变量筛选 | 隐藏维度、专家中间维度、专家总数与 Top-k | 保持作者假设中的非线性宽度与有效秩条件,选择同时影响权重读取和通信载荷的路由维度 | 得到把 |
| 3. 潜空间专家执行 | 完整隐藏表示、路由分数与选中专家索引 | 下投影后传递潜表示;在潜空间执行分发、专家前向与聚合;上投影回模型隐藏维度 | 产生与残差路径兼容的 |
| 4. 预算重新分配 | 压缩比 |
两个变体都设 |
分别得到较低路由成本的模型和相近路由预算下更高容量的模型 |
| 5. 证据检查 | 三种模型规模、验证损失、下游准确率与服务负载 | 先消融压缩比和专家扩展,再跨骨干与规模训练;最后执行 H100 吞吐实测与万亿参数模拟 | 形成直接训练证据、实测系统证据和模拟证据三种强度不同的结论 |
只读本节可以复述首要结构变化、两个变体、路由器与共享专家的完整维度、阶段间传递的表示和最终证据类型。后续章节依次解释成本约束、潜空间执行、预算分配和验证边界。


6. 从部署成本模型筛选路由维度
第一阶段先判断低并发下专家矩阵乘法何时从带宽受限转成计算受限。论文以 Qwen3-235B-A22B 为例,设每个专家接收
分子是专家矩阵乘法 FLOPs,分母近似包含权重、输入和中间激活流量。GB200 的峰值 FP4 算力与 HBM 带宽之比为 1250 FLOPs/byte;代入
第二项成本是专家并行中的全互联通信。论文设 128 个专家分布在 64 张 GPU 上,分发使用 FP4、聚合使用 BF16,单 GPU 每层通信量近似为:
因子 2.5 对应每个元素 0.5 byte 的分发与 2 byte 的聚合。用峰值算力
该结果使通信载荷宽度
作者随后用质量约束排除其它变量。有效非线性预算被近似为:
这里的
为显式写出这项边界,本地重构先固定路由选择,并把路由专家的内容路径抽象为
第一项是潜表示无法区分具有相同
例如目标只依赖
减小
最后,扩大
组合数量增长只说明可选路由模式增加;专家能否形成有效专门化还取决于训练数据、路由学习、负载均衡和优化稳定性。论文用后续消融检查这一从组合计数到准确率的经验映射。
7. 潜空间路由专家的执行接口
第三阶段把前述结构约束变成可执行层。输入 token
效率优先变体的完整输出用于说明数据路径:
以 16B 消融模型为具体例子,基线取
这一执行路径的局部收益是:分发与聚合的数据宽度由
8. 两个变体把同一压缩预算用于不同目标
第四阶段决定压缩收益的用途。两个变体都将专家总数扩大为
准确率优先变体把 Top-k 同步扩大为
此时路由专家计算主项为
两个变体共同说明 LatentMoE 的首要贡献包含结构与预算分配两部分。只加入低维投影会降低模型参数和训练稳定性;Figure 4 显示在
9. 从压缩消融到系统测量的证据链
第五阶段先在 16B 总参数、2B 激活参数的 Transformer 上训练到约 1T token。Figure 3 比较压缩比,
随后作者把
系统证据分为实测和投影。Table 5 在两张 H100、vLLM、FP8 per-tensor 量化下测量 73B 混合模型的每 GPU 吞吐。准确率优先变体随并发度出现正负波动,单并发低约 12%,并发 4 和 64 略高,并发 16 和 128 低约 6%。这组结果支持“额外投影没有造成数量级开销”,同时表明解析成本守恒不能自动转成每个负载点的吞吐守恒。
Figure 7 使用未公开实现的专有模拟器扫描 20 万余个万亿参数服务点。作者先用 Qwen3 Dense 0.6B–32B 的 MMLU 结果拟合对数缩放关系,再把 Kimi-K2-1T-LatentMoE 的准确率映射为约 1.35 倍有效参数量,构造 1.35T 标准 MoE 对照。模拟给出准确率匹配时 1.24–3.46 倍的速度差。这条链同时跨越模型家族、稠密缩放曲线、指标与万亿参数系统模拟,可信度低于 95B/73B 直接训练和 H100 实测。
10. 结论链条
成本模型先指出低并发专家权重读取和高吞吐全互联载荷都含有路由维度
16B 消融直接支持
关键实验结果
结果 1:成本模型把两个部署瓶颈定位到路由维度
- 设置:Qwen3-235B-A22B,128 个专家、Top-8、
、 ;64 张 GB200 组成一个 NVLink 专家并行域,FP4 峰值算力 10 PFLOPs、HBM 带宽 8 TB/s、单向 NVLink 带宽 900 GB/s。 - 系统条件:假设 token 均匀分配,按峰值硬件规格计算,不含通信—计算重叠、路由偏斜和内核效率损失。
- 指标定义:算术强度为专家 FLOPs 与近似数据流量之比;通信/计算比为解析时间比。
- 结果:进入计算受限区间需要每专家至少 1418 个 token;给定参数下通信时间与计算时间之比约为 9。
- 成本归因:低并发成本归于专家权重读取,高吞吐成本归于完整隐藏维度上的全互联载荷。
- 对照是否可比:本结果是同一解析模型内的瓶颈分解,没有运行标准 MoE 与 LatentMoE 的端到端硬件对照;后者由结果 5 单独检查。
- 证据定位:arXiv v1 Section 2.1–2.2,Figure 2 及相邻公式。
- 支持的最窄结论:在该硬件、精度、拓扑和均匀路由模型下,减小路由表示维度同时作用于 HBM 与全互联流量主项。
- 解读:这是架构筛选依据,端到端效果需要实测确认。
结果 2:16B 消融确定压缩上限、专家扩展和变体分工
- 设置:16B 总参数、2B 激活参数 Transformer;基线采用 27 层、
、64 个路由专家、Top-6、2 个共享专家和 1408 中间维度;训练曲线延伸到约 1T token。 - 指标:验证损失。
- Baseline:相同基线架构与训练超参数下的标准 MoE。
- 结果:Figure 3 中
接近基线、 较差;Figure 4 中 压缩后保持 64 个专家明显较差,扩到 256 个专家恢复基线;Figure 5 中效率优先变体接近基线,准确率优先变体更低。 - 对照是否可比:论文说明压缩比扫描保持其它超参数不变,专家扩展消融使用同一基线超参数;没有报告多个随机种子、误差带和曲线末点的精确表格值。
- 证据定位:arXiv v1 Section 4.1,Figures 3–5。
- 支持的最窄结论:在该 16B 配置和训练配方中,
是论文测试范围内可维持质量的压缩比,增加专家总数是恢复压缩模型训练质量的必要配套,增加 Top-k 可进一步降低验证损失。 - 解读:消融支持方法内部因果链,尚未证明
对不同层、任务和模型家族普遍最优。
结果 3:准确率优先变体在两个大规模骨干的全部已报指标上提高
- 设置:95B Transformer 训练 300B token;73B Mamba–Attention 混合模型训练 1T token;两组都使用
,并在同组内使用相同超参数。 - 指标:MMLU Pro、MMLU、代码、数学和常识汇总准确率;代码与数学、常识各由论文列出的多个子基准平均得到。
- Baseline:相同骨干的标准 MoE。
- 结果:95B 基线到准确率优先变体分别为 29.26→34.91、58.95→62.23、40.33→41.50、64.39→64.88、74.32→75.18;73B 混合模型分别为 48.30→52.87、70.10→72.11、51.95→55.14、78.32→80.19、81.73→82.10。
- 对照是否可比:组内总参数与激活参数相近,训练超参数一致;论文称 95B LatentMoE 沿用为基线优化的超参数。训练数据组成、随机种子、置信区间和训练计算未披露。
- 证据定位:arXiv v1 Section 4.2,Tables 3–4;95B 收敛见 Figure 6。
- 支持的最窄结论:在这两个预训练设置中,准确率优先变体以相近参数规模在五个已报告汇总指标上均高于标准 MoE。
- 解读:跨 Transformer 与 Mamba–Attention 的一致方向提高了结构可迁移性的可信度;相同训练管线和单次运行限制了统计外推。
结果 4:效率优先变体降低激活参数,但存在任务级回退
- 设置:与结果 3 相同。
- 指标:激活参数及五个下游汇总准确率。
- 结果:95B 设置中激活参数从 8.47B 降到 5.62B,MMLU Pro、MMLU 和代码提高,数学与常识分别低 0.78 和 0.60;73B 设置中从 8.09B 降到 5.91B,前三项提高,数学与常识分别低 1.31 和 0.95。
- 对照是否可比:总参数相近,训练超参数一致;实际 FLOPs、投影计算和各任务方差没有完整表格。
- 证据定位:arXiv v1 Section 4.2,Tables 3–4。
- 支持的最窄结论:效率优先变体在两组设置中用约 27%–34% 更少激活参数维持总体接近或更好的结果,但不能支持“每项任务都不降”的结论。
- 解读:该变体适合允许小幅任务级回退、优先降低激活成本的部署目标。
结果 5:两张 H100 的吞吐大致相近,负载点之间没有单调优势
- 设置:Hybrid-73BT-8BA,准确率优先 LatentMoE 与标准 MoE;两张 Hopper H100,vLLM,FP8 per-tensor 量化。
- 系统条件:论文未披露输入/输出长度、prefill/decode 比例、vLLM commit、内核版本和重复测量方差。
- 指标定义:并发度 1、4、16、64、128 下的 tokens/s/GPU。
- 结果:LatentMoE 与标准 MoE 依次为 181.6/206.6、528.5/509.8、1130.8/1204.6、1569.6/1549.3、1625.8/1725.9。
- 成本归因:额外下/上投影和较小专家 GEMM 形状会产生开销;论文提出分离 CUDA stream 和较小矩阵专用 CUTLASS 内核作为后续优化。
- 对照是否可比:模型骨干、硬件、运行时和量化口径一致;缺少延迟分位数、显存、网络流量和算子分解。
- 证据定位:arXiv v1 Section 4.3,Table 5。
- 支持的最窄结论:该双 H100 设置中,准确率优先变体的每 GPU 吞吐位于基线的约 0.88–1.04 倍,额外结构开销有限且没有在全部并发点达到同速或更快。
- 解读:这组实测支持“相近吞吐”,无法支持一般性的低延迟或大规模专家并行加速。
结果 6:万亿参数服务优势属于模拟与缩放拟合结论
- 设置:专有高保真模拟器扫描 20 万余个点;decode-heavy chunked piggybacking 的输入/输出序列长度为 8192/16384,prefill-heavy disaggregated serving 为 50000/2048;比较 Kimi-K2-1T-LatentMoE、原生 Kimi-K2-1T 和按深度扩到 80 层的 Kimi-K2-1.35T。
- 系统条件:模拟器实现、校准误差、硬件拓扑和主要模型参数未公开。
- 指标定义:通过 Qwen3 Dense 0.6B–32B 的 MMLU 对数拟合得到有效参数倍率,再构造准确率匹配的标准 MoE;系统图使用归一化 tokens/s/GPU 与 tokens/s/user。
- 结果:有效参数倍率约 1.35,准确率匹配的标准 MoE 因而增加约 350B 参数;模拟中的标准 MoE 沿 Pareto 前沿慢 1.24–3.46 倍,原生 1T 模型与 1T LatentMoE 的差异不超过约 9%。
- 成本归因:大部分差异来自为匹配预测准确率而增加的 350B 参数,直接投影开销对应较小的原生 1T 对照差异。
- 对照是否可比:准确率匹配通过跨模型家族、跨参数区间的拟合构造,没有训练或实测 1.35T 标准 MoE。
- 证据定位:arXiv v1 Section 4.3.1,Equations 3–5,Figure 7。
- 支持的最窄结论:在论文的 EPM 假设和专有模拟器中,LatentMoE 比通过增加深度达到预测同准确率的标准 MoE 具有更优吞吐—延迟前沿。
- 解读:这项结果说明潜在系统收益的量级,不能写成已经测得的万亿参数加速。
OpenReview / 审稿意见吸收
- Reviewer consensus: 论坛可读到 4 份正式评审,初始
overall_recommendation依次为 4、3、4、4,confidence依次为 3、2、3、3。评审普遍认可 roofline 驱动的结构选择、方法改动简洁和 73B/95B 规模训练证据;对理论形式化、相关工作覆盖、系统测量完整性和万亿参数投影的评价更谨慎。 - Main criticisms: 主要问题包括与 MLA、MoLAE、BigMac 等方法的区别不充分;有效秩与 Barron 函数只提供启发式说明;符号、目标与原则间权衡不够清楚;缺少不同专家并行规模、MFU 或硬件利用率、通信与权重读取分解、路由熵和负载不均衡量化;标准 MoE 之外的对照有限;较小 GEMM 可能需要专用 CUTLASS 内核;统一
缺少逐层、逐任务敏感性;万亿参数结论依赖专有模拟器和从小型稠密模型外推的 EPM。 - Author response: 作者区分了两个变体的预算目标,说明路由器使用完整
维输入、共享专家不压缩,并称相同训练超参数下没有观察到收敛问题,辅助损失自由的负载均衡保持了专家分布。回应给出投影计算约占 95B 路由专家计算的 、双 H100 单并发约 12% 开销和较高并发最多约 6% 吞吐下降等解释,并承诺补充 BigMac、符号定义、组件成本、模拟局限、社会影响和更大规模 silicon 对照。除 Table 5 已在 v1 中可查的吞吐外,这些新增分解与承诺未全部出现在 arXiv v1,当前笔记保留为回应主张。 - Decision: ICML 2026 最终决定为
Accept (regular)。领域主席认为工作达到接收标准,指出大规模经验验证是主要优势,同时记录评审对相关工作不足和万亿参数服务分析仍有明显保留;该决定主要来自领域主席对论文的独立评价。 - 对可信度的影响: 公开评审和正式接收提高了方法与直接训练结果经过外部检查的可信度,也明确暴露了当前证据分层。16B 消融、95B/73B 训练与双 H100 实测可以作为主要证据;万亿参数模拟、理论普遍性和部署可移植性继续保持较低结论强度。
局限
- 五项设计原则没有形成统一优化目标或一般性定理。Barron 函数结果到深层 MoE 的映射、任务有效秩和专家组合数量到准确率的映射都属于启发式解释;现有消融只在有限模型与训练配置中验证。
- GB200 成本模型假设均匀路由、峰值算力与带宽,并省略通信—计算重叠、链路竞争、内核占用和实际 collective 行为;真实测量使用两张 H100,无法直接验证 64 张 GB200 专家并行模型。
- 压缩敏感性主要比较统一的
与 8,没有逐层、逐任务或逐模型估计 ,也没有多个随机种子、误差带或显著性报告。 - 主要对照是同骨干标准 MoE。arXiv v1 缺少 BigMac 等相邻低维路由方案和更广泛现代 MoE 变体的同预算比较;相同基线超参数提高了控制性,也可能使 LatentMoE 与专门调参后的上限无法比较。
- 论文披露了 8B 激活模型的学习率日程、序列长度、batch、warmup 和负载均衡系数,训练数据组成、过滤与去重、优化器完整配置、训练硬件与并行方式、随机种子、GPU-hours、能耗和成本仍未披露。
- H100 实测只报告 tokens/s/GPU。输入/输出长度、prefill/decode 分解、首 token 延迟、token 间延迟、尾延迟、显存、网络字节、运行时版本和方差缺失;小矩阵 GEMM 的内核效率可能改变不同硬件上的结论。
- 万亿参数结果没有实物模型或公开模拟器。EPM 从 Qwen3 Dense 0.6B–32B 的 MMLU 拟合外推到万亿参数 MoE,再把估计准确率转换为服务规模;任一迁移假设变化都会改变 350B 参数差和 1.24–3.46 倍速度差。
- 论文称 LatentMoE 已用于 Nemotron-3 Super 和 Ultra,这一部署事实由 NVIDIA 后续报告与项目页支持;它不能替代在同数据、同训练预算下隔离 LatentMoE 贡献的对照。
- 降低大规模模型服务成本可以减少单位请求资源消耗,也会降低高能力模型的部署门槛;公开评审要求补充这项双用途边界,arXiv v1 尚无系统风险分析。
主要启发
1. 高成本数据路径可以使用较窄表示,节省的预算可以增加按需激活的容量
标准 MoE 让路由载荷和路由专家计算都使用模型隐藏维度,模型容量与推理成本因而共同受到这一宽度约束。LatentMoE 在 Section 2 指出的权重读取与全互联通信问题上执行了关键转换:路由器、共享专家和残差路径继续使用完整表示,只有路由专家的通信与计算进入较窄潜空间。Figure 3 中四倍压缩接近基线、八倍压缩出现退化,说明这项转换依赖潜表示仍能保留任务相关信息,压缩比例存在质量边界。
Figures 4–5 提供了区分性证据:只压缩路由维度并保持 64 个专家会提高验证损失,把专家总数增加到 256 后恢复基线轨迹,再把每个 token 激活的专家数从 6 增加到 24 后取得更低损失。这组对照支持的核心判断是,不同数据路径可以使用不同表示宽度;高成本路径只保留完成局部任务所需的信息后,节省的参数、计算与通信预算可以投入更多候选专家或更多激活专家。效率优先变体保留这部分节省,准确率优先变体把节省重新投入按需激活的容量。专家能否形成有效分工仍取决于路由学习和负载均衡,组合数量增加本身不能保证准确率提高。
本地分析把这项判断抽象为一条可迁移关系:当主要成本随某条数据路径的表示宽度增长,而该路径只需要较低维的任务相关信息时,可以压缩这条路径,并把节省的预算投入更直接影响结果的按需容量。注意力可以检查压缩 Key/Value 表示后用相同显存支持更长上下文,跨设备模型可以检查压缩传输激活后增加分支或 token,检索系统可以检查缩小索引表示后扩大候选集合。迁移成立时,相同资源预算下的“压缩并增加容量”应同时优于原设置和“只压缩”设置;潜表示丢失关键信息、实际瓶颈不随宽度变化、投影与小矩阵内核抵消节省,或新增容量没有被有效使用时,该预测会失败。Table 5 的双 H100 结果表明实际吞吐仍随并发点波动,因此这些迁移属于待验证设计方向。
跨论文关系
- 与 DeepSeekMoE:DeepSeekMoE 通过缩小专家中间维度并增加激活专家数扩大组合粒度,同时用共享专家隔离通用知识;LatentMoE 保持中间维度,缩小路由输入与输出宽度,再扩大专家总数和 Top-k。两者都把计算预算分配给更细的专家组合,修改的是专家矩阵的不同轴。
- 与 DeepSeek-V2:DeepSeek-V2 的 MLA 压缩注意力 KV 表示,LatentMoE 压缩路由 FFN 的传输与计算表示;两者分别作用于注意力缓存路径和专家并行路径,可以在同一模型中组合。
- 与 UltraEP:LatentMoE 从架构侧减小路由载荷和单专家矩阵,UltraEP 在 gating 后依据精确负载复制专家并重路由 token;前者改变每条专家路径的成本,后者处理不同路径数量不均造成的设备级负载,两者处于互补层级。
- 与 Kimi K3:K3 后续使用 Stable LatentMoE,在潜空间路由专家之外加入 RMSNorm、SiTU-GLU 和 Quantile Balancing,分别处理聚合尺度、乘性激活上界和极稀疏路由负载;这条关系显示 LatentMoE 的低维专家路径还需要数值稳定与系统负载机制才能扩展到 896 个路由专家。
- 与 NVIDIA Nemotron-3:本文和 NVIDIA 官方项目页说明 LatentMoE 已进入 Nemotron-3 Super 与 Ultra;该关系提供后续采用证据,单篇 v1 的组件级因果结论仍由本文消融承担。