2505.19645-moesd-sparse-moe-speculative-decoding

MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE

MoESD 把稀疏 MoE 的投机解码加速条件归结为专家加载趋于饱和且计算单元仍未充分利用的中等批量区间,并用目标模型验证效率和少量性能采样刻画这一范围;正式版本(camera-ready)在 Qwen2-57B-A14B 与 Mixtral-8x7B 上复现加速比先升后降的趋势,Qwen2 在两张 H800 上最高达到 2.29 倍,结论依赖普通上下文、近似均衡路由、MoE 前馈网络占主要成本和已测硬件范围。

Authors Zongle Huang, Lei Zhu (祝磊), Zongyuan Zhan, Ting Hu, Weikai Mao, Xianzhi Yu, Yongpan Liu (刘勇攀), Tianyu Zhang

Source

作者与关系

  • Zongle Huang: Tsinghua University;Beijing National Research Center for Information Science and Technology.
  • Lei Zhu: Huawei Noah's Ark Lab.
  • Zongyuan Zhan: Huawei Noah's Ark Lab.
  • Ting Hu: Huawei Noah's Ark Lab.
  • Weikai Mao: Huawei Noah's Ark Lab.
  • Xianzhi Yu: Huawei Noah's Ark Lab.
  • Yongpan Liu: Tsinghua University;Beijing National Research Center for Information Science and Technology.
  • Tianyu Zhang: Huawei Noah's Ark Lab.

论文由清华大学与华为诺亚方舟实验室共同完成。Zongle Huang 为第一作者,Yongpan Liu 与 Tianyu Zhang 为通讯作者;Lei Zhu 已在本站建档,本文补充了他在华为期间参与稀疏 MoE 推理加速研究的关系。

论文脉络

1. 研究问题、背景和价值

投机解码(speculative decoding)让小型草稿模型先生成若干候选 token,再由目标模型并行验证,从而减少目标模型的串行前向轮数。稠密模型每次前向都要读取全部权重,多 token 验证通常能复用同一批权重读取,因此容易获得加速。

稀疏混合专家模型(sparse mixture-of-experts, sparse MoE)每个 token 只路由到少量专家。一次自回归解码可能只触发部分专家,多 token 验证会触发更多专家并增加权重读取量。已有经验因此常把稀疏 MoE 视为投机解码的不利目标。MoESD 追问:随着批量增大,单 token 解码本身也会逐渐覆盖多数专家;此时多 token 验证新增的专家加载是否会变小,并让投机解码重新获得系统收益?

2. 已有解决方案与不足

既有投机解码研究主要优化草稿模型、候选树和接受率。接受率能够描述每轮最终保留多少候选 token,草稿成本能够描述提案开销,两者都无法单独说明同一目标模型在不同批量下的验证成本变化。

稀疏 MoE 系统工作还会使用专家缓存、预取、参数卸载和专家并行。缓存与预取依赖专家访问局部性;当中等批量已经使多数专家参与一次解码时,这类方法的可优化空间会缩小。MoESD 从目标模型的权重读取与计算利用率出发,补充了一个与草稿算法相对独立的分析维度。

3. 作者可能的思考路径

以下为本地分析:

  1. 把端到端投机解码时间拆成草稿生成、目标验证和拒绝采样三个部分。
  2. 固定草稿方案后,随批量明显变化的主要项是目标模型单 token 前向与多 token 验证之间的时间比。
  3. 稀疏 MoE 的目标验证成本同时受激活专家数和每个专家处理的 token 数影响。
  4. 批量增大时,激活专家数先趋于饱和;每个专家的计算量随后继续增长,最终使系统从内存带宽受限转为计算受限。
  5. 两个转折点之间形成投机解码的有效区间,可以用少量性能采样拟合具体模型与硬件上的位置。

4. 核心假设或切入点

  • 路由在专家间近似均衡,独立均匀路由可以作为激活数量的一阶近似。
  • 目标模型处于普通上下文长度,参数权重读取仍是主要内存成本;长上下文中的 KV cache 主导情形需要单独分析。
  • MoE 前馈网络在端到端时间中占有足够比例,使专家加载和计算状态能够反映到整体延迟。
  • 草稿模型足够小,接受率在不同批量间没有大幅变化;这样才能把主要趋势归因到目标模型。
  • 具体有效批量范围取决于模型结构、内核、并行方式、GPU 算力与带宽,需要实际性能采样(profiling)。

5. 方法 / 系统 / 理论框架

5.1 三个批量区间

令批量为 BB,每轮草稿长度为 γ\gamma。自回归目标模型每步处理 BB 个 token,投机验证约处理 BγB\gamma 个候选位置。

  • 小批量:单步解码只激活部分专家,多 token 验证额外激活更多专家。目标模型需要读取更多专家权重,验证延迟明显增加。
  • 中等批量:单步解码已经激活接近全部专家,多 token 验证新增的专家加载有限;每个专家分到的 token 仍较少,系统受内存带宽限制。验证可以利用尚未充分使用的计算单元,以较小的延迟增量处理更多 token。
  • 大批量:每个专家的计算量继续增长,目标模型逐渐转为计算受限。多 token 验证的计算成本直接进入延迟,加速比随之下降。

论文据此预测,稀疏 MoE 的投机解码加速比会随批量先升后降。稠密模型始终读取全部权重,缺少前半段的专家加载饱和过程,其验证效率随批量总体下降。

Figure 2(a): Qwen2 在 HumanEval、temperature 0、草稿长度 4 下的加速比与目标模型验证效率随批量变化。
Figure 2(a): Qwen2-57B-A14B-Instruct 在两张 A800 上的端到端加速比和目标模型验证效率均随批量先升后降,峰值位于中等批量。Image Source: arXiv v4 Figure 2(a).

5.2 目标模型验证效率

论文定义目标模型验证效率(target efficiency):

η(B,γ)=TT(B,1)TT(B,γ) \eta(B,\gamma)=\frac{T_T(B,1)}{T_T(B,\gamma)}

其中 TT(B,1)T_T(B,1) 是目标模型一次单 token 前向时间,TT(B,γ)T_T(B,\gamma) 是一次多 token 验证时间。该指标只观察目标模型和工作负载的系统条件:当多 token 验证相对单 token 前向的增量较小时,指标较高。

端到端加速仍同时取决于平均接受长度、草稿模型时间和拒绝采样时间。目标模型验证效率用于解释同一草稿算法在不同目标模型、批量与硬件上的变化,不能替代接受率。

5.3 专家激活与稀疏度

若共有 EE 个专家,每个 token 均匀选择 KK 个专家,tt 个 token 后的期望激活专家数为:

N(t)=E[1(EKE)t] N(t)=E\left[1-\left(\frac{E-K}{E}\right)^t\right]

N(t)N(t) 接近 EE 时,继续增加 token 主要提高已加载专家的计算量。论文用 DeepSeek-V2-Lite-Chat 和 Qwen1.5-MoE-Chat 的实际路由记录检验了这一近似。

令激活比例为 ρ=K/E\rho=K/E。在同样的 token 数下,ρ\rho 越低,每个已激活专家平均收到的 token 越少,MoE 前馈网络保持内存带宽受限的时间更长;计算受限转折点向更大批量移动。论文据此推导更稀疏的 MoE 可能拥有更宽的有效批量范围。

5.4 性能模型

作者把目标模型时间拆为稠密组件、激活专家数量、单专家工作量和 Roofline 模型中的转折,并加入草稿与拒绝采样成本。模型包含 10 个需要拟合的松弛参数。

实验共得到 228 个测量点,覆盖 6 种每 token 激活专家数、2 种草稿长度和 19 种批量;作者从排序后的数据中等间隔选择 21 点,以带边界的非线性最小二乘拟合参数,报告拟合耗时约 0.114 秒。该模型适合用少量性能采样恢复趋势和选择批量范围,仍需针对具体硬件与内核重新采样。

6. 结论链条

  1. 小批量下,多 token 验证会比单 token 解码激活更多专家,额外权重读取削弱投机解码收益。
  2. 批量增大后,单步解码已经覆盖接近全部专家,验证阶段的新增权重读取趋于稳定。
  3. 此时每个专家处理的 token 数仍不足以充分使用计算单元,多 token 验证的边际延迟较小。
  4. 批量继续增大后,目标模型进入计算受限区间,验证成本上升并压低加速比。
  5. 目标模型验证效率跟踪这一系统变化,接受率补充草稿算法质量,两者共同解释端到端结果。
  6. Qwen2 与 Mixtral 的跨硬件结果支持先升后降的趋势;稀疏度扩展实验和性能模型支持有效区间随结构与硬件移动。

关键实验/定理

结果 1:Qwen2 跨硬件端到端加速

  • 设置:Qwen2-57B-A14B-Instruct 为目标模型,Qwen2-0.5B-Instruct 为草稿模型;vLLM 与 CUDA Graph;HumanEval、MT-Bench;temperature 0/1;草稿长度 2/3/4;硬件覆盖 2×A800、2×H800、4×A800、4×L40。
  • Baseline:相同目标模型与服务实现的普通自回归解码。
  • 对照是否可比:同一模型、任务和硬件内比较端到端时间;不同草稿长度下普通解码时间存在测量波动,峰值用于描述观测上界。
  • 系统条件:典型短上下文;多 GPU 配置的具体张量并行、专家并行和互连拓扑未完整披露。
  • 指标定义:普通自回归时间除以投机解码时间;论文报告 10 次运行中的后 5 次均值,附录给出固定随机种子下的 5 次单次结果。
  • 成本归因:vLLM 日志分别记录草稿、目标验证和拒绝采样时间。
  • 结果:HumanEval、temperature 0、草稿长度 4 时,峰值分别为 2×A800 上 2.18 倍、2×H800 上 2.29 倍、4×A800 上 2.08 倍、4×L40 上 2.25 倍。MT-Bench 的峰值较低,2×H800、temperature 0、草稿长度 2 时为 1.46 倍。
  • 证据定位:Section 4.2,Figure 2,Table 1,Table 2,Appendix Figure 7;NeurIPS proceedings PDF pp. 8–10。
  • 支持的最窄结论:在已测 Qwen2 目标/草稿对、普通上下文和四种 GPU 配置上,中等批量能够显著改善稀疏 MoE 的投机解码收益,峰值和适用批量随硬件与任务变化。
  • 解读:2.29 倍是 HumanEval、低温度与特定硬件上的峰值;聊天任务、随机采样和较大批量的收益明显较低。

结果 2:Mixtral、稠密模型与目标模型验证效率

  • 设置:Mixtral-8x7B-Instruct-v0.1 搭配 EAGLE speculation head,在 2×A800 上重复 HumanEval 与 MT-Bench;另以 OPT-30B 搭配 OPT-350M 作为稠密模型对照。
  • Baseline:各模型普通自回归解码;Qwen2 与 Mixtral 使用不同草稿方案,跨模型绝对加速比不构成严格算法对照。
  • 对照是否可比:同一模型内的批量趋势可比;稠密与 MoE 的端到端对照涉及不同模型族、参数规模和草稿模型,论文同时用目标模型验证效率隔离目标侧趋势。
  • 系统条件:2×A800,vLLM。
  • 指标定义:端到端加速比与目标模型验证效率。
  • 成本归因:MoE 的前半段上升来自专家激活数量趋于饱和,后半段下降来自计算受限;稠密模型缺少专家激活饱和带来的上升阶段。
  • 结果:Mixtral 在 HumanEval、temperature 0、草稿长度 4 时峰值为 1.79 倍;其余设置峰值约 1.21–1.38 倍。MoE 的目标模型验证效率先升后降,稠密模型持续下降;附录端到端对照在该设置下于批量不小于 16 时显示 MoE 更有利。
  • 证据定位:Section 4.2,Figure 2(c),Table 1,Appendix Figure 6。
  • 支持的最窄结论:先升后降的目标侧趋势可在第二个 MoE 模型和另一种草稿机制上复现;“批量不小于 16”只适用于论文给出的具体稠密/MoE 对照。
  • 解读:正式版本新增的 Mixtral 与稠密端到端结果回应了初稿模型覆盖面和间接对照方面的评审意见。

结果 3:稀疏度推导、合成消融与性能建模

  • 设置:理论部分假设专家均匀独立激活;路由激活数在 DeepSeek-V2-Lite-Chat 与 Qwen1.5-MoE-Chat 上验证;稀疏度实验直接修改 Qwen2-57B-A14B 的每 token 激活专家数 KK,并按接受 token 比例修正原始加速比。
  • Baseline:不同 KK、草稿长度与批量的 GPU 测量;21 个采样点拟合,剩余测量用于观察趋势。
  • 对照是否可比:直接修改 KK 会改变模型输出与接受率,作者进行了比率修正;这些设置没有重新训练,无法等同于一组原生训练、质量匹配的不同稀疏度 MoE。
  • 假设:路由均衡;专家形状不变;MoE 前馈网络在端到端时间中占主要比例。
  • 适用域:普通上下文、已测 Qwen2 内核和硬件。
  • 指标定义:峰值批量位置,以及加速比保持在峰值除以平方根 2 以上的批量范围。
  • 结果:多数 KK 设置呈先升后降;激活比例降低时,峰值移向更大批量,阈值以上范围变宽。K=1,2K=1,2 持续下降,作者将其归因于直接改造后 attention 成为主要成本。
  • 证据定位:Section 3.2–3.3,Section 4.3,Figure 1,Figure 3,Appendix B。
  • 支持的最窄结论:在均衡路由的一阶模型和 Qwen2 合成稀疏度消融中,更低激活比例会延后计算受限转折;原生训练 MoE 之间的普遍规律仍需质量、参数量和内核匹配的复验。
  • 解读:该结果解释了适用区间如何随稀疏度移动,证据强度低于两个原生 MoE 模型的端到端加速结果。

OpenReview / 审稿意见吸收

  • Reviewer consensus: 五份官方评审认可问题的重要性、系统分解、目标模型验证效率和理论—实验对应关系;最终评分为 4、5、5、4、4,置信度为 3、2、4、2、1。
  • Main criticisms: 初稿模型与硬件覆盖有限;稠密模型对照主要依赖目标侧指标;缺少误差线与树式投机解码实验;性能模型仍依赖性能采样;部分分析可视为 Roofline 模型与专家激活概率的直接延伸,方法新颖性受到质疑。
  • Author response: 作者回复(rebuttal)与正式版本增加 Mixtral+EAGLE、4×A800、4×L40、稠密模型端到端曲线以及固定种子五次运行结果;作者解释了 21 点拟合选择、专家并行兼容性和中等批量的部署场景。
  • 对可信度的影响: 新增实验显著加强了趋势的跨模型、跨草稿方法和跨硬件证据。代码、生产服务级 SLO/吞吐评测、原生不同稀疏度模型对照和完整系统配置仍未公开,最稳妥的结论是识别出已测系统中的有效区间及其成因。

局限

  1. 理论采用近似均匀、独立的专家路由。实际热点专家、容量限制、token 丢弃、负载均衡策略和专家并行通信会改变激活饱和点。
  2. 长上下文中 KV cache 可能成为主要内存成本;论文明确把这一情形交给 MagicDec 等工作讨论,本文结果集中在提示长度约 5–391 token 的任务。
  3. 端到端实验覆盖两个 MoE 目标模型、两个任务和四种 GPU 配置;私有服务场景来自工作负载推断,缺少到达过程、尾延迟、有效吞吐(goodput)、服务等级目标和多租户调度实验。
  4. 稀疏度消融直接修改 Qwen2 的 KK 并修正接受比例,缺少原生训练、质量匹配且总参数或激活参数受控的模型族。
  5. 性能模型包含 10 个拟合参数,需要针对目标硬件、内核和并行配置采样;它提供经验建模路径,无法仅凭模型结构解析预测最佳批量。
  6. vLLM 版本或 commit、GPU 互连拓扑、并行策略、显存占用与完整内核设置披露不足。重复测量使用固定随机种子,也没有独立工作负载种子或置信区间。
  7. 截至 2026-07-24 未发现作者代码仓库,外部复现需要自行还原日志埋点、模型配对和系统配置。

跨论文关系

  • 与已有论文的作者或机构关系:Lei Zhu 同时参与 HiLS-Attention;两项工作都研究大模型推理效率,前者关注稀疏 MoE 的投机验证区间,后者关注超长上下文中的稀疏注意力。
  • 与已有论文的主题关系:DeepSeekMoE 的细粒度专家与 DeepSeek-V2 的高稀疏架构构成本文讨论“专家更多、激活比例更低”趋势的模型背景。
  • 与已有论文的方法或系统关系:Fast Inference from Transformers via Speculative Decoding 给出无损投机采样与接受率—草稿成本分析;MoESD 增加目标模型、批量和硬件共同决定验证成本的系统维度。
  • 与后续工作的关系:DFlashDSpark 主要提高草稿质量或调度效率;MoESD 的目标模型验证效率可以用于判断这些方法在稀疏 MoE 上的部署区间。SPORK 面向工具调用间隔内的自投机执行,工作负载和验证对象均有所不同。

主要启发

  • 评估投机解码时,应同时报告草稿接受情况和目标验证相对单步解码的成本;只看接受率会遗漏模型结构、批量和硬件造成的系统变化。
  • 稀疏 MoE 的批量选择需要同时观察激活专家数和每个专家的 token 数。前者判断权重加载是否趋于饱和,后者判断计算是否接近饱和。
  • “中等批量”是一个需要实测的运行区间。部署前可用少量批量扫描记录草稿、验证、拒绝采样时间,再按服务流量和尾延迟约束选择是否启用投机解码。