2503.01840-eagle-3-training-time-test
EAGLE 3: Scaling up Inference Acceleration of Large Language Models via Training Time Test
EAGLE-3 去除 EAGLE 的特征回归约束,以低、中、高层目标特征融合和训练时测试中的多步自生成展开直接优化草稿 token 分布,使 LLaMA-3.1-8B 在等量数据比较中保持随数据规模增长的加速收益,并在 MT-Bench 将 EAGLE-2 的 3.16 倍加速提高到 4.40 倍;6.47 倍是 Vicuna-13B、HumanEval、temperature 0 的单批量峰值,生产框架收益在 SGLang 批量 64 时为 1.38 倍,方法依赖目标模型内部特征、目标模型专用训练和具体批量与执行内核。
Source
- Workflow version: v2.1
- Material type: research-paper
- Analysis modules: experiment, system
- Canonical source: https://proceedings.neurips.cc/paper_files/paper/2025/hash/c7b5a35ea98b62512a869c19ea7b03cb-Abstract-Conference.html
- Title: EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test
- Authors: Yuhui Li, Fangyun Wei, Chao Zhang, Hongyang Zhang
- Responsible organization: University of Waterloo, Peking University, Microsoft Research, Vector Institute;当前 OpenReview 论文版本另列 EAGLE AI CORP
- arXiv: https://arxiv.org/abs/2503.01840
- PDF: https://proceedings.neurips.cc/paper_files/paper/2025/file/c7b5a35ea98b62512a869c19ea7b03cb-Paper-Conference.pdf
- Code/Project: https://github.com/SafeAILab/EAGLE
- OpenReview / Review page: https://openreview.net/forum?id=4exx1hUffq
- Submitted: arXiv v1, 2025-03-03
- Published / updated: NeurIPS 2025 Poster;arXiv v3 更新于 2025-04-23
- Current version read: NeurIPS 2025 proceedings / 当前 OpenReview 论文版本 / arXiv v3
- Version / revision read: proceedings PDF、arXiv v3 TeX source、OpenReview submission/reviews/rebuttals/decision;代码仓库 commit
cb7e0841fe0c206c6ed74a197ad5e2a1f13f5a2b - Accessed: 2026-07-24
- Key figure decision: include
- Review status: page-type=official-review; match-confidence=high; observed-at=2026-07-24; venue-status=NeurIPS-2025-poster
- Subjects: Computation and Language (cs.CL)
作者与关系
- Yuhui Li: University of Waterloo;Peking University.
- Fangyun Wei: Microsoft Research.
- Chao Zhang: Peking University.
- Hongyang Zhang: University of Waterloo;Vector Institute;EAGLE AI CORP.
Yuhui Li 为第一作者,四位作者连续合作完成 EAGLE、EAGLE-2 与 EAGLE-3。正式稿只给出作者顺序和邮箱,没有共同一作或通讯作者符号。该合作关系连接北京大学、微软研究院与滑铁卢大学 / Vector Institute;Hongyang Zhang 的个人主页把 EAGLE 系列列为重点项目,Fangyun Wei 的微软研究院页面收录了 EAGLE 系列论文。当前 OpenReview PDF 增加了 EAGLE AI CORP 机构信息,本文将其与 proceedings 版本的论文时机构分开记录。
论文脉络
1. 研究问题、背景和价值
投机解码(speculative decoding)让低成本草稿模型先生成候选 token,再由目标模型并行验证。严格的接受与修正过程可以保持目标模型的输出分布,同时用一次目标模型前向接受多个 token。
EAGLE 系列把目标模型的高层隐藏状态提供给一个单层草稿 Transformer,并在隐藏状态空间中自回归生成候选。它比完全独立的小型草稿模型获得了更高接受率。EAGLE-3 关注一个后续问题:增加草稿训练数据时,原始 EAGLE 的接受率和加速比很快趋于饱和,草稿模型没有像普通语言模型一样稳定利用更多数据。
这个问题具有两层价值。算法层面,更长的平均接受长度能够减少目标模型串行验证轮数;系统层面,草稿质量只有在草稿开销、目标验证成本和批量条件合适时才会转化为端到端收益。
2. 已有解决方案与不足
原始 EAGLE 同时优化特征回归损失和 token 预测损失。特征回归让只经历一步教师状态训练的草稿模型,可以在推理时递归使用自己的预测特征;它也要求草稿输出逼近目标模型的特定高层特征。该中间目标限制了草稿表示服务最终 token 分布的自由度,增加数据后收益较快饱和。
直接移除特征回归会产生新的训练—推理分布偏移:第一步草稿可以改善,第二步开始接收的是草稿模型自身输出,而常规训练只提供目标模型的真实特征。论文的 Figure 4 显示,这种方法的首个草稿 token 接受率提高,后续接受率迅速下降。
HASS 已经在训练中模拟多步草稿过程,以缓解 EAGLE 的特征误差累积;它仍保留特征回归和目标模型顶层特征输入。EAGLE-3 把训练多步展开用于另一个目标:允许草稿隐藏状态脱离目标特征空间,并在自身递归状态上直接学习目标 token 分布。
3. 作者可能的思考路径
以下为本地分析:
- 先沿数据规模增加 EAGLE 的训练样本,观察到加速比和平均接受长度很快趋于稳定。
- 将训练目标拆为最终 token 分布与中间特征回归,识别后者对草稿表示的约束。
- 移除特征回归并检查逐步接受率,定位到第一步改善、后续步骤退化的训练—推理分布偏移。
- 在训练阶段展开草稿模型,把前一轮自生成隐藏状态送入下一轮,让后续步骤直接暴露于部署时输入。
- 特征回归约束解除后,输入侧可以使用多层目标特征;低、中、高层融合为多步未来 token 提供比最后一层更丰富的信息。
- 最后把较高接受长度接入 EAGLE-2 动态草稿树,并分别测量研究原型和 SGLang / vLLM 中的端到端收益。
4. 核心假设或切入点
- 目标模型严格验证草稿并执行正确的拒绝采样与残差修正,生成分布才能与普通自回归解码一致。
- 目标模型能够公开低、中、高层隐藏状态及 LM head;每个目标模型需要训练与其结构和词表匹配的草稿模型。
- 一层草稿 Transformer 的计算和内存开销足够低,增加的平均接受长度可以覆盖草稿生成成本。
- 训练数据能够代表部署任务;代码、数学或特定推理数据会明显改变任务上的接受率。
- 多步训练展开能够覆盖推理时常见的草稿自身状态,展开步数、采样方式和损失权重会影响结果。
- 生产收益受批量、候选树、执行框架、GPU 和内核共同控制,研究原型的单批量峰值不能直接替代服务吞吐。
5. 方法 / 系统框架
5.1 去除特征回归后的训练时测试
训练时测试(training-time test, TTT)在本文中指训练阶段模拟多轮草稿生成,并把每一轮草稿模型输出的隐藏向量回送到下一轮。目标模型和草稿模型在在线推理期间都不更新参数。
第一轮以目标模型融合特征和已采样 token 的 embedding 为输入。草稿层输出一个不受目标特征回归约束的隐藏向量,经目标模型 LM head 得到 token 分布。下一轮用该草稿隐藏向量替代尚未经过目标模型验证的位置,并继续预测更远 token。训练使用专门的注意力 mask:原始训练序列保持因果依赖,同一轮并行产生的位置在后续轮次只读取对应路径,避免把互不构成同一前缀的候选混合起来。
现行官方代码进一步说明了损失口径:eagle/traineagle3/cnets.py 用目标模型概率与草稿 log-probability 计算 token 分布交叉熵;main.py 对第 i 轮损失赋予 0.8^i 权重。草稿层仍输出隐藏向量并复用目标 LM head,“直接 token 预测”具体指移除特征回归目标、直接按 token 分布训练。

5.2 多层目标特征融合
目标模型最后层隐藏状态紧邻 LM head,主要服务下一个 token 的 logits。更远 token 还可能需要中间层保留的词法、句法和语义信息。EAGLE-3 从目标模型低层、中层和高层各取一组隐藏状态,沿隐藏维拼接,再经全连接层投影回目标隐藏维度。投影结果与上一时刻采样 token 的 embedding 拼接并降维,送入单层草稿 decoder。
论文正文只使用低、中、高层的功能描述。作者答辩与现行 LLaMA 代码给出具体选择:循环索引 2、总层数整除 2 和总层数减 3。答辩消融显示,只要避开最后一层并融合多个层级,邻近的三层、四层或五层选择差异很小;精确层位缺少理论选择准则和跨架构系统验证。
5.3 草稿树与严格验证
推理阶段继续交替执行草稿生成与目标验证,并复用 EAGLE-2 的置信度驱动动态草稿树。正式稿把树深从 EAGLE-2 的 6 增加到 8,候选节点预算保持相同。严格验证决定“无损”性质,草稿模型只影响接受长度和运行时间。
SGLang 与 vLLM 的生产框架实验关闭草稿树,分别使用最大长度 3 和 2 的候选链。这些配置降低树构建和树注意力集成成本,也使其结果与主表中的研究原型不构成直接性能对照。
5.4 贡献范围校准
多步训练展开、树式注意力 mask 和把模型自身输出送回训练均有既有方法基础。正式稿将 HASS 列为最接近的投机解码方法,并在附录把自生成输入联系到循环模型时代的 scheduled sampling。EAGLE-3 得到直接证据支持的组合贡献是:解除特征回归约束后,用部署状态的多步展开维持递归草稿质量,再利用多层目标特征和更多训练数据提高接受长度。
论文把四个数据规模点上的单调增长称为“scaling law”。这些点说明 EAGLE-3 在已测设置中具有更好的数据可扩展性;它们还没有确定函数形式、指数、饱和位置或跨模型稳定性。
6. 结论链条
- EAGLE 的特征回归让一步训练能够递归执行,同时限制草稿表示围绕最终 token 目标继续优化。
- 移除这一约束会改善首步预测,并让后续步骤暴露训练—推理分布偏移。
- 训练时多步展开把草稿自身隐藏状态纳入后续轮次输入,逐步接受率随自生成输入增加时保持稳定。
- 多层目标特征融合继续提高平均接受长度;LLaMA-3.1-8B 消融中,两项改动把 MT-Bench 加速从 3.16 倍依次提高到 3.82 倍和 4.40 倍。
- 等量数据曲线显示 EAGLE-3 随数据规模继续改善,EAGLE-2 与 HASS 较早趋于稳定。
- 更长接受长度在研究原型中形成 3.0–6.5 倍的单批量加速;生产框架中的收益随批量增大而收窄。
关键实验/定理
结果 1:特征约束与多层融合消融
- 设置:LLaMA-3.1-8B-Instruct;MT-Bench 与 GSM8K;temperature 0;从 EAGLE-2 依次加入去除特征回归约束和多层特征融合。
- Baseline:EAGLE-2;论文中的第一项方法变体使用训练时展开并继续沿用单一高层特征,第二项方法变体加入低、中、高层融合。
- 对照是否可比:同一目标模型、任务和推理原型内的增量消融;论文没有报告多随机种子或误差线。
- 系统条件:主实验使用 EAGLE-2 动态草稿树;正式稿正文称 70B 使用 A100、较小模型使用 RTX 3090,部分表注又概括为 A100,硬件描述存在冲突。
- 指标定义:普通自回归延迟除以投机解码延迟;平均接受长度表示每轮草稿—验证最终前进的平均 token 数。
- 成本归因:两项改动都提高草稿接受长度;表格没有分别报告草稿时间和目标验证时间。
- 结果:MT-Bench 上 EAGLE-2 为 3.16 倍 / 4.05 token,去除特征约束后为 3.82 倍 / 5.37 token,加入多层融合后为 4.40 倍 / 6.13 token;GSM8K 对应为 3.39 倍 / 4.24、3.77 倍 / 5.22 和 4.48 倍 / 6.23。
- 证据定位:Section 4.3,Table 2;Figure 7 的逐步接受率;proceedings PDF。
- 支持的最窄结论:在 LLaMA-3.1-8B 的两个任务和该研究原型中,解除特征回归与多层融合都提供增量收益。
- 解读:该消融直接支持两个设计组件;模型架构、数据和硬件变化后的贡献比例仍需复验。
结果 2:等量数据扩展
- 设置:LLaMA-3.1-8B-Instruct、MT-Bench;训练数据规模为 ShareGPT 的 1、2、4、8 倍;该数值表由作者在 OpenReview 答辩中补充。
- Baseline:EAGLE-2、HASS;三种方法使用相同数据规模进行比较。
- 对照是否可比:数据量轴对齐,能够减少主表中 EAGLE-3 使用约 8 倍数据造成的混杂;代码版本、训练超参数和方法固有结构仍有差异。
- 系统条件:答辩沿用论文的研究原型;没有提供多随机种子、误差线或完整逐点训练成本。
- 指标定义:相对普通自回归解码的加速比。
- 成本归因:数据扩展提高草稿接受长度;端到端曲线同时包含草稿生成和目标验证成本。
- 结果:EAGLE-2 在四个规模上为 3.16、3.36、3.40、3.43 倍,HASS 为 3.55、3.75、3.81、3.84 倍,EAGLE-3 为 3.71、3.99、4.24、4.40 倍。
- 证据定位:Figure 2;OpenReview author response。
- 支持的最窄结论:在一个目标模型和一个任务的四个数据规模上,EAGLE-3 的加速收益保持单调增长,EAGLE-2 与 HASS 较早趋于稳定。
- 解读:这组结果支持“数据可扩展性改善”。四点经验曲线还不足以建立具有函数形式和跨设置预测能力的缩放定律。
结果 3:四个目标模型和五项任务的研究原型结果
- 设置:Vicuna-13B、LLaMA-3.1-8B-Instruct、LLaMA-3.3-70B-Instruct、DeepSeek-R1-Distill-LLaMA-8B;MT-Bench、HumanEval、GSM8K、Alpaca、CNN/DailyMail;temperature 0 与 1;同一目标模型的草稿权重跨任务使用。
- Baseline:普通自回归解码、标准投机采样、PLD、Medusa、Lookahead、Hydra、HASS、EAGLE 和 EAGLE-2;部分方法只在 Vicuna 上有可用权重,放宽非贪心接受条件的方法没有进入 temperature 1 对照。
- 对照是否可比:同一目标模型内的 EAGLE-2 / EAGLE-3 延迟比较最直接;EAGLE-3 使用 ShareGPT 与 UltraChat 合计约 53.2 万条数据,约为原始 EAGLE 训练数据的 8 倍,主表没有对所有基线统一训练数据。
- 系统条件:单批量研究原型;EAGLE-3 使用与 EAGLE-2 相同节点预算、深度 8 的动态树;GPU 描述存在正文与表注冲突。
- 指标定义:端到端加速比与平均接受长度。
- 成本归因:表格给出端到端结果,没有分解草稿、树构造、目标验证和接受修正时间。
- 结果:temperature 0 时,EAGLE-3 在 Vicuna-13B、LLaMA-3.1-8B、LLaMA-3.3-70B 和 DeepSeek-R1-Distill-LLaMA-8B 上的五任务平均加速分别为 5.51、4.44、4.12 和 4.16 倍;对应 EAGLE-2 为 4.22、3.23、2.85 和 3.26 倍。全表峰值为 Vicuna-13B、HumanEval 的 6.47 倍,平均接受长度 7.54;DeepSeek 蒸馏模型在 GSM8K 达到 5.01 倍,作者将其与额外使用 OpenThoughts-114k-math 训练联系起来。
- 证据定位:Section 4.2,Figure 1,Table 1;proceedings PDF。
- 支持的最窄结论:在四个已测目标模型、五项短上下文任务和单批量原型中,EAGLE-3 的平均接受长度与端到端加速均高于 EAGLE-2。
- 解读:6.47 倍受代码模板可预测性、Vicuna-13B、temperature 0 和研究原型共同限定;跨任务差异说明训练数据与工作负载匹配度会显著改变接受率。
结果 4:SGLang、vLLM 与答辩中的 MoE 结果
- 设置:SGLang v0.4.4 使用单张 H100、LLaMA-3.1-8B-Instruct、MT-Bench、长度 3 的候选链;vLLM 使用同一目标模型与任务、长度 2 的候选链,正文写 RTX 3090、表注写 A100。两组实验都关闭候选树。
- Baseline:相同框架中的普通自回归解码与 EAGLE;SGLang 另在 batch size 1 报告 EAGLE-2。
- 对照是否可比:各框架内部相对普通解码的吞吐比较可比;链长、硬件和框架不同,无法与主表或彼此直接比较。
- 系统条件:SGLang 批量 2–64;vLLM 批量 2–56;没有报告提示 / 输出长度分布、并发调度细节、尾延迟或显存占用。
- 指标定义:相对普通解码的吞吐提升;SGLang batch size 1 另给出 tokens/s。
- 成本归因:论文把批量增大后的收益收窄归因于目标解码从内存带宽受限逐渐提高计算利用率;表格没有独立测量草稿和目标阶段。
- 结果:SGLang batch size 1 的普通解码、EAGLE-2、EAGLE-3 分别为 158.34、244.10、373.25 tokens/s,EAGLE-3 相对普通解码为 2.36 倍;batch size 64 时为 1.38 倍。vLLM 中 EAGLE-3 从 batch size 2 的 1.75 倍下降到 batch size 56 的 1.01 倍。作者答辩另报告 SGLang 上 Llama 4 Scout 109B MoE 为 2.00 倍、Maverick 400B MoE 为 2.18 倍。
- 证据定位:Section 4.4–4.5,Tables 3–5;OpenReview author response。
- 支持的最窄结论:EAGLE-3 的草稿改进可以进入两个生产推理框架,并在已测批量范围内延后收益消失的位置;MoE 数值只构成答辩阶段的初步扩展证据。
- 解读:生产收益明显低于研究原型峰值,并随批量增大接近 1;部署决策需要在实际框架中扫描批量、链长和工作负载。
OpenReview / 审稿意见吸收
- Reviewer consensus: 四份官方评审认可投机解码问题的重要性、去除特征约束与多层融合的实用价值、较完整的消融和生产框架集成。最终评分为 5、5、4、4,置信度为 3、2、4、3;最终决定为 Accept(Poster)。
- Main criticisms: 初稿没有给出精确层选择与理论依据;训练采样步数和部分实现细节缺失;70B 草稿训练使用 16 张 A100 约两周,成本较高;主实验覆盖的架构和规模有限;EAGLE-3 使用更多数据可能混杂算法收益;生产框架没有使用草稿树且加速较低;方法需要目标模型内部特征;实验缺少误差线和统计显著性。置信度 4 的评分 4 评审在作者回复后仍认为层选择依据和跨架构证据不足。
- Author response: 作者补充具体层选择及多组相邻层消融、ShareGPT 1/2/4/8 倍的等量数据曲线、训练使用 7 个采样步骤、生产链长选择说明,以及 Llama 4 Scout / Maverick MoE 的 SGLang 结果。作者把 70B 训练成本解释为 7 轮草稿展开,相当于训练约 7 个草稿层,相对 80 层目标模型仍较小,并承认实现尚未充分优化。
- 对可信度的影响: 等量数据曲线加强了“解除特征约束后可继续利用更多数据”的核心判断,层选择消融说明精确层位在已测邻域内不敏感。生产结果和 MoE 扩展提高了工程相关性。缩放定律表述、层选择理论、训练成本、跨架构覆盖与统计稳定性仍缺少充分证据,因此最可靠结论集中在已测模型上的数据可扩展性和接受长度改善。
局限
- 论文的“scaling law”来自 LLaMA-3.1-8B、MT-Bench 和四个数据规模点,没有拟合函数、指数、置信区间或外推检验。现有证据支持单调经验曲线和较晚饱和,无法预测更大数据规模或其他目标模型。
- 6.47 倍是 Vicuna-13B、HumanEval、temperature 0、单批量和动态树配置下的峰值。SGLang batch size 64 为 1.38 倍,vLLM batch size 56 为 1.01 倍;生产结论需要以框架内吞吐、尾延迟和服务目标为准。
- 方法读取目标模型三个层级的隐藏状态并复用 LM head,每个目标模型需要专用草稿权重。闭源 API、只暴露 logits 的服务和内部结构频繁变化的模型难以直接使用。
- LLaMA-3.3-70B 草稿训练报告 16 张 A100 约两周,约为 5,376 GPU-hours;目标模型生成训练回答、特征提取和多轮展开的总成本没有完整分解。训练数据从约 6.8 万条扩展到约 53.2 万条也增加了生命周期成本。
- 正式稿实验设置写训练时模拟 5 步,OpenReview 答辩写 7 个采样步骤,2026-02-19 的现行官方代码把
self.length固定为 7。这个冲突会影响训练分布、计算量和外部复现,论文没有提供与 camera-ready 对应的代码 commit。 - 现行仓库训练入口仍包含作者本地默认模型与数据绝对路径,README 只给出基础 DeepSpeed 命令,并推荐 SpecForge 进行开箱训练。官方权重可直接用于推理,完整重训练仍需手工对齐数据生成、模型路径、展开步数和框架版本。
- 多层融合主要依赖经验消融。现行实现固定选择索引 2、中间层和倒数第三层,缺少根据架构深度、层功能或任务动态选择的准则;主表只覆盖 Vicuna / LLaMA 系稠密模型至 70B,MoE 结果只出现在答辩。
- 论文没有报告独立随机种子、误差线或显著性检验,主实验还存在硬件描述冲突。GPU 型号、CUDA / PyTorch / Transformers 版本、并行方式和逐阶段延迟披露不足。
- 生成质量没有单独评测,因为严格投机验证在理论上保持目标分布。该保证依赖接受概率、残差分布、数值精度和随机采样实现与目标解码一致,尤其需要在 temperature 1 和不同运行时中做分布一致性回归测试。
- 训练和评测集中在短上下文英文任务;长上下文中的 KV cache 成本、多语言接受率、聊天模板变化和持续批处理到达过程仍待验证。
跨论文关系
- 与已有论文的作者或机构关系:四位作者连续完成 EAGLE、EAGLE-2 与 EAGLE-3,形成同一条从特征级草稿、动态草稿树到数据可扩展草稿训练的研究线;当前档案只收录 EAGLE-3,前两项关系由正式稿、OpenReview 与官方仓库共同核验。
- 与已有论文的主题关系:Fast Inference from Transformers via Speculative Decoding 提供严格验证和输出分布保持的基础;EAGLE-3 优化依赖目标隐藏状态的草稿模型,验证规则沿用该框架。
- 与训练分布的关系:GKD 让学生在自身生成序列上匹配教师分布;EAGLE-3 在训练内展开草稿自身隐藏状态并匹配目标 token 分布。两者都减少教师状态与部署状态差异,EAGLE-3 的展开粒度集中在一次投机草稿链。
- 与模型架构的关系:DeepSeek-V3 的多 token 预测受 EAGLE 启发,EAGLE-3 又把 DeepSeek-V3 的多 token 预测设计列为自身多层输入改造的启发来源,形成双向方法影响。
- 与系统边界的关系:MoESD 研究稀疏 MoE 目标模型在不同批量下的验证成本,并在 Mixtral 上使用 EAGLE speculation head;EAGLE-3 提高草稿接受长度,MoESD 说明该改进能否转化为 MoE 端到端收益还取决于专家加载和计算利用率。
- 与后续方法的关系:DFlash 用块扩散并行生成整段草稿,直接减少 EAGLE-3 自回归草稿链的串行开销;DSpark 进一步把草稿置信度、校准和硬件感知前缀调度接入生产 serving。两项工作都把 EAGLE-3 作为强基线,并将优化重点从训练数据可扩展性扩展到草稿执行方式和运行时调度。
主要启发
- 去除辅助回归目标时,应立即检查递归使用自身输出后的逐步指标。第一步改善和后续步骤退化通常说明表示约束已经解除,同时产生了新的训练—部署状态偏移。
- 训练时多步展开的价值可用不同自生成输入深度下的接受率直接诊断。EAGLE-3 的逐步接受率曲线比总平均接受长度更接近其机制证据。
- 草稿质量的扩展曲线与系统加速曲线需要分开报告。前者观察接受长度如何随数据、模型和训练变化,后者还需要纳入草稿时间、目标验证时间、候选结构、批量和硬件。
- 投机解码结果至少应同时给出单批量延迟、连续批处理吞吐、多个批量点、提示 / 输出长度、候选链或树配置,以及与发布代码一致的版本标识。