2602.06036-dflash-block-diffusion-speculative-decoding
DFlash: Block Diffusion for Flash Speculative Decoding
DFlash 的核心贡献是把 diffusion LLM 放到 speculative decoding 的 draft stage:用目标自回归模型的多层 hidden features 做条件,把融合特征注入 draft model 每层 KV cache,再用 block diffusion 一次并行预测整块候选 token。它在 Qwen3-4B/8B 非 thinking 模式下报告约 4.0x-4.9x 平均加速,在 reasoning 模式下约 3.6x-4.6x,并在 SGLang / vLLM 中给出服务端吞吐证据;主要边界是 baseline 集中在 EAGLE-3 和 autoregressive decoding,其他 diffusion speculative decoding 方法因未开源没有直接复现比较。
Source
- Title: DFlash: Block Diffusion for Flash Speculative Decoding
- arXiv: https://arxiv.org/abs/2602.06036
- PDF: https://arxiv.org/pdf/2602.06036
- Code/Project: z-lab/dflash;project blog;Hugging Face model collection
- OpenReview / Review page: 未能可靠匹配公开 OpenReview / reviewer comments;arXiv 注释写明 Accepted at ICML 2026, Camera-ready version。
- Authors: Jian Chen, Yesheng Liang, Zhijian Liu.
- Submitted: arXiv v1 2026-02-05 18:59 UTC;v2 2026-05-28 09:13 UTC。
- Current version read: arXiv v2;TeX source package timestamp 2026-05-29;GitHub repo observed 2026-06-28 with MIT License, 5275 stars, latest push 2026-05-10.
- Subjects: speculative decoding, block diffusion, diffusion language models, LLM inference acceleration, SGLang, vLLM, Qwen3, EAGLE-3.
作者与关系
- Jian Chen: UC San Diego first-year.
- Yesheng Liang: UC San Diego Z Lab.
- Zhijian Liu: UC San Diego.
阅读目标与判断边界
本笔记关注:
- DFlash 如何把 block diffusion drafting 放进 lossless speculative decoding。
- KV injection、random masked block sampling、position-weighted loss 和 shared embedding / LM head 分别解决什么问题。
- 实验结果在 greedy、sampling、thinking mode、SGLang/vLLM serving 和 long context 中的证据强度。
判断边界:
- DFlash 加速的是 decoding latency / throughput,最终输出质量依赖 target model verification 的 lossless guarantee;论文主要报告 acceptance length 和 speedup,并非报告任务准确率提升。
- 本文评估覆盖 Qwen3、Qwen3-Coder、LLaMA-3.1、部分 Qwen3.5 / GPT-OSS 后续模型,但训练成本、GPU hours 和端到端部署成本没有完整披露。
- README 已包含论文之外的后续工程进展,例如 vLLM v0.20.1+ core support、更多 Qwen/Gemma/Kimi/MiniMax draft models;论文结论与项目当前能力需要分开记录。
论文脉络
1. 研究问题、背景和价值
自回归 LLM decoding 每一步只能产生下一个 token,长 CoT reasoning、coding 和 agent workload 会把这个串行过程放大成主要成本。Speculative decoding 的基本思路是让小 draft model 先提出多个候选 token,再由大 target model 并行验证,保留目标模型分布,同时降低平均每 token latency。
现有强方法 EAGLE-3 已经利用 target model hidden feature,但 draft 过程仍是 autoregressive / tree-based,draft cost 随 draft token 数线性增加。为了控制 latency,EAGLE-3 这类 drafter 往往很浅,接受长度容易受 capacity 限制。Diffusion language models 可以并行预测多个 token,但独立 diffusion LLM 的文本质量和多步 denoising 成本仍限制部署。
论文要回答的问题是:能否把 diffusion 的并行 block generation 放到 speculative decoding 的 draft stage,用 target model verification 保持 lossless output,同时借助 target hidden features 让小 diffusion drafter 有足够高的接受率。
2. 已有解决方案与不足
Speculative decoding 原始方法用小 draft model 近似 target model。Medusa 用多个 prediction heads 替代外部 draft model。EAGLE 系列进一步用 frozen target model 的 feature-level context 提升 draft quality。它们的共同瓶颈是 draft token 生成仍带有序列成本或 tree verification overhead。
Diffusion-based speculative decoding 已有 DiffuSpec、SpecDiff-2、TiDAR、PARD 等方向。论文指出两个问题:大 diffusion drafter 可能达到较长 acceptance length,但 7B 级 draft model 的显存和 draft latency 很高;小 diffusion drafter 若缺少 target features,就需要从上下文独立预测未来 token,接受长度和速度上限较低。DFlash 的切入点是“轻量 diffusion adapter + target feature conditioning”。
3. 作者可能的思考路径
作者可能从 speculative decoding 的速度公式开始:
L = (T_draft + T_verify) / tau
eta = L_target / L
这里 tau 是每个 speculative cycle 平均接受 token 数,T_draft 是 draft 时间,T_verify 是 target verification 时间。要提高速度,需要同时增加 tau 并降低 T_draft。
自回归 draft 的成本近似 T_draft = gamma * t_step,所以 draft budget gamma 越大,draft latency 越高。Block diffusion 可以把 gamma 个 masked positions 放进一次 parallel forward,成本近似 t_parallel。于是作者的设计空间变成:用更深、更有表达力的小 diffusion drafter 换取更高 tau,同时保持一次并行 draft 的低 latency。为了避免小模型自己推理未来 token,作者把 target model 的多层 hidden features 作为条件持续喂给 draft model。
4. 核心假设或切入点
核心假设有四条:
- Target model 的 hidden features 含有多个未来 token 的信息,可以作为 draft model 的强上下文。
- Diffusion drafter 的并行 block prediction 可以降低
T_draft,允许 draft model 比 EAGLE-3 更深。 - 将 target features 注入每层 KV cache 比只在 input 层融合更稳定,因为条件信号不会随着 draft layer 加深而快速衰减。
- Speculative verification 可以吸收 diffusion standalone generation quality 的不足,让 diffusion model 专注做 fast drafter。
5. 方法 / 系统 / 理论框架
Inference: target feature conditioned block diffusion
DFlash 的推理流程如下:
- Target model 执行 prefill 或 verification,产生最新已验证 token,并抽取若干 target hidden layers。
- 从浅到深均匀选取 5 个 target layers,把 hidden states concat 后经过 projection 和 RMSNorm 得到 target context feature。
- 这个 feature 被注入每个 draft Transformer layer 的 Key / Value cache,draft tokens 自己产生 Query。
- Draft model 以最新 clean token 为 anchor,对后续 block 内 masked positions 做一次并行预测。
- Target model 并行验证候选 token;接受 prefix 和 bonus token 进入下一轮。
KV injection 在 appendix 中写成:
H_t = RMSNorm(W_c [H^(l_1); ...; H^(l_5)])
Q_i = W_i^Q H_d
K_i = [W_i^K H_t; W_i^K H_d]_seq
V_i = [W_i^V H_t; W_i^V H_d]_seq
这里 target features 只作为 masked-block draft tokens 的额外 KV entries。它们绕过 draft model 的 Q projection、output projection、self-attention update 和 FFN。对 Qwen3.5-35B-A3B,W_c 在 BF16 下约 42 MB,作者认为相对 70 GB target model 属于很小开销。
Training: 对齐推理时的 speculative drafting
训练时 target model 冻结。作者先用完整 clean prompt + response 通过 target model 抽取 target hidden features,再训练 draft model 预测 masked block 中的未来 token。
相比标准 block diffusion training,DFlash 做了几项修改:
- Random anchor sampling:从 response 随机采样 anchor token,把 anchor 作为 block 第一个 clean token,mask 后续
block_size - 1个位置。这匹配推理时上一轮 verification bonus token 作为 clean anchor 的状态。 - Sparse attention mask:多个 blocks 拼接成一个训练序列,block 内可双向 attention,不同 block 之间不互相泄漏,用 Flex Attention 高效训练。
- Long-context training:固定每条 sequence 的 masked block 数,每个 epoch 随机采样 anchor positions,从而控制训练成本并增加覆盖。
- Position-weighted loss:block 内越靠前的 token 错误越会截断后续接受,因此给第
k个位置权重w_k = exp(-(k-1)/gamma)。 - Shared embedding and LM head:draft model 复用 target model 的 token embedding 和 LM head,并冻结它们,只训练中间 draft Transformer layers。
6. 结论链条
论文的结论链条是:
- Speculative decoding 的速度由
tau、T_draft、T_verify共同决定。 - Autoregressive drafting 受顺序生成成本限制,难以同时加大 draft budget 和模型深度。
- Block diffusion 让 draft cost 对 block size 更不敏感,支持更深的小 drafter。
- Target hidden feature conditioning 解决小 diffusion drafter 的预测质量问题。
- KV injection 让每层 draft model 都能访问 target context feature,使 acceptance length 随 draft depth 更好扩展。
- 在 verification lossless guarantee 下,diffusion model 可以作为专用 drafter,而无需作为完整生成模型追赶自回归 LLM 质量。
关键实验/定理
结果 1: Qwen3 non-thinking 主结果
- 设置:Qwen3-4B / Qwen3-8B,thinking mode disabled,Transformers backend,maximum 2048 generated tokens;DFlash block size 16;EAGLE-3 使用 AngelSlim checkpoints,tree size 16 或 60,draft steps 7、top-k 10。
- Baseline:vanilla autoregressive decoding;EAGLE-3 tree size 16;EAGLE-3 tree size 60。
- 指标:speedup over autoregressive baseline;average acceptance length
tau。 - 结果:temperature 0 下,Qwen3-4B DFlash 平均 4.91x /
tau=6.54,Qwen3-8B DFlash 平均 4.86x /tau=6.49。EAGLE-3(16) 分别为 1.81x / 3.05 和 1.76x / 2.96;EAGLE-3(60) 分别为 2.08x / 3.48 和 2.02x / 3.40。temperature 1 下,DFlash 平均为 4.24x / 5.69 和 4.03x / 5.48。 - 解读:DFlash 的优势来自更高 acceptance length 和较低 draft latency;即使 EAGLE-3 用更大 tree size,verification overhead 仍限制 end-to-end speedup。
结果 2: Reasoning mode
- 设置:Qwen3-4B / Qwen3-8B,thinking mode enabled,Transformers backend;draft model 使用带 reasoning traces 的 target outputs 训练。
- Baseline:autoregressive target decoding。
- 指标:GPQA、MATH-500、AIME25 上的 speedup /
tau。 - 结果:Qwen3-4B 在 temperature 0 下分别为 4.23x / 5.23、4.59x / 5.74、4.39x / 5.54;temperature 1 下为 3.67x / 4.55、3.93x / 4.89、3.64x / 4.68。Qwen3-8B 在 temperature 0 下为 4.17x、4.64x、4.51x;temperature 1 下为 3.75x、4.03x、3.70x。
- 解读:DFlash 对长 reasoning 输出有直接价值,因为这类模型的总耗时主要被 generation length 放大。sampling 下速度略低,符合 target distribution entropy 更高时 acceptance 下降的直觉。
结果 3: SGLang / vLLM serving
- 设置:SGLang 使用 Qwen3-4B、Qwen3-8B、Qwen3-Coder-30B-A3B-Instruct,单 B200 GPU,FlashAttention-4 backend,concurrency 1/4/8/16/32,并启用 Spec-v2 scheduling overlap;vLLM appendix 使用 Qwen3.5-9B。
- Baseline:各 serving backend 的 autoregressive decoding。
- 指标:throughput tokens/s、speedup、average acceptance length。
- 结果:SGLang 上 Qwen3-8B Math500 在 concurrency 1/8/32 分别为 5.1x / 4.5x / 2.8x,HumanEval 为 4.2x / 3.6x / 2.4x。Qwen3-Coder-30B-A3B HumanEval 在 concurrency 1/8/32 为 3.5x / 3.2x / 3.1x,LiveCodeBench 为 2.6x / 2.3x / 2.3x。vLLM Qwen3.5-9B 在 concurrency 1/8/32 上 Math500 为 4.0x / 3.2x / 1.9x,HumanEval 为 4.6x / 3.4x / 2.1x,MT-Bench 为 3.0x / 2.2x / 1.3x。
- 解读:DFlash 在真实 serving framework 中仍有收益,但高 concurrency 下 speedup 会下降,说明 verification cost、batching、memory bandwidth 和 scheduling overhead 仍会重塑实际收益。
结果 4: Long-context adaptation
- 设置:基础 Qwen3.5-27B draft model 训练在 4K context;作者用 LongAlign-10K 的 1.6K samples 微调 3 epochs,并在 LongBench hotpotqa、qasper、gov_report 不同 context length 上测 acceptance length。
- Baseline:base DFlash drafter。
- 指标:不同 context length 下 acceptance length。
- 结果:16K context 下,hotpotqa 从 3.61 提升到 6.05,qasper 从 3.57 到 6.00,gov_report 从 2.67 到 3.81;32K gov_report 从 2.09 到 3.56。
- 解读:target features 在长上下文中仍可作为 useful conditioning signal,但基础 4K draft model 会随 context 变长退化,需要少量 long-context adaptation。
结果 5: Ablations
- 设置:除特别说明外,ablation model 使用 100K data、单 H200 GPU、greedy decoding。
- Baseline:naive 5-layer block diffusion drafter;DFlash variants。
- 指标:speedup / acceptance length。
- 结果:
- 无 target context features 的 5-layer block diffusion drafter 在 GSM8K / Math500 / AIME24 / AIME25 上仅约 2.65x-3.73x,
tau约 3.23-4.61。 - Draft layers 从 3 到 8 会提高
tau,但 5-layer 在平均 speedup 上更平衡;8-layer acceptance 更长但 draft latency 更高。 - Target hidden features 从 3 组增到 5 组提高 Math500、HumanEval、MT-Bench 的
tau和 speedup,但离线缓存成本随 hidden feature 数线性增长。 - Train block size 16 可以较好泛化到 test block size 8;反向从 train block size 8 到 test block size 16 效果较弱。
- KV injection 优于 input fusion:block-diffusion drafting 中,GSM8K 从
tau=3.5 / 2.9x到tau=4.2 / 3.3x,HumanEval 从3.5 / 2.9x到4.0 / 3.2x,MT-Bench 从2.6 / 2.0x到3.0 / 2.2x。
- 无 target context features 的 5-layer block diffusion drafter 在 GSM8K / Math500 / AIME24 / AIME25 上仅约 2.65x-3.73x,
- 解读:关键收益来自 target feature conditioning、KV injection、block-size / depth balance 和训练方式的共同作用,diffusion alone 只能提供一部分并行性。
实验设置与 baseline 审计
| 维度 | 记录 |
|---|---|
| 模型与初始化 | LLaMA-3.1-8B-Instruct;Qwen3-4B、Qwen3-8B、Qwen3-Coder-30B-A3B-Instruct;appendix/README 还覆盖 Qwen3.5、GPT-OSS、Gemma、Kimi、MiniMax 等工程模型。 |
| 数据与任务 | 约 800K samples,来自 NVIDIA Nemotron Post-Training Dataset V2 和 CodeAlpaca;训练使用 target model 生成 responses 以增强 target alignment。评测包括 GSM8K、MATH-500、AIME25、HumanEval、MBPP、LiveCodeBench、MT-Bench、Alpaca、GPQA、LongBench 子集。 |
| RL / 训练配置 | 本文属于推理加速论文。DFlash draft model 用 supervised cross-entropy / diffusion denoising 训练;位置权重 w_k = exp(-(k-1)/gamma)。 |
| 系统配置 | Transformers backend 主结果;SGLang serving 使用 FA4 backend、Spec-v2 overlap;vLLM appendix 使用 Qwen3.5-9B;README 说明 vLLM v0.20.1+ 已包含 core DFlash support。 |
| 技术报告训练配置 | Draft model 5 layers,Qwen3-Coder 8 layers;block size 16,LLaMA 3.1 block size 10;target hidden features 从 5 个 target layers 抽取。 |
| 训练硬件与拓扑 | 论文主实验称除特别说明外使用 NVIDIA H200;SGLang / LLaMA serving 用单 B200;没有完整训练集群拓扑。 |
| 并行方式与框架 | Draft training 使用 Flex Attention sparse mask;serving 接入 SGLang、vLLM、Transformers,README 还提供 MLX backend。 |
| 训练数据规模与组成 | 约 800K target-aligned samples;long-context adaptation 用 LongAlign-10K 1.6K samples,3 epochs。 |
| 训练过程与超参 | 6 epochs,AdamW,learning rate 6e-4,gradient clipping 1.0,cosine schedule,warmup ratio 0.04,max sequence length 3072 tokens,Qwen3-Coder 4096,每条 sequence 随机采样 512 anchor positions;loss decay gamma 按 block size 16/10/8 分别为 7/5/4。 |
| 训练时间 / GPU hours / 成本 | 未披露总 GPU hours、wall-clock time 或训练成本。 |
| 未披露项 | 训练总 token budget、batch size、optimizer beta/weight decay、seed 数、误差线、每个模型训练成本、完整 serving memory profile。 |
| 评测协议 | 报告 acceptance length、speedup、throughput;maximum 2048 generated tokens;temperature 0/1;部分 serving concurrency 1-32。 |
| 统计报告 | 未报告多 seed、置信区间或显著性检验。 |
| Baseline 是否 tuned | EAGLE-3 使用已发布 checkpoints;Qwen3 使用 AngelSlim release,LLaMA 使用 official EAGLE-3 checkpoint;未说明对 EAGLE-3 在所有 backend/任务上重新调参。 |
| Baseline 是否 compute-matched | Tree size 16 与 DFlash block size 16 用于 draft budget 对齐;EAGLE-3 tree size 60 作为更大 search budget 对照。训练 compute 未完全 matched。 |
| Baseline 是否 implementation-matched | Qwen3 主结果在 Transformers backend;LLaMA / SGLang 对照另行报告。diffusion-based speculative decoding 方法因缺少开源实现未直接比较。 |
| Baseline 是否覆盖强替代方案 | 覆盖 autoregressive baseline、EAGLE-3、部分 MTP appendix 对照;缺少 DiffuSpec、SpecDiff-2、TiDAR、PARD 的统一复现。 |
| Baseline 是否存在弱化风险 | EAGLE-3 checkpoint 来源与 backend 适配可能影响结果;高 concurrency 下 DFlash speedup 明显下降,说明 serving workload 形态会改变结论。 |
| 结论边界 | “up to 6x” 主要对应特定模型/任务/低并发配置;在聊天、高并发、大模型和 sampling 模式下收益较低但仍为正。 |
证据链强度评估
强证据
- 速度公式与 draft cost 分析清楚解释了 diffusion drafter 的设计空间:一次并行 block generation 让更深 draft model 仍有低 draft latency。
- Qwen3-4B/8B、LLaMA-3.1、Qwen3-Coder 和 SGLang/vLLM 结果覆盖了多个模型、任务和服务框架。
- Ablation 直接支持关键设计:target feature conditioning、KV injection、random anchor sampling、draft depth / block size tradeoff。
中等强度证据
- Long-context adaptation 表明轻量微调可以恢复长上下文 acceptance,但只在少数 LongBench 子集和一个 Qwen3.5-27B draft model 上展示。
- README 的工程覆盖面很广,包含多种模型和 backend,但这些多为项目状态,不全等价于论文主实验的 peer-reviewed 证据。
- “lossless acceleration” 依赖 speculative decoding 的 verification 实现正确,论文主要以 speedup /
tau展示收益,对实现级数值一致性和 sampler consistency 没有深入审计。
需要谨慎的推论
- 与其他 diffusion speculative decoding 方法缺少直接开源复现比较,因此“diffusion drafter 路线最优”仍需更多公开 baseline。
- 高 concurrency、长上下文、大 batch、大模型和复杂 sampling 会改变
T_draft、T_verify、KV memory 和 scheduling overhead,单一 up-to-6x 数字不能泛化到所有部署。 - 训练成本没有披露,轻量 draft model 的成本收益要结合服务量、目标模型规模、缓存 feature 成本和模型维护成本评估。
OpenReview / 审稿意见吸收
- Venue status: arXiv comment 写明 Accepted at ICML 2026, Camera-ready version;TeX 使用
icml2026accepted style。 - Public reviews: 未发现可公开访问的 OpenReview forum 或 reviewer comments。OpenReview API 按 title / DFlash / ICML 2026 venue 检索无结果。
- Ratings / confidence: 无公开 rating / confidence。
- Reviewer consensus: 无公开 reviewer comments。
- Main criticisms: 无公开 reviewer comments;本地可信度边界主要来自 baseline 覆盖、训练成本披露和统计报告不足。
- Author response: 未发现公开 rebuttal。
- 对本文可信度的影响: ICML accepted status 提升基本可信度;缺少公开 review 使 reviewer 对 baseline、ablation 和 serving setup 的具体质疑无法吸收进本笔记。
本地讨论补充
1. 讨论收敛点
- DFlash 和 Bebop/MTP 的共同目标是提高 draft-target overlap,但 DFlash 的 draft distribution 来自 block diffusion adapter,Bebop 的 draft distribution 来自 MTP head。
- DFlash 最有价值的工程点是把 target hidden features 当成 persistent conditioning signal,并在每个 draft layer 的 KV cache 中保留,覆盖只做 input fusion 时容易出现的信号衰减。
2. 修正后的理解
- Diffusion LLM 在这里承担的是“高并行 draft generator”,并不需要作为完整生成模型独立追平 autoregressive LLM。
- Speedup 的主要变量是
tau和 draft/verify cost 的组合。DFlash 在 chat 和高 concurrency 下收益降低,说明 practical speedup 需要按 workload、batching 和 backend 分层报告。
3. 后续复验指标
- 在 vLLM/SGLang 中复验 target distribution exactness、sampler consistency、batch-invariant behavior 和 logprob path。
- 对 DFlash 与 MTP/Bebop、EAGLE-3、Medusa 在同一 backend、同一模型、同一 concurrency 上做统一 speed / memory / accuracy audit。
- 记录 draft model 训练 GPU hours、serving memory overhead、KV cache 增量、不同 context length 的吞吐曲线。
主要启发
- Speculative decoding 后续不只是在 draft head 上做文章,也可以把 draft generator 换成并行 diffusion adapter。
- Target hidden features 可以成为小模型推理加速的“侧信道条件”,但实现上要防止 conditioning 信号随层深衰减;KV injection 是一个可复用设计。
- 高并发 serving 结果提醒:接受长度提升只是必要条件,verification cost、scheduler overlap、KV memory 和 backend kernel 才决定落地收益。
- 对 RL rollout 系统:DFlash 这类 draft model 可能与 MTP、Seer grouped speculative decoding、slime/SGLang rollout acceleration 形成互补,但需要额外处理 policy freshness 和 logprob consistency。
局限
- 缺少 DiffuSpec、SpecDiff-2、TiDAR、PARD 等 diffusion speculative decoding 方法的统一复现比较。
- 训练成本、batch size、GPU hours、seed 和统计误差线披露不足。
- 主结果偏重 speedup / acceptance length,任务准确率、分布一致性和长时间 serving stability 需要更多公开审计。
- 高 concurrency 下 speedup 明显下降,up-to-6x 适合作为最佳条件数字,部署时需要按任务长度、batch size 和 target model 规模重新测。
- DFlash draft model 与 target model 深度绑定;target checkpoint 升级后可能需要重新训练或校准 draft model。
跨论文关系
- 与已有论文的作者关系:无直接作者重叠。新增 UC San Diego / Z Lab 作者节点 Jian Chen、Yesheng Liang、Zhijian Liu。
- 与已有论文的主题关系:与 2211.17192 Speculative Decoding 共享 lossless draft-target verification 机制;与 2606.12370 Bebop 共享 acceptance overlap / rollout acceleration 语言;与 2511.14617 Seer 共享 speculative decoding 服务长输出 workload 的主题。
- 与已有论文的方法或系统关系:与 2505.09388 Qwen3 共享 Qwen3 thinking / non-thinking model context;与 slime 官方项目 和 2602.15763 GLM-5 通过 SGLang rollout、MTP / speculative decoding 和 long-output serving 形成工程关系;与 2025-09-10 inference determinism 和 2605.14220 TIM/VeXact 通过 sampler consistency / backend exactness 形成后续复验关系。
- 跨论文关系定位:把 DFlash 纳入 speculative decoding / MTP / diffusion drafting 主题。
Reference Intake Brief
Target
- Intended target system: 新增论文笔记、更新
content/utility/papers-index.md、更新data/authors.json。 - Existing related assets:
content/utility/papers-index.md;2211.17192;2606.12370;2511.14617;2505.09388。 - Proposed form: 新建独立 Markdown 文档,并作为 diffusion-based speculative decoding 节点接入跨论文关系。
Reusable Elements
- Speculative decoding latency decomposition:
L = (T_draft + T_verify) / tau。 - Diffusion draft cost view: autoregressive draft cost 随
gamma线性增长,block diffusion draft cost 接近一次 parallel forward。 - KV injection conditioning: target features 作为每层 draft attention 的 extra K/V entries。
- Training recipe: random anchor blocks、sparse block attention、position-weighted loss、shared embedding / LM head。
Risks
- Copyright/over-copying: 本笔记使用 paraphrase 和少量必要公式/数字,不复制论文长段落。
- Unsourced or unverifiable claims: arXiv、TeX source、GitHub README、project blog、author homepages 已核验;OpenReview reviewer comments 未找到。
- Tone/brand mismatch: 保持本 archive 的论文分析语气,区分论文主实验和 README 后续工程状态。
- Safety/compliance issues: 该论文是推理效率系统工作,主要风险来自降低模型部署成本;未包含可直接滥用的攻击流程。
- Overlap with existing assets: 与 speculative decoding 原始论文、Bebop/MTP、Seer 形成互补,不重复其原理推导。
Skipped
| Material | Reason |
|---|---|
| 公开 reviewer comments | 未能可靠匹配 OpenReview / ARR / ICML reviewer page;OpenReview API 按标题和 venue 检索无结果。 |
| 本地复现实验 | 需要 H200/B200 或对应 serving backend,超出本次归档范围。 |
Recommendation
Decision: merge
Why: DFlash 是 speculative decoding 的重要新分支,把 diffusion parallel drafting、target feature conditioning 和 serving backend 结合起来;它与本地已有 Qwen/Bebop/MTP、Seer、SGLang/vLLM 和 inference consistency 节点关系明确,适合归档为 diffusion-based speculative decoding 节点。