2601.20802-reinforcement-learning-via-self-distillation

Reinforcement Learning via Self Distillation

SDPO 让当前策略生成自身轨迹,再让反馈条件化的 EMA 同模型在相同轨迹前缀上重算下一词分布,将两者差异转成 Top-K logit 级信用并更新无反馈策略;Qwen3-8B 在带测试反馈的 LiveCodeBench v6 上达到 48.8% 准确率,高于强 GRPO 的 41.2%,并以四分之一生成量达到 GRPO 的最终准确率,但该机制依赖模型的上下文内回溯能力和反馈质量,在 Qwen2.5-1.5B 上低于 GRPO,测试时“三倍更少尝试”也只对应困难题集合中的特定发现概率阈值。

Authors Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas Krause

已审阅 Archived 2026-07-28 16:57 Updated 2026-07-29 10:39 Reviewed 2026-07-29 10:39 Source

Source

  • Workflow version: v2.1
  • Material type: research-paper
  • Analysis modules: experiment, theory, system
  • Canonical source: https://arxiv.org/abs/2601.20802
  • Title: Reinforcement Learning via Self-Distillation
  • Authors: Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas Krause
  • Responsible organization: ETH Zürich;Max Planck Institute for Intelligent Systems;Massachusetts Institute of Technology;Stanford University
  • arXiv: https://arxiv.org/abs/2601.20802
  • HTML: https://arxiv.org/html/2601.20802v2
  • PDF: https://arxiv.org/pdf/2601.20802v2
  • Code/Project: Project pageGitHub;读取 main commit 7c457fc1b1f636ae794eb0362ba37d4743b06fbc
  • Venue page: https://icml.cc/virtual/2026/poster/64121
  • OpenReview / Review page: 完整论文未发现公开 ICML 评审 forum;测试时部分另以 Test-Time Self-Distillation 进入 ICLR 2026 Test-Time Updates Workshop,该 forum 只有 1 条公开 submission note,没有公开 review、rebuttal 或 decision note
  • Submitted: arXiv v1,2026-01-28 17:45:12 UTC
  • Published / updated: arXiv v2,2026-02-16 14:49:34 UTC;ICML 2026 Poster,Proceedings of Machine Learning Research 306
  • Current version read: arXiv v2 HTML;方法、实验和附录均已读取
  • Version / revision read: 2601.20802v2;ICML 2026 正式版首页与 venue 状态;官方代码 commit 7c457fc1b1f636ae794eb0362ba37d4743b06fbc
  • Accessed: 2026-07-28
  • Key figure decision: include
  • Review status: page-type=proceedings; match-confidence=high; observed-at=2026-07-28; venue-status=ICML 2026 Poster, PMLR 306
  • Subjects: Machine Learning (cs.LG);Artificial Intelligence (cs.AI)

作者与关系

  • Jonas Hübotter: ETH Zürich。
  • Frederike Lübeck: ETH Zürich / Max Planck Institute for Intelligent Systems。
  • Lejs Behric: ETH Zürich。
  • Anton Baumann: ETH Zürich。
  • Marco Bagatella: ETH Zürich / Max Planck Institute for Intelligent Systems。
  • Daniel Marta: ETH Zürich。
  • Ido Hakimi: ETH Zürich。
  • Idan Shenfeld: Massachusetts Institute of Technology。
  • Thomas Kleine Buening: ETH Zürich。
  • Carlos Guestrin: Stanford University。
  • Andreas Krause: ETH Zürich。

Jonas Hübotter 是第一作者和通讯作者,提出用自蒸馏完成信用分配的概念框架、实现算法、主导 LiveCodeBench 实验与论文写作。Frederike Lübeck、Lejs Behric 和 Anton Baumann 被标为并列第二作者;Frederike 主导代码环境及测试时训练设计,Lejs 推动稠密蒸馏信用这一切入点并主导教师提示实验,Anton 主导无丰富反馈设置。其余作者分别贡献训练基础设施、实验设计、留出能力评测和强化学习关系分析。

团队以 ETH Zürich Learning and Adaptive Systems Group 为中心,经 Frederike Lübeck 和 Marco Bagatella 连接 Max Planck Institute for Intelligent Systems,经 Idan Shenfeld 连接 MIT,经 Carlos Guestrin 连接 Stanford。当前存档中,Jonas Hübotter 与 Idan Shenfeld 还共同参与 SDFT:SDFT 由 Idan Shenfeld 担任第一作者和通讯作者、Jonas Hübotter 担任第三作者;SDPO 由 Jonas Hübotter 担任第一作者和通讯作者、Idan Shenfeld 作为共同作者。两篇论文的 arXiv v1 分别于 2026 年 1 月 27 日和 28 日提交,相隔约 23 小时,项目主页也互相链接;本地据此将二者记录为同一 MIT–ETH 合作网络同期展开的方法族。

论文脉络

1. 研究问题、背景和价值

LLM 的可验证奖励强化学习(reinforcement learning with verifiable rewards,RLVR)通常把一次完整回答压缩成一个通过或失败分数。GRPO 再将组内相对奖励作为整条回答的优势。这样做便于扩展,却把运行时错误、失败测试、裁判说明和其它环境状态丢弃,并让同一回答中的所有 token 接受相同方向的信用。

这个信息瓶颈带来两个直接问题。第一,同组回答全部失败时,GRPO 的组相对优势归零,当前批次不产生学习信号。第二,一条失败回答往往只在少数决策点出错,序列级奖励无法区分正确前缀、关键错误和后续连带错误。代码环境已经返回能够描述失败位置和类型的文本,算法仍只读取一个二值结果。

论文把更一般的环境接口命名为丰富反馈强化学习(reinforcement learning with rich feedback,RLRF):策略产生轨迹,环境返回标量奖励和任意 token 化状态描述。核心问题由“怎样从终局奖励估计优势”扩展为“怎样把环境文本中已经存在的信息变成训练信号,同时避免外部强教师和额外教师采样”。

2. 已有解决方案与不足

RLVR、价值网络和从中间位置继续采样的方法都能细化信用,但其监督最终仍来自标量奖励;价值网络增加模型与显存成本,中间重采样增加生成开销。多轮反思把环境反馈继续放入上下文并生成修订答案,参数保持不变,历史尝试还会逐渐占满上下文窗口。

标准蒸馏能够在每个位置提供完整词表分布,通常依赖更强的外部教师。离线自蒸馏先让带额外上下文的同模型生成新答案,再对教师答案执行 SFT,会把学生训练到教师生成轨迹上,并增加教师生成量。在线策略蒸馏保留学生自身轨迹,仍需要外部教师。

SDPO 的增量位于三者交界:轨迹由当前学生在线采样,额外信息来自真实环境或同组成功答案,教师由同一模型谱系在特权上下文下构造,训练目标读取反馈前后 next-token 分布差。它省去教师解码和独立奖励模型,同时保留学生轨迹上的更新。

3. 作者可能的思考路径

以下是基于论文问题设置和消融结果的本地重建:

  1. 先观察环境文本已经包含“哪里失败”的状态信息,而 RLVR 数据路径在计算奖励后将其丢弃。
  2. 再利用 LLM 的上下文学习能力:同一模型看到错误信息后,对原回答各位置的支持程度会发生变化。
  3. 保留原回答并执行 teacher-forced 重评分,使反馈前后分布可以按相同回答位置比较,也免去生成修订答案。
  4. 将分布对数比改写成 logit 级优势,把蒸馏接入现有策略优化训练器。
  5. 用 EMA 或显式 trust region 抑制学生和自教师同步漂移,再用 Top-K 加尾部桶降低双份全词表 logits 的显存。
  6. 最后分三种信息条件验证:同组成功答案、环境文本反馈、单个困难问题上的测试时持续更新。

4. 核心假设或切入点

SDPO 依赖五项关键条件:

  1. 反馈条件化后分布更可靠。 同一模型看到环境状态或正确示例后,对原轨迹的局部判断平均优于只看问题时的策略。
  2. 回溯信号可以写回参数。 反馈只在训练时出现,学生通过分布匹配把反馈条件下的行为压入无反馈策略。
  3. 学生轨迹覆盖有用前缀。 教师只在学生采样到的前缀上评分,Top-K 又主要覆盖学生已赋予较高概率的候选。
  4. 教师变化速度受控。 当前模型同时承担学生和教师角色,EMA 或 trust region 需要让监督目标随能力提升,同时避免短期共同漂移。
  5. 反馈与目标一致。 错误、遗漏或可被投机利用的环境文本会直接改变教师分布,SDPO 没有独立机制判断反馈真伪。

5. 贡献全景与方法总览

首要贡献是 Self-Distillation Policy Optimization(SDPO):它把反馈条件化的同模型分布解释为稠密优势估计器,并给出可以接入 RLVR 训练器的 logit 级目标。辅助贡献包括 RLRF 环境接口、Top-K 加尾部桶的显存近似、EMA/trust-region 教师稳定化,以及测试时对单题持续更新的 discovery 评测。

端到端执行链如下:

问题 x
  → 当前学生策略采样 G 条回答 y
  → 环境为每条回答返回奖励与文本反馈
  → 按同题聚合同组成功答案,并为每条回答构造反馈提示 f
  → 学生在原问题与原回答前缀上计算分布 p
  → EMA 同模型在“原问题 + f”与相同回答前缀上计算分布 q
  → 以 Top-K + tail 近似逐位置分布散度
  → 冻结教师分支,只更新无反馈学生
  → EMA 教师吸收新的学生参数

这里的三个对象需要分开:

  • 原回答 yy:由学生在线生成,决定训练所处的前缀分布。
  • 反馈 ff:环境输出、同组成功答案,或二者之一;它只进入教师提示。
  • 自教师 qq:概念定义使用当前模型的反馈条件分布,主实验使用学生参数的 EMA 版本或显式正则化版本。

6. 采样、反馈选择与学习信号的存在条件

对每个问题 xx,当前策略 πθ\pi_\theta 先采样 GG 条回答。反馈提示有三种主要构造:

  1. 回答已经成功:这条回答可以作为同题正确示例;主配置会避免把回答自身再次当作自己的示例。
  2. 同组存在其它成功回答:失败回答获得学生自己刚生成的成功示例。
  3. 没有成功回答但环境返回文本:失败回答获得运行时错误、失败测试或其它环境输出。

若一个标量奖励环境既没有文本反馈,同组也没有任何成功回答,该组没有可用于改变教师上下文的信息。官方实现会把这些样本的 self_distillation_mask 设为零。SDPO 在纯标量设置中仍需要同组至少出现一次成功,然后才能把成功样本变成失败样本的稠密监督;带环境文本的设置可以在首个成功出现前继续更新。这一区分决定了“突破全零奖励停滞”成立的范围。

论文默认优先使用同组成功答案;存在成功答案时忽略环境输出,没有成功答案时才使用环境输出。代码还允许同时使用两者。反馈选择由 ray_trainer.py 构造,主实验提示与 Appendix Table 2 对齐。

Appendix Table 2 写明成功回答会把自身作为正确答案放入教师提示,公开主实验脚本则设置 dont_reprompt_on_self_success=True,排除当前回答自身,只允许使用同组其它成功回答。论文结果因而更接近后一条代码路径;成功组内只有一条成功回答时,这条成功样本本身不产生自蒸馏损失,其它失败样本仍可以使用它。

7. 自教师怎样评分原回答

学生在普通上下文中定义为:

pt(a)=πθ(ax,y<t). p_t(a)=\pi_\theta(a\mid x,y_{<t}).

教师在反馈条件上下文中定义为:

qt(a)=πθˉ(areprompt(x,f),y<t), q_t(a)=\pi_{\bar\theta}(a\mid \operatorname{reprompt}(x,f),y_{<t}),

其中 θˉ\bar\theta 在概念公式中等于当前参数并停止梯度,主实验通常是学生参数的 EMA。两条分支读取相同的原回答前缀 y<ty_{<t},提示长度和内容可以不同。

教师没有先生成一条新的推理或修订答案。实现先构造反馈提示,再把学生原回答 token 直接拼到教师提示后,通过一次 teacher-forced 前向计算取得各位置 logits。因而“教师回溯”表示反馈改变了原轨迹各位置的条件分布;它不包含教师自行解码的 CoT。代码中的拼接位于 ray_trainer.py

Appendix Table 12 将无反馈、丰富反馈和测试时三组实验的 Thinking 都设为 False,教师与学生又共用同一项 chat-template 配置。主结果因此来自非 thinking 模式下的双重评分,不包含教师先生成隐藏推理再评分的阶段。

Figure 4: SDPO 用反馈条件化的自教师重评学生原回答
Figure 4:学生对“返回 1 到 n 的所有数字”生成 range(1, n + 1),环境反馈指出不应包含 n;自教师在相同原回答位置重算概率,对导致包含 n 的局部 token 降低支持。Image Source: arXiv v2 HTML, Figure 4.

这个例子对应的最小机制是:在 range(1, n 前缀后,学生可能给 + 较高概率;教师看到 “Don't include n” 后降低 + 的概率,并提高能够结束区间表达的候选。后续 KL 更新把这项局部分布变化写入学生。正式算法会在每个学生前缀及多个候选 token 上重复这一操作。

8. 从蒸馏散度到 logit 级优势

论文首先给出逐位置反向 KL:

LSDPO(θ)=tKL ⁣(pt    stopgrad(qt)). \mathcal L_{\mathrm{SDPO}}(\theta) = \sum_t \mathrm{KL}\!\left( p_t \;\middle\|\; \operatorname{stopgrad}(q_t) \right).

教师停止梯度,避免反馈条件分支同时向学生回归并消除提示差异。对学生分布求梯度后,可以写成:

θLSDPO=Eyπθ[tEapt[logpt(a)qt(a)θlogpt(a)]]. \nabla_\theta \mathcal L_{\mathrm{SDPO}} = \mathbb E_{y\sim\pi_\theta} \left[ \sum_t \mathbb E_{a\sim p_t} \left[ \log\frac{p_t(a)}{q_t(a)} \nabla_\theta\log p_t(a) \right] \right].

把最小化损失改写成最大化策略目标时,每个候选 token 的优势为:

AtSDPO(a)=logqt(a)pt(a). A_t^{\mathrm{SDPO}}(a) = \log\frac{q_t(a)}{p_t(a)}.

qt(a)>pt(a)q_t(a)>p_t(a) 时,教师在看到反馈后更支持该候选,学生提高它的概率;qt(a)<pt(a)q_t(a)<p_t(a) 时,学生降低它的概率。GRPO 对一条回答的实际采样 token 广播相同优势,完整 SDPO 在每个学生前缀上为多个候选 token 分别计算优势。稠密性同时沿序列位置和词表候选两个维度展开。

论文实现使用逐位置估计器,把产生前缀的采样分布视为固定。Appendix A.1 的序列级完整梯度还包含“早期 token 怎样改变未来状态及未来蒸馏散度”的项;作者实验该估计器后没有观察到可测增益,主结果没有使用。因而 Proposition 2.1 精确对应冻结学生采样前缀后的逐位置目标,它没有覆盖完整序列 KL 对前缀分布的全部导数。

论文还把教师对数概率解释为隐式稠密奖励:最小化反向 KL 等价于最大化教师定义的 token 奖励并保留策略熵。这个等价关系说明 SDPO 可以复用策略梯度基础设施;环境反馈怎样影响教师仍由语言模型的上下文理解承担。

9. Top-K、散度方向与教师稳定化

完整词表蒸馏需要同时保存学生和教师 logits。SDPO 只保留学生分布的 Top-K 候选,并把剩余概率质量合并为一个 tail(尾部)桶:

VTopK(pt){tail}. \mathcal V \longrightarrow \operatorname{TopK}(p_t)\cup\{\mathrm{tail}\}.

这样每条长度为 y|y| 的回答产生 y(K+1)|y|(K+1) 个优势。无丰富反馈实验使用 K=100K=100,LiveCodeBench 与测试时实验使用 K=20K=20。尾部桶保留总概率质量差,却无法区分桶内 token;教师强烈偏好但学生没有放入 Top-K 的新候选只能整体影响 tail,无法获得单独的提升方向。Top-K 因此把显存控制与学生支持集约束绑定在一起。

主公式使用反向 KL,实际实验按设置选择散度:

  • 无丰富反馈:广义 Jensen–Shannon divergence,Top-K 100。
  • LiveCodeBench 丰富反馈:反向 KL,Top-K 20。
  • 测试时自蒸馏:反向 KL,Top-K 20,并将优势裁剪到 5。

官方实现的散度和 tail 计算位于 core_algos.py。所以论文的经验结果支持一组按任务选择的 SDPO 配方,无法将所有增益归因于单一反向 KL。

自教师随学生共同改善,也会形成正反馈式漂移。论文给出两种稳定化方式:

  1. EMA 教师θˉ(1α)θˉ+αθ\bar\theta\leftarrow(1-\alpha)\bar\theta+\alpha\theta。它增加一份教师参数显存,教师前向可以直接使用平滑参数。
  2. 显式 trust-region 教师:在当前反馈教师与初始反馈教师的对数概率之间插值,
q(a)exp ⁣((1α)logqref(a)+αlogqθ(a)). q(a) \propto \exp\!\left( (1-\alpha)\log q_{\mathrm{ref}}(a) +\alpha\log q_\theta(a) \right).

这条路径可以复用已有 reference model 参数,增加一次 reference log-prob 计算。Table 4 中未经正则化的当前教师后期发散;trust-region、EMA 和冻结初始教师都能稳定训练,前两者的最好准确率分别为 50.6% 和 49.3%,高于冻结教师的 48.8%。主实验全部使用 EMA:无丰富反馈更新率 0.05,丰富反馈和测试时设置为 0.01。

10. 测试时自蒸馏怎样改变“发现”过程

测试时实验固定一个困难代码问题,每轮用当前 Qwen3-8B 采样 16 条回答,从公开测试取得反馈,执行 SDPO 更新,再进入下一轮。模型参数持续变化,因此早期反馈可以影响超出单次上下文窗口的后续尝试。

论文定义 discovery@kk 为前 kk 次尝试中至少发现一次成功答案的概率。best-of-kk 固定模型并独立采样;multi-turn 固定参数,把历史反馈保留在滑动上下文;SDPO 把反馈逐轮写入参数。二值奖励 RLVR 在首个成功前没有梯度,SDPO 可以利用失败测试信息提前改变策略。

这项实验的核心证据来自 19 道 LiveCodeBench v6 困难题,其中 9 道满足基础模型 pass@64<0.0364<0.03,每题运行 5 个随机种子,最大预算为 2750 次生成。很困难集合上,SDPO、best-of-kk 和 multi-turn 的 discovery@2750 分别为 53.2%、41.5% 和 35.6%;达到 22% 发现概率时,SDPO 约使用三分之一生成量。这个“三倍”对应一条曲线上的目标概率,并非所有题的平均发现时间;Table 10 在 19 题上的平均首次发现尝试数为 894、1145 和 1141,平均比值约 1.3 倍,且若干单题由基线更快发现。

Q3 展示了参数更新可能超出上下文反思的覆盖范围:best-of-kk 和 multi-turn 在 2750 次内均未发现,SDPO 某次运行在 321 次尝试后首次发现;五个随机种子的平均首次发现时间为 1987。单题现象支持可行性,无法单独证明稳定的跨题优势。

11. 结论链条

  1. 假设:模型看到环境反馈后能够更准确地评价原轨迹局部决策,且反馈本身与目标一致。
  2. 机制:学生在线采样,EMA 同模型在反馈上下文中重评相同前缀,Top-K 分布差形成 logit 级优势,教师停止梯度。
  3. 直接证据:LCBv6 上 48.8% 对 41.2%;logit/token/sequence 消融呈稠密程度越高结果越好;正则化教师稳定训练;较大 Qwen3 模型的增益更明显。
  4. 最窄结论:在 Qwen3-8B、本文代码反馈模板、131 道 LCBv6、80 步和 3 个随机种子设置中,反馈条件自蒸馏比作者实现的多种 RLVR 基线获得更高准确率和更快的生成量收敛。
  5. 边界:弱模型、低质量反馈、学生 Top-K 之外的新动作、长期多任务训练和开放式不可验证反馈仍缺少支持;逐位置估计器也未包含前缀对未来蒸馏损失的完整梯度。

关键实验结果

结果 1:丰富代码反馈提高 LCBv6 准确率和生成量效率

  • 设置:LiveCodeBench v6 的 131 道 2025 年 2–5 月题目;每题私有测试随机分出 50% 作为训练期间公开测试,剩余测试用于验证;Qwen3-8B;80 个训练步骤;3 个随机种子;每题 8 条训练 rollout,验证取 4 条平均。
  • 指标:验证准确率;达到 GRPO 最终准确率所需累计生成数。
  • 指标定义:验证准确率对每题 4 条独立回答的二值正确性取平均;累计生成数统计训练过程中截至对应 checkpoint 已采样的回答数量,用于衡量 rollout 样本效率。
  • 结果:SDPO 最终准确率为 48.8±0.648.8\pm0.6,GRPO 为 41.2±0.841.2\pm0.8;SDPO 以约四分之一生成量达到 GRPO 的最终准确率。GSPO、CISPO 和高熵 token GRPO 分别为 40.1%、41.2% 和 37.8%。
  • Baseline:改进 GRPO、GSPO、CISPO、只训练高熵 token 的 GRPO、基础模型。
  • 对照是否可比:同一 Qwen3-8B、数据拆分和作者训练基础设施;SDPO 与基线的目标和单步前向成本不同,四倍数字使用累计生成数,不代表四倍总 FLOPs 或墙钟速度。
  • 系统条件:单节点 4×NVIDIA GH200、总 378GB VRAM;PyTorch 2.7.0、CUDA 12.8、FSDP2、vLLM、verl
  • 成本归因:SDPO 额外执行反馈教师 log-prob 前向;Top-K 20 避免保存两份完整词表 logits。论文 Figure 5 报告小幅单步时间增量,没有提供跨实现总 FLOPs。
  • 证据定位:Sections 2.2、4;Figure 1;Appendix D.2.3 Table 9;Appendix E.1–E.2 Tables 12–13;arXiv v2 HTML。
  • 支持的最窄结论:在作者的 Qwen3-8B/LCBv6 配置和 80 步预算内,SDPO 的最终验证准确率高于所测 RLVR 基线,并以更少生成量达到 GRPO 的最终水平。
  • 解读:这是论文首要经验结果,优势同时包含丰富反馈、logit 级目标、EMA 教师和任务专属超参数的共同作用。

结果 2:无文本反馈时,同组成功答案仍能提供稠密监督

  • 设置:SciKnowEval 化学、物理、生物、材料科学与 ToolAlpaca;Qwen3-8B、Olmo3-7B-Instruct;每种方法在统一模型—数据设置中训练 5 小时,3 个随机种子;每次使用 32 个问题、每题 8 条 rollout。
  • 指标:avg@16;训练墙钟时间;回答长度。
  • 结果:论文汇总最终平均准确率为 SDPO 70.2%、GRPO 66.6%。Olmo3-7B-Instruct 化学任务中,SDPO 用 50 分钟达到 GRPO 5 小时的准确率,5 小时准确率又高 10 个百分点以上。跨任务回答平均长度低于 GRPO 三倍以上,Olmo 化学设置达到 11 倍长度差。
  • Baseline:经过非对称裁剪、去偏归一化和 rollout-policy 修正的 GRPO;与 SDPO 同为单次在线更新的 on-policy GRPO。
  • 对照是否可比:三种方法分别做超参数搜索,GRPO 默认每批执行 4 个 off-policy mini-batch 更新,SDPO 和 on-policy GRPO 各执行 1 次更新;墙钟对照包含这种算法配方差异。Table 3 的全局最优配置与 Appendix Table 7 的逐模型—任务最优配置口径不同。
  • 学习信号边界:全失败组且没有文本反馈时,SDPO 蒸馏掩码为零;增益来自至少出现一条成功回答后,将其作为同组其它回答的特权示例。
  • 证据定位:Section 3;Figures 6–7;Table 3;Appendix D.1 Tables 7–8;Appendix E.2 Table 12;官方代码 ray_trainer.py 的 solution aggregation 和 self_distillation_mask
  • 支持的最窄结论:在本文五个推理/工具任务和两种 7B–8B 模型上,同组成功答案驱动的 SDPO 整体平均结果高于调优 GRPO,并生成更短回答;单个任务仍存在 SDPO 低于 GRPO 的情况。
  • 解读:结果说明标量环境也能通过“组内成功轨迹作为上下文”升级为更密的监督,同时保留了至少一次成功这一启动条件。

结果 3:丰富反馈和 logit 级信用贡献互补,模型能力形成门槛

  • 假设:反馈条件化的同模型分布在学生已经访问的前缀上提供更可靠的局部偏好,并且逐候选分布差比单个采样 token 或整条序列的统一信用保留更多有效信息。
  • 适用域:Qwen3 与 Qwen2.5-Instruct 系列、本文 LiveCodeBench v6 代码反馈模板、学生在线轨迹和 Top-K 候选集;当前比较没有覆盖开放式反馈、跨模型教师或学生支持集外的候选。
  • 设置:Qwen3 系列与 Qwen2.5-Instruct 系列在 LCBv6 上比较模型规模;Qwen3-8B 上比较 logit-level、token-level、sequence-level SDPO 和 GRPO;3 个随机种子。
  • 指标:训练结束验证准确率;不同信用粒度的准确率。
  • 结果:logit-level 高于 token-level,token-level 高于 sequence-level;sequence-level 仍高于 GRPO,支持丰富反馈本身和信用密度各自贡献。较大 Qwen3 模型的 SDPO–GRPO 差距更大;Qwen2.5-1.5B 上 SDPO 低于 GRPO,Qwen2.5-7B 高于 GRPO,8B 大致相当。
  • Baseline:三种 SDPO 信用粒度、GRPO;跨规模使用同模型族。
  • 对照是否可比:粒度消融共享反馈来源,能较直接区分“读取反馈”和“为更多候选分配信用”;模型族比较同时改变上下文学习、代码能力、校准和基础准确率,当前证据支持能力门槛,尚未识别单一因果因素。
  • 证据定位:Sections 4.1–4.2;Figures 8–10;Appendix D.2 Figures 15–17。
  • 支持的最窄结论:在本文 LCBv6 设置中,丰富反馈与更稠密的词表级信用都带来增益,弱模型的反馈条件教师可能低于标量奖励基线。
  • 解读:自教师的关键资源是反馈条件下的判断质量;参数共享本身不保证教师优于学生。

结果 4:教师正则化和反馈组成决定稳定性与探索

  • 设置:Qwen3-8B/LCBv6;比较当前教师、冻结初始教师、trust-region 教师和 EMA 教师;比较环境输出、同组成功答案、二者组合,以及在反馈上下文额外加入学生原回答。
  • 指标:最好/平均验证准确率;自教师生成准确率;与原尝试产生相同环境输出的比例;学生熵。
  • 结果:未经正则化的当前教师后期发散,最好/平均准确率为 36.1%/29.8%;冻结、trust-region、EMA 分别达到 48.8%/44.4%、50.6%/45.6%、49.3%/45.3%。环境输出与同组答案组合的学生准确率为 48.3%,额外把原回答复制进教师的反馈上下文后降至 44.5%,平均熵由 0.38 降至 0.23。
  • Baseline:四种教师稳定化方式与四种反馈组合。
  • 对照是否可比:设置共享训练任务;Table 4 汇总至 90 步,主结果使用 EMA;提示消融同时影响教师准确率、输出多样性和学生熵,支持“额外复制原回答会锚定教师”的解释。
  • 证据定位:Sections 2.3、4.3、4.6;Tables 4、6;Appendix A.2;Appendix D.2.2。
  • 支持的最窄结论:SDPO 的移动教师需要正则化;在本文代码环境中,错误输出与同组成功答案互补,把学生原回答额外放进反馈文本会降低探索。
  • 解读:教师仍会在 assistant 位置 teacher-force 原回答;该消融针对的是把原回答再复制到 user 反馈上下文,并非移除用于对齐位置的目标序列。

结果 5:测试时更新提高困难题发现率,收益分布高度不均

  • 设置:Qwen3-8B;19 道基础模型 pass@64<0.564<0.5 的 LCBv6 困难题,其中 9 道低于 0.03;每题 5 个随机种子;每轮 16 条回答;最多 2750 次生成。
  • 指标:discovery@kk;平均首次成功所需生成数。
  • 结果:9 道很困难题上,SDPO/best-of-kk/multi-turn 的 discovery@2750 为 53.2%/41.5%/35.6%;达到 22% 发现概率时约有 3 倍生成量差。19 题平均首次成功为 894/1145/1141 次,对应约 1.3 倍;部分题基线更快,Q3 只被 SDPO 在预算内发现。
  • Baseline:固定模型 best-of-kk;保留历史反馈的 multi-turn sampling。multi-turn 使用 32K 滑动提示,约 837–1007 步后触及上下文长度。
  • 对照是否可比:三种方法以总生成次数作为预算,SDPO 还执行参数前向、反向和优化器更新,multi-turn 增加长上下文 prefill;相同生成数不等价于相同 FLOPs、墙钟时间或显存。
  • 证据定位:Section 5;Figure 13;Appendix D.3 Figures 19–20、Tables 10–11。
  • 支持的最窄结论:在这 19 道题和给定生成预算中,测试时 SDPO 提高总体发现概率,并在一个很困难子集的指定概率阈值上减少约三分之二生成;它没有在每道题或平均首次成功指标上达到三倍。
  • 解读:参数更新能够积累超出上下文窗口的失败反馈,额外训练计算和跨问题泛化不属于这项证据覆盖范围。

结果 6:在线更新的旧能力保持优于离线教师成功样本 SFT

  • 设置:Qwen3-8B 在 LCBv6 上训练后,评估 IFEval、ArenaHard-v2 的 hard prompt/creative writing 子集和 MMLU-Pro;比较 base、教师成功样本 SFT、GRPO、SDPO。
  • 指标:LCBv6 准确率与四项留出分数的平均值。
  • 结果:base、SFT、GRPO、SDPO 的留出平均分别为 43.5、41.4、41.8、42.4;LCBv6 分别为 27.9、42.7、41.2、48.8。SDPO 的留出平均仍低于 base 1.1 分,但高于 SFT 和 GRPO,同时取得最高目标任务分数。
  • Baseline:离线 SFT 使用初始自教师生成的成功回答,需要学生和教师两次生成;GRPO 使用在线学生轨迹。
  • 对照是否可比:这是一组终点分数,目标任务增益和旧能力变化没有形成完整 Pareto 曲线;ArenaHard-v2 使用 LLM judge,缺少多任务顺序与长期训练复验。
  • 证据定位:Section 4.4;Table 5。
  • 支持的最窄结论:在一次 LCBv6 后训练中,SDPO 的目标任务—留出能力折中优于所测离线教师 SFT 与 GRPO,同时仍有相对基础模型的平均留出下降。
  • 解读:“避免灾难性遗忘”在本文证据下表示退化较小,不能理解为旧能力完全不变。

局限

  1. 自教师质量形成能力门槛。 Qwen2.5-1.5B 上 SDPO 低于 GRPO,论文将其归因于较弱的上下文学习和回溯能力;模型规模、基础代码能力、提示遵循和校准仍未分离。
  2. 丰富反馈可能错误或可被利用。 教师直接把环境文本当作特权信息,没有独立反馈可信度估计。错误测试、含糊裁判、提示注入或与最终目标不一致的状态描述会改变更新方向。
  3. 纯标量设置仍有成功启动条件。 全失败组且无文本反馈时没有蒸馏更新。SDPO 在首个成功前学习的证据来自具有运行时错误和测试输出的丰富反馈环境。
  4. Top-K 限制新候选信用。 Top-K 按学生分布选择,教师独有的高概率候选若落在集合外只能进入 tail 桶。机制更擅长重排学生已有支持,探索学生极低概率动作的能力未直接测量。
  5. 反馈来自完整原轨迹。 早期候选 token 的优势使用原轨迹最终得到的反馈;它衡量反馈条件教师在该前缀上的偏好差,无法等同于替换该 token 后重新运行环境得到的反事实价值。
  6. 逐位置估计器忽略前缀分布导数。 主实现把学生采样前缀视为固定,未包含早期 token 对未来状态和未来蒸馏损失的完整影响。作者报告序列级估计器没有额外增益,但没有给出跨任务或方差分析。
  7. 经验配方使用多种散度。 无反馈结果使用 Jensen–Shannon,丰富反馈与测试时结果使用反向 KL;Top-K、学习率、EMA 速率和优势裁剪也随设置改变。主结果支持完整配方,尚未建立统一散度的跨设置优势。
  8. 计算效率口径不完整。 四倍和三倍主要按生成次数衡量。SDPO 增加教师前向、反向和优化器状态;multi-turn 增加长上下文 prefill。论文提供单步时间图和硬件条件,没有报告同达到目标分数下的 FLOPs、能耗或端到端费用。
  9. 实验覆盖仍集中。 丰富反馈主结果只有 LCBv6、Qwen3 系列和 3 个随机种子;测试时实验只有 19 道困难题与 5 个种子。长时程工具智能体、开放式文本反馈、连续奖励和大规模多任务 RL 仍待验证。
  10. 发现加速分布不均。 “三倍”来自很困难题集合达到 22% 发现概率的曲线位置;19 题平均首次成功只显示约 1.3 倍,并有多道题由基线更早发现。
  11. 旧能力仍有下降。 SDPO 的留出平均优于 GRPO 和离线 SFT,同时低于基础模型;当前实验支持更好的目标任务—遗忘折中,无法支持零遗忘。
  12. 版本和评审透明度有限。 ICML 2026 正式发表状态已经核验,完整论文未发现公开 ICML review、rebuttal 或 meta-review。测试时子论文的公开 OpenReview forum 只有 submission note。

跨论文关系

  • GKD:两者都在学生在线采样前缀上匹配教师 next-token 分布。GKD 使用独立外部教师并系统研究散度方向;SDPO 用环境反馈条件化的 EMA 同模型构造教师,把分布差解释为反馈驱动的信用。
  • OPSD:两者都把学生原回答接到普通提示和特权提示后执行 teacher-forced 双重评分,教师均无需自行生成 CoT。OPSD 使用固定初始模型和数据集参考解答,并加入逐词表项裁剪;SDPO 使用在线环境反馈或同组成功答案、EMA/trust-region 教师和 Top-K 加 tail,可在测试时持续更新。
  • SDFT:两者共享 Jonas Hübotter 与 Idan Shenfeld,并复用“学生在线采样—特权上下文 EMA 同模型—相同前缀 token 分布匹配”的核心原语。SDFT 把 query-specific demonstration 用作特权信息,面向新任务学习与旧能力保持;SDPO 把在线环境反馈或同组成功答案用作特权信息,将分布差转成 token/logit 级信用并扩展到测试时更新。两篇 arXiv v1 相隔约 23 小时提交,SDPO Section 6.4 将 SDFT 列为 concurrent work;现有证据支持将它们视为同一合作网络同期展开的方法族。
  • CriPO:CriPO 在开放任务中保留 GRPO 主目标,只在评分项未覆盖或整体优势压制局部行为时定向调用自蒸馏。它可以视为把 SDPO/OPSD 的稠密分布信号限制到诊断出的评分项与 token,以减轻全局蒸馏对探索和奖励的干扰。
  • SEED:SEED 将反馈条件自蒸馏扩展到工具智能体轨迹,用模型生成的事后技能作为特权上下文,并与 GRPO 联合训练;SDPO 提供更早的 logit 级信用、教师稳定化和文本环境反馈基线。
  • Credit Assignment Survey:SDPO 位于 token/logit 级信用分配与环境状态利用的交界。它保留 on-policy 前缀,用反馈条件分布替代只依赖终局标量的优势估计,同时没有执行真实的 token 反事实环境重放。

主要启发

  1. 环境接口应同时保存奖励和可解释状态。训练器只消费标量会主动丢失信用信息,文本错误、测试差分和工具状态可以通过条件教师转成局部监督。
  2. “自教师”需要拆成参数来源、特权上下文和更新时序。SDPO 主实验中的教师是 EMA 参数加反馈上下文,概念上的同一当前模型只是起点。
  3. 教师生成和教师评分是两条不同成本路径。SDPO 选择对学生原轨迹做前向评分,省去教师解码,并使学生—教师分布能够按位置直接比较。
  4. logit 级信用提供的信息量受候选集合限制。Top-K 适合压缩显存,后续方法可以显式并入 teacher-only top-K、学生与教师并集或不确定性触发的候选扩展。
  5. 测试时训练的预算需要同时报告生成、前向、反向、优化器和上下文成本。discovery@kk 适合比较尝试数,完整系统选择仍需要墙钟与资源曲线。

本地讨论补充

  • 本次跨论文复核把 SDFT 与 SDPO 归入同一方法族。两者共享特权上下文在线自蒸馏骨架;SDFT 的论文结果实际使用完整词表逐 token forward KL,SDPO 按实验设置使用 reverse KL 或广义 Jensen–Shannon 散度,并加入 Top-K、tail 桶、反馈掩码和教师稳定化。共同计算骨架成立,具体训练目标与工程配方仍需分别解释。
  • 在 SDPO 的纯标量奖励设置中,同组成功 rollout 充当失败 rollout 的在线 demonstration,这一分支与 SDFT 最接近;两者仍分别依赖组内首次成功和预先提供的 query-specific demonstration。
  • 作者重叠、约 23 小时的 arXiv 提交间隔、项目主页互链和 concurrent-work 定位支持“紧密协作下的同期方法展开”。公开材料没有披露统一项目管理或明确的单向继承关系。