2601.19897-self-distillation-continual-learning
Self Distillation Enables Continual Learning
SDFT 让当前 student 先生成 on-policy trajectory,再让看到同一 query 与对应 expert demonstration 的 EMA 同模型在这些 prefix 上给 full-vocabulary token distribution,从而把 demonstration 转成稠密自蒸馏信号;Qwen2.5-7B 的三项 skill-learning 实验同时提高新任务准确率并把平均旧能力保持在 base model 的 1.0 分以内,知识注入 strict accuracy 从 SFT 的 80% 提到 89%,但收益依赖足够强的 in-context learning,且项目仓库明确说明全部论文结果实际使用 per-token forward KL,当前 OpenReview PDF 的 reverse-KL 目标、IRL 等价推导与实验实现尚未对齐。
Source
- Workflow version: v2.1
- Material type: research-paper
- Analysis modules: experiment, theory, docs
- Canonical source: https://openreview.net/forum?id=qA6FgH0nnZ
- Title: Self-Distillation Enables Continual Learning
- Authors: Idan Shenfeld, Mehul Damani, Jonas Hübotter, Pulkit Agrawal
- Responsible organization: Massachusetts Institute of Technology (MIT);Improbable AI Lab;ETH Zürich
- arXiv: https://arxiv.org/abs/2601.19897
- PDF: https://openreview.net/pdf?id=qA6FgH0nnZ
- Code/Project: Project page;GitHub
- OpenReview / Review page: https://openreview.net/forum?id=qA6FgH0nnZ
- Submitted: OpenReview submission note 创建于 2026-01-22 22:21:56 UTC;arXiv v1 提交于 2026-01-27 18:59:08 UTC
- Published / updated: ICML 2026 Spotlight;Proceedings of Machine Learning Research 306;OpenReview submission note 更新于 2026-06-24 23:19:25 UTC
- Current version read: OpenReview ICML 2026 camera-ready revision,17 页;arXiv v1;项目仓库
maincommitd77573212fa0a3ae2eeb64b9b44db1c251f75e3e - Version / revision read: OpenReview forum
qA6FgH0nnZ;arXiv:2601.19897v1;GitHubd77573212fa0a3ae2eeb64b9b44db1c251f75e3e - Accessed: 2026-07-17
- Key figure decision: include
- Review status: page-type=official-review; match-confidence=high; observed-at=2026-07-17; venue-status=ICML 2026 accepted (spotlight)
- OpenReview API snapshot: authenticated;16 条可读 Note;类型为 submission、review、rebuttal、acknowledgement、comment、decision;无缺失的已发现类别
- Subjects: cs.LG;deep learning algorithms;continual learning;on-policy distillation;context distillation
作者与关系
- Idan Shenfeld: MIT / Improbable AI Lab;历史机构:Google DeepMind、Technion。
- Mehul Damani: MIT;历史机构:MIT-IBM Watson AI Lab、New York University、National University of Singapore。
- Jonas Hübotter: ETH Zürich;历史机构:Stanford University、Technical University of Munich。
- Pulkit Agrawal: MIT / Improbable AI Lab;历史机构:University of California, Berkeley、Indian Institute of Technology Kanpur。
Idan Shenfeld 是通讯作者,也是 Pulkit Agrawal 指导的 MIT 博士生。Pulkit Agrawal 同时领导 Improbable AI Lab;两人此前已沿“on-policy update 降低遗忘”的方向合作 RL's Razor。Mehul Damani 是 Jacob Andreas 指导的 MIT 博士生,把本工作连接到语言模型强化学习、校准和工具使用研究。Jonas Hübotter 是 Andreas Krause 指导的 ETH Zürich 博士生,研究 test-time training、reinforcement learning 和 foundation-model specialization;他与 Idan Shenfeld 还共同参与 Reinforcement Learning via Self-Distillation 与后续 user-interaction self-distillation 工作。论文因此形成 MIT 内部跨实验室合作,以及 MIT–ETH 的 self-distillation 方法线。
当前归档中没有这四位作者的既有论文作者重叠。方法关系已连接到 GKD、MOPD 和 Self-Trained Verification;这些关系来自 student-trajectory distillation、teacher construction 和 privileged-context transfer,详见“跨论文关系”。
论文脉络
1. 研究问题、背景和价值
Foundation model 在部署后会持续遇到新工具、新知识和新任务。参数更新需要同时满足两个目标:新能力能够进入权重,既有通用能力保持稳定。现有部署通常通过 expert demonstrations 提供监督,因为许多任务缺少可执行 verifier、可校准 reward model 或可重复的在线环境。
SFT 直接在 demonstration trajectory 上训练,训练状态分布由 expert prefix 决定;推理状态分布由更新后的模型自己生成。模型一旦在早期 token 偏离 demonstration,后续 prefix 会离开训练覆盖区域,形成 compounding error。SFT 的参数更新也可能远离 base model distribution,带来 catastrophic forgetting。
On-policy RL 让模型在自己的 trajectory 上学习,已有结果显示它通常保留更多旧能力;它需要 reward。论文的核心问题因此是:只有 expert demonstration、缺少显式 reward 时,如何得到 on-policy learning signal,并把它用于 continual learning?
2. 已有解决方案与不足
论文把相关方案分成四类:
- SFT / offline imitation:训练简单,state distribution 固定在 expert data,容易产生 train–inference mismatch 和遗忘。
- Inverse Reinforcement Learning (IRL):从 demonstration 恢复 reward,再执行 on-policy RL;reward identifiability、结构先验和计算成本限制了 LLM 规模应用。
- Context distillation:让带额外 context 的模型教无 context 的同模型;既有方案常在 teacher trajectory 或静态 context 上离线蒸馏,主要承担 prompt compression 或 behavior transfer。
- On-policy distillation / GKD:在 student 自生成 prefix 上查询 teacher distribution,直接处理 student state distribution;通常假定另有一个更强 teacher。
SDFT 的增量集中在 teacher construction:每个训练样本自带一条 demonstration,teacher 和 student 共享模型家族与持续更新的权重,teacher 通过 instance-wise context 获得目标任务信息。它用一个单阶段训练过程同时学习新任务和限制参数漂移。
3. 作者可能的思考路径
以下为本地分析的受约束重建:
- 先把 prior work 中“on-policy RL 遗忘更少”的观察分解成 state-distribution effect,而非 reward 独有属性。
- 把 demonstration 看作能够临时改变模型行为的 context。若模型 ICL 足够强,带 demonstration 的模型可以产生比 base policy 更接近目标的 conditional distribution。
- 让 student 生成 trajectory,随后在相同 prefix 上分别计算 student 与 demonstration-conditioned teacher 的 logits。这样 teacher 能在 student 实际进入的状态上给逐 token 修正。
- teacher 使用 student 参数的 EMA,兼顾能力更新与训练稳定性;冻结 base teacher 会逐步落后,直接使用当前 student 容易放大反馈噪声。
- 用新任务准确率、旧能力平均分、顺序学习曲线和 pass@k 分别检查 acquisition、forgetting、连续积累和 entropy-collapse 替代解释。
4. 核心假设或切入点
SDFT 依赖五项成立条件:
- ICL optimality:给定 query-specific demonstration 后,teacher 能输出接近目标任务最优策略的行为。
- Minimal deviation:这个 conditional teacher 在达到高新任务性能的同时仍接近当前/base policy。
- Student coverage:student rollout 能覆盖部署时会遇到的主要 prefix,使 teacher feedback 对 compounding error 有效。
- Teacher stability:EMA 更新速度足以跟踪 student 学到的新能力,同时过滤直接 self-teaching 的高方差反馈。
- Demonstration quality:demonstration 能表达正确任务意图,prompt 能促使 teacher 推广意图并减少逐字复制。
论文只在 ToolAlpaca 上直接验证前两项,并通过模型规模实验间接验证 ICL 依赖。其它条件主要由消融和结果趋势支持。
5. 方法 / 理论 / 实现框架
5.1 Student rollout 与 demonstration-conditioned teacher
训练集为
teacher 看到同一 query 与 demonstration,权重
每个 training example 只采一条 student trajectory:
随后 student 与 teacher 都在
teacher prompt 先给 query,再说明后续内容是一份示例 response,插入 demonstration,并要求模型生成自己的回答和 reasoning process。代码默认跳过 completion 的前三个 token loss,用于降低 teacher 语言模板被 student 继承的 artifact。

证据定位:Section 3;Algorithm 1,PDF pp. 3–4、17;GitHub main.py 与 distil_trainer.py,commit d77573212fa0a3ae2eeb64b9b44db1c251f75e3e。
5.2 论文陈述的 reverse-KL 目标
OpenReview camera-ready PDF 把 sequence-level 目标写为 student 到 teacher 的 reverse KL:
朴素实现需要同时处理 trajectory sampling distribution 和每个 prefix 的 token distribution。论文选择单条 student rollout,并在每个 prefix 上对 vocabulary 做 analytic KL,得到低方差的 per-token update。Appendix A.1 明确承认这个 full analytic per-token estimator 对 sequence-level KL 仍有偏差,因为它没有传播早期 token 选择对未来 state distribution 的影响;Rao–Blackwellized estimator 才给出无偏的 sequence-level gradient,计算成本更高。
证据定位:Section 3 Eq. 1;Appendix A.1,PDF pp. 3、12。
5.3 IRL 解释的覆盖范围
论文从 KL-regularized policy improvement 出发:
若接受 in-context assumption:
则 demonstration-induced implicit reward 可以写为:
token-level log-ratio 可以解释为逐 token reward。这个推导说明 reverse-KL objective 与 KL-regularized policy improvement 的关系;它依赖 conditional teacher 接近最优 policy 的假设。实际 analytic per-token estimator省略 future-state effect,实验实现又使用 forward KL,因此 IRL 等价更适合作为目标层解释,当前实验证据没有单独验证它是 observed gains 的机制。
证据定位:Section 3.1 Eqs. 3–6,PDF p. 4;Appendix A.1,PDF p. 12;OpenReview Reviewer 4 rebuttal 中关于 future reward sum 的澄清。
5.4 论文、README 与代码之间的 KL 方向差异
| 来源 | 对训练目标的陈述 | 直接证据 |
|---|---|---|
| OpenReview camera-ready PDF | student-to-teacher reverse KL;主文与 IRL 推导沿 reverse KL 展开 | Section 3 Eq. 1;Section 3.1;Appendix A.1 |
| 项目 README | 全部论文结果由 on-policy sampling + per-token forward KL 产生,并称与 GKD 相似 | README Updates,标注 04/07/26 |
| 当前默认配置 | alpha=0.0 使用 forward KL;alpha=1.0 使用 reverse KL |
distil_config.py |
| 当前训练入口 | 构造 DistilConfig 时没有覆盖 divergence alpha,因此保留 forward-KL 默认值 |
main.py |
| 当前 loss 实现 | alpha == 0 分支对 teacher target 与 student log-probability 计算 full-vocabulary forward KL |
distil_trainer.py |
本地判断:当前结果最稳妥的归因对象是“student on-policy sampling + query-specific demonstration-conditioned EMA teacher + per-token forward-KL distillation”。reverse KL、IRL 等价和 analytic reverse-KL estimator 仍属于论文主张;它们需要更正后的论文版本或 divergence-controlled reproduction 才能与已报告结果绑定。
5.5 训练与成本路径
主实验对 Qwen2.5-7B-Instruct 做 full fine-tuning,每个 run 使用一张 NVIDIA H200,训练框架为 Hugging Face TRL。skill learning 对 SFT、DFT、SDFT 共同 sweep learning rate
SDFT 每个 prompt 生成一条 rollout,再对 student 与 teacher 做 full-vocabulary logits 计算。论文报告相对 SFT 约
证据定位:Section 5 Computational Costs,PDF pp. 8–9;Appendix B.1,Tables 3–4,PDF pp. 13–15。
6. 结论链条
- 假设:强 ICL 模型在看到 query-specific demonstration 后能形成高准确率、低 KL deviation 的 conditional teacher。
- 机制:student 在自己的 trajectory 上展开;EMA teacher 在同一 prefix 上提供 full-vocabulary distribution,训练信号覆盖 student 实际访问的状态。
- 直接证据:ToolAlpaca teacher 达到 100% accuracy 且对 base KL 为 0.68 nats;三项 skill task 中 SDFT 的新任务准确率均高于 SFT,旧能力平均分距离 base 不超过 1.0;knowledge acquisition strict / OOD accuracy 为 89% / 98%。
- 最窄结论:在本文 Qwen2.5 与 Olmo 实验、给定高质量 demonstration 和足够 ICL 能力时,student-trajectory self-distillation 比匹配预算下的 SFT 更好地平衡新任务学习与旧能力保持。
- 边界:实现证据对应 forward KL;3B 模型落后 SFT;自动 judge、自建知识数据、额外生成成本和有限模型族限制了外推范围。
关键实验结果
结果 1:conditional teacher 在 ToolAlpaca 上同时满足高任务性能与较小分布偏移
- 假设:query-specific demonstration 能让 Qwen2.5-7B-Instruct 形成高 reward、低 base-policy KL 的 conditional teacher。
- 适用域:ToolAlpaca tool-call task;Qwen2.5-7B-Instruct;本文 teacher prompt 与 demonstration 构造。
- 设置:Qwen2.5-7B-Instruct;ToolAlpaca;base policy、带 query-specific demonstration 的 teacher、SFT model。
- 指标:tool-call success;对 base policy 的 KL divergence;50 条 teacher reasoning trace 人工检查。
- 结果:base model success 为 42%;conditional teacher 为 100%;teacher 对 base KL 为 0.68 nats,SFT model 为 1.26 nats;作者称 50 条抽查的 tool call 与 reasoning trace 均有效。
- Baseline:无 demonstration 的 base model;在 demonstration 上训练的 SFT model。
- 对照是否可比:同一 base model 和 ToolAlpaca 任务;teacher accuracy 与 KL 只验证 inference-time conditional policy,50 条 trace 的抽样方法与独立标注协议未披露。
- 证据定位:Section 3.2;Figure 2 right;PDF pp. 4–5。
- 支持的最窄结论:在 ToolAlpaca 上,这个 prompt 能构造一个准确率高于 base、参数分布偏移小于 SFT 的 conditional teacher。
- 解读:它支持 SDFT 的局部 ICL assumption,并未证明 conditional teacher 在所有任务上接近未知最优 policy。
结果 2:三项 skill learning 同时提高新任务准确率并接近 base 旧能力
- 设置:Qwen2.5-7B-Instruct;Science Q&A、Tool Use、Medical 三项独立 full fine-tuning;旧能力平均分来自 HellaSwag、HumanEval、IFEval、MMLU、TruthfulQA、Winogrande。
- 指标:新任务 accuracy;六项 prior-capability benchmark 平均分。
- 结果:
| 任务 | Base:新 / 旧 | SFT:新 / 旧 | DFT:新 / 旧 | SDFT:新 / 旧 |
|---|---|---|---|---|
| Science Q&A | 32.1 / 65.5 | 66.2 / 53.4 | 54.8 / 60.2 | 70.2 / 64.5 |
| Tool Use | 42.9 / 65.5 | 63.2 / 56.0 | 64.2 / 60.8 | 70.6 / 65.4 |
| Medical | 30.1 / 65.5 | 35.5 / 60.2 | 36.2 / 64.0 | 40.2 / 65.4 |
- Baseline:SFT、SFT + Re-invoke、DFT;表中列出最直接的 SFT / DFT 对照,完整 Re-invoke 数字见 Table 5。
- 对照是否可比:方法从同一 base checkpoint 出发,并 sweep learning rate、batch size、epoch;按 target-task validation 选 checkpoint。SDFT 另有 EMA 超参数和 on-policy generation,训练 compute 高于 SFT / DFT,比较反映 accuracy–retention trade-off,未匹配 wall-clock。
- 统计:Appendix B.2 称除特别说明外使用 3 seeds 并报告 95% confidence interval;Table 5 给出 point estimate,未列每项 interval。
- 证据定位:Section 4.1–4.2;Figure 4;Appendix Table 5,PDF pp. 6–7、17。
- 支持的最窄结论:在三项 Qwen2.5-7B 单任务适配中,SDFT 的新任务准确率高于 SFT / DFT,同时 prior average 与 base 的差值为 0.1–1.0 分。
- 解读:这是首要贡献最强的直接证据;compute 未匹配使它更适合作为方法可行性与 Pareto trade-off 证据。
结果 3:顺序训练展示三项技能的累计保持
- 设置:同一个 Qwen2.5-7B-Instruct 依次训练 Tool Use、Science Q&A、Medical;比较 SDFT 与 SFT。
- 指标:每项任务相对 base 与两种算法最大值线性归一化后的 performance,随 gradient step 变化。
- 结果:SDFT 学习后续任务时,前序任务曲线总体保持;SFT 在任务切换后出现明显下降和振荡。
- Baseline:sequential SFT。
- 对照是否可比:任务顺序一致;SDFT 与 SFT 的最佳 batch size 不同,因此每阶段 gradient-step 数不同。图使用每任务独立归一化,未给原始 accuracy、旧通用能力曲线或顺序置换。
- 证据定位:Figure 3;Section 4.2;PDF pp. 5、7;OpenReview rebuttal 对 gradient-step 差异的说明。
- 支持的最窄结论:在固定三任务顺序和归一化任务指标上,SDFT 比 SFT 更稳定地保留已学技能。
- 解读:该图支持短序列 continual learning;长期任务数、顺序敏感性和开放式数据流仍待复验。
结果 4:知识注入提高 strict 与 OOD accuracy
- 设置:约 200K tokens 的 2025 年自然灾害 Wikipedia corpus;GPT-5 生成 QA,规模约为原始 corpus 的
;Qwen2.5-7B-Instruct;oracle RAG、CPT、SFT、SDFT。 - 指标:strict accuracy;lenient accuracy;依赖注入知识的 indirect OOD accuracy;GPT-5-mini 自动评判。
- 结果:
| 方法 | Strict | Lenient | OOD |
|---|---|---|---|
| Base | 0 | 0 | 0 |
| Oracle RAG | 91 | 100 | 100 |
| CPT | 9 | 37 | 7 |
| SFT | 80 | 95 | 80 |
| SDFT | 89 | 100 | 98 |
- Baseline:oracle RAG 提供正确文章,CPT 读原始文本,SFT 读生成 QA。
- 对照是否可比:所有 parametric methods 使用同一 base;输入形式与 compute 不同,oracle RAG 保留外部 context,SDFT 使用 text + answer demonstration 并做 rollout。生成式 QA 与 judge 来自同一模型供应商家族,未报告独立人工 accuracy audit。
- 证据定位:Section 4.1;Table 1;Appendix A.2、B.3,PDF pp. 5–6、13、15–16。
- 支持的最窄结论:在这组自建 2025 灾害 QA 上,SDFT 比 SFT 获得更高 strict 与 indirect-question accuracy,并接近 oracle RAG。
- 解读:结果支持更广的知识整合;数据构造、judge 依赖和单一主题限制了外部有效性。
结果 5:模型规模决定 SDFT 能否超过 SFT
- 设置:Qwen2.5 3B / 7B / 14B 在 Science Q&A 上比较 SDFT 与 SFT;另用 Olmo-3-7B-Think 在无 chain-of-thought demonstration 的 Medical task 上测试 reasoning preservation。
- 指标:新任务 accuracy;SDFT–SFT accuracy gap;Olmo average generation tokens。
- 结果:Qwen 3B 的 SDFT 相对 SFT 为
分,7B 为 ,14B 为 。Olmo-3-7B-Think 的 base / SFT / SDFT accuracy 为 31.2 / 23.5 / 43.7,平均生成长度为 4612 / 3273 / 4180 tokens。 - Baseline:同尺寸 SFT;Olmo base。
- 对照是否可比:同一 model size 内可比;跨尺寸只展示三点且未直接测量 ICL quality。Olmo 表把生成长度用作 reasoning-depth proxy,长度不能单独证明 reasoning quality。
- 证据定位:Sections 4.3–4.4;Figure 5 left;Table 2,PDF pp. 7–8。
- 支持的最窄结论:本文设置中 SDFT 的相对收益随 Qwen model size 增大,3B 条件下会落后 SFT;Olmo reasoning-model case 支持方法能够减少 short-answer SFT 引起的行为收缩。
- 解读:模型能力是明确的适用门槛,论文对 frontier model 的进一步收益仍属于外推。
结果 6:on-policy data、teacher 形式与 KL 方向需要分开解释
- 适用版本:OpenReview ICML 2026 camera-ready PDF;GitHub
maincommitd77573212fa0a3ae2eeb64b9b44db1c251f75e3e,观察于 2026-07-17。 - 设置:Tool Use 上比较 SDFT、固定 teacher outputs 的 offline KL distillation、SFT from teacher;Appendix 对 frozen base teacher、current-student teacher、EMA teacher 做消融;项目仓库公开实际 loss。
- 指标:accuracy 随 generation 数变化;训练稳定性;实现中的 divergence branch。
- 结果:Figure 6 显示 on-policy SDFT 曲线高于两种 offline teacher 使用方式;EMA teacher 高于 frozen base 并避免 current-student teacher 的 collapse。仓库 README 说明已报告结果使用 per-token forward KL,代码默认配置与训练入口一致。
- Baseline:相同 conditional teacher 下的 offline distillation;不同 teacher weight update;代码中的 forward / reverse KL 分支。
- 对照是否可比:Figure 6 固定 teacher construction,能较好分离 on-policy state distribution;论文没有报告 divergence-controlled forward-vs-reverse KL 实验,因此 KL 方向无法由主结果识别。
- 证据定位:Section 4.5;Figure 6;Appendix A.3,PDF pp. 8、13–14;GitHub README、
distil_config.py、distil_trainer.py、main.pyatd77573212fa0a3ae2eeb64b9b44db1c251f75e3e。 - 支持的最窄结论:student on-policy prefix 和 EMA teacher 对本文收益与稳定性有直接消融支持;实验支持 forward-KL implementation,reverse-KL 专属效果仍待复验。
- 解读:这一版本差异收窄了论文的理论归因,同时保留了核心经验贡献。
OpenReview / 审稿意见吸收
公开评审快照
OpenReview API 在 2026-07-17 认证读取成功,共返回 16 条可读 Note:1 submission、4 official reviews、4 rebuttals、4 rebuttal acknowledgements、2 follow-up comments、1 decision。四份 acknowledgement 均为 fully_resolved,最终决定为 Accept (spotlight)。
- Reviewer consensus: 四位 reviewer 均认可问题重要、方法清楚且实验覆盖充分;分歧集中在 novelty 与 baseline 覆盖。
- Main criticisms: 模型规模覆盖、ICL 能力依赖、训练成本、baseline 公平性、最优 policy 假设和 sequence-level KL estimator 是主要疑问。
- Author response: rebuttal 补充 Olmo、32B external teacher、GRPO、replay、EMA sensitivity 与 Re-invoke cost curve,并澄清 analytic per-token estimator 的偏差。
- 对可信度的影响: 补充结果增强了跨模型、强 teacher 与成本比较的证据;多数内容仍停留在 rebuttal,forward-KL 实现与 reverse-KL 理论的版本差异继续限制理论归因。
| Official review note | 当前 recommendation | Confidence | Soundness | Originality | Rebuttal 后状态 |
|---|---|---|---|---|---|
iJm3pe5ROj |
4 | 3 | 2 | 2 | acknowledgement 说明在补充 32B teacher 对照后将分数提高到 4;当前字段为 4 |
Yure2kBjCo |
5 | 4 | 3 | 3 | 维持正面评价 |
zmgBwkdlGD |
4 | 3 | 3 | 2 | 维持原有正面评分 |
u4fVpLTciH |
6 | 4 | 4 | 4 | 维持原有最高评分 |
分数保持 OpenReview 当前返回值。iJm3pe5ROj 的 pre-rebuttal 历史数值未出现在当前 normalized Note 中,acknowledgement 只明确说明最终提高到 4。
Reviewer consensus
- 四位 reviewer 都认可问题重要、方法直观、写作清楚,并认为 tool use、science、medical、knowledge acquisition 和 sequential learning 的覆盖较强。
- 对方法价值的共同判断集中在两个点:用 query-specific demonstration 构造同尺寸 teacher;在 student trajectory 上提供 token-level signal,从而兼顾新任务学习和能力保持。
- 分歧集中在 novelty。较保守 reviewer 把 SDFT 视为 on-policy distillation 的 teacher-construction 变体,并要求与 GKD、Re-invoke 和更强 external teacher 做直接比较。
Main criticisms
- 主要实验集中在 Qwen2.5,3B 失败显示方法依赖强 ICL。
- SDFT 相对 SFT 增加 rollout、teacher forward 和 EMA 超参数,成本与 baseline 调参公平性需要量化。
- Re-invoke、DFT 和传统 continual-learning baseline 的覆盖不完整。
- 论文的 ICL optimal-policy assumption 只能做必要条件式经验核验,无法直接确认未知最优 policy。
- reverse-KL / IRL 推导从 sequence reward 到 per-token estimator 的步骤需要澄清。
Author response
- 补充 Olmo-3-7B-Instruct Science Q&A:base 为新任务 33.9 / 旧能力 46.3,SFT 为 65.9 / 42.6,SDFT 为 66.7 / 46.1。
- 补充 Qwen2.5-32B external teacher:teacher accuracy 为 47.5%,on-policy distillation 后 7B student 为 47.3%,低于 SDFT 的 70.2%;这项对照支持 demonstration conditioning 能产生比更大无 context teacher 更强的 task-specific signal。
- 补充 GRPO:三组 hyperparameter configuration 中最好 accuracy 为 74.8%,SDFT 为 70.2%;作者报告 GRPO 在该设置需要约
generation compute / wall-clock。它说明 reward 可用且预算充足时 RL 可以达到更高准确率。 - 补充 Science Q&A replay/mixup:高 replay ratio 降低 forgetting,同时明显压低新任务收益;SDFT 给出更好的当前 trade-off。
- 补充 EMA sensitivity:
– 区间结果稳定, 时 collapse;camera-ready Appendix 公开的正式 sweep 范围较窄。 - 补充 Re-invoke cost curve:SDFT 为
SFT wall-clock、forgetting ;Re-invoke 需要 SFT 加后续 才达到 。 - 对理论问题,作者说明精确 token policy gradient 应包含从当前 token 开始的 future reward sum;camera-ready Appendix A.1 随后把 analytic per-token estimator 明确标为 sequence-level biased。
以上新增结果来自 rebuttal / comment,部分未进入当前 camera-ready PDF,证据等级低于完整主文实验,尤其 GRPO 只试了三组配置。
最终决定与可信度影响
Area decision 记录 Accept (spotlight),认为 reviewer 从 weak accept 到 strong accept 的分布在 rebuttal 后形成一致接收意见,并特别认可 cost trade-off、32B teacher 对照和跨域结果。Decision 同时列出四条 reference-correctness 自动检查提醒,主要涉及版本或书目信息,不直接改变核心实验。
正式公开审稿、四项 fully-resolved acknowledgement 与 Spotlight 决定提高了论文问题设定和经验结果的可信度。项目仓库后续披露的 forward-KL 实现与 camera-ready reverse-KL 叙述尚未在论坛评审中得到处理;因此当前可信结论应聚焦 on-policy self-distillation 的经验效果,KL 方向与 IRL 等价保持待核验状态。
主要启发
- Demonstration 可以同时承担 task specification 与 teacher context,省去单独训练 external teacher;前提是 base model 已具有足够 ICL 能力。
- Continual learning 的关键测量应同时包含 new-task accuracy、prior-capability retention、sequential task retention 和 compute。只报告某一项会隐藏 plasticity–stability trade-off。
- On-policy distillation 至少要拆成三个独立设计轴:trajectory 来源、teacher construction、divergence 方向。本文对前两个轴给出较强证据,第三个轴存在版本差异。
- 论文公式、camera-ready、README 与默认代码配置需要一起审计。当前案例显示,核心经验结果可以成立,同时理论归因需要随实现更正。
- 实用复验应优先做同一 checkpoint、同一 rollout、同一 teacher 下的 forward KL / reverse KL / JSD 对照,并记录新任务准确率、旧能力、KL drift、entropy、wall-clock 与 seed variance。
局限
- 实验实现与论文目标未对齐。 README 明确披露全部结果使用 per-token forward KL,OpenReview PDF 仍以 reverse KL 和 IRL 等价为机制主线。当前结果无法支持 reverse KL 的专属贡献。
- 实用 estimator 带 sequence-level bias。 Appendix A.1 承认 full analytic per-token estimator忽略 early token 对 future states 的影响;Rao–Blackwellized estimator 更接近无偏目标但未成为主实验实现。
- 模型能力门槛明确。 Qwen2.5-3B 的 SDFT 比 SFT 低 3.3 分;teacher quality 随 ICL、prompt 和 demonstration quality 变化。小模型、非语言 policy 和弱 ICL 模型的适用性有限。
- compute 没有完全匹配。 SDFT 相对 SFT 约
FLOPs、 wall-clock;SDFT、DFT、Re-invoke、GRPO 的训练阶段和 validation selection 不同,主表主要证明 Pareto trade-off。 - 模型族与任务范围有限。 主结果依赖 Qwen2.5-7B;Olmo 提供 reasoning case,Olmo-Instruct 对照只在 rebuttal。任务覆盖三项 skill、一个自建知识主题和固定三任务顺序。
- 自动评判与数据生成带来混杂。 Medical 和 knowledge acquisition 使用 GPT-5-mini judge,知识 QA 使用 GPT-5 生成;缺少独立人工 agreement、judge sensitivity 和跨 judge 复验。
- 统计报告仍不完整。 Appendix 声明多数实验使用 3 seeds 和 95% confidence interval,Table 1、Table 2、Table 5 与多项消融只给 point estimate;sequential learning 使用归一化曲线并缺少 task-order permutation。
- 仓库复现范围不完整。 截至 commit
d77573212fa0a3ae2eeb64b9b44db1c251f75e3e,公开data/只有 science 与 tool-use,README 也只提供两项训练入口;Medical、knowledge acquisition、完整 sequential run、全部 seed 与原始 log 尚未形成同等公开复现路径。 - teacher artifact 采用启发式处理。 论文观察到 student 会继承“Based on the text...”等 teacher phrasing,代码通过跳过前三个 completion token 的 loss 抑制;其跨 prompt、语言和任务稳定性未验证。
跨论文关系
- 与 GKD:两者都在 student 自生成 prefix 上查询 teacher 的 token distribution。SDFT 用 query-specific demonstration 把同模型变成 task teacher;项目 README 又明确说明全部结果实际使用与 GKD 相似的 per-token forward KL,因此 GKD 是当前实现层最直接的前序方法。
- 与 MOPD:MOPD 使用多个从同一 SFT checkpoint 分叉并经领域 RL 强化的 teacher,在 student trajectory 上执行 reverse-KL 或等价 policy-gradient transfer;SDFT 使用 demonstration-conditioned EMA self-teacher。两者共同强调 teacher 与 student 的分布接近,teacher 来源和已验证 KL 方向不同。
- 与 Self-Trained Verification:STV 让带 reference solution 的同模型 teacher 产生 privileged verifier signal,再蒸馏给无 reference verifier;SDFT 让带 expert demonstration 的 teacher 在 student trajectory 上提供 task-learning signal。两者共同使用 privileged context 构造 self-teacher,输出对象分别是 verifier 与 task policy。
- 与 RLVR Reasoning Boundary:SDFT 用 pass@k 曲线检查 accuracy gain 是否只来自 entropy collapse;该检查沿用“pass@1 与 coverage / pass@k 分离”的能力边界思路。本文 pass@k 上升支持候选覆盖改善,仍不能单独证明产生了 base model 原先完全不可达的能力。
- 与 Self-Improving Agents:SDFT 提供 parameter-level continual update 的具体实例,适合放入 trace-to-capability 流水线的 model update 分支;它同时展示了更新规则、旧能力保持和长期评测需要联合设计。
- 与已有论文的作者或机构关系:当前归档没有直接作者重叠;SDFT 由 MIT / Improbable AI Lab 与 ETH Zürich 合作完成,形成独立的 self-distillation 研究网络。
本地讨论补充
- 本次读取 OpenReview 全部 16 条可读 Note 后,审稿共识支持“demonstration-conditioned self-teacher + student on-policy trajectory”作为实用 continual-learning recipe,评分分歧主要来自新颖性、成本和 teacher baseline。
- 本地代码核验把结论边界进一步收缩到 forward-KL implementation。后续看到论文更新时应优先检查三处:arXiv 是否修正 KL 方向,OpenReview camera-ready 是否同步,公开脚本是否提供 divergence-controlled ablation。
- 复验优先级:同一 student rollout 和 EMA teacher 下比较 forward KL / reverse KL / JSD;随后把 wall-clock 匹配的 SFT + replay、Re-invoke 与 GRPO 放入同一 accuracy–retention–cost 图,并对 Medical / knowledge judge 做人工 agreement audit。