2601.18734-self-distilled-reasoner-opsd

Self Distilled Reasoner: On Policy Self Distillation for Large Language Models

OPSD 让学生模型先在只有题目的上下文中采样自身轨迹,再由同一初始化模型的固定教师在额外看到参考解答后对相同轨迹前缀给出完整词表分布,并用逐位置前向 KL 与逐词表项裁剪训练学生;Qwen3-1.7B、4B 和 8B 在三个数学基准上的 Avg@12 分别较基础模型提高 6.3、2.4 和 3.0 分,但较 GRPO 的 5.7、0.9 和 0.8 分增益使用了不同 rollout 长度、训练步数和最佳 checkpoint 选择窗口,且论文未报告多随机种子、置信区间或包含教师前向计算的总训练成本。

Authors Siyan Zhao, Zhihui Xie (谢知晖), Mengchen Liu, Jing Huang, Guan Pang, Feiyu Chen, Aditya Grover

已审阅 Archived 2026-07-28 12:08 Updated 2026-07-28 15:34 Reviewed 2026-07-28 18:50 Source

Source

  • Workflow version: v2.1
  • Material type: research-paper
  • Analysis modules: experiment, system, theory
  • Canonical source: https://arxiv.org/abs/2601.18734
  • Title: Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
  • Authors: Siyan Zhao, Zhihui Xie, Mengchen Liu, Jing Huang, Guan Pang, Feiyu Chen, Aditya Grover
  • Responsible organization: UCLA;The University of Hong Kong;Meta Superintelligence Labs
  • arXiv: https://arxiv.org/abs/2601.18734
  • PDF: https://arxiv.org/pdf/2601.18734v3
  • HTML: arXiv experimental HTML 仍展示较早版本的四基准、Avg@16 和 JSD 配置,本文结果以 v3 PDF 与 TeX source 为准
  • Code/Project: author project articleGitHub repository
  • Qwen3 chat template: Qwen3-1.7B tokenizer_config.json
  • OpenReview / Review page: https://openreview.net/forum?id=Jpxfof0EaS
  • Submitted: 2026-01-26 17:56:50 UTC
  • Published / updated: arXiv v3,2026-03-20 15:40:19 UTC;ICML 2026 Accept (regular)
  • Current version read: arXiv v3
  • Version / revision read: arXiv v3 PDF、TeX source;OpenReview submission forum、4 份 official reviews、4 份 rebuttals 与 decision;GitHub commit 7448751f307a9cdbcc1246dd1565a1a605b443df;Qwen3-1.7B tokenizer commit 0ecc654158dd093daab47fd37c5f122925d93983
  • Accessed: 2026-07-28
  • Key figure decision: include
  • Review status: page-type=official-review; match-confidence=high; observed-at=2026-07-28; venue-status=ICML 2026 Accept (regular)
  • Subjects: Machine Learning (cs.LG);Computation and Language (cs.CL)

作者与关系

  • Siyan Zhao: UCLA。
  • Zhihui Xie: The University of Hong Kong。
  • Mengchen Liu: Meta Superintelligence Labs。
  • Jing Huang: Meta Superintelligence Labs。
  • Guan Pang: Meta Superintelligence Labs。
  • Feiyu Chen: Meta Superintelligence Labs。
  • Aditya Grover: UCLA。

Siyan Zhao 是第一作者和通讯作者。Feiyu Chen 与 Aditya Grover 被标为 equal advising,该标记表示共同指导,不表示共同一作。作者网络由 UCLA、HKU 与 Meta 三方组成;Siyan Zhao 的实习经历连接 UCLA 与 Meta,Zhihui Xie 的个人主页还记录了 2025 年在 Meta Superintelligence Labs 的研究实习,但本文作者块仍将其机构列为 HKU。

论文脉络

1. 研究问题、背景和价值

数学推理后训练常在三种监督结构间取舍:

  • SFT 直接学习参考推理轨迹,信号密集且采样成本低,训练前缀来自固定数据,可能偏离模型推理时实际访问的错误前缀。
  • GRPO 等可验证奖励强化学习从当前策略采样,训练分布与推理分布较接近;奖励通常只在整条回答结束后给出,同组回答全部正确或全部错误时,组相对优势为零。
  • 在线策略蒸馏让学生先采样,再由单独教师对学生访问到的前缀提供 token 级分布;它同时获得当前策略数据和密集监督,需要维护另一个教师模型。

OPSD 研究能否把 reasoning dataset 已有的参考解答转成上下文特权,并让同一模型在该上下文中承担教师角色。它希望降低 rollout 采样量和外部教师部署成本,同时保留学生自身轨迹上的密集反馈。

这里需要区分两个资源条件。“不需要外部教师模型”表示无需额外加载一个更大模型;训练仍需要参考答案或参考推理。主实验中的 OpenThoughts 轨迹由外部数据流程生成,因此方法仍依赖外部特权监督,只把监督从目标序列改成了教师上下文。

2. 已有解决方案与不足

  • 离线 SFT / 蒸馏:在参考轨迹上训练,无法直接看到学生会生成的错误前缀。参考轨迹风格与 Qwen3 的思考模式差异还可能改变测试时回答长度。
  • RLVR / GRPO:对每题采样一组完整回答并用最终答案判分。它能直接优化正确率,同组奖励方差为零时没有梯度,并且所有回答 token 共享相同轨迹优势。
  • 过程奖励模型:可以提供更局部的信号,需要额外过程标注、奖励模型训练和误差控制。
  • 在线策略蒸馏GKD 已在学生轨迹上计算教师—学生分布差,监督密集且在策略访问分布内;教师通常是另一模型。
  • 上下文蒸馏与 STaR:同一模型在附加上下文中生成目标,再通过 SFT 或筛选学习。OPSD 保留学生采样前缀,并在这些前缀上读取软分布。

OPSD 的增量集中在教师的构造方式:同一模型通过“题目 + 参考解答”上下文形成特权条件分布,再将该条件分布蒸馏回只看题目的学生分布。逐词表项 KL 裁剪是 v3 新增的稳定化配方。

3. 作者可能的思考路径

以下为本地分析。

第一步来自训练分布问题。若学生先生成自己的解答,教师就能在学生真正访问的前缀上给反馈,避免把参考轨迹当成唯一训练路径。

第二步来自 reasoning dataset 的信息结构。每道题已经带有参考解答,当前模型在看到解答后通常比从零求解更容易判断下一步。将参考解答放入教师提示,就能用上下文计算换取一个条件更充分的同模型分布。

第三步来自软分布。只监督学生实际采样的 token 会丢失同一位置上其它候选的相对信息;保存完整词表分布能让教师同时提高或降低多个候选 token 的概率。

第四步来自训练失稳。学生与教师的提示风格差异会让 “wait”“think”“therefore” 等风格 token 产生较大的 KL 分量,这些分量可能覆盖数学 token 的信号。v3 通过逐词表项上限裁剪控制单个分量。

第五步来自目标漂移。若教师也随学生 LoRA 同步更新,它会逐渐适应学生错误前缀,监督目标可能一起漂移。主实验在教师前向时关闭 LoRA,使教师固定为 step 0 的基座模型。

4. 核心假设或切入点

  1. 同一个基础模型在获得正确答案或参考推理后,能够形成比只看题目时更有用的下一 token 分布。
  2. 特权教师即使接在学生的错误前缀后,仍能给出有修正价值的局部分布。
  3. 教师上下文引起的概率变化主要包含解题信息;Qwen3 thinking 开关改变的提示边界和提示风格可以由模板配置与裁剪控制。
  4. 固定初始教师在学生更新后仍具有足够能力,并能提供稳定参照。
  5. 前 1024 个学生 token 已覆盖足够多的关键决策位置,后续 token 的边际监督价值较低。
  6. 完整词表前向 KL 带来的信息增益能够抵消词表级 logits 的显存和计算成本。

论文直接检验了不同散度、四种 thinking 开关组合、裁剪、生成长度和完整词表/采样 token 两种目标。教师对错误前缀的纠错质量、提示变化的鲁棒性、参考解答质量和总 FLOPs 没有得到直接评测。

5. 用两种上下文和两种 Qwen3 提示边界定义教师与学生

OPSD 的端到端路径如下:

环节 输入 核心操作 向后传递的对象
数据取样 题目 xx、参考解答 yy^\star 构造普通学生提示和特权教师提示 两种条件上下文
学生 rollout 当前学生策略、题目 只从学生采样一条最多 1024 token 的回答 学生轨迹 y^\hat y
双分支评分 两种提示、同一条学生轨迹 学生和教师分别在每个学生前缀上计算完整词表 logits 每个位置的两组分布
稳定教师 初始基座与学生 LoRA 教师前向关闭 LoRA,学生分支保留可训练 LoRA 固定教师目标、可训练学生
分布匹配 教师/学生完整词表分布 主实验计算前向 KL,并裁剪每个词表项的贡献 密集位置级损失
参数更新 平均损失 梯度只经过学生 logits 和 LoRA 更新后的学生策略

训练样本为 (x,y)(x,y^\star)。学生只看到题目,教师还看到参考解答:

pS(x)=pθ(x),pT(x,y)=pθ(x,y). p_S(\cdot\mid x)=p_\theta(\cdot\mid x), \qquad p_T(\cdot\mid x,y^\star)=p_\theta(\cdot\mid x,y^\star).

这里需要区分三种容易混在一起的对象:

  1. 参考 CoT:数据中的 yy^\star 可以包含完整推理,它只进入教师的特权提示。
  2. Qwen3 thinking 开关student_thinking=Falseteacher_thinking=True 被传给 apply_chat_template,控制 assistant 回合的起始边界。
  3. 教师自行生成的 CoT:论文主流程没有这一步。教师只在拼接后的序列上执行前向评分。

Qwen3 的官方 chat template 在 enable_thinking=False 时主动插入一个已经闭合的空 thinking 块;enable_thinking=True 时只写入 assistant 起点,正常解码随后可以自行生成 <think>...</think>。OPSD 没有在主教师分支调用解码,而是把学生生成的同一段 y^\hat y 直接接到两种提示后面。因此,实际结构可以压缩为:

学生 TM-off:[题目][assistant][<think></think> 空块已闭合][学生生成 ŷ]
教师 TM-on :[题目][参考 CoT][assistant]                       [同一段 ŷ]

这个行为来自 Qwen3 tokenizer chat template 0ecc654 和 OPSD 固定版本中的 data_collator.py。更精确地说,论文所称的 “TM-on teacher” 使用了允许 thinking 的教师提示边界;输入中没有教师自行生成的 thinking 块。

两种提示长度分别记为 mSm_SmTm_T。程序按各自提示长度切片,把学生后缀中的相对位置 nn 对齐:

cS=[PS(x),y^],cT=[PT(x,y),y^], c_S=[P_S(x),\hat y],\qquad c_T=[P_T(x,y^\star),\hat y],
znS=fθ(cS)mS+n1,znT=fθ0(cT)mT+n1. z^S_n=f_{\theta}(c_S)_{m_S+n-1},\qquad z^T_n=f_{\theta_0}(c_T)_{m_T+n-1}.

KL 比较的是 znSz^S_nznTz^T_n 在同一词表上的概率分布。它不要求两种提示逐 token 对齐,只要求二者在各自提示后读取相同的学生前缀 y^<n\hat y_{<n}。代码先构造 [teacher_prompt, generation_ids],再分别按 student_prompt_lenteacher_prompt_len 截取等长 logits;对应实现见 opsd_trainer.py 的损失计算和学生后缀拼接

在第一个学生 token 位置,TM-on 教师仍可能把较高概率分给 <think> 或推理起始词,但程序实际喂入的是学生采样的 y^1\hat y_1;后续位置继续在学生前缀上执行强制前缀评分。因而,这组配置同时改变了特权信息和 assistant 起始状态。三种 Qwen3 规模上的消融显示它产生最大的数学 token KL,并且作者报告早期下游实验更好;该证据只能支持一种有效的提示边界配置,不能证明教师生成或显式形成了一条更好的 CoT。

仓库另有 reason_first=True 的可选分支,它会先生成一段教师分析,再把这段分析和 transition prompt 放入教师上下文。OPSDTrainer 的默认值为 False,论文 v3 对主流程的描述也明确教师通过预填充执行隐式 rationalization;该可选分支需要与主实验的无教师生成路径分开理解。

6. 从学生策略采样唯一的训练轨迹

学生从当前策略采样:

y^=(y^1,,y^y^)pS(x). \hat y=(\hat y_1,\ldots,\hat y_{|\hat y|}) \sim p_S(\cdot\mid x).

这一步决定了“on-policy”的含义:训练前缀来自当前学生,不来自参考解答,也不来自教师生成。每题每步只采样一条轨迹,最大长度为 1024,温度为 1.1。学生更新后,下一批轨迹随策略变化。

参考解答只进入教师提示。即使学生轨迹已走向错误方向,两个分支仍在相同的 y^<n\hat y_{<n} 上比较;方法期待特权教师在该前缀下更倾向于有助于恢复正确推理的 token。

7. 在相同学生前缀上执行完整词表匹配

对每个位置 nn,学生和教师分别计算:

pS(x,y^<n),pT(x,y,y^<n). p_S(\cdot\mid x,\hat y_{<n}), \qquad p_T(\cdot\mid x,y^\star,\hat y_{<n}).

轨迹上的一般目标是:

D(pTpS)(y^x)=1y^n=1y^D ⁣(pT(x,y,y^<n)pS(x,y^<n)). D(p_T\Vert p_S)(\hat y\mid x) = \frac{1}{|\hat y|} \sum_{n=1}^{|\hat y|} D\!\left( p_T(\cdot\mid x,y^\star,\hat y_{<n}) \Vert p_S(\cdot\mid x,\hat y_{<n}) \right).

论文形式允许前向 KL、反向 KL或广义 JSD。v3 消融后,主实验统一使用前向 KL:

DKL(pTpS)=vVpT(v)(logpT(v)logpS(v)). D_{\mathrm{KL}}(p_T\Vert p_S) = \sum_{v\in\mathcal V} p_T(v)\bigl(\log p_T(v)-\log p_S(v)\bigr).

前向 KL 让教师具有非零质量的多个候选都进入损失,能够提供采样 token 之外的信息。反向 KL 更偏向学生当前支持集,JSD 对两侧做混合;在本文 1.7B/AIME25 消融中,两者均弱于前向 KL。

8. 主实验中的教师是固定初始快照

概念图把教师和学生写成同一个 pθp_\theta。实验代码通过 LoRA 实现了更具体的参数关系:

  • 学生前向加载可训练 LoRA。
  • 教师前向处于 torch.no_grad(),并调用 disable_adapter(),使用 step 0 基座权重。
  • 学生每步更新 LoRA,教师保持不变。

因此,“同一模型”准确对应同一架构、tokenizer 和初始化;训练开始后,教师与学生不再共享当前参数值。固定教师同时提供特权解答信息和初始策略参照,发挥稳定目标与隐式正则化作用。代码还包含动态教师与 EMA 教师选项,它们不属于 v3 主实验。

9. 逐词表项裁剪控制风格 token 的大分量

论文将任意 ff-散度在位置 nn、词表项 vv 上的分量写为:

n,v(f)=pT(v)f ⁣(pS(v)pT(v)). \ell_{n,v}^{(f)} = p_T(v\mid\cdot) f\!\left( \frac{p_S(v\mid\cdot)}{p_T(v\mid\cdot)} \right).

随后对每个词表项分别设置上限:

Lclip=1y^n=1y^vVmin ⁣(n,v(f),τ). \mathcal L_{\mathrm{clip}} = \frac{1}{|\hat y|} \sum_{n=1}^{|\hat y|} \sum_{v\in\mathcal V} \min\!\left(\ell_{n,v}^{(f)},\tau\right).

这里裁剪的是每个位置的每个词表项贡献,随后才对词表求和。仓库主脚本在 1.7B/4B 上使用 τ=0.05\tau=0.05,8B 使用 0.060.06;论文只说明未系统调节 τ\tau,没有在正文表格列出具体值。

前向 KL 的单个词表项可以为负,只有对整个词表求和后才保证非负。代码只裁剪上界,较大的正项被截断,负项保持原值;仓库 README 因此明确说明总损失可能为负。裁剪后的目标属于有偏稳定化损失,已不具备严格 ff-散度的非负性。这项设计能抑制少数风格分量,也可能同时削弱教师在关键 token 上给出的强修正。

10. 采样 token 目标是独立的方法变体

论文还定义了更省显存的采样 token 目标。对学生实际采样的 y^n\hat y_n,优势为:

An=logpT(y^nx,y,y^<n)logpS(y^nx,y^<n). A_n = \log p_T(\hat y_n\mid x,y^\star,\hat y_{<n}) - \log p_S(\hat y_n\mid x,\hat y_{<n}).

训练损失为:

Lsampled=E ⁣[1y^nsg[An]logpS(y^nx,y^<n)]. \mathcal L_{\mathrm{sampled}} = - \mathbb E\!\left[ \frac{1}{|\hat y|} \sum_n \operatorname{sg}[A_n] \log p_S(\hat y_n\mid x,\hat y_{<n}) \right].

sg\operatorname{sg} 表示停止梯度。教师比学生更偏好实际采样 token 时,AnA_n 为正并提高该 token 概率;教师更不偏好时,AnA_n 为负并降低该 token 概率。附录将它解释为具有密集 token 奖励的策略梯度,并与 STaR 的序列级二值筛选作比较。

这段策略梯度解释只直接覆盖采样 token 变体。主实验使用完整词表前向 KL,梯度同时来自整个词表,不能直接等同为只对实际采样 token 分配的奖励。Qwen3-4B 的两项消融显示完整词表目标更强,同时需要保存每个位置的词表级 logits。

Figure 1: OPSD 用普通上下文和特权解答上下文评分同一条学生轨迹
Figure 1:学生只看到题目并负责生成训练轨迹;固定教师额外看到参考解答,在同一学生前缀上输出完整词表分布;梯度只经过学生分支。Image Source: author project article, opsd_main.png.

11. 训练与成本路径

主实验使用 Qwen3-1.7B/4B/8B Instruct、最多 30K 条 OpenThoughts 数学题—解答对、LoRA rank 64/alpha 128、AdamW、bf16、gradient checkpointing 和 FlashAttention 2。OPSD 与 GRPO 的有效批次均为 32,学习率均为 5×1065\times10^{-6}

OPSD 每题采样 1 条、最多 1024 token、训练 100 步;GRPO 每题采样 8 条、每条最多 16,000 token、训练 500 步。按配置上限,每个 prompt-step 的 rollout token 上限相差:

8×160001024=125. \frac{8\times 16000}{1024}=125.

OpenReview 回复给出的第 100 步累计实际生成量为 OPSD 3.28M、GRPO 26.23M,对应约 8 倍。125 倍是最大 rollout 配额差,约 8 倍是该回复中实际生成 token 的差;两者都没有计入 OPSD 的教师前向、学生完整词表 logits、反向传播、显存通信和硬件利用率。论文的 token efficiency 证据支持较低的采样量,尚未建立相同比较口径下的总 FLOPs、能耗或费用优势。

12. 结论链条

  1. 假设:获得参考解答后,同一初始化模型能在学生实际前缀上形成更有用的下一 token 分布。
  2. 机制:学生生成一条在线策略轨迹,固定初始教师在特权上下文中评分相同前缀,完整词表前向 KL 经逐项裁剪后更新学生 LoRA。
  3. 直接证据:三个 Qwen3 规模的三项数学 Avg@12 均高于基础模型、SFT 与 GRPO 的模型级平均;散度、thinking 提示边界、裁剪、长度和目标形式消融支持主要配方。
  4. 最窄结论:在 Qwen3 Instruct 1.7B–8B、OpenThoughts 数学数据、100 步 LoRA 和本文最佳 checkpoint 口径中,固定特权教师的完整词表自蒸馏能以更少 rollout token 改善三项数学平均分。
  5. 边界:总计算没有对齐,较大模型相对 GRPO 的平均增益小于 1 分,训练与评测没有多随机种子或误差区间,当前证据未覆盖代码、通用问答、长程智能体和 8B 以上模型。

关键实验结果

结果 1:三个 Qwen3 规模的数学平均分均高于基础模型、SFT 与 GRPO

  • 设置:Qwen3-1.7B/4B/8B Instruct;最多 30K 条 OpenThoughts 数学题—解答对;AIME24、AIME25、HMMT25;推理启用 thinking mode,温度 1.0,每题 12 次采样,最大 38,912 new tokens。
  • 指标:三个基准的 Avg@12,以及三项算术平均。
  • 结果:8B 的 Base/SFT/GRPO/OPSD 平均为 61.8/59.8/64.0/64.8;4B 为 61.2/58.6/62.7/63.6;1.7B 为 37.1/35.8/37.7/43.4。OPSD 相对基础模型提高 3.0、2.4、6.3 分,相对 GRPO 提高 0.8、0.9、5.7 分。8B 的 HMMT25 上 OPSD 为 45.8,低于 GRPO 的 46.7。
  • Baseline:Qwen3 Instruct base、同数据 SFT、二值结果奖励 GRPO。
  • 对照是否可比:模型、数据来源、有效批次和学习率对齐;OPSD 与 GRPO 的生成数、最大长度、温度、训练步数和最佳 checkpoint 窗口不同。OPSD 从前 100 步每 20 步选择最佳值,GRPO 从 500 步内选择峰值。论文没有报告调参预算、随机种子、标准差、置信区间或显著性。
  • 系统条件:8 张 A100 或 H100;论文未按模型和方法注明具体 GPU 型号、训练时长、峰值显存、并行拓扑或总 FLOPs。
  • 证据定位:Section 4.1–4.2;Table 2;Appendix B Tables 6–8;PDF pp. 6、13。
  • 支持的最窄结论:在本文训练和 checkpoint 选择协议下,OPSD 在三个模型规模上的三项平均分均高于主要对照。
  • 解读:1.7B 增益较大;4B/8B 相对 GRPO 小于 1 分,需要多次训练确认稳定性。该结果支持有效训练配方,尚未隔离固定教师、提示模式和裁剪各自的净贡献。

结果 2:rollout token 明显减少,总训练计算仍缺统一口径

  • 设置:Qwen3-1.7B,OPSD 与 GRPO 有效批次均为 32;OPSD 1 条 × 1024 token,GRPO 8 条 × 16,000 token;比较前 100 个 gradient updates。
  • 指标定义:随训练步数变化的 Avg@12、累计生成 token,以及 GRPO 批次内奖励标准差为零的比例。
  • 结果:v3 Figure 3 显示 OPSD 在 100 步内用更少生成 token 获得更高平均分;作者称 GRPO 在前 100 步超过一半批次的组内奖励标准差为零。OpenReview 回复在第 100 步报告 OPSD/GRPO 累计生成量 3.28M/26.23M,平均分 42.5/38.1。
  • Baseline:相同作者代码中的 GRPO。
  • 对照是否可比:生成 token 是可复查的采样工作量指标;两个方法对完整回答的需求不同,生成长度差属于算法配方的一部分。它仍不能代表总计算,因为 OPSD 每个位置执行教师和学生完整词表前向并保存 logits,GRPO 执行多轨迹采样、判题和策略更新。
  • 成本归因:采样量下降来自单 rollout、短前缀和密集教师分布;额外成本来自特权教师前向与词表级分布匹配。
  • 证据定位:Section 4.2;Figure 3;Appendix B Table 6;OpenReview rebuttal hsq2XQxyIw;repository README.mdscripts/run_opsd_1b.sh
  • 支持的最窄结论:在前 100 步和作者配置中,OPSD 使用约八分之一的实际生成 token,并取得更高的三项平均分。
  • 解读:论文标题下的效率主张应写为 rollout-token efficiency。训练时间、FLOPs、显存和费用仍需在同硬件与同达到目标分数条件下复验。

结果 3:前向 KL、thinking 提示边界差异和逐项裁剪共同形成主配方

  • 设置:Qwen3-1.7B;AIME25 比较前向 KL、反向 KL、JSD;10 道题统计四种 student/teacher thinking-mode 配置的 token 类别 KL;AIME24 比较有无裁剪。
  • 指标:Avg@12;按关键词划分的 style/math/other 平均 KL。
  • 结果:AIME25 的 Base/step 50/step 100 分别为:前向 KL 36.7/43.9/41.1,反向 KL 36.7/37.5/35.0,JSD 36.7/36.9/39.0。TM-off 学生 + TM-on 教师的 style/math KL 在 1.7B、4B、8B 上分别为 0.85/0.14、0.92/0.10、0.79/0.06。Figure 4 显示裁剪避免 AIME24 后期表现回落。
  • Baseline:相同训练设置下的三种散度、四种 thinking 开关组合和无裁剪变体。
  • 对照是否可比:散度比较共享裁剪方案;论文没有报告 τ\tau 搜索。所谓四种“思考模式”同时改变 chat template 的 assistant 起始边界;教师没有在这项主流程中自行生成 CoT,因此该比较不能单独归因于教师推理长度或质量。分析只使用 10 道题,style/math 类别来自人工关键词表,类别 KL 与最终正确率之间没有因果分解。裁剪曲线只展示 1.7B/AIME24 单一设置。
  • 证据定位:Section 4.3.1–4.3.3;Tables 3、5;Figure 4;Appendix B–C;PDF pp. 7、13–14;repository data_collator.py:60-100opsd_trainer.py:573-679, 1261-1279scripts/run_opsd_*.sh;Qwen3 tokenizer chat template commit 0ecc654158dd093daab47fd37c5f122925d93983
  • 支持的最窄结论:在 10 道题的 token 类别统计中,TM-off 学生与 TM-on 教师的提示边界组合在三个模型规模上都产生最大的数学 token KL;在本文其余小规模消融中,前向 KL 最有效,逐词表项裁剪能稳定一个 1.7B 训练设置。
  • 解读:风格 KL 显著高于数学 KL,说明特权上下文和 assistant 起始边界同时改变监督分布。裁剪提供可用的工程控制;现有证据还不能确认收益来自参考解答、提示边界或两者交互,也不足以确认阈值可跨模型、数据和提示迁移。

结果 4:完整词表目标有小幅准确率优势和明确显存代价

  • 设置:Qwen3-4B,distillation generation budget 为 2048 token;AIME25 与 HMMT25;比较完整词表 logits 蒸馏和采样 token 策略梯度。
  • 指标:pass@8。
  • 结果:完整词表目标在 AIME25/HMMT25 上为 84.1/60.0,采样 token 目标为 82.1/57.3,提高 2.0/2.7 分。
  • Baseline:同一 OPSD 框架的采样 token 变体。
  • 对照是否可比:论文说明生成预算一致,没有报告两种目标的峰值显存、每步时间、吞吐、随机种子或阈值调节。仓库说明采样 token 变体没有实现逐项裁剪,因此稳定化配方也不同。
  • 系统条件:完整词表方法需保存形状近似为 batch × sequence × vocabulary 的教师和学生 logits;LoRA、bf16 和 gradient checkpointing 降低其它部分的内存。
  • 证据定位:Section 4.3.5;Table 4;PDF pp. 7–8;repository opsd_trainer.py:647-745
  • 支持的最窄结论:在 Qwen3-4B 的两个数学基准上,完整词表目标较采样 token 变体取得 2–3 分 pass@8 增益。
  • 解读:该消融支持完整分布包含额外信息,也显示 OPSD 的最强版本依赖显存更高的训练路径。

结果 5:只给最终答案的补充实验降低了对完整 CoT 的依赖,但证据范围很窄

  • 设置:OpenReview 回复新增 Qwen3-1.7B/AIME24;教师分别看到完整 CoT 或只看到最终答案,训练到 100 步。
  • 指标:Avg@12 随训练步数变化。
  • 结果:step 100 时完整 CoT 为 57.2,只给答案为 58.1;只给答案设置从基础模型 51.5 提高 6.6 分。
  • Baseline:相同模型和任务下的 full-CoT privileged context。
  • 对照是否可比:作者为 answer-only 条件更改了教师 transition prompt;结果只覆盖一个模型、一个基准和一次训练,未进入 arXiv v3 主文,也没有方差。
  • 证据定位:OpenReview rebuttals hsq2XQxyIwMkKRM0lQj7w1rgWjWKP6MJaN9SVplk;URL: OpenReview forum
  • 假设:参考答案正确,并且教师能够利用参考答案为学生已经生成的前缀提供更有信息量的下一个 token 分布;答辩中的答案识别率来自作者追加实验。
  • 适用域:上述补充结果覆盖 Qwen3-1.7B、AIME 2024 与 200 条训练样本上的教师答案识别检查,不能直接外推到错误参考答案、开放式任务或更大模型。
  • 支持的最窄结论:在一个 1.7B/AIME24 设置中,OPSD 可以仅用最终答案作为特权信息并保持增益。
  • 解读:这项结果削弱了“必须使用外部完整 CoT”的限制;方法仍需要正确答案,且尚未验证 answer-only 配方在其它模型和任务上的稳定性。

局限

  1. “自蒸馏”的教师边界需要明确。 主实验教师固定为 step 0 基座,学生通过 LoRA 更新;两者训练后只共享架构和初始化。方法无需独立教师 checkpoint,仍需要正确答案或参考推理作为外部特权信息。
  2. 教师对错误前缀的质量没有直接测量。 论文展示分布差和最终得分,没有判断教师在学生已偏离正确路径后给出的高概率 token 是否能恢复正确推理。OpenReview 的 answer-masked comprehension 实验测量参考推理理解,仍未覆盖错误前缀纠错。
  3. 裁剪损失失去严格散度性质。 单项上界裁剪可使总前向 KL 损失为负,并改变最优点和梯度权重。阈值没有系统调节,关键数学 token 的大修正也可能被截断。
  4. 效率口径只覆盖 rollout token。 教师前向、完整词表 logits、反向传播、通信、峰值显存和 GPU 利用率未纳入比较;“A100 or H100”没有按实验配置拆分。
  5. 训练预算与 checkpoint 选择不同。 OPSD 训练 100 步、GRPO 训练 500 步,二者生成长度和温度不同,并各自在不同窗口选择峰值。论文未提供同墙钟时间、同 FLOPs、同生成 token 或同达到目标分数的完整对照。
  6. 统计报告不足。 三个数学基准规模较小,Avg@12 减少了单次解码噪声,不能替代多训练种子。所有主结果和消融均缺少标准差、置信区间与显著性检验。
  7. 领域、模型家族和规模有限。 证据只覆盖 Qwen3 Instruct 1.7B–8B 与竞赛数学。代码、通用知识、开放写作、工具使用、智能体长轨迹和更大模型未验证。
  8. 提示边界与特权上下文是强混杂因素。 Qwen3 的 TM-off 模板插入已经闭合的空 thinking 块,TM-on 教师只保留允许 thinking 的 assistant 起点;主教师分支随后直接接入学生生成,没有教师自行生成的 CoT。10 道题的关键词 KL 分类无法分离参考解答、assistant 起始状态与提示风格的贡献。
  9. 参考数据质量和污染未审计。 论文使用 OpenThoughts 数学子集,未报告对 AIME/HMMT 的去重、污染检查、解答正确率和不同解答来源的分层表现。
  10. 来源版本存在不一致。 arXiv experimental HTML 仍展示旧实验;OpenReview 回复称主表使用 2K OPSD generation length,而 arXiv v3 Table 6 明确写 1024。复现时应固定 v3 PDF、TeX source 和具体代码 commit。
  11. 理论解释只覆盖方法变体。 与 STaR 的密集策略梯度比较对应采样 token 目标;主结果使用完整词表前向 KL。论文没有给出完整词表裁剪目标的收敛或策略改进保证。

跨论文关系

  • GKD:两者都在学生在线策略轨迹上匹配完整 next-token 分布。GKD 使用独立教师并系统讨论散度,OPSD 用固定初始模型加参考解答上下文构造教师,并增加逐词表项裁剪。
  • SDFT:两者都让同一初始化模型在普通上下文和特权上下文中评分学生轨迹。SDFT 用 query-specific demonstrations 和 EMA 教师控制持续学习遗忘;OPSD 用参考解答和固定初始教师提高数学推理。
  • MOPD:MOPD 在学生在线策略 token 上汇总多个领域 RL 教师,解决能力整合;OPSD 通过单一基础模型的特权上下文省去外部教师,并集中研究完整词表目标和短 rollout。
  • Self-Trained Verification:两者都把参考解答作为同模型教师的特权信息。STV 将该机制用于验证器训练并接入推理时与训练时自改进;OPSD 直接蒸馏解题策略。
  • SEED:SEED 将在线策略自蒸馏扩展到智能体完整轨迹,用当前策略生成事后技能并以门控似然辅助 GRPO;OPSD 使用固定答案/推理与固定初始教师,教师信息不随策略能力共同演化。
  • CriPO:CriPO 的 UC 分支把 OPSD 改成评分项条件的定向行为注入,并与 GRPO 共同训练。CriPO 的独立 OPSD 基线在开放回答任务中下降,说明特权上下文和目标权重需要随任务结构调整。

OpenReview / 审稿意见吸收

  • Reviewer consensus: OpenReview API 在 2026-07-28 可读取 15 条 Notes,包括 submission、4 份 official reviews、4 份 rebuttals、acknowledgements、comment 和 decision。四位评审的 overall_recommendation 分别为 5、4、4、3,confidence 为 4、4、4、3;final justification 中两位维持正向分数,一位维持 4,一位在补充实验后提高到 borderline。最终决定为 ICML 2026 Accept (regular)
  • Main criticisms: 主要问题集中于三类。第一,OPSD 使用参考 CoT,而 GRPO 只需要答案,外部监督量不同;第二,完整词表 logits 显存较高,短 OPSD rollout 与 16K GRPO rollout 的 token efficiency 对照缺少受控总成本;第三,主结果增益小、无统计区间、训练曲线未充分饱和,且只覆盖数学和 8B 以下模型。评审还要求检查教师是否真正理解参考解答、动态教师稳定性、提示设计和更长 rollout。
  • Author response: 作者补充了 answer-only 训练,在 Qwen3-1.7B/AIME24 step 100 得到 58.1,略高于 full-CoT 的 57.2;在 200 个训练样本上遮蔽最终答案后,1.7B/4B 教师从剩余推理恢复答案的准确率为 75.0%/84.5%;还报告 GRPO 零奖励方差批次比例、实际累计生成 token、教师样例以及固定教师的稳定作用。回复将早期 token 更重要作为短 rollout 的解释,并承认完整词表显存代价。
  • 对可信度的影响: 补充实验支持 OPSD 可以只依赖最终答案,并确认较小模型具备一定参考推理理解能力;它们扩大了机制的可行范围。训练长度公平性、总计算、统计方差、完整词表代价和领域泛化仍是开放问题。decision 的接收理由认可方法简洁与采样效率,同时保留“显存成本、数学范围和相对 GRPO 增益有限”三项弱点。

主要启发

  1. 特权上下文可以把已有答案、解答或环境反馈转换成同模型的条件分布,适合在学生已访问的前缀上生成密集训练信号。
  2. “共享模型”需要继续拆分为共享架构、共享初始化、共享当前参数和教师更新规则;这四种实现会产生不同的稳定性和资源需求。
  3. 在线策略蒸馏的效率报告至少应并列给出 rollout token、教师/学生前向 FLOPs、反向 FLOPs、峰值显存、墙钟时间与达到目标分数的成本。
  4. 提示上下文和生成边界会同时传递任务知识与风格信号。enable_thinking 在只做前向评分时表示 chat template 边界,不等价于已经生成一条 CoT;按 token 类别监测散度、展开实际模板、控制极端分量和验证提示鲁棒性,应成为特权上下文蒸馏的标准诊断。
  5. 完整词表目标与采样 token 目标对应两种训练机制。前者提供更丰富的候选分布,后者显存更低并具有清晰的策略梯度解释;比较时需要同时对齐稳定化配方和计算预算。