2607.26246-w2s-opd-weak-to-strong-distillation
Weak to Strong On Policy Distillation
W2S-OPD 将较弱正负模型在同一前缀上的 logits 差分作为相对监督信号,叠加到冻结的 Qwen3-8B 基座分布后形成代理教师,再在学生自身轨迹上执行逐 token 反向 KL;在四项数学与三项代码基准中,预训练/强化学习对比设置相对直接 OPD 的平均准确率分别提高 5.3 和 2.2 个百分点,但证据仅覆盖 Qwen3 同族、单次 100 步训练且未报告随机种子或置信区间。
Source
- Workflow version: v2.1
- Material type: research-paper
- Analysis modules: experiment, theory
- Canonical source: https://arxiv.org/abs/2607.26246v2
- Title: Weak-to-Strong On-Policy Distillation
- Authors: Fangxu Yu, Weijia Xu, Michael Xu, Tianyi Zhou, Zinan Lin
- Responsible organization: University of Maryland, College Park;Microsoft Research;Mohamed bin Zayed University of Artificial Intelligence
- arXiv: https://arxiv.org/abs/2607.26246v2
- PDF: https://arxiv.org/pdf/2607.26246v2
- HTML: https://arxiv.org/html/2607.26246v2
- Code/Project: project page;GitHub repository
- OpenReview / Review page: 未发现与题名、作者或 arXiv ID 匹配的公开 OpenReview / conference review page
- Submitted: arXiv v1,2026-07-28 20:31:48 UTC
- Published / updated: arXiv v2,2026-08-03 03:38:30 UTC
- Current version read: v2
- Version / revision read: arXiv v2 HTML(含附录);GitHub commit
73c953f819f173825eeb4a4a14cb2207c4c2588b。作者与引用信息以 v2 HTML 为准;仓库 README 在核验时仍保留 v1 的七人作者列表 - Accessed: 2026-08-04
- Key figure decision: include
- Review status: page-type=not-found; match-confidence=high; observed-at=2026-08-04; venue-status=arXiv technical report
- Subjects: Machine Learning (cs.LG)
作者与关系
- Fangxu Yu: University of Maryland, College Park。
- Weijia Xu: Microsoft Research。
- Michael Xu: Microsoft Research。
- Tianyi Zhou: Mohamed bin Zayed University of Artificial Intelligence。
- Zinan Lin: Microsoft Research。
Fangxu Yu 是第一作者,其个人主页将 Tianyi Zhou 列为博士导师,因此这项工作还连接了 UMD 与 MBZUAI 的导师—学生关系。Microsoft Research 有三位作者,并接收第一作者完成研究实习。v2 将作者调整为五人并改变署名顺序;本笔记不沿用项目仓库 README 中尚未同步的 v1 七人列表。论文与 v2 HTML 均未标注共同一作或通讯作者。
论文脉络
1. 研究问题、背景和价值
在线策略蒸馏(on-policy distillation, OPD)让学生模型先生成轨迹,再由教师在学生实际访问的每个前缀上提供完整或截断的 token 分布。它同时具有两项优势:训练状态来自当前学生,降低离线教师轨迹造成的暴露偏差;监督覆盖每个位置,密度高于只在回答末尾给分的可验证奖励。
常见 OPD 依赖两类教师。强到弱蒸馏使用参数量更大、能力更强的教师;同源能力整合先从学生基座训练多个领域专家,再把这些专家合并回一个学生。前一条路径在最强模型上缺少更强教师,后一条路径需要按学生规模重复领域强化学习。本文研究的具体问题是:只有规模更小或整体能力更弱的模型时,能否构造对强学生有效、同时不把学生拉向弱模型整体分布的逐 token 教师信号。
这个问题的价值集中在监督来源。若一个较小模型经过领域强化学习后包含可迁移技能,或同一模型家族的不同规模已经隐含能力差异,那么训练者可能只需提取差异部分,再由强学生自身分布承担通用能力基线。这样可以减少训练同规模领域教师的必要性,也把“弱监督能否推动强模型”转成一个可直接接入 OPD 的分布构造问题。
2. 已有解决方案与不足
- 直接弱教师 OPD:学生在自身轨迹上拟合弱教师。训练状态保持在线,目标分布仍由弱模型决定;教师—学生分布差距会降低监督可学习性,弱教师的通用能力上限也可能进入学生更新。
- 强到弱蒸馏:Qwen3 等模型系列用大模型向小模型迁移推理能力。该路径要求已有更强教师,无法直接覆盖最强学生。
- 同源多教师整合:MOPD 从同一学生基座分叉并训练领域强化学习教师,再在学生轨迹上进行反向 KL。教师与学生分布较近,领域专家训练成本随学生规模增长。
- 特权上下文自蒸馏:OPSD 和 SDPO 通过参考解答、环境反馈等额外上下文形成同模型教师。它们避免外部强教师,仍依赖特权信息质量及教师条件分布的可靠性。
- 解码时专家组合:DExperts 与 proxy tuning 已用正模型减负模型的 logits 调整生成分布。W2S-OPD 将这种推理时分布组合改为训练期间的代理教师,再蒸馏到不依赖外部模型的学生中。
论文还将 Direct-OPD(arXiv:2607.05394)列为同期工作。该方法同样把弱教师强化学习前后的对数概率比作为稠密信号;W2S-OPD 扩展到模型规模和正确/错误提示两类对比源,并提供统一代理教师形式。论文没有给出两者的直接实验对照,因此预训练/强化学习设置中的净增量尚不能相对这一同期方法确定。
3. 作者可能的思考路径
以下为本地分析。
第一步来自直接弱教师失败。弱模型的绝对分布同时包含目标领域技能、规模限制和其它模型特性;直接拟合会一起转移这些成分。若改用两个相关弱模型的差异,共有成分可能部分抵消,剩余信号描述正模型相对负模型提高了哪些 token。
第二步来自分布邻近性。差分信号本身没有完整语言模型分布,需要一个锚点。冻结的学生初始基座已经实现强学生的通用分布,把差分加到该锚点上可以生成一个与学生起点相邻的合法分布。
第三步来自 OPD。代理教师只需在学生访问的前缀上即时计算;学生继续生成在线轨迹,并用稠密反向 KL 接收代理教师分布。部署时只保留训练后的学生。
第四步来自组合性。多个正负对的相对对数概率可以相加,对应概率空间中的专家乘积。不同领域信号因此可以在一次蒸馏中按样本路由或共同组合。
4. 核心假设或切入点
- 正负模型共享的非目标因素足够多,使逐 token 差分主要反映待迁移能力。预训练/强化学习对使用同一初始化,控制最强;模型规模对同时改变参数量及其伴随属性,控制较弱。
- 锚点、正模型和负模型具有一致词表与 token 对齐关系,才能逐词表项执行 logits 加减。实验全部使用 Qwen3 系列,没有验证跨 tokenizer 或跨模型家族组合。
- 冻结的学生基座是合适参照。当前学生从该 checkpoint 初始化,训练后会逐步偏离它,因此“代理教师接近学生”在初始化时最直接,后续接近程度取决于训练漂移与放大系数。
- 相对对数概率能够跨规模迁移。附录给出它作为指数倾斜奖励的精确等价,尚未证明它构成全局线性、与规模无关或具有因果意义的“能力方向”。
- 中等放大系数能同时保留信号强度和分布邻近性。Figure 4 提供单组经验曲线,没有给出可跨任务预测最优系数的规则。
- 教师 top-32 分布包含足够概率质量。论文说明 Qwen3 教师分布通常尖锐,未报告被保留概率质量、截断误差分布或不同 top-K 的消融。
5. 贡献全景与方法总览
首要贡献是把弱模型监督拆成“相对信号”和“强模型锚点”:正负弱模型只决定哪些 token 应相对增强,冻结的学生基座决定完整分布的主体。辅助贡献包括三类正负对构造、多方向的加法组合、与 KL 约束奖励最大化的等价解释,以及 top-K 稠密 OPD 实现。
端到端路径由四个阶段组成:
| 阶段 | 输入 | 核心操作 | 向后传递的对象 | 局部作用 |
|---|---|---|---|---|
| 1. 对比信号 | 同一学生前缀、冻结正模型、冻结负模型 | 计算逐词表项 logits 差或等价对数概率比 | 相对 token 信号 | 去除正负模型共有部分,保留相对偏好 |
| 2. 代理教师 | 对比信号、冻结学生基座、放大系数 | 将差分叠加到基座 logits 并 softmax | 代理教师分布 | 用强模型分布补全弱信号并控制偏移 |
| 3. 在线策略蒸馏 | 当前学生生成的轨迹、代理教师 top-K 分布 | 在每个学生前缀计算反向 KL | 稠密逐位置损失 | 只更新学生参数,并保持训练状态在线 |
| 4. 对比选择与组合 | 强化学习前后、模型规模或正确/错误提示对;一个或多个领域 | 选择单个正负对,或对多个差分加权求和 | 单领域或路由后的多领域代理教师 | 复用同一训练接口迁移不同来源的信号 |
这里有四类名称相近但更新关系不同的对象:
- 学生基座
:Qwen3-8B non-thinking 的冻结副本,始终作为代理教师锚点。 - 当前学生
:从同一 Qwen3-8B checkpoint 初始化,负责生成在线轨迹并接受梯度更新。 - 正/负模型
与 :冻结的 Qwen3 小模型或同一小模型的不同条件分支,只提供相对信号。 - 代理教师
:每个前缀即时合成的分布,没有独立参数或训练过程。

6. 从正负模型构造相对 token 信号
这一阶段需要回答局部问题:弱模型的哪些变化值得迁移。对学生轨迹前缀
softmax 对所有 logits 的共同平移不敏感,因此该差分在概率空间中等价于正负模型的相对对数概率,差一个与 token 无关且会被归一化吸收的常数。对候选 token
一个三 token 的最小例子可以说明接口。若学生基座 logits 为
“共有成分被抵消”的质量取决于正负对的匹配程度。强化学习前后对共享架构、参数初始化和规模,差异较容易归因于领域强化学习;正确/错误提示对共享模型和提示格式,差异还包含答案条件信息;4B/0.6B 对同时改变深度、宽度和训练动态,差分不具备同等强度的因果隔离。
7. 在冻结的学生基座上合成代理教师
相对信号没有归一化分布。W2S-OPD 把它加到学生基座 logits 上,再执行 softmax:
附录 B 给出更精确的解释。对
这一形式把“差分方向”转成一个可检验的优化问题。对词表单纯形中的任意分布
代入代理教师后可以得到:
右侧第一项与
这项等价结果是论文最扎实的理论部分。它精确支持“相对 log-ratio 是奖励、基座是信任域锚点、
8. 在学生自身轨迹上执行稠密反向 KL
当前学生先对数据问题
反向 KL 的期望侧是当前学生分布,因此学生高概率候选的教师偏好会直接进入梯度。在线轨迹解决的是训练状态分布问题;代理教师解决的是监督目标问题。两者需要同时存在,才能形成本文的方法闭环。
完整 Qwen3 词表约有 15 万个 token。实现让教师只返回每个位置概率最高的
学生基座、正模型和负模型均冻结;只有当前 Qwen3-8B 学生更新。部署时无需保留三个教师侧模型。训练时每个位置需要额外执行 8B 锚点与两个 4B 分支的前向评分,运行成本仍高于单个弱教师 OPD。
9. 三类对比源与多方向组合
三类对比共享相同的代理教师接口,监督来源和可归因强度不同:
| 设置 | 正模型 | 负模型 | 预期差分 | 新增资源 | 主要边界 |
|---|---|---|---|---|---|
| 强化学习前后 | Qwen3-4B 领域强化学习专家 | 其 Qwen3-4B 初始模型 | 领域强化学习引起的相对偏好 | 4B 规模 GRPO | 数学正模型平均分高于 8B 基座,因此该设置不满足“所有来源均弱于学生” |
| 较大/较小基座 | Qwen3-4B | Qwen3-0.6B 或 1.7B | 随模型规模变化的相对偏好 | 无额外训练 | 规模差同时包含多个结构与训练因素 |
| 正确/错误提示 | 带正确提示的 Qwen3-4B | 带同格式错误提示的同一 Qwen3-4B | 当前问题上朝正确答案变化的相对偏好 | 需要参考答案与两次条件评分 | 信号依赖提示质量,并包含答案条件信息 |
多个正负对可以直接在 logits 空间相加:
概率空间中的等价形式是:
多个相对奖励相加,对应多个概率比相乘,组合顺序在这个静态公式中不影响结果。主实验的多教师设置混合数学和代码数据,并按领域标签把每个样本路由到相应教师对,相当于让相关
10. 结论链条
- 假设:匹配的正负弱模型差分与待迁移技能正相关,且同一 Qwen3 词表允许逐 token 对齐;冻结学生基座可作为稳定分布锚点。
- 机制:从正负模型提取相对 log-ratio,将其作为指数倾斜奖励叠加到学生基座,再让当前学生在自身轨迹上最小化到代理教师的 top-32 反向 KL。
- 直接证据:强化学习前后对比设置在数学和代码平均准确率上分别比直接 OPD 高 5.3 和 2.2 个百分点;纯弱源的规模对比和提示对比也分别使 8B 学生数学平均分提高 6.0 和 1.4 个百分点。
- 最窄结论:在同一 Qwen3 模型家族、8B non-thinking 学生、作者给定对比源与 100 步单次训练中,重锚定后的相对监督比直接拟合 4B 教师更有效,并能从两个整体更弱的基座或一个带对比提示的弱模型中获得小幅到中等增益。
- 边界:实验没有覆盖跨模型家族、不同 tokenizer、更大或更强学生、多随机种子、计算对齐的现代 OPD 稳定化基线,也没有证明 logit 差分是可跨环境保持的因果能力表示。
关键实验/定理
结果 1:强化学习前后对比在数学和代码上均优于直接 OPD
- 设置:Qwen3-8B non-thinking 学生;Qwen3-4B 强化学习后领域专家为正模型,强化学习前 Qwen3-4B 为负模型;单教师分别训练数学与代码,多教师混合两域并按标签路由;100 步训练。
- Baseline:Student Base、正负模型、SFT、直接 OPD;W2S-OPD 与 OPD 使用相同训练配置。
- 指标:四项数学与三项代码基准的采样平均准确率;数学每题 32 条样本,代码每题 4 条样本。
- 结果:
| 设置 | 方法 | 数学平均 | 代码平均 |
|---|---|---|---|
| 参考 | Qwen3-8B Student Base | 17.0 | 57.6 |
| 参考 | Qwen3-4B-RL Positive | 48.8 | 61.5 |
| 单教师 | OPD | 46.5 | 58.7 |
| 单教师 | W2S-OPD | 51.8 | 60.9 |
| 多教师 | OPD | 46.5 | 59.5 |
| 多教师 | W2S-OPD | 52.1 | 61.1 |
- 对照是否可比:W2S-OPD 与 OPD 对齐训练步数和主要超参数。SFT 的目标数据构造细节披露较少;论文未报告各方法多随机种子、误差条、置信区间或显著性。
- 证据定位:Section 4.1–4.2;Table 2;Figure 3;Appendix C;arXiv v2 HTML。
- 支持的最窄结论:单教师设置中,W2S-OPD 相对 OPD 的数学与代码平均准确率分别提高 5.3 和 2.2 个百分点;多教师设置分别提高 5.6 和 1.6 个百分点。
- 解读:单教师数学平均分 51.8 高于 4B 强化学习专家的 48.8,四个数学单项也均高于该专家;代码平均分 60.9 仍低于专家的 61.5,HumanEval+ 与 LiveCodeBench 也未超过专家。“超过教师”应限定于该数学设置。
结果 2:两个整体更弱的基座或同一弱模型的提示差分也能改善学生
- 设置:规模对比使用 Qwen3-4B 正模型与 Qwen3-0.6B 负模型;提示对比使用同一 Qwen3-4B,在格式一致的正确提示与错误提示下分别评分。
- Baseline:Qwen3-8B Student Base;规模设置中的两个源模型均低于学生基座,提示设置的 4B 源模型也低于学生。
- 指标:同一组四项数学和三项代码平均准确率。
- 结果:规模对比把数学平均分从 17.0 提高到 23.0,把代码平均分从 57.6 提高到 58.8;提示对比分别提高到 18.4 和 58.7。附录将负模型从 0.6B 换为 1.7B 后,数学增益从 6.0 降为 4.7 个百分点。
- 对照是否可比:两组结果均从同一 8B 基座开始;没有直接 OPD 对照,也没有按额外前向次数或提示构造成本匹配的基线。规模间隙实验只有两个负模型取值。
- 证据定位:Section 4.2;Tables 3–4;Appendix D.2,Table 11。
- 支持的最窄结论:在作者选定的 Qwen3 同族对比中,整体能力均低于 8B 学生的监督源仍能提供正向平均增益。
- 解读:4B/0.6B 的较大间隙对应更高数学增益,与“差距越大、相对信号越强”的解释一致;两个取值不足以建立单调尺度规律,也没有排除负模型质量、校准或熵差异。
结果 3:代理教师是相对奖励与基座 KL 约束的闭式最优解
- 假设:正负模型和基座在相同词表上具有严格正的 softmax 概率;
;优化变量是单个前缀上的词表分布。 - 适用域:逐前缀代理教师合成;该结论不覆盖学生参数优化的全局收敛或任务回报。
- 对照是否可比:这是对代理教师定义的恒等变换与变分刻画,没有经验基线;它用于解释同一构造,不能替代不同对比源或蒸馏目标的效果比较。
- 结果:附录 B 将 logits 差分严格改写为相对 log-ratio 奖励,并证明指数倾斜代理教师唯一最大化“期望相对奖励减基座反向 KL 惩罚”。多对组合对应相对奖励相加和概率比相乘。
- 证据定位:Appendix B,Eqs. (8)–(13)。
- 支持的最窄结论:给定任意相对信号
、基座分布和正放大系数,论文的代理教师是相应 KL 正则化单步分布优化的精确解。 - 解读:理论解释了公式内部一致性与
的信任域作用。任务收益需要额外假设 与正确行为一致;对比源是否隔离了能力仍属于经验问题。
结果 4:放大系数呈中间较优,领域外结果只覆盖两个基准
- 设置:在强化学习前后设置中改变
,其它配置固定;领域外评测使用只在数学任务上蒸馏的模型。 - Baseline:Figure 4 中的直接 OPD;领域外表中的 Student Base、4B Positive 与 OPD。
- 指标:数学和代码基准平均准确率;GPQA-Diamond 与 IFBench。
- 结果:Figure 4 显示多数基准随
先改善后下降,中间区间优于 OPD。数学训练后的 W2S-OPD 在 GPQA-Diamond / IFBench 得到 56.5 / 27.0,Student Base 为 38.9 / 26.3,OPD 为 54.4 / 25.9。 - 对照是否可比:
曲线来自同一训练设置;论文未给出随机波动。领域外结论只覆盖两个基准和一次数学训练,GPQA 的大幅提高也可能来自可迁移推理能力,而非通用能力整体改善。 - 证据定位:Section 4.3;Figure 4;Table 5。
- 支持的最窄结论:作者设置中存在信号过弱和偏移过大的经验折中;W2S-OPD 在两个选定领域外指标上高于 OPD,且 IFBench 没有出现 OPD 相对基座的下降。
- 解读:结果支持调节
的必要性,尚未形成自动选择规则,也不足以推出广泛的通用能力保持。
结果 5:不同对比源强化的 token 类别分布不同
- 设置:从 200 条学生数学推理轨迹中选出
最高的 1% token,再由 ThinkARM 自动分类器标注为八类问题求解阶段。 - Baseline:全部 token 的阶段分布,以及三类对比源之间的相对分布。
- 指标:top-1% 高差分 token 在 Read、Analyze、Plan、Implement、Explore、Verify、Monitor、Answer 八类中的占比。
- 结果:强化学习前后、规模和提示对比的 Plan 占比分别为 15.7%、12.6% 和 20.2%;Monitor 为 1.8%、0.9% 和 2.3%;规模对比的 Analyze 最高,为 44.4%;提示对比的 Answer 为 16.4%。
- 对照是否可比:三组使用同一分析定义;标签来自自动分类器,top-1% 阈值、学生轨迹和类别基准分布会影响结果。论文没有进行人工标签核验或介入实验。
- 证据定位:Section 4.4;Eq. (7);Table 6;Figure 5。
- 支持的最窄结论:三类对比源的最高相对支持 token 在自动阶段标签上的分布不同。
- 解读:作者将强化学习前后与提示对比解释为更强调规划框架,将规模对比解释为更强调求解过程。该分析属于描述性关联,没有证明这些 token 类别中介最终准确率提升。
结果 6:每步运行时间增加约 20%,公开仓库尚未发布训练代码
- 设置:2 张 NVIDIA B200;强化学习前后设置;OPD 与 W2S-OPD 的平均每训练步墙钟时间。
- Baseline:直接 OPD 每步 868 秒。
- 指标:平均每步墙钟秒数。
- 结果:W2S-OPD 每步 1043 秒,比 OPD 增加 175 秒,即约 20.2%。论文归因于 rollout 仍占主导,新增三个冻结模型的评分仅执行前向计算。
- 对照是否可比:两者训练步数和配置对齐;没有披露计时方差、设备利用率、并行布局或 I/O 分解。该值不包含获得 4B 强化学习专家的 300/500 步训练成本。
- 证据定位:Appendix C,Tables 7–9;Appendix D.1,Table 10;GitHub commit
73c953f。 - 支持的最窄结论:在作者的两张 B200 实现中,代理教师合成相对直接 4B 教师 OPD 增加约五分之一的单步时间。
- 解读:截至 2026-08-04,仓库根目录只有 README 和图片资源,README 明确说明数据、模型设置、训练与评测代码仍在内部审核;当前公开状态不足以复现实验,且仓库没有许可证。
实验设置审计
| 维度 | 记录 |
|---|---|
| 学生与锚点 | Qwen3-8B non-thinking;同一 checkpoint 的冻结副本作为锚点。 |
| 领域专家 | Qwen3-4B non-thinking;数学在 DeepMath-103K Level-6 上执行 500 步 GRPO,代码在 Eurus-RL-Code 上执行 300 步。 |
| 蒸馏 | 100 步;batch size 64;学习率 |
| 代理教师 | 数学/代码的 |
| 领域专家 GRPO | batch 与 mini-batch 均为 128;每题 8 条 rollout;学习率 |
| 评测 | 数学每题 32 个样本,代码每题 4 个样本;均报告样本平均准确率;数学使用 Math-Verify。 |
| 硬件 | 每次蒸馏使用 2 张 NVIDIA B200;实现基于 verl。 |
| 随机性 | 未报告训练随机种子数、独立运行均值、方差、置信区间或显著性检验。每题多次采样不能替代独立训练复验。 |
| 代码状态 | GitHub 仓库已建立,训练、数据与评测代码未发布;无 release、实验 tag 或许可证。 |
局限
- “能力方向”的识别强度有限。 精确推导只确认正负模型的相对 log-ratio 构成指数倾斜奖励。它没有证明差分是全局线性、跨规模不变或因果隔离的能力表示。
- 全部实验共享 Qwen3 词表与模型家族。 logits 加减要求 token 对齐;跨 tokenizer 需要词表映射或其它接口,论文没有讨论。跨家族时校准、熵和架构差异也可能主导差分。
- 锚点在训练期间固定。 代理教师始终邻近初始基座,当前学生更新后可能偏离该锚点。论文没有报告训练期间学生—锚点、学生—代理教师 KL 的演化。
- 对比源的控制强度不一致。 强化学习前后对最接近受控差分;规模对包含参数量及其伴随训练差异;提示对依赖参考答案,并可能混合提示条件效应和目标解答信息。
- “所有监督源更弱”只适用于规模和提示设置。 强化学习后的 4B 数学专家平均分为 48.8,高于 8B 基座的 17.0;该设置验证小规模专家迁移和超过数学专家,不验证所有来源都弱于学生。
- 统计报告不足。 所有主结果、
消融、领域外结果和 token 分析均缺少多随机种子、误差条、置信区间与显著性;小于两个百分点的差异需要复验。 - 基线覆盖有限。 主表比较 SFT 与直接 OPD,没有纳入 relaxed OPD、adaptive target、trust-region OPD 等针对教师—学生差距的稳定化方法,也没有与同期 Direct-OPD 做直接对照。
- 关键消融缺失。 未分别检验当前学生而非初始基座作锚点、前向 KL、未经重锚定的 log-ratio 奖励、不同 top-K、概率差替代 logits 差,以及匹配额外前向计算的控制组。
- top-K 近似缺少误差测量。
相对约 15 万词表大幅降低通信,论文没有报告保留概率质量、尾部分布或截断前后梯度差。 - 多方向证据主要是按领域路由。 主实验没有展示同一问题上多个非零方向同时组合,也未检验方向冲突、系数校准与组合数量扩展。
- 领域外结论范围窄。 GPQA-Diamond 与 IFBench 只能支持两个指标上的保持或改善;知识、对话、安全、多语言和长上下文能力没有评测。
- 总成本与复现状态未闭合。 单步额外 20.2% 不包含获取强化学习专家的成本;公开仓库尚无训练、数据和评测代码,论文结果无法独立复现。
跨论文关系
- 与 MOPD:两者都在学生轨迹上使用逐 token 反向 KL,并支持多领域教师整合。MOPD 要求每个领域教师从学生同规模基座分叉;W2S-OPD 把小模型正负对的相对信号重新锚定到学生基座,减少同规模领域强化学习需求。W2S-OPD 的多教师实验仍采用按领域标签路由,延续了 MOPD 的任务—教师对应关系。
- 与 GKD:GKD 确立学生自生成轨迹上的通用蒸馏框架;W2S-OPD 保留该状态分布,只改变教师分布的构造方式,从已有强教师改为基座与弱模型概率比形成的代理教师。
- 与 OPSD:两者都用额外条件形成学生自身轨迹上的稠密教师信号。OPSD 由同一初始模型在参考解答上下文中直接给分布;W2S-OPD 的提示设置取正确/错误条件分布之比,再叠加到独立的 8B 基座,因此显式抵消共享提示格式并保留强学生锚点。
- 与 SDPO:SDPO 使用环境反馈条件化的 EMA 同模型分布构造逐 token 信号;W2S-OPD 使用冻结小模型的正负对数概率比。两者都把最终或特权信息转成在线轨迹的稠密监督,教师更新关系和锚点不同。
- 与 Qwen3:W2S-OPD 的学生、锚点与所有对比源均来自 Qwen3,复用了同词表和 non-thinking 模式。结果证明同族内部的跨规模差分可用,尚未证明该机制是模型家族无关的。
- 与同期 Direct-OPD(arXiv:2607.05394):W2S-OPD 论文称两者都使用弱专家强化学习前后的相对信号;W2S-OPD 进一步加入模型规模、对比提示和多方向代理教师。缺少同设置直接实验,使强化学习前后分支的新颖性和收益差异仍待确认。
主要启发
1. 弱监督的相对信号与强模型的分布锚点可以独立设计
W2S-OPD 的核心结构把两个问题分开处理:正负弱模型回答“哪些 token 应相对增强”,学生基座回答“完整分布应以什么能力水平为起点”。附录的 KL 约束等价给出直接证据,代理教师正是相对奖励在基座信任域内的最优分布。这个分解可迁移到其它特权上下文或反馈源,但前提是相对信号与目标行为正相关,并且锚点确实代表需要保留的能力。
2. 对比构造决定差分的可解释范围
同一初始化的强化学习前后对可以较强地控制架构、规模与初始能力,正确/错误提示对可以控制模型和提示格式,跨规模模型对只提供相关性更强的经验差分。三者使用相同公式,不代表三者具有相同的因果解释。后续设计应把正负对的匹配条件、剩余混杂因素和可验证目标写成方法的一部分,并通过交换负模型、随机提示或无关领域对照区分替代解释。
3. 在线稠密监督的运行成本需要按完整监督链计量
论文报告代理教师相对单个 4B 教师 OPD 增加约 20.2% 单步时间,这项数据直接描述蒸馏阶段。强化学习前后设置还需要先训练 4B 领域专家;提示设置需要参考答案与两次条件评分;规模设置才接近无需额外训练的数据路径。方法成本应按对比源获取、每步教师前向、分布传输和学生更新分别记录,否则不同实例化之间的“低成本”含义并不相同。