2607.18082-cripo-rubric-rl-self-distillation
Enhancing Rubric based RL via Self Distillation
CriPO 把评分量规聚合后的学习信号丢失拆成当前采样未覆盖评分项和已满足但整体优势非正的评分项,前者通过评分项条件自教师与局部前向 KL 注入缺失行为,后者通过反事实自教师定位 token 并将局部负优势改为固定正值;两种 Qwen3 小模型在医学与科学的五项裁判评测中较 GRPO 平均提高 3.2 和 1.4 分,结论受单次训练、LLM 裁判、启发式 token 归因以及 v2 缺少硬件条件的限制。
Source
- Workflow version: v2.1
- Material type: research-paper
- Analysis modules: experiment, system
- Canonical source: https://arxiv.org/abs/2607.18082v2
- Title: Enhancing Rubric-based RL via Self-Distillation
- Authors: Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang, Guangcheng Zhu, Yuhang Zhang, Cheng Peng, Haobo Wang, Siqing Wang
- Responsible organization: Zhejiang University;ByteDance
- arXiv: https://arxiv.org/abs/2607.18082
- PDF: https://arxiv.org/pdf/2607.18082v2
- TeX source: https://arxiv.org/src/2607.18082v2
- Code/Project: 截至访问日未发现 CriPO 官方代码或项目页;论文只链接了独立 OPSD 基线使用的 SDPO 代码库
- OpenReview / Review page: 未发现可靠匹配的公开审稿页
- Submitted: arXiv v1,2026-07-20 15:50:02 UTC
- Published / updated: arXiv v2,2026-07-21 03:34:34 UTC
- Current version read: arXiv v2,18 页;同时读取 PDF 与 TeX 源码
- Version / revision read:
2607.18082v2;v1→v2 的 TeX 差异不改变方法与结果,v2 删除了 v1 中“8×A800-40G 训练、64×910B2 部署评分模型”的硬件说明 - Accessed: 2026-07-22
- Key figure decision: include
- Review status: page-type=not-found; match-confidence=high; observed-at=2026-07-22; venue-status=arXiv preprint
- Subjects: Machine Learning (cs.LG);Artificial Intelligence (cs.AI)
作者与关系
- Mingxuan Xia: Zhejiang University / ByteDance。
- Yuhang Yang: Zhejiang University / ByteDance。
- Chao Ye: ByteDance。
- Shuai Zhu: ByteDance。
- Shenzhi Yang: Zhejiang University。
- Guangcheng Zhu: Zhejiang University。
- Yuhang Zhang: ByteDance。
- Cheng Peng: Zhejiang University。
- Haobo Wang: Zhejiang University。
- Siqing Wang: ByteDance。
论文将 Mingxuan Xia 和 Yuhang Yang 标为共同一作,并说明两人的工作完成于 ByteDance 实习期间;Haobo Wang 和 Siqing Wang 是通讯作者。Mingxuan Xia 的个人主页记录 Haobo Wang 为其导师;Haobo Wang 的发表记录还能稳定连接 Yuhang Yang、Chao Ye、Shenzhi Yang、Guangcheng Zhu 和 Cheng Peng。这篇论文因而将 Zhejiang University 的弱监督学习与大模型强化学习团队连接到 ByteDance 的开放任务后训练研究。当前归档中未发现这些作者与已存论文的直接作者重叠。
论文脉络
1. 研究问题、背景和价值
可验证任务能够用正确答案或测试用例给 RLVR 提供稳定奖励。医疗咨询、长文写作和科学解释等开放任务通常同时考察事实性、完整性、安全性和任务效用,因而越来越多的方法先让 LLM 裁判按评分量规(rubric)的多个评分项打分,再将多维分数聚合为标量奖励。
这条路径在奖励层保留了评分项信息,GRPO 更新时仍只使用每条回答的单个组相对优势,并把它广播给整条回答的 token。论文聚焦两个信息瓶颈:采样组没有出现某项行为时,该评分项无法产生更新;回答已经满足某项要求时,其它评分项仍可以将整体优势拉到非正,连带惩罚有用 token。
2. 已有解决方案与不足
RuscaRL 和 HeRL 等方法把评分量规或未满足项目直接放进采样提示,用外部引导得到更强的训练轨迹。训练时 token 条件于带特权信息的前缀,推理时模型需要仅依赖自己的前缀,两者的状态分布存在差异。
基于当前策略采样的自蒸馏(on-policy self-distillation,OPSD)先让学生模型(student)产生自己的轨迹,再由获得额外信息的同模型教师(teacher)在相同前缀上给出 token 分布,从而使训练采样轨迹保持在学生模型的分布内。本文的预备实验显示,用完整评分量规执行稠密 OPSD 会使奖励下降;因此 CriPO 保留 GRPO 作为奖励导向的主目标,只对检测到的评分项失效定向使用自蒸馏。
3. 作者可能的思考路径
以下为本地分析的受约束重建:
- 先保留 rubric judge 输出的逐项二值分数,回到 GRPO 聚合前检查每个评分项在采样组中的覆盖与优势方向。
- 将“采样未出现”和“已出现但被整体优势覆盖”分开,因为前者需要增加行为支持,后者需要保留已存局部行为。
- 两类失效都用同模型的特权上下文构造教师:向教师加入缺失评分项可以提供注入方向,让教师去掉已满足评分项可以暴露相关 token。
- 将干预范围限制在高 KL 贡献 token 或反事实教师明确替换的 token,降低提示改动对全序列的扰动。
- 最后将两种局部更新路由回 GRPO,用完整方法、单分支变体和随机 token 对照检查收益是否来自定向修正。
4. 核心假设或切入点
CriPO 的有效性依赖以下条件:
- rubric judge 的逐项二值分数能稳定反映目标行为,评分项权重也与任务价值一致。
- 同一模型在加入某个评分项后会给出更可靠的局部 token 分布,它已经具备该行为的上下文内化能力。
- 反事实提示导致的 token 概率差主要来自目标评分项,风格、篇幅和全局语义扰动处于次要位置。
- 将被选 token 的负优势直接改为 0.1 能够保留有用行为,同时不会过度强化该轨迹中的其它问题。
- 不同评分项对 token 的作用可以局部分离,多个评分项共享表达时不会出现严重的更新冲突。
5. 方法框架
5.1 从标量奖励回到评分项信号
对 prompt
未被当前采样覆盖的评分项(Unexplored Criteria,UC)满足:
优化信号受抑制的评分项(Suppressed Criteria,SC)至少被一条轨迹满足,但满足该项的轨迹优势之和为负;论文还将“优势之和为零且满足轨迹少于半组”纳入该类。它依赖当前采样组、评分项权重和组归一化,所以可作为训练时局部诊断量。

figure/blind_criteria_frequency.pdf.5.2 UC 分支:局部行为注入
CriPO 从组内选出优势最高的轨迹
方法将每个 token 的 KL 从大到小排序,只保留累计贡献达到
5.3 SC 分支:反事实 token 定位与局部优势改写
对于负优势且满足 SC 的轨迹,反事实自教师接收原回答和已满足的 SC,提示要求修改或删去实现这些评分项的片段。对每个实际采样 token,方法检查两个条件:
- 去掉目标评分项后,教师给实际 token 的对数概率低于学生模型。
- 教师给实际 token 的概率低于它最偏好 token 概率的
倍。
满足两个条件的位置被视为承载相应评分项行为的 token。CriPO 将这些 token 的原负优势
5.4 合并目标与真正的方法增量
CriPO 的总损失为:
Qwen3-1.7B 和 Qwen3-4B 分别使用
更准确的方法定位是“评分项级失效诊断与定向修正”。UC 分支将已有的当前策略上下文自蒸馏改写为评分项条件的局部注入;SC 分支提出更具区别性的机制,它先用“满足轨迹的优势之和”检测信号丢失,再将反事实同模型分布差当作 token 归因器,并用归因结果改写策略梯度。整体工作属于算法配方与诊断量设计,论文没有给出新的无偏估计或收敛定理。

figure/cdpo.pdf.5.5 训练与成本路径
所有 GRPO 类设置对每个输入采样 8 条轨迹,最大回答长度为 4096,训练批次大小为 64,学习率为
全程实际用时显示 CriPO 比 GRPO 多用约 11%–28% 时间,但更早超过 GRPO 的最终分数。v2 已删除 v1 中的训练与裁判硬件说明,这些数字只能作为同一作者实现内的收敛成本对照。
6. 结论链条
- 假设:评分量规裁判能提供稳定逐项信号,特权上下文下的同模型分布可以承担局部教师和 token 归因器。
- 机制:采样组内先诊断 UC 与 SC,分别注入局部行为和保留已存局部行为,最后与 GRPO 共同更新策略。
- 直接证据:两个 Qwen3 规模的五项平均分较 GRPO 提高 3.2 和 1.4 分;单分支与随机 token 消融支持定向修正;完整方法在四个训练设置中均于 GRPO 训练结束前超过其最终表现。
- 最窄结论:在 Qwen3-1.7B/4B、本文二值评分量规、RaR 医学/科学数据和 LLM 裁判协议中,定向的评分项自蒸馏与优势改写能在 200 步预算下提高 GRPO 的平均分数。
- 边界:实验没有多随机种子、置信区间、人类评测或完整硬件条件,token 归因与固定正优势仍是启发式操作。
关键实验结果
结果 1:两个 Qwen3 规模的主结果优于 GRPO 与 HeRL
- 设置:Qwen3-1.7B 和 Qwen3-4B;RaR-Medicine 与 RaR-Science 用于训练和域内评测,HealthBench、LLMEval-Med 和 ResearchQA 用于跨数据集评测。过滤易例后,两个训练集分别有 15,658 和 10,874 条数据;每个方法训练 200 步。
- 指标:GPT-4o-mini 按评分量规给出的五项百分制得分及算术平均。
- 结果:Qwen3-1.7B 上 GRPO、HeRL、CriPO 平均分为 59.2、60.4、62.4;Qwen3-4B 上分别为 68.2、68.4、69.6。完整 CriPO 较 GRPO 提高 3.2 和 1.4 分,并在十个“模型规模×基准”组合上都高于 HeRL。Qwen3-4B 上 CriPO 与只启用 SC 分支的 CriPO-S 平均分同为 69.6。
- Baseline:base model、GRPO、HeRL、独立 OPSD、CriPO-U 和 CriPO-S。
- 对照是否可比:GRPO、HeRL 与 CriPO 使用同数据和同一评测协议,论文没有给出每个 baseline 的调参搜索;HeRL 直接使用原默认超参数,独立 OPSD 使用 1 条采样和不同生成参数,其大幅下降不能单独证明混合目标的每个组件都必要。同期 Rubric-Guided Self-Distillation 与 Rubric-Conditioned Self-Distillation 只在相关工作中讨论,没有直接实验对照。
- 系统条件:训练基于
verl;Qwen3-32B 作为训练时 rubric judge;v2 未保留训练硬件、裁判服务硬件或完整资源使用。 - 证据定位:Section 4.1–4.2;Table 1;Appendix Detailed Experimental Settings;PDF pp. 7–8、16–17。
- 支持的最窄结论:在本文训练预算和 LLM 裁判协议下,CriPO 对两个 Qwen3 小模型的五项平均分数均高于主要对照。
- 解读:完整方法的配方收益较稳定,“两个分支在每种规模上都产生叠加增益”尚缺证据,4B 平均分已由 SC 分支单独达到。
结果 2:收敛步数改善明显,实际用时收益依赖模型与数据集
- 设置:Figure 5 左侧对 Qwen3-4B / RaR-Medicine 训练到 400 步;右侧比较两个模型规模与两个 RaR 训练域的完整训练时间,以及 CriPO 首次超过 GRPO 最终表现的时间。
- 指标定义:左侧是 Accy@4 随优化步数的变化;右侧是作者实现中的实际用时。
- 结果:Qwen3-4B / RaR-Medicine 中 CriPO 在第 175 步已超过 GRPO 约第 350 步的最佳表现,对应约两倍的步数差。四个设置中,GRPO 完整时间分别为 6h14m、8h37m、7h42m、11h32m,CriPO 完整时间为 6h56m、11h02m、8h52m、14h06m,CriPO 超过 GRPO 最终分数的时间为 2h26m、5h04m、6h32m、11h29m。
- Baseline:相同作者实现下的 GRPO。
- 对照是否可比:同模型与数据集内的对照可用于比较优化进度;CriPO 每步增加自教师前向计算,因而“步数节省”与“计算节省”需要分开记录。最后一个 4B / Science 设置的实际用时提前量只有 3 分钟。
- 成本归因:收敛步数改善来自额外评分项教师信号,单步增量成本来自 UC/SC 分支的教师 logits 与 KL/token 筛选,论文没有拆分两个分支各自的 FLOPs、显存或通信成本。
- 证据定位:Section 4.2 Efficiency and Convergence Analysis;Figure 5;PDF pp. 8–9。
- 支持的最窄结论:CriPO 在四个作者设置中均于 GRPO 训练结束前超过其最终分数,约两倍步数的结论由 Qwen3-4B / RaR-Medicine 这一设置直接支持。
- 解读:这是优化效率证据,跨硬件的计算成本结论还需要恢复硬件、并行、判分服务和利用率条件后复验。

figure/CriPO_training_analysis_combined.pdf.结果 3:失效诊断与消融支持分支方向,完整方法对 SC 平均数量的改善很小
- 设置:Qwen3-4B / RaR-Medicine;训练过程统计使用 0–200 步,训练后对 base、GRPO、CriPO-U、CriPO-S 和完整 CriPO 比较 UC/SC 样本比例与每样本平均数量。
- 指标:包含至少一个 UC/SC 的样本比例;每个样本的 UC/SC 平均数量。
- 结果:GRPO 训练中 UC 样本比例为 83.6%–85.6%,SC 比例为 57.1%–57.7%,表明这两个诊断量在一个设置中持续出现。训练后 UC 比例为 GRPO 84.8%、CriPO-U 80.9%、CriPO 82.7%;SC 比例为 GRPO 52.6%、CriPO-S 50.0%、CriPO 51.4%。SC 平均数量为 GRPO 1.70、CriPO-S 1.65、CriPO 1.69。
- Baseline:base model 与 GRPO;单分支变体用于验证针对性。
- 对照是否可比:同一模型、数据和评分定义,可支持方向比较;没有误差线和多次训练,1–2 个百分点的差异尚不能排除随机波动。
- 证据定位:Figure 1;Section 4.3 Statistics of Unexplored and Suppressed Criteria;Figure 7;PDF pp. 2、9–10。
- 支持的最窄结论:本文定义的 UC 与 SC 在 Qwen3-4B / RaR-Medicine 中频繁出现,单分支变体对对应样本比例的改变方向符合方法预期。
- 解读:这组证据支持“诊断量可被定向影响”,完整 CriPO 对 SC 平均数量只比 GRPO 低 0.01,它还不足以将主结果增益主要归因于 SC 数量下降。
结果 4:token 定位消融和换裁判评测提供辅助证据
- 设置:Qwen3-4B 上比较 CriPO-U 的 token 筛选/最高优势轨迹选择,以及 CriPO-S 的反事实 token 定位;附录将评测裁判从 GPT-4o-mini 替换为 Qwen3-32B,并检查 IFEval、IFBench 和 MulDimIF。
- 指标:三项医学基准平均分;五项医学/科学评测平均分;通用指令遵循得分。
- 结果:CriPO-U 平均为 66.4,去掉 KL 贡献筛选或最高优势轨迹选择后为 65.5/65.6;CriPO-S 平均为 68.9,将 token 定位替换为随机位置后降至 64.9。Qwen3-32B 裁判下,完整 CriPO 较 GRPO 在 1.7B/4B 上提高 3.4/2.1 分。通用指令遵循的单项变化介于 -1.0 到 +1.3 分,未观察到大幅崩塌。
- Baseline:去筛选、去最优轨迹、随机 token 定位;GRPO;base model。
- 对照是否可比:随机 token 对照能够排除“任意增加正优势就有效”的简单解释,仍缺少人工 token 标注、其它归因器、阈值敏感性与多随机种子。Qwen3-32B 同时是训练裁判,因此它只证明换裁判后趋势保留,独立性弱于主表的 GPT-4o-mini。
- 证据定位:Section 4.4;Table 2;Appendix Supplementary Experiments;Tables 3–4;PDF pp. 9–10、14–16。
- 支持的最窄结论:在一个模型与三项医学基准上,定向 token 定位比随机位置更有效;主要平均增益在第二个 LLM 裁判下仍保持正向。
- 解读:证据支持局部定向修正的实用性,它还没有证明反事实 teacher 选中的 token 与评分项存在可识别的因果对应。
局限
- 定义域较窄。 UC/SC 定义使用二值评分项和当前组相对优势,连续分数、分级量规、高相关评分项与不同 rollout group size 下的稳定性未验证。
- token 定位是提示介入的归因代理。 反事实教师会同时改变风格、长度、措辞和全局规划,概率差不等于评分项的因果贡献。论文只提供一个 token 案例和随机 token 消融。
- 优势改写带有启发式常数。 被选 token 统一改为 0.1,没有根据评分项权重、归因强度或其它评分项的损失调整。
、 、top-K、KL clamp 和首尾 mask 的组合敏感性没有系统报告。 - 机制指标与主结果之间还有差距。 完整 CriPO 对 SC 平均数量相对 GRPO 只改善 0.01,4B 的五项平均分与 CriPO-S 持平,当前证据更稳定地支持完整训练配方有效。
- 评测高度依赖 LLM 裁判。 主表使用 GPT-4o-mini,附录使用与训练同模型的 Qwen3-32B,没有盲法人评、标量奖励攻击、评分量规改写或长度控制评测。CriPO-S 会生成更长回答,一个医疗案例不足以排除裁判长度偏好。
- 统计报告不足。 论文未报告随机种子数、方差、置信区间或显著性,小幅差值和阈值下的诊断量变化需要多次复验。
- 基线与同期方法覆盖有缺口。 HeRL 沿用默认配置,OPSD 的采样参数与 GRPO 类方法不同,RuscaRL 只在相关工作中出现;两篇 2026 年 6 月的评分量规自蒸馏同期工作也没有直接对照。
- 可复现性与成本边界不完整。 截至 2026-07-22 未发现 CriPO 代码,v2 删除了 v1 的 GPU/NPU 条件,没有拆分教师前向计算、判分服务、显存、通信和利用率成本。“约一半优化步数”直接对应一个配置,四个配置的实际用时收益跨度很大。
- 规模与外部有效性有限。 主实验只覆盖 1.7B/4B 模型、医学/科学两个训练域与 200 步后训练,长文写作、对话、工具智能体、更大模型与长期训练中的行为未测试。
跨论文关系
- 与 RubricEM:两者都用评分量规将开放任务奖励分解为可解释项目。RubricEM 将量规用于智能体的阶段执行、分阶段奖励与反思记忆;CriPO 聚焦单条开放回答中评分项级信号如何穿过标量奖励和 token 优势。
- 与 SDFT、MOPD 和 Self-Trained Verification:这些工作都在学生模型自己的轨迹前缀上读取特权条件下的教师分布。SDFT 用示例条件化的 EMA 同模型学习新任务,MOPD 用多个领域 RL 教师整合能力,STV 用参考答案条件化的教师训练验证器;CriPO 将特权信息换为评分项,并把分布差同时用于损失和 token 归因。
- 与 SRPO 和 TRACE:三者都将终局或整体信号下沉到更局部的行为。SRPO 通过错误点后重采样只更新后缀,TRACE 用冻结参考模型的答案可预测性变化给工具轮次分配信用,CriPO 用反事实评分项 teacher 定位 token 并改写局部优势。
- 与 LLM-as-a-Verifier:两者都使用 criteria decomposition 提高开放式判断的细粒度。LLM-as-a-Verifier 将逐项评估用于候选答案评分和选择,CriPO 继续把逐项得分放入策略训练;两者都需要评估裁判更换、人类标注和长度控制来排除裁判偏好。
- 与 Credit Assignment Survey:CriPO 位于 token-level credit assignment 与 reward decomposition 的交界。它保留了 GRPO 的轨迹级标量奖励,仅对被诊断为信号丢失的评分项启用局部自蒸馏或优势改写,属于条件式信用精细化。