2510.04474-drpo-decoupled-reward-policy-optimization

DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization

DRPO 在 DisCO 的正负判别框架内,依据长度奖励对旧 policy 的正确 rollout 条件分布做相对重加权,同时维持主判别目标中每个正确样本 score 的显式正向系数;在每题采样八条、最长八千 token 的 1.5B、7B 和 8B 蒸馏推理模型实验中,它取得优于作者复现基线的长度—准确率前沿,7B 模型平均生成长度减少百分之五十一时性能相对下降百分之二点六,结论依赖可验证的二元正确性、同题同时出现正负样本以及以 token 数衡量效率。

Authors Gang Li, Yan Chen, Ming Lin, Tianbao Yang

待审阅 Archived 2026-07-21 18:17 Updated 2026-07-29 15:47 Source

Source

作者与关系

  • Gang Li: Texas A&M University;共同一作。
  • Yan Chen: The University of Virginia;共同一作。
  • Ming Lin: Oracle Cloud Infrastructure。
  • Tianbao Yang: Texas A&M University。

Gang Li 与 Tianbao Yang 组成 Texas A&M University 一侧的合作主线;Tianbao Yang 是该校计算机科学与工程教授及 OptMAI Lab 主任。Yan Chen 以共同一作身份连接 The University of Virginia。Ming Lin 在论文期任职 Oracle Cloud Infrastructure Generative AI Service,为学术团队与产业研究提供跨机构桥接。

Gang Li、Ming Lin 与 Tianbao Yang 也是 DisCO 的作者。DRPO 直接沿用 DisCO 的正负样本判别目标和 KL 约束,再加入只作用于正样本分布的长度偏好;这组三位作者重叠构成本文最强的连续产出关系。当前档案没有发现四位作者与其它已收录论文直接重叠。

论文脉络

1. 研究问题、背景和价值

长推理模型通过生成分支、反思、验证和回溯提高复杂问题的成功率,也会在简单问题上产生大量重复 token。较长输出直接增加 decode 计算、响应时间和 rollout 训练成本,因此很多工作把正确性 reward 与长度惩罚相加,再交给 GRPO、RLOO 或 REINFORCE-style advantage estimator。

这类组合存在一个符号问题。正确但较长的 response 会获得较低的组合 reward;当 GRPO 再用包含错误 response 的全组均值做中心化时,这个 reward 可能低于组均值,使正确 response 获得负 advantage。训练信号随后同时表达“比其它正确答案更长”和“应当降低生成概率”,长度偏好改变了正确性信号的方向。

DRPO 研究的问题是:如何让模型在正确答案之间偏好更短的推理,同时保持“正确轨迹应被强化、错误轨迹应被抑制”的符号语义。

2. 已有解决方案与剩余缺口

已有高效推理方法大致分为三类:

  1. 在 prompt 或 decoding 阶段设置长度预算、提前退出或压缩规则,部署直接,但训练策略仍可能偏好冗长路径。
  2. 用短轨迹做 SFT、rejection sampling 或 preference learning,能显式提供简洁示范,但依赖离线候选质量和数据制作。
  3. 在 RL reward 中加入 length penalty。RLOO-LP、ALP、HAPO、L1-MAX、ShorterBetter 与 LASER-D 分别使用正确样本长度统计、题目难度、历史最短解或目标长度。

第三类可以沿用 outcome verifier 和在线 rollout,组合 reward 与 group-relative normalization 的顺序却会让辅助偏好改写正确性符号。调小 penalty 系数可以缩小符号翻转的发生范围,同时也会削弱长度信号;缺少 group 组成与 penalty 差异的统一界时,固定的非零系数无法提供与 group 无关的保证。若辅助 reward 有已知界、正确性奖励余量(correctness margin)可以计算,足够小的系数仍能在该条件内维持正向 advantage。DRPO 的结构性增量来自正负样本分离与非中心化的正指数权重,使主判别项中正确样本显式系数的正性不依赖这些范围假设。

DisCO 提供了另一种基底:把正确和错误 response 分成两类,提高正确样本的序列 score,并通过 log-sum-exp 集中压低困难错误样本。它原本只接受二元正确性,未控制正确样本内部的长度差异。DRPO 的关键增量是把长度优化放进 DisCO 的正样本分布。

3. 作者可能的思考路径

以下为本地分析:

  1. 先把正确性视为不可被辅助 reward 翻转的一级语义:正确样本的系数保持为正,错误样本进入独立负项。
  2. 再把长度视为正样本内部的二级排序:短且正确获得较大系数,长且正确获得较小系数。
  3. 理想训练分布应从当前 policy 已能采到的正确输出出发,向高长度 reward 的输出倾斜,同时用 KL 防止分布移动过远。
  4. KL 正则化 reward maximization 有指数倾斜的闭式解,因此无需额外训练 reward policy,也无需离线构造短答案数据。
  5. 把闭式分布代回 DisCO 后,可以用当前 on-policy 正样本做 importance weighting,得到可直接实现的 group objective。

4. 核心假设或切入点

DRPO 依赖以下条件:

  1. correctness verifier 能把每条 response 可靠地分成正样本和负样本。
  2. 当前 rollout policy 已经能采到正确答案;指数重加权只能在已有正样本支持集(support)内调整相对概率比,无法增加旧 policy 尚未覆盖的正确轨迹。
  3. 同一 prompt 的 group 中同时存在正负样本,DisCO 的两个判别项才都有经验估计。
  4. 组内存在至少两个长度不同的正确样本时,长度 reward 才能形成正样本内部的相对偏好;单个正确样本的归一化权重恒为 1。
  5. token 数与实际推理成本、延迟具有足够相关性;它没有直接衡量逻辑质量、冗余类型、硬件延迟或能耗。
  6. 长度 reward 的方向正确。过强的短输出偏好仍会损害需要较长搜索的问题,正系数约束只能避免符号翻转,无法保证推理充分性。

5. 贡献全景与方法总览

DRPO 将正确性判断和长度偏好分成两个层次处理。首要贡献是在 DisCO 的正负样本判别目标中改写正样本分支:由长度奖励导出指数权重,使所有正确输出继续获得显式正系数,同时在正确输出内部提高较短输出的相对权重。辅助贡献是识别 GRPO 的符号翻转条件:正确性奖励与长度奖励的组合值经过组内中心化后,较长的正确输出可能获得负优势(advantage);这项诊断说明了正负样本分离的设计动机。

后文按照论证依赖展开:

GRPO 的符号翻转
  → DisCO 提供正负样本分离的目标
  → KL 正则化推导正确样本的长度倾斜
  → 有限采样组与官方代码实现经验目标
  → 明确正系数保证的范围

实际训练的端到端执行链如下:

  1. 对提示 qq,旧采样策略 πold\pi_{\mathrm{old}} 生成一组在线采样输出(rollout);二元验证器(verifier)给出正确性标签并记录长度,形成正确集合 Sq+S_q^+ 和错误集合 SqS_q^-
  2. 当前策略 πθ\pi_\theta 为每条输出计算词元平均对数似然,得到序列分数 sθ(o,q)s_\theta(o,q),并把分数传入对应的正样本或负样本分支。
  3. 正样本分支依据内层 KL 正则化的闭式解,在 Sq+S_q^+ 内计算与 exp(rl(o)/λ)\exp(r_l(o)/\lambda) 成比例的经验权重 ω^i\hat\omega_i;较短的正确输出获得较大正系数,较长的正确输出获得较小且仍为正的系数。
  4. 正样本分支最大化加权序列分数;负样本分支沿用 DisCO 的 log-sum-exp 项,对高分错误输出施加更强的抑制信号。两个分支组成最终的序列级判别训练信号。
  5. 外层 KL 约束限制 πθ\pi_\theta 相对 πold\pi_{\mathrm{old}} 的单次更新幅度,优化器据此更新当前策略。

关键对象的角色如下:

  • πold\pi_{\mathrm{old}} 是冻结的旧采样策略,负责生成当前训练组;πold+\pi_{\mathrm{old}}^+ 是它在正确输出上的条件分布,也是内层分布优化的参照。
  • PqP_q^* 是长度奖励与内层 KL 共同定义的理想正确样本分布,用于导出权重;它不等于待更新策略。
  • πθ\pi_\theta 是实际计算序列分数并接受梯度更新的当前策略。
  • λ\lambda 是内层 KL 正则化系数,同时控制长度倾斜强度;λ\lambda 越大,长度偏好越弱,λ\lambda\to\infty 时 DRPO 回到 DisCO。

DisCO 提供正负样本划分、序列分数、困难错误样本聚合和外层策略更新约束;DRPO 在其正样本分支中加入正确输出内部的长度重加权。内层 DKL(Pπold+)D_{\mathrm{KL}}(P\Vert\pi_{\mathrm{old}}^+) 构造 PqP_q^* 并导出长度权重,外层 DKL(πoldπθ)D_{\mathrm{KL}}(\pi_{\mathrm{old}}\Vert\pi_\theta) 直接约束实际策略更新。

官方实现要求同一采样组同时包含正确和错误输出,主判别项才生效;长度排序还要求至少两个长度不同的正确输出。只有一个正确输出时,正样本分支退化为 DisCO;全对或全错采样组的判别项会被过滤。方法定义、理论推导与实现分别定位于 Sections 4.1–4.2、Equations 3–7、Appendix A.1、Algorithm 1 和官方代码 compute_policy_loss_drpo

6. GRPO 中组合 reward 的符号翻转

对同一问题 qq 采样 GG 条 response,GRPO 使用标准化 group advantage:

A(oiq)=r(oiq)meanjr(ojq)stdjr(ojq). A(o_i\mid q) = \frac{r(o_i\mid q)-\operatorname{mean}_{j}r(o_j\mid q)} {\operatorname{std}_{j}r(o_j\mid q)}.

若 group reward 的标准差大于 0、错误 response 的 reward 均为 0,正确集合 Sq+S_q^+ 内的组合 reward 为 u1,,umu_1,\ldots,u_m,那么正确 response ii 发生符号翻转的精确条件是:

Ai<0ui<1GjSq+uj. A_i<0 \quad\Longleftrightarrow\quad u_i < \frac{1}{G} \sum_{j\in S_q^+}u_j.

标准差只缩放 advantage 的幅度,不决定符号。这个条件还表明,翻转会随 group solve rate 和组成变化:增加 reward 为 0 的错误 response 会降低全组均值,有时反而消除翻转。因此,更精确的故障描述是“组合后的标量 reward 经全组中心化后,无法在未知 group 组成下稳定保留正确性优先、长度次序次之的层级语义”。

论文 Figure 1 构造三条正确、三条错误 response。纯正确性 reward 为 [1,1,1,0,0,0][1,1,1,0,0,0] 时,三条正确 response 都得到正 advantage;加入长度惩罚后,组合 reward 变成 [0.73,0.6,0.2,0,0,0][0.73,0.6,0.2,0,0,0],图中把第三条较长但正确 response 的 advantage 标为约 0.17-0.17。图示 reward 和 advantage 已经过小数舍入,显示值无法精确复算该小数,符号结论不受影响。

Figure 1: GRPO 长度组合 reward 使正确长答案获得负 advantage,DRPO 保留正向系数
Figure 1: 上两行分别表示纯正确性 reward 与加入长度 reward 后的 GRPO advantage;第三行表示 DRPO 在正样本内降低长答案权重,并维持其正向系数。这个图是构造示例,用于证明符号翻转可以发生;它没有统计真实训练中该事件的发生频率。Image Source: arXiv HTML Figure 1.

作者在 rebuttal 中进一步澄清:该诊断用于解释 GRPO-based length penalty 出现 accuracy degradation 的一种机制。vanilla GRPO 即使没有长度 reward 也可能产生 overthinking;当前证据没有统计真实训练中的翻转频率或实施因果干预,因此符号翻转不能解释冗长推理的全部来源,也不能单独确立 accuracy degradation 的主要原因。

7. DisCO 提供正负样本分离的基底

DisCO 把一条 response 的 score 定义为平均 token log-likelihood:

sθ(o,q)=1ot=1ologπθ(otq,o<t). s_\theta(o,q) = \frac{1}{|o|} \sum_{t=1}^{|o|} \log \pi_\theta(o_t\mid q,o_{<t}).

记旧 policy 在正确、错误 response 上的条件分布分别为 πold+\pi_{\mathrm{old}}^+πold\pi_{\mathrm{old}}^-。DisCO 优化:

maxθ Eq[Eoπold+sθ(o,q)τlogEoπoldexp(sθ(o,q)τ)], \max_\theta\ \mathbb E_q\left[ \mathbb E_{o\sim\pi_{\mathrm{old}}^+}s_\theta(o,q) - \tau\log \mathbb E_{o'\sim\pi_{\mathrm{old}}^-} \exp\left(\frac{s_\theta(o',q)}{\tau}\right) \right],

同时约束:

DKL(πoldπθ)δ. D_{\mathrm{KL}}(\pi_{\mathrm{old}}\Vert\pi_\theta)\leq\delta.

第一项提高正确 response 的 score;第二项通过 log-sum-exp 给高 score 错误 response 更强的抑制信号;KL 约束限制单次 policy shift。DisCO 的分布层面目标没有额外的长度相关重要性比率(importance ratio),经验正样本平均也对采到的正确 response 使用相同样本系数,因此仍未表达“短且正确优于长且正确”。

8. 用 KL 正则化得到长度倾斜的正样本分布

论文使用线性长度 reward:

rl(o)=1oC, r_l(o)=1-\frac{|o|}{C},

其中 CC 是最大 response length。DRPO 在当前正确输出分布附近寻找一个更偏好高长度 reward 的分布:

Pq=argmaxPEoPrl(o)λDKL(Pπold+(q)). P_q^* = \arg\max_{P} \mathbb E_{o\sim P}r_l(o) - \lambda D_{\mathrm{KL}} \left(P\Vert\pi_{\mathrm{old}}^+(\cdot\mid q)\right).

Appendix A.1 用 Gibbs inequality 推出闭式解:

Pq(o)=πold+(oq)exp(rl(o)/λ)Eo~πold+exp(rl(o~)/λ). P_q^*(o) = \frac{ \pi_{\mathrm{old}}^+(o\mid q) \exp(r_l(o)/\lambda) }{ \mathbb E_{\tilde o\sim\pi_{\mathrm{old}}^+} \exp(r_l(\tilde o)/\lambda) }.

它是对旧 policy 正样本分布的 exponential tilt(指数倾斜)。对两条正确 response oao_aobo_b,目标分布中的相对概率比满足:

Pq(oa)Pq(ob)=πold+(oaq)πold+(obq)exp(rl(oa)rl(ob)λ). \frac{P_q^*(o_a)}{P_q^*(o_b)} = \frac{\pi_{\mathrm{old}}^+(o_a\mid q)} {\pi_{\mathrm{old}}^+(o_b\mid q)} \exp\left( \frac{r_l(o_a)-r_l(o_b)}{\lambda} \right).

长度 reward 越高的正确 response 获得越有利的相对概率比乘数;绝对概率及其排序仍同时取决于 πold+\pi_{\mathrm{old}}^+ 的基准概率比,支持集也受该分布限制。λ\lambda 越小,长度偏好越尖锐;λ\lambda\to\infty 时分布层面的重要性比率趋于 1,PqP_q^* 回到 πold+\pi_{\mathrm{old}}^+,DRPO 退化为 DisCO。

PqP_q^* 代回 DisCO 的正样本项后,每个正确 response 得到:

ω(oq)=exp(rl(o)/λ)Eo~πold+exp(rl(o~)/λ). \omega(o\mid q) = \frac{\exp(r_l(o)/\lambda)} {\mathbb E_{\tilde o\sim\pi_{\mathrm{old}}^+} \exp(r_l(\tilde o)/\lambda)}.

对于线性长度 reward,exp(1/λ)\exp(1/\lambda) 会在归一化中抵消,因此相对权重可以改写为:

ω(oq)exp(oCλ). \omega(o\mid q) \propto \exp\left(-\frac{|o|}{C\lambda}\right).

CλC\lambda 是控制长度偏好变化速度的有效尺度:两条正确 response 相差 CλC\lambda 个 token 时,较长 response 的相对重加权因子约乘以 e1e^{-1}。这是对论文公式的本地重写,用来解释 λ\lambda 如何映射到实际长度差异。

错误 response 继续由独立的负样本 log-sum-exp 处理,其长度不参与 reward。作者在 rebuttal 中解释,这是有意保留的探索边界:失败轨迹首先需要找到正确解,限制其长度可能进一步降低 positive discovery。

这里同时出现两个作用不同的 KL。内层 DKL(Pπold+)D_{\mathrm{KL}}(P\Vert\pi_{\mathrm{old}}^+) 产生正样本目标分布的指数倾斜;DisCO 外层的 DKL(πoldπθ)D_{\mathrm{KL}}(\pi_{\mathrm{old}}\Vert\pi_\theta) 约束实际 policy update。闭式解只对应理想分布 PqP_q^*,没有给出实际策略 πθ\pi_\theta 的闭式解。

9. 从理论分布到官方实现

实际训练对每题采样 8 条 response,按二元 reward 划分 Sq+S_q^+SqS_q^-。正样本经验权重为:

ω^i=exp(rl(oi)/λ)jSq+exp(rl(oj)/λ),iSq+. \hat\omega_i = \frac{\exp(r_l(o_i)/\lambda)} {\sum_{j\in S_q^+}\exp(r_l(o_j)/\lambda)}, \qquad i\in S_q^+.

理论重要性比率满足 Eπold+[ω]=1\mathbb E_{\pi_{\mathrm{old}}^+}[\omega]=1,且在 λ\lambda\to\infty 时逐点趋于 1;有限 group 的归一化系数满足 iSq+ω^i=1\sum_{i\in S_q^+}\hat\omega_i=1,并在同一极限下趋于 1/Sq+1/|S_q^+|。两种口径都让正样本项回到 DisCO,数值归一化含义不同。

官方代码在 verl/verl/trainer/ppo/core_algos.py -> compute_policy_loss_drpo 中先跨 worker all_gather score、group id、reward 与长度,再按 prompt 分组。实现使用 response mask 长度除以最大 response length 作为 o/C|o|/C,对应:

weight = exp((1 - length_ratio) / Lambda)
positive term = weighted average of positive sequence scores
negative term = log-sum-exp gradient over negative sequence scores

代码明确构造:

valid_group = has_at_least_one_positive AND has_at_least_one_negative

全对或全错 group 的判别项被过滤;训练脚本又设置 algorithm.filter_groups.enable=False,因此这些 group 仍可能进入 batch,只对整体 KL constraint 产生作用。有效 group 的 loss 最后除以原始问题数,过滤比例也会改变判别梯度尺度。论文 Algorithm 1 没有展开这项边界。

当某组只有一个正样本时,ω^=1\hat\omega=1,当前组退化为 DisCO 的正样本项,不提供长度间排序。全对 group 即使包含多条不同长度的正确 response,官方实现也会把整组判别项清零。DRPO 的长度信号因而同时受到题目 solve rate、group size 和过滤规则影响。

对每题采样 G=8G=8 条 response,若给定问题的单次成功概率为 pp,并用独立采样近似 rollout,那么 DRPO 特有的长度排序要求正确样本数 KK 满足 2K72\leq K\leq7,其覆盖概率为:

Pr(2K7)=1(1p)88p(1p)7p8. \Pr(2\leq K\leq7) = 1-(1-p)^8-8p(1-p)^7-p^8.

例如 p=0.1p=0.10.50.50.990.99 时,覆盖率分别约为 18.7%18.7\%96.1%96.1\%7.7%7.7\%。这是基于实现条件的本地推导,用来说明长度学习集中在中等 solve rate 区域;论文没有报告这些 group 类型的真实占比或训练期变化。

虽然训练配置保留 adv_estimator=grpocompute_policy_loss_drpo 的主损失没有读取 GRPO advantage,也没有使用 PPO importance ratio 或 clipping。实现中的 DRPO 主目标就是 DisCO 的正负序列判别项,加上正样本内部的长度 softmax 权重。

论文所说的“只依赖 on-policy data、没有额外开销”应理解为无需额外 reward model、离线短答案数据或第二次 rollout。官方实现仍需要 group partition、跨 worker gather、排序、指数权重与 KL 计算,论文没有报告 wall-clock 或通信开销。

证据定位:Sections 4.1–4.2;Equations 3–7;Appendix A.1;Algorithm 1;官方代码 commit d76eec8verl/verl/trainer/ppo/core_algos.py:337-433scripts/train/run_drpo_1.5b_8k.sh

10. “正确样本保持正向信号”的精确含义

DRPO 保证主判别目标中每个正样本 score 前的显式权重为正,并让长正确 response 获得较小正权重。这个结论针对 sequence-level objective coefficient。共享参数、负样本项、KL penalty 和不同 token 的梯度耦合仍可能使某些 token 概率下降,因此它不构成“每个正确 response 的所有 token likelihood 都单调上升”的参数级保证。

这一区分也限定了理论贡献。闭式解准确描述了理想正样本分布如何相对旧 policy 倾斜;有限的 8-sample group 只提供该分布的经验近似,尤其在正样本稀少的困难问题上方差更高。

11. 结论链条

  1. 正确性与长度 reward 在全组内共同中心化时,正确长 response 可以获得负 advantage;Figure 1 与 Appendix Table 3 证明多种 reward design 都存在这种可能。
  2. DisCO 已经把正确和错误 response 分成正负判别项,为保持正确性符号提供结构基础。
  3. KL 正则化长度 reward maximization 对正确样本分布产生指数倾斜闭式解;代回 DisCO 后,只需对 on-policy 正样本做长度权重归一化。
  4. 1.5B、7B、8B 三种 base model 的长度—准确率曲线均优于主要训练内 baseline,支持该目标在 tested setting 下改善 trade-off。
  5. GSM8K 与 K&K logic puzzle 说明短推理收益可以扩展到简单数学和一种非数学逻辑任务;AIME 上的负 AES 与代码中的 finite-group coverage 同时显示,低 solve rate 和接近 all-correct 的饱和状态都会削弱长度排序信号,论文没有报告真实 group 组成来直接验证这项机制解释。

关键实验结果

结果 1:三种模型规模上的长度—准确率前沿

  • 设置:DeepSeek-R1-Distill-Qwen-1.5B、Qwen-7B 与 Llama-8B;DeepScaleR-Preview 约 40.3K 训练题;每题 8 条 rollout;batch size 128;最大生成 8K;训练 1000 steps,每 200 steps 评估。
  • 指标:四个数学数据集平均 Pass@1 与平均生成 token 数;Pass@1 对每题采样 16 次后平均。
  • Baseline:RLOO-LP、ALP、HAPO 由作者在相近设置下训练;L1-MAX、ShorterBetter、LASER-D 使用原工作公开模型。
  • 假设:二元 verifier 对最终答案的判定可靠,当前 policy 能在每题八条采样中产生同时包含正确与错误输出的 group。
  • 适用域:1.5B–8B 蒸馏推理模型、8K 最大生成长度、以可验证答案为主的数学与合成逻辑任务。
  • 结果:7B 的 DisCO reference 从平均长度 3053 降到 DRPO 的 1502,作者报告性能相对下降 2.6%;RLOO-LP 从 2975 降到 1841 时性能下降 7.1%。Table 1 的最佳 AES 上,DRPO 在 1.5B、7B、8B 分别为 0.178、0.249、0.297;8B RLOO-LP 也得到正 AES 0.251,其余列出的 baseline 最佳值为负。
  • 对照是否可比:RLOO-LP、ALP、HAPO 的训练预算和超参数 sweep 较可比;三个外部 checkpoint 的训练、数据与 decoding 配置没有完全对齐。每种方法报告 best-Pass@1 checkpoint,可能偏向保留 accuracy 的时间点。
  • 证据定位:Section 5.2;Figure 3;Table 1;Appendix A.2 / A.6。
  • 支持的最窄结论:在三种 1.5B–8B distilled reasoning base model、8K budget 和作者实现的数学 RL 设置中,DRPO 达到更靠左上方的经验 trade-off frontier。
Figure 2: DRPO 与高效推理基线的平均 Pass@1—长度前沿
Figure 2: 官方仓库给出的 1.5B 与 7B 平均 Pass@1—response length 对比;蓝色 DRPO 曲线由不同 λ\lambda 形成。该仓库图没有包含 camera-ready 新增的 8B panel,8B 数字以正文 Figure 3 与 Table 1 为准。Image Source: official repository assets/comp.png at commit d76eec8.

结果 2:简单题可以大幅缩短,困难题更敏感

  • 设置:把 GSM8K、MATH-500、OlympiadBench、AIME 按难度分别画 trade-off;比较不同 λ\lambda 与 baseline。
  • 指标:各数据集 Pass@1、平均长度与 AES(Accuracy Efficiency Score,准确率—效率分数)。记 ΔLength\Delta\mathrm{Length} 为相对长度缩减、ΔAcc\Delta\mathrm{Acc} 为相对准确率变化;准确率下降时,AES=ΔLength10ΔAcc\mathrm{AES}=\Delta\mathrm{Length}-10|\Delta\mathrm{Acc}|,因此正 AES 仍允许少量准确率下降。准确率上升时,公式使用 3 倍增益奖励。每种方法又使用自己的无长度版本作为 reference,AES 更适合观察方法内部的边际交易。
  • 结果:GSM8K 上,1.5B 从 1563 降到 356 tokens,长度减少 77.2%,性能相对下降 1.1%;7B 从 969 降到 261,长度减少 73.1%,性能相对下降 0.6%。随着任务变难,各方法通常需要更长输出;DRPO 在 AIME 上也出现负 AES,例如 1.5B、λ=0.1\lambda=0.1 为 -0.729。
  • 对照是否可比:同模型内的 λ\lambda sweep 可比;跨数据集题量、答案格式和 base accuracy 不同,AES 又依赖人为设置的权重,适合辅助观察,不能替代完整 Pareto curve。
  • 证据定位:Section 5.3;Figure 4;Appendix Tables 4–6。
  • 支持的最窄结论:DRPO 的强长度压缩主要建立在简单到中等、能稳定采到多个正样本的问题上;高难题仍存在明显 accuracy—length tension。

结果 3:非数学逻辑任务与 reward shape 消融

  • 设置:K&K logic puzzle 使用 1.5B 模型,训练集为 3–7 人 puzzle,测试集为 2–8 人 puzzle,训练 400 steps、每 80 steps 评估;另在数学任务比较 linear、concave、cosine 三种长度 reward。
  • 指标:logic puzzle accuracy 与平均 token 数;数学任务 Pass@1—长度曲线。
  • 结果:K&K 上从 2095 降到 1400 tokens,长度减少 33.2%,accuracy 从 0.972 变为 0.974;0.002 的差异没有多次训练或置信区间支持,最窄解读是未观察到准确率下降。三种 reward shape 均形成可用 trade-off;linear 覆盖的长度范围最宽,concave 与 cosine 通常保留更高 accuracy、输出也更长。
  • 对照是否可比:K&K 对主要训练内 baseline 使用相同 1.5B setting,仍只有一个合成逻辑任务和单次训练曲线;reward-shape ablation 同模型同 sweep 较可比。
  • 证据定位:Appendix A.4–A.5;Figures 5–6。
  • 支持的最窄结论:正样本内重加权可以使用多种长度 reward,并在一种高准确率、可精确判分的合成 logic puzzle 分布上保留长度—准确率 trade-off;跨 coding、science、commonsense 与开放式任务仍未验证。

结果 4:公开实现揭示 mixed-group 边界

  • 设置:官方 VERL fork,commit d76eec8compute_policy_loss_drpo 读取 binary sequence reward、uid、response mask 与 old/current logprob。
  • 指标:代码路径与 loss 构造;论文没有单独报告过滤率。
  • 结果:实现过滤全对和全错 group;单个正样本的长度权重归一化为 1;训练脚本关闭预先的 group filtering,并在 8 A100-80GB、每题 8 rollout 的设置运行 1.5B recipe。
  • 对照是否可比:这是实现事实,没有对应的 ablation;无法从主表分离 dropped-group fraction 对性能的贡献。
  • 证据定位:官方实现 compute_policy_loss_drpo1.5B 训练脚本;commit: d76eec8。
  • 支持的最窄结论:官方实现需要同题同时出现正负样本;长度偏好还需要多个正样本,论文的“正负解耦”在有限 group 中具有明确的 coverage 条件。

OpenReview / 审稿意见吸收

  • Page type: official-review
  • Authenticated forum intake: 12 条可读 Note,包括投稿、4 份 Official Review、5 条作者 Official Comment、1 份 Meta Review 与 1 份 Decision。
  • Decision: Accept (Poster),ICLR 2026。
  • Reviewer consensus: 评审普遍认可 composite reward 的符号冲突值得处理,也认可正样本内长度重加权带来的经验前沿改善。
  • Main criticisms: 主要质疑集中在相对 DisCO 的增量、符号翻转对 overthinking 的解释范围、模型与任务外推、token 数效率口径、对照与消融完整性。
  • Author response: 作者补充 8B、K&K logic puzzle、reward-shape 消融和 GRPO 对照澄清;论坛另报告动态温度与 Pass@16,但后两项没有进入当前 camera-ready。
  • 对可信度的影响: 新增实验和公开实现提高可复查性;缺少多次训练、显著性、真实延迟与困难任务 coverage 统计,使结论仍应限制在已测设置。

初始正式评分如下,OpenReview 没有显示 rebuttal 后更新分数:

Reviewer Rating Confidence 主要判断
1 6 3 方法设计与结果较强;贡献高度依赖 DisCO,写作和引用需要改善。
2 8 4 认可问题诊断、闭式目标和实验;要求非数学任务与 Pass@k。
3 4 5 质疑符号翻转能否解释 overthinking、缺少显式 vanilla GRPO、token 数效率口径过窄。
4 4 4 要求更大模型、不同模型家族、非数学任务、reward shape 与 DisCO 对照。

Reviewer consensus

评审普遍认可两个点:正确长 response 得到负 advantage 是值得关注的 composite-reward failure mode;在正样本内做长度重加权的目标简洁,并取得明显的长度—准确率改善。主要争议集中在贡献相对 DisCO 的增量、根因陈述范围、模型与任务外推、token count 指标、vanilla GRPO 命名和消融完整性。

Author response

作者在 revision 中加入 DeepSeek-R1-Distill-Llama-8B、K&K logic puzzle、linear / concave / cosine reward 消融,并明确 λ=+\lambda=+\infty 对应 DisCO、ALP 的 β=0\beta=0 对应 vanilla GRPO。camera-ready 正文可以核对这些新增内容。

作者还在论坛回应中报告 difficulty-adaptive λ=1p(q)\lambda=1-p(q) 的 1.5B 结果:Pass@1 0.640、length 2370、AES 0.183,略高于固定 λ\lambda 的最佳 AES 0.178;并称补充了 Pass@16,还说明 process reward 可以替换长度 reward。当前 OpenReview camera-ready PDF 与 arXiv v2 均没有 Pass@16 和 dynamic-λ\lambda 内容,process reward 也只有目标替换建议,没有训练实验。因此,这三项保留为 rebuttal-only evidence,不并入正文主结论。

Meta-review 与可信度影响

Meta-review 判断新增 8B、logic puzzle、reward-shape ablation、GRPO 对照澄清和引用修订已经处理主要关切,并推测两位初始低分 reviewer 若参与最终讨论可能转为正面;这属于 AC 的判断,不能改写成 reviewer 实际升分。最终 Poster 决定、camera-ready、公开代码与 checkpoint 提高了可复查性;缺少多 seed、显著性、真实延迟和困难任务 coverage 统计仍限制因果强度。

主要启发

  • 多目标 reward 的危险点常出现在“组合后再归一化”。一级语义的符号和二级偏好可以分层处理:先保证正确/错误方向,再在正确集合内部排序效率。
  • 指数倾斜只在当前 policy 已覆盖的正样本支持集内调整相对概率比,绝对目标概率仍受旧分布基准比影响。positive discovery 与 positive ranking 是两个独立问题;前者仍依赖 base model、rollout width、curriculum 和 verifier。
  • group 内正样本数量决定辅助 reward 的有效分辨率,官方实现又会过滤 all-correct group。报告 DRPO 类方法时应同时给 all-correct、all-wrong、single-positive、multi-positive group 比例及其训练期变化。
  • token length 是可复现且便宜的成本 proxy。部署判断还需要 decode latency、energy、batching、正确推理步骤比例与截断失败率。
  • “正样本系数为正”是 objective-level invariant。它提供清晰的语义保护,同时保留共享参数耦合和 KL regularization 带来的实际梯度复杂性。

局限

  1. 首要贡献依赖 binary correctness partition;开放式生成、部分正确、过程 reward 与多维 preference 只获得形式层面的扩展说明。指数倾斜也不会创造旧 policy 尚未覆盖的正确轨迹;旧分布强烈偏向长轨迹时,有限 λ\lambda 不保证短轨迹拥有更高绝对概率。
  2. 官方代码过滤全对和全错 group,single-positive group 又没有正样本内长度排序;论文没有报告各类 group 占比、过滤率或随训练变化的 coverage。
  3. “负 advantage 是主要 accuracy degradation 来源”主要由构造示例、reward table 和最终 performance curve 支持,缺少真实训练中 sign-flip frequency、受影响 token 质量和因果干预统计。
  4. 模型规模止于 8B,任务以数学为主,非数学证据只有 1.5B K&K logic puzzle;coding、science、commonsense、tool use 与 30B 以上模型未验证。
  5. 训练结果没有独立 seeds、误差线、置信区间或显著性检验;每题 16 次 evaluation sampling 只能降低评测采样噪声,不能替代训练重复。
  6. 每种方法选择 best-Pass@1 checkpoint,多组长度控制或正则化超参数又同时形成 frontier,存在 checkpoint 与 hyperparameter selection bias。
  7. RLOO-LP、ALP、HAPO 的对照较强;L1-MAX、ShorterBetter、LASER-D 使用外部模型或不同 decoding 设置,训练数据也有个别差异。
  8. 平均 token 数不能识别逻辑冗余、推理正确性、batch latency、首 token 延迟、吞吐、能耗和硬件利用率;论文没有端到端效率测量。
  9. AES 对 accuracy loss 使用人为设置的 10 倍惩罚,并为每种方法使用各自 reference;其绝对值和跨论文可比性有限,完整 Pareto curve 更可靠。
  10. 论文声称无需额外开销,官方实现仍包含 distributed all-gather、group sorting、权重与 KL 计算;没有 wall-clock、GPU-hour 或通信 ablation。
  11. rebuttal 声称加入的 Pass@16 与 dynamic-λ\lambda 结果没有进入当前 camera-ready;这些证据只能从论坛评论复查。
  12. 复现配置存在两处待澄清差异:正文 Section 5.1 给出的 RLOO-LP 系数集合与 Appendix AES 表及 7B 重点结果使用的集合不一致;论文写训练 top-p 为 0.95,公开训练脚本没有覆盖配置中的默认 top-p=1,评测脚本才显式设置 0.95。

跨论文关系

  • 与 DisCO(arXiv:2505.12366)的关系最直接:Gang Li、Ming Lin、Tianbao Yang 三位作者重叠;DRPO 保留 DisCO 的正负判别 score、hard-negative log-sum-exp 和 KL constraint,把长度 reward 变成相对于旧正样本条件分布的指数重要性比率。DRPO 的 novelty 应理解为 DisCO 上的多 reward 扩展和 efficient-reasoning 实证。
  • DeepSeek-R1:R1 展示 GRPO 与长 CoT emergence,也留下 overthinking 与 token cost;DRPO 针对 correctness—length composite reward 的 group normalization 重新设计 policy objective。
  • DAPO:DAPO 用 overlong reward shaping、dynamic sampling 和 token-level normalization稳定长 CoT RL;DRPO 指出把长度 penalty 直接送入 group advantage 可能翻转正确 response 的符号,并用正样本内重加权替代该路径。
  • MiniMax-M1 / CISPO:CISPO 调整 importance-weight clipping 以保持 token gradient,DRPO 调整 correctness 与 length 的 reward aggregation 以保持正样本 sequence coefficient;两者分别处理 policy-ratio clipping 与 composite-reward sign 两类稳定性问题。
  • MaxRL:两者都从 binary outcome 重写 RLVR objective。MaxRL 最大化成功 rollout likelihood并面向 pass@k coverage;DRPO 使用正负判别目标,并在已成功 rollout 内部按长度偏好重新分配权重。
  • RLVR Reasoning Boundary:该笔记把 positive trajectory discovery 视为 RLVR 的首要边界;DRPO 的经验目标进一步要求 mixed group,且多个正样本才能产生长度排序,因此它改善的是可采样成功区域内的效率选择,无法把近零成功概率的问题变成可学习问题。