2510.04474-drpo-decoupled-reward-policy-optimization

DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization

DRPO 在 DisCO 的正负判别框架内,只用正确 rollout 之间的长度奖励重加权正样本,同时维持所有正确样本的正向系数;在每题采样八条、最长八千 token 的 1.5B、7B 和 8B 蒸馏推理模型实验中,它取得优于作者复现基线的长度—准确率前沿,7B 模型平均生成长度减少百分之五十一时性能相对下降百分之二点六,结论依赖可验证的二元正确性、同题同时出现正负样本以及以 token 数衡量效率。

Authors Gang Li, Yan Chen, Ming Lin, Tianbao Yang

待审阅 Archived 2026-07-21 18:17 Source

Source

作者与关系

  • Gang Li: Texas A&M University;共同一作。
  • Yan Chen: The University of Virginia;共同一作。
  • Ming Lin: Oracle Cloud Infrastructure。
  • Tianbao Yang: Texas A&M University。

Gang Li 与 Tianbao Yang 组成 Texas A&M University 一侧的合作主线;Tianbao Yang 是该校计算机科学与工程教授及 OptMAI Lab 主任。Yan Chen 以共同一作身份连接 The University of Virginia。Ming Lin 在论文期任职 Oracle Cloud Infrastructure Generative AI Service,为学术团队与产业研究提供跨机构桥接。

Gang Li、Ming Lin 与 Tianbao Yang 也是 DisCO 的作者。DRPO 直接沿用 DisCO 的正负样本判别目标和 KL 约束,再加入只作用于正样本分布的长度偏好;这组三位作者重叠构成本文最强的连续产出关系。当前档案没有发现四位作者与其它已收录论文直接重叠。

论文脉络

1. 研究问题、背景和价值

长推理模型通过生成分支、反思、验证和回溯提高复杂问题的成功率,也会在简单问题上产生大量重复 token。较长输出直接增加 decode 计算、响应时间和 rollout 训练成本,因此很多工作把正确性 reward 与长度惩罚相加,再交给 GRPO、RLOO 或 REINFORCE-style advantage estimator。

这类组合存在一个符号问题。正确但较长的 response 会获得较低的组合 reward;当 GRPO 再用包含错误 response 的全组均值做中心化时,这个 reward 可能低于组均值,使正确 response 获得负 advantage。训练信号随后同时表达“比其它正确答案更长”和“应当降低生成概率”,长度偏好改变了正确性信号的方向。

DRPO 研究的问题是:如何让模型在正确答案之间偏好更短的推理,同时保持“正确轨迹应被强化、错误轨迹应被抑制”的符号语义。

2. 已有解决方案与剩余缺口

已有高效推理方法大致分为三类:

  1. 在 prompt 或 decoding 阶段设置长度预算、提前退出或压缩规则,部署直接,但训练策略仍可能偏好冗长路径。
  2. 用短轨迹做 SFT、rejection sampling 或 preference learning,能显式提供简洁示范,但依赖离线候选质量和数据制作。
  3. 在 RL reward 中加入 length penalty。RLOO-LP、ALP、HAPO、L1-MAX、ShorterBetter 与 LASER-D 分别使用正确样本长度统计、题目难度、历史最短解或目标长度。

第三类可以沿用 outcome verifier 和在线 rollout,组合 reward 与 group-relative normalization 的顺序却会让辅助偏好改写正确性符号。调整 penalty 系数只能移动触发位置,无法从结构上保证正确样本继续得到正向系数。

DisCO 提供了另一种基底:把正确和错误 response 分成两类,提高正确样本的序列 score,并通过 log-sum-exp 集中压低困难错误样本。它原本只接受二元正确性,未控制正确样本内部的长度差异。DRPO 的关键增量是把长度优化放进 DisCO 的正样本分布。

3. 作者可能的思考路径

以下为本地分析:

  1. 先把正确性视为不可被辅助 reward 翻转的一级语义:正确样本的系数保持为正,错误样本进入独立负项。
  2. 再把长度视为正样本内部的二级排序:短且正确获得较大系数,长且正确获得较小系数。
  3. 理想训练分布应从当前 policy 已能采到的正确输出出发,向高长度 reward 的输出倾斜,同时用 KL 防止分布移动过远。
  4. KL 正则化 reward maximization 有指数倾斜的闭式解,因此无需额外训练 reward policy,也无需离线构造短答案数据。
  5. 把闭式分布代回 DisCO 后,可以用当前 on-policy 正样本做 importance weighting,得到可直接实现的 group objective。

4. 核心假设或切入点

DRPO 依赖以下条件:

  1. correctness verifier 能把每条 response 可靠地分成正样本和负样本。
  2. 当前 rollout policy 已经能采到正确答案;指数重加权只能在已有正样本 support 内重新分配质量。
  3. 同一 prompt 的 group 中同时存在正负样本,DisCO 的两个判别项才都有经验估计。
  4. 组内存在至少两个长度不同的正确样本时,长度 reward 才能形成正样本内部的相对偏好;单个正确样本的归一化权重恒为 1。
  5. token 数与实际推理成本、延迟具有足够相关性;它没有直接衡量逻辑质量、冗余类型、硬件延迟或能耗。
  6. 长度 reward 的方向正确。过强的短输出偏好仍会损害需要较长搜索的问题,正系数约束只能避免符号翻转,无法保证推理充分性。

5. 方法与理论框架

5.1 GRPO 中组合 reward 的符号翻转

对同一问题 qq 采样 GG 条 response,GRPO 使用标准化 group advantage:

A(oiq)=r(oiq)meanjr(ojq)stdjr(ojq). A(o_i\mid q) = \frac{r(o_i\mid q)-\operatorname{mean}_{j}r(o_j\mid q)} {\operatorname{std}_{j}r(o_j\mid q)}.

论文 Figure 1 构造三条正确、三条错误 response。纯正确性 reward 为 [1,1,1,0,0,0][1,1,1,0,0,0] 时,三条正确 response 都得到正 advantage;加入长度惩罚后,组合 reward 变成 [0.73,0.6,0.2,0,0,0][0.73,0.6,0.2,0,0,0],第三条较长但正确的 response 得到 0.17-0.17 advantage。这里暴露的是先混合 reward、再以全组中心化造成的语义冲突。

Figure 1: GRPO 长度组合 reward 使正确长答案获得负 advantage,DRPO 保留正向系数
Figure 1: 上两行分别表示纯正确性 reward 与加入长度 reward 后的 GRPO advantage;第三行表示 DRPO 在正样本内降低长答案权重,并维持其正向系数。这个图是构造示例,用于证明符号翻转可以发生;它没有统计真实训练中该事件的发生频率。Image Source: arXiv HTML Figure 1.

作者在 rebuttal 中进一步澄清:该诊断用于解释 GRPO-based length penalty 为何会造成 accuracy degradation。vanilla GRPO 即使没有长度 reward 也可能产生 overthinking,因此符号翻转不能解释冗长推理的全部来源。

5.2 DisCO 提供正负样本分离的基底

DisCO 把一条 response 的 score 定义为平均 token log-likelihood:

sθ(o,q)=1ot=1ologπθ(otq,o<t). s_\theta(o,q) = \frac{1}{|o|} \sum_{t=1}^{|o|} \log \pi_\theta(o_t\mid q,o_{<t}).

记旧 policy 在正确、错误 response 上的条件分布分别为 πold+\pi_{\mathrm{old}}^+πold\pi_{\mathrm{old}}^-。DisCO 优化:

maxθ Eq[Eoπold+sθ(o,q)τlogEoπoldexp(sθ(o,q)τ)], \max_\theta\ \mathbb E_q\left[ \mathbb E_{o\sim\pi_{\mathrm{old}}^+}s_\theta(o,q) - \tau\log \mathbb E_{o'\sim\pi_{\mathrm{old}}^-} \exp\left(\frac{s_\theta(o',q)}{\tau}\right) \right],

同时约束:

DKL(πoldπθ)δ. D_{\mathrm{KL}}(\pi_{\mathrm{old}}\Vert\pi_\theta)\leq\delta.

第一项提高正确 response 的 score;第二项通过 log-sum-exp 给高 score 错误 response 更强的抑制信号;KL 约束限制单次 policy shift。DisCO 对所有正确 response 使用相同权重,因此仍未表达“短且正确优于长且正确”。

5.3 用 KL 正则化得到长度倾斜的正样本分布

论文使用线性长度 reward:

rl(o)=1oC, r_l(o)=1-\frac{|o|}{C},

其中 CC 是最大 response length。DRPO 在当前正确输出分布附近寻找一个更偏好高长度 reward 的分布:

Pq=argmaxPEoPrl(o)λDKL(Pπold+(q)). P_q^* = \arg\max_{P} \mathbb E_{o\sim P}r_l(o) - \lambda D_{\mathrm{KL}} \left(P\Vert\pi_{\mathrm{old}}^+(\cdot\mid q)\right).

Appendix A.1 用 Gibbs inequality 推出闭式解:

Pq(o)=πold+(oq)exp(rl(o)/λ)Eo~πold+exp(rl(o~)/λ). P_q^*(o) = \frac{ \pi_{\mathrm{old}}^+(o\mid q) \exp(r_l(o)/\lambda) }{ \mathbb E_{\tilde o\sim\pi_{\mathrm{old}}^+} \exp(r_l(\tilde o)/\lambda) }.

它是对旧 policy 正样本分布的 exponential tilt(指数倾斜):更短的正确 response 获得更大概率质量,support 仍受 πold+\pi_{\mathrm{old}}^+ 限制。λ\lambda 越小,长度偏好越尖锐;λ\lambda\to\infty 时权重趋于均匀,DRPO 退化为 DisCO。

PqP_q^* 代回 DisCO 的正样本项后,每个正确 response 得到:

ω(oq)=exp(rl(o)/λ)Eo~πold+exp(rl(o~)/λ). \omega(o\mid q) = \frac{\exp(r_l(o)/\lambda)} {\mathbb E_{\tilde o\sim\pi_{\mathrm{old}}^+} \exp(r_l(\tilde o)/\lambda)}.

错误 response 继续由独立的负样本 log-sum-exp 处理,其长度不参与 reward。作者在 rebuttal 中解释,这是有意保留的探索边界:失败轨迹首先需要找到正确解,限制其长度可能进一步降低 positive discovery。

5.4 从理论分布到官方实现

实际训练对每题采样 8 条 response,按二元 reward 划分 Sq+S_q^+SqS_q^-。正样本经验权重为:

ω^i=exp(rl(oi)/λ)jSq+exp(rl(oj)/λ),iSq+. \hat\omega_i = \frac{\exp(r_l(o_i)/\lambda)} {\sum_{j\in S_q^+}\exp(r_l(o_j)/\lambda)}, \qquad i\in S_q^+.

官方代码在 verl/verl/trainer/ppo/core_algos.py -> compute_policy_loss_drpo 中先跨 worker all_gather score、group id、reward 与长度,再按 prompt 分组。实现使用 response mask 长度除以最大 response length 作为 o/C|o|/C,对应:

weight = exp((1 - length_ratio) / Lambda)
positive term = weighted average of positive sequence scores
negative term = log-sum-exp gradient over negative sequence scores

代码明确构造:

valid_group = has_at_least_one_positive AND has_at_least_one_negative

全对或全错 group 的判别项被过滤;训练脚本又设置 algorithm.filter_groups.enable=False,因此这些 group 仍可能进入 batch,只对整体 KL constraint 产生作用。有效 group 的 loss 最后除以原始问题数,过滤比例也会改变判别梯度尺度。论文 Algorithm 1 没有展开这项边界。

当某组只有一个正样本时,ω^=1\hat\omega=1,当前组退化为 DisCO 的正样本项,不提供长度间排序。DRPO 的长度信号会随题目 solve rate 和 group size 改变;简单题更容易出现多个正样本,也更容易获得稳定的正样本内长度偏好。

论文所说的“只依赖 on-policy data、没有额外开销”应理解为无需额外 reward model、离线短答案数据或第二次 rollout。官方实现仍需要 group partition、跨 worker gather、排序、指数权重与 KL 计算,论文没有报告 wall-clock 或通信开销。

证据定位:Sections 4.1–4.2;Equations 3–7;Appendix A.1;Algorithm 1;官方代码 commit d76eec8verl/verl/trainer/ppo/core_algos.py:337-433scripts/train/run_drpo_1.5b_8k.sh

5.5 “正确样本保持正向信号”的精确含义

DRPO 保证主判别目标中每个正样本 score 前的显式权重为正,并让长正确 response 获得较小正权重。这个结论针对 sequence-level objective coefficient。共享参数、负样本项、KL penalty 和不同 token 的梯度耦合仍可能使某些 token 概率下降,因此它不构成“每个正确 response 的所有 token likelihood 都单调上升”的参数级保证。

这一区分也限定了理论贡献。闭式解准确描述了理想正样本分布如何相对旧 policy 倾斜;有限的 8-sample group 只提供该分布的经验近似,尤其在正样本稀少的困难问题上方差更高。

6. 结论链条

  1. 正确性与长度 reward 在全组内共同中心化时,正确长 response 可以获得负 advantage;Figure 1 与 Appendix Table 3 证明多种 reward design 都存在这种可能。
  2. DisCO 已经把正确和错误 response 分成正负判别项,为保持正确性符号提供结构基础。
  3. KL 正则化长度 reward maximization 对正确样本分布产生指数倾斜闭式解;代回 DisCO 后,只需对 on-policy 正样本做长度权重归一化。
  4. 1.5B、7B、8B 三种 base model 的长度—准确率曲线均优于主要训练内 baseline,支持该目标在 tested setting 下改善 trade-off。
  5. GSM8K 与 K&K logic puzzle 说明短推理收益可以扩展到简单数学和一种非数学逻辑任务;AIME 上的负 AES 与代码中的 mixed-group requirement 同时显示,困难任务和低 solve-rate group 是更窄的成立边界。

关键实验结果

结果 1:三种模型规模上的长度—准确率前沿

  • 设置:DeepSeek-R1-Distill-Qwen-1.5B、Qwen-7B 与 Llama-8B;DeepScaleR-Preview 约 40.3K 训练题;每题 8 条 rollout;batch size 128;最大生成 8K;训练 1000 steps,每 200 steps 评估。
  • 指标:四个数学数据集平均 Pass@1 与平均生成 token 数;Pass@1 对每题采样 16 次后平均。
  • Baseline:RLOO-LP、ALP、HAPO 由作者在相近设置下训练;L1-MAX、ShorterBetter、LASER-D 使用原工作公开模型。
  • 假设:二元 verifier 对最终答案的判定可靠,当前 policy 能在每题八条采样中产生同时包含正确与错误输出的 group。
  • 适用域:1.5B–8B 蒸馏推理模型、8K 最大生成长度、以可验证答案为主的数学与合成逻辑任务。
  • 结果:7B 的 DisCO reference 从平均长度 3053 降到 DRPO 的 1502,作者报告性能相对下降 2.6%;RLOO-LP 从 2975 降到 1841 时性能下降 7.1%。Table 1 的最佳 AES 上,DRPO 在 1.5B、7B、8B 分别为 0.178、0.249、0.297;8B RLOO-LP 也得到正 AES 0.251,其余列出的 baseline 最佳值为负。
  • 对照是否可比:RLOO-LP、ALP、HAPO 的训练预算和超参数 sweep 较可比;三个外部 checkpoint 的训练、数据与 decoding 配置没有完全对齐。每种方法报告 best-Pass@1 checkpoint,可能偏向保留 accuracy 的时间点。
  • 证据定位:Section 5.2;Figure 3;Table 1;Appendix A.2 / A.6。
  • 支持的最窄结论:在三种 1.5B–8B distilled reasoning base model、8K budget 和作者实现的数学 RL 设置中,DRPO 达到更靠左上方的经验 trade-off frontier。
Figure 2: DRPO 与高效推理基线的平均 Pass@1—长度前沿
Figure 2: 官方仓库给出的 1.5B 与 7B 平均 Pass@1—response length 对比;蓝色 DRPO 曲线由不同 λ\lambda 形成。该仓库图没有包含 camera-ready 新增的 8B panel,8B 数字以正文 Figure 3 与 Table 1 为准。Image Source: official repository assets/comp.png at commit d76eec8.

结果 2:简单题可以大幅缩短,困难题更敏感

  • 设置:把 GSM8K、MATH-500、OlympiadBench、AIME 按难度分别画 trade-off;比较不同 λ\lambda 与 baseline。
  • 指标:各数据集 Pass@1、平均长度与 AES(Accuracy Efficiency Score,准确率—效率分数)。AES 对长度减少给正分,对 accuracy loss 使用 10 倍惩罚。
  • 结果:GSM8K 上,1.5B 从 1563 降到 356 tokens,长度减少 77.2%,性能相对下降 1.1%;7B 从 969 降到 261,长度减少 73.1%,性能相对下降 0.6%。随着任务变难,各方法通常需要更长输出;DRPO 在 AIME 上也出现负 AES,例如 1.5B、λ=0.1\lambda=0.1 为 -0.729。
  • 对照是否可比:同模型内的 λ\lambda sweep 可比;跨数据集题量、答案格式和 base accuracy 不同,AES 又依赖人为设置的权重,适合辅助观察,不能替代完整 Pareto curve。
  • 证据定位:Section 5.3;Figure 4;Appendix Tables 4–6。
  • 支持的最窄结论:DRPO 的强长度压缩主要建立在简单到中等、能稳定采到多个正样本的问题上;高难题仍存在明显 accuracy—length tension。

结果 3:非数学逻辑任务与 reward shape 消融

  • 设置:K&K logic puzzle 使用 1.5B 模型,训练集为 3–7 人 puzzle,测试集为 2–8 人 puzzle,训练 400 steps、每 80 steps 评估;另在数学任务比较 linear、concave、cosine 三种长度 reward。
  • 指标:logic puzzle accuracy 与平均 token 数;数学任务 Pass@1—长度曲线。
  • 结果:K&K 上从 2095 降到 1400 tokens,长度减少 33.2%,accuracy 从 0.972 变为 0.974。三种 reward shape 均形成可用 trade-off;linear 覆盖的长度范围最宽,concave 与 cosine 通常保留更高 accuracy、输出也更长。
  • 对照是否可比:K&K 对主要训练内 baseline 使用相同 1.5B setting,仍只有一个合成逻辑任务和单次训练曲线;reward-shape ablation 同模型同 sweep 较可比。
  • 证据定位:Appendix A.4–A.5;Figures 5–6。
  • 支持的最窄结论:正样本内重加权不局限于线性长度 reward,并在一种非数学 logic puzzle 分布上保留 trade-off 优势;跨 coding、science、commonsense 与开放式任务仍未验证。

结果 4:公开实现揭示 mixed-group 边界

  • 设置:官方 VERL fork,commit d76eec8compute_policy_loss_drpo 读取 binary sequence reward、uid、response mask 与 old/current logprob。
  • 指标:代码路径与 loss 构造;论文没有单独报告过滤率。
  • 结果:实现过滤全对和全错 group;单个正样本的长度权重归一化为 1;训练脚本关闭预先的 group filtering,并在 8 A100-80GB、每题 8 rollout 的设置运行 1.5B recipe。
  • 对照是否可比:这是实现事实,没有对应的 ablation;无法从主表分离 dropped-group fraction 对性能的贡献。
  • 证据定位:官方实现 compute_policy_loss_drpo1.5B 训练脚本;commit: d76eec8。
  • 支持的最窄结论:官方实现需要同题同时出现正负样本;长度偏好还需要多个正样本,论文的“正负解耦”在有限 group 中具有明确的 coverage 条件。

OpenReview / 审稿意见吸收

  • Page type: official-review
  • Authenticated forum intake: 12 条可读 Note,包括投稿、4 份 Official Review、5 条作者 Official Comment、1 份 Meta Review 与 1 份 Decision。
  • Decision: Accept (Poster),ICLR 2026。
  • Reviewer consensus: 评审普遍认可 composite reward 的符号冲突值得处理,也认可正样本内长度重加权带来的经验前沿改善。
  • Main criticisms: 主要质疑集中在相对 DisCO 的增量、符号翻转对 overthinking 的解释范围、模型与任务外推、token 数效率口径、对照与消融完整性。
  • Author response: 作者补充 8B、K&K logic puzzle、reward-shape 消融和 GRPO 对照澄清;论坛另报告动态温度与 Pass@16,但后两项没有进入当前 camera-ready。
  • 对可信度的影响: 新增实验和公开实现提高可复查性;缺少多次训练、显著性、真实延迟与困难任务 coverage 统计,使结论仍应限制在已测设置。

初始正式评分如下,OpenReview 没有显示 rebuttal 后更新分数:

Reviewer Rating Confidence 主要判断
1 6 3 方法设计与结果较强;贡献高度依赖 DisCO,写作和引用需要改善。
2 8 4 认可问题诊断、闭式目标和实验;要求非数学任务与 Pass@k。
3 4 5 质疑符号翻转能否解释 overthinking、缺少显式 vanilla GRPO、token 数效率口径过窄。
4 4 4 要求更大模型、不同模型家族、非数学任务、reward shape 与 DisCO 对照。

Reviewer consensus

评审普遍认可两个点:正确长 response 得到负 advantage 是值得关注的 composite-reward failure mode;在正样本内做长度重加权的目标简洁,并取得明显的长度—准确率改善。主要争议集中在贡献相对 DisCO 的增量、根因陈述范围、模型与任务外推、token count 指标、vanilla GRPO 命名和消融完整性。

Author response

作者在 revision 中加入 DeepSeek-R1-Distill-Llama-8B、K&K logic puzzle、linear / concave / cosine reward 消融,并明确 λ=+\lambda=+\infty 对应 DisCO、ALP 的 β=0\beta=0 对应 vanilla GRPO。camera-ready 正文可以核对这些新增内容。

作者还在论坛回应中报告 difficulty-adaptive λ=1p(q)\lambda=1-p(q) 的 1.5B 结果:Pass@1 0.640、length 2370、AES 0.183,略高于固定 λ\lambda 的最佳 AES 0.178;并称补充了 Pass@16,还说明 process reward 可以替换长度 reward。当前 OpenReview camera-ready PDF 与 arXiv v2 均没有 Pass@16 和 dynamic-λ\lambda 内容,process reward 也只有目标替换建议,没有训练实验。因此,这三项保留为 rebuttal-only evidence,不并入正文主结论。

Meta-review 与可信度影响

Meta-review 判断新增 8B、logic puzzle、reward-shape ablation、GRPO 对照澄清和引用修订已经处理主要关切,并推测两位初始低分 reviewer 若参与最终讨论可能转为正面;这属于 AC 的判断,不能改写成 reviewer 实际升分。最终 Poster 决定、camera-ready、公开代码与 checkpoint 提高了可复查性;缺少多 seed、显著性、真实延迟和困难任务 coverage 统计仍限制因果强度。

主要启发

  • 多目标 reward 的危险点常出现在“组合后再归一化”。一级语义的符号和二级偏好可以分层处理:先保证正确/错误方向,再在正确集合内部排序效率。
  • 指数倾斜只重排当前 policy 已覆盖的正样本。positive discovery 与 positive ranking 是两个独立问题;前者仍依赖 base model、rollout width、curriculum 和 verifier。
  • group 内正样本数量决定辅助 reward 的有效分辨率。报告 DRPO 类方法时应同时给 all-correct、all-wrong、single-positive、multi-positive group 比例。
  • token length 是可复现且便宜的成本 proxy。部署判断还需要 decode latency、energy、batching、正确推理步骤比例与截断失败率。
  • “正样本系数为正”是 objective-level invariant。它提供清晰的语义保护,同时保留共享参数耦合和 KL regularization 带来的实际梯度复杂性。

局限

  1. 首要贡献依赖 binary correctness partition;开放式生成、部分正确、过程 reward 与多维 preference 只获得形式层面的扩展说明。
  2. 官方代码过滤全对和全错 group,single-positive group 又没有正样本内长度排序;论文没有报告各类 group 占比、过滤率或随训练变化的 coverage。
  3. “负 advantage 是主要 accuracy degradation 来源”主要由构造示例、reward table 和最终 performance curve 支持,缺少真实训练中 sign-flip frequency、受影响 token 质量和因果干预统计。
  4. 模型规模止于 8B,任务以数学为主,非数学证据只有 1.5B K&K logic puzzle;coding、science、commonsense、tool use 与 30B 以上模型未验证。
  5. 训练结果没有独立 seeds、误差线、置信区间或显著性检验;每题 16 次 evaluation sampling 只能降低评测采样噪声,不能替代训练重复。
  6. 每种方法选择 best-Pass@1 checkpoint,多个 penalty 超参数又同时形成 frontier,存在 checkpoint 与 hyperparameter selection bias。
  7. RLOO-LP、ALP、HAPO 的对照较强;L1-MAX、ShorterBetter、LASER-D 使用外部模型或不同 decoding 设置,训练数据也有个别差异。
  8. 平均 token 数不能识别逻辑冗余、推理正确性、batch latency、首 token 延迟、吞吐、能耗和硬件利用率;论文没有端到端效率测量。
  9. AES 对 accuracy loss 使用人为设置的 10 倍惩罚,并为每种方法使用各自 reference;其绝对值和跨论文可比性有限,完整 Pareto curve 更可靠。
  10. 论文声称无需额外开销,官方实现仍包含 distributed all-gather、group sorting、权重与 KL 计算;没有 wall-clock、GPU-hour 或通信 ablation。
  11. rebuttal 声称加入的 Pass@16 与 dynamic-λ\lambda 结果没有进入当前 camera-ready;这些证据只能从论坛评论复查。

跨论文关系

  • 与 DisCO(arXiv:2505.12366)的关系最直接:Gang Li、Ming Lin、Tianbao Yang 三位作者重叠;DRPO 保留 DisCO 的正负判别 score、hard-negative log-sum-exp 和 KL constraint,把长度 reward 变成正样本分布的指数权重。DRPO 的 novelty 应理解为 DisCO 上的多 reward 扩展和 efficient-reasoning 实证。
  • DeepSeek-R1:R1 展示 GRPO 与长 CoT emergence,也留下 overthinking 与 token cost;DRPO 针对 correctness—length composite reward 的 group normalization 重新设计 policy objective。
  • DAPO:DAPO 用 overlong reward shaping、dynamic sampling 和 token-level normalization稳定长 CoT RL;DRPO 指出把长度 penalty 直接送入 group advantage 可能翻转正确 response 的符号,并用正样本内重加权替代该路径。
  • MiniMax-M1 / CISPO:CISPO 调整 importance-weight clipping 以保持 token gradient,DRPO 调整 correctness 与 length 的 reward aggregation 以保持正样本 sequence coefficient;两者分别处理 policy-ratio clipping 与 composite-reward sign 两类稳定性问题。
  • MaxRL:两者都从 binary outcome 重写 RLVR objective。MaxRL 最大化成功 rollout likelihood并面向 pass@k coverage;DRPO 使用正负判别目标,并在已成功 rollout 内部按长度偏好重新分配权重。
  • RLVR Reasoning Boundary:该笔记把 positive trajectory discovery 视为 RLVR 的首要边界;DRPO 的经验目标进一步要求 mixed group,且多个正样本才能产生长度排序,因此它改善的是可采样成功区域内的效率选择,无法把近零成功概率的问题变成可学习问题。