2510.04474-drpo-decoupled-reward-policy-optimization
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
DRPO 在 DisCO 的正负判别框架内,只用正确 rollout 之间的长度奖励重加权正样本,同时维持所有正确样本的正向系数;在每题采样八条、最长八千 token 的 1.5B、7B 和 8B 蒸馏推理模型实验中,它取得优于作者复现基线的长度—准确率前沿,7B 模型平均生成长度减少百分之五十一时性能相对下降百分之二点六,结论依赖可验证的二元正确性、同题同时出现正负样本以及以 token 数衡量效率。
Source
- Workflow version: v2.1
- Material type: research-paper
- Analysis modules: experiment, theory
- Canonical source: https://openreview.net/forum?id=GP5RHZnEsw
- Title: DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
- Authors: Gang Li, Yan Chen, Ming Lin, Tianbao Yang
- Responsible organization: Texas A&M University;The University of Virginia
- arXiv: https://arxiv.org/abs/2510.04474
- PDF: https://openreview.net/pdf?id=GP5RHZnEsw
- HTML: https://arxiv.org/html/2510.04474v2
- TeX Source: https://arxiv.org/e-print/2510.04474v2
- Code/Project: https://github.com/Optimization-AI/DRPO (读取 commit
d76eec8b609d45a45ab2bc087aff98ebbc753695,2026-03-30) - Model checkpoints: https://huggingface.co/collections/ganglii/drpo
- OpenReview / Review page: https://openreview.net/forum?id=GP5RHZnEsw
- Submitted: 2025-09-19(OpenReview);2025-10-06(arXiv v1)
- Published / updated: ICLR 2026 Poster;OpenReview camera-ready revision 最后修改于 2026-04-11;arXiv v2 更新于 2026-03-01
- Current version read: OpenReview camera-ready PDF;arXiv v2 HTML / TeX source;官方代码 commit
d76eec8 - Version / revision read: arXiv:2510.04474v2;OpenReview Camera_Ready_Revision
- Accessed: 2026-07-21
- Key figure decision: include
- Review status: page-type=official-review; match-confidence=high; observed-at=2026-07-21; venue-status=ICLR 2026 Poster
- License: CC BY 4.0
- Subjects: Artificial Intelligence(cs.AI);Machine Learning(cs.LG)
作者与关系
- Gang Li: Texas A&M University;共同一作。
- Yan Chen: The University of Virginia;共同一作。
- Ming Lin: Oracle Cloud Infrastructure。
- Tianbao Yang: Texas A&M University。
Gang Li 与 Tianbao Yang 组成 Texas A&M University 一侧的合作主线;Tianbao Yang 是该校计算机科学与工程教授及 OptMAI Lab 主任。Yan Chen 以共同一作身份连接 The University of Virginia。Ming Lin 在论文期任职 Oracle Cloud Infrastructure Generative AI Service,为学术团队与产业研究提供跨机构桥接。
Gang Li、Ming Lin 与 Tianbao Yang 也是 DisCO 的作者。DRPO 直接沿用 DisCO 的正负样本判别目标和 KL 约束,再加入只作用于正样本分布的长度偏好;这组三位作者重叠构成本文最强的连续产出关系。当前档案没有发现四位作者与其它已收录论文直接重叠。
论文脉络
1. 研究问题、背景和价值
长推理模型通过生成分支、反思、验证和回溯提高复杂问题的成功率,也会在简单问题上产生大量重复 token。较长输出直接增加 decode 计算、响应时间和 rollout 训练成本,因此很多工作把正确性 reward 与长度惩罚相加,再交给 GRPO、RLOO 或 REINFORCE-style advantage estimator。
这类组合存在一个符号问题。正确但较长的 response 会获得较低的组合 reward;当 GRPO 再用包含错误 response 的全组均值做中心化时,这个 reward 可能低于组均值,使正确 response 获得负 advantage。训练信号随后同时表达“比其它正确答案更长”和“应当降低生成概率”,长度偏好改变了正确性信号的方向。
DRPO 研究的问题是:如何让模型在正确答案之间偏好更短的推理,同时保持“正确轨迹应被强化、错误轨迹应被抑制”的符号语义。
2. 已有解决方案与剩余缺口
已有高效推理方法大致分为三类:
- 在 prompt 或 decoding 阶段设置长度预算、提前退出或压缩规则,部署直接,但训练策略仍可能偏好冗长路径。
- 用短轨迹做 SFT、rejection sampling 或 preference learning,能显式提供简洁示范,但依赖离线候选质量和数据制作。
- 在 RL reward 中加入 length penalty。RLOO-LP、ALP、HAPO、L1-MAX、ShorterBetter 与 LASER-D 分别使用正确样本长度统计、题目难度、历史最短解或目标长度。
第三类可以沿用 outcome verifier 和在线 rollout,组合 reward 与 group-relative normalization 的顺序却会让辅助偏好改写正确性符号。调整 penalty 系数只能移动触发位置,无法从结构上保证正确样本继续得到正向系数。
DisCO 提供了另一种基底:把正确和错误 response 分成两类,提高正确样本的序列 score,并通过 log-sum-exp 集中压低困难错误样本。它原本只接受二元正确性,未控制正确样本内部的长度差异。DRPO 的关键增量是把长度优化放进 DisCO 的正样本分布。
3. 作者可能的思考路径
以下为本地分析:
- 先把正确性视为不可被辅助 reward 翻转的一级语义:正确样本的系数保持为正,错误样本进入独立负项。
- 再把长度视为正样本内部的二级排序:短且正确获得较大系数,长且正确获得较小系数。
- 理想训练分布应从当前 policy 已能采到的正确输出出发,向高长度 reward 的输出倾斜,同时用 KL 防止分布移动过远。
- KL 正则化 reward maximization 有指数倾斜的闭式解,因此无需额外训练 reward policy,也无需离线构造短答案数据。
- 把闭式分布代回 DisCO 后,可以用当前 on-policy 正样本做 importance weighting,得到可直接实现的 group objective。
4. 核心假设或切入点
DRPO 依赖以下条件:
- correctness verifier 能把每条 response 可靠地分成正样本和负样本。
- 当前 rollout policy 已经能采到正确答案;指数重加权只能在已有正样本 support 内重新分配质量。
- 同一 prompt 的 group 中同时存在正负样本,DisCO 的两个判别项才都有经验估计。
- 组内存在至少两个长度不同的正确样本时,长度 reward 才能形成正样本内部的相对偏好;单个正确样本的归一化权重恒为 1。
- token 数与实际推理成本、延迟具有足够相关性;它没有直接衡量逻辑质量、冗余类型、硬件延迟或能耗。
- 长度 reward 的方向正确。过强的短输出偏好仍会损害需要较长搜索的问题,正系数约束只能避免符号翻转,无法保证推理充分性。
5. 方法与理论框架
5.1 GRPO 中组合 reward 的符号翻转
对同一问题
论文 Figure 1 构造三条正确、三条错误 response。纯正确性 reward 为

作者在 rebuttal 中进一步澄清:该诊断用于解释 GRPO-based length penalty 为何会造成 accuracy degradation。vanilla GRPO 即使没有长度 reward 也可能产生 overthinking,因此符号翻转不能解释冗长推理的全部来源。
5.2 DisCO 提供正负样本分离的基底
DisCO 把一条 response 的 score 定义为平均 token log-likelihood:
记旧 policy 在正确、错误 response 上的条件分布分别为
同时约束:
第一项提高正确 response 的 score;第二项通过 log-sum-exp 给高 score 错误 response 更强的抑制信号;KL 约束限制单次 policy shift。DisCO 对所有正确 response 使用相同权重,因此仍未表达“短且正确优于长且正确”。
5.3 用 KL 正则化得到长度倾斜的正样本分布
论文使用线性长度 reward:
其中
Appendix A.1 用 Gibbs inequality 推出闭式解:
它是对旧 policy 正样本分布的 exponential tilt(指数倾斜):更短的正确 response 获得更大概率质量,support 仍受
把
错误 response 继续由独立的负样本 log-sum-exp 处理,其长度不参与 reward。作者在 rebuttal 中解释,这是有意保留的探索边界:失败轨迹首先需要找到正确解,限制其长度可能进一步降低 positive discovery。
5.4 从理论分布到官方实现
实际训练对每题采样 8 条 response,按二元 reward 划分
官方代码在 verl/verl/trainer/ppo/core_algos.py -> compute_policy_loss_drpo 中先跨 worker all_gather score、group id、reward 与长度,再按 prompt 分组。实现使用 response mask 长度除以最大 response length 作为
weight = exp((1 - length_ratio) / Lambda)
positive term = weighted average of positive sequence scores
negative term = log-sum-exp gradient over negative sequence scores
代码明确构造:
valid_group = has_at_least_one_positive AND has_at_least_one_negative
全对或全错 group 的判别项被过滤;训练脚本又设置 algorithm.filter_groups.enable=False,因此这些 group 仍可能进入 batch,只对整体 KL constraint 产生作用。有效 group 的 loss 最后除以原始问题数,过滤比例也会改变判别梯度尺度。论文 Algorithm 1 没有展开这项边界。
当某组只有一个正样本时,
论文所说的“只依赖 on-policy data、没有额外开销”应理解为无需额外 reward model、离线短答案数据或第二次 rollout。官方实现仍需要 group partition、跨 worker gather、排序、指数权重与 KL 计算,论文没有报告 wall-clock 或通信开销。
证据定位:Sections 4.1–4.2;Equations 3–7;Appendix A.1;Algorithm 1;官方代码 commit d76eec8 的 verl/verl/trainer/ppo/core_algos.py:337-433 与 scripts/train/run_drpo_1.5b_8k.sh。
5.5 “正确样本保持正向信号”的精确含义
DRPO 保证主判别目标中每个正样本 score 前的显式权重为正,并让长正确 response 获得较小正权重。这个结论针对 sequence-level objective coefficient。共享参数、负样本项、KL penalty 和不同 token 的梯度耦合仍可能使某些 token 概率下降,因此它不构成“每个正确 response 的所有 token likelihood 都单调上升”的参数级保证。
这一区分也限定了理论贡献。闭式解准确描述了理想正样本分布如何相对旧 policy 倾斜;有限的 8-sample group 只提供该分布的经验近似,尤其在正样本稀少的困难问题上方差更高。
6. 结论链条
- 正确性与长度 reward 在全组内共同中心化时,正确长 response 可以获得负 advantage;Figure 1 与 Appendix Table 3 证明多种 reward design 都存在这种可能。
- DisCO 已经把正确和错误 response 分成正负判别项,为保持正确性符号提供结构基础。
- KL 正则化长度 reward maximization 对正确样本分布产生指数倾斜闭式解;代回 DisCO 后,只需对 on-policy 正样本做长度权重归一化。
- 1.5B、7B、8B 三种 base model 的长度—准确率曲线均优于主要训练内 baseline,支持该目标在 tested setting 下改善 trade-off。
- GSM8K 与 K&K logic puzzle 说明短推理收益可以扩展到简单数学和一种非数学逻辑任务;AIME 上的负 AES 与代码中的 mixed-group requirement 同时显示,困难任务和低 solve-rate group 是更窄的成立边界。
关键实验结果
结果 1:三种模型规模上的长度—准确率前沿
- 设置:DeepSeek-R1-Distill-Qwen-1.5B、Qwen-7B 与 Llama-8B;DeepScaleR-Preview 约 40.3K 训练题;每题 8 条 rollout;batch size 128;最大生成 8K;训练 1000 steps,每 200 steps 评估。
- 指标:四个数学数据集平均 Pass@1 与平均生成 token 数;Pass@1 对每题采样 16 次后平均。
- Baseline:RLOO-LP、ALP、HAPO 由作者在相近设置下训练;L1-MAX、ShorterBetter、LASER-D 使用原工作公开模型。
- 假设:二元 verifier 对最终答案的判定可靠,当前 policy 能在每题八条采样中产生同时包含正确与错误输出的 group。
- 适用域:1.5B–8B 蒸馏推理模型、8K 最大生成长度、以可验证答案为主的数学与合成逻辑任务。
- 结果:7B 的 DisCO reference 从平均长度 3053 降到 DRPO 的 1502,作者报告性能相对下降 2.6%;RLOO-LP 从 2975 降到 1841 时性能下降 7.1%。Table 1 的最佳 AES 上,DRPO 在 1.5B、7B、8B 分别为 0.178、0.249、0.297;8B RLOO-LP 也得到正 AES 0.251,其余列出的 baseline 最佳值为负。
- 对照是否可比:RLOO-LP、ALP、HAPO 的训练预算和超参数 sweep 较可比;三个外部 checkpoint 的训练、数据与 decoding 配置没有完全对齐。每种方法报告 best-Pass@1 checkpoint,可能偏向保留 accuracy 的时间点。
- 证据定位:Section 5.2;Figure 3;Table 1;Appendix A.2 / A.6。
- 支持的最窄结论:在三种 1.5B–8B distilled reasoning base model、8K budget 和作者实现的数学 RL 设置中,DRPO 达到更靠左上方的经验 trade-off frontier。

assets/comp.png at commit d76eec8.结果 2:简单题可以大幅缩短,困难题更敏感
- 设置:把 GSM8K、MATH-500、OlympiadBench、AIME 按难度分别画 trade-off;比较不同
与 baseline。 - 指标:各数据集 Pass@1、平均长度与 AES(Accuracy Efficiency Score,准确率—效率分数)。AES 对长度减少给正分,对 accuracy loss 使用 10 倍惩罚。
- 结果:GSM8K 上,1.5B 从 1563 降到 356 tokens,长度减少 77.2%,性能相对下降 1.1%;7B 从 969 降到 261,长度减少 73.1%,性能相对下降 0.6%。随着任务变难,各方法通常需要更长输出;DRPO 在 AIME 上也出现负 AES,例如 1.5B、
为 -0.729。 - 对照是否可比:同模型内的
sweep 可比;跨数据集题量、答案格式和 base accuracy 不同,AES 又依赖人为设置的权重,适合辅助观察,不能替代完整 Pareto curve。 - 证据定位:Section 5.3;Figure 4;Appendix Tables 4–6。
- 支持的最窄结论:DRPO 的强长度压缩主要建立在简单到中等、能稳定采到多个正样本的问题上;高难题仍存在明显 accuracy—length tension。
结果 3:非数学逻辑任务与 reward shape 消融
- 设置:K&K logic puzzle 使用 1.5B 模型,训练集为 3–7 人 puzzle,测试集为 2–8 人 puzzle,训练 400 steps、每 80 steps 评估;另在数学任务比较 linear、concave、cosine 三种长度 reward。
- 指标:logic puzzle accuracy 与平均 token 数;数学任务 Pass@1—长度曲线。
- 结果:K&K 上从 2095 降到 1400 tokens,长度减少 33.2%,accuracy 从 0.972 变为 0.974。三种 reward shape 均形成可用 trade-off;linear 覆盖的长度范围最宽,concave 与 cosine 通常保留更高 accuracy、输出也更长。
- 对照是否可比:K&K 对主要训练内 baseline 使用相同 1.5B setting,仍只有一个合成逻辑任务和单次训练曲线;reward-shape ablation 同模型同 sweep 较可比。
- 证据定位:Appendix A.4–A.5;Figures 5–6。
- 支持的最窄结论:正样本内重加权不局限于线性长度 reward,并在一种非数学 logic puzzle 分布上保留 trade-off 优势;跨 coding、science、commonsense 与开放式任务仍未验证。
结果 4:公开实现揭示 mixed-group 边界
- 设置:官方 VERL fork,commit
d76eec8;compute_policy_loss_drpo读取 binary sequence reward、uid、response mask 与 old/current logprob。 - 指标:代码路径与 loss 构造;论文没有单独报告过滤率。
- 结果:实现过滤全对和全错 group;单个正样本的长度权重归一化为 1;训练脚本关闭预先的 group filtering,并在 8 A100-80GB、每题 8 rollout 的设置运行 1.5B recipe。
- 对照是否可比:这是实现事实,没有对应的 ablation;无法从主表分离 dropped-group fraction 对性能的贡献。
- 证据定位:官方实现
compute_policy_loss_drpo;1.5B 训练脚本;commit: d76eec8。 - 支持的最窄结论:官方实现需要同题同时出现正负样本;长度偏好还需要多个正样本,论文的“正负解耦”在有限 group 中具有明确的 coverage 条件。
OpenReview / 审稿意见吸收
- Page type: official-review
- Authenticated forum intake: 12 条可读 Note,包括投稿、4 份 Official Review、5 条作者 Official Comment、1 份 Meta Review 与 1 份 Decision。
- Decision: Accept (Poster),ICLR 2026。
- Reviewer consensus: 评审普遍认可 composite reward 的符号冲突值得处理,也认可正样本内长度重加权带来的经验前沿改善。
- Main criticisms: 主要质疑集中在相对 DisCO 的增量、符号翻转对 overthinking 的解释范围、模型与任务外推、token 数效率口径、对照与消融完整性。
- Author response: 作者补充 8B、K&K logic puzzle、reward-shape 消融和 GRPO 对照澄清;论坛另报告动态温度与 Pass@16,但后两项没有进入当前 camera-ready。
- 对可信度的影响: 新增实验和公开实现提高可复查性;缺少多次训练、显著性、真实延迟与困难任务 coverage 统计,使结论仍应限制在已测设置。
初始正式评分如下,OpenReview 没有显示 rebuttal 后更新分数:
| Reviewer | Rating | Confidence | 主要判断 |
|---|---|---|---|
| 1 | 6 | 3 | 方法设计与结果较强;贡献高度依赖 DisCO,写作和引用需要改善。 |
| 2 | 8 | 4 | 认可问题诊断、闭式目标和实验;要求非数学任务与 Pass@k。 |
| 3 | 4 | 5 | 质疑符号翻转能否解释 overthinking、缺少显式 vanilla GRPO、token 数效率口径过窄。 |
| 4 | 4 | 4 | 要求更大模型、不同模型家族、非数学任务、reward shape 与 DisCO 对照。 |
Reviewer consensus
评审普遍认可两个点:正确长 response 得到负 advantage 是值得关注的 composite-reward failure mode;在正样本内做长度重加权的目标简洁,并取得明显的长度—准确率改善。主要争议集中在贡献相对 DisCO 的增量、根因陈述范围、模型与任务外推、token count 指标、vanilla GRPO 命名和消融完整性。
Author response
作者在 revision 中加入 DeepSeek-R1-Distill-Llama-8B、K&K logic puzzle、linear / concave / cosine reward 消融,并明确
作者还在论坛回应中报告 difficulty-adaptive
Meta-review 与可信度影响
Meta-review 判断新增 8B、logic puzzle、reward-shape ablation、GRPO 对照澄清和引用修订已经处理主要关切,并推测两位初始低分 reviewer 若参与最终讨论可能转为正面;这属于 AC 的判断,不能改写成 reviewer 实际升分。最终 Poster 决定、camera-ready、公开代码与 checkpoint 提高了可复查性;缺少多 seed、显著性、真实延迟和困难任务 coverage 统计仍限制因果强度。
主要启发
- 多目标 reward 的危险点常出现在“组合后再归一化”。一级语义的符号和二级偏好可以分层处理:先保证正确/错误方向,再在正确集合内部排序效率。
- 指数倾斜只重排当前 policy 已覆盖的正样本。positive discovery 与 positive ranking 是两个独立问题;前者仍依赖 base model、rollout width、curriculum 和 verifier。
- group 内正样本数量决定辅助 reward 的有效分辨率。报告 DRPO 类方法时应同时给 all-correct、all-wrong、single-positive、multi-positive group 比例。
- token length 是可复现且便宜的成本 proxy。部署判断还需要 decode latency、energy、batching、正确推理步骤比例与截断失败率。
- “正样本系数为正”是 objective-level invariant。它提供清晰的语义保护,同时保留共享参数耦合和 KL regularization 带来的实际梯度复杂性。
局限
- 首要贡献依赖 binary correctness partition;开放式生成、部分正确、过程 reward 与多维 preference 只获得形式层面的扩展说明。
- 官方代码过滤全对和全错 group,single-positive group 又没有正样本内长度排序;论文没有报告各类 group 占比、过滤率或随训练变化的 coverage。
- “负 advantage 是主要 accuracy degradation 来源”主要由构造示例、reward table 和最终 performance curve 支持,缺少真实训练中 sign-flip frequency、受影响 token 质量和因果干预统计。
- 模型规模止于 8B,任务以数学为主,非数学证据只有 1.5B K&K logic puzzle;coding、science、commonsense、tool use 与 30B 以上模型未验证。
- 训练结果没有独立 seeds、误差线、置信区间或显著性检验;每题 16 次 evaluation sampling 只能降低评测采样噪声,不能替代训练重复。
- 每种方法选择 best-Pass@1 checkpoint,多个 penalty 超参数又同时形成 frontier,存在 checkpoint 与 hyperparameter selection bias。
- RLOO-LP、ALP、HAPO 的对照较强;L1-MAX、ShorterBetter、LASER-D 使用外部模型或不同 decoding 设置,训练数据也有个别差异。
- 平均 token 数不能识别逻辑冗余、推理正确性、batch latency、首 token 延迟、吞吐、能耗和硬件利用率;论文没有端到端效率测量。
- AES 对 accuracy loss 使用人为设置的 10 倍惩罚,并为每种方法使用各自 reference;其绝对值和跨论文可比性有限,完整 Pareto curve 更可靠。
- 论文声称无需额外开销,官方实现仍包含 distributed all-gather、group sorting、权重与 KL 计算;没有 wall-clock、GPU-hour 或通信 ablation。
- rebuttal 声称加入的 Pass@16 与 dynamic-
结果没有进入当前 camera-ready;这些证据只能从论坛评论复查。
跨论文关系
- 与 DisCO(arXiv:2505.12366)的关系最直接:Gang Li、Ming Lin、Tianbao Yang 三位作者重叠;DRPO 保留 DisCO 的正负判别 score、hard-negative log-sum-exp 和 KL constraint,把长度 reward 变成正样本分布的指数权重。DRPO 的 novelty 应理解为 DisCO 上的多 reward 扩展和 efficient-reasoning 实证。
- 与 DeepSeek-R1:R1 展示 GRPO 与长 CoT emergence,也留下 overthinking 与 token cost;DRPO 针对 correctness—length composite reward 的 group normalization 重新设计 policy objective。
- 与 DAPO:DAPO 用 overlong reward shaping、dynamic sampling 和 token-level normalization稳定长 CoT RL;DRPO 指出把长度 penalty 直接送入 group advantage 可能翻转正确 response 的符号,并用正样本内重加权替代该路径。
- 与 MiniMax-M1 / CISPO:CISPO 调整 importance-weight clipping 以保持 token gradient,DRPO 调整 correctness 与 length 的 reward aggregation 以保持正样本 sequence coefficient;两者分别处理 policy-ratio clipping 与 composite-reward sign 两类稳定性问题。
- 与 MaxRL:两者都从 binary outcome 重写 RLVR objective。MaxRL 最大化成功 rollout likelihood并面向 pass@k coverage;DRPO 使用正负判别目标,并在已成功 rollout 内部按长度偏好重新分配权重。
- 与 RLVR Reasoning Boundary:该笔记把 positive trajectory discovery 视为 RLVR 的首要边界;DRPO 的经验目标进一步要求 mixed group,且多个正样本才能产生长度排序,因此它改善的是可采样成功区域内的效率选择,无法把近零成功概率的问题变成可学习问题。