2505.24864-prorl-prolonged-rl-reasoning-boundaries
ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
这篇论文是对 “RLVR 只提升 base model 已有解的采样效率” 观点的直接反驳:作者提出 ProRL,用高温 rollout、DAPO 式 decoupled clipping/dynamic sampling、KL regularization、周期性 reference policy 与 optimizer reset,以及 136K 多任务 verifiable reward 数据,把 DeepSeek-R1-Distill-Qwen-1.5B 训练成 Nemotron-Research-Reasoning-Qwen-1.5B;结果显示,math 这类 base 已经很强的任务会出现 pass@128 收缩或收益有限,但 code、logic puzzle、OOD boxnet、graph_color 难度外推等 base 较弱任务会出现 pass@1 与 pass@k 的持续提升,因此 RL 是否扩展 reasoning boundary 取决于起点能力、任务分布、训练时长和稳定化 recipe。
Source
- Title: ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
- arXiv: https://arxiv.org/abs/2505.24864
- HTML v1: https://arxiv.org/html/2505.24864v1
- PDF v1: https://arxiv.org/pdf/2505.24864v1
- TeX Source v1: https://arxiv.org/e-print/2505.24864v1
- Model: https://huggingface.co/nvidia/Nemotron-Research-Reasoning-Qwen-1.5B
- Authors: Mingjie Liu, Shizhe Diao, Ximing Lu, Jian Hu, Xin Dong, Yejin Choi, Jan Kautz, Yi Dong
- Submitted: 2025-05-30
- Current version read: v1, submitted 2025-05-30
- Subjects: Computation and Language (cs.CL); Artificial Intelligence (cs.AI)
- arXiv comment: 26 pages, 17 figures
作者与关系
- Mingjie Liu: NVIDIA.
- Shizhe Diao: NVIDIA.
- Ximing Lu: NVIDIA.
- Jian Hu: NVIDIA.
- Xin Dong: NVIDIA.
- Yejin Choi: NVIDIA.
- Jan Kautz: NVIDIA.
- Yi Dong: NVIDIA.
阅读目标与判断边界
本笔记关注:
- ProRL 的训练 recipe 如何解决 prolonged RL 中的 entropy collapse 和训练停滞。
- 作者如何用 pass@128、pass@1 distribution、OOD tasks 和 creativity index 论证 reasoning boundary 扩展。
- 这篇论文如何回应 2504.13837 与 2506.10947 对 RLVR gain 来源的质疑。
- 哪些结论证据强,哪些结论受模型规模、训练成本、任务选择和实现细节限制。
判断边界:
- 本文的最强证据集中在 DeepSeek-R1-Distill-Qwen-1.5B 到 NVIDIA Nemotron-Research-Reasoning-Qwen-1.5B 的单一 base/model family;更大模型上的 scaling 仍未验证。
- ProRL 是一套包含数据、算法、KL、reference reset、reward shaping、rollout count 和 context window 调整的复合 recipe,不能把收益归因给单一组件。
- pass@k 证据最有价值的部分是跨任务分解:math/code/STEM/logic/OOD 的趋势不同。平均分提升不能单独证明 boundary expansion。
- 论文使用 benchmark 子集、Reasoning Gym synthetic tasks 和规则 verifier;数据污染、任务格式学习、verifier coverage 和评测 backend 稳定性仍需后续复验。
论文脉络
1. 问题背景
近期 RLVR 争议集中在一个核心问题:RL 训练到底能不能让 LLM 获得 base model 多次采样也无法得到的新解法?2504.13837 用 pass@
ProRL 论文承认这些观察在数学等 base 已经很熟的任务上成立,但认为结论受到两个限制:任务域过窄、训练过早停止。作者的假设是:如果 RL 训练足够长,且任务分布覆盖 base model 较弱的新型 reasoning domain,RL 就有机会探索并稳定占据新的 solution space。
2. ProRL 的训练框架
ProRL 以 GRPO 为核心。GRPO 用同组样本 reward 估计 advantage,避免 PPO 中的 value model。论文写出的目标形式是:
其中:
GRPO 的 group-relative advantage 为:
ProRL 的关键问题是 prolonged training 中的 entropy collapse:模型过早把输出分布集中到少数模式,导致组内样本缺少多样性,advantage 估计和探索都变差。作者采用几类稳定化措施:
- 高 rollout temperature:使用 temperature 1.2 提高早期探索。
- DAPO decoupled clipping:设置
、 ,让 upper clip 更宽,鼓励提升原本低概率 token。 - Dynamic sampling:过滤组内全对或全错 prompt,让训练集中在有学习信号的中间难度样本。
- KL regularization:加入当前 policy 和 reference policy 之间的 KL penalty。
- Reference policy reset:当 KL 项主导、验证集停滞或退化时,把 reference policy hard-reset 到近期 online policy,并重置 optimizer state。
KL 目标写作:
这个设计和 DAPO 的 “remove KL” 方向不同。作者认为,他们从 DeepSeek-R1-Distill-Qwen-1.5B 这种已经具备 coherent CoT 的 checkpoint 出发,保留 KL 有助于稳定训练和维持 entropy;reference reset 则避免 KL 长期压制 policy update。
3. 数据和训练设置
训练数据共 136K 条,覆盖五类 verifiable tasks:
| Domain | Reward Type | Quantity | Source |
|---|---|---|---|
| Math | Binary | 40K | DeepScaleR Dataset |
| Code | Continuous | 24K | Eurus-2-RL Dataset |
| STEM | Binary | 25K | SCP-116K filtering |
| Logical Puzzles | Continuous | 37K | Reasoning Gym |
| Instruction Following | Continuous | 10K | Llama-Nemotron synthetic IFEval-style data |
训练使用 verl,rollout 每个 prompt 采样
Appendix 训练 recipe 显示这是一个多阶段流程:
- Run 1:四类任务训练,暂不含 instruction following,8K response length。
- Run 2:reference policy hard reset 后继续训练,维持 8K。
- Run 3:加入 instruction following 数据,随后发现 response length 突然升高和
<eos>终止问题。 - Run 4-5:加入 reward shaping,惩罚未正确终止的 response。
- Run 6-7:rollout count 从 16 增加到 32,并进行两次 hard reset。
- Run 8:context window 扩展到 16K,rollout count 降回 16。
4. 主模型结果
作者发布的模型是 Nemotron-Research-Reasoning-Qwen-1.5B。相对 DeepSeek-R1-Distill-Qwen-1.5B,它在多个领域提升:
- Math 平均:44.45
60.14,提升 15.7 点。 - Code 平均:23.08
37.49,提升 14.4 点。 - GPQA Diamond:15.86
41.78,提升 25.9 点。 - IFEval:44.05
66.02,提升 22.0 点。 - Reasoning Gym:4.24
59.06,提升 54.8 点。 - OOD tasks:acre 5.99
58.57;boxnet 0.00 7.91;game_of_life_halting 3.49 52.29。
和领域专用 1.5B 模型比较,Nemotron-Research-Reasoning-Qwen-1.5B 在 math 平均超过 DeepScaleR-1.5B 约 4.6 点,在 code 平均超过 DeepCoder-1.5B 约 6.5 点。和 DeepSeek-R1-Distill-Qwen-7B 比较,它在部分领域达到接近甚至超过 7B 的结果,但 math/code 平均仍低于 7B reference。
5. pass@k 分析:Diminish、Plateau、Sustained 三种 regime
论文最关键的分析是将推理边界拆成任务级趋势,避免只看平均 pass@1。作者用每题 256 samples 重新评估,并报告 pass@128 作为 reasoning boundary 指标。结论是 ProRL 的效果分成三类:
- Diminish:math、LiveCodeBench、letter_counting 等任务中,pass@1 提升,但 pass@128 持平或下降。解释是 base model 已经覆盖大量可解路径,RL 把分布集中到高概率成功路径,牺牲了 diversity。
- Plateau:GPQA、maze、palindrome 等任务中,pass@1 和 pass@128 都有提升,但主要发生在早期 checkpoint,prolonged training 追加收益有限。
- Sustained:CodeContests、TACO、dice 等任务中,intermediate checkpoint 到 final checkpoint 仍有持续 pass@k 提升。作者将其解释为 prolonged RL 在复杂任务上持续扩展 reasoning boundary。
这个三分法很重要:论文承认 2504.13837 的观察在 base 已经较强、pretraining overlap 较高或任务较熟悉的区域成立。
6. Base 越弱,ProRL gain 越大
作者用 base model 的 pass@128 和 RL 后的 pass@128 gain 做相关分析,发现显著负相关:base pass@128 越高,RL 后 reasoning breadth gain 越小,甚至可能为负;base pass@128 越低,ProRL 越可能扩大边界。
他们还计算 creativity index,用 DOLMA 作为开放预训练语料参照。低 gain 的 math/code 任务往往 creativity index 较低,意味着 response 与预训练语料重叠更高。这个结果支持作者的解释:熟悉任务中 RL 更像 sharpening;不熟悉任务中 prolonged RL 更可能学到可迁移的抽象策略。
7. OOD 与难度外推
论文用 Reasoning Gym 的 OOD tasks 做边界扩展证据:
- boxnet:训练中未出现。base model 在作者评测里没有解题能力,ProRL 模型获得明显解题能力,且 final checkpoint 相对 intermediate checkpoint 在所有
上继续提升。 - graph_color difficulty:训练只包含 10 nodes,测试扩展到更大 graph sizes。随着节点数增加,所有模型表现下降,但 ProRL 模型在 pass@1 和 pass@128 上都保持更高准确率。
作者据此主张,ProRL 不只是把训练分布内 prompt 做得更熟,还能在结构新颖或难度提升的任务上迁移。
8. pass@1 distribution shift
作者引用 Dang et al. 对 pass@
其中
ProRL 的结果显示,Codeforces 和 family_relationships 等任务的 pass@1 distribution 发生明显右移。family_relationships 从大量零准确率 prompt 转向大量满分 prompt,作者认为这说明模型发现了之前没有稳定掌握的解题策略。
关键实验/定理
结果 1:ProRL 训练出强 1.5B generalist reasoning model
- 设置:DeepSeek-R1-Distill-Qwen-1.5B 作为起点,使用 136K 多任务 verifiable reward 数据,verl + GRPO/DAPO-style recipe,约 16K GPU hours。
- 指标:math/code/STEM/IFEval/Reasoning Gym pass@1 或 continuous reward。
- 结果:Nemotron-Research-Reasoning-Qwen-1.5B 相对 base 在 math +15.7、code +14.4、GPQA +25.9、IFEval +22.0、Reasoning Gym +54.8。
- 解读:Prolonged RL + 多任务数据可以显著提升小模型的 generalist reasoning 表现。
结果 2:pass@128 gain 与 base pass@128 负相关
- 设置:每题增加到 256 samples,比较 base、intermediate checkpoint 和 final ProRL 模型。
- 指标:pass@128 与 RL 后 pass@128 gain。
- 结果:base pass@128 高的任务通常 gain 小或为负;base pass@128 低的任务 gain 更大。
- 解读:RL 是否扩展 reasoning boundary 取决于 base model 是否已经覆盖该任务的解空间。熟悉任务偏 sharpening,不熟悉或半熟任务偏 expansion。
结果 3:三类 pass@k regime
- 设置:按 pass@k 曲线形态对任务分类。
- 指标:base/intermediate/final 的 pass@
曲线。 - 结果:Diminish 类任务 pass@1 提升但 pass@128 下降;Plateau 类任务早期提升后停滞;Sustained 类任务在 prolonged training 后继续提升。
- 解读:单一 “RLVR 是否扩展边界” 问题需要按任务和 base competence 拆解。
结果 4:OOD boxnet 和 graph_color 难度外推
- 设置:boxnet 作为训练外 Reasoning Gym task;graph_color 训练为 10 nodes,测试更大 node count。
- 指标:pass@1、pass@128、pass@
。 - 结果:base 在 boxnet 上没有解题能力,ProRL 获得明显能力;graph_color 难度增加时 ProRL 仍明显优于 base 和 intermediate。
- 解读:这是论文最接近 “new reasoning boundary” 的证据,但仍需注意 Reasoning Gym 的 synthetic task 与 verifier 格式因素。
结果 5:KL + reference reset 支撑 prolonged training
- 设置:ProRL 在多阶段训练中监控 validation、entropy、KL、response length,并在停滞或退化时 hard-reset reference policy 与 optimizer。
- 指标:validation pass@1/pass@16、entropy、KL、response length。
- 结果:作者报告 KL loss、DAPO components 和 reset 共同避免 entropy collapse,并让 validation performance 随训练 compute 继续提升。
- 解读:这篇论文的训练收益来自持续可训练性,而持续可训练性依赖一套工程化干预;这也是复现实验的主要难点。
证据链强度评估
强证据
- 作者明确和 2504.13837 对齐使用 pass@
/ pass@128 语言,并按任务展示 Diminish、Plateau、Sustained 三种现象,避免只用平均 pass@1 支撑主张。 - 模型跨 math、code、STEM、instruction following、Reasoning Gym、OOD tasks 均有结果,覆盖范围比只看数学更宽。
- 训练 recipe 和资源设置较具体:数据规模、reward type、rollout 数、温度、clip、batch、学习率、H100 资源、阶段式 reset 都有记录。
- 作者承认 math 等任务上存在 boundary narrowing,与前人观察相容,增强了结论的分层可信度。
中等强度证据
- OOD boxnet、graph_color 难度外推和 family_relationships distribution shift 支持 boundary expansion,但这些任务来自 synthetic Reasoning Gym,格式学习和 verifier 结构仍可能贡献较大。
- creativity index 提供预训练 overlap 线索,但它是 response 与 DOLMA 的重叠 proxy,不能完整证明训练前知识状态。
- ProRL 相比领域专用 1.5B 模型有优势,但同时改变了任务混合、训练时长、KL/reset 和 reward shaping,组件贡献需要 ablation 才能拆开。
需要谨慎的推论
- “RL 可以扩展 reasoning boundary” 在本文中应理解为:在特定 1.5B Qwen distill 起点、多任务 verifiable data、prolonged training 和稳定化 recipe 下,部分任务的 pass@k boundary 扩展。它仍需更多模型家族、规模和任务分布验证。
- 论文没有完整排除数据污染、format correction、benchmark-specific verifier learning 或 reward shaping artifact。
- 训练过程依赖 validation 监控、hard reset 和 staged interventions;它更接近工程 recipe,自动稳定性仍需额外证明。
- 1.5B 上的收益不能自然外推到 7B、32B 或 frontier reasoning model。更大模型 base competence 更强,可能把更多任务推入 Diminish/Plateau regime。
OpenReview / 审稿意见吸收
- Venue status: 当前档案未记录公开 peer-review 状态。
- Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
- Ratings / confidence: 无公开评分可用于校准。
- Reviewer consensus: 暂无。
- Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
- Author response: 暂无公开 rebuttal 记录。
- 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。
本地讨论补充
1. 讨论收敛点
- 这篇论文应和 2504.13837、2506.10947 三篇一起读。2504.13837 提供 boundary narrowing 证据,2506.10947 提供 prior amplification / spurious reward 解释,ProRL 则提供 “在 base 较弱任务 + 长训练 + 多任务 recipe 下可以扩展 boundary” 的反向条件。
- 这篇论文的重要性不在于简单宣布 RLVR 能扩展能力,而在于把条件说得更具体:base competence 低、任务有可验证 feedback、训练有足够长的探索窗口、entropy collapse 被控制、reference policy 能周期性更新。
- ProRL 的结果提示,RLVR 的讨论不应停留在 “RL 有用/无用”。更科学的表述是:RLVR 在熟悉任务上倾向于 sharpening,在未充分掌握但有可验证反馈的任务上可能 expansion,在完全缺少必要知识或 verifier coverage 不足的任务上可能失败。
2. 修正后的理解
- 2504.13837 的 pass@k 结论和 ProRL 并不直接冲突。两者研究的是不同训练时长、任务分布和 base competence 区间。
- 2506.10947 提醒 random reward 也能放大 Qwen-Math prior;ProRL 的反驳需要依赖 OOD / low-base-pass@128 tasks。若只看 math 平均分,ProRL 仍会受到 prior amplification 解释的挑战。
- 本地讨论进一步指出,ProRL 没有充分区分 reasoning capability gain 与 answer-format normalization。Reasoning Gym 和 instruction-following 任务尤其敏感,因为 base model 可能用
\boxed{}等熟悉格式作答,而 verifier 要求<answer></answer>或特定输出结构。论文自己也提到 base 在 Reasoning Gym 上存在格式跟随问题,并在后续 run 中加入 termination reward shaping,因此这部分提升需要拆成 valid-format rate、format-correct conditional accuracy 和 semantic solving accuracy 三项。 - prolonged RL 的实质可能是给 policy 足够多次“发现、强化、稳定”新行为的机会;KL/reference reset 的作用是让探索不因 entropy collapse 或 KL 约束停滞。
3. 后续复验指标
- 对每个任务同时报告 base pass@1、base pass@128、RL pass@1、RL pass@128、pass@1 distribution 和 response entropy。
- 对所有格式敏感任务报告 valid-format rate、在 valid-format 样本上的 conditional accuracy、格式无关解析后的 accuracy,以及只训练格式规范化的 SFT / RL baseline。
- 用 random / format / incorrect reward baseline 复验 ProRL,尤其是 Reasoning Gym 和 OOD tasks,排除纯 prior amplification。
- 对 KL、reference reset、DAPO clip-higher、dynamic sampling、rollout count、reward shaping、context window 扩展做组件级 ablation。
- 在更大模型和非 Qwen family 上复验,观察任务从 Sustained 向 Plateau/Diminish 转移的边界。
主要启发
- RLVR gain 需要按照任务的 base competence 分层解释。base 已经很强时,RL 更像压缩采样和 sharpening;base 较弱但仍能获得 verifier feedback 时,long-horizon RL 更可能扩展可解区域。
- Prolonged RL 的关键是维持可探索分布并延长有效训练窗口:entropy、KL、reference reset、dynamic sampling 和 rollout diversity 都是训练信号的一部分。
pass@k不应只作为结论工具,也应成为 curriculum design 工具。低 base pass@128 且有非零学习信号的任务,可能是 RL 最有价值的训练区域。- 多任务 verifiable reward 可能比单一数学任务更适合研究 boundary expansion,因为它能暴露不同 regime,减少数学 benchmark 高 pretraining overlap 对结论的主导。
- 对小模型来说,ProRL 展示了一条实用路线:用长时间 RL 和任务混合,把 1.5B 模型推到接近 7B reasoning distill model 的部分能力区间。
局限
- 模型规模只验证到 1.5B,且起点是 DeepSeek-R1-Distill-Qwen-1.5B;更大模型或不同 family 是否同样受益仍不清楚。
- 训练成本约 16K GPU hours,并依赖多阶段人工干预、reference reset 和 reward shaping,复现门槛高。
- ProRL 是复合 recipe,论文没有充分拆分每个组件对 final gain 的独立贡献。
- OOD、Reasoning Gym 和 instruction-following 任务具有 synthetic 和格式化特征,部分提升可能来自格式遵循、终止行为修正、verifier 对齐或任务模板学习;论文没有把 valid-format rate 与格式正确条件下的真实解题率拆开报告。
- 论文没有系统加入 spurious reward baseline,因此和 2506.10947 的 prior amplification 解释仍需进一步对照。
- 训练数据混合与评测任务之间可能存在结构相似性,creativity index 只能部分反映预训练 overlap。
跨论文关系
- 与 2504.13837:两者是 RLVR boundary 争议的直接对照。2504.13837 指出当前 binary RLVR 常提升 sampling efficiency 但收缩高
coverage;ProRL 认为该结论在训练较短、任务较熟、base 已经较强时成立,而 prolonged RL 在低 base pass@128 的任务上可以扩展 boundary。 - 与 2506.10947:2506.10947 强调 random/spurious reward 也能放大 Qwen-Math prior;ProRL 需要用 OOD、low-base-competence、pass@128 gain 和 distribution shift 来证明自己超出 prior amplification。后续最关键复验是给 ProRL 加 random/format/incorrect reward baseline。
- 与
2503.14476DAPO:ProRL 直接采用 DAPO 的 decoupled clipping、Clip-Higher 和 dynamic sampling,并基于 verl 训练;区别是 ProRL 重新引入 KL regularization 和 reference reset,服务 prolonged training。 - 与
2501.12948DeepSeek-R1:ProRL 从 DeepSeek-R1-Distill-Qwen-1.5B 出发,延续 GRPO/verifiable reward 系谱;它更关注训练时长、任务混合和 pass@k boundary。 - 与
2409.19256HybridFlow/VERL:ProRL 使用 verl,是大规模 RLHF/RLVR 系统框架在 reasoning prolonged training 上的应用案例。 - 与
2605.14220和 Thinking Machines inference determinism:ProRL 的 pass@k、long rollout、vLLM evaluation 和 multi-stage RL 对 sampler/trainer consistency 更敏感;实现级 mismatch 可能影响 boundary 判断。 - 与
2606.00135tool-calling RL:两者都说明 RL 训练收益取决于有效 prompt group、rollout 多样性、zero-variance filtering 和 policy update 成本。ProRL 的 dynamic sampling 是同一问题在 reasoning tasks 上的版本。 - 与
2605.30290STV:两者都服务 self-improvement / verifier feedback 生态。ProRL 强调 RL policy 训练,STV 强调 verifier feedback 与 test-time refinement;二者可以结合成 verifier-guided prolonged RL。
Reference Intake Brief
Target
- Intended target system: 新增论文笔记 / RLVR boundary 与 prolonged RL 专题。
- Existing related assets:
content/utility/papers-index.md;2504.13837-rlvr-reasoning-boundary-base-model.md;2506.10947-spurious-rewards-rethinking-rlvr.md;2503.14476-dapo-long-cot-rl-system.md;2501.12948-deepseek-r1-rl-reasoning.md。 - Proposed form: 新建独立 Markdown 文档,更新索引行,并维护对应论文的关系章节。
Reusable Elements
- 三 regime 诊断:Diminish / Plateau / Sustained。
- Prolonged RL 稳定化 recipe:KL regularization、reference policy reset、DAPO clip-higher、dynamic sampling、高温 rollout、reward shaping。
- Boundary expansion 复验 checklist:base pass@128、RL pass@128 gain、OOD tasks、difficulty extrapolation、pass@1 distribution shift、creativity index。
- RLVR 条件化结论:熟悉任务 sharpening,低 base competence 任务 expansion,缺少 verifier 或必要知识任务 failure。
Risks
- Copyright/over-copying: 笔记使用概括、重述和少量公式表达,避免长段复制论文原文。
- Unsourced or unverifiable claims: 作者、版本、主题、提交日期来自 arXiv API 和 TeX source;source 草稿中的 16k steps 表述未写成正式结论。
- Tone/brand mismatch: 中文说明保持技术档案风格,突出证据链和边界条件。
- Safety/compliance issues: 论文涉及更强 reasoning model 训练,但笔记只沉淀机制、评测和复验指标,没有包含滥用流程。
- Overlap with existing assets: 与 2504.13837 和 2506.10947 强重叠,本笔记的新增价值是 prolonged RL 条件、multi-task recipe 和 boundary expansion 的反向证据。
Skipped
| Material | Reason |
|---|---|
| 所有 pass@k appendix 图逐项复写 | 图数量多,长期价值集中在三 regime 和代表性任务。 |
| Hugging Face 模型实测 | 用户请求是论文分析,未要求运行模型或复现 benchmark。 |
| 完整 Reasoning Gym prompt 示例 | 保留任务含义即可,避免笔记被示例文本淹没。 |
Recommendation
Decision: merge
Why: 这篇论文是本地 RLVR boundary 主题的关键反向证据,能把已有 “sampling efficiency / prior amplification” 判断推进为条件化框架:任务熟悉度、base competence、训练时长和稳定化 recipe 共同决定 RLVR gain 来源。