2505.24864-prorl-prolonged-rl-reasoning-boundaries

ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models

这篇论文是对 “RLVR 只提升 base model 已有解的采样效率” 观点的直接反驳:作者提出 ProRL,用高温 rollout、DAPO 式 decoupled clipping/dynamic sampling、KL regularization、周期性 reference policy 与 optimizer reset,以及 136K 多任务 verifiable reward 数据,把 DeepSeek-R1-Distill-Qwen-1.5B 训练成 Nemotron-Research-Reasoning-Qwen-1.5B;结果显示,math 这类 base 已经很强的任务会出现 pass@128 收缩或收益有限,但 code、logic puzzle、OOD boxnet、graph_color 难度外推等 base 较弱任务会出现 pass@1 与 pass@k 的持续提升,因此 RL 是否扩展 reasoning boundary 取决于起点能力、任务分布、训练时长和稳定化 recipe。

Authors Mingjie Liu, Shizhe Diao, Ximing Lu, Jian Hu, Xin Dong, Yejin Choi, Jan Kautz, Yi Dong

已审阅 Archived 2026-03-10 10:40 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

阅读目标与判断边界

本笔记关注:

  1. ProRL 的训练 recipe 如何解决 prolonged RL 中的 entropy collapse 和训练停滞。
  2. 作者如何用 pass@128、pass@1 distribution、OOD tasks 和 creativity index 论证 reasoning boundary 扩展。
  3. 这篇论文如何回应 2504.138372506.10947 对 RLVR gain 来源的质疑。
  4. 哪些结论证据强,哪些结论受模型规模、训练成本、任务选择和实现细节限制。

判断边界:

  • 本文的最强证据集中在 DeepSeek-R1-Distill-Qwen-1.5B 到 NVIDIA Nemotron-Research-Reasoning-Qwen-1.5B 的单一 base/model family;更大模型上的 scaling 仍未验证。
  • ProRL 是一套包含数据、算法、KL、reference reset、reward shaping、rollout count 和 context window 调整的复合 recipe,不能把收益归因给单一组件。
  • pass@k 证据最有价值的部分是跨任务分解:math/code/STEM/logic/OOD 的趋势不同。平均分提升不能单独证明 boundary expansion。
  • 论文使用 benchmark 子集、Reasoning Gym synthetic tasks 和规则 verifier;数据污染、任务格式学习、verifier coverage 和评测 backend 稳定性仍需后续复验。

论文脉络

1. 问题背景

近期 RLVR 争议集中在一个核心问题:RL 训练到底能不能让 LLM 获得 base model 多次采样也无法得到的新解法?2504.13837 用 pass@kk 说明许多 RLVR 模型在小 kk 上提升明显,但高 kk 反而被 base model 追上,提示 RL 主要做概率重排。2506.10947 进一步说明,在 Qwen-Math 上 random / format / incorrect reward 也能提升分数,说明部分 RLVR gain 可以来自 model prior 与 objective bias。

ProRL 论文承认这些观察在数学等 base 已经很熟的任务上成立,但认为结论受到两个限制:任务域过窄、训练过早停止。作者的假设是:如果 RL 训练足够长,且任务分布覆盖 base model 较弱的新型 reasoning domain,RL 就有机会探索并稳定占据新的 solution space。

2. ProRL 的训练框架

ProRL 以 GRPO 为核心。GRPO 用同组样本 reward 估计 advantage,避免 PPO 中的 value model。论文写出的目标形式是:

LGRPO(θ)=Eτπθ[min(rθ(τ)A(τ),clip(rθ(τ),1ϵ,1+ϵ)A(τ))], \mathcal{L}_{\mathrm{GRPO}}(\theta) = \mathbb{E}_{\tau \sim \pi_\theta} \left[ \min\left( r_\theta(\tau) A(\tau), \mathrm{clip}(r_\theta(\tau), 1-\epsilon, 1+\epsilon) A(\tau) \right) \right],

其中:

rθ(τ)=πθ(τ)πold(τ). r_\theta(\tau)=\frac{\pi_\theta(\tau)}{\pi_{\mathrm{old}}(\tau)}.

GRPO 的 group-relative advantage 为:

A(τ)=Rτmean({Ri}iG(τ))std({Ri}iG(τ)). A(\tau) = \frac{R_\tau-\mathrm{mean}(\{R_i\}_{i\in G(\tau)})} {\mathrm{std}(\{R_i\}_{i\in G(\tau)})}.

ProRL 的关键问题是 prolonged training 中的 entropy collapse:模型过早把输出分布集中到少数模式,导致组内样本缺少多样性,advantage 估计和探索都变差。作者采用几类稳定化措施:

  1. 高 rollout temperature:使用 temperature 1.2 提高早期探索。
  2. DAPO decoupled clipping:设置 ϵlow=0.2\epsilon_{\mathrm{low}}=0.2ϵhigh=0.4\epsilon_{\mathrm{high}}=0.4,让 upper clip 更宽,鼓励提升原本低概率 token。
  3. Dynamic sampling:过滤组内全对或全错 prompt,让训练集中在有学习信号的中间难度样本。
  4. KL regularization:加入当前 policy 和 reference policy 之间的 KL penalty。
  5. Reference policy reset:当 KL 项主导、验证集停滞或退化时,把 reference policy hard-reset 到近期 online policy,并重置 optimizer state。

KL 目标写作:

LKL-RL(θ)=LGRPO(θ)βDKL(πθπref). L_{\mathrm{KL\text{-}RL}}(\theta) = L_{\mathrm{GRPO}}(\theta) -\beta D_{\mathrm{KL}}(\pi_\theta \Vert \pi_{\mathrm{ref}}).

这个设计和 DAPO 的 “remove KL” 方向不同。作者认为,他们从 DeepSeek-R1-Distill-Qwen-1.5B 这种已经具备 coherent CoT 的 checkpoint 出发,保留 KL 有助于稳定训练和维持 entropy;reference reset 则避免 KL 长期压制 policy update。

3. 数据和训练设置

训练数据共 136K 条,覆盖五类 verifiable tasks:

Domain Reward Type Quantity Source
Math Binary 40K DeepScaleR Dataset
Code Continuous 24K Eurus-2-RL Dataset
STEM Binary 25K SCP-116K filtering
Logical Puzzles Continuous 37K Reasoning Gym
Instruction Following Continuous 10K Llama-Nemotron synthetic IFEval-style data

训练使用 verl,rollout 每个 prompt 采样 n=16n=16 responses,batch size 256,mini-batch size 64,AdamW,constant learning rate 2×1062\times 10^{-6}。训练资源为 4 个 8x NVIDIA H100-80GB nodes,约 16K GPU hours。大部分训练将 response length 限制在 8K,最后约 200 steps 扩展到 16K context window。

Appendix 训练 recipe 显示这是一个多阶段流程:

  1. Run 1:四类任务训练,暂不含 instruction following,8K response length。
  2. Run 2:reference policy hard reset 后继续训练,维持 8K。
  3. Run 3:加入 instruction following 数据,随后发现 response length 突然升高和 <eos> 终止问题。
  4. Run 4-5:加入 reward shaping,惩罚未正确终止的 response。
  5. Run 6-7:rollout count 从 16 增加到 32,并进行两次 hard reset。
  6. Run 8:context window 扩展到 16K,rollout count 降回 16。

4. 主模型结果

作者发布的模型是 Nemotron-Research-Reasoning-Qwen-1.5B。相对 DeepSeek-R1-Distill-Qwen-1.5B,它在多个领域提升:

  • Math 平均:44.45 \rightarrow 60.14,提升 15.7 点。
  • Code 平均:23.08 \rightarrow 37.49,提升 14.4 点。
  • GPQA Diamond:15.86 \rightarrow 41.78,提升 25.9 点。
  • IFEval:44.05 \rightarrow 66.02,提升 22.0 点。
  • Reasoning Gym:4.24 \rightarrow 59.06,提升 54.8 点。
  • OOD tasks:acre 5.99 \rightarrow 58.57;boxnet 0.00 \rightarrow 7.91;game_of_life_halting 3.49 \rightarrow 52.29。

和领域专用 1.5B 模型比较,Nemotron-Research-Reasoning-Qwen-1.5B 在 math 平均超过 DeepScaleR-1.5B 约 4.6 点,在 code 平均超过 DeepCoder-1.5B 约 6.5 点。和 DeepSeek-R1-Distill-Qwen-7B 比较,它在部分领域达到接近甚至超过 7B 的结果,但 math/code 平均仍低于 7B reference。

5. pass@k 分析:Diminish、Plateau、Sustained 三种 regime

论文最关键的分析是将推理边界拆成任务级趋势,避免只看平均 pass@1。作者用每题 256 samples 重新评估,并报告 pass@128 作为 reasoning boundary 指标。结论是 ProRL 的效果分成三类:

  • Diminish:math、LiveCodeBench、letter_counting 等任务中,pass@1 提升,但 pass@128 持平或下降。解释是 base model 已经覆盖大量可解路径,RL 把分布集中到高概率成功路径,牺牲了 diversity。
  • Plateau:GPQA、maze、palindrome 等任务中,pass@1 和 pass@128 都有提升,但主要发生在早期 checkpoint,prolonged training 追加收益有限。
  • Sustained:CodeContests、TACO、dice 等任务中,intermediate checkpoint 到 final checkpoint 仍有持续 pass@k 提升。作者将其解释为 prolonged RL 在复杂任务上持续扩展 reasoning boundary。

这个三分法很重要:论文承认 2504.13837 的观察在 base 已经较强、pretraining overlap 较高或任务较熟悉的区域成立。

6. Base 越弱,ProRL gain 越大

作者用 base model 的 pass@128 和 RL 后的 pass@128 gain 做相关分析,发现显著负相关:base pass@128 越高,RL 后 reasoning breadth gain 越小,甚至可能为负;base pass@128 越低,ProRL 越可能扩大边界。

他们还计算 creativity index,用 DOLMA 作为开放预训练语料参照。低 gain 的 math/code 任务往往 creativity index 较低,意味着 response 与预训练语料重叠更高。这个结果支持作者的解释:熟悉任务中 RL 更像 sharpening;不熟悉任务中 prolonged RL 更可能学到可迁移的抽象策略。

7. OOD 与难度外推

论文用 Reasoning Gym 的 OOD tasks 做边界扩展证据:

  • boxnet:训练中未出现。base model 在作者评测里没有解题能力,ProRL 模型获得明显解题能力,且 final checkpoint 相对 intermediate checkpoint 在所有 kk 上继续提升。
  • graph_color difficulty:训练只包含 10 nodes,测试扩展到更大 graph sizes。随着节点数增加,所有模型表现下降,但 ProRL 模型在 pass@1 和 pass@128 上都保持更高准确率。

作者据此主张,ProRL 不只是把训练分布内 prompt 做得更熟,还能在结构新颖或难度提升的任务上迁移。

8. pass@1 distribution shift

作者引用 Dang et al. 对 pass@kk 的上界分析:

Ex,yD[pass@k]1((1Ex,yD[ρx])2+Var(ρx))k/2, \mathbb{E}_{x,y\sim D}[\mathrm{pass@}k] \le 1- \left( \left(1-\mathbb{E}_{x,y\sim D}[\rho_x]\right)^2 + \mathrm{Var}(\rho_x) \right)^{k/2},

其中 ρx\rho_x 是 task xx 的 pass@1 accuracy。直觉是:提高平均 pass@1 会抬高 pass@kk 上界,提高方差会压低上界。

ProRL 的结果显示,Codeforces 和 family_relationships 等任务的 pass@1 distribution 发生明显右移。family_relationships 从大量零准确率 prompt 转向大量满分 prompt,作者认为这说明模型发现了之前没有稳定掌握的解题策略。

关键实验/定理

结果 1:ProRL 训练出强 1.5B generalist reasoning model

  • 设置:DeepSeek-R1-Distill-Qwen-1.5B 作为起点,使用 136K 多任务 verifiable reward 数据,verl + GRPO/DAPO-style recipe,约 16K GPU hours。
  • 指标:math/code/STEM/IFEval/Reasoning Gym pass@1 或 continuous reward。
  • 结果:Nemotron-Research-Reasoning-Qwen-1.5B 相对 base 在 math +15.7、code +14.4、GPQA +25.9、IFEval +22.0、Reasoning Gym +54.8。
  • 解读:Prolonged RL + 多任务数据可以显著提升小模型的 generalist reasoning 表现。

结果 2:pass@128 gain 与 base pass@128 负相关

  • 设置:每题增加到 256 samples,比较 base、intermediate checkpoint 和 final ProRL 模型。
  • 指标:pass@128 与 RL 后 pass@128 gain。
  • 结果:base pass@128 高的任务通常 gain 小或为负;base pass@128 低的任务 gain 更大。
  • 解读:RL 是否扩展 reasoning boundary 取决于 base model 是否已经覆盖该任务的解空间。熟悉任务偏 sharpening,不熟悉或半熟任务偏 expansion。

结果 3:三类 pass@k regime

  • 设置:按 pass@k 曲线形态对任务分类。
  • 指标:base/intermediate/final 的 pass@kk 曲线。
  • 结果:Diminish 类任务 pass@1 提升但 pass@128 下降;Plateau 类任务早期提升后停滞;Sustained 类任务在 prolonged training 后继续提升。
  • 解读:单一 “RLVR 是否扩展边界” 问题需要按任务和 base competence 拆解。

结果 4:OOD boxnet 和 graph_color 难度外推

  • 设置:boxnet 作为训练外 Reasoning Gym task;graph_color 训练为 10 nodes,测试更大 node count。
  • 指标:pass@1、pass@128、pass@kk
  • 结果:base 在 boxnet 上没有解题能力,ProRL 获得明显能力;graph_color 难度增加时 ProRL 仍明显优于 base 和 intermediate。
  • 解读:这是论文最接近 “new reasoning boundary” 的证据,但仍需注意 Reasoning Gym 的 synthetic task 与 verifier 格式因素。

结果 5:KL + reference reset 支撑 prolonged training

  • 设置:ProRL 在多阶段训练中监控 validation、entropy、KL、response length,并在停滞或退化时 hard-reset reference policy 与 optimizer。
  • 指标:validation pass@1/pass@16、entropy、KL、response length。
  • 结果:作者报告 KL loss、DAPO components 和 reset 共同避免 entropy collapse,并让 validation performance 随训练 compute 继续提升。
  • 解读:这篇论文的训练收益来自持续可训练性,而持续可训练性依赖一套工程化干预;这也是复现实验的主要难点。

证据链强度评估

强证据

  • 作者明确和 2504.13837 对齐使用 pass@kk / pass@128 语言,并按任务展示 Diminish、Plateau、Sustained 三种现象,避免只用平均 pass@1 支撑主张。
  • 模型跨 math、code、STEM、instruction following、Reasoning Gym、OOD tasks 均有结果,覆盖范围比只看数学更宽。
  • 训练 recipe 和资源设置较具体:数据规模、reward type、rollout 数、温度、clip、batch、学习率、H100 资源、阶段式 reset 都有记录。
  • 作者承认 math 等任务上存在 boundary narrowing,与前人观察相容,增强了结论的分层可信度。

中等强度证据

  • OOD boxnet、graph_color 难度外推和 family_relationships distribution shift 支持 boundary expansion,但这些任务来自 synthetic Reasoning Gym,格式学习和 verifier 结构仍可能贡献较大。
  • creativity index 提供预训练 overlap 线索,但它是 response 与 DOLMA 的重叠 proxy,不能完整证明训练前知识状态。
  • ProRL 相比领域专用 1.5B 模型有优势,但同时改变了任务混合、训练时长、KL/reset 和 reward shaping,组件贡献需要 ablation 才能拆开。

需要谨慎的推论

  • “RL 可以扩展 reasoning boundary” 在本文中应理解为:在特定 1.5B Qwen distill 起点、多任务 verifiable data、prolonged training 和稳定化 recipe 下,部分任务的 pass@k boundary 扩展。它仍需更多模型家族、规模和任务分布验证。
  • 论文没有完整排除数据污染、format correction、benchmark-specific verifier learning 或 reward shaping artifact。
  • 训练过程依赖 validation 监控、hard reset 和 staged interventions;它更接近工程 recipe,自动稳定性仍需额外证明。
  • 1.5B 上的收益不能自然外推到 7B、32B 或 frontier reasoning model。更大模型 base competence 更强,可能把更多任务推入 Diminish/Plateau regime。

OpenReview / 审稿意见吸收

  • Venue status: 当前档案未记录公开 peer-review 状态。
  • Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
  • Ratings / confidence: 无公开评分可用于校准。
  • Reviewer consensus: 暂无。
  • Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
  • Author response: 暂无公开 rebuttal 记录。
  • 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。

本地讨论补充

1. 讨论收敛点

  • 这篇论文应和 2504.138372506.10947 三篇一起读。2504.13837 提供 boundary narrowing 证据,2506.10947 提供 prior amplification / spurious reward 解释,ProRL 则提供 “在 base 较弱任务 + 长训练 + 多任务 recipe 下可以扩展 boundary” 的反向条件。
  • 这篇论文的重要性不在于简单宣布 RLVR 能扩展能力,而在于把条件说得更具体:base competence 低、任务有可验证 feedback、训练有足够长的探索窗口、entropy collapse 被控制、reference policy 能周期性更新。
  • ProRL 的结果提示,RLVR 的讨论不应停留在 “RL 有用/无用”。更科学的表述是:RLVR 在熟悉任务上倾向于 sharpening,在未充分掌握但有可验证反馈的任务上可能 expansion,在完全缺少必要知识或 verifier coverage 不足的任务上可能失败。

2. 修正后的理解

  • 2504.13837 的 pass@k 结论和 ProRL 并不直接冲突。两者研究的是不同训练时长、任务分布和 base competence 区间。
  • 2506.10947 提醒 random reward 也能放大 Qwen-Math prior;ProRL 的反驳需要依赖 OOD / low-base-pass@128 tasks。若只看 math 平均分,ProRL 仍会受到 prior amplification 解释的挑战。
  • 本地讨论进一步指出,ProRL 没有充分区分 reasoning capability gain 与 answer-format normalization。Reasoning Gym 和 instruction-following 任务尤其敏感,因为 base model 可能用 \boxed{} 等熟悉格式作答,而 verifier 要求 <answer></answer> 或特定输出结构。论文自己也提到 base 在 Reasoning Gym 上存在格式跟随问题,并在后续 run 中加入 termination reward shaping,因此这部分提升需要拆成 valid-format rate、format-correct conditional accuracy 和 semantic solving accuracy 三项。
  • prolonged RL 的实质可能是给 policy 足够多次“发现、强化、稳定”新行为的机会;KL/reference reset 的作用是让探索不因 entropy collapse 或 KL 约束停滞。

3. 后续复验指标

  • 对每个任务同时报告 base pass@1、base pass@128、RL pass@1、RL pass@128、pass@1 distribution 和 response entropy。
  • 对所有格式敏感任务报告 valid-format rate、在 valid-format 样本上的 conditional accuracy、格式无关解析后的 accuracy,以及只训练格式规范化的 SFT / RL baseline。
  • 用 random / format / incorrect reward baseline 复验 ProRL,尤其是 Reasoning Gym 和 OOD tasks,排除纯 prior amplification。
  • 对 KL、reference reset、DAPO clip-higher、dynamic sampling、rollout count、reward shaping、context window 扩展做组件级 ablation。
  • 在更大模型和非 Qwen family 上复验,观察任务从 Sustained 向 Plateau/Diminish 转移的边界。

主要启发

  • RLVR gain 需要按照任务的 base competence 分层解释。base 已经很强时,RL 更像压缩采样和 sharpening;base 较弱但仍能获得 verifier feedback 时,long-horizon RL 更可能扩展可解区域。
  • Prolonged RL 的关键是维持可探索分布并延长有效训练窗口:entropy、KL、reference reset、dynamic sampling 和 rollout diversity 都是训练信号的一部分。
  • pass@k 不应只作为结论工具,也应成为 curriculum design 工具。低 base pass@128 且有非零学习信号的任务,可能是 RL 最有价值的训练区域。
  • 多任务 verifiable reward 可能比单一数学任务更适合研究 boundary expansion,因为它能暴露不同 regime,减少数学 benchmark 高 pretraining overlap 对结论的主导。
  • 对小模型来说,ProRL 展示了一条实用路线:用长时间 RL 和任务混合,把 1.5B 模型推到接近 7B reasoning distill model 的部分能力区间。

局限

  1. 模型规模只验证到 1.5B,且起点是 DeepSeek-R1-Distill-Qwen-1.5B;更大模型或不同 family 是否同样受益仍不清楚。
  2. 训练成本约 16K GPU hours,并依赖多阶段人工干预、reference reset 和 reward shaping,复现门槛高。
  3. ProRL 是复合 recipe,论文没有充分拆分每个组件对 final gain 的独立贡献。
  4. OOD、Reasoning Gym 和 instruction-following 任务具有 synthetic 和格式化特征,部分提升可能来自格式遵循、终止行为修正、verifier 对齐或任务模板学习;论文没有把 valid-format rate 与格式正确条件下的真实解题率拆开报告。
  5. 论文没有系统加入 spurious reward baseline,因此和 2506.10947 的 prior amplification 解释仍需进一步对照。
  6. 训练数据混合与评测任务之间可能存在结构相似性,creativity index 只能部分反映预训练 overlap。

跨论文关系

  • 2504.13837:两者是 RLVR boundary 争议的直接对照。2504.13837 指出当前 binary RLVR 常提升 sampling efficiency 但收缩高 kk coverage;ProRL 认为该结论在训练较短、任务较熟、base 已经较强时成立,而 prolonged RL 在低 base pass@128 的任务上可以扩展 boundary。
  • 2506.109472506.10947 强调 random/spurious reward 也能放大 Qwen-Math prior;ProRL 需要用 OOD、low-base-competence、pass@128 gain 和 distribution shift 来证明自己超出 prior amplification。后续最关键复验是给 ProRL 加 random/format/incorrect reward baseline。
  • 2503.14476 DAPO:ProRL 直接采用 DAPO 的 decoupled clipping、Clip-Higher 和 dynamic sampling,并基于 verl 训练;区别是 ProRL 重新引入 KL regularization 和 reference reset,服务 prolonged training。
  • 2501.12948 DeepSeek-R1:ProRL 从 DeepSeek-R1-Distill-Qwen-1.5B 出发,延续 GRPO/verifiable reward 系谱;它更关注训练时长、任务混合和 pass@k boundary。
  • 2409.19256 HybridFlow/VERL:ProRL 使用 verl,是大规模 RLHF/RLVR 系统框架在 reasoning prolonged training 上的应用案例。
  • 2605.14220 和 Thinking Machines inference determinism:ProRL 的 pass@k、long rollout、vLLM evaluation 和 multi-stage RL 对 sampler/trainer consistency 更敏感;实现级 mismatch 可能影响 boundary 判断。
  • 2606.00135 tool-calling RL:两者都说明 RL 训练收益取决于有效 prompt group、rollout 多样性、zero-variance filtering 和 policy update 成本。ProRL 的 dynamic sampling 是同一问题在 reasoning tasks 上的版本。
  • 2605.30290 STV:两者都服务 self-improvement / verifier feedback 生态。ProRL 强调 RL policy 训练,STV 强调 verifier feedback 与 test-time refinement;二者可以结合成 verifier-guided prolonged RL。

Reference Intake Brief

Target

  • Intended target system: 新增论文笔记 / RLVR boundary 与 prolonged RL 专题。
  • Existing related assets: content/utility/papers-index.md2504.13837-rlvr-reasoning-boundary-base-model.md2506.10947-spurious-rewards-rethinking-rlvr.md2503.14476-dapo-long-cot-rl-system.md2501.12948-deepseek-r1-rl-reasoning.md
  • Proposed form: 新建独立 Markdown 文档,更新索引行,并维护对应论文的关系章节。

Reusable Elements

  1. 三 regime 诊断:Diminish / Plateau / Sustained。
  2. Prolonged RL 稳定化 recipe:KL regularization、reference policy reset、DAPO clip-higher、dynamic sampling、高温 rollout、reward shaping。
  3. Boundary expansion 复验 checklist:base pass@128、RL pass@128 gain、OOD tasks、difficulty extrapolation、pass@1 distribution shift、creativity index。
  4. RLVR 条件化结论:熟悉任务 sharpening,低 base competence 任务 expansion,缺少 verifier 或必要知识任务 failure。

Risks

  • Copyright/over-copying: 笔记使用概括、重述和少量公式表达,避免长段复制论文原文。
  • Unsourced or unverifiable claims: 作者、版本、主题、提交日期来自 arXiv API 和 TeX source;source 草稿中的 16k steps 表述未写成正式结论。
  • Tone/brand mismatch: 中文说明保持技术档案风格,突出证据链和边界条件。
  • Safety/compliance issues: 论文涉及更强 reasoning model 训练,但笔记只沉淀机制、评测和复验指标,没有包含滥用流程。
  • Overlap with existing assets: 与 2504.138372506.10947 强重叠,本笔记的新增价值是 prolonged RL 条件、multi-task recipe 和 boundary expansion 的反向证据。

Skipped

Material Reason
所有 pass@k appendix 图逐项复写 图数量多,长期价值集中在三 regime 和代表性任务。
Hugging Face 模型实测 用户请求是论文分析,未要求运行模型或复现 benchmark。
完整 Reasoning Gym prompt 示例 保留任务含义即可,避免笔记被示例文本淹没。

Recommendation

Decision: merge

Why: 这篇论文是本地 RLVR boundary 主题的关键反向证据,能把已有 “sampling efficiency / prior amplification” 判断推进为条件化框架:任务熟悉度、base competence、训练时长和稳定化 recipe 共同决定 RLVR gain 来源。