2504.13837-rlvr-reasoning-boundary-base-model
Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
这篇论文把 RLVR 的收益拆成 sampling efficiency 和 reasoning capacity boundary:当前基于 binary verifiable reward 的 RLVR 常常把 base model 已经能低概率采样到的正确 reasoning paths 提升到更高概率,因此 pass@1 明显改善;但在较大采样预算下的 pass@k 覆盖上,base model 往往能解出更多题,说明现有 RLVR 主要是在 base distribution 内重分配概率质量,尚未稳定地产生超出 base model 的新 reasoning patterns。蒸馏与此不同,它能从更强 teacher 注入新轨迹,从而扩大 student 的 reasoning boundary。
Source
- Title: Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
- arXiv: https://arxiv.org/abs/2504.13837
- HTML v5: https://arxiv.org/html/2504.13837v5
- PDF v5: https://arxiv.org/pdf/2504.13837v5
- TeX Source v5: https://arxiv.org/e-print/2504.13837v5
- Project: https://limit-of-RLVR.github.io
- Code: https://github.com/LeapLabTHU/limit-of-RLVR
- Authors: Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao, Zhaokai Wang, Yang Yue, Shiji Song, Gao Huang
- Submitted: 2025-04-18
- Current version read: v5, last revised 2025-11-24
- Subjects: Artificial Intelligence (cs.AI); Computation and Language (cs.CL); Computer Vision and Pattern Recognition (cs.CV)
- DOI: https://doi.org/10.48550/arXiv.2504.13837
- Journal reference: NeurIPS 2025 Oral; ICML 2025 AI4MATH workshop best paper
作者与关系
- Yang Yue(乐洋): LeapLab, Tsinghua University.
- Zhiqi Chen: LeapLab, Tsinghua University.
- Rui Lu: LeapLab, Tsinghua University.
- Andrew Zhao: LeapLab, Tsinghua University.
- Zhaokai Wang: Shanghai Jiao Tong University.
- Yang Yue(乐阳): LeapLab, Tsinghua University.
- Shiji Song: LeapLab, Tsinghua University.
- Gao Huang: LeapLab, Tsinghua University.
阅读目标与判断边界
本笔记关注:
- 作者如何定义和测量 reasoning capacity boundary。
- RLVR 提升
pass@1与降低高k覆盖之间的机制关系。 - coverage、perplexity、entropy、训练步数、算法对比和 distillation 共同支持什么结论。
- 它和 DeepSeek-R1、DAPO、STV、tool-use RL、CoT monitoring 等本地已存档论文如何连接。
判断边界:
- 本文讨论的是当前公开可分析的 RLVR 设置,尤其是 binary verifiable outcome reward;作者也明确保留了更大 RL compute、更强 exploration、dense process reward 和 agentic interaction 的未来空间。
- pass@
在本文中用于测量“多次采样内是否至少能解出一次”,服务 capability boundary 分析;部署时仍需要 majority vote、best-of- 或 cost-aware evaluation 等实用选择策略。 - 数学题存在 lucky guess 风险;作者用 coding tasks、过滤 AIME24、人工检查 CoT 等方式降低这个问题,但这种人工验证无法覆盖全部样本。
- 论文对 near-frontier 模型只做了 Magistral-Medium 的 preliminary scaling experiment;更大模型、更大 RL compute 或 proprietary training pipeline 的结论仍需后续证据。
论文脉络
1. 问题背景
RLVR 已经成为 reasoning model 后训练的核心路线。它用可自动验证的 reward 代替人工标注:数学题看 final answer 是否正确,代码题看 unit tests 是否通过,多模态 reasoning 看可验证答案是否匹配。DeepSeek-R1、DAPO、Oat-Zero、SimpleRLZoo、Code-R1 等工作都说明,RLVR 能显著提高平均准确率和小采样预算下的表现。
通常的直觉是:RL 会像 Atari、Go 或 AlphaGo Zero 一样,通过探索发现新策略。作者质疑这个直觉在 LLM RLVR 中是否成立,因为 LLM 的动作空间是长 token 序列,组合空间极大;policy gradient 只能从当前 policy 采样到的轨迹里得到 reward。若 base model 完全采样不到某类正确路径,binary reward 很难给出有效学习信号。
2. Reasoning boundary 的测量
作者引入 pass@
作者使用低方差无偏估计:
其中
3. RLVR 形式化
论文采用标准 verifiable reward 视角:LLM policy
优化目标是:
PPO / GRPO / RLOO / ReMax / Reinforce++ / DAPO 等算法都属于 policy gradient 家族。对 binary RLVR 来说,它们主要提升已获 reward 样本的 log-likelihood,降低错误样本的 log-likelihood。因此,如果正确 reasoning path 已经存在于 base model 的采样分布中,RLVR 会把概率质量推向这些路径;如果路径完全不在当前采样支持内,训练很难得到可用梯度。
4. 核心发现
作者在数学、代码、视觉 reasoning 三个域做系统实验:
- 数学:LLaMA-3.1-8B、Qwen2.5-7B/14B/32B-Base、Qwen2.5-Math-7B;SimpleRLZoo、Oat-Zero、DAPO;benchmark 包括 GSM8K、MATH500、Minerva、Olympiad、AIME24、AMC23。
- 代码:Qwen2.5-7B-Instruct、DeepSeek-R1-Distill-Qwen-14B;Code-R1、DeepCoder;benchmark 包括 LiveCodeBench、HumanEval+、MBPP+。
- 视觉 reasoning:Qwen2.5-VL-7B;EasyR1;benchmark 包括过滤多选题后的 MathVista 和 MathVision。
共同现象是:RLVR model 在小
5. 为什么说路径已在 base distribution 里
作者用三类证据支持“RLVR 轨迹已在 base model 采样分布中”:
- Coverage set analysis:AIME24 与 MATH500 上,base-only solved 的问题显著多于 RL-only solved 的问题。
- Accuracy histogram:RLVR 后高 accuracy 问题增多,但 accuracy 为 0 的问题也增多,说明一部分原本可低概率解出的问题变成完全采样不到。
- Perplexity analysis:用 base model 评估 RLVR model 生成的 response,PPL 往往落在 base-generated response 的低 PPL 区间,且随着 RL 训练推进,
继续下降。
Perplexity 计算为:
这里 PPL 低表示模型
6. 蒸馏的对照
作者比较 DeepSeek-R1-Distill-Qwen-7B、Qwen2.5-Math-7B、Oat-Zero 和 Qwen2.5-Math-7B-Instruct。蒸馏模型的 pass@pass@k 应该整体抬升;在作者实验里,distillation 更符合这个特征,当前 RLVR 更像概率重排。
关键实验/定理
结果 1:数学 reasoning 中 RLVR 提高低 k,降低大 k 覆盖
- 设置:多组 Qwen2.5 / LLaMA base model 与 SimpleRLZoo / Oat-Zero / DAPO RLVR model,在 GSM8K、MATH500、Minerva、Olympiad、AIME24、AMC23 上比较 pass@
曲线。 - 指标:pass@
,重点观察 与 的差异。 - 结果:RLVR 在小
下表现更好;随着 增大,base model 常常追上并超过 RLVR model。Minerva 32B 示例中,base model 在 约高出 RLVR model 9 个百分点。 - 解读:RLVR 让正确路径更容易被采到,但没有稳定扩大可解问题集合。
结果 2:CoT 人工检查降低 lucky guess 解释
- 设置:对 GSM8K 和 AIME24 中平均准确率低于 5% 但有正确输出的困难题,人工检查导致正确答案的 CoT 是否合理。
- 指标:每个困难题是否至少存在一个正确 CoT。
- 结果:GSM8K 困难题中,base model 解出的 25 题里有 24 题至少包含一个正确 CoT;RLVR model 解出的 25 题里有 23 题至少包含一个正确 CoT。过滤后的 AIME24 中,base model 解出的困难题里 5/6 至少包含一个正确 CoT,RLVR model 为 4/6。
- 解读:大 pass@
中 base model 的收益主要来自低概率但有效的 reasoning path,而不只是 final answer 猜中。
结果 3:代码和视觉 reasoning 呈现相同趋势
- 设置:代码任务使用 Code-R1 / DeepCoder,在 LiveCodeBench、HumanEval+、MBPP+ 上评估;视觉任务使用 EasyR1 训练 Qwen2.5-VL-7B,在过滤多选题后的 MathVista 和 MathVision 上评估。
- 指标:pass@
曲线;代码任务通过 unit tests 作为 verifier;视觉任务检查 difficult CoT。 - 结果:代码和视觉 reasoning 与数学一致:RLVR 提升低采样预算下表现,base / starting model 在大
下保持更广覆盖。视觉 reasoning 的人工检查中,base 与 RL model 都有 7/8 个困难问题至少存在一个正确 CoT。 - 解读:该现象不只存在于 math final-answer verifier,也出现在更难靠随机猜测通过的 coding unit tests 和多模态 reasoning 中。
结果 4:Coverage set 近似包含关系
- 设置:比较 base model 和 SimpleRLZoo-Qwen2.5-7B 在 AIME24(
)与 MATH500( )上的 solvable set。 - 指标:四类问题比例:两者都能解、只有 base 能解、只有 RLVR 能解、两者都不能解。
- 结果:
| Benchmark | 两者都能解 | 只有 base 能解 | 只有 RLVR 能解 | 两者都不能解 |
|---|---|---|---|---|
| AIME24 | 63.3% | 13.3% | 0.0% | 23.3% |
| MATH500 | 92.4% | 3.6% | 1.0% | 3.0% |
- 解读:RLVR solved set 近似是 base solved set 的子集。MATH500 中少量 RL-only case 在采样 1024 次后也能被 base model 解出。
结果 5:六种 RLVR 算法差异小,sampling efficiency gap 仍大
- 设置:作者用 VeRL 重新实现 PPO、GRPO、Reinforce++、RLOO、ReMax、DAPO,在 Omni-MATH-Rule 训练集、in-domain test 和 MATH500 上比较。
- 指标:pass@1、pass@256 与 sampling efficiency gap:
其中作者用
- 结果:不同算法的 pass@1 有差异,DAPO 在部分数据上 pass@1 略高;但 pass@256 基本没有超出 base 上界。Omni-MATH-Test 上,GRPO 的 gap 约 43.9,RLOO 最好也约 41.0 到 42.6 量级,整体仍大。
- 解读:当前算法主要差在利用 base potential 的效率,还没有改变 reasoning boundary 的证据。
结果 6:训练越久,pass@1 上升,pass@256 下降
- 设置:GRPO 在 Omni-MATH-Rule 上训练 150、300、450 steps。
- 指标:pass@1 和 pass@256。
- 结果:Omni-MATH-Train 上 pass@1 从 base 9.9 提升到 step450 的 42.5;同一数据上的 pass@256 从 base 67.2 下降到 64.3。Omni-MATH-Test 上 pass@1 从 10.2 提升到 28.3,pass@256 从 69.1 下降到 63.9。
- 解读:训练继续推进会让平均表现更好,但可解问题覆盖收缩,更符合“概率质量集中到 reward path”的解释;扩展搜索边界的证据较弱。
结果 7:熵、KL 和 rollout number 解释一部分现象
- 设置:作者调节 RLVR model 的 generation temperature,使输出 entropy 接近 base model;同时 ablate KL penalty 与 rollout number
。 - 指标:pass@
曲线、entropy、pass@128。 - 结果:提高 RLVR model temperature 后,它自己的大
表现有所改善,但仍低于 base model。增大 rollout number 从 8 到 32 可以改善较大 的 pass@ ,但仍会被 base model 超过。加入 KL coefficient 0.001 后,pass@1 接近无 KL 版本,但 pass@128 更低。 - 解读:entropy collapse 是 coverage 收缩的一部分原因;训练探索预算、KL 约束和 reward sparsity 也会共同影响 boundary。
结果 8:Near-frontier scaling 初步支持同一趋势
- 设置:使用 Magistral-Medium-2506 API 与其 starting model Mistral-Medium-3-2505,在 AIME24 / AIME25 上评估。
- 指标:pass@
。 - 结果:RLVR-enhanced Magistral 在
上比 base 多解约 7 个 AIME24 问题和 8 个 AIME25 问题;随着 增大,性能差距逐渐缩小。 - 解读:在 near-frontier pure-RLVR model 上,当前观察仍成立;更大 RL compute 是否能改变结论仍是开放问题。
证据链强度评估
强证据
- 多任务覆盖较广:数学、代码、视觉 reasoning 都出现类似 pass@
现象。 - 多模型、多算法覆盖较广:Qwen2.5、LLaMA、Qwen2.5-VL、Code-R1、DeepCoder、DAPO、Oat-Zero、SimpleRLZoo、VeRL 中的六种 RL algorithms 都被纳入。
- Coverage set、accuracy histogram、perplexity evolution、training dynamics 互相支持同一个机制:RLVR 在 base prior 内强化 reward path。
- 代码任务通过 unit tests 评估,降低了数学 final answer lucky guess 对整体结论的影响。
中等强度证据
- CoT 人工检查支持 base model 存在有效 reasoning path,但样本量有限,且人工判断存在主观边界。
- Distillation 对照说明“扩展 boundary”的曲线应该是什么样,但只覆盖 DeepSeek-R1-Distill-Qwen-7B 等代表性案例。
- Magistral-Medium near-frontier 结果有价值,但样本、API、模型细节和 compute budget 都受限制。
- Sampling efficiency gap 是有用诊断指标,但把 base pass@256 当作上界只是近似,真实上界取决于可承受的
、temperature、prompt 和 verifier。
需要谨慎的推论
- 本文不等价于“RL 对 LLM reasoning 无用”。它说明当前 binary RLVR 主要提升采样效率,并指出扩展 boundary 需要新的 exploration / credit assignment / environment interaction。
- 大
pass@k是能力边界测量;base model 需要上百或上千次采样才能解出的题,在产品系统里仍可能不实用。 - 结论依赖当前公开 RLVR pipeline;如果未来引入 dense process reward、value-based credit assignment、curriculum、tool-use environment 或 large-scale agentic RL,结论边界可能改变。
- 训练数据、benchmark leakage、prompt template、temperature 和 verifier 质量都会影响 pass@
曲线,后续复现必须完整记录这些设置。
OpenReview / 审稿意见吸收
- Venue status: 当前档案未记录公开 peer-review 状态。
- Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
- Ratings / confidence: 无公开评分可用于校准。
- Reviewer consensus: 暂无。
- Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
- Author response: 暂无公开 rebuttal 记录。
- 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。
本地讨论补充
1. 讨论收敛点
- 初版归档把本文定位为本地档案中的 “RLVR reasoning boundary / sampling efficiency” 节点。它把 DeepSeek-R1 和 DAPO 中常说的 “RL 激发 reasoning” 拆成两个可测变量:低
k的采样效率和高k的可解问题覆盖。 - 该论文适合与
2503.14476DAPO 一起读。DAPO 解决 long-CoT RL recipe 如何稳定、开源、可复现;本文追问同类 RLVR recipe 到底是在扩展能力,还是在更高效地采样 base model 已有能力。 - 它也补充了
2606.00135tool-calling RL 的讨论:tool-use RL 里如果 harness / environment 能提供新信息和多轮反馈,可能有机会突破本文 binary single-turn RLVR 的探索瓶颈。
2. 修正后的理解
- 更精确的表述是:当前 RLVR 的主要效果是把 base model 的
pass@k潜力压缩到更小的采样预算;这还不能证明模型学会了 base distribution 中完全不存在的新 reasoning path。 - “base model 是上界”应理解为经验性近似:在作者的任务、采样预算和 verifier 设置下,RLVR solved set 大多被 base model 大采样覆盖。它不能当作所有 RLVR 方法都无法突破的理论上界。
- Distillation 的作用不同:它通过 teacher traces 改变 student prior,因而可以把原本不在 student base distribution 高概率区域的 reasoning pattern 写入模型。
- 本地讨论进一步收敛为:纯 binary verifiable reward 对“扩展解题边界”的能力有限,核心限制在 positive trajectory discovery。若 base model 对某题的正确 reasoning path 采样概率
处在可触达范围内,RLVR 可以用 rollout 找到正样本并提高其概率;若 在实际 rollout budget 下近似为 0,binary reward 很难提供有效梯度。期望至少采到一次正确路径的概率近似为 ,因此所需 rollout 规模约为 。SFT / distillation 的作用是把外部 teacher 或人工数据中的 reasoning trace 注入模型 prior,先把 从近乎不可达提高到可采样区间,再让 RLVR 做概率重排和稳定化。 - 因此,更准确的结论是:需要某种机制先改变或扩展 base prior。这个机制可以是高质量 SFT / distillation,也可以是 dense process reward、curriculum、value-based credit assignment、更强 exploration、tool-use / multi-turn environment feedback 或更强 base pretraining。当前论文的实验证据主要约束的是 outcome-only、single-turn、binary-verifier RLVR。
- 关于泛化能力,本地讨论进一步拆成三层:第一是发现难,模型必须先采样到完整正确轨迹才会得到正 reward;第二是归因难,长 CoT 最终错了只知道整条轨迹失败,最终对了也很难知道哪些步骤真正关键;第三是迁移难,RL 更容易强化已采到并得分的轨迹族,对未见题型、新抽象结构和当前分布外解法的帮助有限。因此最终对/错 reward 的主要效果是提高已有可采样能力的出现概率,对扩展泛化边界需要更密的中间信号或更强的 prior 改写机制。
3. 后续复验指标
- 同时报告
pass@1、pass@8/16、pass@128/256/1024,避免只看平均准确率。 - 记录 solvable set overlap:base-only、RL-only、both、neither。
- 对 RL-generated correct trajectories 计算 base PPL,并观察 PPL 随训练 step 的变化。
- 记录 entropy、response length、reward、format compliance 与 pass@
的联动。 - 区分 outcome-only binary reward、process reward、tool-feedback reward 和 multi-turn environment reward。
- 对每个 benchmark 报告 prompt template、temperature、top-
、max tokens、verifier、采样 seed 和去重策略。
主要启发
- 评估 reasoning RL 需要同时看平均性能和覆盖边界。
pass@1上升可以来自概率重排,不能单独证明模型产生新能力。 - RLVR 的核心瓶颈是 sparse binary reward 下的探索。若 correct path 采样概率为
到 ,RL 可以通过足够 rollout 找到并强化;若概率低到当前 compute 无法触达,policy gradient 很难获得有效信号。 - 对 long-CoT RL recipe,应把 sampling efficiency gap 作为诊断指标:算法是否真正接近 base model 的大采样上界。
- Distillation 与 RLVR 应分工理解:蒸馏改写 prior,RLVR 在 prior 内做 reward-guided probability shaping。
- 下一代 reasoning RL 可能需要高层抽象 exploration、curriculum、dense process reward、value-based credit assignment、agentic tool/environment interaction;只扩大 outcome-only rollout 可能不足以解决边界扩展问题。
- 对安全与监控来说,高
pass@k覆盖提醒我们:base model 低概率行为可能已经包含很多能力或风险,后训练会改变这些行为的可见概率。
局限
- 许多 frontier reasoning model 的 base checkpoint、训练数据和 RL pipeline 不公开,本文无法完全隔离最强系统中的 RLVR 影响。
- 数学任务的 pass@
仍有 lucky guess 残余风险,尽管作者通过 CoT 人工检查、过滤 AIME24 和 coding tasks 降低了这一问题。 - 大
k采样成本很高,pass@更适合作为能力边界分析工具;产品可用策略还需要引入成本、延迟和选择器质量。 - Perplexity analysis 只在部分问题和样本上执行,不能证明所有 RLVR 轨迹都已被 base distribution 高概率覆盖。
- Distillation 对照覆盖有限;不同 teacher、数据质量、student size 和 training recipe 会改变边界扩展幅度。
- 作者提出的未来方向仍是判断性建议,包括 high-level exploration、process reward、curriculum 和 agentic RL,本文没有系统证明这些方向足以突破当前限制。
跨论文关系
- 与
2501.12948的作者关系:未发现作者重叠。主题关系很强。DeepSeek-R1 证明 rule/verifiable reward 可以激发 long-CoT reasoning 表现;本文追问这些表现是否超出 base model 潜在采样能力,并用pass@k给出边界诊断。 - 与
2503.14476的作者关系:未发现作者重叠,但存在 Tsinghua 机构网络关联。DAPO 来自 ByteDance Seed、AIR Tsinghua 和 SIA-Lab,本篇来自 Tsinghua LeapLab;主题上,DAPO 提供 open-source RLVR recipe,本文提供评估该类 recipe 是否扩展 reasoning boundary 的方法。 - 与
2605.30290的作者关系:未发现作者重叠。两者都围绕 verifier / reward feedback 的有效性。STV 关注 verifier feedback 是否能推动 self-improvement;本文提示 outcome verifier 驱动的 RLVR 可能主要提高采样效率,后续 verifier/self-improvement 论文需要同时报告大pass@k覆盖。 - 与
2606.00135的作者关系:未发现作者重叠。两者都关心 RL training 的 rollout 效率与有效梯度。本文指出 single-turn binary RLVR 探索不足;tool-calling RL 论文显示 multi-turn tool environment、harness 和 rollout filtering 会显著影响训练收益。 - 与
2503.11926的作者关系:未发现作者重叠。主题关系在 CoT distribution。Monitoring 论文展示训练目标会改变 CoT 可观测分布;本文展示 RLVR 会把输出分布向 reward path 集中并缩小探索覆盖,两者都说明后训练改变的不只是平均能力。 - 与
2403.03185的作者关系:未发现作者重叠。方法关系在 distribution shift 与 reference/base distribution。Correlated proxies 论文关注 policy 偏离 reference 后 proxy 失效;本文关注 RLVR policy 偏离 base distribution 后 reasoning coverage 收缩。 - 与
2605.14220和2025-09-10的作者关系:未发现作者重叠。系统关系在采样可复现性。本文的大pass@k结论依赖 sampling distribution 的可重复估计;TIM/VeXact 和 TML 文章说明 rollout backend、batch invariance 和 sampler consistency 会影响这类估计。 - 跨论文关系定位:记录 RLVR Reasoning Boundary 与 Sampling Efficiency,并连接 DeepSeek-R1、DAPO、STV、tool-calling RL、CoT monitoring、correlated proxies 和 rollout determinism。
Reference Intake Brief
Target
- Intended target system:
content/papers/2504.13837-rlvr-reasoning-boundary-base-model.md论文存档。 - Existing related assets:
content/utility/papers-index.md、2501.12948-deepseek-r1-rl-reasoning.md、2503.14476-dapo-long-cot-rl-system.md、2605.30290-self-trained-verification.md、2606.00135-agentic-tool-calling-rl-training.md、2503.11926-monitoring-reasoning-models-obfuscation.md、2403.03185-correlated-proxies-reward-hacking.md。 - Proposed form: 新建独立 Markdown 文档,并更新总索引。
Reusable Elements
- pass@
作为 reasoning capacity boundary 指标。 - sampling efficiency gap
,用于衡量 RLVR 把 base 多采样潜力压缩到单采样的程度。 - coverage set overlap、base-PPL-on-RL-trajectories、entropy matching 和 training-step pass@
曲线作为 RLVR 诊断 checklist。
Risks
- Copyright/over-copying: 本笔记使用转述和结构化摘要,未复制长段原文、prompt 模板或 CoT case。
- Unsourced or unverifiable claims: 版本、作者、奖项、表格数值来自 arXiv v5、项目页和 TeX source;跨论文关系为本地分析判断。
- Tone/brand mismatch: 保持中文技术笔记风格,避免夸大为“RL 无效”。
- Safety/compliance issues: 本文不涉及可直接滥用的攻击流程;与 reward/verifier 相关内容只保留机制和评测启发。
- Overlap with existing assets: 与 DeepSeek-R1、DAPO、STV、tool-calling RL 均有交叉,但本文独立贡献是 reasoning boundary 评估与 RLVR sampling-efficiency 解释。
Skipped
| Material | Reason |
|---|---|
| 完整 prompt templates | 对主结论影响较小,且站点笔记不需要复现实验脚本级细节。 |
| AIME24 CoT case 长图内容 | 原始 CoT 很长;本笔记只保留其作为“base model 可低概率生成正确 reasoning path”的证据作用。 |
| 所有 27 张图逐图描述 | 关键曲线和表格已覆盖主结论;后续若做 RLVR 评测专题再展开。 |
Recommendation
Decision: merge
Why: 该论文为本地 reasoning RL 档案补上 “RLVR 是否扩展 base model reasoning boundary” 的关键诊断节点,能直接服务后续讨论 DeepSeek-R1、DAPO、tool-use RL、verifier feedback 和 agentic RL exploration。