2504.13837-rlvr-reasoning-boundary-base-model

Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

这篇论文把 RLVR 的收益拆成 sampling efficiency 和 reasoning capacity boundary:当前基于 binary verifiable reward 的 RLVR 常常把 base model 已经能低概率采样到的正确 reasoning paths 提升到更高概率,因此 pass@1 明显改善;但在较大采样预算下的 pass@k 覆盖上,base model 往往能解出更多题,说明现有 RLVR 主要是在 base distribution 内重分配概率质量,尚未稳定地产生超出 base model 的新 reasoning patterns。蒸馏与此不同,它能从更强 teacher 注入新轨迹,从而扩大 student 的 reasoning boundary。

Authors Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao, Zhaokai Wang, Shiji Song, Gao Huang

已审阅 Archived 2026-03-06 15:30 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Yang Yue(乐洋): LeapLab, Tsinghua University.
  • Zhiqi Chen: LeapLab, Tsinghua University.
  • Rui Lu: LeapLab, Tsinghua University.
  • Andrew Zhao: LeapLab, Tsinghua University.
  • Zhaokai Wang: Shanghai Jiao Tong University.
  • Yang Yue(乐阳): LeapLab, Tsinghua University.
  • Shiji Song: LeapLab, Tsinghua University.
  • Gao Huang: LeapLab, Tsinghua University.

阅读目标与判断边界

本笔记关注:

  1. 作者如何定义和测量 reasoning capacity boundary。
  2. RLVR 提升 pass@1 与降低高 k 覆盖之间的机制关系。
  3. coverage、perplexity、entropy、训练步数、算法对比和 distillation 共同支持什么结论。
  4. 它和 DeepSeek-R1、DAPO、STV、tool-use RL、CoT monitoring 等本地已存档论文如何连接。

判断边界:

  • 本文讨论的是当前公开可分析的 RLVR 设置,尤其是 binary verifiable outcome reward;作者也明确保留了更大 RL compute、更强 exploration、dense process reward 和 agentic interaction 的未来空间。
  • pass@kk 在本文中用于测量“多次采样内是否至少能解出一次”,服务 capability boundary 分析;部署时仍需要 majority vote、best-of-NN 或 cost-aware evaluation 等实用选择策略。
  • 数学题存在 lucky guess 风险;作者用 coding tasks、过滤 AIME24、人工检查 CoT 等方式降低这个问题,但这种人工验证无法覆盖全部样本。
  • 论文对 near-frontier 模型只做了 Magistral-Medium 的 preliminary scaling experiment;更大模型、更大 RL compute 或 proprietary training pipeline 的结论仍需后续证据。

论文脉络

1. 问题背景

RLVR 已经成为 reasoning model 后训练的核心路线。它用可自动验证的 reward 代替人工标注:数学题看 final answer 是否正确,代码题看 unit tests 是否通过,多模态 reasoning 看可验证答案是否匹配。DeepSeek-R1、DAPO、Oat-Zero、SimpleRLZoo、Code-R1 等工作都说明,RLVR 能显著提高平均准确率和小采样预算下的表现。

通常的直觉是:RL 会像 Atari、Go 或 AlphaGo Zero 一样,通过探索发现新策略。作者质疑这个直觉在 LLM RLVR 中是否成立,因为 LLM 的动作空间是长 token 序列,组合空间极大;policy gradient 只能从当前 policy 采样到的轨迹里得到 reward。若 base model 完全采样不到某类正确路径,binary reward 很难给出有效学习信号。

2. Reasoning boundary 的测量

作者引入 pass@kk 来测量模型的潜在可解问题覆盖。对每个问题采样 kk 个输出,只要有一个输出通过 verifier,就认为该问题在模型的当前采样边界内。数据集平均 pass@kk 近似表示“模型在 kk 次尝试内能覆盖多少问题”。

作者使用低方差无偏估计:

pass@k=ExiD[1(ncik)(nk)], \mathrm{pass@}k = \mathbb{E}_{x_i \sim \mathcal{D}} \left[ 1 - \frac{\binom{n-c_i}{k}}{\binom{n}{k}} \right],

其中 nn 是每个问题实际生成的样本数,cic_i 是其中正确样本数。数学 benchmark 通常用 n=128n=12810241024;AIME24 / AMC23 等小数据集会使用更大的采样数来观察尾部能力。

3. RLVR 形式化

论文采用标准 verifiable reward 视角:LLM policy πθ\pi_\theta 对 prompt xx 生成序列 y=(y1,,yT)\mathbf{y}=(y_1,\dots,y_T),deterministic verifier V\mathcal{V} 返回 binary reward:

r=V(x,y){0,1}. r = \mathcal{V}(x,\mathbf{y}) \in \{0,1\}.

优化目标是:

J(θ)=ExD[Eyπθ(x)[r]]. J(\theta) = \mathbb{E}_{x\sim\mathcal{D}} \left[ \mathbb{E}_{\mathbf{y}\sim\pi_\theta(\cdot|x)}[r] \right].

PPO / GRPO / RLOO / ReMax / Reinforce++ / DAPO 等算法都属于 policy gradient 家族。对 binary RLVR 来说,它们主要提升已获 reward 样本的 log-likelihood,降低错误样本的 log-likelihood。因此,如果正确 reasoning path 已经存在于 base model 的采样分布中,RLVR 会把概率质量推向这些路径;如果路径完全不在当前采样支持内,训练很难得到可用梯度。

4. 核心发现

作者在数学、代码、视觉 reasoning 三个域做系统实验:

  • 数学:LLaMA-3.1-8B、Qwen2.5-7B/14B/32B-Base、Qwen2.5-Math-7B;SimpleRLZoo、Oat-Zero、DAPO;benchmark 包括 GSM8K、MATH500、Minerva、Olympiad、AIME24、AMC23。
  • 代码:Qwen2.5-7B-Instruct、DeepSeek-R1-Distill-Qwen-14B;Code-R1、DeepCoder;benchmark 包括 LiveCodeBench、HumanEval+、MBPP+。
  • 视觉 reasoning:Qwen2.5-VL-7B;EasyR1;benchmark 包括过滤多选题后的 MathVista 和 MathVision。

共同现象是:RLVR model 在小 kk,尤其 k=1k=1,通常超过 base model;当 kk 增大到几十、上百或上千时,base model 的 pass@kk 曲线更陡,常常追上并超过 RLVR model。作者把这解释为:RLVR 提高了正确样本的采样效率,同时缩小了可探索的问题覆盖。

5. 为什么说路径已在 base distribution 里

作者用三类证据支持“RLVR 轨迹已在 base model 采样分布中”:

  1. Coverage set analysis:AIME24 与 MATH500 上,base-only solved 的问题显著多于 RL-only solved 的问题。
  2. Accuracy histogram:RLVR 后高 accuracy 问题增多,但 accuracy 为 0 的问题也增多,说明一部分原本可低概率解出的问题变成完全采样不到。
  3. Perplexity analysis:用 base model 评估 RLVR model 生成的 response,PPL 往往落在 base-generated response 的低 PPL 区间,且随着 RL 训练推进,PPLBase(YRLx)\mathrm{PPL}_{\mathrm{Base}}(\mathbf{Y}_{\mathrm{RL}}|x) 继续下降。

Perplexity 计算为:

PPLm(Yx)=exp(1Tt=1TlogP(ytx,y1,,yt1)). \mathrm{PPL}_{m}(\mathbf{Y}\mid x) = \exp\left( -\frac{1}{T}\sum_{t=1}^{T} \log P(y_t\mid x,y_1,\dots,y_{t-1}) \right).

这里 PPL 低表示模型 mm 本来就更容易生成这个 response。作者的解释是:RLVR 主要在 base prior 内强化已有 high-reward path,缺少把 policy 推向 base model 近乎不可达 reasoning path 的证据。

6. 蒸馏的对照

作者比较 DeepSeek-R1-Distill-Qwen-7B、Qwen2.5-Math-7B、Oat-Zero 和 Qwen2.5-Math-7B-Instruct。蒸馏模型的 pass@kk 曲线整体高于 base model,说明 teacher 的 long-CoT traces 可以把新 reasoning patterns 注入 student。这个对照很关键:如果一种方法确实扩展 reasoning boundary,大 pass@k 应该整体抬升;在作者实验里,distillation 更符合这个特征,当前 RLVR 更像概率重排。

关键实验/定理

结果 1:数学 reasoning 中 RLVR 提高低 k,降低大 k 覆盖

  • 设置:多组 Qwen2.5 / LLaMA base model 与 SimpleRLZoo / Oat-Zero / DAPO RLVR model,在 GSM8K、MATH500、Minerva、Olympiad、AIME24、AMC23 上比较 pass@kk 曲线。
  • 指标:pass@kk,重点观察 k=1k=1k=128/1024k=128/1024 的差异。
  • 结果:RLVR 在小 kk 下表现更好;随着 kk 增大,base model 常常追上并超过 RLVR model。Minerva 32B 示例中,base model 在 k=128k=128 约高出 RLVR model 9 个百分点。
  • 解读:RLVR 让正确路径更容易被采到,但没有稳定扩大可解问题集合。

结果 2:CoT 人工检查降低 lucky guess 解释

  • 设置:对 GSM8K 和 AIME24 中平均准确率低于 5% 但有正确输出的困难题,人工检查导致正确答案的 CoT 是否合理。
  • 指标:每个困难题是否至少存在一个正确 CoT。
  • 结果:GSM8K 困难题中,base model 解出的 25 题里有 24 题至少包含一个正确 CoT;RLVR model 解出的 25 题里有 23 题至少包含一个正确 CoT。过滤后的 AIME24 中,base model 解出的困难题里 5/6 至少包含一个正确 CoT,RLVR model 为 4/6。
  • 解读:大 pass@kk 中 base model 的收益主要来自低概率但有效的 reasoning path,而不只是 final answer 猜中。

结果 3:代码和视觉 reasoning 呈现相同趋势

  • 设置:代码任务使用 Code-R1 / DeepCoder,在 LiveCodeBench、HumanEval+、MBPP+ 上评估;视觉任务使用 EasyR1 训练 Qwen2.5-VL-7B,在过滤多选题后的 MathVista 和 MathVision 上评估。
  • 指标:pass@kk 曲线;代码任务通过 unit tests 作为 verifier;视觉任务检查 difficult CoT。
  • 结果:代码和视觉 reasoning 与数学一致:RLVR 提升低采样预算下表现,base / starting model 在大 kk 下保持更广覆盖。视觉 reasoning 的人工检查中,base 与 RL model 都有 7/8 个困难问题至少存在一个正确 CoT。
  • 解读:该现象不只存在于 math final-answer verifier,也出现在更难靠随机猜测通过的 coding unit tests 和多模态 reasoning 中。

结果 4:Coverage set 近似包含关系

  • 设置:比较 base model 和 SimpleRLZoo-Qwen2.5-7B 在 AIME24(k=1024k=1024)与 MATH500(k=128k=128)上的 solvable set。
  • 指标:四类问题比例:两者都能解、只有 base 能解、只有 RLVR 能解、两者都不能解。
  • 结果:
Benchmark 两者都能解 只有 base 能解 只有 RLVR 能解 两者都不能解
AIME24 63.3% 13.3% 0.0% 23.3%
MATH500 92.4% 3.6% 1.0% 3.0%
  • 解读:RLVR solved set 近似是 base solved set 的子集。MATH500 中少量 RL-only case 在采样 1024 次后也能被 base model 解出。

结果 5:六种 RLVR 算法差异小,sampling efficiency gap 仍大

  • 设置:作者用 VeRL 重新实现 PPO、GRPO、Reinforce++、RLOO、ReMax、DAPO,在 Omni-MATH-Rule 训练集、in-domain test 和 MATH500 上比较。
  • 指标:pass@1、pass@256 与 sampling efficiency gap:
ΔSE=pass@k(πbase)pass@1(πRL), \Delta_{\mathrm{SE}} = \mathrm{pass@}k(\pi_{\mathrm{base}}) - \mathrm{pass@}1(\pi_{\mathrm{RL}}),

其中作者用 k=256k=256 近似 base model 的上界。ΔSE\Delta_{\mathrm{SE}} 越小,表示 RL algorithm 越接近把 base model 的多采样潜力压缩到单次采样。

  • 结果:不同算法的 pass@1 有差异,DAPO 在部分数据上 pass@1 略高;但 pass@256 基本没有超出 base 上界。Omni-MATH-Test 上,GRPO 的 gap 约 43.9,RLOO 最好也约 41.0 到 42.6 量级,整体仍大。
  • 解读:当前算法主要差在利用 base potential 的效率,还没有改变 reasoning boundary 的证据。

结果 6:训练越久,pass@1 上升,pass@256 下降

  • 设置:GRPO 在 Omni-MATH-Rule 上训练 150、300、450 steps。
  • 指标:pass@1 和 pass@256。
  • 结果:Omni-MATH-Train 上 pass@1 从 base 9.9 提升到 step450 的 42.5;同一数据上的 pass@256 从 base 67.2 下降到 64.3。Omni-MATH-Test 上 pass@1 从 10.2 提升到 28.3,pass@256 从 69.1 下降到 63.9。
  • 解读:训练继续推进会让平均表现更好,但可解问题覆盖收缩,更符合“概率质量集中到 reward path”的解释;扩展搜索边界的证据较弱。

结果 7:熵、KL 和 rollout number 解释一部分现象

  • 设置:作者调节 RLVR model 的 generation temperature,使输出 entropy 接近 base model;同时 ablate KL penalty 与 rollout number nn
  • 指标:pass@kk 曲线、entropy、pass@128。
  • 结果:提高 RLVR model temperature 后,它自己的大 kk 表现有所改善,但仍低于 base model。增大 rollout number 从 8 到 32 可以改善较大 kk 的 pass@kk,但仍会被 base model 超过。加入 KL coefficient 0.001 后,pass@1 接近无 KL 版本,但 pass@128 更低。
  • 解读:entropy collapse 是 coverage 收缩的一部分原因;训练探索预算、KL 约束和 reward sparsity 也会共同影响 boundary。

结果 8:Near-frontier scaling 初步支持同一趋势

  • 设置:使用 Magistral-Medium-2506 API 与其 starting model Mistral-Medium-3-2505,在 AIME24 / AIME25 上评估。
  • 指标:pass@kk
  • 结果:RLVR-enhanced Magistral 在 k=1k=1 上比 base 多解约 7 个 AIME24 问题和 8 个 AIME25 问题;随着 kk 增大,性能差距逐渐缩小。
  • 解读:在 near-frontier pure-RLVR model 上,当前观察仍成立;更大 RL compute 是否能改变结论仍是开放问题。

证据链强度评估

强证据

  • 多任务覆盖较广:数学、代码、视觉 reasoning 都出现类似 pass@kk 现象。
  • 多模型、多算法覆盖较广:Qwen2.5、LLaMA、Qwen2.5-VL、Code-R1、DeepCoder、DAPO、Oat-Zero、SimpleRLZoo、VeRL 中的六种 RL algorithms 都被纳入。
  • Coverage set、accuracy histogram、perplexity evolution、training dynamics 互相支持同一个机制:RLVR 在 base prior 内强化 reward path。
  • 代码任务通过 unit tests 评估,降低了数学 final answer lucky guess 对整体结论的影响。

中等强度证据

  • CoT 人工检查支持 base model 存在有效 reasoning path,但样本量有限,且人工判断存在主观边界。
  • Distillation 对照说明“扩展 boundary”的曲线应该是什么样,但只覆盖 DeepSeek-R1-Distill-Qwen-7B 等代表性案例。
  • Magistral-Medium near-frontier 结果有价值,但样本、API、模型细节和 compute budget 都受限制。
  • Sampling efficiency gap 是有用诊断指标,但把 base pass@256 当作上界只是近似,真实上界取决于可承受的 kk、temperature、prompt 和 verifier。

需要谨慎的推论

  • 本文不等价于“RL 对 LLM reasoning 无用”。它说明当前 binary RLVR 主要提升采样效率,并指出扩展 boundary 需要新的 exploration / credit assignment / environment interaction。
  • pass@k 是能力边界测量;base model 需要上百或上千次采样才能解出的题,在产品系统里仍可能不实用。
  • 结论依赖当前公开 RLVR pipeline;如果未来引入 dense process reward、value-based credit assignment、curriculum、tool-use environment 或 large-scale agentic RL,结论边界可能改变。
  • 训练数据、benchmark leakage、prompt template、temperature 和 verifier 质量都会影响 pass@kk 曲线,后续复现必须完整记录这些设置。

OpenReview / 审稿意见吸收

  • Venue status: 当前档案未记录公开 peer-review 状态。
  • Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
  • Ratings / confidence: 无公开评分可用于校准。
  • Reviewer consensus: 暂无。
  • Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
  • Author response: 暂无公开 rebuttal 记录。
  • 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。

本地讨论补充

1. 讨论收敛点

  • 初版归档把本文定位为本地档案中的 “RLVR reasoning boundary / sampling efficiency” 节点。它把 DeepSeek-R1 和 DAPO 中常说的 “RL 激发 reasoning” 拆成两个可测变量:低 k 的采样效率和高 k 的可解问题覆盖。
  • 该论文适合与 2503.14476 DAPO 一起读。DAPO 解决 long-CoT RL recipe 如何稳定、开源、可复现;本文追问同类 RLVR recipe 到底是在扩展能力,还是在更高效地采样 base model 已有能力。
  • 它也补充了 2606.00135 tool-calling RL 的讨论:tool-use RL 里如果 harness / environment 能提供新信息和多轮反馈,可能有机会突破本文 binary single-turn RLVR 的探索瓶颈。

2. 修正后的理解

  • 更精确的表述是:当前 RLVR 的主要效果是把 base model 的 pass@k 潜力压缩到更小的采样预算;这还不能证明模型学会了 base distribution 中完全不存在的新 reasoning path。
  • “base model 是上界”应理解为经验性近似:在作者的任务、采样预算和 verifier 设置下,RLVR solved set 大多被 base model 大采样覆盖。它不能当作所有 RLVR 方法都无法突破的理论上界。
  • Distillation 的作用不同:它通过 teacher traces 改变 student prior,因而可以把原本不在 student base distribution 高概率区域的 reasoning pattern 写入模型。
  • 本地讨论进一步收敛为:纯 binary verifiable reward 对“扩展解题边界”的能力有限,核心限制在 positive trajectory discovery。若 base model 对某题的正确 reasoning path 采样概率 pp 处在可触达范围内,RLVR 可以用 rollout 找到正样本并提高其概率;若 pp 在实际 rollout budget 下近似为 0,binary reward 很难提供有效梯度。期望至少采到一次正确路径的概率近似为 1(1p)N1-(1-p)^N,因此所需 rollout 规模约为 1/p1/p。SFT / distillation 的作用是把外部 teacher 或人工数据中的 reasoning trace 注入模型 prior,先把 pp 从近乎不可达提高到可采样区间,再让 RLVR 做概率重排和稳定化。
  • 因此,更准确的结论是:需要某种机制先改变或扩展 base prior。这个机制可以是高质量 SFT / distillation,也可以是 dense process reward、curriculum、value-based credit assignment、更强 exploration、tool-use / multi-turn environment feedback 或更强 base pretraining。当前论文的实验证据主要约束的是 outcome-only、single-turn、binary-verifier RLVR。
  • 关于泛化能力,本地讨论进一步拆成三层:第一是发现难,模型必须先采样到完整正确轨迹才会得到正 reward;第二是归因难,长 CoT 最终错了只知道整条轨迹失败,最终对了也很难知道哪些步骤真正关键;第三是迁移难,RL 更容易强化已采到并得分的轨迹族,对未见题型、新抽象结构和当前分布外解法的帮助有限。因此最终对/错 reward 的主要效果是提高已有可采样能力的出现概率,对扩展泛化边界需要更密的中间信号或更强的 prior 改写机制。

3. 后续复验指标

  • 同时报告 pass@1pass@8/16pass@128/256/1024,避免只看平均准确率。
  • 记录 solvable set overlap:base-only、RL-only、both、neither。
  • 对 RL-generated correct trajectories 计算 base PPL,并观察 PPL 随训练 step 的变化。
  • 记录 entropy、response length、reward、format compliance 与 pass@kk 的联动。
  • 区分 outcome-only binary reward、process reward、tool-feedback reward 和 multi-turn environment reward。
  • 对每个 benchmark 报告 prompt template、temperature、top-pp、max tokens、verifier、采样 seed 和去重策略。

主要启发

  • 评估 reasoning RL 需要同时看平均性能和覆盖边界。pass@1 上升可以来自概率重排,不能单独证明模型产生新能力。
  • RLVR 的核心瓶颈是 sparse binary reward 下的探索。若 correct path 采样概率为 10410^{-4}10510^{-5},RL 可以通过足够 rollout 找到并强化;若概率低到当前 compute 无法触达,policy gradient 很难获得有效信号。
  • 对 long-CoT RL recipe,应把 sampling efficiency gap 作为诊断指标:算法是否真正接近 base model 的大采样上界。
  • Distillation 与 RLVR 应分工理解:蒸馏改写 prior,RLVR 在 prior 内做 reward-guided probability shaping。
  • 下一代 reasoning RL 可能需要高层抽象 exploration、curriculum、dense process reward、value-based credit assignment、agentic tool/environment interaction;只扩大 outcome-only rollout 可能不足以解决边界扩展问题。
  • 对安全与监控来说,高 pass@k 覆盖提醒我们:base model 低概率行为可能已经包含很多能力或风险,后训练会改变这些行为的可见概率。

局限

  1. 许多 frontier reasoning model 的 base checkpoint、训练数据和 RL pipeline 不公开,本文无法完全隔离最强系统中的 RLVR 影响。
  2. 数学任务的 pass@kk 仍有 lucky guess 残余风险,尽管作者通过 CoT 人工检查、过滤 AIME24 和 coding tasks 降低了这一问题。
  3. k 采样成本很高,pass@kk 更适合作为能力边界分析工具;产品可用策略还需要引入成本、延迟和选择器质量。
  4. Perplexity analysis 只在部分问题和样本上执行,不能证明所有 RLVR 轨迹都已被 base distribution 高概率覆盖。
  5. Distillation 对照覆盖有限;不同 teacher、数据质量、student size 和 training recipe 会改变边界扩展幅度。
  6. 作者提出的未来方向仍是判断性建议,包括 high-level exploration、process reward、curriculum 和 agentic RL,本文没有系统证明这些方向足以突破当前限制。

跨论文关系

  • 2501.12948 的作者关系:未发现作者重叠。主题关系很强。DeepSeek-R1 证明 rule/verifiable reward 可以激发 long-CoT reasoning 表现;本文追问这些表现是否超出 base model 潜在采样能力,并用 pass@k 给出边界诊断。
  • 2503.14476 的作者关系:未发现作者重叠,但存在 Tsinghua 机构网络关联。DAPO 来自 ByteDance Seed、AIR Tsinghua 和 SIA-Lab,本篇来自 Tsinghua LeapLab;主题上,DAPO 提供 open-source RLVR recipe,本文提供评估该类 recipe 是否扩展 reasoning boundary 的方法。
  • 2605.30290 的作者关系:未发现作者重叠。两者都围绕 verifier / reward feedback 的有效性。STV 关注 verifier feedback 是否能推动 self-improvement;本文提示 outcome verifier 驱动的 RLVR 可能主要提高采样效率,后续 verifier/self-improvement 论文需要同时报告大 pass@k 覆盖。
  • 2606.00135 的作者关系:未发现作者重叠。两者都关心 RL training 的 rollout 效率与有效梯度。本文指出 single-turn binary RLVR 探索不足;tool-calling RL 论文显示 multi-turn tool environment、harness 和 rollout filtering 会显著影响训练收益。
  • 2503.11926 的作者关系:未发现作者重叠。主题关系在 CoT distribution。Monitoring 论文展示训练目标会改变 CoT 可观测分布;本文展示 RLVR 会把输出分布向 reward path 集中并缩小探索覆盖,两者都说明后训练改变的不只是平均能力。
  • 2403.03185 的作者关系:未发现作者重叠。方法关系在 distribution shift 与 reference/base distribution。Correlated proxies 论文关注 policy 偏离 reference 后 proxy 失效;本文关注 RLVR policy 偏离 base distribution 后 reasoning coverage 收缩。
  • 2605.142202025-09-10 的作者关系:未发现作者重叠。系统关系在采样可复现性。本文的大 pass@k 结论依赖 sampling distribution 的可重复估计;TIM/VeXact 和 TML 文章说明 rollout backend、batch invariance 和 sampler consistency 会影响这类估计。
  • 跨论文关系定位:记录 RLVR Reasoning Boundary 与 Sampling Efficiency,并连接 DeepSeek-R1、DAPO、STV、tool-calling RL、CoT monitoring、correlated proxies 和 rollout determinism。

Reference Intake Brief

Target

  • Intended target system: content/papers/2504.13837-rlvr-reasoning-boundary-base-model.md 论文存档。
  • Existing related assets: content/utility/papers-index.md2501.12948-deepseek-r1-rl-reasoning.md2503.14476-dapo-long-cot-rl-system.md2605.30290-self-trained-verification.md2606.00135-agentic-tool-calling-rl-training.md2503.11926-monitoring-reasoning-models-obfuscation.md2403.03185-correlated-proxies-reward-hacking.md
  • Proposed form: 新建独立 Markdown 文档,并更新总索引。

Reusable Elements

  1. pass@kk 作为 reasoning capacity boundary 指标。
  2. sampling efficiency gap ΔSE\Delta_{\mathrm{SE}},用于衡量 RLVR 把 base 多采样潜力压缩到单采样的程度。
  3. coverage set overlap、base-PPL-on-RL-trajectories、entropy matching 和 training-step pass@kk 曲线作为 RLVR 诊断 checklist。

Risks

  • Copyright/over-copying: 本笔记使用转述和结构化摘要,未复制长段原文、prompt 模板或 CoT case。
  • Unsourced or unverifiable claims: 版本、作者、奖项、表格数值来自 arXiv v5、项目页和 TeX source;跨论文关系为本地分析判断。
  • Tone/brand mismatch: 保持中文技术笔记风格,避免夸大为“RL 无效”。
  • Safety/compliance issues: 本文不涉及可直接滥用的攻击流程;与 reward/verifier 相关内容只保留机制和评测启发。
  • Overlap with existing assets: 与 DeepSeek-R1、DAPO、STV、tool-calling RL 均有交叉,但本文独立贡献是 reasoning boundary 评估与 RLVR sampling-efficiency 解释。

Skipped

Material Reason
完整 prompt templates 对主结论影响较小,且站点笔记不需要复现实验脚本级细节。
AIME24 CoT case 长图内容 原始 CoT 很长;本笔记只保留其作为“base model 可低概率生成正确 reasoning path”的证据作用。
所有 27 张图逐图描述 关键曲线和表格已覆盖主结论;后续若做 RLVR 评测专题再展开。

Recommendation

Decision: merge

Why: 该论文为本地 reasoning RL 档案补上 “RLVR 是否扩展 base model reasoning boundary” 的关键诊断节点,能直接服务后续讨论 DeepSeek-R1、DAPO、tool-use RL、verifier feedback 和 agentic RL exploration。