2506.10947-spurious-rewards-rethinking-rlvr

Spurious Rewards: Rethinking Training Signals in RLVR

这篇论文指出,某些 RLVR 实验中的能力提升可以由模型预训练 prior、GRPO clipping bias 和提示/格式行为共同解释:在 Qwen2.5-Math 上,随机 reward、format reward、甚至奖励错误答案的 reward 都能显著提高 MATH-500 / AMC / AIME24 表现,随机 reward 在 MATH-500 上带来 21.4 个百分点提升,接近 ground-truth reward 的 29.1 个百分点;作者进一步说明 GRPO clipping 会系统性放大已有高 prior 行为,例如 Qwen-Math 的 code reasoning,因此未来 RLVR 论文需要加入 spurious reward baseline、跨模型家族复验和行为分布诊断。

Authors Rulin Shao, Shuyue Stella Li, Rui Xin, Scott Geng, Yiping Wang, Sewoong Oh, Simon Shaolei Du, Nathan Lambert, Sewon Min, Ranjay Krishna, Yulia Tsvetkov, Hannaneh Hajishirzi, Pang Wei Koh, Luke Zettlemoyer

已审阅 Archived 2026-02-26 16:30 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Rulin Shao: University of Washington.
  • Shuyue Stella Li: University of Washington.
  • Rui Xin: University of Washington.
  • Scott Geng: University of Washington.
  • Yiping Wang: University of Washington。
  • Sewoong Oh: University of Washington。
  • Simon Shaolei Du: University of Washington。
  • Nathan Lambert: Allen Institute for Artificial Intelligence。
  • Sewon Min: University of California, Berkeley。
  • Ranjay Krishna: University of Washington and Allen Institute for Artificial Intelligence。
  • Yulia Tsvetkov: University of Washington。
  • Hannaneh Hajishirzi: University of Washington and Allen Institute for Artificial Intelligence。
  • Pang Wei Koh: University of Washington and Allen Institute for Artificial Intelligence。
  • Luke Zettlemoyer: University of Washington。

阅读目标与判断边界

本笔记关注:

  1. 为什么 random / format / incorrect reward 也能提升 Qwen2.5-Math。
  2. GRPO clipping bias 如何把无信息 reward 转化成有效的 prior amplifier。
  3. code reasoning 在 Qwen-Math 中扮演什么角色,以及为什么这种机制具有模型家族依赖。
  4. 这篇论文如何改变对 DeepSeek-R1、DAPO、RLVR reasoning boundary、reward hacking 和 verifier self-improvement 论文的解释。

判断边界:

  • 论文把 spurious reward 当作诊断探针,用来检验 RLVR 训练到底在利用什么信号;作者明确说明这类 reward 不能直接作为可靠能力训练策略。
  • 结论最强的部分集中在 Qwen2.5-Math family 和数学 reasoning benchmark;对 Llama3、OLMo2、Qwen2.5 general model 的结果显示机制具有明显模型依赖。
  • random reward 的收益依赖 GRPO clipping、base prior、prompt、采样温度、训练步数和 reward 稀疏度。把结果外推到所有 RLVR 算法或所有模型家族需要谨慎。
  • 论文讨论的是 reasoning benchmark 上的表现提升;它没有证明模型获得了新的数学概念能力,也没有证明部署场景中的真实可靠性提升。

论文脉络

1. 问题背景

RLVR 的常见叙事是:给模型一个可验证 reward,模型通过 RL 学会更强 reasoning。数学题用最终答案验证,代码题用 unit tests,格式和长度等约束也能进入 reward。DeepSeek-R1、DAPO、SimpleRLZoo、STV 等工作都强化了这条路线。

作者提出一个更基础的问题:如果 reward 本身几乎没有正确性信息,RLVR 是否仍然能提升 benchmark?如果答案是肯定的,那么很多 RLVR 结果需要重新拆解,因为性能提升可能来自 base model prior 的重新加权,也可能来自算法偏差、prompt artifact 或格式行为,而不一定来自 reward 对正确推理的精确指引。

论文因此构造了多种 spurious rewards:

  1. Ground Truth reward:奖励 verifier 判定正确的答案。
  2. Majority Vote reward:从 base model 采样 64 个答案,用多数答案作为 pseudo-label。
  3. Format reward:只奖励非空的 \boxed{} 表达式,忽略正确性。
  4. Random reward:对每条 response 独立采样 Bernoulli reward,主实验使用 γ=0.5\gamma=0.5
  5. Majority-voted Incorrect reward:奖励匹配某个多数投票得到的错误答案,用来构造与正确性负相关的训练信号。

2. 反直觉现象:spurious reward 也能训练出提升

在 Qwen2.5-Math-7B 上,spurious reward 的效果非常强。MATH-500 上,ground-truth reward 带来 29.1 个百分点提升;random reward 带来 21.4 个百分点提升;majority-voted incorrect reward 带来 24.1 个百分点提升。AMC 和 AIME24 上也出现类似趋势,format reward、random reward 和 incorrect reward 都能显著提高分数。

这组结果说明,Qwen-Math 的 RLVR 收益并不总能用“reward 提供了正确性方向”来解释。即使 reward 与正确答案无关,甚至指向错误答案,训练仍然可能强化某些原本就有利于 benchmark 的行为。

AIME25 是一个重要边界:ground-truth reward 在 AIME25 上明显更强,spurious rewards 的提升较小甚至接近无效。作者把这解释为分布和时间上的差异:AIME25 更可能超出 Qwen-Math 预训练和 benchmark prior 的覆盖范围,因此真实 verifier 的作用更突出。

3. 模型家族依赖

作者把同一套 reward 应用到更多模型:Qwen2.5-1.5B/7B、OLMo2-7B、OLMo2-7B-SFT、Llama3.1-8B、Llama3.2-3B 等。结果显示,spurious rewards 对 Qwen family 的效果显著,对 Llama 和 OLMo 往往无效,甚至会降低表现。

这个现象给 RLVR 实证研究带来直接方法论要求:只在 Qwen-Math 上报告大幅提升,很难区分方法本身有效、模型 prior 被放大、prompt 与格式行为被利用这几种解释。论文建议未来工作至少加入非 Qwen 模型,并报告 random / format / incorrect reward dummy baselines。

作者还复验了两类依赖弱监督的 RLVR 方案:TTRL 和 One-Shot RL。它们在 Qwen-Math 上可以产生提升,但在其他模型上经常失效。这进一步支持“Qwen-centric result 需要额外 baseline”的判断。

4. GRPO clipping bias:无信息 reward 如何产生方向

论文的机制解释集中在 GRPO 的 clipped objective。简化形式为:

J(θ)=Ex,yπold[tmin(ρt(y;θ)A^(x,y),clip(ρt(y;θ),1ϵc,1+ϵc)A^(x,y))], J(\theta) = \mathbb{E}_{x,y\sim\pi_{\mathrm{old}}} \left[ \sum_t \min\left( \rho_t(y;\theta)\hat{A}(x,y), \mathrm{clip}(\rho_t(y;\theta),1-\epsilon_c,1+\epsilon_c)\hat{A}(x,y) \right) \right],

其中

ρt(y;θ)=πθ(ytx,y<t)πold(ytx,y<t). \rho_t(y;\theta) = \frac{\pi_\theta(y_t\mid x,y_{<t})} {\pi_{\mathrm{old}}(y_t\mid x,y_{<t})}.

对于 random reward,如果没有 clipping,正负 advantage 在期望上抵消,梯度期望为零。加入 clipping 后,梯度会在 ratio 超出区间时被截断,截断方式对高 prior token 与低 prior token 的影响不同。论文给出的直觉是:

  • 高 prior token 的旧概率本来就大,向上移动时在绝对概率空间里有更宽的安全区间。
  • 低 prior token 的旧概率很小,稍微向上移动就可能触发上界 clipping,得到负向 bias。
  • 结果是,clipping 会偏向把策略拉回或集中到 πold\pi_{\mathrm{old}} 的高概率区域。

论文附录把 random reward 下的 bias 写成分段形式。忽略常数项后,期望梯度偏差可以理解为:

Bias(θJ)Ex,y[{θRθ,πθ(yt)<πold(yt)(1ϵc),0,πold(yt)(1ϵc)πθ(yt)πold(yt)(1+ϵc),θRθ,πθ(yt)>πold(yt)(1+ϵc).]. \mathrm{Bias}(\nabla_\theta J) \propto \mathbb{E}_{x,y} \left[ \begin{cases} \nabla_\theta R_\theta, & \pi_\theta(y_t)<\pi_{\mathrm{old}}(y_t)(1-\epsilon_c), \\ 0, & \pi_{\mathrm{old}}(y_t)(1-\epsilon_c) \le \pi_\theta(y_t) \le \pi_{\mathrm{old}}(y_t)(1+\epsilon_c), \\ -\nabla_\theta R_\theta, & \pi_\theta(y_t)>\pi_{\mathrm{old}}(y_t)(1+\epsilon_c). \end{cases} \right].

这里的关键点是:random reward 没有提供正确性方向,但 GRPO clipping 仍然会提供一个与旧策略 prior 有关的优化偏差。如果旧策略中某些高 prior 行为恰好有助于数学 benchmark,random reward 训练也能提升分数。

5. Code reasoning:Qwen-Math 中被放大的行为

作者把 Qwen-Math 的一个高 prior 行为称为 code reasoning:模型用类似 Python 代码的形式进行推理,但实际没有执行代码。Qwen2.5-Math-7B 在 RL 前就有 65.0% 的 response 使用 code reasoning;这些 response 的准确率为 60.9%,明显高于非 code response 的 35.0%。Qwen2.5-Math-1.5B 也呈现类似现象,code response 准确率 52.6%,非 code response 17.2%。

在 spurious reward RL 中,code reasoning 频率很快从 65% 上升到 90% 以上,random reward 训练中最高接近 95.6%。这和 accuracy 提升同步出现。论文据此认为,spurious reward 训练强化了 Qwen-Math 已有且有效的 code reasoning prior。

作者也做了反例分析:Qwen2.5-7B general model 和 OLMo2-7B-SFT 虽然也会大量输出 code-like reasoning,但 code response 的准确率低于语言推理 response。作者把这类模型称为 Bad-Code models。在这些模型上,强化 code behavior 会降低表现。这解释了为什么同一套 spurious rewards 在 Qwen-Math 上有效,在其他模型上经常失效。

6. 干预实验:提示和 reward 可以显式操纵 code prior

论文进一步做了几类 intervention:

  • Prompt intervention:在问题前加入 “Let's solve this using Python.”。Qwen2.5-Math-1.5B 提升 24.2 点,Qwen2.5-Math-7B 提升 15.0 点;Qwen2.5-7B、Llama3.1/3.2、OLMo 等模型则出现明显下降。
  • Python reward:奖励 response 中出现 python 字符串。Qwen-Math 的 code reasoning 频率在 20 steps 内超过 99%,性能提升主要发生在 Qwen-Math。
  • No-Python reward:抑制 code reasoning 后,Qwen-Math 的 spurious reward 收益下降;对 Bad-Code models,有时反而改善表现。

这些实验说明,spurious reward 的作用并不神秘。它通过 RL 更新放大已有行为分布。如果被放大的行为与 benchmark 成功相关,分数会上升;如果该行为与错误相关,分数会下降。

7. 其他 spurious behavior 与 prompt sensitivity

作者还测试了 no-repetition reward:只奖励没有明显重复字符串的 response。这个 reward 在 Qwen-Math 上也能带来一定提升,因为重复少的 response 与正确性存在一定相关性。这个结果说明,spurious reward 的效果可以来自很多可见行为,不局限于 code reasoning。

论文也报告了 prompt sensitivity。Qwen-Math 的初始表现对 evaluation prompt 和 training prompt 非常敏感,甚至加入与任务无关的 Lipsum “spurious prompt” 也可能提高初始表现。这提醒后续 RLVR 工作要报告 prompt、chat template、decoding、verifier 和 model family,避免把 prompt artifact 误读为算法改进。

关键实验/定理

结果 1:Qwen2.5-Math-7B 上 random reward 接近 ground-truth reward

  • 设置:使用 GRPO、DeepScaleR 数据和 Qwen2.5-Math family,比较 ground truth、majority vote、format、random、majority-voted incorrect rewards。
  • 指标:MATH-500 pass@1,AMC avg@8,AIME24/25 avg@8。
  • 结果:MATH-500 上,ground-truth reward 提升 29.1 点,random reward 提升 21.4 点,majority-voted incorrect reward 提升 24.1 点。AMC 和 AIME24 也出现 spurious reward 明显提升。
  • 解读:Qwen-Math 上的 RLVR improvement 不能只归因于 reward 正确性信号;模型 prior 与算法 bias 是必要解释变量。

结果 2:AIME25 显示真实 reward 的额外价值

  • 设置:在 AIME25 上比较相同 reward 类型。
  • 指标:avg@8。
  • 结果:ground-truth reward 相对 spurious rewards 有明显优势,spurious rewards 的收益较小。
  • 解读:当任务更难、更晚出现或更少落在 Qwen-Math 已有 prior 覆盖内时,真实 verifier 仍然重要。spurious reward 主要暴露已有 prior 可被放大的程度。

结果 3:非 Qwen 模型上 spurious reward 常常失效

  • 设置:把 reward 方案扩展到 Qwen2.5 general、OLMo2、Llama3.1、Llama3.2 等模型。
  • 指标:MATH-500、AMC、AIME 等数学 benchmark。
  • 结果:spurious rewards 对 Qwen family 的收益最稳定,对 Llama3 / OLMo2 往往无效或有害。模型越小,spurious reward 收益越弱;已经经过 RL post-training 的模型收益也较小。
  • 解读:spurious reward 能否有效取决于 base model 是否有可放大的有益 prior。RLVR 方法评估需要跨模型家族验证。

结果 4:GRPO clipping 是 random reward 生效的关键机制

  • 设置:对 random reward 训练做 clipping ablation,包括移除 clipping、调整 mini-batch 匹配 rollout size、减少 rollout 数量以控制更新次数。
  • 指标:训练后的 MATH-500 等 benchmark 表现。
  • 结果:默认 clipping 下 random reward 产生稳定提升;移除或改变 clipping 后,random reward 的提升明显减弱或变得高度不稳定。
  • 解读:random reward 本身在期望上没有方向,GRPO clipping bias 把旧策略 prior 转化为实际更新方向。

结果 5:code reasoning 是 Qwen-Math 的可放大 prior

  • 设置:统计训练前和训练中 response 的 code reasoning 频率,并比较 code response 与 non-code response 的准确率。
  • 指标:code frequency、accuracy by reasoning style。
  • 结果:Qwen2.5-Math-7B 训练前 code frequency 为 65.0%,code response 准确率 60.9%,non-code response 准确率 35.0%。spurious rewards 训练后 code frequency 快速升至 90% 以上。
  • 解读:spurious reward 训练强化了已有且对数学任务有效的 code reasoning prior。

结果 6:Prompt/Python reward/No-Python reward 证明行为可被操纵

  • 设置:加入 “Let's solve this using Python.” prompt,或使用 Python reward / No-Python reward。
  • 指标:数学 benchmark 表现和 code reasoning 频率。
  • 结果:Python prompt 显著提升 Qwen-Math,但降低 Qwen general、Llama 和 OLMo;Python reward 把 Qwen-Math code frequency 推到 99% 以上;No-Python reward 降低 Qwen-Math spurious reward 收益,并能帮助部分 Bad-Code models。
  • 解读:训练信号在改变可观察 reasoning style;行为与正确性相关时分数上升,相关性为负时分数下降。

证据链强度评估

强证据

  • Qwen2.5-Math-7B 上 random、format、incorrect rewards 的提升幅度很大,足以排除“只有 ground-truth verifier 才能带来分数提升”的简单解释。
  • 跨模型比较显示强模型家族依赖:Qwen-Math 有收益,Llama/OLMo 常常无收益。这个对照强化了 base prior 解释。
  • clipping ablation 与理论推导相互支持,说明 random reward 的有效梯度来自 GRPO objective 的实现细节。
  • code reasoning 的行为统计和 intervention 实验构成闭环:训练前存在、准确率更高、spurious reward 强化、显式 prompt/reward 可操纵。

中等强度证据

  • TTRL 和 One-Shot RL 的复验说明弱监督 RLVR 的效果也可能 Qwen-centric,但不同实现细节和训练预算仍会影响结论。
  • AIME25 的结果支持“真实 verifier 在更难/更新任务上更重要”,但 AIME25 样本数较小,仍需要更多 post-cutoff benchmark 验证。
  • no-repetition reward 显示 spurious behavior 可以扩展到 code reasoning 之外,但论文主要深挖 code reasoning,其他行为的机制证据较少。

需要谨慎的推论

  • 论文没有否定 RLVR 的价值。它说明部分 RLVR gains 可以来自 prior amplification,尤其在 Qwen-Math 上。
  • random reward 能提升 benchmark 不代表 random reward 是可用训练方法。作者明确把它当作 diagnostic baseline。
  • GRPO clipping bias 的分析针对特定 objective 和训练设置;PPO、DAPO、RLOO、ReMax 等算法的具体 bias 可能不同。
  • Qwen-Math 的 code reasoning 可能来自预训练、SFT、数学数据、prompt/template 等多重因素;论文没有完全拆开这些来源。

OpenReview / 审稿意见吸收

  • Venue status: 当前档案未记录公开 peer-review 状态。
  • Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
  • Ratings / confidence: 无公开评分可用于校准。
  • Reviewer consensus: 暂无。
  • Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
  • Author response: 暂无公开 rebuttal 记录。
  • 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。

本地讨论补充

1. 讨论收敛点

  • 本文应和 2504.13837 放在一起理解:2504.13837 说 RLVR 经常把 base model 已经能采样到的路径提升为高概率输出;本文给出一个更具体的机制,说明即使 reward 本身没有正确性信息,GRPO clipping 和 base prior 也可能推动这种概率重排。
  • 对 RLVR 实验来说,dummy baseline 需要成为常规配置:random reward、format reward、incorrect reward、prompt-only intervention、no-code/no-format intervention 都可以帮助区分“reward 指向正确推理”和“训练放大已有行为”。
  • 模型家族是实验结论的一部分。Qwen-Math 的结果不能自然代表 Llama、OLMo、DeepSeek、Mistral 或 frontier proprietary models。
  • 本地讨论后进一步确认:这篇论文的重要性在于提供了正确解读 RLVR 性能提升来源的方法。它把 benchmark gain 拆成 reward informativeness、base-model prior、objective/clipping bias、prompt/template artifact 和可观察行为分布,并用多种 reward、多个模型家族和行为干预实验逐项排查。

2. 修正后的理解

  • spurious reward 的核心可表述为:random reward 可以通过优化器/objective 的偏置放大已有高 prior 行为。当这些行为与 benchmark 成功相关时,分数会上升。
  • code reasoning 在 Qwen-Math 中是有益 prior;在 Qwen general 或 OLMo-SFT 中可能成为有害 prior。因此同一种 reward 在不同模型上会产生相反结果。
  • ground-truth reward 的价值仍然存在,尤其在 AIME25 这类更难、更晚、更少被已有 prior 覆盖的任务上。本文主要削弱的是“看到 RLVR gain 就能推断 reward 提供了正确 reasoning 信号”的解读。

3. 后续复验指标

  • 每个 RLVR 结果都应报告 ground-truth reward 与 random / format / incorrect reward 的差距。
  • 同时报告行为分布:code reasoning 频率、boxed format 频率、repetition rate、response length、entropy、base-model perplexity、pass@kk
  • 在 Qwen-Math 之外加入至少一个 Llama、一个 OLMo/OLMoE 或其他 open model family,并使用相同训练预算和 prompt/template。
  • 对 GRPO 类算法记录 clipping rate、ratio 分布、advantage 分布、token prior bucket 和行为变化之间的关系。

主要启发

  • RLVR 论文需要把 reward informativeness 和 prior amplification 分开测量。只报告 pass@1 提升不足以说明 reward 指向了真实能力增长。
  • 这篇论文的核心贡献是方法论校准:它告诉我们看到 RLVR 性能提升时,要追问提升来自真实 verifier signal、已有能力的采样效率提升、模型 prior 放大、格式/提示捷径,还是训练目标本身的 bias。
  • Spurious reward baseline 是低成本但高价值的诊断工具。若 random reward 已能达到真实 reward 的大部分收益,方法贡献需要重新解释。
  • 训练算法本身会塑造有效训练信号。GRPO clipping、advantage normalization、rollout grouping、prompt/template 和 verifier 都可能成为实际优化目标的一部分。
  • 行为分布是能力指标的前置解释变量。code reasoning、format compliance、length、重复率等表面行为可能决定 RLVR gain 的来源。
  • 跨模型家族复验是 RLVR 方法论底线。Qwen-Math prior 很强,且可能与数学 benchmark 和代码式推理高度耦合。

局限

  1. 实验重点集中在数学 reasoning,代码、工具调用、多轮 agent 任务和真实应用环境中的 spurious reward 机制仍需独立验证。
  2. 机制分析主要围绕 GRPO clipping;其他 RL objectives、不同 KL 设置、不同 clipping policy 或 entropy regularization 下的 bias 需要额外实验。
  3. code reasoning 分类和行为统计虽然有解释力,但仍是可观察表面行为,不能完全等同于内部推理机制。
  4. AIME25 等 post-cutoff benchmark 的样本量有限,真实 reward 相对 spurious reward 的优势需要更多数据集确认。
  5. 论文展示了 prompt sensitivity,但没有系统枚举 chat template、system prompt、数据污染、benchmark overlap 对结果的影响。

跨论文关系

  • 2504.13837 的关系最强:2504.13837 从 pass@kk 和 reasoning boundary 说明 RLVR 常常重排 base distribution;本文从 spurious rewards、GRPO clipping bias 和 code reasoning prior 解释这种重排如何在 Qwen-Math 上发生。
  • 2503.14476 DAPO 的关系:DAPO 讨论 GRPO recipe、Clip-Higher、Dynamic Sampling、Token-level Policy Gradient Loss 和 Overlong Reward Shaping;本文提醒这类 recipe 需要配套 random / format / incorrect baseline,并记录 clipping rate 与行为分布。
  • 2501.12948 DeepSeek-R1 的关系:R1 展示 verifiable reward 可以激发 long-CoT;本文提醒 rule/verifiable reward 的收益需要区分真实 reward guidance、base prior amplification 和格式/行为 prior。
  • 2605.30290 STV 的关系:STV 关注 verifier feedback 驱动 self-improvement;本文提醒 verifier/reward feedback 实验应加入 dummy verifier,检查性能是否来自 evaluator informativeness。
  • 2501.096202403.03185 的关系:二者讨论 learned reward 或 proxy reward 的 spurious dependence / correlated proxy;本文把 spurious reward 问题推进到 RLVR objective 和 base prior 层。
  • 2606.00135 的关系:tool-calling RL 论文强调 harness 和 prompt serialization 会改变能力测量;本文显示数学 RLVR 中 prompt、format 和 model family 也会进入有效训练信号。
  • 2503.11926 的关系:CoT monitoring 论文关注训练目标改变 visible reasoning telemetry;本文展示 spurious rewards 可以显著改变 code reasoning 频率,说明 visible reasoning style 本身会被 reward 选择。
  • 2605.14220 和 Thinking Machines deterministic inference 文章的关系:两者关注 rollout/trainer/inference 实现一致性;本文补充 objective-level clipping bias,说明即使实现一致,训练目标也可能带有 prior-amplifying bias。

Reference Intake Brief

Target

  • Intended target system: 新增论文笔记 / RLVR 方法论与 reward signal 诊断专题。
  • Existing related assets: content/utility/papers-index.md2504.13837-rlvr-reasoning-boundary-base-model.md2503.14476-dapo-long-cot-rl-system.md2501.12948-deepseek-r1-rl-reasoning.md2403.03185-correlated-proxies-reward-hacking.md
  • Proposed form: 新建独立 Markdown 文档,更新索引行,并维护对应论文的关系章节。

Reusable Elements

  1. Spurious reward baseline checklist:random reward、format reward、incorrect reward、prompt-only intervention、behavior-suppression reward。
  2. GRPO clipping bias 解释:random reward 在 unclipped objective 下期望梯度为零,clipping 后产生 prior-aligned bias。
  3. 行为分布诊断:code reasoning frequency、format rate、repetition rate、length、entropy、base PPL、pass@kk、clipping rate。
  4. 跨模型复验原则:Qwen-Math result 需要至少和 Llama/OLMo/其他 open family 对照。

Risks

  • Copyright/over-copying: 笔记使用概括、重述和少量公式表达,避免长段复制论文原文。
  • Unsourced or unverifiable claims: 作者机构、版本日期、主题分类来自 arXiv API 与 TeX source;会议接收状态未确认,已写入待确认。
  • Tone/brand mismatch: 中文解释保持技术笔记风格,避免夸张宣传语。
  • Safety/compliance issues: 论文涉及 reward hacking / spurious rewards,但笔记聚焦诊断、评测和防御启发,没有提供可直接滥用的攻击流程。
  • Overlap with existing assets: 与 2504.138372503.14476 有主题重叠,本笔记的新增价值是 spurious reward + GRPO clipping bias + model-family prior。

Skipped

Material Reason
全量 appendix 训练日志逐项复写 对长期索引价值较低,保留关键 ablation 和可复验指标即可。
代码仓库逐文件审计 用户请求是论文分析,未要求复现实验或审计实现。

Recommendation

Decision: merge

Why: 该论文为 RLVR 评估提供了强方法论基线,能直接补充本地档案中 DeepSeek-R1、DAPO、RLVR boundary、reward hacking、STV 和 tool-use RL 的解释链条。