2512.07783-interplay-pretraining-midtraining-rl-reasoning

On the Interplay of Pre Training, Mid Training, and RL on Reasoning Language Models

这篇论文用完全可控的合成推理环境把 pre-training、mid-training 和 RL post-training 的作用拆开:RL 能带来真正的 pass@128 能力扩展,但需要两个条件同时成立,base model 在目标区域有足够探索余地,RL 数据位于模型 edge of competence;contextual generalization 还需要预训练中出现过少量相关 primitive seed;mid-training 作为 pre-training 与 RL 的分布桥接,在固定 compute 下能显著提高 RL readiness;把 process verification 放入 reward 可以降低 outcome-only reward hacking,使性能提升更接近有效推理链条。

Authors Charlie Zhang, Graham Neubig, Xiang Yue

已审阅 Archived 2026-03-24 10:30 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Charlie Zhang: Carnegie Mellon University, Language Technologies Institute.
  • Graham Neubig: Carnegie Mellon University, Language Technologies Institute.
  • Xiang Yue: Carnegie Mellon University, Language Technologies Institute.

阅读目标与判断边界

本笔记关注:

  1. 论文如何把 “RL 到底有没有扩展 reasoning ability” 变成可控实验问题。
  2. pre-training exposure、RL data difficulty、mid-training compute allocation 和 process reward 分别控制什么变量。
  3. 它如何调和 2504.138372509.251232506.10947 等论文之间的张力。
  4. 对实际 reasoning model 训练有什么可复用的课程设计、数据过滤和 reward 设计启发。

判断边界:

  • 实验模型是 100M 参数 Qwen2.5-style decoder-only model,从零训练在合成 reasoning corpus 上;它用于因果隔离和机制诊断,不等同于直接证明 7B/70B frontier models 的同等现象。
  • 任务来自 GSM-Infinite 风格的可控 arithmetic DAG,优势是 contamination-free、可验证、可控;代价是真实数学、代码和 agent tasks 中 primitive、context 和 reward 都更混杂。
  • pass@128 在本文中是 capability expansion 的关键指标,因为它近似测量模型在多次采样下是否已经覆盖某类解法;部署上的 pass@1、best-of-N 或 latency-aware score 需要另行分析。
  • process verification 依赖可解析的 reasoning trace 和 gold DAG。真实开放式问题中,过程监督质量、覆盖范围和误判风险会决定这条路线是否可迁移。

论文脉络

1. 问题背景

LLM reasoning RL 争论的核心问题是:post-training 是把 base model 已有能力变成更高概率输出,还是能让模型学到预训练之外的新推理能力?

已有论文给出的证据分裂明显。2504.13837 用 pass@kk 说明很多 RLVR 模型在标准数学和代码任务上主要提升 sampling efficiency,base model 的大 kk 覆盖常常更强;2506.10947 说明一些 RLVR gain 可由 model prior、format reward 和算法偏差解释;2509.25123 则用可控 composition task 给出 RL 学到组合能力的正向证据。

本文认为这些结论可以统一:不同论文观察的是训练空间里的不同区域。若任务在 pre-training 中覆盖充分,RL 主要提升已存在轨迹的概率;若任务完全超出模型可探索范围,RL reward 稀疏到难以提供信号;当 RL 数据落在模型刚好能偶尔做对的 edge of competence,RL 才能把探索到的成功模式转成更稳定的能力扩展。

2. 可控合成推理框架

论文基于 GSM-Infinite 构造合成 arithmetic word problems。每个问题由一个 dependency graph 表示:

G=(V,E), \mathcal G=(\mathcal V,\mathcal E),

其中节点 vVv\in\mathcal V 是中间变量,边 eEe\in\mathcal E 表示依赖关系,最终 answer node vv^\star 给出答案 aa^\star。任务复杂度由操作数定义:

op(G)=E. \mathrm{op}(\mathcal G)=|\mathcal E|.

同一个 graph 可以被不同 contextual template τ\tau 渲染成自然语言问题,例如 animals-zoo、teachers-school、movie-festival。这样,论文把推理能力拆成两个轴:

  • Extrapolative / depth generalization:模型能否处理比训练中更深、更复杂的 dependency graph。
  • Contextual / breadth generalization:模型能否把同一结构推理迁移到不同 surface context。

这套设计的关键是可控性:pre-training、mid-training、post-training 的数据分布彼此可分;结构复杂度和文本 context 可以独立变化;gold DAG 可以用于过程验证。

3. Process-Verified Evaluation

模型输出自由文本 solution 后,系统把它解析为 predicted graph:

G^=(V^,E^,val^),a^. \hat{\mathcal G}=(\hat{\mathcal V},\hat{\mathcal E},\widehat{\mathrm{val}}), \quad \hat a.

对每个 gold node vv,检查预测中是否存在该节点、依赖父节点是否匹配、数值是否正确:

s(v;G^,G)={1,vV^,paG^(v)=paG(v),val^(v)=val(v),0,otherwise. s(v;\hat{\mathcal G},\mathcal G)= \begin{cases} 1, & v\in\hat{\mathcal V},\quad \mathrm{pa}_{\hat{\mathcal G}}(v)=\mathrm{pa}_{\mathcal G}(v),\quad \widehat{\mathrm{val}}(v)=\mathrm{val}(v),\\ 0, & \text{otherwise}. \end{cases}

过程准确率定义为:

ProcessAcc(G^;G)=1VvVs(v;G^,G). \mathrm{ProcessAcc}(\hat{\mathcal G};\mathcal G) = \frac{1}{|\mathcal V|} \sum_{v\in\mathcal V}s(v;\hat{\mathcal G},\mathcal G).

只有当过程完全正确且最终答案正确时,样本才算 verified correct:

VerifiedCorrect(a^,G^;a,G)=1[ProcessAcc(G^;G)=1a^=a]. \mathrm{VerifiedCorrect}(\hat a,\hat{\mathcal G};a^\star,\mathcal G)= \mathbf 1[ \mathrm{ProcessAcc}(\hat{\mathcal G};\mathcal G)=1 \land \hat a=a^\star ].

论文所有 pass@kk 都使用这个严格标准。这一点很重要:它降低了 lucky answer、格式 shortcut 和 outcome reward hacking 对指标的污染。

4. 训练设置

模型为 100M 参数 Qwen2.5-style decoder-only model:12 layers,hidden size 768,12 attention heads,2 KV heads,intermediate size 3072,SiLU,RMSNorm。作者在合成 corpus 上训练 BPE tokenizer,词表约 2200,最大序列长度 2048。

基础 pre-training 使用 10B tokens,约为参数量的 100 倍。主设置中 pre-training 覆盖 op=210\mathrm{op}=2\text{--}10 的问题,使模型掌握基础 reasoning primitives,同时在更深任务上保留 headroom。

Post-training 使用 GRPO,global batch size 1024,rollout multiplicity r=6r=6,最大 prompt / response length 各 1024,actor learning rate 10610^{-6},KL coefficient 10310^{-3},rollout temperature 1.0,evaluation temperature 0.7。

Mid-training 是 continued pre-training / supervised next-token objective 的简化版本,使用更接近 RL 目标分布的数据,训练在模型有 emerging but incomplete competence 的区域。它的作用是强化 RL 可以放大的 reasoning priors。

5. RL 何时扩展 base model 之外的能力

作者先固定 pre-training,只改变 RL 数据难度。问题按 op\mathrm{op} 分三类:

  • ID: op=210\mathrm{op}=2\text{--}10,处于 pre-training 范围内。
  • OOD-edge: op=1114\mathrm{op}=11\text{--}14,base model 仍有非零 pass@128。
  • OOD-hard: op=1520\mathrm{op}=15\text{--}20,base model 近似 pass@128 为零。

RL 数据使用四个难度段:op=710\mathrm{op}=7\text{--}109129\text{--}12111411\text{--}14172017\text{--}20

核心观察:

  1. 对 ID tasks,RL 可以提升 pass@1,但无法提升 pass@128。这说明模型原本已经覆盖这些解法,RL 主要在重分配概率。
  2. 对 OOD-edge 和 OOD-hard evaluation,使用 edge-of-competence 数据 op=1114\mathrm{op}=11\text{--}14 做 RL,可以提升 pass@128,图 1 概述中报告 well-calibrated 时 pass@128 最高提升约 42%。
  3. 使用太简单的 RL 数据容易重复已会的技能;使用太难的数据会遇到 reward sparsity。最有用的数据位于 fail-at-pass@1 but succeed-at-pass@kk 的区域。

这给出了直接训练建议:构造 RL 数据时,不应只按 benchmark 难度静态筛选,而应按当前模型的 pass@1 / pass@kk 画像动态筛选 edge of competence。随着模型变强,edge 区域也会移动,适合做自步课程。

6. 预训练 exposure 如何影响 contextual generalization

第二组实验固定 RL 数据,把 long-tail context B 在 pre-training 中的 atomic exposure 当变量。模型在 context A 的 op=220\mathrm{op}=2\text{--}20 上大量预训练,同时在 context B 中只加入 op=2\mathrm{op}=2 atomic examples,比例从 0、0.1%、1% 等变化;然后 RL 使用 50% context A + 50% context B、op=220\mathrm{op}=2\text{--}20 的数据。

核心观察:

  1. 0% 或 0.1% context B atomic exposure 时,RL 难以把 context A 的推理迁移到 context B。
  2. 只要 pre-training 中有约 1% context B atomic examples,RL 就能显著提升 context B 任务,并泛化到 op=20\mathrm{op}=20 的困难实例;图 1 概述中报告 pass@128 最高提升约 60%。
  3. graph similarity analysis 显示,简单任务上模型更多复用 context A 中已见 pattern;复杂任务上,拥有足够 context B exposure 的模型能生成更低拓扑相似度的新结构。

本文由此给出 “seed primitives” 观点:RL 可以组合并放大已经存在的 primitive seed,但很难从完全没有 exposure 的新 context 中凭空合成迁移能力。实践上,pre-training / mid-training 需要优先覆盖长尾 domain 的 basic rules,而不一定需要大量高复杂度长样本。

7. Mid-training 与 RL 的 compute 分配

第三组实验研究固定 compute 下 mid-training 和 RL 的分配。作者把 supervised mid-training tokens 和 RL compute 统一成 token-equivalent cost。Chinchilla 近似下:

Ctrain6PT. C_{\mathrm{train}}\approx 6PT.

对 on-policy GRPO,计算拆成 actor rollout、reference forward、policy update forward/backward:

CRL=(8+2γ)PNrLtotal, C_{\mathrm{RL}} = (8+2\gamma)PNrL_{\mathrm{total}},

其中 γ\gamma 表示是否有 reference pass,NN 是 RL samples,rr 是 rollout size,LtotalL_{\mathrm{total}} 是 prompt + completion 长度。折算成 mid-training token cost:

TRL=(43+γ3)NrLtotal. T_{\mathrm{RL}} = \left(\frac{4}{3}+\frac{\gamma}{3}\right)NrL_{\mathrm{total}}.

主文使用 γ=1\gamma=1,所以:

TRL=53NrLtotal. T_{\mathrm{RL}}=\frac{5}{3}NrL_{\mathrm{total}}.

总预算 TT 按 RL ratio β\beta 分配:

Tmid=(1β)T,TRL=βT. T_{\mathrm{mid}}=(1-\beta)T, \quad T_{\mathrm{RL}}=\beta T.

实验比较 Full mid-training、Full RL、Light-RL (β=0.2)(\beta=0.2)、Medium-RL (β=0.5)(\beta=0.5)、Heavy-RL (β=0.8)(\beta=0.8)。主设置使用同一 base model,pre-training 覆盖 op=210\mathrm{op}=2\text{--}10,mid/RL 数据在 op=1114\mathrm{op}=11\text{--}14

核心观察:

  • OOD-edge tasks 上,full mid-training 和 light RL 更强,light RL 的 pass@1 最好。
  • OOD-hard tasks 上,把更多预算给 RL 会提升更深任务的 pass@1 和 pass@128。
  • appendix 的 compute sweep 显示,pass@1 上 hybrid mid+RL 通常优于单独 mid 或单独 RL;pass@128 的最优比例随预算变化,低预算时 Heavy-RL 较好,更高预算时 Full RL 在 OOD-hard pass@128 上更强。

本文对 mid-training 的解释是:mid-training 安装或强化 reasoning priors,RL 扩大探索并强化成功轨迹。若目标是相邻分布可靠性,更多 mid-training + light RL 更合适;若目标是更远 OOD extrapolation,需要保留足够 RL exploration budget。

8. Process supervision 如何缓解 reward hacking

Outcome-only reward 容易奖励 “答案正确但推理链错误” 的轨迹。本文把 process verification 加入 reward:

R=αRout+(1α)Rpv, R=\alpha R_{\mathrm{out}}+(1-\alpha)R_{\mathrm{pv}},

其中 RoutR_{\mathrm{out}} 是 final answer reward,RpvR_{\mathrm{pv}} 是 process verification reward,α\alpha 控制权重。作者还测试严格版本:

R={Rout,Rpv=1,0,otherwise. R= \begin{cases} R_{\mathrm{out}}, & R_{\mathrm{pv}}=1,\\ 0, & \text{otherwise}. \end{cases}

op=1114\mathrm{op}=11\text{--}14 上 post-training 后,process-aware rewards 在 op=1520\mathrm{op}=15\text{--}20 extrapolative settings 上把 pass@1 提升约 4% 到 5%。中等混合比例,例如 0.2Rout+0.8Rpv0.2R_{\mathrm{out}}+0.8R_{\mathrm{pv}},在 outcome accuracy 和 reasoning consistency 之间取得较好平衡;严格 reward 进一步降低错误过程获得奖励的机会。

这个实验和 2403.031852604.04648 的关系在于:当 proxy 或 outcome reward 与真实推理过程不完全一致时,优化会进入 shortcut 区域。本文的优势是 gold DAG 可用,因此能把过程正确性直接放入 reward;真实任务中 process supervision 本身也会成为新的 proxy,需要额外校准。

关键实验/定理

结果 1:RL 只有在 edge of competence 数据上扩展 pass@128

  • 设置:100M Qwen2.5-style model 预训练 10B tokens,ID 为 op=210\mathrm{op}=2\text{--}10;GRPO 使用约 200K samples,分别来自 op=710\mathrm{op}=7\text{--}109129\text{--}12111411\text{--}14172017\text{--}20
  • 指标:strict process-verified pass@1 / pass@128,评估 ID、OOD-edge、OOD-hard。
  • 结果:ID 上 RL 提高 pass@1 但不提高 pass@128;OOD 上使用 op=1114\mathrm{op}=11\text{--}14 edge data 可以提高 pass@128;图 1 报告 well-calibrated 时 pass@128 最高提升约 42%。
  • 解读:RL 是否扩展能力取决于 pre-training headroom 和 RL data calibration。太易的数据只做概率重排,太难的数据 reward 太稀疏。

结果 2:contextual generalization 需要少量 pre-training seed

  • 设置:pre-training 大量覆盖 context A,并改变 context B atomic op=2\mathrm{op}=2 examples 的比例;RL 使用 50% context A + 50% context B,覆盖 op=220\mathrm{op}=2\text{--}20
  • 指标:context B 上 process-verified pass@128,按 operation difficulty 分解。
  • 结果:0% 或 0.1% context B exposure 时,RL 很难迁移;约 1% context B atomic exposure 足以让 RL 在 context B 上泛化到 op=20\mathrm{op}=20;图 1 报告 pass@128 最高提升约 60%。
  • 解读:RL 需要预训练中已存在的 basic primitive seed。长尾 context 的少量 atomic coverage 比盲目增加复杂样本更关键。

结果 3:mid-training 和 RL 在固定 compute 下互补

  • 设置:同一 base model,pre-training 覆盖 op=210\mathrm{op}=2\text{--}10;mid-training 和 RL 都使用 op=1114\mathrm{op}=11\text{--}14 数据;比较 Full mid、Full RL、Light-RL、Medium-RL、Heavy-RL。
  • 指标:OOD-edge 和 OOD-hard 上 pass@1 / pass@128。
  • 结果:OOD-edge pass@1 中 full mid-training / light RL 更强;OOD-hard 中更多 RL budget 更有利;图 1 报告 mid-training + RL 在 OOD-hard 上比 RL-only 高约 10.8%。
  • 解读:mid-training 提供结构化先验和稳定性,RL 提供探索和选择压力。最佳 compute allocation 取决于目标是相邻分布可靠性还是更深 OOD 扩展。

结果 4:process-aware reward 降低 outcome reward hacking

  • 设置:在 op=1114\mathrm{op}=11\text{--}14 上 RL,比较 outcome-only reward、不同 α\alpha 的 mixed reward、strict process-gated reward。
  • 指标:op=1520\mathrm{op}=15\text{--}20 上 process-verified pass@1 / pass@128,错误类型分解。
  • 结果:加入 process verification 后,extrapolative pass@1 提升约 4% 到 5%;中等 process-heavy reward 平衡表现最好,严格 reward 进一步降低错误过程获得奖励。
  • 解读:对有 gold process 的任务,把 reward 从 final answer 扩展到 reasoning graph 能减少 shortcut exploitation,使 RL gain 更接近真实过程改进。

公式:GRPO 与 mid-training 的 compute 等价

  • Mid-training compute:
Cmid=6PTmid. C_{\mathrm{mid}}=6PT_{\mathrm{mid}}.
  • GRPO compute:
CRL=(8+2γ)PNrLtotal. C_{\mathrm{RL}} = (8+2\gamma)PNrL_{\mathrm{total}}.
  • 等价 token cost:
TRL=(43+γ3)NrLtotal, T_{\mathrm{RL}} = \left(\frac{4}{3}+\frac{\gamma}{3}\right)NrL_{\mathrm{total}},

γ=1\gamma=1

TRL=53NrLtotal. T_{\mathrm{RL}}=\frac{5}{3}NrL_{\mathrm{total}}.
  • 这套折算允许比较 “同样 compute 给 mid-training 还是给 RL”。它没有覆盖所有真实系统开销,例如 rollout engine/trainer mismatch、工具调用轨迹长度、通信、checkpoint 传输和 serving bottleneck;这些需要结合 2606.001352409.192562605.14220 的系统视角补充。

证据链强度评估

强证据

  • 合成任务可控,pre-training、mid-training、RL 数据分布可显式操控,降低了真实 benchmark 中 contamination、未知 pretraining prior 和任务混杂的问题。
  • Evaluation 使用 process-verified correctness,避免只看 final answer 导致的 lucky correctness 和 outcome reward hacking。
  • 四个变量形成连贯机制链:pre-training headroom、minimal primitive exposure、mid-training bridge、process-aware reward;每个变量都有对应 ablation。
  • 公开 GitHub、Hugging Face datasets 和 checkpoints,复现实验的材料比多数纯论文结果更完整。

中等强度证据

  • 使用 Qwen2.5-style 100M model 从零训练,适合机制研究,但对大模型 scaling 的外推需要谨慎。
  • mid-training compute equivalence 提供了合理比较口径,但真实 RL 系统中 rollout、trainer、reference、reward model、KV cache 和通信成本会改变 wall-clock 比例。
  • process verification 在合成 DAG 上非常清楚;真实数学、代码、agent 任务中的 process supervision 可能噪声更高,也可能被模型优化成新的 proxy。

需要谨慎的推论

  • “RL 能扩展能力” 在本文中有明确条件:edge-of-competence data、已有 primitive seed、可验证任务、足够 rollout 探索。离开这些条件后,结论强度下降。
  • “1% exposure 足够” 是在本文 context/template 和 100M model 规模下的经验阈值,不能直接变成所有长尾 domain 的固定比例。
  • 论文的 reward hacking 缓解来自高质量 gold DAG。若 process reward model 本身有偏,process-aware reward 也可能诱导新的 Goodhart 问题。

OpenReview / 审稿意见吸收

  • Venue status: 当前档案未记录公开 peer-review 状态。
  • Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
  • Ratings / confidence: 无公开评分可用于校准。
  • Reviewer consensus: 暂无。
  • Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
  • Author response: 暂无公开 rebuttal 记录。
  • 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。

本地讨论补充

1. 讨论收敛点

  • 本文适合放在 RLVR boundary 争论的中间节点:它接受 “很多标准 benchmark 上 RL 像 reranking / sharpening” 的观察,同时指出在可控 OOD-edge 条件下,RL 可以扩展 pass@128。
  • 这篇论文给 “mid-training 是否重要” 提供了较强证据。它把 mid-training 从经验 recipe 提升成一个可计算的 compute allocation 变量。

2. 修正后的理解

  • 对实际训练来说,更有诊断价值的问题是数据位于哪个区域:already-covered、edge-of-competence、unreachable。只有中间区域最适合 RL。
  • pre-training / mid-training 的目标可以理解为铺设 primitive coverage 和 reasoning priors;RL 的目标是把这些 primitives 在边界任务上组合、探索并放大。
  • process supervision 的价值在于把 reward 对齐到推理过程,而不只是最终答案。它降低了 outcome-only reward 给 shortcut 的空间。

3. 后续复验指标

  • 对 7B+ 模型复验 edge-of-competence 筛选:按 fail@1 / pass@kk 分桶训练 RL,观察 pass@128 是否随桶变化。
  • 对真实数学 / 代码任务引入 process verifier 或 executable trace verifier,比较 outcome-only、process-heavy、strict process-gated reward。
  • 把 mid-training token-equivalent compute 和真实 wall-clock / GPU-hour 同时报告,分离算法 compute 与系统开销。
  • 测试不同 base families:Qwen、Llama、DeepSeek、Gemma、Mistral,确认 primitive seed 与 RL readiness 是否模型家族依赖。

4. 详细讲解后的收敛

  • 可以把本文的训练观理解成三段式:pre-training 铺设 primitive coverage,mid-training 把模型推到目标分布附近并稳定 reasoning priors,RL 在 edge-of-competence 区域通过多次采样和 reward 放大成功组合。
  • 本文对 RLVR 争论的关键贡献是把 “RL 是否学到新能力” 变成可诊断条件:已覆盖任务上 RL 主要提升采样效率;完全不可达任务上 reward 太稀疏;边界任务上 RL 最可能把低概率成功轨迹转为可泛化能力。
  • 对训练实践,数据选择比算法标签更关键。先用 pass@1 / pass@kk 给任务分桶,再把 RL 预算投向 fail@1 but pass@kk 的任务,比直接堆更多随机难题更符合本文证据。
  • 本文中的 process reward 可以看作对 outcome reward 的结构化约束。它要求模型不仅给出正确答案,还要生成可验证的中间依赖图,从而减少答案正确但过程错误的样本进入强化闭环。

主要启发

  • RL 数据选择应围绕模型自己的 edge of competence,优先参考模型实际 pass@1 / pass@kk 画像。实用筛选规则可以是:base model pass@1 失败,但 pass@kk 有非零成功率。
  • 长尾能力训练不一定需要一开始就投喂复杂样本。少量 atomic primitive exposure 可能足以让后续 RL 学会组合和迁移。
  • Mid-training 是 reasoning RL pipeline 中的一等变量。它决定模型是否具备可被 RL 放大的 priors,也影响固定 compute 下 pass@1 与 pass@128 的权衡。
  • 对可验证任务,final answer reward 需要尽量配合 process reward 或 trace verifier。缺少过程约束时,RL 可能学会正确答案附近的 shortcut,稳定推理过程的比例会下降。
  • 论文把 “能力扩展” 从总分争论推进到可诊断 checklist:pretraining coverage、task headroom、edge data、primitive seed、mid-training bridge、process reward。

局限

  1. 实验规模较小,100M 参数 Qwen2.5-style model 与现代 reasoning models 在 representation capacity、pretraining diversity、RL stability 上差异很大。
  2. 合成 arithmetic DAG 的 process verification 非常干净,真实问题的 reasoning graph 往往不唯一,正确过程也可能有多条等价路径。
  3. 本文主要关注 GRPO 形式的 RL post-training,没有系统比较 PPO、DAPO、REINFORCE++、RLOO、online distillation、self-training 等不同算法的 interaction。
  4. Mid-training 与 RL 的 compute equivalence 基于 FLOPs 近似,未纳入真实系统中的 rollout/trainer 分离、batching、通信、evaluation、checkpoint 和数据生成成本。
  5. Contextual generalization 的模板空间可控且有限,真实 domain transfer 涉及更多语言、知识、工具、视觉和交互变量。
  6. Process-aware reward 的防 hacking 效果依赖 gold process 质量。若 process reward 错误或不完整,模型仍可能对过程指标 Goodhart。

跨论文关系

  • 2504.13837:本文是直接补充和部分调和。2504.13837 说明标准 benchmark 上 RLVR 常提升 pass@1 但不扩展大 kk 覆盖;本文指出当数据处在 edge of competence 且 pre-training 留有 headroom 时,RL 可以提高 pass@128。
  • 2509.25123:两者都用 controllable synthetic setting 证明 RL 在合适条件下能形成 composition / extrapolation。2509.25123 强调 atomic skills + compositional incentive;本文进一步拆出 primitive seed、pre-training exposure、mid-training bridge 和 edge data calibration。
  • 2506.10947:Spurious Rewards 提醒 RLVR gain 可能来自 prior amplification 和算法偏差;本文通过可控数据分布和 process-verified evaluation 降低这些 confound,并把 true gain 的条件表达为 headroom + edge-of-competence。
  • 2505.24864:ProRL 强调 prolonged RL 可以扩展 reasoning boundary;本文给出更细的条件语言:长期 RL 的收益需要 primitive coverage、边界任务和合适 mid-training priors。
  • 2510.01180:BroRL 从 rollout width 角度扩展探索;本文从数据难度与 training-stage 分配角度解释什么时候探索有用。二者都支持 “RL 需要看到足够可强化成功轨迹”。
  • 2503.14476:DAPO 提供 long-CoT RL recipe 和有效梯度过滤;本文的 edge-of-competence 筛选与 DAPO Dynamic Sampling 在思想上相近,都是过滤全对/全错、保留有学习信号的样本。
  • 2501.12948:DeepSeek-R1 展示 outcome reward 激发 reasoning 的宏观现象;本文解释其中一个可能机制:预训练 / mid-training 已提供 primitive seed,RL 在边界任务上组合和放大。
  • 2606.00135:两者都把 RL compute 拆得更细。Tool-use RL 关注 rollout 与 policy update 的系统成本;本文给出 GRPO token-equivalent compute,用于比较 mid-training 与 RL budget。
  • 2605.14220:本文的结论依赖 pass@kk 和 rollout 分布的精确测量;TIM/VeXact 提醒 rollout/trainer implementation mismatch 会改变 on-policy 优化目标,复验时需要控制。
  • 2403.031852604.04648:本文的 process reward 实验是 outcome reward hacking 的防线之一。它把 reward 从最终答案 proxy 扩展到可验证过程,减少 shortcut exploitation。

Reference Intake Brief

Target

  • Intended target system: 新增论文笔记;更新索引行和 RLVR boundary / compositional generalization / training-stage interplay 关系章节。
  • Existing related assets: papers-index.md2504.138372509.251232506.109472505.248642510.01180
  • Proposed form: 新建独立 Markdown 文档;更新索引行、对应论文的关系章节和站点标签。

Reusable Elements

  1. Edge-of-competence RL data filter:选择 pass@1 失败但 pass@kk 有非零成功率的任务作为 RL 数据。
  2. Primitive seed heuristic:为长尾 context 提供少量 atomic exposure,再用 RL 学组合和迁移。
  3. Mid/RL compute equivalence:用 TRL=53NrLtotalT_{\mathrm{RL}}=\frac{5}{3}NrL_{\mathrm{total}} 近似比较 GRPO 与 mid-training token budget。
  4. Process-verified evaluation:只有过程图和最终答案都正确时才计为 pass@kk 成功。
  5. Process-aware reward:R=αRout+(1α)RpvR=\alpha R_{\mathrm{out}}+(1-\alpha)R_{\mathrm{pv}} 或 strict process-gated outcome reward。

Risks

  • Copyright/over-copying: 只记录摘要式分析、关键公式和实验设置,未复制长段论文正文。
  • Unsourced or unverifiable claims: arXiv 元数据来自 arXiv abs/html;代码、ICML 2026 Spotlight、HF checkpoints 来自官方 GitHub / Hugging Face 页面;作者当前任职来自 Xiang Yue 个人主页,作为补充关系线索使用。
  • Tone/brand mismatch: 中文表达遵循本目录要求,保留技术分析和边界条件。
  • Safety/compliance issues: 本文涉及 reward hacking,但内容是机制诊断和防御性 process supervision,无可直接滥用操作流程。
  • Overlap with existing assets: 与 RLVR boundary / composition / spurious reward 多篇论文高度重叠;新增价值是把 pre-training、mid-training、RL 的因果变量统一到一个可控框架。

Skipped

Material Reason
所有 appendix figures 的逐点读数 HTML / TeX 未提供完整表格数值;笔记保留主文报告的方向和关键百分比。
GitHub 复现实验命令细节 仓库已有安装和脚本说明;本笔记只记录论文分析所需信息。
所有 context templates 和 generator knobs 只保留理解实验因果结构所需的 DAG、op、template、process verification。
Xiang Yue 全部历史论文关系 只记录与当前存档主题直接相关的 reasoning / RL / benchmarking 线索。

Recommendation

Decision: merge

Why: 该论文是本地 RLVR 争论链条中的关键桥接节点。它把 “RL 是 reranking 还是 capability expansion” 从二分问题改写为条件问题:pre-training coverage、primitive seed、edge-of-competence 数据、mid-training bridge 和 process reward 共同决定 RL 是否扩展 reasoning boundary。