2512.07783-interplay-pretraining-midtraining-rl-reasoning
On the Interplay of Pre Training, Mid Training, and RL on Reasoning Language Models
这篇论文用完全可控的合成推理环境把 pre-training、mid-training 和 RL post-training 的作用拆开:RL 能带来真正的 pass@128 能力扩展,但需要两个条件同时成立,base model 在目标区域有足够探索余地,RL 数据位于模型 edge of competence;contextual generalization 还需要预训练中出现过少量相关 primitive seed;mid-training 作为 pre-training 与 RL 的分布桥接,在固定 compute 下能显著提高 RL readiness;把 process verification 放入 reward 可以降低 outcome-only reward hacking,使性能提升更接近有效推理链条。
Source
- Title: On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
- arXiv: https://arxiv.org/abs/2512.07783
- HTML v1: https://arxiv.org/html/2512.07783v1
- PDF v1: https://arxiv.org/pdf/2512.07783v1
- TeX Source v1: https://arxiv.org/e-print/2512.07783v1
- DOI: https://doi.org/10.48550/arXiv.2512.07783
- Code/Project: https://github.com/Interplay-LM-Reasoning/Interplay-LM-Reasoning
- Hugging Face organization: https://huggingface.co/Interplay-LM-Reasoning
- Datasets: https://huggingface.co/datasets/Interplay-LM-Reasoning/composition, https://huggingface.co/datasets/Interplay-LM-Reasoning/context
- Models: https://huggingface.co/Interplay-LM-Reasoning/extrapolation_midtrain, https://huggingface.co/Interplay-LM-Reasoning/extrapolation_rl, https://huggingface.co/Interplay-LM-Reasoning/context_pretrain_2
- Authors: Charlie Zhang, Graham Neubig, Xiang Yue
- Submitted: 2025-12-08
- Current version read: v1, submitted Mon, 8 Dec 2025 18:12:10 UTC
- Subjects: Computation and Language (
cs.CL) - Venue status: arXiv v1 未写正式 venue;官方 GitHub README 标注为 ICML 2026 Spotlight,后续若 arXiv camera-ready 更新需要复核。
作者与关系
- Charlie Zhang: Carnegie Mellon University, Language Technologies Institute.
- Graham Neubig: Carnegie Mellon University, Language Technologies Institute.
- Xiang Yue: Carnegie Mellon University, Language Technologies Institute.
阅读目标与判断边界
本笔记关注:
- 论文如何把 “RL 到底有没有扩展 reasoning ability” 变成可控实验问题。
- pre-training exposure、RL data difficulty、mid-training compute allocation 和 process reward 分别控制什么变量。
- 它如何调和 2504.13837、2509.25123、2506.10947 等论文之间的张力。
- 对实际 reasoning model 训练有什么可复用的课程设计、数据过滤和 reward 设计启发。
判断边界:
- 实验模型是 100M 参数 Qwen2.5-style decoder-only model,从零训练在合成 reasoning corpus 上;它用于因果隔离和机制诊断,不等同于直接证明 7B/70B frontier models 的同等现象。
- 任务来自 GSM-Infinite 风格的可控 arithmetic DAG,优势是 contamination-free、可验证、可控;代价是真实数学、代码和 agent tasks 中 primitive、context 和 reward 都更混杂。
- pass@128 在本文中是 capability expansion 的关键指标,因为它近似测量模型在多次采样下是否已经覆盖某类解法;部署上的 pass@1、best-of-N 或 latency-aware score 需要另行分析。
- process verification 依赖可解析的 reasoning trace 和 gold DAG。真实开放式问题中,过程监督质量、覆盖范围和误判风险会决定这条路线是否可迁移。
论文脉络
1. 问题背景
LLM reasoning RL 争论的核心问题是:post-training 是把 base model 已有能力变成更高概率输出,还是能让模型学到预训练之外的新推理能力?
已有论文给出的证据分裂明显。2504.13837 用 pass@
本文认为这些结论可以统一:不同论文观察的是训练空间里的不同区域。若任务在 pre-training 中覆盖充分,RL 主要提升已存在轨迹的概率;若任务完全超出模型可探索范围,RL reward 稀疏到难以提供信号;当 RL 数据落在模型刚好能偶尔做对的 edge of competence,RL 才能把探索到的成功模式转成更稳定的能力扩展。
2. 可控合成推理框架
论文基于 GSM-Infinite 构造合成 arithmetic word problems。每个问题由一个 dependency graph 表示:
其中节点
同一个 graph 可以被不同 contextual template
- Extrapolative / depth generalization:模型能否处理比训练中更深、更复杂的 dependency graph。
- Contextual / breadth generalization:模型能否把同一结构推理迁移到不同 surface context。
这套设计的关键是可控性:pre-training、mid-training、post-training 的数据分布彼此可分;结构复杂度和文本 context 可以独立变化;gold DAG 可以用于过程验证。
3. Process-Verified Evaluation
模型输出自由文本 solution 后,系统把它解析为 predicted graph:
对每个 gold node
过程准确率定义为:
只有当过程完全正确且最终答案正确时,样本才算 verified correct:
论文所有 pass@
4. 训练设置
模型为 100M 参数 Qwen2.5-style decoder-only model:12 layers,hidden size 768,12 attention heads,2 KV heads,intermediate size 3072,SiLU,RMSNorm。作者在合成 corpus 上训练 BPE tokenizer,词表约 2200,最大序列长度 2048。
基础 pre-training 使用 10B tokens,约为参数量的 100 倍。主设置中 pre-training 覆盖
Post-training 使用 GRPO,global batch size 1024,rollout multiplicity
Mid-training 是 continued pre-training / supervised next-token objective 的简化版本,使用更接近 RL 目标分布的数据,训练在模型有 emerging but incomplete competence 的区域。它的作用是强化 RL 可以放大的 reasoning priors。
5. RL 何时扩展 base model 之外的能力
作者先固定 pre-training,只改变 RL 数据难度。问题按
- ID:
,处于 pre-training 范围内。 - OOD-edge:
,base model 仍有非零 pass@128。 - OOD-hard:
,base model 近似 pass@128 为零。
RL 数据使用四个难度段:
核心观察:
- 对 ID tasks,RL 可以提升 pass@1,但无法提升 pass@128。这说明模型原本已经覆盖这些解法,RL 主要在重分配概率。
- 对 OOD-edge 和 OOD-hard evaluation,使用 edge-of-competence 数据
做 RL,可以提升 pass@128,图 1 概述中报告 well-calibrated 时 pass@128 最高提升约 42%。 - 使用太简单的 RL 数据容易重复已会的技能;使用太难的数据会遇到 reward sparsity。最有用的数据位于 fail-at-pass@1 but succeed-at-pass@
的区域。
这给出了直接训练建议:构造 RL 数据时,不应只按 benchmark 难度静态筛选,而应按当前模型的 pass@1 / pass@
6. 预训练 exposure 如何影响 contextual generalization
第二组实验固定 RL 数据,把 long-tail context B 在 pre-training 中的 atomic exposure 当变量。模型在 context A 的
核心观察:
- 0% 或 0.1% context B atomic exposure 时,RL 难以把 context A 的推理迁移到 context B。
- 只要 pre-training 中有约 1% context B atomic examples,RL 就能显著提升 context B 任务,并泛化到
的困难实例;图 1 概述中报告 pass@128 最高提升约 60%。 - graph similarity analysis 显示,简单任务上模型更多复用 context A 中已见 pattern;复杂任务上,拥有足够 context B exposure 的模型能生成更低拓扑相似度的新结构。
本文由此给出 “seed primitives” 观点:RL 可以组合并放大已经存在的 primitive seed,但很难从完全没有 exposure 的新 context 中凭空合成迁移能力。实践上,pre-training / mid-training 需要优先覆盖长尾 domain 的 basic rules,而不一定需要大量高复杂度长样本。
7. Mid-training 与 RL 的 compute 分配
第三组实验研究固定 compute 下 mid-training 和 RL 的分配。作者把 supervised mid-training tokens 和 RL compute 统一成 token-equivalent cost。Chinchilla 近似下:
对 on-policy GRPO,计算拆成 actor rollout、reference forward、policy update forward/backward:
其中
主文使用
总预算
实验比较 Full mid-training、Full RL、Light-RL
核心观察:
- OOD-edge tasks 上,full mid-training 和 light RL 更强,light RL 的 pass@1 最好。
- OOD-hard tasks 上,把更多预算给 RL 会提升更深任务的 pass@1 和 pass@128。
- appendix 的 compute sweep 显示,pass@1 上 hybrid mid+RL 通常优于单独 mid 或单独 RL;pass@128 的最优比例随预算变化,低预算时 Heavy-RL 较好,更高预算时 Full RL 在 OOD-hard pass@128 上更强。
本文对 mid-training 的解释是:mid-training 安装或强化 reasoning priors,RL 扩大探索并强化成功轨迹。若目标是相邻分布可靠性,更多 mid-training + light RL 更合适;若目标是更远 OOD extrapolation,需要保留足够 RL exploration budget。
8. Process supervision 如何缓解 reward hacking
Outcome-only reward 容易奖励 “答案正确但推理链错误” 的轨迹。本文把 process verification 加入 reward:
其中
在
这个实验和 2403.03185、2604.04648 的关系在于:当 proxy 或 outcome reward 与真实推理过程不完全一致时,优化会进入 shortcut 区域。本文的优势是 gold DAG 可用,因此能把过程正确性直接放入 reward;真实任务中 process supervision 本身也会成为新的 proxy,需要额外校准。
关键实验/定理
结果 1:RL 只有在 edge of competence 数据上扩展 pass@128
- 设置:100M Qwen2.5-style model 预训练 10B tokens,ID 为
;GRPO 使用约 200K samples,分别来自 、 、 、 。 - 指标:strict process-verified pass@1 / pass@128,评估 ID、OOD-edge、OOD-hard。
- 结果:ID 上 RL 提高 pass@1 但不提高 pass@128;OOD 上使用
edge data 可以提高 pass@128;图 1 报告 well-calibrated 时 pass@128 最高提升约 42%。 - 解读:RL 是否扩展能力取决于 pre-training headroom 和 RL data calibration。太易的数据只做概率重排,太难的数据 reward 太稀疏。
结果 2:contextual generalization 需要少量 pre-training seed
- 设置:pre-training 大量覆盖 context A,并改变 context B atomic
examples 的比例;RL 使用 50% context A + 50% context B,覆盖 。 - 指标:context B 上 process-verified pass@128,按 operation difficulty 分解。
- 结果:0% 或 0.1% context B exposure 时,RL 很难迁移;约 1% context B atomic exposure 足以让 RL 在 context B 上泛化到
;图 1 报告 pass@128 最高提升约 60%。 - 解读:RL 需要预训练中已存在的 basic primitive seed。长尾 context 的少量 atomic coverage 比盲目增加复杂样本更关键。
结果 3:mid-training 和 RL 在固定 compute 下互补
- 设置:同一 base model,pre-training 覆盖
;mid-training 和 RL 都使用 数据;比较 Full mid、Full RL、Light-RL、Medium-RL、Heavy-RL。 - 指标:OOD-edge 和 OOD-hard 上 pass@1 / pass@128。
- 结果:OOD-edge pass@1 中 full mid-training / light RL 更强;OOD-hard 中更多 RL budget 更有利;图 1 报告 mid-training + RL 在 OOD-hard 上比 RL-only 高约 10.8%。
- 解读:mid-training 提供结构化先验和稳定性,RL 提供探索和选择压力。最佳 compute allocation 取决于目标是相邻分布可靠性还是更深 OOD 扩展。
结果 4:process-aware reward 降低 outcome reward hacking
- 设置:在
上 RL,比较 outcome-only reward、不同 的 mixed reward、strict process-gated reward。 - 指标:
上 process-verified pass@1 / pass@128,错误类型分解。 - 结果:加入 process verification 后,extrapolative pass@1 提升约 4% 到 5%;中等 process-heavy reward 平衡表现最好,严格 reward 进一步降低错误过程获得奖励。
- 解读:对有 gold process 的任务,把 reward 从 final answer 扩展到 reasoning graph 能减少 shortcut exploitation,使 RL gain 更接近真实过程改进。
公式:GRPO 与 mid-training 的 compute 等价
- Mid-training compute:
- GRPO compute:
- 等价 token cost:
当
- 这套折算允许比较 “同样 compute 给 mid-training 还是给 RL”。它没有覆盖所有真实系统开销,例如 rollout engine/trainer mismatch、工具调用轨迹长度、通信、checkpoint 传输和 serving bottleneck;这些需要结合 2606.00135、2409.19256 和 2605.14220 的系统视角补充。
证据链强度评估
强证据
- 合成任务可控,pre-training、mid-training、RL 数据分布可显式操控,降低了真实 benchmark 中 contamination、未知 pretraining prior 和任务混杂的问题。
- Evaluation 使用 process-verified correctness,避免只看 final answer 导致的 lucky correctness 和 outcome reward hacking。
- 四个变量形成连贯机制链:pre-training headroom、minimal primitive exposure、mid-training bridge、process-aware reward;每个变量都有对应 ablation。
- 公开 GitHub、Hugging Face datasets 和 checkpoints,复现实验的材料比多数纯论文结果更完整。
中等强度证据
- 使用 Qwen2.5-style 100M model 从零训练,适合机制研究,但对大模型 scaling 的外推需要谨慎。
- mid-training compute equivalence 提供了合理比较口径,但真实 RL 系统中 rollout、trainer、reference、reward model、KV cache 和通信成本会改变 wall-clock 比例。
- process verification 在合成 DAG 上非常清楚;真实数学、代码、agent 任务中的 process supervision 可能噪声更高,也可能被模型优化成新的 proxy。
需要谨慎的推论
- “RL 能扩展能力” 在本文中有明确条件:edge-of-competence data、已有 primitive seed、可验证任务、足够 rollout 探索。离开这些条件后,结论强度下降。
- “1% exposure 足够” 是在本文 context/template 和 100M model 规模下的经验阈值,不能直接变成所有长尾 domain 的固定比例。
- 论文的 reward hacking 缓解来自高质量 gold DAG。若 process reward model 本身有偏,process-aware reward 也可能诱导新的 Goodhart 问题。
OpenReview / 审稿意见吸收
- Venue status: 当前档案未记录公开 peer-review 状态。
- Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
- Ratings / confidence: 无公开评分可用于校准。
- Reviewer consensus: 暂无。
- Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
- Author response: 暂无公开 rebuttal 记录。
- 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。
本地讨论补充
1. 讨论收敛点
- 本文适合放在 RLVR boundary 争论的中间节点:它接受 “很多标准 benchmark 上 RL 像 reranking / sharpening” 的观察,同时指出在可控 OOD-edge 条件下,RL 可以扩展 pass@128。
- 这篇论文给 “mid-training 是否重要” 提供了较强证据。它把 mid-training 从经验 recipe 提升成一个可计算的 compute allocation 变量。
2. 修正后的理解
- 对实际训练来说,更有诊断价值的问题是数据位于哪个区域:already-covered、edge-of-competence、unreachable。只有中间区域最适合 RL。
- pre-training / mid-training 的目标可以理解为铺设 primitive coverage 和 reasoning priors;RL 的目标是把这些 primitives 在边界任务上组合、探索并放大。
- process supervision 的价值在于把 reward 对齐到推理过程,而不只是最终答案。它降低了 outcome-only reward 给 shortcut 的空间。
3. 后续复验指标
- 对 7B+ 模型复验 edge-of-competence 筛选:按 fail@1 / pass@
分桶训练 RL,观察 pass@128 是否随桶变化。 - 对真实数学 / 代码任务引入 process verifier 或 executable trace verifier,比较 outcome-only、process-heavy、strict process-gated reward。
- 把 mid-training token-equivalent compute 和真实 wall-clock / GPU-hour 同时报告,分离算法 compute 与系统开销。
- 测试不同 base families:Qwen、Llama、DeepSeek、Gemma、Mistral,确认 primitive seed 与 RL readiness 是否模型家族依赖。
4. 详细讲解后的收敛
- 可以把本文的训练观理解成三段式:pre-training 铺设 primitive coverage,mid-training 把模型推到目标分布附近并稳定 reasoning priors,RL 在 edge-of-competence 区域通过多次采样和 reward 放大成功组合。
- 本文对 RLVR 争论的关键贡献是把 “RL 是否学到新能力” 变成可诊断条件:已覆盖任务上 RL 主要提升采样效率;完全不可达任务上 reward 太稀疏;边界任务上 RL 最可能把低概率成功轨迹转为可泛化能力。
- 对训练实践,数据选择比算法标签更关键。先用 pass@1 / pass@
给任务分桶,再把 RL 预算投向 fail@1 but pass@ 的任务,比直接堆更多随机难题更符合本文证据。 - 本文中的 process reward 可以看作对 outcome reward 的结构化约束。它要求模型不仅给出正确答案,还要生成可验证的中间依赖图,从而减少答案正确但过程错误的样本进入强化闭环。
主要启发
- RL 数据选择应围绕模型自己的 edge of competence,优先参考模型实际 pass@1 / pass@
画像。实用筛选规则可以是:base model pass@1 失败,但 pass@ 有非零成功率。 - 长尾能力训练不一定需要一开始就投喂复杂样本。少量 atomic primitive exposure 可能足以让后续 RL 学会组合和迁移。
- Mid-training 是 reasoning RL pipeline 中的一等变量。它决定模型是否具备可被 RL 放大的 priors,也影响固定 compute 下 pass@1 与 pass@128 的权衡。
- 对可验证任务,final answer reward 需要尽量配合 process reward 或 trace verifier。缺少过程约束时,RL 可能学会正确答案附近的 shortcut,稳定推理过程的比例会下降。
- 论文把 “能力扩展” 从总分争论推进到可诊断 checklist:pretraining coverage、task headroom、edge data、primitive seed、mid-training bridge、process reward。
局限
- 实验规模较小,100M 参数 Qwen2.5-style model 与现代 reasoning models 在 representation capacity、pretraining diversity、RL stability 上差异很大。
- 合成 arithmetic DAG 的 process verification 非常干净,真实问题的 reasoning graph 往往不唯一,正确过程也可能有多条等价路径。
- 本文主要关注 GRPO 形式的 RL post-training,没有系统比较 PPO、DAPO、REINFORCE++、RLOO、online distillation、self-training 等不同算法的 interaction。
- Mid-training 与 RL 的 compute equivalence 基于 FLOPs 近似,未纳入真实系统中的 rollout/trainer 分离、batching、通信、evaluation、checkpoint 和数据生成成本。
- Contextual generalization 的模板空间可控且有限,真实 domain transfer 涉及更多语言、知识、工具、视觉和交互变量。
- Process-aware reward 的防 hacking 效果依赖 gold process 质量。若 process reward 错误或不完整,模型仍可能对过程指标 Goodhart。
跨论文关系
- 与 2504.13837:本文是直接补充和部分调和。
2504.13837说明标准 benchmark 上 RLVR 常提升 pass@1 但不扩展大覆盖;本文指出当数据处在 edge of competence 且 pre-training 留有 headroom 时,RL 可以提高 pass@128。 - 与 2509.25123:两者都用 controllable synthetic setting 证明 RL 在合适条件下能形成 composition / extrapolation。
2509.25123强调 atomic skills + compositional incentive;本文进一步拆出 primitive seed、pre-training exposure、mid-training bridge 和 edge data calibration。 - 与 2506.10947:Spurious Rewards 提醒 RLVR gain 可能来自 prior amplification 和算法偏差;本文通过可控数据分布和 process-verified evaluation 降低这些 confound,并把 true gain 的条件表达为 headroom + edge-of-competence。
- 与 2505.24864:ProRL 强调 prolonged RL 可以扩展 reasoning boundary;本文给出更细的条件语言:长期 RL 的收益需要 primitive coverage、边界任务和合适 mid-training priors。
- 与 2510.01180:BroRL 从 rollout width 角度扩展探索;本文从数据难度与 training-stage 分配角度解释什么时候探索有用。二者都支持 “RL 需要看到足够可强化成功轨迹”。
- 与 2503.14476:DAPO 提供 long-CoT RL recipe 和有效梯度过滤;本文的 edge-of-competence 筛选与 DAPO Dynamic Sampling 在思想上相近,都是过滤全对/全错、保留有学习信号的样本。
- 与 2501.12948:DeepSeek-R1 展示 outcome reward 激发 reasoning 的宏观现象;本文解释其中一个可能机制:预训练 / mid-training 已提供 primitive seed,RL 在边界任务上组合和放大。
- 与 2606.00135:两者都把 RL compute 拆得更细。Tool-use RL 关注 rollout 与 policy update 的系统成本;本文给出 GRPO token-equivalent compute,用于比较 mid-training 与 RL budget。
- 与 2605.14220:本文的结论依赖 pass@
和 rollout 分布的精确测量;TIM/VeXact 提醒 rollout/trainer implementation mismatch 会改变 on-policy 优化目标,复验时需要控制。 - 与 2403.03185 和 2604.04648:本文的 process reward 实验是 outcome reward hacking 的防线之一。它把 reward 从最终答案 proxy 扩展到可验证过程,减少 shortcut exploitation。
Reference Intake Brief
Target
- Intended target system: 新增论文笔记;更新索引行和 RLVR boundary / compositional generalization / training-stage interplay 关系章节。
- Existing related assets: papers-index.md;2504.13837;2509.25123;2506.10947;2505.24864;2510.01180。
- Proposed form: 新建独立 Markdown 文档;更新索引行、对应论文的关系章节和站点标签。
Reusable Elements
- Edge-of-competence RL data filter:选择 pass@1 失败但 pass@
有非零成功率的任务作为 RL 数据。 - Primitive seed heuristic:为长尾 context 提供少量 atomic exposure,再用 RL 学组合和迁移。
- Mid/RL compute equivalence:用
近似比较 GRPO 与 mid-training token budget。 - Process-verified evaluation:只有过程图和最终答案都正确时才计为 pass@
成功。 - Process-aware reward:
或 strict process-gated outcome reward。
Risks
- Copyright/over-copying: 只记录摘要式分析、关键公式和实验设置,未复制长段论文正文。
- Unsourced or unverifiable claims: arXiv 元数据来自 arXiv abs/html;代码、ICML 2026 Spotlight、HF checkpoints 来自官方 GitHub / Hugging Face 页面;作者当前任职来自 Xiang Yue 个人主页,作为补充关系线索使用。
- Tone/brand mismatch: 中文表达遵循本目录要求,保留技术分析和边界条件。
- Safety/compliance issues: 本文涉及 reward hacking,但内容是机制诊断和防御性 process supervision,无可直接滥用操作流程。
- Overlap with existing assets: 与 RLVR boundary / composition / spurious reward 多篇论文高度重叠;新增价值是把 pre-training、mid-training、RL 的因果变量统一到一个可控框架。
Skipped
| Material | Reason |
|---|---|
| 所有 appendix figures 的逐点读数 | HTML / TeX 未提供完整表格数值;笔记保留主文报告的方向和关键百分比。 |
| GitHub 复现实验命令细节 | 仓库已有安装和脚本说明;本笔记只记录论文分析所需信息。 |
| 所有 context templates 和 generator knobs | 只保留理解实验因果结构所需的 DAG、op、template、process verification。 |
| Xiang Yue 全部历史论文关系 | 只记录与当前存档主题直接相关的 reasoning / RL / benchmarking 线索。 |
Recommendation
Decision: merge
Why: 该论文是本地 RLVR 争论链条中的关键桥接节点。它把 “RL 是 reranking 还是 capability expansion” 从二分问题改写为条件问题:pre-training coverage、primitive seed、edge-of-competence 数据、mid-training bridge 和 process reward 共同决定 RL 是否扩展 reasoning boundary。