2305.20050-lets-verify-step-by-step-process-supervision

Let's Verify Step by Step

这篇是 OpenAI reasoning verification 线的历史节点:它用 80 万 step-level human labels 训练 PRM,在 MATH 500 题 held-out subset 上用 Best-of-1860 选择达到 78.2%,高于强 ORM 和 majority vote;核心价值是把“最终答案正确”拆成“每一步是否仍在正确推理轨道上”,并通过 PRM800K 让过程监督成为后续 reasoning RL / verifier / credit assignment 研究的公共起点。可信度边界同样明确:大规模结果依赖未开放的 GPT-4 系列基座、MATH 专域、Best-of-N 搜索评测和不完全可复现的人工标注流程。

Authors Hunter Lightman, Vineet Kosaraju, Yura Burda, Harri Edwards, Bowen Baker, Teddy Lee, Jan Leike, John Schulman, Ilya Sutskever, Karl Cobbe

已审阅 Archived 2026-06-23 14:27 Updated 2026-07-13 09:48 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

阅读目标与判断边界

本笔记关注:

  1. Process supervision 相对 outcome supervision 的真实信息优势来自哪里。
  2. PRM800K、active learning 和 Best-of-N 评估如何共同支撑 78.2% 结果。
  3. 这篇作为历史论文,对后续 LLM RL、PRM、STV、SRPO 和 CoT monitorability 的影响。

判断边界:

  • 这篇是 ICLR 2024 poster,OpenReview 公共审稿可读;大规模模型权重、模型规模、完整训练细节和人类标注员身份没有完全公开。
  • 论文只训练 reward model / verifier,并用 Best-of-N search 测试 reward model 选择能力;它没有展示用 PRM reward 做 RLHF / RLVR 后训练 generator 的结果。
  • 大规模 PRM 与 ORM 训练集不等价:PRM800K 来自 active learning、偏向 convincing wrong-answer samples,ORM 使用 100 uniform samples / problem 且数据量约大一个数量级。作者通过小规模 synthetic supervision 尝试补上公平比较。
  • PRM800K 训练中纳入 4500 个 MATH test split problems,因此主评测只在剩余随机 500 题 held-out subset 上做;这不等价于完整 MATH test set 的严格未见评测。

论文脉络

1. 研究问题、背景和价值

多步推理的失败常发生在中间步骤。Outcome supervision 只看最终答案,对错误轨迹只能给一个整体负标签;当解题链很长时,模型需要从一条负样本中自己推断哪一步开始出错。数学题有自动判答案的优势,所以 outcome label 成本低,但它无法区分“推理过程正确但最后算错”“过程错误但碰巧答案正确”“前缀正确、后缀走偏”等情况。

Process supervision 直接给中间 step 标签,目标是把 credit assignment 从整条 solution 降到 step。对 reward model 来说,这会把训练问题从“判断整条轨迹是否最终正确”变成“判断当前 prefix 之后这一步是否仍然合理”。对 alignment 来说,过程监督还把奖励绑定到 human-endorsed chain-of-thought,减少模型通过不可信过程拿到正确答案的空间。

2. 已有解决方案与不足

此前最接近的路线是 Uesato et al. 2022,在 grade-school math 上比较 process feedback 和 outcome feedback,发现最终 performance 接近,process supervision 更省数据。OpenAI 这篇认为仍有三个空白:

  • GSM8K 难度较低,reward model 在更难的 MATH 上可能更需要细粒度 credit signal。
  • 小规模模型和小数据可能掩盖 process supervision 的 scaling 优势。
  • outcome label 在数学题里虽然便宜,但会把 false positive solution 当作正例,尤其是推理过程错误但最后答案正确的样本。

因此作者把问题设成:在更强 base model、更难数据、更大 human step label 规模下,PRM 是否能训练出比 ORM 更可靠的 verifier。

3. 作者可能的思考路径

OpenAI 早期 GSM8K verifier 线已经证明:对同一个问题采很多候选答案,再用 verifier 选最好的一条,比单纯让 generator 直接输出更有效。这个路线自然遇到 verifier 的上限:ORM 只能看整条 solution 的正确性,训练目标很稀疏,且容易被“看起来像正确答案”的错误推理干扰。

如果把数学解答强制成 newline-delimited steps,人工标注员可以在第一处错误停止。这样一条错误 solution 不再只提供一个负标签,而提供若干个正 step 和一个 first-error step。每条人工反馈的单位成本提高有限,但信息密度明显增加。下一步就是通过 active learning 把标注预算集中到当前 PRM 最容易被误导的 wrong-answer solutions 上。

4. 核心假设或切入点

  • Step label 的信息密度足以抵消人工标注成本,尤其是在长链、难题和错误率高的区域。
  • PRM 的 step correctness 概率可以通过 product reduction 合成为 solution score,用于 Best-of-N reranking。
  • convincing wrong-answer samples 对训练 PRM 更有价值,因为它们暴露了当前 PRM 认为“高分但实际最终错误”的轨迹。
  • 大 PRM 可以近似 human step supervision,用于小模型消融,降低大规模人工标注的复验成本。

5. 方法 / 系统 / 理论框架

整体 pipeline 分为 generator、PRM800K 数据、reward model 和 Best-of-N 评估四层。

Generator 由 GPT-4 base model / 小规模 GPT-4-like base model 出发,先在 MathMix 上继续预训练,再用正确答案的 few-shot MATH training solutions finetune 一轮,让输出变成 newline-delimited step-by-step format。这个 finetune 目标只服务格式化,不声称提升数学能力。

PRM800K 标注时,人类对每个 step 给 positive、negative、neutral 三类标签。Positive 表示正确且推进解题;negative 表示错误或不合理;neutral 处理语义模糊或有效但进展弱的步骤。训练时只监督到 first incorrect step,使错误 solution 的 process label 与 outcome label 在“都揭示有错误”这一点上更可比,同时让 process label 额外提供错误位置。

ORM 的训练目标是 final token 上预测整条 solution 是否最终正确。大规模 ORM 使用 generator 对每个 problem uniform sample 100 条解答,自动判 final answer。PRM 在每个 step 末尾预测 label token。测试时 PRM 单次 forward 得到所有 step correctness probability,默认把 neutral 视作 positive,并用 step probability 的 product 作为 solution score。

评估统一使用 Best-of-N search:对每个 test problem 采 N 条 generator solution,用 RM 选分数最高的一条,再用 final answer checker 判是否正确。这里 reward model 的能力等价于“在候选池中挑对答案”的能力,尚未进入 generator policy update。

6. 结论链条

  • Large-scale 结果显示 PRM 在 Best-of-1860 上解出 78.2%,ORM 为 72.4%,majority voting 为 69.6%。
  • 小规模 synthetic supervision 把数据集固定,分别用大 PRM 提供 process label、用大 PRM 提供 outcome label、用 final-answer checker 提供 outcome label。Process supervision 在 1-200 samples / problem 的数据规模上都领先。
  • Active learning 小规模消融中,用 selector PRM 从 1000 samples / problem 中挑 convincing wrong-answer samples,估计约有 2.6x data efficiency gain。
  • OOD STEM 测试中,PRM 在 recent AP / AMC questions 上 aggregate best-of-100 为 72.9%,ORM 为 63.8%,majority vote 为 61.3%,支持一定分布外鲁棒性。
  • OpenReview 审稿认可结果和数据集贡献,同时指出可复现性、数学域泛化和未做 RLHF generator training 是主要边界。

领域相关研究

研究线 代表工作 和这篇的关系
GSM8K / verifier reranking Training Verifiers to Solve Math Word Problems Karl Cobbe、Vineet Kosaraju、John Schulman 等同一 OpenAI math verifier 线。早期工作训练 verifier 判断完整答案正确性;这篇把 verifier 标签降到 step。
Process vs outcome feedback Uesato et al. 2022 直接前序;Uesato 在 grade-school math 上发现 outcome / process 最终性能接近,OpenAI 用更强模型、更难 MATH 和更大 step-label 数据得到更明显差距。
自动过程监督 / PRM 扩展 Math-Shepherd、OmegaPRM、Rewarding Progress 后续研究试图降低人工 step labels 成本,或把 process reward 定义成 progress / step-level advantage。Rewarding Progress 明确指出 dense human labels 成本不具备可扩展性,并把 process reward 设计为未来正确概率的变化。
理论反思 Do We Need to Verify Step by Step? ICML 2025 理论工作指出,在标准 coverage 假设下 outcome supervision 的统计难度不高于 process supervision 到超多项式级别;经验差距更可能来自算法、优化和数据构造限制。
Reset / self-localized credit assignment 2605.25507 SRPO SRPO 延续 first-error signal 视角,但用模型自定位和 shared-prefix suffix resampling 替代外部 step label / PRM。
Verifier self-training 2605.30290 STV STV 关注 verifier 自训练、verifier-guided refinement 和 on-policy distillation;这篇提供人工 PRM800K 作为早期高质量 PRM 参照。
CoT monitorability 与安全 2503.11926 CoT monitorability Process supervision 强化人类认可的推理过程;CoT monitorability 论文提醒把 CoT / process monitor 放入 reward 后可能改变可见推理分布并诱导 obfuscation。
RLVR outcome reward credit assignment DAPO, OTB, VIMPO 这些后续工作大多保留 outcome-only verifier,转向优化 estimator、baseline、token-level value 或 rollout construction;这篇代表更直接的人工过程标签路线。

关键实验/定理

结果 1:Large-scale PRM vs ORM vs majority voting

  • 设置:large-scale models 从 base GPT-4 finetune;generator 生成 1860 条 test solutions / problem;评估在随机保留的 500 个 MATH test problems 上做 Best-of-N;PRM 使用 PRM800K step labels,ORM 使用 generator uniform samples,100 samples / problem。
  • Baseline:large-scale ORM;majority voting / self-consistency;作者还试过 RM-weighted voting,但未明显提升。
  • 指标:Best-of-1860 选中答案的 final-answer correctness。
  • 结果:PRM 78.2%,ORM 72.4%,majority voting 69.6%。PRM 在所有 N 上领先,且 N 增大时差距扩大。
  • 解读:在候选池很大时,PRM 更能过滤“看起来合理但有中间错误”的答案。这个结论强支撑 reward model reranking 能力;它没有直接证明 PRM reward 用于 RL 更新后的 generator 性能。

结果 2:PRM800K 数据构成与 active learning

  • 设置:原始收集 1,085,590 个 step labels、101,599 个 solution samples;训练过滤后约 800K step labels、75K solutions。Phase 1 约 40K labels,占 5%;Phase 2 分 10 generations,每代用当前 PRM 选高分 wrong-answer solutions 给标注员。
  • Baseline:uniformly surfaced generator solutions;phase 1 多候选 step 标注;phase 2 active learning。
  • 指标:数据平衡、标注质量控制、后续 small-scale active learning data efficiency。
  • 结果:combined 数据中最终答案正确的 solution 约 14.2%,但正确 steps 约 73.1%;phase 2 绝大多数是错误答案 solution,但仍包含大量正确前缀 step。标注员先做 30 道 quality-control questions,要求至少 75% 与 gold labels 一致,后续每代保留 10-20 个 QC problems。
  • 解读:PRM800K 的价值集中在“高迷惑度错误轨迹里的正确前缀和首错位置”。这也带来数据偏差:PRM 训练数据偏向 wrong-answer solution,无法直接拿同一数据训练公平 ORM。

结果 3:Small-scale synthetic supervision 消融

  • 设置:small-scale GPT-4-like models 预训练 compute 约为 GPT-4 base 的 1/200;固定从 small-scale generator 每题采 1 到 200 条 samples;用 large-scale PRM 分别生成 process labels 和 outcome labels;另设 final-answer checking outcome labels。
  • Baseline:large PRM outcome supervision;final-answer checker outcome supervision。
  • 指标:Best-of-500 selection;200 samples / problem reward model 的 Best-of-N robustness;3 seeds mean / std。
  • 结果:process supervision 在所有数据规模上都优于两类 outcome supervision;large PRM outcome label 比 final-answer checker 更强,说明 false positive final answers 会伤害 ORM。
  • 解读:这个实验弥补了大规模 PRM / ORM 数据集不等价问题。它的代价是 process label 来自 large PRM surrogate,结论依赖大 PRM 近似 human label 的质量。

结果 4:Active learning 的 2.6x data efficiency

  • 设置:训练一个 small-scale PRM_selector,用每题 1 条 sample 的数据;再对每题 1000 条 samples 打分。训练大一点的 reward models 时,从每题选择 N 条:80% 为 selector 认为最 convincing 的 wrong-answer samples,20% 为剩余最 convincing samples。
  • Baseline:uniform data labelling。
  • 指标:small-scale PRM 的 data scaling slope;Best-of-500。
  • 结果:作者通过拟合斜率估计 active learning 约提升 2.6x data efficiency。最大 active-learning dataset 200 samples / problem 略低于趋势线,作者解释为它已经占候选池 1000 条的显著比例,缺少多样性。
  • 解读:active learning 的收益来自把标注预算放到当前 PRM 容易误判的区域。论文也承认 iterative retraining selector 的初步实验不稳定,没有提供可靠收益证据。

结果 5:OOD STEM generalization

  • 设置:held-out recent STEM questions,共 234 题,来自 AP Physics、AP Calculus、AP Chemistry、AMC10、AMC12;这些考试发布时间晚于 pretraining data 编译时间。每题 100 samples,Best-of-100。
  • Baseline:large-scale ORM;majority vote。
  • 指标:final answer correctness。
  • 结果:
Dataset ORM PRM Majority Vote # Problems
AP Calculus 68.9% 86.7% 80.0% 45
AP Chemistry 68.9% 80.0% 71.7% 60
AP Physics 77.8% 86.7% 82.2% 45
AMC10/12 49.1% 53.2% 32.8% 84
Aggregate 63.8% 72.9% 61.3% 234
  • 解读:OOD 结果给“PRM 不只记住 MATH held-out subset”提供补充证据。题量较小,且仍在 STEM/math-like reasoning 分布内,对开放域、agentic coding、长工具链任务的泛化仍需单独验证。

结果 6:PRM scoring strategy

  • 设置:PRM 需要把 step-level label probability 聚合成 solution score。作者比较 neutral 视作 positive / negative,以及 product / minimum 两种 reduction。
  • Baseline:四种 scoring strategies。
  • 指标:Best-of-1860 MATH held-out accuracy。
  • 结果:
Step score / reduction Product Minimum
neutral = positive 78.2% 77.6%
neutral = negative 77.4% 77.8%
  • 解读:四种策略差距很小,默认策略为 neutral=positive + product。Product 会轻微惩罚 step 数更多的解答,后续做 PRM / verifier 复验时需要记录 response length 和 step count 分布。

实验设置与 baseline 审计

  • 模型与初始化:large-scale base GPT-4,无 RLHF;small-scale GPT-4-like base 预训练 compute 约少 200x;所有模型额外在约 1.5B MathMix tokens 上 finetune / continued pretrain。
  • 数据与任务:MATH train + MATH test split 中 4500 题用于 PRM800K training;主评测只用剩余随机 500 MATH test problems。PRM800K filtered train 约 800K step labels / 75K solutions / 12K problems;OOD 用 234 recent AP / AMC STEM questions。
  • RL / 训练配置:这篇不训练 generator policy,不做 PPO/GRPO/RLHF;训练对象是 ORM / PRM reward models。ORM 单 epoch、无 dropout、无 LM objective;PRM 两个 epochs,低 learning rate 对稳定性重要。
  • 系统配置:模型规模、GPU、训练预算和完整 hyperparameter sweep 没有公开;OpenReview reviewer 也把可复现性列为主要问题。
  • 评测协议:Best-of-N search over uniformly sampled generator solutions;MATH 主结果 N=1860;OOD N=100;small-scale synthetic N=500 或不同 N robustness;final answer 自动判题。
  • 统计报告:large-scale 主结果表未报告 seed / CI;small-scale synthetic figures 报 3 seeds mean / std;Best-of-N 子采样可视化展示 N<=1000 的 subsample variance。
  • Baseline 强度:
    • 是否 tuned:ORM 使用 100 uniform samples / problem,数据量比 PRM 大一个数量级,作者称其为 strong ORM baseline;PRM scoring strategy 做了小范围比较。
    • 是否 compute-matched:large-scale PRM / ORM 数据不匹配,PRM 人工 label 更密,ORM sample 更多;small-scale synthetic supervision 尝试把数据固定后比较 label type。
    • 是否 implementation-matched:reward model family 和 generator family一致,但 PRM / ORM 标签来源、样本选择策略和训练数据分布不同。
    • 是否覆盖强替代方案:覆盖 majority voting、ORM、PRM、RM-weighted voting;没有覆盖代码执行 self-verification、tool-assisted checking、tree search、RL generator training 或后续自动 PRM 方法。
    • 是否存在弱化风险:主结果在 proprietary GPT-4 base 上;MATH test split 大部分进入 PRM data;ORM final-answer label 受 false positive 影响;人类标注员背景、模型大小和训练预算不足以完全复现。
    • 结论边界:实验强支撑“在 MATH-like reasoning 的 verifier reranking 中,dense step supervision 比 final-outcome supervision 更可靠”;它不足以单独证明“所有 long-horizon RL 任务都应优先收集人工 step labels”或“PRM reward 直接用于 RL 训练一定优于 outcome reward”。

证据链强度评估

强证据

  • PRM 在 large-scale Best-of-N reranking 上显著优于 ORM 和 majority voting,且 OOD STEM 表给了同方向补充。
  • PRM800K 是明确释放的数据资产,GitHub 提供 raw labels、labeling instructions 和 held-out subset 信息。
  • Small-scale synthetic 消融把数据集固定后比较 process / outcome label,缓解大规模训练数据不公平问题。

中等强度证据

  • Active learning 2.6x data efficiency 来自 small-scale surrogate experiment 和 slope fit,方向可信,精确倍数依赖 selector、candidate pool 和 diversity。
  • “Process supervision 有 alignment benefit”在概念上合理,但这篇主要用 final-answer correctness 证明 verifier 可靠性,安全侧收益仍是机制推断。
  • OOD STEM 泛化支持 moderate distribution shift,但任务仍然是标准化考试型 STEM reasoning。

需要谨慎的推论

  • 大规模模型、训练预算和完整 hyperparameters 未公开,外部很难复现 78.2%。
  • 主评测的 500 MATH held-out problems 来自 test split 的剩余子集;PRM 训练纳入 4500 个 MATH test problems,污染风险和过拟合速度需要独立审计。
  • Best-of-N performance 随 N 增大提升,不等价于训练后单次采样能力提升;部署时 N=1860 的推理成本也很高。
  • PRM 可能学到人类标注偏好和 step format 偏差;把 PRM reward 强优化后仍可能出现 process reward hacking 或 CoT obfuscation,需要结合 monitorability / reward hacking 文献处理。

OpenReview / 审稿意见吸收

  • Venue status: ICLR 2024 poster,OpenReview 显示 published 2024-01-16,last modified 2024-03-05。
  • Public reviews: 4 条 official reviews,ratings 为 8 / 6 / 5 / 3;confidence 为 3、4、3、3。Meta-review 建议接收,decision 为 Accept (poster)。
  • Ratings / confidence:
    • Reviewer 5YZq: 8, confidence 3;认可 thorough investigation、active learning 和 dataset release。
    • Reviewer DxcT: 6, confidence 3;认可 strong empirical results 和 dataset,但强烈质疑可复现性。
    • Reviewer HKpB: 5, confidence 4;认可数据集和问题价值,质疑只做 math、未做 RLHF generator training。
    • Reviewer 4gd2: 3, confidence 3;认为 dense reward / reward shaping 方向已有基础,novelty 和泛化不足。
  • Reviewer consensus: 数据集 PRM800K、强 empirical result、step-level feedback 作为 LLM reasoning reward model 的直观价值受到多数 reviewer 认可。
  • Main criticisms: 模型规模、训练细节、MathMix 来源和标注员信息不足,影响可复现;实验几乎局限数学和考试型 STEM;没有展示 process supervision 如何影响 generator policy training;同预算下 step-level label 与 outcome-level label 的成本比较需要更清楚。
  • Author response: 作者承认可复现性限制,特别是 large-scale results 当前无法用公开模型复现;强调 small-scale results 理论上应能用 open-source models 复验。对泛化问题,作者引用 OOD STEM table 作为初步证据,并把更广域研究留给后续。对 RLHF 问题,作者明确本工作目标是训练 reliable reward models,generator RL training 属于 future work。
  • 对这篇可信度的影响: OpenReview 提高了“社区认可 PRM800K 和主结果价值”的可信度,同时把结论边界压回到 reward model reranking、MATH-like reasoning 和不可完全复现的大规模私有模型设置。后续引用这篇时,应把“process supervision beats outcome supervision”写成该实验条件下的强经验结果,并同时标注可复现和泛化限制。

本地讨论补充

1. 讨论收敛点

  • 这篇的历史地位来自三个组合:人工 step-level labels、active learning 选择 convincing wrong-answer samples、Best-of-N verifier reranking。
  • 它解决的是 reward model 的 credit assignment,尚未解决 generator RL 的 on-policy optimization、reward hacking 和 compute budget 问题。
  • 后续 SRPO / VIMPO / OTB 等路线可以看作“尽量不收人工 process labels,但仍想把 outcome reward 的信号下沉到局部 token / step / suffix”的不同尝试。

2. 修正后的理解

  • PRM 的 product score 更像“整条解答所有 step 都正确”的联合置信度,因此天然偏向更短、更确定的 solution。复验时需要把 step count、length bias 和 correctness calibration 一起看。
  • Process supervision 的优势有两层:信息论上给出错误位置,优化上让 reward model 不必从轨迹级标签中反推 first error。后续理论工作提醒,在足够 coverage 和 rollout / verifier 条件下,这个差距未必是统计不可逾越的,实际差距可能来自算法和数据构造。
  • Active learning 的核心并非单纯收集更多错题,而是收集“当前 PRM 高分但 final answer 错”的样本,这类样本直接打在 verifier 的 decision boundary 上。

3. 后续复验指标

  • PRM calibration:step-level ECE、first-error localization accuracy、solution-level product score 与 true correctness 的 calibration。
  • Length / step bias:score 与 step count、response length、neutral label 数量的相关性。
  • Search-cost frontier:Best-of-N 的 N-accuracy curve、compute-normalized accuracy、N 增大时 false-positive selection rate。
  • RL transfer:用 PRM reward 训练 policy 后的 pass@1、pass@kk、reward hacking rate、CoT monitorability 和 distribution shift。
  • Dataset contamination:MATH held-out split、MathMix decontamination、题目 paraphrase overlap 和 OOD STEM / coding / theorem proving 扩展。

主要启发

  • 对 long-horizon reasoning,reward signal 的粒度直接决定 credit assignment 难度。Outcome reward 可以便宜且可验证,但会把错误定位留给模型或优化器;process label 显著增加每条 trajectory 的监督信息。
  • Active learning 应围绕当前 verifier 的误判区域设计。convincing wrong-answer samples 比随机错误样本更接近 reward model 的有效训练边界。
  • Best-of-N 是 verifier 评估的强协议,也会放大 reward model 的尾部错误。N 越大,verifier 被极端高分错误样本欺骗的风险越需要校准。
  • 人工 process supervision 可以作为高质量 teacher / oracle,后续更可扩展的路线需要把它蒸馏、自动化或替换成 self-localized / advantage-style process signal。
  • 将 process signal 直接放入训练目标要额外关注 monitorability 和 reward hacking。可解释过程是安全资产,也可能在优化压力下变成新的 proxy。

局限

  1. 大规模模型、规模、训练预算和 hyperparameters 公开不足,78.2% 结果难以外部复现。
  2. 主任务集中在 MATH,OOD 仍然是考试型 STEM;开放式问答、代码 agent、工具调用、多轮规划和偏好任务需要单独验证。
  3. PRM800K 训练纳入 4500 个 MATH test split problems,只在剩余 500 题上评估;完整 MATH test 的标准可比性较弱。
  4. 大规模 PRM 和 ORM 数据不等价,small-scale synthetic 消融虽有补充,但用大 PRM surrogate 代替 human labels。
  5. 论文只评估 reward model reranking,没有展示 PRM 作为 RL reward 后是否提升 generator pass@1,也没有系统测 reward hacking。
  6. 人类标注员背景、标注一致性细节和 label ambiguity 仍有限公开;neutral label 的处理和 first-error stopping 可能影响 PRM 学到的边界。

跨论文关系

  • LLM-as-a-Verifier:PRM800K 用人工 step labels 训练绝对 process reward model;LLM-as-a-Verifier 从冻结 LLM 的 pairwise score-token logits 构造 prefix feedback。后者降低监督准备成本,同时需要额外验证 opponent dependence、时间相关混杂与绝对 value calibration。
  • 与已有论文的作者关系:John Schulman 已在 KL estimator 建档;Bowen Baker2503.11926 CoT monitorability 重叠。
  • 与已有论文的主题关系:这篇是本地归档中 process supervision / PRM 的历史源点之一,连接 SRPO、STV、Interplay、CoT monitorability、DAPO / OTB / VIMPO 等 long-horizon RL credit assignment 与 verifier 研究。
  • 与已有论文的方法或系统关系:PRM800K 提供外部 step label;SRPO 用 self-localized reset 替代外部 first-error label;VIMPO / OTB 用 estimator 和 baseline 方法把 outcome reward 下沉到 token;STV 用 verifier self-training 提升 verifier-guided refinement;CoT monitorability 讨论 process signal 进入 reward 后的安全副作用。
  • 跨论文关系定位:记录 Process Supervision、PRM800K 与 Step-Level Verifier,并把 2305.20050 接到 SRPO、STV、Interplay 和 CoT monitorability。

Reference Intake Brief

Target

Reusable Elements

  1. Process vs outcome supervision 的实验审计模板:必须拆开 label granularity、candidate sampling、Best-of-N budget 和 final-answer checker noise。
  2. PRM / verifier 复验指标:first-error localization、step calibration、solution product score、length bias、search-cost frontier。
  3. 与后续 RLVR credit assignment 的连接语言:人工 step labels、self-localized reset、token-level value / baseline、verifier self-training是同一问题的不同工程折中。

Risks

  • Copyright/over-copying: 只做摘要和转述,未复制论文长段落或 reviewer 原文。
  • Unsourced or unverifiable claims: 大规模训练细节不足;作者 profile 中 Teddy / Harri / Yura 的当前职位线索需要后续更稳定来源。
  • Tone/brand mismatch: 保持中文技术归档语气,避免把 OpenAI project page 的 alignment narrative 写成无条件结论。
  • Safety/compliance issues: 内容属于 reasoning supervision 和 verifier 机制分析,无可直接滥用操作流程。
  • Overlap with existing assets: SRPO 笔记已经引用这篇作为 PRM 背景;本次新增历史源点并把关系反向补全。

Skipped

Material Reason
模型权重、完整 GPT-4-scale 训练配置 论文、OpenAI project page 和 OpenReview 均未公开足够细节。
人类标注员完整背景 公开论文只描述 labeler task、QC 和 instructions;OpenReview reviewer 也要求更多信息,作者未给出完整 profile。
非数学 / 非考试型任务复验 原论文未覆盖,后续需要结合 STV、SRPO、agentic coding 和 theorem proving 文献另行归档。

Recommendation

Decision: merge

Why: 这篇是 PRM800K、process supervision 与 reasoning verifier 的基础历史节点;虽然可复现性和泛化边界明显,但数据集、实验协议、OpenReview 记录和后续引用关系都足以支持独立归档。