2502.10581-do-we-need-to-verify-step-by-step-process-supervision-theory
Do We Need to Verify Step by Step? Rethinking Process Supervision from a Theoretical Perspective
这篇从理论上挑战“过程监督天然比结果监督更强”的直觉:在标准 coverage / concentrability 假设下,只拿 trajectory-level total reward 的 outcome supervision 可以通过 least-squares reward imputation 转成 per-step reward data,后续 offline reinforcement learning 的统计难度只比 process supervision 多项式级 horizon 因子;同时,若能从中间状态 rollout,任意 policy 的 advantage function 都可以作为保最优策略的 process reward,而直接用 Q-function 可能诱导错误策略。它的强结论只覆盖统计复杂度、offline data 和覆盖假设,并不说明现实 LLM RL 中不需要 PRM 或 step labels;OpenReview 接收意见也基本把价值定位在理论洞见,而把 practical algorithm design 和 LLM 适用性列为边界。
Source
- Title: Do We Need to Verify Step by Step? Rethinking Process Supervision from a Theoretical Perspective
- arXiv: 2502.10581
- PDF: arXiv PDF, PMLR PDF
- PMLR: PMLR 267:27373-27398, Proceedings of the 42nd International Conference on Machine Learning, 2025
- Code/Project: 纯理论论文,未发现代码仓库。
- OpenReview / Review page: ICML 2025 OpenReview
- Authors: Zeyu Jia, Alexander Rakhlin, Tengyang Xie
- Submitted: 2025-02-14
- Current version read: arXiv v2, revised 2025-03-26;PMLR / ICML 2025 camera-ready metadata
- Subjects: Machine Learning (
cs.LG); Artificial Intelligence (cs.AI); Machine Learning (stat.ML) - DOI: 10.48550/arXiv.2502.10581
作者与关系
- Zeyu Jia: MIT EECS.
- Alexander Rakhlin: MIT.
- Tengyang Xie: University of Wisconsin-Madison Computer Science.
阅读目标与判断边界
术语预备:
- RL (Reinforcement Learning,强化学习):在这里指从轨迹和 reward 信号中学习 policy。
- MDP (Markov Decision Process,马尔可夫决策过程):论文的理论建模对象,状态、动作、转移、奖励和 horizon 都被显式定义。
- Outcome supervision(结果监督):只在完整 trajectory 结束后得到 total reward 或 preference。
- Process supervision(过程监督):在 trajectory 每个 step 得到 step-wise reward。
- ORM (Outcome-supervised Reward Model,结果监督奖励模型):学习评价整条 trajectory 的最终结果。
- PRM (Process-supervised Reward Model,过程监督奖励模型):学习评价每个 state-action step 的中间 reward。
- DPO (Direct Preference Optimization,直接偏好优化):把 preference reward modeling 和 policy optimization 合并为单步对比学习目标的算法。
- ARMOR (Adversarially Robust Model-based Offline Reinforcement Learning,论文引用的 model-based offline RL 算法):附录用它说明 single-policy concentrability 也可在 total-reward setting 中保持。
本笔记关注:
- 这篇怎样形式化比较 process supervision 和 outcome supervision 的统计复杂度。
- Change of Trajectory Measure Lemma 为什么能把 trajectory-level total reward error 连接到 state-action concentrability。
- Advantage function 作为 process reward 的结论与 Math-Shepherd、PRM800K、SRPO、OTB、VIMPO 等本地归档线索有什么关系。
判断边界:
- 这是一篇理论论文,没有实证实验;核心证据是 theorem、proof 和 OpenReview theory review。
- 论文的“无需 step-by-step verification”只在统计复杂度意义上成立,且依赖 coverage、realizability、finite hypothesis class、offline dataset、bounded reward 等条件。
- 对 LLM reasoning 的启发需要经过实践翻译:真实系统还要处理 verifier noise、human label quality、token/context state 是否 Markov、exploration、optimization stability 和 reward hacking。
论文脉络
1. 研究问题、背景和价值
Process supervision 在 LLM reasoning 中很有吸引力。人工标注每个 reasoning step,或训练 PRM 给每一步打分,可以更早发现错误,也能把 long-horizon trajectory 的 credit assignment 从整条 response 下沉到局部 step。2305.20050 Let's Verify Step by Step 和 2312.08935 Math-Shepherd 都说明 step-level verifier 在 Best-of-N reranking 或 step-wise PPO 中有效。
问题在于,process labels 成本高,语义也不总是清晰。Outcome supervision 只需要最终结果或 preference,采集成本低得多;DeepSeek-R1 / GRPO 这类 RLVR 经验又显示,强 base model 在 outcome reward 下也能发展 long-CoT reasoning。于是一个理论问题变得重要:过程监督的优势来自统计信息量本身,还是来自当前算法更容易利用 dense signal?
这篇论文把问题放进 finite-horizon MDP 与 offline RL 框架中,比较两种数据格式:
和
前者是 process supervision,后者是 outcome supervision。作者关注的是:在相同 coverage 条件下,用
2. 已有解决方案与不足
经验层面已有三条路线:
- 人工 PRM:PRM800K 这类数据直接给 step labels,质量高但成本高。
- 自动 process supervision:Math-Shepherd、Rewarding Progress 等用 rollout / completion / progress signal 从 outcome correctness 生成 step-level labels。
- Outcome-only RL:GRPO、PPO、DAPO 等直接用 final answer correctness 或 preference reward 训练 policy。
理论层面,offline RL 已经很熟悉 process-supervised data,因为每一步 reward 都可见;难点集中在 coverage / concentrability。Outcome supervision 看起来更难,因为 total reward 只约束整条 trajectory 的 reward sum。一个自然担忧是:如果只知道参考 policy 下每条 trajectory 的总和,换到另一个 policy 时需要 trajectory-level concentrability,
这个量可能随 horizon 指数爆炸。Process supervision 通常只需要 state-action concentrability,
这就形成了“结果监督可能有指数级统计劣势”的常识判断。
3. 作者可能的思考路径
作者很可能从 offline RL 的 coverage 语言出发,而非从 LLM 工程细节出发。若 process supervision 的优势只是因为它让 reward error 在 state-action 层可控,那么关键问题是:trajectory-level total reward regression 是否也能推出 state-action coverage 下的 policy value error?
看起来不容易,因为
4. 核心假设或切入点
核心切入点是 Change of Trajectory Measure Lemma。给定任意 state-action function
论文证明:
以及:
把
5. 方法 / 系统 / 理论框架
Outcome-to-process transformation
论文先用 outcome-supervised dataset
其中
主定理给出:
于是,outcome supervision 可以模拟 process supervision,统计损失主要是
All-policy 与 single-policy coverage
最直接的 transformation 需要 all-policy coverage:
因为先学一个固定
这点对 LLM 场景很关键:覆盖所有 policy 不现实,覆盖一个高质量 best-of-N policy 或 reference-improved policy 更接近可想象的条件。
Preference / DPO extension
论文把 trajectory preference 也视为 outcome supervision。给定 Bradley-Terry model:
作者先分析 explicit reward modeling,再分析 DPO (Direct Preference Optimization,直接偏好优化)。结论是,在相应 realizability 与 bounded log-ratio 条件下,sample complexity 可以用 state-action concentrability 表达,而此前一些分析依赖 trajectory concentrability。
不过作者也指出,在 LLM token-level setup 中,action token 被 append 到 context 后,最后 state 基本包含整个 trajectory,这会让 state-action concentrability 退化得接近 trajectory-level concentrability。因此 DPO 部分对 token-level LLM 的直接收益有限,但对保持 Markov state 的 robotics / controlled environments 更有意义。
Advantage function as process reward
若能从中间 state-action pair rollout,并估计某个 policy
则 advantage 可以作为 process reward。核心恒等式来自 performance difference lemma:
因此,对所有
同时,论文构造一个 horizon 2 的 MDP 反例,说明直接把
6. 结论链条
- Process supervision 与 outcome supervision 的差异在论文中被归约为 per-step reward data 与 total-reward trajectory data 的差异。
- Least-squares total reward fitting 能把 outcome data 转成 imputed per-step reward data。
- Change of Trajectory Measure Lemma 证明 total-reward fitting error 可以用 state-action concentrability 转移到目标 policy,避免 trajectory concentrability 的指数级依赖。
- 因此,在 offline RL 和标准 coverage 条件下,outcome supervision 在统计复杂度上没有比 process supervision 高出本质级别,只多项式依赖 horizon。
- 对 rollout-based automatic process supervision,advantage function 是理论上保最优策略的 process reward;Q-function / raw future return 可能改变最优策略。
- 经验上看到的 PRM 优势仍可能成立,但更可能来自算法、optimization、coverage、verifier quality 和数据构造,而非 outcome labels 的统计信息天然不足。
关键实验/定理
结果 1:Outcome total reward 可以转成 per-step reward data
- 设置:finite-horizon MDP;offline dataset 由 reference policy
i.i.d. 采集;只观察每条 trajectory 的 total reward ;reward class 包含 ground-truth reward 。 - Baseline:标准 process-supervised offline RL,即每一步 reward 可见。
- 指标:任意 policy
下 learned reward 的 value error。 - 结果:
- 解读:结果监督数据并不需要 trajectory concentrability;只要 state-action coverage 成立,total reward regression 就足以构造可用的 per-step reward estimate。有限 reward class 和 realizability 是重要前提。
结果 2:Change of Trajectory Measure Lemma
- 设置:任意 bounded state-action function
,比较 和目标 policy 下 trajectory sum 的 second moment。 - Baseline:朴素 trajectory-level change of measure,依赖
。 - 指标:
。 - 结果:
- 解读:这是论文的技术核心。它说明 trajectory sum 的误差即使只在 reference trajectory distribution 下被控制,也能通过 state-action coverage 转到目标 policy,代价是
。这解释了为什么 outcome supervision 的统计复杂度可以接近 process supervision。
结果 3:Preference-based RL 和 DPO 的 sample complexity 分析
- 设置:preference data 由 Bradley-Terry model 生成;explicit reward modeling 或 DPO;policy class 满足 realizability;DPO 部分还要求 bounded trajectory log-ratio。
- Baseline:已有 preference-based RL / DPO 理论分析中常见的 trajectory concentrability 依赖。
- 指标:policy suboptimality 或 KL-regularized objective gap。
- 结果:显式 reward modeling 与 DPO 都能得到依赖 state-action concentrability 的 bound,形式上包含
。 - 解读:Change of Trajectory Measure Lemma 不只用于 scalar outcome reward,也能用于 pairwise preference。对 token-level LLM setting,作者明确指出 state-action concentrability 可能接近 trajectory concentrability,因为 context state 包含历史 trajectory。
结果 4:Advantage function 可以作为 optimal process reward
- 设置:transition model 已知,reward unknown;从中间
rollout 得到 advantage estimate;reward approximation error under 为 ;policy optimization error 为 。 - Baseline:用 raw Q-function 或 raw continuation success 作 step reward。
- 指标:原始 MDP 下 policy suboptimality。
- 结果:
- 解读:advantage reward 只差一个 policy-independent constant,因此保持原 MDP 的最优策略。这给 automated process supervision 里的 advantage / progress reward 提供理论支持。
结果 5:Q-function reward 可以失败
- 设置:作者构造 horizon 2 的 MDP 和一个 policy
;把 当作新的 reward function 重新求最优策略。 - Baseline:使用 advantage function
。 - 指标:原始 reward 下最优值差。
- 结果:存在例子使得
-optimal policy 在原始 MDP 下至少落后 。 - 解读:raw future return / Q-like potential 会混入 state value baseline,可能改变早期 action 对后续 state 的偏好。对 PRM 设计来说,这支持用 centered advantage / progress,而非直接用“从当前 step 后能拿多少最终 reward”。
实验设置与 baseline 审计
- 模型与初始化:无模型实验;理论对象是 finite-horizon MDP、policy class、reward class 和 offline dataset。
- 数据与任务:理论数据格式为
step-wise reward data、 total-reward trajectory data、preference pair data;没有真实 benchmark。 - RL / 训练配置:offline RL transformation、preference-based RL / DPO analysis、advantage-function rollout reward;没有 PPO / GRPO / DAPO 实验。
- 系统配置:无系统实验。
- 评测协议:用 sample complexity、policy suboptimality、value error、concentrability dependence 和 horizon dependence 衡量。
- 统计报告:理论 high-probability bounds;没有 seeds、error bars 或 empirical significance。
- Baseline 强度:
- 是否 tuned:不适用。比较对象是理论保证,而非调参后的算法。
- 是否 compute-matched:不适用。理论中关注样本复杂度,不计入 rollout / optimization compute。
- 是否 implementation-matched:不适用。Algorithm 1 是 transformation wrapper,附录 ARMOR variant 是理论构造。
- 是否覆盖强替代方案:覆盖 process-supervised offline RL、preference / DPO analysis、advantage vs Q reward;未覆盖真实 LLM RL 的 verifier noise、token-level credit assignment、sampling distribution 和 on-policy drift。
- 是否存在弱化风险:把 LLM reasoning 映射为 fully observed Markov state-action process 是强抽象;token context 作为 state 会让 state-action coverage 退化;finite hypothesis class / realizability 也削弱直接工程外推。
- 结论边界:理论上削弱“process supervision 有不可避免统计优势”的说法;无法推出“实践中 PRM 不值得做”或“结果监督算法总能达到同等表现”。
证据链强度评估
强证据
- Main theorem、Change of Trajectory Measure Lemma、preference / DPO extension 和 advantage theorem 都给出完整数学证明,OpenReview 中至少两位 reviewer 明确认可核心理论贡献和 proof soundness。
- 论文对 coverage 语言的区分清晰:trajectory concentrability 与 state-action concentrability 的差异正是 process vs outcome 争论中最关键的理论点。
- Advantage vs Q 的反例简单明确,能直接给 automated PRM / progress reward 设计提供原则性提醒。
中等强度证据
- Outcome-to-process transformation 有清晰 algorithmic form,但作为 practical LLM method 还缺少实现实验。现实中 least-squares reward imputation、reward class realizability 和 optimization 都可能成为瓶颈。
- DPO bound 对非 token-level Markov environments 更有意义;对 autoregressive LLM token setting,作者自己承认 state-action concentrability 会接近 trajectory-level concentrability。
- ARMOR with Total Rewards 说明 single-policy coverage 可以保留,但它依赖 model-based pessimism 和 bounded total reward,尚未转化成可直接用于 LLM post-training 的 recipe。
需要谨慎的推论
- 论文比较的是统计复杂度,不比较 human label cost、reward noise、annotation bias、optimization stability 或 compute cost。
- Coverage 假设是核心前提。LLM 的 state 是长 context,action 是 token 或 step,off-policy data 对目标 policy 的 coverage 可能很差。
- Process reward 的实证优势可能来自算法更容易优化、dense signal 方差更低、verifier calibration 更好、curriculum 更自然,而这些都不被 theorem 排除。
- “任意 policy 的 advantage function 都可作为 process reward”依赖准确估计 advantage;估计误差、distribution shift 和 rollout cost 会决定实际可用性。
OpenReview / 审稿意见吸收
- Venue status: ICML 2025 poster;PMLR 收录为 Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:27373-27398。
- Public reviews: 4 条公开 Official Review;overall recommendation 分别为 2、3、4、5;decision 为 Accept (poster)。
- Ratings / confidence: OpenReview 页面公开 overall recommendation,但本次 API 输出未看到 confidence 字段。
- Reviewer consensus: reviewers 普遍认可理论问题重要,尤其是 Change of Trajectory Measure Lemma、outcome/process supervision statistical equivalence、advantage function as process reward 这几项贡献。最终 decision comment 明确说 Lemma 3 和理论 insight 被多位 reviewer 高度评价。
- Main criticisms: 主要质疑集中在 practical applicability:coverage assumptions 在 LLM training 中是否现实;论文 introduction 对 LLM 场景是否过度外推;缺少 empirical validation;finite hypothesis set、offline RL setting 和 bounded reward 等假设需要更前置地说明;相关工作中 automated process supervision、pre-LLM RL、potential-based reward shaping 讨论不够。
- Author response: 作者在 rebuttal 中强调论文关注 statistical complexity,不声称解决 algorithmic / practical implementation;补充 all-policy coverage 与 single-policy coverage 区分,说明 best-of-N policy 可作为 single good policy 的例子;回应 finite reward class 可用 classical parametric / nonparametric ERM 工具推广;承诺补充 proof sketch 和相关工作。Reviewer yWDQ post-rebuttal 提升评分,认为该工作作为 theory paper 有价值,但实际算法连接仍弱。
- 对可信度的影响: OpenReview 提高了核心理论结果可信度;同时,reviewer 的批评要求把结论限定在 offline RL theory 和 coverage assumptions 内。后续在 LLM RL 语境引用时,应写成“统计复杂度上不必然更难”,避免写成“实践中无需 process supervision”。
本地讨论补充
1. 讨论收敛点
- 这篇和 ReAct 式 multi-step acting 没有直接关系。它讨论的是 RL 轨迹中的 reward resolution:step-wise reward 与 trajectory-level reward。
- 它的核心对象也不只是 verifier training,而是从 outcome data 到 process reward / process-supervised offline RL 的理论转化。
- 对 base model 预训练没有直接含义;它主要服务 SFT 后的 reward modeling、RLHF / RLVR、offline RL、preference learning 和 verifier / PRM 设计。
2. 修正后的理解
- PRM800K 的经验结论和这篇理论结论并不冲突。PRM800K 说明某个大模型 math reranking setting 下,人工 step labels 训练出的 PRM 更有效;这篇说明在抽象 MDP 与 coverage 条件下,outcome supervision 的统计复杂度不天然指数更差。
- Math-Shepherd 的 HE / SE potential label 更像 Q-like future success estimate。这篇提醒 raw Q / success probability 未必保最优策略,advantage-style centering 或 progress reward 更符合理论。
- SRPO、OTB、VIMPO 等 outcome-only credit assignment 方法可以被看成对 practical gap 的不同尝试:它们保留 final reward,但改变 rollout construction、baseline 或 token-level estimator,让结果监督更容易被 optimizer 利用。
3. 后续复验指标
- Coverage diagnostics:在 LLM setting 中估计 target policy 和 rollout/reference policy 的 prefix/action coverage,至少用 empirical support、importance ratio、max token KL / TV proxies 近似。
- Reward decomposition diagnostics:比较 Q-like potential、advantage-like centered reward、progress reward 的 policy ranking 是否一致。
- Algorithmic gap diagnostics:同一 outcome dataset 下,比较 direct outcome RL、outcome-to-process PRM、advantage PRM、human PRM 的 sample efficiency、compute cost、reward hacking 和 pass@
coverage。 - Verifier noise diagnostics:系统性 final-answer checker error、process label ambiguity、人类 step label inconsistency 会改变理论中的 reward realizability 假设。
主要启发
- Process supervision 的经验优势需要拆成两层:统计信息是否更多,以及算法是否更容易利用。这篇主要削弱第一层的必然性。
- Outcome supervision 可以通过理论 transformation 生成 process-like signal,但实践上仍要解决 reward fitting、coverage、optimization 和 verifier bias。
- Advantage function 是更干净的 process reward 目标。若用 rollout 从某个 prefix 估计“未来还能拿多少分”,最好进一步做 baseline / centering,避免 raw Q 改变 policy ordering。
- 对 LLM RL 论文审计时,要区分 trajectory-level coverage、prefix distribution shift 和 token/action distribution mismatch。
提供了一种理论语言,但长 context autoregressive setting 可能让它重新变难。
局限
- 主要结果依赖 offline RL setting;论文结论没有覆盖在线采样、on-policy policy update、async rollout 或 trainer/rollout mismatch。
- Coverage / concentrability 假设很强。真实 LLM reasoning 的 prefix space 极大,reference policy 未必覆盖目标 policy 的关键错误修复路径。
- 有限 reward class、realizability、bounded reward 和 Markov state 假设限制直接应用。OpenReview reviewer 也要求更清楚标注 finite hypothesis set 与 offline setting。
- 没有实证实验。缺少 synthetic MDP 和 LLM reasoning 验证,使 algorithmic gap 只能停留在推论。
- DPO 部分对 token-level LLM setting 的收益有限,因为 autoregressive context state 包含完整历史,state-action coverage 可能退化到 trajectory-level coverage。
- 没有处理 verifier / human feedback 的来源质量差异。现实中 process reward 与 outcome reward 可能来自不同监督者、不同噪声模型和不同成本结构。
跨论文关系
- 与已有论文的作者关系:当前没有直接作者重叠;本次新增 Zeyu Jia、Alexander Rakhlin 和 Tengyang Xie 作者档案。
- 与已有论文的主题关系:直接回应 2305.20050 Let's Verify Step by Step 的 process supervision / PRM800K 历史节点;理论上解释 2312.08935 Math-Shepherd、Rewarding Progress 等 outcome-to-process automatic supervision 为什么可能成立。
- 与已有论文的方法或系统关系:与 2605.25507 SRPO、2602.07078 OTB 和 2606.20008 VIMPO 构成 outcome-only reward 下 credit assignment 的理论上游;与 2504.13837 RLVR boundary 和 2506.10947 Spurious Rewards 共同提醒 outcome RL 的实证收益需要区分 statistical possibility、base prior、sampling efficiency 和 reward artifact。
- 跨论文关系定位:把 Process Supervision、PRM800K 与 Step-Level Verifier 关系扩展到理论反思节点,并连接 PRM800K、Math-Shepherd、SRPO、OTB、VIMPO 和 RLVR boundary 争论。
Reference Intake Brief
Target
- Intended target system: 新增论文笔记;更新
content/utility/papers-index.md;更新data/authors.json。 - Existing related assets: 2305.20050 Let's Verify Step by Step, 2312.08935 Math-Shepherd, 2605.25507 SRPO, 2602.07078 OTB, 2606.20008 VIMPO, 2504.13837 RLVR boundary, 2506.10947 Spurious Rewards。
- Proposed form: 新建独立 Markdown 文档
2502.10581-do-we-need-to-verify-step-by-step-process-supervision-theory.md,同步索引行和 Process Supervision 关系章节。
Reusable Elements
- Change of Trajectory Measure Lemma:可复用于分析 outcome-to-process transformation、preference learning 和 offline RL coverage。
- Advantage vs Q distinction:可复用于 Math-Shepherd、Rewarding Progress、OmegaPRM、SRPO 和后续 process reward 设计。
- Theory-to-practice checklist:coverage、finite class / realizability、offline vs online、Markov state、verifier noise、algorithmic gap。
Risks
- Copyright/over-copying: 只保留必要定理形式、算法摘要和 reviewer 意见摘要,避免长段复制论文原文或审稿原文。
- Unsourced or unverifiable claims: 作者 profile 中 X 账号只记录高置信匹配;Grok 失败已说明,Alexander Rakhlin 的同名社交账号未写入。
- Tone/brand mismatch: 使用理论审计语气,避免把论文结论外推成实践否定 PRM。
- Safety/compliance issues: 纯理论 RL / reward modeling 论文,无直接双用途操作细节。
- Overlap with existing assets: 与 PRM800K 和 Math-Shepherd 笔记重叠在 process supervision 主题,但本篇的理论立场和 OpenReview 讨论足以单独存档。
Skipped
| Material | Reason |
|---|---|
| 代码仓库 | 未发现论文专属代码;PMLR / OpenReview / arXiv 均未列出代码仓库。 |
Recommendation
Decision: merge
Why: 这篇是 process supervision / outcome supervision 争论中的关键理论节点。它为本地档案中 PRM800K、Math-Shepherd、SRPO、OTB、VIMPO、RLVR boundary 等论文提供一条统一的理论参照:过程监督的实证优势需要从统计复杂度、coverage、算法可优化性和 verifier quality 多层拆开讨论。