2606.20008-vimpo-value-implicit-policy-optimization-llms
VIMPO: Value Implicit Policy Optimization for LLMs
VIMPO 试图填补 GRPO 和 PPO actor-critic 之间的空位:它不训练独立 critic,却从 KL-regularized RL 的最优性条件推出一个由 policy-reference log-ratio 表达的隐式 value recurrence,把终止状态的 value 设为零后将 outcome reward 变成 value loss,再用同一个 log-ratio identity 构造 token-level PPO actor advantage。它的主结果显示,在 Qwen3-4B-Base 数学 RLVR 上,VIMPO 比 token-level GRPO 在 MATH-500、AIME 2024/2025 和 OlympiadBench 上更高,并且在 25% reward flipping 下更稳;证据边界在于单模型、单 seed、数学域、exact full-vocab KL 成本和缺少 tuned PPO/VAPO/DAPO-style baseline。
Source
- Title: VIMPO: Value-Implicit Policy Optimization for LLMs
- arXiv: https://arxiv.org/abs/2606.20008
- HTML: https://arxiv.org/html/2606.20008v1
- PDF: https://arxiv.org/pdf/2606.20008
- TeX Source: https://arxiv.org/e-print/2606.20008
- Code/Project: https://github.com/backprop07/VIMPO
- OpenReview / Review page: 未发现可可靠匹配的 VIMPO 公开审稿页;同组上游工作 Intuitor / Learning to Reason without External Rewards 有 ICLR 2026 OpenReview 页面:https://openreview.net/forum?id=OU9nFEYR2M
- Authors: Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song, Xuandong Zhao
- Submitted: 2026-06-18
- Current version read: arXiv v1, submitted 2026-06-18 09:44:12 UTC;本地阅读使用 arXiv HTML v1 与 TeX source。
- Subjects: Machine Learning (cs.LG)
- Related public materials: Intuitor / Learning to Reason without External Rewards arXiv;Intuitor code;Self-Certainty arXiv;Self-Certainty OpenReview
作者与关系
- Zhewei Kang: UC Berkeley.
- Aosong Feng: Yale University.
- Sergey Levine: UC Berkeley.
- Dawn Song: UC Berkeley.
- Xuandong Zhao: UC Berkeley.
阅读目标与判断边界
本笔记关注:
- VIMPO 如何从 KL 正则最优性条件推出隐式 value 和 token-level advantage。
- 它相对 GRPO 的真实差异:reward 进入 value loss,actor update 使用 policy-implied log-ratio advantage。
- 实验结果能支撑到什么程度,哪些部分还需要更强 baseline 和复验。
判断边界:
- arXiv HTML 中部分公式变量渲染缺失,本笔记以 TeX source 为公式依据。
- 代码仓库是 focused fork of
verl,但数据文件未提交,公开复现仍需准备 Guru math subset 和验证 parquet。 - 论文只报告 single-seed 4B math RLVR,结论不能直接外推到 code、tool use、open-ended instruction following、robotics 或更大模型。
- exact KL 是方法推导的重要组成,使用 k2/k3/candidate-set 近似会改变 centering 性质,需要单独验证。
论文脉络
1. 研究问题、背景和价值
RLVR 已经成为 reasoning LLM 后训练的主线。DeepSeek-R1、DAPO、ProRL、BroRL 等工作说明,给数学和代码任务提供可验证 final reward,可以明显提高 pass@1 或 avg@k。但训练目标内部仍有一个长期张力:PPO actor-critic 有 value function,可以提供 token-level credit assignment;GRPO / DAPO 这类 critic-free 方法训练更简单、更省资源,但经常把同一个 trajectory-level advantage 广播到整条 response 的所有 token。
长 CoT 场景会放大这个问题。一条数学推理里,真正决定正确或错误的 token 往往集中在少数分支:一个变量定义、一个计数假设、一个代数变形、一个 final answer extraction。GRPO 把整条 response 当作一个不可拆的样本,会让普通连接 token 和关键推理 token 拿到相同 advantage。DAPO 的 token-level loss aggregation 改善了 loss reduction,但 advantage 仍是 response-level 的。
VIMPO 的价值在于提出一个更结构化的中间方案:保留 critic-free,不引入额外 value model;同时从 policy/reference log-ratio 中导出 token-level value/advantage 信号。若这个方向成立,RLVR 可以获得更细的 credit assignment,同时避免 critic 训练、critic drift 和 value-policy co-adaptation 的系统成本。
2. 已有解决方案与不足
已有路线可以分成三类。
- PPO / VAPO actor-critic:有显式 value function 和 GAE,token-level signal 更细,但要训练额外 critic。critic calibration、value pretraining、policy/critic 共同漂移都会增加不稳定性。
- GRPO / DAPO critic-free:用同一 prompt 的多条 rollout 做 group-relative advantage,省掉 critic。代价是 advantage 粒度粗,reward 只在 response 级别进入。
- Post-hoc credit assignment:FIPO 用 future-KL factor 重新加权 GRPO advantage,attention-based 方法用内部 attention 找 anchor token。这类方法能补局部信号,但更像附加权重规则。
VIMPO 的切入点是从 KL-regularized optimality 重新写 value,而非在 GRPO 结果上加权。它借用了 DPO/IPO 里常见的 log-ratio 参数化直觉:如果最优策略相对 reference 的 log-ratio 可以表达 reward 或 value,那么不一定需要单独训练 reward/value 网络。
3. 作者可能的思考路径
从已有背景出发,作者很可能先看到两个事实。第一,GRPO 在 reasoning RL 中很实用,尤其适合 outcome-only reward;第二,GRPO 的 per-token 学习信号很粗,解释不了一条 long-CoT 中哪些 prefix 决策应该被强化。
接着,DPO 的 log-ratio 形式提供了一个提示:在 KL-regularized objective 下,最优 policy 和 reference policy 的 log-ratio 本来就携带 reward/value 信息。把 autoregressive generation 写成 deterministic-transition MDP 后,Bellman equation 变得很简单,因为下一个 state 就是当前 prefix 加上 token。
这样可以把三件事连起来:KL 正则最优性给出
4. 核心假设或切入点
核心假设是:policy 相对 frozen reference 的 token-level log-ratio 可以作为隐式 value / advantage 的承载变量。
KL-regularized local optimum 满足:
deterministic transition 下:
合并后得到论文的核心 identity:
这说明每个 sampled token 的 log-ratio 可以被解释成 Bellman residual 加 KL correction。将其移项后,value 可以沿 token 序列递推;将其看作 residual 后,又能得到 token-level TD advantage。
5. 方法 / 系统 / 理论框架
设
VIMPO 的 policy-implied value 来自递推式:
终止状态没有 future reward,因此训练目标是让
在 outcome-only RLVR 中,除最后 token 外 reward 为 0,
这里
这一步也澄清了一个容易混淆的说法:verifier 提供整条 response 的 outcome reward
actor 侧使用 policy-implied TD advantage:
也可以做 GAE-style accumulation:
VIMPO 最终目标是:
其中
这个结构的关键是:external reward 进入 value loss;actor loss 不直接乘 final reward,而使用由当前 policy/reference log-ratio 诱导出的 token-level advantage。value loss 负责把 cumulative log-ratio 对齐到 centered reward,actor branch 负责把这种内部 token signal 转成 PPO-style policy movement。
6. 结论链条
- GRPO 的 trajectory-level advantage 粒度粗,long-CoT 需要更细的 token-level credit assignment。
- KL-regularized optimality + deterministic autoregressive transition 可以把 optimal value 写成 policy-reference log-ratio recurrence。
- 终止状态
给 value loss 提供无参数 anchor,不需要训练独立 critic。 - 同一 identity 给出
形式的 token-level actor advantage,可接入 PPO clipped update。 - 在 Qwen3-4B-Base 数学 RLVR 上,VIMPO 相对 token-level GRPO 提升平均分,并在 25% reward flipping 下保持更高准确率。
- 这些结果支持“policy-implied value 可以改善 critic-free RLVR credit assignment”的方向,但还没有证明其在更大模型、更多域、更多 seeds 和 tuned actor-critic baseline 上稳定优越。
关键实验/定理
结果 1:主实验对比 GRPO
- 设置:Qwen3-4B-Base;Guru math subset 54.4K examples;max prompt length 2048,max response length 4096;每 prompt 8 responses;prompt batch size 96,总 rollout responses 768;actor lr
;VIMPO 使用 , 。 - 指标:MATH-500 avg@1、AIME 2024 avg@32、AIME 2025 avg@32、OlympiadBench avg@1。
- 结果:
| Method | MATH-500 | AIME24 | AIME25 | OlympiadBench | Avg. |
|---|---|---|---|---|---|
| Qwen3-4B-Base | 54.0 | 8.6 | 3.6 | 18.0 | 21.1 |
| Naive GRPO | 80.4 | 20.0 | 14.6 | 31.3 | 36.6 |
| GRPO | 79.6 | 19.3 | 17.6 | 33.2 | 37.4 |
| VIMPO | 81.6 | 21.7 | 20.8 | 34.0 | 39.5 |
- 解读:VIMPO 在四个 benchmark 上都高于 GRPO,平均提升 2.1 分;AIME 2025 从 17.6 到 20.8,是最明显的单项差距。绝对提升不夸张,但方向一致。
结果 2:25% reward flipping 下更稳
- 设置:训练时对 binary correctness reward 做 25% 独立翻转;训练和验证指标仍用 clean verifier;只跑前 200 training steps。
- 指标:同主实验。
- 结果:
| Method | MATH-500 | AIME24 | AIME25 | OlympiadBench | Avg. |
|---|---|---|---|---|---|
| GRPO noisy | 75.2 | 13.0 | 11.7 | 28.9 | 32.2 |
| VIMPO noisy | 78.2 | 18.3 | 14.9 | 32.3 | 35.9 |
- 解读:VIMPO 在 noisy setting 下平均高 3.7 分。论文解释为 reward 先进入 value-loss target,actor update 不直接按单个 corrupted label 放大,因此对 label flip 更不敏感。这个解释合理,但只覆盖独立随机 flip;systematic verifier bias、format reward 偏差和 spurious reward 需要额外实验。
结果 3:系数消融
- 设置:比较 value-only
、主设置 、高 / 高 。 - 指标:training accuracy、VO KL、response length。
- 结果:value-only 可以学习但慢;加入 PPO actor branch 后训练更快、VO KL 更高;高
/ 高 初期快但很快 plateau;主设置到 200 步时 response 更长。 - 解读:actor branch 主要作用是加速 policy movement;
和 同时影响 KL、学习速度和长度偏好。后续需要 schedule 或 adaptive coefficient,而不能只依赖固定值。
结果 4:entropy 与 token-level 可视化
- 设置:附录记录 naive GRPO、GRPO、VIMPO 训练 entropy,并在 MATH-500 counting case 上比较 VIMPO GAE signal 和 Monte Carlo rollout-based TD diagnostic。
- 指标:token-level policy entropy;选定 prefix 的 correctness probability change;normalized token signal。
- 结果:两个 GRPO baseline entropy 更接近单调下降;VIMPO 进入低 entropy 后仍有小幅恢复。case study 中,VIMPO signal 在正确/错误 branch 的关键 token 上与 Monte Carlo diagnostic 大体一致。
- 解读:这是机制 sanity check,而非强统计证据。它支持 VIMPO 的 token-level signal 有可解释结构,但不能单独证明泛化收益。
证据链强度评估
强证据
- 方法推导清晰:从 KL-regularized optimality、Bellman recurrence、terminal anchor 到 outcome-only loss,链条完整。
- 实验主对照控制了 base model、训练数据、batch size、responses per prompt、learning rate 等共享超参。
- GRPO baseline 使用 DAPO-style token-level loss aggregation,避免拿较弱 sequence-mean baseline 做唯一对照。
- 代码仓库公开了
verlfork、recipe/vimpoentry point、exact KL / candidate-set / k2 / k3 相关配置和 GRPO baseline run mode。
中等强度证据
- 四个数学 benchmark 方向一致,但平均提升约 2.1 分,仍需要多 seed 置信区间。
- noisy reward 结果有价值,但 25% independent flip 只模拟随机噪声,不覆盖 reward hacking、systematic verifier error 或 spurious reward。
- entropy 和 token-level visualization 解释性强,但属于附录级定性证据。
- 代码可读性较好,但数据文件未提交,仓库当前 commit 数很少,完整复现实验仍依赖外部数据和环境。
需要谨慎的推论
- VIMPO 仍然依赖 frozen reference 的 full-distribution KL geometry。它没有显式 KL reward penalty,但 reference 通过
和 深入进入目标。 - 将最优策略 identity 中的
替换成当前 trainable policy 是 DPO-like approximation。训练早期或远离 optimum 时,这个 policy-implied value 的校准程度需要实证诊断。 - VIMPO 没有比较 tuned PPO / VAPO,也没有加入完整 DAPO dynamic sampling、overlong shaping、Clip-Higher 组合;因此当前结论是“优于这个 GRPO baseline”,而非“优于当前最强 RLVR recipe”。
- exact KL 需要 policy 和 reference 的 full next-token distribution。大模型、长 response、MoE、pipeline parallel 和高吞吐 rollout 下,这个成本可能改变方法实用性。
- 论文没有报告 pass@
coverage、spurious reward baselines 或 model-family sweep,无法判断收益来自更好 credit assignment、base prior 重排、长度/format 行为变化还是 benchmark-specific dynamics。
OpenReview / 审稿意见吸收
- Venue status: arXiv preprint v1,submitted 2026-06-18;未发现 VIMPO 对应 OpenReview / ARR / conference submission 页面。
- Public reviews: 2026-06-21 搜索标题、arXiv id、OpenReview、ICLR/NeurIPS/ICML 组合,未找到可可靠匹配的公开 reviewer comments。
- Ratings / confidence: 无公开评分。
- Reviewer consensus: 无公开审稿共识可引用。
- Main criticisms: 无公开 reviewer 批评;本地可信度主要由推导完整性、公开代码、实验对照和局限判断决定。
- Author response: 无公开 rebuttal。
- 对可信度的影响: 暂按 arXiv preprint 处理。由于同一作者组的 Intuitor 已有 ICLR 2026 Poster 与 OpenReview 页面,这条 Berkeley reasoning RL/RLIF 研究线有连续性,但不能把 Intuitor 的审稿状态转移给 VIMPO。
本地讨论补充
1. 讨论收敛点
- 直接读 arXiv HTML 可以快速确认结构、结果和局限;TeX source 对公式仍然必要,因为 HTML 在公式变量上丢失较多。
- VIMPO 的真正新意集中在 value loss 的目标来自 terminal boundary,并且 value 本身由 policy/reference log-ratio 递推出来。
- actor advantage
的期望为零,像一个 centered internal signal;reward 通过 改变 policy,使后续 log-ratio 轨迹与 centered reward 对齐。
2. 修正后的理解
- VIMPO 可以看成“critic-free Bellman consistency + PPO actor branch”。相比只更换 baseline,它额外改变了 reward 进入训练目标的路径,以及 token 获得 advantage 的方式。
- 它和 DAPO 的关系要分清:DAPO 主要是 long-CoT RL recipe,包括 dynamic sampling、Clip-Higher、token-level loss、overlong reward shaping;VIMPO 主要是 objective / credit assignment。两者未来可以组合,但当前实验没有证明组合效果。
- 它和 Entropy Mechanism 的关系也值得跟踪:VIMPO 附录显示 entropy 轨迹不像 GRPO 那么单调,但这只是现象;是否真正缓解 entropy collapse,需要按 2505.22617 的 covariance / entropy diagnostics 做专门实验。
3. Token 级 credit 的统计口径
VIMPO 的 token 级信号来自模型分布的 log-ratio geometry;verifier 只给每条 response 一个最终奖励
随后,对 response 中每个 token
同一个 prefix 上还要计算 full-distribution KL:
二者的角色不同:
可以理解为这个 token 相比当前 prefix 的整体 policy drift 是否更值得被强化。外部 reward 通过整条轨迹约束这些 token-level signal 的总和:
所以 VIMPO 的“token 级 reward”更准确地说是 token-level credit / advantage。正确 response 会推动累计 log-ratio 对齐正的 centered reward,错误 response 会推动累计 log-ratio 对齐负的 centered reward;每个 token 的局部更新强弱则由
4. 后续复验指标
- 多 seed:每个 benchmark 报 mean / std / confidence interval,尤其 AIME 这种小样本 benchmark。
- Stronger baselines:GRPO + DAPO recipe、DAPO + VIMPO、PPO/VAPO tuned actor-critic、FIPO / attention credit assignment。
- Spurious baselines:random reward、format reward、incorrect reward、noisy verifier、systematic answer-extraction bias。
- pass@
coverage:比较 VIMPO、GRPO、base model 的 pass@1、pass@32、pass@128,区分 sampling efficiency 和 reasoning boundary expansion。 - KL cost accounting:记录 exact KL forward 成本、reference logits 内存、吞吐下降,以及 k2/k3/candidate-set 近似对 accuracy 和 centering 的影响。
- Train-rollout consistency:在
verl/ vLLM / SGLang / FSDP2 环境中记录 rollout logprob、trainer logprob、K3、max token KL,避免 VIMPO 的 log-ratio signal 被实现级 mismatch 污染。
主要启发
- RLVR credit assignment 可以沿三条轴拆:reward 粒度、value/advantage 粒度、policy update 约束。GRPO 解决了 critic 成本,VIMPO 尝试补回 token-level value/advantage 粒度。
- KL/reference 的作用可以从“惩罚项”转成“表示坐标系”。VIMPO 不把 KL 当 explicit reward penalty,但它用 reference log-ratio 表达隐式 value。
- Outcome-only reward 仍能产生 token-level signal,但需要假设 cumulative log-ratio 能承载最终 reward 差异。这个假设比 reward broadcast 更强,也更需要诊断。
- 对工程实现,exact KL 是核心成本。若想大规模应用,近似 KL、cached reference distribution、candidate-set KL 和 low-rank / sparse logits 计算会成为关键。
- 对论文评估,VIMPO 应和 RLVR boundary、spurious reward、entropy collapse 三条线一起看。只看四个 benchmark 平均分不足以判断它是否真正提升 reasoning。
局限
- 单模型单域单 seed。主实验集中在 Qwen3-4B-Base + math RLVR,缺少模型规模、模型家族、训练数据和随机种子维度。
- baseline 还不够强。没有 tuned PPO/VAPO,也没有完整 DAPO recipe 或 FIPO/attention credit assignment 对照。
- exact KL 成本高。full-distribution KL 对大模型、长序列和高吞吐 rollout 不友好。
- frozen reference 可能限制后期探索。固定
和固定 reference 在训练后期可能让 policy 过度受初始化几何影响。 - reward noise 实验覆盖有限。25% independent flip 能测试随机噪声,对 reward hacking、系统性 verifier 错误和格式偏差说明不足。
- 缺少 pass@
和 coverage set 分析。当前无法区分 VIMPO 是扩大可解集合,还是更有效地重排 base prior 中已有路径。 - 理论 identity 是 optimality 条件,训练中使用当前 policy 代入。这个近似在远离 optimum 时的偏差需要更多诊断。
- 公开代码还不等于完整复现。仓库说明数据文件未提交,实验日志、seeds、完整环境和评测样本仍需补齐。
跨论文关系
- 与 2503.14476 DAPO:DAPO 解决 long-CoT RL recipe 和系统复现问题,VIMPO 解决 critic-free credit assignment 问题。两者可组合,当前论文只比较较干净的 GRPO baseline,没有叠加 DAPO full recipe。
- 与 verl:VIMPO 代码是
verlfocused fork,直接落在 PPO/GRPO/DAPO/rollout correction 生态中;未来可和k2/k3、rollout logprob、TIS/RS、async rollout 诊断联动。 - 与 2505.22617 Entropy Mechanism:Entropy 论文解释 GRPO-style RLVR 为什么快速消耗 entropy;VIMPO 附录显示 entropy 轨迹更不单调,但需要用 covariance token diagnostics 复验。
- 与 2504.13837 RLVR boundary:VIMPO 报告 avg@1/avg@32 提升,仍缺 pass@
coverage set;后续需要验证它是否扩大 reasoning boundary,或主要提高 sampling efficiency。 - 与 2506.10947 Spurious Rewards:VIMPO 的 noisy reward 实验不能替代 random / format / incorrect reward baselines。若 VIMPO 也能在 spurious reward 下提升,需要重新拆解 credit assignment 与 base prior amplification。
- 与 2020-03-07 Schulman KL:VIMPO repo 暴露 exact、candidate-set、k2、k3 等 KL estimator 选项;是否能用 Monte Carlo KL 近似替代 exact KL,应结合 k2/k3 的偏差方差性质和 VIMPO centering 需求判断。
- 与 2605.14220 TIM/VeXact:VIMPO 的核心变量是 sampled-token log-ratio 和 full KL,rollout/trainer logprob mismatch 会直接污染 value loss 和 actor advantage,因此更需要 zero-mismatch 或强日志诊断。
- 跨论文关系定位:记录 VIMPO 与 Critic-Free Token-Level Credit Assignment,并连接 DAPO、VERL、Entropy Mechanism、RLVR boundary、Spurious Rewards、Schulman KL 和 TIM/VeXact。
Reference Intake Brief
Target
- Intended target system: 新增论文笔记。
- Existing related assets:
content/utility/papers-index.md;2503.14476、2505.22617、2504.13837、2506.10947、2020-03-07、2605.14220。 - Proposed form: 新建独立 Markdown 文档;更新
content/utility/papers-index.md;为 5 位作者补data/authors.json。
Reusable Elements
- VIMPO value loss:
。 - policy-implied actor advantage:
。 - baseline audit checklist:GRPO token-level、DAPO full recipe、PPO/VAPO、FIPO、spurious rewards、pass@
。 - exact KL scalability question:full-vocab KL vs k2/k3/candidate-set approximation。
- Berkeley reasoning RL/RLIF lineage:Self-Certainty → Intuitor → VIMPO。
Risks
- Copyright/over-copying: 只保留公式、数值和本地分析,不复制论文大段原文。
- Unsourced or unverifiable claims: 对 OpenReview、代码和作者 profile 只写已检索到的公开来源;VIMPO 未公开审稿。
- Tone/brand mismatch: 保持归档分析语气,避免把初版 arXiv 结果写成稳定结论。
- Safety/compliance issues: 论文不涉及直接滥用细节;reward hacking 相关内容只保留评测和方法论启发。
- Overlap with existing assets: 与 DAPO、Entropy、Spurious Rewards、RLVR Boundary 都有重叠,已在跨论文关系中区分。
Skipped
| Material | Reason |
|---|---|
| VIMPO 公开 reviewer comments | 未发现 OpenReview/ARR/会议公开审稿页,不能可靠匹配到当前 VIMPO 版本。 |
| 完整训练数据 | GitHub README 明确说明 dataset files are not committed。 |
| alphaXiv / Moonlight 摘要 | 可用于传播状态参考,但不进入证据链核心。 |
Recommendation
Decision: merge
Why: VIMPO 是 critic-free RLVR credit assignment 的重要新节点,直接连接 GRPO/DAPO、KL log-ratio、token-level advantage、reward noise robustness 和 exact KL 工程成本;虽然证据仍是 early-stage,但足以进入本地长期论文档案并和现有 RLVR 方法论线形成强关系。