2606.20008-vimpo-value-implicit-policy-optimization-llms

VIMPO: Value Implicit Policy Optimization for LLMs

VIMPO 试图填补 GRPO 和 PPO actor-critic 之间的空位:它不训练独立 critic,却从 KL-regularized RL 的最优性条件推出一个由 policy-reference log-ratio 表达的隐式 value recurrence,把终止状态的 value 设为零后将 outcome reward 变成 value loss,再用同一个 log-ratio identity 构造 token-level PPO actor advantage。它的主结果显示,在 Qwen3-4B-Base 数学 RLVR 上,VIMPO 比 token-level GRPO 在 MATH-500、AIME 2024/2025 和 OlympiadBench 上更高,并且在 25% reward flipping 下更稳;证据边界在于单模型、单 seed、数学域、exact full-vocab KL 成本和缺少 tuned PPO/VAPO/DAPO-style baseline。

Authors Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song, Xuandong Zhao

已审阅 Archived 2026-06-21 22:33 Updated 2026-07-16 19:17 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

阅读目标与判断边界

本笔记关注:

  1. VIMPO 如何从 KL 正则最优性条件推出隐式 value 和 token-level advantage。
  2. 它相对 GRPO 的真实差异:reward 进入 value loss,actor update 使用 policy-implied log-ratio advantage。
  3. 实验结果能支撑到什么程度,哪些部分还需要更强 baseline 和复验。

判断边界:

  • arXiv HTML 中部分公式变量渲染缺失,本笔记以 TeX source 为公式依据。
  • 代码仓库是 focused fork of verl,但数据文件未提交,公开复现仍需准备 Guru math subset 和验证 parquet。
  • 论文只报告 single-seed 4B math RLVR,结论不能直接外推到 code、tool use、open-ended instruction following、robotics 或更大模型。
  • exact KL 是方法推导的重要组成,使用 k2/k3/candidate-set 近似会改变 centering 性质,需要单独验证。

论文脉络

1. 研究问题、背景和价值

RLVR 已经成为 reasoning LLM 后训练的主线。DeepSeek-R1、DAPO、ProRL、BroRL 等工作说明,给数学和代码任务提供可验证 final reward,可以明显提高 pass@1 或 avg@k。但训练目标内部仍有一个长期张力:PPO actor-critic 有 value function,可以提供 token-level credit assignment;GRPO / DAPO 这类 critic-free 方法训练更简单、更省资源,但经常把同一个 trajectory-level advantage 广播到整条 response 的所有 token。

长 CoT 场景会放大这个问题。一条数学推理里,真正决定正确或错误的 token 往往集中在少数分支:一个变量定义、一个计数假设、一个代数变形、一个 final answer extraction。GRPO 把整条 response 当作一个不可拆的样本,会让普通连接 token 和关键推理 token 拿到相同 advantage。DAPO 的 token-level loss aggregation 改善了 loss reduction,但 advantage 仍是 response-level 的。

VIMPO 的价值在于提出一个更结构化的中间方案:保留 critic-free,不引入额外 value model;同时从 policy/reference log-ratio 中导出 token-level value/advantage 信号。若这个方向成立,RLVR 可以获得更细的 credit assignment,同时避免 critic 训练、critic drift 和 value-policy co-adaptation 的系统成本。

2. 已有解决方案与不足

已有路线可以分成三类。

  1. PPO / VAPO actor-critic:有显式 value function 和 GAE,token-level signal 更细,但要训练额外 critic。critic calibration、value pretraining、policy/critic 共同漂移都会增加不稳定性。
  2. GRPO / DAPO critic-free:用同一 prompt 的多条 rollout 做 group-relative advantage,省掉 critic。代价是 advantage 粒度粗,reward 只在 response 级别进入。
  3. Post-hoc credit assignment:FIPO 用 future-KL factor 重新加权 GRPO advantage,attention-based 方法用内部 attention 找 anchor token。这类方法能补局部信号,但更像附加权重规则。

VIMPO 的切入点是从 KL-regularized optimality 重新写 value,而非在 GRPO 结果上加权。它借用了 DPO/IPO 里常见的 log-ratio 参数化直觉:如果最优策略相对 reference 的 log-ratio 可以表达 reward 或 value,那么不一定需要单独训练 reward/value 网络。

3. 作者可能的思考路径

从已有背景出发,作者很可能先看到两个事实。第一,GRPO 在 reasoning RL 中很实用,尤其适合 outcome-only reward;第二,GRPO 的 per-token 学习信号很粗,解释不了一条 long-CoT 中哪些 prefix 决策应该被强化。

接着,DPO 的 log-ratio 形式提供了一个提示:在 KL-regularized objective 下,最优 policy 和 reference policy 的 log-ratio 本来就携带 reward/value 信息。把 autoregressive generation 写成 deterministic-transition MDP 后,Bellman equation 变得很简单,因为下一个 state 就是当前 prefix 加上 token。

这样可以把三件事连起来:KL 正则最优性给出 π(as)\pi^*(a|s)Q(s,a)Q^*(s,a) 的关系;deterministic Bellman equation 把 Q(s,a)Q^*(s,a) 写成 immediate reward 加 future value;终止状态没有 future reward,因此 V(sT)=0V(s_T)=0 可以作为边界条件。VIMPO 就是在这条链路上把 outcome reward 接回 token-level log-ratio。

4. 核心假设或切入点

核心假设是:policy 相对 frozen reference 的 token-level log-ratio 可以作为隐式 value / advantage 的承载变量。

KL-regularized local optimum 满足:

π(ast)=πref(ast)Z(st)exp(1βQ(st,a)). \pi^*(a\mid s_t) = \frac{\pi_{\mathrm{ref}}(a\mid s_t)}{Z(s_t)} \exp\left(\frac{1}{\beta}Q^*(s_t,a)\right).

deterministic transition 下:

Q(st,at)=r(st,at)+γV(st+1). Q^*(s_t,a_t)=r(s_t,a_t)+\gamma V^*(s_{t+1}).

合并后得到论文的核心 identity:

βlogπ(atst)πref(atst)=r(st,at)+γV(st+1)V(st)+βKL(st). \beta \log\frac{\pi^*(a_t\mid s_t)}{\pi_{\mathrm{ref}}(a_t\mid s_t)} = r(s_t,a_t)+\gamma V^*(s_{t+1})-V^*(s_t) +\beta \mathrm{KL}^*(s_t).

这说明每个 sampled token 的 log-ratio 可以被解释成 Bellman residual 加 KL correction。将其移项后,value 可以沿 token 序列递推;将其看作 residual 后,又能得到 token-level TD advantage。

5. 方法 / 系统 / 理论框架

ρt=βlogπθ(atst)πref(atst),κt=βKL(πθ(st)πref(st)). \rho_t=\beta\log\frac{\pi_\theta(a_t\mid s_t)}{\pi_{\mathrm{ref}}(a_t\mid s_t)}, \qquad \kappa_t=\beta\mathrm{KL}(\pi_\theta(\cdot\mid s_t)\|\pi_{\mathrm{ref}}(\cdot\mid s_t)).

VIMPO 的 policy-implied value 来自递推式:

Vπ(st)=γtV^0+k=0t1γkt[βlogπθ(aksk)πref(aksk)βKLπ(sk)r(sk,ak)]. V_\pi(s_t) = \gamma^{-t}\widehat V_0 + \sum_{k=0}^{t-1}\gamma^{k-t} \left[ \beta\log\frac{\pi_\theta(a_k\mid s_k)}{\pi_{\mathrm{ref}}(a_k\mid s_k)} -\beta\mathrm{KL}_\pi(s_k) -r(s_k,a_k) \right].

终止状态没有 future reward,因此训练目标是让 Vπ(sT)V_\pi(s_T) 接近 0:

LV(π)=12Vπ(sT)2. \mathcal L_V(\pi)=\frac12 V_\pi(s_T)^2.

在 outcome-only RLVR 中,除最后 token 外 reward 为 0,γ=1\gamma=1V^0\widehat V_0 用 group mean reward 估计。value loss 变成:

LV=12[t=0T1(ρtsg[κt])(RRˉ)]2. \mathcal L_V = \frac12 \left[ \sum_{t=0}^{T-1}(\rho_t-\operatorname{sg}[\kappa_t]) - (R-\bar R) \right]^2.

这里 sg\operatorname{sg} 表示 stop-gradient。作者这样做是为了让 KL 只作为 centering baseline,避免 value loss 通过直接操纵 full-distribution KL 来降低 loss。

这一步也澄清了一个容易混淆的说法:verifier 提供整条 response 的 outcome reward RR,逐 token 信号来自当前 policy 与 reference policy 的 log-ratio geometry。ρt\rho_t 只看实际采到的 token 相对 reference 被推高或压低多少,κt\kappa_t 看同一 prefix 上整个 next-token 分布相对 reference 的平均偏移成本。二者相减后得到一个 centered TD-like signal,再由整条轨迹的 consistency loss 约束其累计值接近 RRˉR-\bar R

actor 侧使用 policy-implied TD advantage:

A^tTD=ρtκt. \widehat A^{\mathrm{TD}}_t=\rho_t-\kappa_t.

也可以做 GAE-style accumulation:

A^tλ==0Tt1(γλ)A^t+TD. \widehat A^\lambda_t = \sum_{\ell=0}^{T-t-1}(\gamma\lambda)^\ell \widehat A^{\mathrm{TD}}_{t+\ell}.

VIMPO 最终目标是:

LVIMPO=LV+cALA, \mathcal L_{\mathrm{VIMPO}} = \mathcal L_V+c_A\mathcal L_A,

其中 LA\mathcal L_A 是 PPO clipped actor loss,actor advantage 会 detach 并在 valid response tokens 上 normalize。

这个结构的关键是:external reward 进入 value loss;actor loss 不直接乘 final reward,而使用由当前 policy/reference log-ratio 诱导出的 token-level advantage。value loss 负责把 cumulative log-ratio 对齐到 centered reward,actor branch 负责把这种内部 token signal 转成 PPO-style policy movement。

6. 结论链条

  1. GRPO 的 trajectory-level advantage 粒度粗,long-CoT 需要更细的 token-level credit assignment。
  2. KL-regularized optimality + deterministic autoregressive transition 可以把 optimal value 写成 policy-reference log-ratio recurrence。
  3. 终止状态 V(sT)=0V(s_T)=0 给 value loss 提供无参数 anchor,不需要训练独立 critic。
  4. 同一 identity 给出 ρtκt\rho_t-\kappa_t 形式的 token-level actor advantage,可接入 PPO clipped update。
  5. 在 Qwen3-4B-Base 数学 RLVR 上,VIMPO 相对 token-level GRPO 提升平均分,并在 25% reward flipping 下保持更高准确率。
  6. 这些结果支持“policy-implied value 可以改善 critic-free RLVR credit assignment”的方向,但还没有证明其在更大模型、更多域、更多 seeds 和 tuned actor-critic baseline 上稳定优越。

关键实验/定理

结果 1:主实验对比 GRPO

  • 设置:Qwen3-4B-Base;Guru math subset 54.4K examples;max prompt length 2048,max response length 4096;每 prompt 8 responses;prompt batch size 96,总 rollout responses 768;actor lr 10610^{-6};VIMPO 使用 β=5×104\beta=5\times10^{-4}cA=5×103c_A=5\times10^{-3}
  • 指标:MATH-500 avg@1、AIME 2024 avg@32、AIME 2025 avg@32、OlympiadBench avg@1。
  • 结果:
Method MATH-500 AIME24 AIME25 OlympiadBench Avg.
Qwen3-4B-Base 54.0 8.6 3.6 18.0 21.1
Naive GRPO 80.4 20.0 14.6 31.3 36.6
GRPO 79.6 19.3 17.6 33.2 37.4
VIMPO 81.6 21.7 20.8 34.0 39.5
  • 解读:VIMPO 在四个 benchmark 上都高于 GRPO,平均提升 2.1 分;AIME 2025 从 17.6 到 20.8,是最明显的单项差距。绝对提升不夸张,但方向一致。

结果 2:25% reward flipping 下更稳

  • 设置:训练时对 binary correctness reward 做 25% 独立翻转;训练和验证指标仍用 clean verifier;只跑前 200 training steps。
  • 指标:同主实验。
  • 结果:
Method MATH-500 AIME24 AIME25 OlympiadBench Avg.
GRPO noisy 75.2 13.0 11.7 28.9 32.2
VIMPO noisy 78.2 18.3 14.9 32.3 35.9
  • 解读:VIMPO 在 noisy setting 下平均高 3.7 分。论文解释为 reward 先进入 value-loss target,actor update 不直接按单个 corrupted label 放大,因此对 label flip 更不敏感。这个解释合理,但只覆盖独立随机 flip;systematic verifier bias、format reward 偏差和 spurious reward 需要额外实验。

结果 3:系数消融

  • 设置:比较 value-only cA=0c_A=0、主设置 β=5×104,cA=5×103\beta=5\times10^{-4}, c_A=5\times10^{-3}、高 β\beta / 高 cAc_A
  • 指标:training accuracy、VO KL、response length。
  • 结果:value-only 可以学习但慢;加入 PPO actor branch 后训练更快、VO KL 更高;高 β\beta / 高 cAc_A 初期快但很快 plateau;主设置到 200 步时 response 更长。
  • 解读:actor branch 主要作用是加速 policy movement;β\betacAc_A 同时影响 KL、学习速度和长度偏好。后续需要 schedule 或 adaptive coefficient,而不能只依赖固定值。

结果 4:entropy 与 token-level 可视化

  • 设置:附录记录 naive GRPO、GRPO、VIMPO 训练 entropy,并在 MATH-500 counting case 上比较 VIMPO GAE signal 和 Monte Carlo rollout-based TD diagnostic。
  • 指标:token-level policy entropy;选定 prefix 的 correctness probability change;normalized token signal。
  • 结果:两个 GRPO baseline entropy 更接近单调下降;VIMPO 进入低 entropy 后仍有小幅恢复。case study 中,VIMPO signal 在正确/错误 branch 的关键 token 上与 Monte Carlo diagnostic 大体一致。
  • 解读:这是机制 sanity check,而非强统计证据。它支持 VIMPO 的 token-level signal 有可解释结构,但不能单独证明泛化收益。

证据链强度评估

强证据

  • 方法推导清晰:从 KL-regularized optimality、Bellman recurrence、terminal anchor 到 outcome-only loss,链条完整。
  • 实验主对照控制了 base model、训练数据、batch size、responses per prompt、learning rate 等共享超参。
  • GRPO baseline 使用 DAPO-style token-level loss aggregation,避免拿较弱 sequence-mean baseline 做唯一对照。
  • 代码仓库公开了 verl fork、recipe/vimpo entry point、exact KL / candidate-set / k2 / k3 相关配置和 GRPO baseline run mode。

中等强度证据

  • 四个数学 benchmark 方向一致,但平均提升约 2.1 分,仍需要多 seed 置信区间。
  • noisy reward 结果有价值,但 25% independent flip 只模拟随机噪声,不覆盖 reward hacking、systematic verifier error 或 spurious reward。
  • entropy 和 token-level visualization 解释性强,但属于附录级定性证据。
  • 代码可读性较好,但数据文件未提交,仓库当前 commit 数很少,完整复现实验仍依赖外部数据和环境。

需要谨慎的推论

  • VIMPO 仍然依赖 frozen reference 的 full-distribution KL geometry。它没有显式 KL reward penalty,但 reference 通过 ρt\rho_tκt\kappa_t 深入进入目标。
  • 将最优策略 identity 中的 π\pi^* 替换成当前 trainable policy πθ\pi_\theta 是 DPO-like approximation。训练早期或远离 optimum 时,这个 policy-implied value 的校准程度需要实证诊断。
  • VIMPO 没有比较 tuned PPO / VAPO,也没有加入完整 DAPO dynamic sampling、overlong shaping、Clip-Higher 组合;因此当前结论是“优于这个 GRPO baseline”,而非“优于当前最强 RLVR recipe”。
  • exact KL 需要 policy 和 reference 的 full next-token distribution。大模型、长 response、MoE、pipeline parallel 和高吞吐 rollout 下,这个成本可能改变方法实用性。
  • 论文没有报告 pass@kk coverage、spurious reward baselines 或 model-family sweep,无法判断收益来自更好 credit assignment、base prior 重排、长度/format 行为变化还是 benchmark-specific dynamics。

OpenReview / 审稿意见吸收

  • Venue status: arXiv preprint v1,submitted 2026-06-18;未发现 VIMPO 对应 OpenReview / ARR / conference submission 页面。
  • Public reviews: 2026-06-21 搜索标题、arXiv id、OpenReview、ICLR/NeurIPS/ICML 组合,未找到可可靠匹配的公开 reviewer comments。
  • Ratings / confidence: 无公开评分。
  • Reviewer consensus: 无公开审稿共识可引用。
  • Main criticisms: 无公开 reviewer 批评;本地可信度主要由推导完整性、公开代码、实验对照和局限判断决定。
  • Author response: 无公开 rebuttal。
  • 对可信度的影响: 暂按 arXiv preprint 处理。由于同一作者组的 Intuitor 已有 ICLR 2026 Poster 与 OpenReview 页面,这条 Berkeley reasoning RL/RLIF 研究线有连续性,但不能把 Intuitor 的审稿状态转移给 VIMPO。

本地讨论补充

1. 讨论收敛点

  • 直接读 arXiv HTML 可以快速确认结构、结果和局限;TeX source 对公式仍然必要,因为 HTML 在公式变量上丢失较多。
  • VIMPO 的真正新意集中在 value loss 的目标来自 terminal boundary,并且 value 本身由 policy/reference log-ratio 递推出来。
  • actor advantage ρtκt\rho_t-\kappa_t 的期望为零,像一个 centered internal signal;reward 通过 LV\mathcal L_V 改变 policy,使后续 log-ratio 轨迹与 centered reward 对齐。

2. 修正后的理解

  • VIMPO 可以看成“critic-free Bellman consistency + PPO actor branch”。相比只更换 baseline,它额外改变了 reward 进入训练目标的路径,以及 token 获得 advantage 的方式。
  • 它和 DAPO 的关系要分清:DAPO 主要是 long-CoT RL recipe,包括 dynamic sampling、Clip-Higher、token-level loss、overlong reward shaping;VIMPO 主要是 objective / credit assignment。两者未来可以组合,但当前实验没有证明组合效果。
  • 它和 Entropy Mechanism 的关系也值得跟踪:VIMPO 附录显示 entropy 轨迹不像 GRPO 那么单调,但这只是现象;是否真正缓解 entropy collapse,需要按 2505.22617 的 covariance / entropy diagnostics 做专门实验。

3. Token 级 credit 的统计口径

VIMPO 的 token 级信号来自模型分布的 log-ratio geometry;verifier 只给每条 response 一个最终奖励 RiR_i。实际流程是:同一个 prompt 采样 GG 条 response,再做 group centering 得到 RiRˉR_i-\bar R。这个值仍然属于整条 response。

随后,对 response 中每个 token ata_t,在 prefix st=(x,a0,,at1)s_t=(x,a_0,\ldots,a_{t-1}) 上计算 sampled-token log-ratio:

ρt=β[logπθ(atst)logπref(atst)]. \rho_t = \beta\left[ \log\pi_\theta(a_t\mid s_t) - \log\pi_{\mathrm{ref}}(a_t\mid s_t) \right].

同一个 prefix 上还要计算 full-distribution KL:

κt=βaπθ(ast)[logπθ(ast)logπref(ast)]. \kappa_t = \beta \sum_a \pi_\theta(a\mid s_t) \left[ \log\pi_\theta(a\mid s_t) - \log\pi_{\mathrm{ref}}(a\mid s_t) \right].

二者的角色不同:ρt\rho_t 描述实际采到的 token 相对 reference 的偏移,κt\kappa_t 描述整个 next-token 分布的平均偏移成本。因此

A^tTD=ρtκt \widehat A^{\mathrm{TD}}_t=\rho_t-\kappa_t

可以理解为这个 token 相比当前 prefix 的整体 policy drift 是否更值得被强化。外部 reward 通过整条轨迹约束这些 token-level signal 的总和:

t=0T1(ρtsg[κt])RiRˉ. \sum_{t=0}^{T-1}(\rho_t-\operatorname{sg}[\kappa_t]) \approx R_i-\bar R.

所以 VIMPO 的“token 级 reward”更准确地说是 token-level credit / advantage。正确 response 会推动累计 log-ratio 对齐正的 centered reward,错误 response 会推动累计 log-ratio 对齐负的 centered reward;每个 token 的局部更新强弱则由 ρtκt\rho_t-\kappa_t 决定。GRPO 把同一个 RiRˉR_i-\bar R 广播到整条 response,VIMPO 用 reference-log-ratio 坐标把这股 reward pressure 分摊到不同 token。

4. 后续复验指标

  • 多 seed:每个 benchmark 报 mean / std / confidence interval,尤其 AIME 这种小样本 benchmark。
  • Stronger baselines:GRPO + DAPO recipe、DAPO + VIMPO、PPO/VAPO tuned actor-critic、FIPO / attention credit assignment。
  • Spurious baselines:random reward、format reward、incorrect reward、noisy verifier、systematic answer-extraction bias。
  • pass@kk coverage:比较 VIMPO、GRPO、base model 的 pass@1、pass@32、pass@128,区分 sampling efficiency 和 reasoning boundary expansion。
  • KL cost accounting:记录 exact KL forward 成本、reference logits 内存、吞吐下降,以及 k2/k3/candidate-set 近似对 accuracy 和 centering 的影响。
  • Train-rollout consistency:在 verl / vLLM / SGLang / FSDP2 环境中记录 rollout logprob、trainer logprob、K3、max token KL,避免 VIMPO 的 log-ratio signal 被实现级 mismatch 污染。

主要启发

  • RLVR credit assignment 可以沿三条轴拆:reward 粒度、value/advantage 粒度、policy update 约束。GRPO 解决了 critic 成本,VIMPO 尝试补回 token-level value/advantage 粒度。
  • KL/reference 的作用可以从“惩罚项”转成“表示坐标系”。VIMPO 不把 KL 当 explicit reward penalty,但它用 reference log-ratio 表达隐式 value。
  • Outcome-only reward 仍能产生 token-level signal,但需要假设 cumulative log-ratio 能承载最终 reward 差异。这个假设比 reward broadcast 更强,也更需要诊断。
  • 对工程实现,exact KL 是核心成本。若想大规模应用,近似 KL、cached reference distribution、candidate-set KL 和 low-rank / sparse logits 计算会成为关键。
  • 对论文评估,VIMPO 应和 RLVR boundary、spurious reward、entropy collapse 三条线一起看。只看四个 benchmark 平均分不足以判断它是否真正提升 reasoning。

局限

  1. 单模型单域单 seed。主实验集中在 Qwen3-4B-Base + math RLVR,缺少模型规模、模型家族、训练数据和随机种子维度。
  2. baseline 还不够强。没有 tuned PPO/VAPO,也没有完整 DAPO recipe 或 FIPO/attention credit assignment 对照。
  3. exact KL 成本高。full-distribution KL 对大模型、长序列和高吞吐 rollout 不友好。
  4. frozen reference 可能限制后期探索。固定 β\beta 和固定 reference 在训练后期可能让 policy 过度受初始化几何影响。
  5. reward noise 实验覆盖有限。25% independent flip 能测试随机噪声,对 reward hacking、系统性 verifier 错误和格式偏差说明不足。
  6. 缺少 pass@kk 和 coverage set 分析。当前无法区分 VIMPO 是扩大可解集合,还是更有效地重排 base prior 中已有路径。
  7. 理论 identity 是 optimality 条件,训练中使用当前 policy 代入。这个近似在远离 optimum 时的偏差需要更多诊断。
  8. 公开代码还不等于完整复现。仓库说明数据文件未提交,实验日志、seeds、完整环境和评测样本仍需补齐。

跨论文关系

  • 2503.14476 DAPO:DAPO 解决 long-CoT RL recipe 和系统复现问题,VIMPO 解决 critic-free credit assignment 问题。两者可组合,当前论文只比较较干净的 GRPO baseline,没有叠加 DAPO full recipe。
  • verl:VIMPO 代码是 verl focused fork,直接落在 PPO/GRPO/DAPO/rollout correction 生态中;未来可和 k2/k3、rollout logprob、TIS/RS、async rollout 诊断联动。
  • 2505.22617 Entropy Mechanism:Entropy 论文解释 GRPO-style RLVR 为什么快速消耗 entropy;VIMPO 附录显示 entropy 轨迹更不单调,但需要用 covariance token diagnostics 复验。
  • 2504.13837 RLVR boundary:VIMPO 报告 avg@1/avg@32 提升,仍缺 pass@kk coverage set;后续需要验证它是否扩大 reasoning boundary,或主要提高 sampling efficiency。
  • 2506.10947 Spurious Rewards:VIMPO 的 noisy reward 实验不能替代 random / format / incorrect reward baselines。若 VIMPO 也能在 spurious reward 下提升,需要重新拆解 credit assignment 与 base prior amplification。
  • 2020-03-07 Schulman KL:VIMPO repo 暴露 exact、candidate-set、k2、k3 等 KL estimator 选项;是否能用 Monte Carlo KL 近似替代 exact KL,应结合 k2/k3 的偏差方差性质和 VIMPO centering 需求判断。
  • 2605.14220 TIM/VeXact:VIMPO 的核心变量是 sampled-token log-ratio 和 full KL,rollout/trainer logprob mismatch 会直接污染 value loss 和 actor advantage,因此更需要 zero-mismatch 或强日志诊断。
  • 跨论文关系定位:记录 VIMPO 与 Critic-Free Token-Level Credit Assignment,并连接 DAPO、VERL、Entropy Mechanism、RLVR boundary、Spurious Rewards、Schulman KL 和 TIM/VeXact。

Reference Intake Brief

Target

  • Intended target system: 新增论文笔记。
  • Existing related assets: content/utility/papers-index.md2503.144762505.226172504.138372506.109472020-03-072605.14220
  • Proposed form: 新建独立 Markdown 文档;更新 content/utility/papers-index.md;为 5 位作者补 data/authors.json

Reusable Elements

  1. VIMPO value loss:LV=12[t(ρtsg[κt])(RRˉ)]2\mathcal L_V=\frac12[\sum_t(\rho_t-\operatorname{sg}[\kappa_t])-(R-\bar R)]^2
  2. policy-implied actor advantage:A^tTD=ρtκt\widehat A^{TD}_t=\rho_t-\kappa_t
  3. baseline audit checklist:GRPO token-level、DAPO full recipe、PPO/VAPO、FIPO、spurious rewards、pass@kk
  4. exact KL scalability question:full-vocab KL vs k2/k3/candidate-set approximation。
  5. Berkeley reasoning RL/RLIF lineage:Self-Certainty → Intuitor → VIMPO。

Risks

  • Copyright/over-copying: 只保留公式、数值和本地分析,不复制论文大段原文。
  • Unsourced or unverifiable claims: 对 OpenReview、代码和作者 profile 只写已检索到的公开来源;VIMPO 未公开审稿。
  • Tone/brand mismatch: 保持归档分析语气,避免把初版 arXiv 结果写成稳定结论。
  • Safety/compliance issues: 论文不涉及直接滥用细节;reward hacking 相关内容只保留评测和方法论启发。
  • Overlap with existing assets: 与 DAPO、Entropy、Spurious Rewards、RLVR Boundary 都有重叠,已在跨论文关系中区分。

Skipped

Material Reason
VIMPO 公开 reviewer comments 未发现 OpenReview/ARR/会议公开审稿页,不能可靠匹配到当前 VIMPO 版本。
完整训练数据 GitHub README 明确说明 dataset files are not committed。
alphaXiv / Moonlight 摘要 可用于传播状态参考,但不进入证据链核心。

Recommendation

Decision: merge

Why: VIMPO 是 critic-free RLVR credit assignment 的重要新节点,直接连接 GRPO/DAPO、KL log-ratio、token-level advantage、reward noise robustness 和 exact KL 工程成本;虽然证据仍是 early-stage,但足以进入本地长期论文档案并和现有 RLVR 方法论线形成强关系。