2602.07078-optimal-token-baseline-long-horizon-llm-rl

The Optimal Token Baseline: Variance Reduction for Long Horizon LLM RL

OTB 解决的是 long-horizon LLM-RL 中 outcome reward 经过整条 response 回传时的高方差问题:它从 causal policy gradient 的方差最小化目标推导出 token-level optimal baseline,用截至当前 token 的累计 gradient realized energy 对 return 加权并按该能量的期望归一化;再用 forward pass 可得到的 logit-gradient proxy 近似这项能量,把原本需要 backward gradient norm 的权重改写成由当前采样 token 概率和完整 policy 概率向量范数计算的量。实验显示 OTB 在 Qwen single-turn reasoning 与 TIR 场景中优于 GRPO/RLOO/OPO/OGB/SimpleTIR,且每组 4 条 rollout 接近每组 32 条的 token 消耗效果;证据边界在于 proxy 假设、full-vocab probability 额外开销、single-seed/peak reporting、数学/TIR 域集中,以及 group-baseline finite-sample bias。

Authors Yingru Li (李英儒), Jiawei Xu, Ziniu Li (李子牛), Jiacai Liu (刘佳材), Wei Liu (刘威), Yuxuan Tong (童雨轩), Longtao Zheng (郑龙韬), Zhenghai Xue, Yaxiang Zhang, Tianle Cai (蔡天乐), Ge Zhang, Qian Liu (刘乾), Baoxiang Wang (王宝祥)

已审阅 Archived 2026-06-22 10:21 Updated 2026-07-16 19:17 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

阅读目标与判断边界

本笔记关注:

  1. OTB 的 baseline 最优性来自哪个方差目标,和 GRPO/RLOO/OGB/OPO 的差别是什么。
  2. realized energy WtW_t 如何把“哪个 token 的 score gradient 更容易放大方差”变成可估计权重。
  3. logit-gradient proxy 为什么只用 forward logits 就能近似 gradient norm,以及这个近似依赖哪些假设。
  4. OTB 在 verl 中如何落地,配置和 kernel 支持有什么限制。
  5. OTB 和 TRM、VIMPO、DAPO、Entropy Mechanism、TIM/VeXact 的关系。

判断边界:

  • arXiv HTML 中部分公式渲染不完整,本笔记以 TeX source 为公式依据。
  • 实验主要是 math reasoning 与 tool-integrated reasoning,不能直接外推到 open-ended instruction following、代码 agent、browser/OS agent 或多模态 RL。
  • 论文主表以 peak performance 和训练曲线为主,缺少多 seed 方差、置信区间和完整 ablation logs。
  • OTB 需要 group sampling。verl 文档明确指出 single-rollout batch 下 OTB 会退化成 vanilla returns。
  • OTB 使用 sampled token probability 和 full distribution vπ(v)2\sum_v \pi(v)^2;若训练使用 fused linear-cross-entropy kernels,需要额外支持或回退。

论文脉络

1. 研究问题、背景和价值

Long-horizon LLM-RL 经常使用 outcome-only reward。数学推理、代码、工具调用和多轮任务里,reward 往往只在最终答案或工具轨迹完成后给出。policy gradient 需要把这个稀疏信号分配给上千到上万 token。序列变长后,两个问题会同时出现。

第一,score function 会沿时间累加。标准 REINFORCE 形式是:

g^(τ)=R(τ)S(τ),S(τ)=t=1Tst, \hat g(\tau)=R(\tau)S(\tau), \qquad S(\tau)=\sum_{t=1}^{T}s_t,

其中

st=θlogπθ(ytx,y<t). s_t=\nabla_\theta\log\pi_\theta(y_t\mid x,y_{<t}).

TT 很大时,S(τ)S(\tau) 的 norm 可能由少数 token 主导。即使两条 response reward 相同,它们对梯度方差的贡献也可能差很多。

第二,RLVR 常用的 group-relative baseline 粒度较粗。GRPO/RLOO 用同一 prompt 下多条 rollout 的均值或留一均值作为 baseline,能消掉一部分 prompt-level reward 偏移,但没有区分同一 response 内不同 token 的 gradient energy。长 CoT 里真正让梯度不稳定的 token 往往集中在少数位置,sequence-level baseline 很难对齐这种局部异质性。

OTB 的价值在于把 baseline 从“按 response 或 prompt 做平均”推进到“按 token 前缀的累计 gradient energy 做加权”。它仍然保持 critic-free,不训练 value model;同时给出一个只依赖 logits 的近似,让方法能接入 verl 这类现有 RL trainer。

2. 已有解决方案与不足

已有方法可以放在同一张坐标系里看。

  1. GRPO / RLOO:用同一 prompt 的 group reward 估计 baseline。优点是简单、省 critic;缺点是所有 token 共享同一类 response-level advantage,无法处理 token-level variance heterogeneity。

  2. OGB, Optimal Global Baseline:推导 sequence-level 方差最优 baseline:

    Bglobal(x)=Eτ[R(τ)S(τ)2]Eτ[S(τ)2]. B^*_{\mathrm{global}}(x) = \frac{\mathbb E_\tau[R(\tau)\lVert S(\tau)\rVert^2]} {\mathbb E_\tau[\lVert S(\tau)\rVert^2]}.

    它承认 gradient energy 会影响 baseline,但仍用一个全局 baseline 作用于整条序列。

  3. OPO / length proxy:用 token length 或类似序列属性作为 proxy 做加权。它更容易实现,但 length 只能粗略反映长序列风险,不能代表具体 token 的 score-gradient norm。

  4. Actor-critic / value model:可以提供 token-level value,但需要训练 critic,系统成本和不稳定源更多。

OTB 在这几条路线中选择了一个中间点:保持无 critic,推导 token-level optimal baseline,再用 logit distribution 估计每个 token 对 gradient energy 的贡献。

3. 作者可能的思考路径

作者的思考路径大概率从训练崩溃现象出发。长序列 RL 中,训练曲线常出现 reward 先涨后掉、response length 失控、train-rollout KL 扩大、梯度范数和方差 proxy 升高。若只看 reward baseline,GRPO 似乎已经有 group centering;继续出现不稳定,说明问题不只在 prompt-level reward shift,还在不同 trajectory / token 的 score gradient energy。

于是可以先写出 REINFORCE 方差。加入 baseline 后,true gradient 不变,方差项由 E[tst(GtBt)2]\mathbb E[\lVert\sum_t s_t(G_t-B_t)\rVert^2] 控制。若暂时忽略不同时间步 score 的交叉项,问题会落到每个 tt 的局部加权最小二乘:

minBtE[Wt(GtBt)2]. \min_{B_t}\mathbb E[W_t(G_t-B_t)^2].

这个目标直接给出 weighted mean。权重越大,说明该 token 前缀的 gradient energy 越大;它对方差贡献越敏感,baseline 越应该更贴近这类样本的 return。

难点随即变成如何估计 WtW_t。真实

Wt=j=1tsj2 W_t=\sum_{j=1}^{t}\lVert s_j\rVert^2

需要 parameter-space gradient norm,直接计算会引入额外 backward 或 per-token gradient 成本。作者转向 logits:对于 sampled token 的 logprob,logit-space gradient 有闭式形式 eytπte_{y_t}-\pi_t。在 RMSNorm / final linear layer / 近似 isotropic gradient propagation 假设下,logit-gradient norm 可以作为 full parameter score norm 的 proxy。

4. 核心假设或切入点

OTB 的切入点可以概括为一句话:baseline 应该更贴近高 realized-energy token 的 return,因为这些 token 对梯度方差的贡献更大。

causal policy gradient 写成:

g~c(τ)=t=1Tst(GtBt). \tilde g_c(\tau)=\sum_{t=1}^{T}s_t(G_t-B_t).

这里 GtG_t 是 reward-to-go,BtB_t 是对第 tt 步使用的 baseline。若 baseline 满足只依赖 action 采样前的历史 (x,y<t)(x,y_{<t}),它不会改变期望梯度。

论文把每个 token 的累计 realized energy 定义为:

Wt=j=1tsj2=j=1tθlogπθ(yjx,y<j)2. W_t=\sum_{j=1}^{t}\lVert s_j\rVert^2 = \sum_{j=1}^{t} \left\lVert \nabla_\theta\log\pi_\theta(y_j\mid x,y_{<j}) \right\rVert^2.

方差最小化的局部目标是:

J(Bt)=Eytπθ(x)[Wt(GtBt)2]. J(B_t)= \mathbb E_{y_{\le t}\sim\pi_\theta(\cdot\mid x)} \left[ W_t(G_t-B_t)^2 \right].

BtB_t 求导得到 optimal token baseline:

Bt(x)=E[GtWt]E[Wt]. B_t^*(x) = \frac{\mathbb E[G_tW_t]}{\mathbb E[W_t]}.

这个式子说明 OTB 的 baseline 是 weighted return mean,权重来自 gradient realized energy。若某条 rollout 在第 tt 步之前积累了更大的 score-gradient norm,它在 baseline 估计里权重更高。

5. 方法 / 系统 / 理论框架

5.1 Practical OTB estimator

真实 WtW_t 不能高效计算,论文用 group samples 估计:

B^t=i=1NGt(i)W^t(i)i=1NW^t(i)+ϵ. \hat B_t = \frac{\sum_{i=1}^{N}G_t^{(i)}\hat W_t^{(i)}} {\sum_{i=1}^{N}\hat W_t^{(i)}+\epsilon}.

其中第 ii 条 rollout 的 proxy realized energy 是:

W^t(i)=j=1tw^j(i). \hat W_t^{(i)} = \sum_{j=1}^{t}\hat w_j^{(i)}.

最终 advantage 使用:

A^t(i)=Gt(i)B^t. \hat A_t^{(i)}=G_t^{(i)}-\hat B_t.

OTB 的加权 baseline 必须按 valid response tokens 计算。padding、truncation、EOS 后 token 如果进入 WtW_t,会把长度和 padding artifact 混入 baseline。论文和 verl 文档都强调只在有效 token 上统计。

5.2 Logit-Gradient Proxy

给定 logits ztz_t 和概率分布 πt=softmax(zt)\pi_t=\mathrm{softmax}(z_t),sampled token yty_t 的 logprob 对 logits 的梯度为:

δt=ztlogπθ(ytx,y<t)=eytπt. \delta_t = \nabla_{z_t}\log\pi_\theta(y_t\mid x,y_{<t}) = e_{y_t}-\pi_t.

于是 logit-gradient norm 有闭式表达:

w^t=δt2=12πθ(ytx,y<t)+πt22. \hat w_t = \lVert\delta_t\rVert^2 = 1-2\pi_\theta(y_t\mid x,y_{<t}) +\lVert\pi_t\rVert_2^2.

其中:

πt22=vVπθ(vx,y<t)2. \lVert\pi_t\rVert_2^2 = \sum_{v\in\mathcal V}\pi_\theta(v\mid x,y_{<t})^2.

这个 proxy 有直观含义。若 sampled token 概率很高,eyte_{y_t}πt\pi_t 更接近,logit-gradient norm 较小;若 sampled token 是低概率 token,梯度需要更明显地改变 logits,proxy 更大。πt22\lVert\pi_t\rVert_2^2 则反映整个 next-token distribution 的集中程度。

论文进一步用 final linear layer 解释 proxy 和 parameter gradient 的关系。若 zt=Whtz_t=Wh_t,则:

Wlogπθ(ytx,y<t)F=δt2ht2. \lVert\nabla_W\log\pi_\theta(y_t\mid x,y_{<t})\rVert_F = \lVert\delta_t\rVert_2\lVert h_t\rVert_2.

在 RMSNorm 后,ht2\lVert h_t\rVert_2 通常接近 dmodel\sqrt{d_{\mathrm{model}}}。再假设梯度沿 backbone 传播时近似 isotropic,full score norm 与 δt22\lVert\delta_t\rVert_2^2 成比例。这个假设解释了为什么只看 logits 可以近似 gradient realized energy,也提示了主要局限:proxy 是结构化近似,不能保证在所有 architecture、normalization、MoE routing 或 quantized/fused path 中都稳定。

5.3 Unbiasedness and finite-group bias

baseline 不改变 policy gradient 的条件是:第 tt 步 baseline 在采样 yty_t 之前已经确定,即只依赖 (x,y<t)(x,y_{<t})。理论上 BtB_t^* 满足这个条件。

实践中,B^t\hat B_t 用同一 prompt 的 group samples 估计。因为当前样本也参与了 group weighted mean,有限 NN 下会引入和 GRPO/RLOO 类似的 leave-one-out 问题。论文把这种偏差视为 O(1/N)O(1/N) 级别;当 NN 足够大时渐近消失。verl 文档要求 rollout.n > 1,并指出单条 rollout 下 OTB 会退化。

5.4 OTB and OGB variance gap

OGB 使用单个全局 baseline:

Bglobal=E[RS2]E[S2]. B_{\mathrm{global}}^* = \frac{\mathbb E[R\lVert S\rVert^2]} {\mathbb E[\lVert S\rVert^2]}.

OTB 使用每个 token 的 BtB_t^*。论文给出的分解可以理解为:全局 baseline 的方差目标等于 OTB 的最优目标,加上每个 token baseline 被迫共享同一个全局值造成的正 gap:

tE[Wt(BtBglobal)2]0. \sum_t \mathbb E \left[ W_t(B_t^*-B_{\mathrm{global}}^*)^2 \right] \ge 0.

因此只要不同 token / prefix 的 optimal baseline 存在差异,OGB 就会留下额外方差。长序列里这种差异更常见,因为 early reasoning branch、tool call、verification token、final answer token 对 return 和 gradient energy 的关系并不相同。

5.5 Off-policy extension

appendix 将 OTB 扩展到 off-policy / rollout correction 场景。设 behavior policy 是 πβ\pi_\beta,target policy 是 πθ\pi_\theta

ρt=πθ(ytx,y<t)πβ(ytx,y<t),ρˉt=min(c,ρt). \rho_t= \frac{\pi_\theta(y_t\mid x,y_{<t})} {\pi_\beta(y_t\mid x,y_{<t})}, \qquad \bar\rho_t=\min(c,\rho_t).

使用 token importance sampling 后,variance weight 会带上 clipped ratio squared:

W^tTIS=j=1tρˉj2w^j. \hat W_t^{\mathrm{TIS}} = \sum_{j=1}^{t}\bar\rho_j^2\hat w_j.

对应 practical baseline:

B^tTIS=iGt(i)W^t(i),TISiW^t(i),TIS+ϵ. \hat B_t^{\mathrm{TIS}} = \frac{\sum_iG_t^{(i)}\hat W_t^{(i),\mathrm{TIS}}} {\sum_i\hat W_t^{(i),\mathrm{TIS}}+\epsilon}.

这部分和 2605.14220 TIM/VeXact 以及 2512.23075 TRM 直接相关。TIS 处理 behavior-target ratio,OTB 处理 baseline variance;两者可以组合,但 TIS clipping 会引入 bias,因此 off-policy OTB 的目标从无偏方差最小化转向小偏差近似下的 MSE 控制。

5.6 verl implementation

verl PR #4678 添加 AdvantageEstimator.OPTIMAL_TOKEN_BASELINE,让 actor 在 forward 时输出 sum_pi_squared,并提供:

  • calculate_sum_pi_squared_from_logits
  • compute_variance_proxy_metrics
  • compute_optimal_token_baseline_advantage
  • tir_optimal_token_baseline

核心配置形态是:

algorithm.adv_estimator: optimal_token_baseline
actor_rollout_ref.actor.calculate_sum_pi_squared: true
actor_rollout_ref.rollout.n: 8

verl docs 同时给出 tir_optimal_token_baseline,并提示当前 fused kernels 需要额外兼容。因为 OTB 要计算 vπ(v)2\sum_v\pi(v)^2,如果训练路径只保留 sampled-token logprob,无法直接得到 proxy。

6. 结论链条

  1. Long-horizon outcome RL 的梯度方差随 token score 累积放大,sequence-level group baseline 只能消除一部分 prompt / response 层面的均值偏移。
  2. 若把 causal policy gradient 的方差目标局部化,每个 token 的最优 baseline 是 reward-to-go 按累计 gradient realized energy 加权的均值。
  3. 真实 realized energy 需要 per-token parameter gradient norm,成本过高;logit-gradient norm 提供可由 forward logits 计算的 proxy。
  4. RMSNorm + final linear layer + isotropic propagation 假设支撑 proxy 与 full score norm 的比例关系。
  5. 在 single-turn reasoning 与 TIR 任务中,OTB 比 GRPO/RLOO/OPO/OGB/SimpleTIR 更稳,训练 collapse 更少;N=4 组大小接近 N=32 的效果,降低 token consumption。
  6. 这些结果支持“variance-aware token baseline 是 long-horizon LLM-RL 的有效稳定化模块”,但还需要多 seed、更大域、更强 baseline、fused-kernel overhead 和 off-policy 组合复验。

关键实验/定理

结果 1:Optimal Token Baseline theorem

  • 设置:causal policy gradient estimator g~c(τ)=tst(GtBt)\tilde g_c(\tau)=\sum_ts_t(G_t-B_t);baseline 只能依赖 action 前历史;局部方差目标 J(Bt)=E[Wt(GtBt)2]J(B_t)=\mathbb E[W_t(G_t-B_t)^2]

  • 结论:

    Bt=E[GtWt]E[Wt]. B_t^* = \frac{\mathbb E[G_tW_t]}{\mathbb E[W_t]}.
  • 解读:OTB 把 baseline 从 simple group mean 改成 realized-energy weighted mean。它倾向于更匹配高 gradient-energy token 的 return,从而降低这些 token 对整体梯度方差的放大。

结果 2:主表 single-turn reasoning

  • 设置:Qwen3-8B-Base;deduplicated DAPO-MATH-17k;full on-policy RL;batch size 128;max response length 8192;group size 16;rule-based reward;无 KL reward / entropy regularization。
  • 指标:AIME25、AIME24、AMC23、MATH500。
  • 结果:
Method AIME25 AIME24 AMC23 MATH500
GRPO 25.31 31.35 80.86 90.50
RLOO 24.38 28.96 74.53 90.56
OPO 27.29 35.31 84.53 93.31
OGB 30.10 33.13 80.55 90.75
OTB 30.31 37.29 85.08 93.43
  • 解读:OTB 在四项指标上整体最好,尤其 AIME24 / AMC23 相对 OGB 和 OPO 更强。AIME25 上 OTB 与 OGB 接近,说明 token-level baseline 的收益幅度会随 benchmark 变化。

结果 3:主表 TIR

  • 设置:Qwen2.5-7B;SimpleTIR-style tool-integrated reasoning;相同数学数据与 on-policy RL 设定。
  • 指标:AIME25、AIME24、AMC23、MATH500。
  • 结果:
Method AIME25 AIME24 AMC23 MATH500
GRPO 18.54 27.60 59.45 76.88
RLOO 20.10 25.00 62.42 76.06
OPO 20.83 29.90 64.84 76.94
OGB 21.15 30.63 62.50 75.69
SimpleTIR 26.67 37.91 71.25 82.25
OTB 28.13 41.46 79.45 84.69
  • 解读:TIR 场景里 OTB 对 AMC23 的提升很明显,说明 tool call / multi-stage reasoning 中 token-level variance heterogeneity 更强。这里也要注意,OTB 对比 SimpleTIR 时同时涉及 baseline 方法和 TIR recipe 组合,复验需要拆分不同模块贡献。

结果 4:token consumption reduction and group size

  • 设置:对比 rollout group size N=4,8,16,32N=4,8,16,32;观察最终性能与 token consumption。
  • 论文结果:OTB 的 N=4N=4 能接近 baseline N=32N=32 的效果;project page 称 single-turn / TIR token saving 约为 62% / 66%,paper text/table 中对应报告为约 66.03% / 68.32%。
  • 解读:这个结果是 OTB 工程价值最大的部分。若小 group 就能达到大 group 方差水平,训练吞吐和 token budget 会直接受益。但不同公开材料中节省比例略有差别,归档时保留二者并优先以后续复现实验校准。

结果 5:proxy ablation

  • 设置:比较 Logit-Gradient Proxy、length proxy、global baseline 等估计方式。
  • 结果:论文报告 Logit-Gradient Proxy 是稳定训练的关键;length proxy 在更长或 TIR 场景下容易 collapse。
  • 解读:这支持“variance 不能用长度单独解释”的判断。长序列确实带来更高风险,但真正进入方差目标的是 score-gradient energy。length 只能作为粗 proxy,无法区分高概率 filler token 和低概率关键决策 token。

证据链强度评估

强证据

  • OTB 公式从局部加权二次目标直接推导,Bt=E[GtWt]/E[Wt]B_t^*=\mathbb E[G_tW_t]/\mathbb E[W_t] 是清晰的 weighted least-squares 解。
  • logit-gradient proxy eyπ2=12π(y)+vπ(v)2\lVert e_y-\pi\rVert^2=1-2\pi(y)+\sum_v\pi(v)^2 有精确闭式形式,可直接由 logits 计算。
  • verl PR #4678 已合入,说明方法不只停留在论文伪代码层;docs 给出了配置、metrics、TIR variant 和 kernel caveat。

中等强度证据

  • single-turn 与 TIR 主表都显示 OTB 优于 GRPO/RLOO/OPO/OGB,方向一致。
  • N=4 接近 N=32 和 token saving 结果支撑训练效率收益,但公开材料中的 saving 数字有轻微差异,需要用同一代码版本复算。
  • train-rollout KL、gradient variance proxy、gradient norm、entropy、response length 等曲线支持 OTB 减少 collapse,但缺少完整多 seed statistical report。

需要谨慎的推论

  • Logit-Gradient Proxy 到 full parameter gradient norm 的关系依赖 RMSNorm、final linear layer 和 isotropic propagation 假设;MoE、不同 normalization、quantization、fused kernels、adapter tuning 下可能改变比例关系。
  • OTB 的 group estimator 有 finite-NN bias;小 group 高性能不等于 baseline 完全无偏。
  • 实验集中在 math reasoning / TIR,不能自动推广到 coding agent、browser agent、multi-modal agent、human preference RLHF。
  • OTB 减 variance,不直接解决 rollout/current mismatch、reward hacking、spurious reward、pass@kk coverage 或 verifier artifact。

OpenReview / 审稿意见吸收

  • Venue status: arXiv v1;TeX source 使用 icml2026 preprint style;Longtao Zheng 和 Wei Liu 个人主页标注 OTB as ICML 2026 / Proceedings,project page 与 verl docs 也公开关联该工作。
  • Public reviews: 未发现可可靠匹配 2602.07078 / "The Optimal Token Baseline" 的公开 OpenReview forum 或 reviewer comments 页面。
  • Ratings / confidence: 无公开评分可归档。
  • Reviewer consensus: 无公开 reviewer consensus 可归档。
  • Main criticisms: 无公开审稿意见;本地评估保留 proxy 假设、single-seed/peak reporting、fused-kernel overhead、off-policy extension bias 和 task-domain coverage 作为主要风险。
  • Author response: 未发现公开 author response。
  • 对可信度的影响: 论文的理论推导和 verl 落地信号较强,公开审稿意见缺失会降低对实验充分性的外部校验;后续如果 ICML 2026 页面或 OpenReview comments 公开,需要补入 reviewer 对 proxy validity、ablation、compute overhead 和 baseline fairness 的反馈。

本地讨论补充

1. OTB、TRM、VIMPO 的问题分层

  • 2512.23075 TRM 关心 rollout policy 与 training policy 分离时的 surrogate objective error。它要回答哪些样本仍处在 trust region 内。
  • OTB 关心同一个 on-policy / near-on-policy estimator 内部的 gradient variance。它要回答 baseline 应该如何按 token energy 加权。
  • 2606.20008 VIMPO 关心 outcome reward 如何形成 token-level credit assignment。它要回答 actor advantage 能否由 policy/reference log-ratio 诱导。

这三者可以组合,但优化目标不同。TRM 先过滤或修正不可信样本,OTB 在可信样本内降低方差,VIMPO 试图把 reward 信号重新分配到 token-level actor update。

2. OTB 和 GRPO baseline 的关系

GRPO 用 group mean reward 作为 baseline,隐含每条 rollout、每个 token 对方差的贡献权重相同。OTB 把这个权重换成 W^t\hat W_t。若所有 token 的 realized energy 近似相同,OTB 会接近 group mean;若少数 token 的 W^t\hat W_t 很大,OTB 会让这些样本对 baseline 估计影响更大。

这个变化看起来简单,但它和 Monte Carlo 方差控制一致:baseline 本身不提供新 reward,它通过让高方差项的 centered return 更小来降低 estimator variance。

3. 为什么 low-probability sampled token 权重更大

对 sampled token yty_t,logit-gradient proxy 是:

w^t=12π(yt)+vπ(v)2. \hat w_t=1-2\pi(y_t)+\sum_v\pi(v)^2.

π(yt)\pi(y_t) 很低时,第一项 11 仍在,2π(yt)-2\pi(y_t) 很小,整体 proxy 较大。这意味着模型采到了一个当前 policy 认为低概率的 token,若该 token 还带来高 return 或低 return,它会对 policy gradient 产生更大改变。OTB 让 baseline 更关注这类 token 前缀,降低它们把梯度方向拉偏的概率。

4. 后续复验指标

  • 每步 w^t\hat w_tW^t\hat W_t 分布,按 token position、token probability、correct/incorrect rollout、tool call stage 分桶。
  • OTB advantage variance、gradient norm、train-rollout KL、policy entropy、response length、pass@1/avg@k/pass@k。
  • N=4/8/16/32 下 token consumption、wall-clock throughput、GPU memory、logits retention overhead。
  • 与 DAPO、VAPO、VIMPO、TRM、TIS/RS 的组合实验,拆分 variance reduction、trust-region filtering、token credit assignment 的贡献。
  • fused CE kernels 与 non-fused logits path 的性能差异,尤其是 vπ(v)2\sum_v\pi(v)^2 的计算开销。

主要启发

  • 长序列 RL 稳定性不能只看 reward baseline,还要看 score-gradient energy 的位置和分布。
  • outcome-only RL 的 token-level 改造有多条路线:OTB 做 variance-aware baseline,VIMPO 做 policy-implied value,Entropy Mechanism 做 covariance/entropy control,TRM 做 trust-region sample admission。
  • 对 RL 系统实现而言,forward logits 中的 full distribution statistic 会变得更重要。只保存 sampled-token logprob 的轻量路径无法支持 OTB、exact KL、VIMPO 这类方法的完整诊断。
  • OTB 的工程卖点在 token budget。若小 rollout group 通过更好 baseline 接近大 group,训练成本下降会比单点 benchmark 提升更有价值。

局限

  1. Proxy assumption 需要更多验证。eyπ2\lVert e_y-\pi\rVert^2 与 full parameter score norm 的比例关系依赖 architecture 和训练路径;MoE routing、RMSNorm 位置、quantization、fused kernels、adapter tuning 都可能改变它。
  2. Group estimator 存在 finite-NN bias。论文把偏差视为渐近可忽略,但小 NN 正是节省 token 的主卖点,因此需要 leave-one-out OTB 或 bias-corrected variant 的对照。
  3. 实验报告缺少多 seed 和置信区间。collapse 类问题对随机性敏感,peak reporting 容易高估稳定性。
  4. 任务覆盖集中在数学与 TIR。coding agents、browser/OS agents、多工具环境和 open-ended RLHF 的 reward structure 不同,GtG_tW^t\hat W_t 的相关性可能改变。
  5. 计算开销不应只看 token consumption。OTB 需要 full-vocab probability statistic,可能影响 memory、fused kernel、activation/logits retention 和 trainer throughput。
  6. OTB 不控制 mismatch。若 rollout engine 与 trainer logprob 不一致,仍需要 TIM/VeXact、rollout correction 或 TRM 先处理行为分布问题。
  7. off-policy OTB 依赖 clipped IS,bias / variance tradeoff 需要和 TIS、RS、sequence rejection 同时评估。

跨论文关系

  • 2512.23075 TRM 的关系:两篇论文共享多位作者和 verl 生态。TRM 处理 rollout/current mismatch 与 sequence-level trust region,OTB 处理 long-horizon policy-gradient variance;二者可以形成“先确保样本可信,再降低 estimator variance”的组合。
  • verl 官方仓库 的关系:OTB 已作为 verl algorithm estimator 合入,配置项、TIR variant 和 metrics 进入框架文档,属于 paper-to-framework 的直接落地节点。
  • 2503.14476 DAPO 的关系:OTB 使用 DAPO-MATH-17k 去重数据和 long-CoT GRPO/RLVR 背景;DAPO 解决 recipe 与系统 scale,OTB 改进 baseline variance。
  • 2606.20008 VIMPO 的关系:二者都反对把整条 response 的同一个 advantage 粗放广播到所有 token。VIMPO 引入 policy-implied token advantage,OTB 保留 reward-to-go advantage 结构但用 token realized energy 改 baseline。
  • 2505.22617 Entropy Mechanism 的关系:Entropy Mechanism 看 token covariance 和 entropy dynamics;OTB 看 logit-gradient norm / realized energy。二者都提示少数 token 可能主导训练动力学,但一个服务 exploration/entropy control,一个服务 variance reduction。
  • 2605.14220 TIM/VeXact2020-03-07 Schulman KL 的关系:off-policy OTB 需要 importance ratio 和 clipped ratio squared;若 ratio 方向、k2/k3 estimator 或 rollout/trainer logprob 不一致,baseline 权重也会被污染。
  • 2607.07508 SAO 的关系:两者都处理 long-horizon token-level advantage variance。OTB 用同 prompt group samples 估计 variance-minimizing baseline,rollout.n=1 时会退化;SAO 恢复一份显式 learned critic,使每 prompt 单 rollout 仍能获得 state-dependent baseline,同时增加 value pretraining、模型内存和 critic updates。
  • 跨论文关系定位:记录 OTB、Realized Energy 与 Gradient Variance Reduction,并加入 OTB 与 TRM、verl、DAPO、VIMPO、Entropy Mechanism、TIM/VeXact 的关系。

Reference Intake Brief

Target

  • Intended target system: 新增论文笔记 2602.07078-optimal-token-baseline-long-horizon-llm-rl.md,并更新 content/utility/papers-index.mddata/authors.json
  • Existing related assets: 2512.23075 TRM2503.14476 DAPO2606.20008 VIMPO2505.22617 Entropy Mechanism
  • Proposed form: 新建独立 Markdown 文档,补充索引行、对应论文的关系章节和作者档案。

Reusable Elements

  1. OTB 公式:Bt=E[GtWt]/E[Wt]B_t^*=\mathbb E[G_tW_t]/\mathbb E[W_t]
  2. Logit-Gradient Proxy:w^t=12π(yt)+vπ(v)2\hat w_t=1-2\pi(y_t)+\sum_v\pi(v)^2
  3. verl implementation:algorithm.adv_estimator=optimal_token_baselineactor.calculate_sum_pi_squared=truerollout.n>1
  4. 复验指标:advantage variance、gradient norm、train-rollout KL、entropy、response length、token consumption、logits statistic overhead。

Risks

  • Copyright/over-copying: 只保留必要公式、实验数字和短描述;没有复刻论文正文。
  • Unsourced or unverifiable claims: ICML 2026 status 仅作为作者主页/工程页 signal;公开审稿意见未发现,后续需要补审稿页。
  • Tone/brand mismatch: 以方法机制、证据强度和局限为主,避免宣传式表述。
  • Safety/compliance issues: 内容为 RL variance reduction 与训练系统分析,无直接滥用操作细节。
  • Overlap with existing assets: 和 TRM/VIMPO/Entropy Mechanism 区分为 variance reduction、trust-region control、token credit assignment、entropy dynamics 四条线。

Skipped

Material Reason
公开 reviewer comments 未发现 OpenReview/ARR/ICML 公开审稿页,或无法可靠匹配到当前论文版本。
ICML virtual page 搜索只发现零散社交摘要和作者主页标注,未可靠定位官方页面。
完整训练日志 project page、paper 与 verl PR 未提供可直接归档的完整 multi-seed raw logs。

Recommendation

Decision: merge

Why: OTB 是 long-horizon LLM-RL 中 variance reduction 的清晰节点,和本地已有 TRM / verl / DAPO / VIMPO / Entropy Mechanism 文档形成直接互补;理论推导、工程 PR 和实验结果都足以归档,同时需要保留 proxy 与实验充分性的边界。