2602.07078-optimal-token-baseline-long-horizon-llm-rl
The Optimal Token Baseline: Variance Reduction for Long Horizon LLM RL
OTB 解决的是 long-horizon LLM-RL 中 outcome reward 经过整条 response 回传时的高方差问题:它从 causal policy gradient 的方差最小化目标推导出 token-level optimal baseline,用截至当前 token 的累计 gradient realized energy 对 return 加权并按该能量的期望归一化;再用 forward pass 可得到的 logit-gradient proxy 近似这项能量,把原本需要 backward gradient norm 的权重改写成由当前采样 token 概率和完整 policy 概率向量范数计算的量。实验显示 OTB 在 Qwen single-turn reasoning 与 TIR 场景中优于 GRPO/RLOO/OPO/OGB/SimpleTIR,且每组 4 条 rollout 接近每组 32 条的 token 消耗效果;证据边界在于 proxy 假设、full-vocab probability 额外开销、single-seed/peak reporting、数学/TIR 域集中,以及 group-baseline finite-sample bias。
Source
- Title: The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL
- arXiv: https://arxiv.org/abs/2602.07078
- HTML: https://arxiv.org/html/2602.07078v1
- PDF: https://arxiv.org/pdf/2602.07078
- TeX Source: https://arxiv.org/e-print/2602.07078
- Project / Blog: https://yingru.notion.site/The-Optimal-Token-Baseline-399211a558b782cfa936014c0d42dfb8
- Implementation PR: https://github.com/verl-project/verl/pull/4678
- Related docs: https://github.com/verl-project/verl/blob/main/docs/algo/otb.md
- Dataset: https://huggingface.co/datasets/Jiawei415/DPAO_filter
- OpenReview / Review page: 未发现可可靠匹配到
2602.07078的公开 OpenReview / ARR / ICML reviewer comments 页面;Longtao Zheng 与 Wei Liu 个人主页均把 OTB 标注为 ICML 2026 / Proceedings,verl 文档也链接该 arXiv,但本次只把这些记录作为作者页和工程页的 venue signal。 - Authors: Yingru Li, Jiawei Xu, Ziniu Li, Jiacai Liu, Wei Liu, Yuxuan Tong, Longtao Zheng, Zhenghai Xue, Yaxiang Zhang, Tianle Cai, Ge Zhang, Qian Liu, Baoxiang Wang
- Submitted: 2026-02-06
- Current version read: arXiv v1, submitted 2026-02-06 03:16:04 UTC;本地阅读使用 arXiv HTML v1、TeX source、project page 与 verl PR/docs。
- Subjects: Machine Learning (cs.LG); Artificial Intelligence (cs.AI)
作者与关系
- Yingru Li: xAI.
- Jiawei Xu: The Chinese University of Hong Kong, Shenzhen.
- Ziniu Li: Tencent Hunyuan.
- Jiacai Liu: Fudan University.
- Wei Liu: HKUST.
- Yuxuan Tong: Tsinghua University / ByteDance Seed.
- Longtao Zheng: ByteDance.
- Zhenghai Xue: Nanyang Technological University.
- Yaxiang Zhang: National University of Singapore.
- Tianle Cai: Princeton University.
- Ge Zhang: M-A-P, ByteDance Seed, University of Waterloo.
- Qian Liu: TikTok AI Innovation Center / xAI.
- Baoxiang Wang: CUHK-Shenzhen School of Data Science.
阅读目标与判断边界
本笔记关注:
- OTB 的 baseline 最优性来自哪个方差目标,和 GRPO/RLOO/OGB/OPO 的差别是什么。
- realized energy
如何把“哪个 token 的 score gradient 更容易放大方差”变成可估计权重。 - logit-gradient proxy 为什么只用 forward logits 就能近似 gradient norm,以及这个近似依赖哪些假设。
- OTB 在 verl 中如何落地,配置和 kernel 支持有什么限制。
- OTB 和 TRM、VIMPO、DAPO、Entropy Mechanism、TIM/VeXact 的关系。
判断边界:
- arXiv HTML 中部分公式渲染不完整,本笔记以 TeX source 为公式依据。
- 实验主要是 math reasoning 与 tool-integrated reasoning,不能直接外推到 open-ended instruction following、代码 agent、browser/OS agent 或多模态 RL。
- 论文主表以 peak performance 和训练曲线为主,缺少多 seed 方差、置信区间和完整 ablation logs。
- OTB 需要 group sampling。verl 文档明确指出 single-rollout batch 下 OTB 会退化成 vanilla returns。
- OTB 使用 sampled token probability 和 full distribution
;若训练使用 fused linear-cross-entropy kernels,需要额外支持或回退。
论文脉络
1. 研究问题、背景和价值
Long-horizon LLM-RL 经常使用 outcome-only reward。数学推理、代码、工具调用和多轮任务里,reward 往往只在最终答案或工具轨迹完成后给出。policy gradient 需要把这个稀疏信号分配给上千到上万 token。序列变长后,两个问题会同时出现。
第一,score function 会沿时间累加。标准 REINFORCE 形式是:
其中
当
第二,RLVR 常用的 group-relative baseline 粒度较粗。GRPO/RLOO 用同一 prompt 下多条 rollout 的均值或留一均值作为 baseline,能消掉一部分 prompt-level reward 偏移,但没有区分同一 response 内不同 token 的 gradient energy。长 CoT 里真正让梯度不稳定的 token 往往集中在少数位置,sequence-level baseline 很难对齐这种局部异质性。
OTB 的价值在于把 baseline 从“按 response 或 prompt 做平均”推进到“按 token 前缀的累计 gradient energy 做加权”。它仍然保持 critic-free,不训练 value model;同时给出一个只依赖 logits 的近似,让方法能接入 verl 这类现有 RL trainer。
2. 已有解决方案与不足
已有方法可以放在同一张坐标系里看。
-
GRPO / RLOO:用同一 prompt 的 group reward 估计 baseline。优点是简单、省 critic;缺点是所有 token 共享同一类 response-level advantage,无法处理 token-level variance heterogeneity。
-
OGB, Optimal Global Baseline:推导 sequence-level 方差最优 baseline:
它承认 gradient energy 会影响 baseline,但仍用一个全局 baseline 作用于整条序列。
-
OPO / length proxy:用 token length 或类似序列属性作为 proxy 做加权。它更容易实现,但 length 只能粗略反映长序列风险,不能代表具体 token 的 score-gradient norm。
-
Actor-critic / value model:可以提供 token-level value,但需要训练 critic,系统成本和不稳定源更多。
OTB 在这几条路线中选择了一个中间点:保持无 critic,推导 token-level optimal baseline,再用 logit distribution 估计每个 token 对 gradient energy 的贡献。
3. 作者可能的思考路径
作者的思考路径大概率从训练崩溃现象出发。长序列 RL 中,训练曲线常出现 reward 先涨后掉、response length 失控、train-rollout KL 扩大、梯度范数和方差 proxy 升高。若只看 reward baseline,GRPO 似乎已经有 group centering;继续出现不稳定,说明问题不只在 prompt-level reward shift,还在不同 trajectory / token 的 score gradient energy。
于是可以先写出 REINFORCE 方差。加入 baseline 后,true gradient 不变,方差项由
这个目标直接给出 weighted mean。权重越大,说明该 token 前缀的 gradient energy 越大;它对方差贡献越敏感,baseline 越应该更贴近这类样本的 return。
难点随即变成如何估计
需要 parameter-space gradient norm,直接计算会引入额外 backward 或 per-token gradient 成本。作者转向 logits:对于 sampled token 的 logprob,logit-space gradient 有闭式形式
4. 核心假设或切入点
OTB 的切入点可以概括为一句话:baseline 应该更贴近高 realized-energy token 的 return,因为这些 token 对梯度方差的贡献更大。
causal policy gradient 写成:
这里
论文把每个 token 的累计 realized energy 定义为:
方差最小化的局部目标是:
对
这个式子说明 OTB 的 baseline 是 weighted return mean,权重来自 gradient realized energy。若某条 rollout 在第
5. 方法 / 系统 / 理论框架
5.1 Practical OTB estimator
真实
其中第
最终 advantage 使用:
OTB 的加权 baseline 必须按 valid response tokens 计算。padding、truncation、EOS 后 token 如果进入
5.2 Logit-Gradient Proxy
给定 logits
于是 logit-gradient norm 有闭式表达:
其中:
这个 proxy 有直观含义。若 sampled token 概率很高,
论文进一步用 final linear layer 解释 proxy 和 parameter gradient 的关系。若
在 RMSNorm 后,
5.3 Unbiasedness and finite-group bias
baseline 不改变 policy gradient 的条件是:第
实践中,rollout.n > 1,并指出单条 rollout 下 OTB 会退化。
5.4 OTB and OGB variance gap
OGB 使用单个全局 baseline:
OTB 使用每个 token 的
因此只要不同 token / prefix 的 optimal baseline 存在差异,OGB 就会留下额外方差。长序列里这种差异更常见,因为 early reasoning branch、tool call、verification token、final answer token 对 return 和 gradient energy 的关系并不相同。
5.5 Off-policy extension
appendix 将 OTB 扩展到 off-policy / rollout correction 场景。设 behavior policy 是
使用 token importance sampling 后,variance weight 会带上 clipped ratio squared:
对应 practical baseline:
这部分和 2605.14220 TIM/VeXact 以及 2512.23075 TRM 直接相关。TIS 处理 behavior-target ratio,OTB 处理 baseline variance;两者可以组合,但 TIS clipping 会引入 bias,因此 off-policy OTB 的目标从无偏方差最小化转向小偏差近似下的 MSE 控制。
5.6 verl implementation
verl PR #4678 添加 AdvantageEstimator.OPTIMAL_TOKEN_BASELINE,让 actor 在 forward 时输出 sum_pi_squared,并提供:
calculate_sum_pi_squared_from_logitscompute_variance_proxy_metricscompute_optimal_token_baseline_advantagetir_optimal_token_baseline
核心配置形态是:
algorithm.adv_estimator: optimal_token_baseline
actor_rollout_ref.actor.calculate_sum_pi_squared: true
actor_rollout_ref.rollout.n: 8
verl docs 同时给出 tir_optimal_token_baseline,并提示当前 fused kernels 需要额外兼容。因为 OTB 要计算
6. 结论链条
- Long-horizon outcome RL 的梯度方差随 token score 累积放大,sequence-level group baseline 只能消除一部分 prompt / response 层面的均值偏移。
- 若把 causal policy gradient 的方差目标局部化,每个 token 的最优 baseline 是 reward-to-go 按累计 gradient realized energy 加权的均值。
- 真实 realized energy 需要 per-token parameter gradient norm,成本过高;logit-gradient norm 提供可由 forward logits 计算的 proxy。
- RMSNorm + final linear layer + isotropic propagation 假设支撑 proxy 与 full score norm 的比例关系。
- 在 single-turn reasoning 与 TIR 任务中,OTB 比 GRPO/RLOO/OPO/OGB/SimpleTIR 更稳,训练 collapse 更少;N=4 组大小接近 N=32 的效果,降低 token consumption。
- 这些结果支持“variance-aware token baseline 是 long-horizon LLM-RL 的有效稳定化模块”,但还需要多 seed、更大域、更强 baseline、fused-kernel overhead 和 off-policy 组合复验。
关键实验/定理
结果 1:Optimal Token Baseline theorem
-
设置:causal policy gradient estimator
;baseline 只能依赖 action 前历史;局部方差目标 。 -
结论:
-
解读:OTB 把 baseline 从 simple group mean 改成 realized-energy weighted mean。它倾向于更匹配高 gradient-energy token 的 return,从而降低这些 token 对整体梯度方差的放大。
结果 2:主表 single-turn reasoning
- 设置:Qwen3-8B-Base;deduplicated DAPO-MATH-17k;full on-policy RL;batch size 128;max response length 8192;group size 16;rule-based reward;无 KL reward / entropy regularization。
- 指标:AIME25、AIME24、AMC23、MATH500。
- 结果:
| Method | AIME25 | AIME24 | AMC23 | MATH500 |
|---|---|---|---|---|
| GRPO | 25.31 | 31.35 | 80.86 | 90.50 |
| RLOO | 24.38 | 28.96 | 74.53 | 90.56 |
| OPO | 27.29 | 35.31 | 84.53 | 93.31 |
| OGB | 30.10 | 33.13 | 80.55 | 90.75 |
| OTB | 30.31 | 37.29 | 85.08 | 93.43 |
- 解读:OTB 在四项指标上整体最好,尤其 AIME24 / AMC23 相对 OGB 和 OPO 更强。AIME25 上 OTB 与 OGB 接近,说明 token-level baseline 的收益幅度会随 benchmark 变化。
结果 3:主表 TIR
- 设置:Qwen2.5-7B;SimpleTIR-style tool-integrated reasoning;相同数学数据与 on-policy RL 设定。
- 指标:AIME25、AIME24、AMC23、MATH500。
- 结果:
| Method | AIME25 | AIME24 | AMC23 | MATH500 |
|---|---|---|---|---|
| GRPO | 18.54 | 27.60 | 59.45 | 76.88 |
| RLOO | 20.10 | 25.00 | 62.42 | 76.06 |
| OPO | 20.83 | 29.90 | 64.84 | 76.94 |
| OGB | 21.15 | 30.63 | 62.50 | 75.69 |
| SimpleTIR | 26.67 | 37.91 | 71.25 | 82.25 |
| OTB | 28.13 | 41.46 | 79.45 | 84.69 |
- 解读:TIR 场景里 OTB 对 AMC23 的提升很明显,说明 tool call / multi-stage reasoning 中 token-level variance heterogeneity 更强。这里也要注意,OTB 对比 SimpleTIR 时同时涉及 baseline 方法和 TIR recipe 组合,复验需要拆分不同模块贡献。
结果 4:token consumption reduction and group size
- 设置:对比 rollout group size
;观察最终性能与 token consumption。 - 论文结果:OTB 的
能接近 baseline 的效果;project page 称 single-turn / TIR token saving 约为 62% / 66%,paper text/table 中对应报告为约 66.03% / 68.32%。 - 解读:这个结果是 OTB 工程价值最大的部分。若小 group 就能达到大 group 方差水平,训练吞吐和 token budget 会直接受益。但不同公开材料中节省比例略有差别,归档时保留二者并优先以后续复现实验校准。
结果 5:proxy ablation
- 设置:比较 Logit-Gradient Proxy、length proxy、global baseline 等估计方式。
- 结果:论文报告 Logit-Gradient Proxy 是稳定训练的关键;length proxy 在更长或 TIR 场景下容易 collapse。
- 解读:这支持“variance 不能用长度单独解释”的判断。长序列确实带来更高风险,但真正进入方差目标的是 score-gradient energy。length 只能作为粗 proxy,无法区分高概率 filler token 和低概率关键决策 token。
证据链强度评估
强证据
- OTB 公式从局部加权二次目标直接推导,
是清晰的 weighted least-squares 解。 - logit-gradient proxy
有精确闭式形式,可直接由 logits 计算。 - verl PR #4678 已合入,说明方法不只停留在论文伪代码层;docs 给出了配置、metrics、TIR variant 和 kernel caveat。
中等强度证据
- single-turn 与 TIR 主表都显示 OTB 优于 GRPO/RLOO/OPO/OGB,方向一致。
- N=4 接近 N=32 和 token saving 结果支撑训练效率收益,但公开材料中的 saving 数字有轻微差异,需要用同一代码版本复算。
- train-rollout KL、gradient variance proxy、gradient norm、entropy、response length 等曲线支持 OTB 减少 collapse,但缺少完整多 seed statistical report。
需要谨慎的推论
- Logit-Gradient Proxy 到 full parameter gradient norm 的关系依赖 RMSNorm、final linear layer 和 isotropic propagation 假设;MoE、不同 normalization、quantization、fused kernels、adapter tuning 下可能改变比例关系。
- OTB 的 group estimator 有 finite-
bias;小 group 高性能不等于 baseline 完全无偏。 - 实验集中在 math reasoning / TIR,不能自动推广到 coding agent、browser agent、multi-modal agent、human preference RLHF。
- OTB 减 variance,不直接解决 rollout/current mismatch、reward hacking、spurious reward、pass@
coverage 或 verifier artifact。
OpenReview / 审稿意见吸收
- Venue status: arXiv v1;TeX source 使用
icml2026preprint style;Longtao Zheng 和 Wei Liu 个人主页标注 OTB as ICML 2026 / Proceedings,project page 与 verl docs 也公开关联该工作。 - Public reviews: 未发现可可靠匹配
2602.07078/ "The Optimal Token Baseline" 的公开 OpenReview forum 或 reviewer comments 页面。 - Ratings / confidence: 无公开评分可归档。
- Reviewer consensus: 无公开 reviewer consensus 可归档。
- Main criticisms: 无公开审稿意见;本地评估保留 proxy 假设、single-seed/peak reporting、fused-kernel overhead、off-policy extension bias 和 task-domain coverage 作为主要风险。
- Author response: 未发现公开 author response。
- 对可信度的影响: 论文的理论推导和 verl 落地信号较强,公开审稿意见缺失会降低对实验充分性的外部校验;后续如果 ICML 2026 页面或 OpenReview comments 公开,需要补入 reviewer 对 proxy validity、ablation、compute overhead 和 baseline fairness 的反馈。
本地讨论补充
1. OTB、TRM、VIMPO 的问题分层
- 2512.23075 TRM 关心 rollout policy 与 training policy 分离时的 surrogate objective error。它要回答哪些样本仍处在 trust region 内。
- OTB 关心同一个 on-policy / near-on-policy estimator 内部的 gradient variance。它要回答 baseline 应该如何按 token energy 加权。
- 2606.20008 VIMPO 关心 outcome reward 如何形成 token-level credit assignment。它要回答 actor advantage 能否由 policy/reference log-ratio 诱导。
这三者可以组合,但优化目标不同。TRM 先过滤或修正不可信样本,OTB 在可信样本内降低方差,VIMPO 试图把 reward 信号重新分配到 token-level actor update。
2. OTB 和 GRPO baseline 的关系
GRPO 用 group mean reward 作为 baseline,隐含每条 rollout、每个 token 对方差的贡献权重相同。OTB 把这个权重换成
这个变化看起来简单,但它和 Monte Carlo 方差控制一致:baseline 本身不提供新 reward,它通过让高方差项的 centered return 更小来降低 estimator variance。
3. 为什么 low-probability sampled token 权重更大
对 sampled token
当
4. 后续复验指标
- 每步
、 分布,按 token position、token probability、correct/incorrect rollout、tool call stage 分桶。 - OTB advantage variance、gradient norm、train-rollout KL、policy entropy、response length、pass@1/avg@k/pass@k。
- N=4/8/16/32 下 token consumption、wall-clock throughput、GPU memory、logits retention overhead。
- 与 DAPO、VAPO、VIMPO、TRM、TIS/RS 的组合实验,拆分 variance reduction、trust-region filtering、token credit assignment 的贡献。
- fused CE kernels 与 non-fused logits path 的性能差异,尤其是
的计算开销。
主要启发
- 长序列 RL 稳定性不能只看 reward baseline,还要看 score-gradient energy 的位置和分布。
- outcome-only RL 的 token-level 改造有多条路线:OTB 做 variance-aware baseline,VIMPO 做 policy-implied value,Entropy Mechanism 做 covariance/entropy control,TRM 做 trust-region sample admission。
- 对 RL 系统实现而言,forward logits 中的 full distribution statistic 会变得更重要。只保存 sampled-token logprob 的轻量路径无法支持 OTB、exact KL、VIMPO 这类方法的完整诊断。
- OTB 的工程卖点在 token budget。若小 rollout group 通过更好 baseline 接近大 group,训练成本下降会比单点 benchmark 提升更有价值。
局限
- Proxy assumption 需要更多验证。
与 full parameter score norm 的比例关系依赖 architecture 和训练路径;MoE routing、RMSNorm 位置、quantization、fused kernels、adapter tuning 都可能改变它。 - Group estimator 存在 finite-
bias。论文把偏差视为渐近可忽略,但小 正是节省 token 的主卖点,因此需要 leave-one-out OTB 或 bias-corrected variant 的对照。 - 实验报告缺少多 seed 和置信区间。collapse 类问题对随机性敏感,peak reporting 容易高估稳定性。
- 任务覆盖集中在数学与 TIR。coding agents、browser/OS agents、多工具环境和 open-ended RLHF 的 reward structure 不同,
与 的相关性可能改变。 - 计算开销不应只看 token consumption。OTB 需要 full-vocab probability statistic,可能影响 memory、fused kernel、activation/logits retention 和 trainer throughput。
- OTB 不控制 mismatch。若 rollout engine 与 trainer logprob 不一致,仍需要 TIM/VeXact、rollout correction 或 TRM 先处理行为分布问题。
- off-policy OTB 依赖 clipped IS,bias / variance tradeoff 需要和 TIS、RS、sequence rejection 同时评估。
跨论文关系
- 与 2512.23075 TRM 的关系:两篇论文共享多位作者和 verl 生态。TRM 处理 rollout/current mismatch 与 sequence-level trust region,OTB 处理 long-horizon policy-gradient variance;二者可以形成“先确保样本可信,再降低 estimator variance”的组合。
- 与 verl 官方仓库 的关系:OTB 已作为 verl algorithm estimator 合入,配置项、TIR variant 和 metrics 进入框架文档,属于 paper-to-framework 的直接落地节点。
- 与 2503.14476 DAPO 的关系:OTB 使用 DAPO-MATH-17k 去重数据和 long-CoT GRPO/RLVR 背景;DAPO 解决 recipe 与系统 scale,OTB 改进 baseline variance。
- 与 2606.20008 VIMPO 的关系:二者都反对把整条 response 的同一个 advantage 粗放广播到所有 token。VIMPO 引入 policy-implied token advantage,OTB 保留 reward-to-go advantage 结构但用 token realized energy 改 baseline。
- 与 2505.22617 Entropy Mechanism 的关系:Entropy Mechanism 看 token covariance 和 entropy dynamics;OTB 看 logit-gradient norm / realized energy。二者都提示少数 token 可能主导训练动力学,但一个服务 exploration/entropy control,一个服务 variance reduction。
- 与 2605.14220 TIM/VeXact 和 2020-03-07 Schulman KL 的关系:off-policy OTB 需要 importance ratio 和 clipped ratio squared;若 ratio 方向、k2/k3 estimator 或 rollout/trainer logprob 不一致,baseline 权重也会被污染。
- 与 2607.07508 SAO 的关系:两者都处理 long-horizon token-level advantage variance。OTB 用同 prompt group samples 估计 variance-minimizing baseline,
rollout.n=1时会退化;SAO 恢复一份显式 learned critic,使每 prompt 单 rollout 仍能获得 state-dependent baseline,同时增加 value pretraining、模型内存和 critic updates。 - 跨论文关系定位:记录 OTB、Realized Energy 与 Gradient Variance Reduction,并加入 OTB 与 TRM、verl、DAPO、VIMPO、Entropy Mechanism、TIM/VeXact 的关系。
Reference Intake Brief
Target
- Intended target system: 新增论文笔记
2602.07078-optimal-token-baseline-long-horizon-llm-rl.md,并更新content/utility/papers-index.md与data/authors.json。 - Existing related assets: 2512.23075 TRM、2503.14476 DAPO、2606.20008 VIMPO、2505.22617 Entropy Mechanism。
- Proposed form: 新建独立 Markdown 文档,补充索引行、对应论文的关系章节和作者档案。
Reusable Elements
- OTB 公式:
。 - Logit-Gradient Proxy:
。 - verl implementation:
algorithm.adv_estimator=optimal_token_baseline、actor.calculate_sum_pi_squared=true、rollout.n>1。 - 复验指标:advantage variance、gradient norm、train-rollout KL、entropy、response length、token consumption、logits statistic overhead。
Risks
- Copyright/over-copying: 只保留必要公式、实验数字和短描述;没有复刻论文正文。
- Unsourced or unverifiable claims: ICML 2026 status 仅作为作者主页/工程页 signal;公开审稿意见未发现,后续需要补审稿页。
- Tone/brand mismatch: 以方法机制、证据强度和局限为主,避免宣传式表述。
- Safety/compliance issues: 内容为 RL variance reduction 与训练系统分析,无直接滥用操作细节。
- Overlap with existing assets: 和 TRM/VIMPO/Entropy Mechanism 区分为 variance reduction、trust-region control、token credit assignment、entropy dynamics 四条线。
Skipped
| Material | Reason |
|---|---|
| 公开 reviewer comments | 未发现 OpenReview/ARR/ICML 公开审稿页,或无法可靠匹配到当前论文版本。 |
| ICML virtual page | 搜索只发现零散社交摘要和作者主页标注,未可靠定位官方页面。 |
| 完整训练日志 | project page、paper 与 verl PR 未提供可直接归档的完整 multi-seed raw logs。 |
Recommendation
Decision: merge
Why: OTB 是 long-horizon LLM-RL 中 variance reduction 的清晰节点,和本地已有 TRM / verl / DAPO / VIMPO / Entropy Mechanism 文档形成直接互补;理论推导、工程 PR 和实验结果都足以归档,同时需要保留 proxy 与实验充分性的边界。