2512.23075-trust-region-masking-long-horizon-llm-rl

Trust Region Masking for Long Horizon LLM Reinforcement Learning

这篇论文把 long-horizon LLM-RL 中 pi_rollpi_theta 的实现级分布差异形式化为 surrogate objective error:经典 trust-region bound 随序列长度按平方增长并迅速失效,作者给出更紧的 KL/TV 组合界,指出 max token divergence 是单靠 sequence-average KL 无法替代的控制量,并提出 Trust Region Masking 在序列级丢弃违反阈值的样本;它有清晰理论价值和 verl 落地迹象,但全局保证依赖精确 KL、较高接受率和阈值校准,实验目前主要支撑趋势判断。

Authors Yingru Li (李英儒), Jiacai Liu (刘佳材), Jiawei Xu, Yuxuan Tong (童雨轩), Ziniu Li (李子牛), Qian Liu (刘乾), Baoxiang Wang (王宝祥)

已审阅 Archived 2026-06-21 11:52 Updated 2026-07-16 19:17 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

阅读目标与判断边界

本笔记关注:

  1. 论文如何定义 rollout policy 与 training policy 的 mismatch。
  2. 经典 trust-region bound 为什么在 4K 以上长序列里失去约束意义。
  3. 新的 Pinsker-Marginal、Mixed、Coupling、Adaptive bounds 分别控制什么误差源。
  4. TRM 和 PPO clipping、token masking、TIM/VeXact、verl rollout correction 的关系。
  5. k2/k3 KL estimator 在本文里的 ratio 方向,及其和 Schulman KL blog 的对应关系。

判断边界:

  • 本文 arXiv v4 仍是理论与小规模系统实验结合的论文,实验图没有给出可直接复用的完整数值表。
  • 主要实验覆盖 Qwen3-8B-Base、Zero-RL、DAPO-MATH-17k 和 AIME25,尚不能代表所有 agentic、code、tool-use、多模态或异步 RL 场景。
  • 理论保证以 token-level divergence bound 为前提;工程上完整 KL 需要保存 rollout full logits 或重新获得 rollout 分布,成本明显高于只保存 sampled-token logprob。
  • TRM 优化的是 masked surrogate;当 rejection rate 较高时,优化目标会偏离原始 surrogate,并可能引入长度或难例选择偏差。

论文脉络

1. 研究问题、背景和价值

LLM RL 训练通常以 rollout policy 生成样本,再由 training policy 计算 logprob ratio 并更新参数。理想推导里,采样分布和优化分布共享同一个 policy;现代系统里二者经常分离:

  • rollout 由 vLLM、SGLang 或专用 inference engine 生成。
  • training 由 FSDP、Megatron-LM 或其他 trainer 计算 loss。
  • MoE routing、kernel path、precision、batching、KV cache、异步权重同步都可能让同一 checkpoint 在两条路径上给出不同 token probability。

因此训练实际面对的是:

yπroll(x),θL(πθ) uses logπθ(ytct). y \sim \pi_{\mathrm{roll}}(\cdot \mid x), \qquad \nabla_\theta L(\pi_\theta) \text{ uses } \log \pi_\theta(y_t \mid c_t).

πroll\pi_{\mathrm{roll}}πθ\pi_\theta 在 token 条件分布上存在偏差,policy gradient surrogate 只是对真实目标的一种近似。长序列把这个问题放大:每个 token 的差异很小,经过 prefix distribution shift 和序列级累积后,surrogate error 可以压过 reward 范围。

2. 已有解决方案与不足

已有实践大致有三类处理方式。

第一类是 PPO/GRPO clipping。它限制 current policy 相对 old policy 的 sampled-token ratio:

ρt=πθ(ytct)πold(ytct). \rho_t=\frac{\pi_\theta(y_t\mid c_t)}{\pi_{\mathrm{old}}(y_t\mid c_t)}.

clipping 控制更新幅度,但默认 denominator 对应真实采样分布。若 rollout path 和 trainer path 已经错位,ratio 约束可能覆盖不住实现级 mismatch。论文特别指出,在 ρt1+ϵ\rho_t \gg 1+\epsilon 且 advantage 为负时,PPO 的 unclipped 分支仍会留下大梯度,作者称其为 gradient leakage。

第二类是 token-level masking。它可以把异常 token 的 loss 置零,降低局部梯度尖峰。但它没有改变完整序列的分布偏差,也无法保证 maxtDKL(πroll(ct)πθ(ct))\max_t D_{\mathrm{KL}}(\pi_{\mathrm{roll}}(\cdot\mid c_t)\|\pi_\theta(\cdot\mid c_t)) 处在 trust region 内。

第三类是 sequence-average KL 或 rollout correction diagnostics。平均 KL 能发现整体漂移,但 rare context 上的高 KL 可能被平均值掩盖。论文给出命题说明:只知道 DKLseqD_{\mathrm{KL}}^{\mathrm{seq}} 无法推出 DKLtok,maxD_{\mathrm{KL}}^{\mathrm{tok,max}} 的上界。构造方式很直观:令一个稀有 context c\*c^\* 的出现概率为 pp,该 context KL 为 1,其他 context KL 为 0;当 p0p\to 0 时 sequence average 趋近 0,但 max token KL 仍为 1。

3. 作者可能的思考路径

这篇论文的思路可以概括为四步。

第一步,从 performance difference identity 出发,把 surrogate error 写成 prefix distribution shift 与 per-token advantage-like function 的乘积。这样可以分别控制两部分:

  • 当前 token 动作分布差异带来的 gtg_t 范数。
  • rollout 与 current policy 诱导的 prefix distribution 差异。

第二步,指出经典 trust-region bound 同时用 worst-case token divergence 控制所有时间步,导致 T(T1)δT(T-1)\delta 型增长。对 T=4096,δ=104T=4096,\delta=10^{-4},bound 约为 1677,而 reward 常在 [0,1][0,1]。这个 bound 在工程上没有阈值意义。

第三步,把 KL、TV、sequence-level average 和每个时间步的 average TV 组合起来,形成一组可取最小值的界。核心目标是让 bound 在常见小 divergence 区间从 O(T2)O(T^2) 降到 O(T3/2)O(T^{3/2})O(T)O(T) 或依赖实际非均匀 divergence profile。

第四步,把理论中的关键控制量转成工程动作:当某条 rollout sequence 内任何 token prefix 超出 trust region,就整条序列不进入梯度;同时配合 average criterion 限制累计漂移。

4. 核心假设或切入点

TRM 的核心假设可以拆成四层。

  1. 现代 LLM-RL 中 πroll\pi_{\mathrm{roll}}πθ\pi_\theta 的分离是系统常态。rollout engine、trainer engine、MoE routing、precision、kernel path 和异步权重同步都会让采样行为策略与训练优化策略产生差异。
  2. 这种差异会同时产生 token/action distribution mismatch 和 prefix distribution shift。前者改变同一 prefix 上下一个 token 的概率和 importance ratio;后者改变模型在第 tt 步实际访问到的 prefix 集合。
  3. 长序列会放大 prefix distribution shift。早期 token 的小差异会改变后续 prefix tree,后续每一步又在新的 prefix 上继续累计差异,因此经典 trust-region bound 在 long-horizon reasoning 中很快变得不可用。
  4. 能给出非空保证的控制量必须包含 max token-level divergence。sequence-average KL、PPO clipping 和 token masking 都能缓解某些症状,但它们不能排除 rare prefix 上的极端 KL outlier;TRM 因而选择 sequence-level mask,把任何违反 trust region 的整条样本从梯度中移除。

这个切入点把问题从“如何让 PPO ratio 更稳”推进到“哪些 rollout 样本仍然属于当前 policy 可以信任的局部区域”。它关心样本进入梯度之前是否已经偏离行为分布太远,而不只关心进入 loss 之后如何 clipping。

5. 方法 / 系统 / 理论框架

5.1 核心数学对象

在 TRM 里,LLM 的每一步生成都可以看成一个 RL state-action 问题。第 tt 步的 state 是当前 prefix:

ct=(x,y<t), c_t=(x,y_{<t}),

也就是 prompt xx 和已经生成出的历史 token y<ty_{<t};第 tt 步的 action 是下一个 token yty_t。给定 policy π\pi 后,第 tt 步会访问到哪些 prefix 由该 policy 诱导出来:

dtπ(ct)=P(x)s=1t1π(yscs). d_t^{\pi}(c_t) = P(x)\prod_{s=1}^{t-1}\pi(y_s\mid c_s).

这个 dtπd_t^\pi 就是 LLM 里的 prefix distribution,对应普通 RL 里的 state visitation distribution。它描述“第 tt 步之前,模型已经走到了哪些上下文,以及这些上下文各自有多大概率”。同一道数学题下,rollout policy 可能更常走到 “先列方程” 这类 prefix;current policy 可能更常走到 “先尝试归纳” 这类 prefix。两者后续 token 的 reward、advantage 和 loss 都会在不同 prefix 集合上被计算。

TRM 需要同时区分两类 mismatch。

第一类是同一个 prefix 上的 token/action distribution mismatch。固定某个已经出现的上下文 ctc_t,rollout engine 和 trainer/current policy 对下一个 token 的完整分布可能不同:

πθ(ct)πroll(ct). \pi_\theta(\cdot\mid c_t) \neq \pi_{\mathrm{roll}}(\cdot\mid c_t).

这类 mismatch 发生在“已经站在同一个 prefix 上,下一步该怎么走”的层面。工程来源包括 backend kernel、precision、MoE routing、batching、KV cache path、异步权重 staleness 等。它直接改变 per-token importance ratio:

ρt=πθ(ytct)πroll(ytct). \rho_t= \frac{\pi_\theta(y_t\mid c_t)} {\pi_{\mathrm{roll}}(y_t\mid c_t)}.

如果 rollout 认为当前 sampled token 概率很高,而 trainer/current policy 认为它概率很低,ρt\rho_t 会很小;反过来,trainer/current policy 给出远高于 rollout 的概率时,ρt\rho_t 会很大。PPO clipping、TIS、TRM-Max、sample-level k2/k3k_2/k_3 估计器首先看到的就是这一层。它会影响 token 的 loss contribution、是否越过 clip boundary、是否成为 outlier token,以及 max token divergence:

DKLtok,max=maxt,ctDKL(πroll(ct)πθ(ct)). D_{\mathrm{KL}}^{\mathrm{tok,max}} = \max_{t,c_t} D_{\mathrm{KL}} \left( \pi_{\mathrm{roll}}(\cdot\mid c_t) \Vert \pi_\theta(\cdot\mid c_t) \right).

第二类是 prefix distribution shift。即使每个 prefix 上的 token 分布差异都很小,前面若干步的差异也会改变后面实际会访问到的 prefix 集合:

dtπθdtπroll. d_t^{\pi_\theta} \neq d_t^{\pi_{\mathrm{roll}}}.

这类 mismatch 发生在“模型实际会走到哪些上下文”的层面。第 1 步 token 分布有一点差异,会改变第 2 步 prefix;第 2 步 prefix 变化后,第 3 步面对的条件分布也跟着变化。长 CoT 中,这种 prefix tree 的偏移会沿时间展开,最终让 rollout 采样到的数据分布和 current policy 真正会访问的数据分布分离。

TRM 的 surrogate error 分解正是把这两层分开。真实目标 J(πθ)J(\pi_\theta) 关心 current policy 诱导的 prefix distribution:

Ectdtπθ[gt(ct)]. \mathbb E_{c_t\sim d_t^{\pi_\theta}}[g_t(c_t)].

rollout surrogate 使用的是 rollout policy 采样到的 prefix distribution:

Ectdtπroll[gt(ct)]. \mathbb E_{c_t\sim d_t^{\pi_{\mathrm{roll}}}}[g_t(c_t)].

二者差值形成 context / prefix shift 项:

Error=t(Edtπθ[gt]Edtπroll[gt]). \mathrm{Error} = \sum_t \left( \mathbb E_{d_t^{\pi_\theta}}[g_t] - \mathbb E_{d_t^{\pi_{\mathrm{roll}}}}[g_t] \right).

所以,token/action distribution mismatch 控制“同一个 prefix 上下一个 token 的概率差多少”;prefix distribution shift 控制“两个 policy 在第 tt 步看到的 prefix 人群差多少”。前者是局部动作分布误差,后者是这些局部误差沿 autoregressive rollout 累积后的状态访问误差。TRM 的理论界需要同时控制这两部分:用 token-level KL/TV 控制 gtg_t 的幅度,用 context shift bound 控制 dtπθd_t^{\pi_\theta}dtπrolld_t^{\pi_{\mathrm{roll}}} 的距离。

论文设:

TV 是 Total Variation distance,全变差距离。对同一个 prefix ctc_t 上的两个 next-token 分布 P=πθ(ct)P=\pi_\theta(\cdot\mid c_t)Q=πroll(ct)Q=\pi_{\mathrm{roll}}(\cdot\mid c_t),离散 vocabulary 上的计算式是:

DTV(P,Q)=12vVP(v)Q(v). D_{\mathrm{TV}}(P,Q) = \frac12\sum_{v\in\mathcal V}|P(v)-Q(v)|.

等价地:

DTV(P,Q)=supAVP(A)Q(A). D_{\mathrm{TV}}(P,Q) = \sup_{A\subseteq\mathcal V}|P(A)-Q(A)|.

第一种写法适合实现:对 vocabulary 中每个 token 的概率差取绝对值、求和、再乘 1/21/2。第二种写法适合理解:它表示存在某个 token 集合 AA,两个分布分配给这个集合的概率最多能差多少。TV 的取值范围是 [0,1][0,1]00 表示两个分布完全一致,11 表示概率质量几乎落在不相交的 token 集合上。

TRM 中出现两类 TV。token-level TV 比较同一个 prefix 上的 next-token 分布:

DTV(πθ(ct),πroll(ct))=12vVπθ(vct)πroll(vct). D_{\mathrm{TV}}\left( \pi_\theta(\cdot\mid c_t), \pi_{\mathrm{roll}}(\cdot\mid c_t) \right) = \frac12\sum_{v\in\mathcal V} \left| \pi_\theta(v\mid c_t) - \pi_{\mathrm{roll}}(v\mid c_t) \right|.

prefix distribution TV 比较两个 policy 在第 tt 步会访问到哪些 prefix:

DTV(dtπθ,dtπroll)=12ctdtπθ(ct)dtπroll(ct). D_{\mathrm{TV}}\left( d_t^{\pi_\theta}, d_t^{\pi_{\mathrm{roll}}} \right) = \frac12 \sum_{c_t} \left| d_t^{\pi_\theta}(c_t) - d_t^{\pi_{\mathrm{roll}}}(c_t) \right|.

前者衡量“同一个上下文里下一步 token 分布差多少”,后者衡量“第 tt 步实际会站在哪些上下文上差多少”。TRM 的 KL route 通过 Pinsker inequality 把 KL 转成 TV 上界;TV route 则直接用概率质量差异控制 advantage shift 或 prefix shift。

ϵ=DTVtok,max=maxt,ctDTV(πθ(ct),πroll(ct)), \epsilon = D_{\mathrm{TV}}^{\mathrm{tok,max}} = \max_{t,c_t} D_{\mathrm{TV}}\left(\pi_\theta(\cdot\mid c_t),\pi_{\mathrm{roll}}(\cdot\mid c_t)\right),
δ=DKLtok,max=maxt,ctDKL(πroll(ct)πθ(ct)). \delta = D_{\mathrm{KL}}^{\mathrm{tok,max}} = \max_{t,c_t} D_{\mathrm{KL}}\left(\pi_{\mathrm{roll}}(\cdot\mid c_t)\|\pi_\theta(\cdot\mid c_t)\right).

还定义 sequence-level divergence:

DKLseq=tEctdtπrollDKL(πroll(ct)πθ(ct)), D_{\mathrm{KL}}^{\mathrm{seq}} = \sum_t \mathbb E_{c_t\sim d_t^{\pi_{\mathrm{roll}}}} D_{\mathrm{KL}}\left(\pi_{\mathrm{roll}}(\cdot\mid c_t)\|\pi_\theta(\cdot\mid c_t)\right),

以及每步平均 TV:

Dˉt=EctdtπrollDTV(πθ(ct),πroll(ct)). \bar D_t=\mathbb E_{c_t\sim d_t^{\pi_{\mathrm{roll}}}} D_{\mathrm{TV}}\left(\pi_\theta(\cdot\mid c_t),\pi_{\mathrm{roll}}(\cdot\mid c_t)\right).

surrogate 形式为:

Lπroll(πθ)=Eπroll[A(x,y)t=1Tρt], L_{\pi_{\mathrm{roll}}}(\pi_\theta) = \mathbb E_{\pi_{\mathrm{roll}}} \left[A(x,y)\sum_{t=1}^T \rho_t\right],

其中:

ρt=πθ(ytct)πroll(ytct). \rho_t=\frac{\pi_\theta(y_t\mid c_t)}{\pi_{\mathrm{roll}}(y_t\mid c_t)}.

等价地,若把固定 baseline 合并掉,也可写成:

Lπroll(πθ)=Eπroll[R(x,y)t=1T(ρt1)]. L'_{\pi_{\mathrm{roll}}}(\pi_\theta) = \mathbb E_{\pi_{\mathrm{roll}}} \left[R(x,y)\sum_{t=1}^T(\rho_t-1)\right].

5.2 理论边界

核心分解来自:

Error=t(Edtπθ[gt]Edtπroll[gt]). \mathrm{Error} = \sum_t \left( \mathbb E_{d_t^{\pi_\theta}}[g_t] - \mathbb E_{d_t^{\pi_{\mathrm{roll}}}}[g_t] \right).

两个关键 lemma:

  1. Advantage bound:
gt2min(1,ϵ,δ/2). \|g_t\|_\infty \le 2\min\left(1,\epsilon,\sqrt{\delta/2}\right).
  1. Context shift:
DTV(dtπθ,dtπroll)min(1,(t1)ϵ,(t1)δ/2,DTVseq,DKLseq/2). D_{\mathrm{TV}}\left(d_t^{\pi_\theta},d_t^{\pi_{\mathrm{roll}}}\right) \le \min\left( 1,(t-1)\epsilon,\sqrt{(t-1)\delta/2}, D_{\mathrm{TV}}^{\mathrm{seq}}, \sqrt{D_{\mathrm{KL}}^{\mathrm{seq}}/2} \right).

由此得到一组 bounds:

Bound 主要依赖 小 divergence 区间直觉
Pinsker-Marginal KL token max KL 控制动作差异与 prefix shift O(T3/2δ)O(T^{3/2}\delta)
Pinsker-Marginal TV+KL TV 控制动作差异,KL 控制 prefix shift O(T3/2ϵδ)O(T^{3/2}\epsilon\sqrt{\delta})
Mixed KL token max KL + sequence KL O(TδDKLseq)O(T\sqrt{\delta D_{\mathrm{KL}}^{\mathrm{seq}}})
Mixed TV token max TV + sequence TV O(TϵDTVseq)O(T\epsilon D_{\mathrm{TV}}^{\mathrm{seq}})
Coupling token max TV TϵT\epsilon 时接近经典 O(T2ϵ2)O(T^2\epsilon^2),cap 激活后为 O(T)O(T)
Adaptive 每步平均 TV + 未来长度权重 divergence 非均匀时更紧
Unified 上述取最小值 实践上用最强的可用诊断量收紧 bound

论文给出的数值例子:T=4096T=4096δ=104\delta=10^{-4}ϵ=5×103\epsilon=5\times 10^{-3}DKLseq=0.01D_{\mathrm{KL}}^{\mathrm{seq}}=0.01DTVseq=0.05D_{\mathrm{TV}}^{\mathrm{seq}}=0.05。经典 KL-only bound 约 1677;Unified bound 在 KL+TV 设置下可降到不超过 4.1。这个数值展示了理论口径的差异,不能直接理解成模型效果提升比例。

5.3 Trust Region Masking

TRM 定义 sequence mask:

M(x,y)=1[(x,y)T], M(x,y)=\mathbf 1[(x,y)\in \mathcal T],

masked surrogate:

Lmasked=Eπroll[M(x,y)A(x,y)tρt]. L_{\mathrm{masked}} = \mathbb E_{\pi_{\mathrm{roll}}} \left[ M(x,y) A(x,y)\sum_t \rho_t \right].

工程实现中,rejected sequences 对梯度贡献为 0;accepted sequences 的梯度归一化口径使用总 batch size NN,accepted count 只作为统计量记录。这样可以让 rejection 同时减少 batch gradient magnitude,反映 trust region violation 带来的有效样本不足。

若能保存 rollout full logits,并在 trainer forward 中计算 current full logits,可精确计算:

DKL(ct)=vπroll(vct)logπroll(vct)πθ(vct). D_{\mathrm{KL}}(c_t) = \sum_v \pi_{\mathrm{roll}}(v\mid c_t) \log \frac{\pi_{\mathrm{roll}}(v\mid c_t)} {\pi_\theta(v\mid c_t)}.

最简单的 max criterion:

M=1[maxtDKL(ct)δmax]. M=\mathbf 1\left[\max_t D_{\mathrm{KL}}(c_t)\le \delta_{\max}\right].

实践中作者推荐结合 average criterion:

maxtDKL(ct)δmax,1TtDKL(ct)δavg. \max_t D_{\mathrm{KL}}(c_t)\le \delta_{\max}, \qquad \frac1T\sum_t D_{\mathrm{KL}}(c_t)\le \delta_{\mathrm{avg}}.

二者覆盖不同 failure mode:max criterion 捕捉少数极端 prefix,average criterion 限制长序列累计漂移。

5.4 与 k2/k3 估计器的关系

完整 KL 需要 full logits,内存和通信成本都高。若系统只保存 sampled-token logprob,论文 appendix 讨论用 k2/k3 近似。

本文 ratio 定义为:

ρ=πθ(yc)πroll(yc),yπroll. \rho=\frac{\pi_\theta(y\mid c)}{\pi_{\mathrm{roll}}(y\mid c)},\qquad y\sim \pi_{\mathrm{roll}}.

在这个方向下:

k3(ρ)=ρ1logρ, k_3(\rho)=\rho-1-\log\rho,

并且:

Eyπroll[k3(ρ)]=DKL(πrollπθ). \mathbb E_{y\sim \pi_{\mathrm{roll}}}[k_3(\rho)] = D_{\mathrm{KL}}(\pi_{\mathrm{roll}}\|\pi_\theta).

这是 Schulman KL blog 的同一控制变量结论,样本分布是 denominator 分布,ratio 是 numerator / denominator。本文估计的是 rollout 到 current 的 forward KL,因此 rho=pi_theta/pi_roll

k2 定义为:

k2(ρ)=12(logρ)2. k_2(\rho)=\frac12(\log\rho)^2.

它有偏,但对 ρ0\rho\to 0ρ\rho\to\infty 都敏感,更适合当 max outlier detector。论文给出的工程建议可以概括为:

  • k3: 非负、无偏,适合 average filtering。
  • k2: 对双向极端 ratio 更敏感,适合 max criterion 的异常检测。

5.5 长度偏差与 LN-TRM / SER

即使阈值本身不随长度缩放,sequence rejection 的概率也会随长度下降。若每个 token violation 概率为 pp,接受率近似:

(1p)TepT. (1-p)^T\approx e^{-pT}.

长 reasoning chain 更容易包含一个 outlier token,因此 max-based TRM 可能偏向短序列。论文讨论了两种缓解:

LN-TRM 使用带未来长度权重的统计量:

W(y)=tρt1wt,wt=min(1,(Tt)ϵ,(Tt)δ/2), W(y)=\sum_t |\rho_t-1|w_t, \qquad w_t=\min\left(1,(T-t)\epsilon,\sqrt{(T-t)\delta/2}\right),

再用 Z(T)=twtZ(T)=\sum_t w_t 做归一化。

SER 是更简单的工程版本:

WSER=1Ttρt1. W_{\mathrm{SER}}=\frac1T\sum_t |\rho_t-1|.

SER 更容易接入日志系统,但理论保证弱于基于 max token KL 的 TRM。

6. 结论链条

论文的主线可以压缩为六步:

  1. Long-horizon LLM-RL 训练中,rollout policy πroll\pi_{\mathrm{roll}} 与 current/training policy πθ\pi_\theta 经常不一致,这种不一致来自系统实现、MoE routing 和异步训练。
  2. πrollπθ\pi_{\mathrm{roll}}\ne\pi_\theta 会同时带来 token/action distribution mismatch 与 prefix distribution shift;后者让早期局部差异沿 autoregressive prefix tree 传播。
  3. 经典 trust-region analysis 用 worst-case token divergence 控制所有时间步,误差界随 T2T^2 增长,在 4K 级 long-CoT 场景下失去工程阈值意义。
  4. 论文通过 Pinsker-Marginal、Mixed、Coupling 和 Adaptive bounds,把误差界收紧到更可用的 KL/TV 组合形式,但所有有效界仍依赖 max token-level divergence。
  5. sequence-average KL 无法控制 rare prefix 上的极端 token divergence;PPO clipping 和 token masking 也无法恢复全序列 trust region。因此 TRM 采用 sequence-level mask:一条样本只要出现违反阈值的 prefix/token divergence,就不进入梯度。
  6. TRM 的实践价值取决于接受率、阈值、KL 估计口径和长度偏差控制。高接受率时,masked surrogate 接近 full surrogate;高 rejection rate 时,问题会转化为样本效率下降和选择偏差。

关键实验/定理

定理 1:经典 trust-region bound 在长序列下失效

  • 设置:长度 TT,token max KL 为 δ\delta
  • 经典结论:error bound 随 T(T1)δT(T-1)\delta 增长。
  • 数值例子:T=4096,δ=104T=4096,\delta=10^{-4} 时,bound 约 1677。
  • 解读:当 reward 范围在 [0,1][0,1],这个 bound 很难指导阈值选择。

定理 2:Unified bound 收紧 surrogate error

论文把 Pinsker-Marginal、Mixed、Coupling、Adaptive bounds 取最小值:

B\*=min{BPMKL,BPMTV,BMixKL,BMixTV,BCoup,BAdap\*}. B^\*= \min\{ B_{\mathrm{PM}}^{\mathrm{KL}}, B_{\mathrm{PM}}^{\mathrm{TV}}, B_{\mathrm{Mix}}^{\mathrm{KL}}, B_{\mathrm{Mix}}^{\mathrm{TV}}, B_{\mathrm{Coup}}, B_{\mathrm{Adap}}^\* \}.

若:

Lπroll(πθ)B\*>0, L_{\pi_{\mathrm{roll}}}(\pi_\theta)-B^\*>0,

则可得到 monotonic improvement guarantee。关键价值在于:bound 可同时利用 max token divergence、sequence average divergence 和非均匀时间分布,避免只用 worst-case token KL 乘上 T2T^2

命题 3:sequence-average KL 不能推出 token max KL

构造 rare context c\*c^\*

  • Pr(c\*)=p\Pr(c^\*)=p
  • DKL(c\*)=1D_{\mathrm{KL}}(c^\*)=1
  • 其他 context 的 KL 为 0。

则:

DKLseq0(p0), D_{\mathrm{KL}}^{\mathrm{seq}}\to 0 \quad (p\to 0),

但:

DKLtok,max=1. D_{\mathrm{KL}}^{\mathrm{tok,max}}=1.

解读:平均 KL 可以很低,同时存在足以破坏局部 trust region 的 token prefix。TRM 的 max criterion 正是面向这类 rare but high-impact outlier。

实验 1:PPO clipping 可放大 mismatch-induced instability

  • 模型与数据:Qwen3-8B-Base,Zero-RL,deduplicated DAPO-MATH-17k,AIME25。
  • 系统设置:vLLM 生成,PyTorch FSDP 训练,用这种常见路径模拟 rollout/trainer mismatch。
  • 对比:Token-level IS 与 PPO clipping。
  • 指标:AIME25 avg@32、Log Absolute PPL Gap、训练曲线稳定性。
  • 结论:PPO clipping 在 mismatch 存在时更容易出现更大的 PPL Gap 和 score degradation;作者用 gradient leakage 解释负 advantage + 高 ratio token 的异常梯度。

实验 2:TRM-Max 与 TRM-Avg 分别稳定不同失配模式

  • TRM-Max 示例阈值:δ=0.05\delta=0.05
  • TRM-Avg 示例阈值:δ=0.001\delta=0.001
  • 观察:二者都能在对应设置下降低 PPL Gap 并稳定训练。
  • 解读:max criterion 对 outlier token 更敏感,avg criterion 对累计漂移更敏感。

实验 3:松阈值单独使用会失败,组合使用可以恢复稳定

  • 设置:loose TRM-Max δ=0.1\delta=0.1,loose TRM-Avg δ=0.002\delta=0.002
  • 观察:单独使用时仍可能失败;组合使用后训练更稳定。
  • 解读:长序列 mismatch 同时有局部极端和全局累计两种形态,单一统计量容易漏检。

实现证据:verl PR #4544

  • PR 标题:[algo, doc] feat: trust region sequence masking - (1) k3 KL avg and (2) veto for max criterion
  • 状态:2026-01-14 merged。
  • 主要内容:sequence-level k1/k3 masking modes,token veto via |log(ratio)|,相关单测和 rollout correction 文档。
  • 解读:TRM 已进入 verl 工程讨论和实现路径;这提升了论文工程相关性,但实际使用仍需记录具体 commit、阈值、loss mode、normalization 和 rejection rate。

证据链强度评估

强证据

  • 经典 trust-region bound 的长序列失效、unified bound 和 rare context 反例形成了清晰理论动机。
  • PPO mismatch 实验直接对准 rollout engine 与 trainer engine 不一致这一工程痛点。
  • verl PR #4544 说明方法已经进入主流 RL 后训练框架的实现讨论。

中等强度证据

  • TRM-Max、TRM-Avg 和组合阈值实验支撑“局部 outlier 与全局累计漂移需要同时处理”的判断。
  • 实验图展示趋势清楚,但完整数值表、seed 和跨系统复验仍不足。

需要谨慎的推论

  • 理论 bound 控制 full surrogate error,实际训练优化 masked surrogate;高 rejection rate 会改变有效训练分布。
  • exact KL、token veto、sequence mask 的成本和阈值需要按 vLLM/FSDP、MoE、precision、异步 staleness 重新校准。

主要启发

  • 长序列 RL 的 trust region 需要同时看 token max divergence 和 sequence-average divergence。
  • rollout/trainer mismatch 应作为系统指标记录,不能只在训练崩溃后用 loss 曲线倒推。
  • 工程实现必须暴露 rejection rate、mask 位置分布、ESS、长度分布和 wall-clock,才能判断稳定性收益是否抵消样本损失。

局限

  1. 理论 guarantee 与工程目标之间有间隙。理论控制的是 full surrogate error,TRM 实际优化 masked surrogate;当 rejection rate 升高,梯度会向 accepted subset 偏移。
  2. 精确 KL 成本高。full-vocabulary KL 需要 rollout full logits 或等价的分布恢复,long-horizon RL 中这会增加显存、存储和传输成本。
  3. max criterion 存在长度偏差。长序列包含 outlier token 的概率更高,TRM 可能偏向短回答或更平滑的轨迹。
  4. 实验证据以趋势为主。论文图展示 score 与 PPL Gap 趋势,但没有提供完整数值表,复验需要重新跑配置。
  5. 阈值依赖系统。vLLM/FSDP、MoE routing、kernel path、precision、异步 staleness 会改变 ratio 分布,δmax\delta_{\max}δavg\delta_{\mathrm{avg}} 很难跨系统直接迁移。
  6. TRM 会减少有效样本量。若 mismatch 来自系统实现,丢弃样本可稳定训练;若大量样本被拒绝,训练吞吐和数据覆盖都会下降,可能需要先修 rollout/trainer consistency。
  7. agentic/tool-use 场景仍待验证。工具调用、多轮环境反馈和异步 partial rollout 会引入额外行为策略,TRM 的 sequence 定义、mask 粒度和 reward attribution 需要重新设计。

OpenReview / 审稿意见吸收

  • Venue status: 当前档案未记录公开 peer-review 状态。
  • Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
  • Ratings / confidence: 无公开评分可用于校准。
  • Reviewer consensus: 暂无。
  • Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
  • Author response: 暂无公开 rebuttal 记录。
  • 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。

本地讨论补充

1. TRM 和 TIM/VeXact 的关系

TIM/VeXact 关注同一 checkpoint 在 rollout engine 与 trainer engine 上 logprob 不一致会怎样影响 RL stability。VeXact 的目标是把 rollout/trainer path 对齐到 zero-mismatch。

TRM 接受系统中仍会存在 πrollπθ\pi_{\mathrm{roll}}\ne\pi_\theta,然后用 trust region bound 和 sequence masking 控制这种差异进入梯度的方式。两者在工程上互补:

  • VeXact 类方案降低 mismatch 源头。
  • TRM 类方案限制 mismatch 样本参与更新。
  • verl rollout correction docs 把这类问题落到三策略框架:πrollout\pi_{\mathrm{rollout}}πold\pi_{\mathrm{old}}πθ\pi_\theta

2. TRM 和 PPO clipping 的口径差异

PPO 常见 ratio 是 current / old:

πθ(ytct)πold(ytct). \frac{\pi_\theta(y_t\mid c_t)}{\pi_{\mathrm{old}}(y_t\mid c_t)}.

TRM 关心的是 rollout / current 之间的 trust region:

DKL(πroll(ct)πθ(ct)). D_{\mathrm{KL}}\left(\pi_{\mathrm{roll}}(\cdot\mid c_t)\|\pi_\theta(\cdot\mid c_t)\right).

πold\pi_{\mathrm{old}} 就是 rollout behavior policy,并且 rollout/trainer 完全一致,二者可以近似落在同一问题里。实际系统中,πrollout\pi_{\mathrm{rollout}}πold\pi_{\mathrm{old}}πθ\pi_\theta 可能分离:rollout engine 保存的 logprob、trainer recompute 的 old logprob、current forward 的 logprob分别来自不同路径。此时 PPO clipping 管理的是 policy update step,TRM 管理的是样本进入 gradient 前的 behavior-policy mismatch。

3. k3 中 r1r-1 的方向

前面 Schulman KL 笔记里使用:

xq,r=p(x)q(x). x\sim q,\qquad r=\frac{p(x)}{q(x)}.

于是:

Exq[r1]=Exq[p(x)q(x)]1=xq(x)p(x)q(x)1=xp(x)1=0. \mathbb E_{x\sim q}[r-1] = \mathbb E_{x\sim q}\left[\frac{p(x)}{q(x)}\right]-1 = \sum_x q(x)\frac{p(x)}{q(x)}-1 = \sum_x p(x)-1 =0.

TRM 里的对应变量是:

q=πroll,p=πθ,r=ρ=πθπroll. q=\pi_{\mathrm{roll}},\qquad p=\pi_\theta,\qquad r=\rho=\frac{\pi_\theta}{\pi_{\mathrm{roll}}}.

所以:

k3=ρ1logρ k_3=\rho-1-\log\rho

估计的是:

DKL(πrollπθ). D_{\mathrm{KL}}(\pi_{\mathrm{roll}}\|\pi_\theta).

这和“真正采样的分布 log_prob 减去另一个分布 log_prob”一致:forward KL 的 sample estimator 主项是:

logπroll(yc)logπθ(yc)=logρ. \log \pi_{\mathrm{roll}}(y\mid c)-\log \pi_\theta(y\mid c) =-\log\rho.

rho-1 是零均值控制变量,用来降低方差并保持非负。

4. 为什么 max 和 average 要组合

average KL 反映一条序列上总漂移,max KL 捕捉局部 outlier。两类错误对训练的影响不同:

  • 少数 token ratio 极端时,PPO/GRPO loss 可以被单点梯度主导。
  • 每个 token 都略偏时,单点 max 不高,但长序列累计偏移会让整条 trajectory 的 probability interpretation 改变。

因此 combined criterion 的经验成功符合理论结构:max criterion 对应 DKLtok,maxD_{\mathrm{KL}}^{\mathrm{tok,max}},average criterion 对应 DKLseq/TD_{\mathrm{KL}}^{\mathrm{seq}}/T

5. 实践落地时应记录的字段

复验 TRM 或在系统中打开 sequence masking 时,建议至少记录:

  • rollout engine、trainer engine、attention backend、MoE backend、precision、kernel deterministic 设置。
  • πrollout\pi_{\mathrm{rollout}}πold\pi_{\mathrm{old}}πθ\pi_\theta 的 logprob 来源。
  • full KL、k2、k3、sampled-token logprob delta 的具体定义和 ratio 方向。
  • δmax\delta_{\max}δavg\delta_{\mathrm{avg}}、SER/LN-TRM threshold。
  • masked fraction、accepted sequence length distribution、reward distribution、advantage distribution。
  • 是否按 total batch size 归一化,及有效 batch size 波动。
  • AIME/math 之外的任务类型,特别是 code、tool-use、multi-turn agent。

跨论文关系

  • TIM / VeXact:TIM 证明 rollout 与 trainer 的实现级 logprob mismatch 会改变优化目标;TRM 用 sequence-level max-token divergence 决定样本是否进入梯度,提供误差控制层。
  • verl 官方仓库:verl rollout correction 已显式区分 πrollout\pi_{\mathrm{rollout}}πold\pi_{\mathrm{old}}πθ\pi_\theta,并接入 sequence-level k1/k3 masking;TRM 因而具有直接的 paper-to-framework 实现关系。
  • KL Estimators:Schulman 的 k1/k2/k3 讨论提供 sampled-action KL estimator 的偏差与方差语言,TRM 将 k1/k3 用于长轨迹 divergence threshold 和 max veto。
  • DAPOEntropy Mechanism:三者共享 long-CoT GRPO 背景,分别处理有效梯度与 overlong shaping、entropy dynamics、rollout/current mismatch。
  • OTB:两篇论文共享作者与 verl 生态;TRM 控制样本准入和 trust-region violation,OTB 降低同一 policy-gradient estimator 内部的 token-level 方差。
  • 2607.07508 SAO:两者都用 rollout/current divergence 控制 gradient admission。SAO 根据 sampled-token ratio 对区间外 token 做双侧硬 mask,成本低且适配异步 behavior logprob;TRM 以 sequence-level max / average divergence 控制完整 trajectory 准入,并给出长序列 surrogate-error 理论。SAO 的 token gate 无法覆盖 full-distribution 与 prefix shift,TRM 的 sequence rejection 会付出更高 sample-efficiency 成本。

Reference Intake Brief

  • Decision: merge。
  • Why: 本文直接补齐本地档案中 TIM/VeXact、verl rollout correction、Schulman KL estimator 与 DAPO/GRPO long-horizon RL 之间的理论连接,且已有 verl PR 合并记录,具备研究与工程双重价值。
  • What to carry forward:
    • long-horizon surrogate error 不能只看 average KL,max token divergence 是核心控制量。
    • PPO clipping 控制 policy update ratio,TRM 控制 rollout/current mismatch 样本是否进入梯度。
    • k3 在本文的 ratio 方向是 ρ=πθ/πroll\rho=\pi_\theta/\pi_{\mathrm{roll}},样本来自 πroll\pi_{\mathrm{roll}},估计 DKL(πrollπθ)D_{\mathrm{KL}}(\pi_{\mathrm{roll}}\|\pi_\theta)
    • max criterion 与 average criterion覆盖不同 failure mode,组合使用更合理。
    • high rejection rate 会把问题从 stability 转成 sample efficiency 和 selection bias,需要同时记录 masked fraction 和长度分布。
  • Follow-up:
    • 跟踪 verl 中 TRM 配置的默认值、API 命名和后续 benchmark。
    • 若后续归档 TRPO/PPO 或 rollout correction 论文,应把 TRM 的 bound 与原始 trust region 理论放到同一链条。
    • 若分析 agentic RL 系统,需要重新定义 sequence mask 的边界:单轮 response、整条 tool trajectory、或每个 environment step。