2505.22617-entropy-mechanism-rl-reasoning-language-models

The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models

这篇论文把 reasoning LLM 的 RLVR 训练瓶颈重新表述为 policy entropy 的消耗过程:在没有 entropy / KL 干预时,reward 提升和 entropy 下降之间可以用负指数关系拟合;进一步用 softmax policy 的 entropy dynamics 说明,高概率且高 advantage 的 token update 会持续降低 entropy;工程上提出 Clip-Cov / KL-Cov,只干预极少数高 covariance token,以维持探索并提升 Qwen2.5 数学 RL 结果。

Authors Ganqu Cui, Yuchen Zhang, Jiacheng Chen, Lifan Yuan (袁立凡), Zhi Wang, Yuxin Zuo, Haozhan Li, Yuchen Fan, Huayu Chen (陈华玉), Weize Chen, Zhiyuan Liu, Hao Peng, Lei Bai (白磊), Wanli Ouyang, Yu Cheng, Bowen Zhou, Ning Ding (丁宁)

已审阅 Archived 2026-06-21 11:35 Updated 2026-07-16 19:17 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Ganqu Cui: Shanghai AI Laboratory.
  • Yuchen Zhang: Shanghai AI Laboratory / Peking University.
  • Jiacheng Chen: Shanghai AI Laboratory.
  • Lifan Yuan: UIUC.
  • Zhi Wang: Nanjing University.
  • Yuxin Zuo: Tsinghua University.
  • Haozhan Li: Tsinghua University.
  • Yuchen Fan: Shanghai AI Laboratory.
  • Huayu Chen: Tsinghua University.
  • Weize Chen: Tsinghua University.
  • Zhiyuan Liu: Tsinghua University.
  • Hao Peng: UIUC.
  • Lei Bai: Shanghai AI Laboratory.
  • Wanli Ouyang: Shanghai AI Laboratory.
  • Yu Cheng: Shanghai AI Laboratory / CUHK.
  • Bowen Zhou: Shanghai AI Laboratory / Tsinghua University.
  • Ning Ding: Tsinghua University / Shanghai AI Laboratory.

阅读目标与判断边界

本笔记关注:

  1. 论文如何定义和测量 RLVR 中的 policy entropy,以及它和 validation performance 的经验关系。
  2. 论文的 covariance 推导到底说明了什么,哪些地方依赖 tabular softmax / first-order approximation / policy gradient 假设。
  3. Clip-Cov / KL-Cov 相比 entropy bonus、reference KL 和 DAPO Clip-Higher 的实际差异。
  4. 本篇在当前 RL reasoning 社区中的可信度:工程采纳强,但理论与泛化仍需独立复验。

判断边界:

  • 论文在 OpenReview 上显示为 ICLR 2026 withdrawn submission,因此不能当作已完成顶会审稿背书的定论。
  • 实验主效果集中在 Qwen2.5-7B / 32B、DAPO-MATH、数学 benchmarks;跨模型、跨 reward、跨 agentic environment 的结论需要复验。
  • 理论推导使用 tabular softmax policy 和一阶近似,本地分析只把它当作解释 token update 方向的机制模型。

论文脉络

1. 研究问题、背景和价值

Reasoning LLM 的 RLVR 训练通常使用 verifiable reward:数学答案是否匹配、代码是否通过测试、任务是否满足自动验证条件。DeepSeek-R1、DAPO、ProRL、BroRL 等工作说明这条路线能显著提升 math/code reasoning,但也暴露出几个共同问题:训练早期收益很快出现,后续 steps 的边际收益下降;模型 response 变长,policy 分布更集中;同一套 recipe 对 base model、数据难度、采样温度和动态采样非常敏感。

这篇论文抓住其中一个变量:policy entropy。作者把 entropy 视为当前 policy 在训练 prompts 上继续探索新路径的能力。若 entropy 很快接近 0,模型会把概率质量集中到已经被 reward 强化过的路径上,后续 rollout 很难探索到新的正确解法。这个视角有工程价值,因为它给 RL 训练提供了比单看 reward 更早、更细的诊断信号:如果 reward 还在升,但 entropy 已经被快速消耗,后续训练可能进入低收益区。

论文的价值主要在三点:

  1. 给出一个经验规律,把 validation performance 和 policy entropy 拟合到 R=aexp(H)+bR=-a\exp(\mathcal H)+b
  2. 给出一个 softmax policy 下的 entropy dynamics 解释,把 entropy 下降和 logπ\log\pi、logit update / advantage 的 covariance 联系起来。
  3. 用 covariance 指标定位极少数高影响 token,并提出 Clip-Cov / KL-Cov 作为低改动的 entropy control recipe。

2. 已有解决方案与不足

已有 RL / RLHF 中常见的探索控制手段包括 entropy bonus、reference KL penalty、PPO clipping、TRPO-style trust region,以及 DAPO 中的 Clip-Higher。它们确实都在某种意义上控制 policy update 或分布漂移,但在 reasoning LLM 的 RLVR 场景中存在不同不足。

Entropy bonus 会直接鼓励分布更均匀,但论文实验显示它对系数非常敏感:小系数几乎不改变 entropy,大系数可能导致 entropy explosion,中间系数能稳定 entropy 时不一定带来更好 performance。Reference KL penalty 可以把 policy 拉回 reference model,从而维持一定 entropy,但这也可能限制模型向 rewarded reasoning path 移动,论文实验中 performance 反而下降。

DAPO 的 Clip-Higher 提高 PPO ratio 上界,允许正 advantage token 获得更大更新,能改善 long-CoT RL。论文把它解释为间接增加低概率、高 advantage token 的更新机会,也就是鼓励一部分低 covariance token 参与学习。它的问题是粒度较粗:阈值只看 ratio 和 advantage,不直接看某个 token 对 entropy dynamics 的贡献。

这篇论文的切入点是:如果 entropy 下降来自少数高 covariance token 对 policy 的集中推动,那么更直接的控制方式是定位这些 token,再只对它们约束 update。

3. 作者可能的思考路径

从已有背景看,作者可能先观察到一个训练曲线现象:Qwen / Mistral / LLaMA / DeepSeek-Math 等模型在 math/code RL 中,早期 reward 快速上升,entropy 快速下降,后续训练变慢。这个现象和 RL 经典 exploitation-exploration trade-off 对应,但 LLM 训练里更强,因为每个 token 的 softmax 分布会把高 reward 路径迅速变成高概率路径。

接着,作者会自然尝试已有控制手段:加 entropy loss、加 reference KL、调 PPO clip。若这些手段出现系数敏感或 performance 损失,就需要问一个更局部的问题:到底哪些 token update 在消耗 entropy?

softmax policy 给了一个分析入口。entropy 是 π\pi 的函数,policy update 可以近似为 logits 的微小变化。对 entropy 做一阶展开后,变化项会落到 logπ(as)\log\pi(a\mid s)Δzs,a\Delta z_{s,a} 的 covariance 上。再把 policy gradient 下的 logit 变化写成 advantage 相关项,就得到一个很实用的直觉:高概率动作继续获得正 advantage,会让分布更尖;低概率动作获得正 advantage,可能提升探索。

由此,方法设计变得直接:先计算 token-wise covariance proxy,找出极少数高 covariance token,然后限制它们的梯度或给它们加 KL penalty。

4. 核心假设或切入点

论文的核心假设可以拆成三层:

  1. RLVR 中 policy entropy 是限制后续 exploration 和 performance scaling 的关键状态变量。
  2. 在 softmax policy 下,entropy 的 step-wise change 可以通过 logπ\log\pi 和 logit update / advantage 的 covariance 解释。
  3. 高 covariance token 具有强长尾分布,干预极少数 token 就能改变整体 entropy dynamics,同时保留多数 token 的正常 policy gradient 学习。

5. 方法 / 系统 / 理论框架

5.1 Policy entropy 定义

论文测量的是训练数据上的平均 token-level policy entropy:

H(πθ,D)=1DxD1yt=1yEytπθ[logπθ(yty<t,x)]. \mathcal H(\pi_\theta,\mathcal D)= -\frac{1}{|\mathcal D|}\sum_{x\in\mathcal D} \frac{1}{|\boldsymbol y|}\sum_{t=1}^{|\boldsymbol y|} \mathbb E_{y_t\sim \pi_\theta} \left[\log \pi_\theta(y_t\mid \boldsymbol y_{<t}, x)\right].

它关心模型在当前 prompts 和 prefixes 下对下一 token 的不确定性。这个定义是 token-level 的,和 sequence-level response diversity、pass@kk coverage、semantic diversity 有关系,但不能直接等同。

5.2 经验律:performance 与 entropy 的指数关系

作者在 4 个模型家族、11 个 base models、math/code verifiable tasks 和多个 RL algorithms 上观察到:

R=aexp(H)+b. R=-a\exp(\mathcal H)+b.

其中 RR 是 validation performance,H\mathcal H 是 policy entropy。当 H=0\mathcal H=0 时,论文把

Rmax=a+b R_{\max}=-a+b

解释为给定 policy model 和训练数据下的可预测 ceiling。

关键实验结论:

  • 2400 gradient steps 的 11 个 RL runs 中,前 200 steps 消耗 73% entropy,同时获得 76% performance gain。
  • 前 800 steps 消耗 94% entropy,同时获得超过 93% performance gain。
  • 只用 Qwen2.5 family 前 36 training steps 拟合 a,ba,b,预测后续 200 steps,math / code 的平均 RMSE 为 0.9% / 1.2%,最终性能 RMSE 为 0.5% / 1.9%。
  • 在 Qwen2.5-7B 上比较 GRPO、RLOO、PRIME,拟合曲线近似不随算法变化,作者据此认为 a,ba,b 反映 model/data 的内在属性。

这个经验律是论文最有传播力的主张,也是最需要复验的部分。它在作者实验范围内很整齐,但论文自己也承认,使用不同 policy model 或 off-policy data 的工作观察到过不同 entropy patterns。

5.3 Softmax policy 的 entropy dynamics

对 softmax policy:

πθ(as)=exp(zs,a)aexp(zs,a). \pi_\theta(a\mid s)= \frac{\exp(z_{s,a})}{\sum_{a'}\exp(z_{s,a'})}.

在 tabular softmax 和一阶近似下,论文给出:

H(πθk+1s)H(πθks)Covaπθk(s)(logπθk(as),zs,ak+1zs,ak). \mathcal H(\pi_\theta^{k+1}\mid s)-\mathcal H(\pi_\theta^{k}\mid s) \approx -\mathrm{Cov}_{a\sim \pi_\theta^k(\cdot\mid s)} \left( \log\pi_\theta^k(a\mid s), z_{s,a}^{k+1}-z_{s,a}^{k} \right).

这个式子的直觉是:如果某个已经高概率的 action 在更新后 logit 继续上升,分布会变得更集中,entropy 下降。若低概率 action 获得更新,分布可能变平,entropy 上升。

在 vanilla policy gradient 下,论文推导:

zs,ak+1zs,ak=ηπθ(as)A(s,a). z_{s,a}^{k+1}-z_{s,a}^{k} =\eta\,\pi_\theta(a\mid s)A(s,a).

代回 entropy change:

ΔH(s)ηCovaπθk(s)(logπθk(as),πθk(as)A(s,a)). \Delta \mathcal H(s) \approx -\eta\, \mathrm{Cov}_{a\sim\pi_\theta^k(\cdot\mid s)} \left( \log\pi_\theta^k(a\mid s), \pi_\theta^k(a\mid s)A(s,a) \right).

在 natural policy gradient 下:

ΔH(s)ηCovaπθk(s)(logπθk(as),A(s,a)). \Delta \mathcal H(s) \approx -\eta\, \mathrm{Cov}_{a\sim\pi_\theta^k(\cdot\mid s)} \left( \log\pi_\theta^k(a\mid s), A(s,a) \right).

这三个式子给了一个统一解释:当当前 policy 的高概率动作同时具有高 advantage,covariance 为正,entropy 下降;当 rare action 获得高 advantage,covariance 下降甚至为负,entropy 下降速度减慢或转为上升。

5.4 Empirical verification

论文用 Qwen2.5-7B 做 on-policy GRPO without PPO surrogate loss,在 bandit setting 中把 prompt 当 state、整个 response 当 action。response log probability 做长度归一化:

logπθ(yx)=1yt=1ylogπθ(yty<t,x). \log\pi_\theta(\boldsymbol y\mid\boldsymbol x) =\frac{1}{|\boldsymbol y|} \sum_{t=1}^{|\boldsymbol y|} \log\pi_\theta(y_t\mid \boldsymbol y_{<t},\boldsymbol x).

作者记录 covariance 和 ΔH-\Delta \mathcal H,发现两条曲线动态相似;covariance 在训练中多数时候为正,从而解释 entropy 单调下降。按 prompt group accuracy 分桶后,容易样本 covariance 更高,难样本 covariance 更低;这符合“模型已经会的区域更容易被 RL 强化成更确定输出”的直觉。

5.5 Token-wise covariance proxy

实际算法不能对所有 state-action 做精确全分布 covariance,于是论文用 batch 内 token-wise centered cross-product:

Cov(yi)=(logπθ(yi)1Nj=1Nlogπθ(yj))(A(yi)1Nj=1NA(yj)). \mathrm{Cov}(y_i)= \left( \log\pi_\theta(y_i)-\frac{1}{N}\sum_{j=1}^N \log\pi_\theta(y_j) \right) \left( A(y_i)-\frac{1}{N}\sum_{j=1}^N A(y_j) \right).

其中 NN 是一个 batch 的 rollout tokens。注意这个量是工程 proxy:它和 NPG 公式里的 covariance 方向一致,但受 batch composition、advantage normalization、response length、loss mask、token frequency 和采样温度影响。

论文报告 Qwen2.5-7B 第一步中 covariance 呈强长尾:

Group Mean covariance
Top 0.02% 5.654
Top 0.2% 3.112
Top 2% 1.385
Top 20% 0.351
Top 50% 0.152
All 0.003

这个表是方法成立的关键动机:总体平均很小,但极少数 token 的 covariance 极大。只要这些 token 反复把高概率、高 advantage 方向推得更尖,整体 entropy curve 就会被明显改变。

5.6 Clip-Cov

Clip-Cov 的动作是从高 covariance 区间中随机选择 rNrN 个 token,把这些 token 的 policy gradient contribution detach:

LClip-Cov(θ)={Et[πθ(yty<t)πθold(yty<t)At],tIclip,0,tIclip. L_{\text{Clip-Cov}}(\theta)= \begin{cases} \mathbb E_t\left[ \frac{\pi_\theta(y_t\mid\boldsymbol y_{<t})} {\pi_{\theta_{\mathrm{old}}}(y_t\mid\boldsymbol y_{<t})} A_t \right], & t\notin I_{\text{clip}},\\ 0, & t\in I_{\text{clip}}. \end{cases}

实验中 r=2×104r=2\times 10^{-4}ωlow=1\omega_{\text{low}}=1ωhigh=5\omega_{\text{high}}=5。这意味着它只移除极少数高 covariance token 的梯度贡献。

5.7 KL-Cov

KL-Cov 选择 covariance top-kk token,对这些 token 加 KL penalty:

IKL={iRank(Cov(yi))kN}. I_{\mathrm{KL}}= \{i\mid \mathrm{Rank}(\mathrm{Cov}(y_i))\le kN\}.

论文公式写作:

LKL-Cov(θ)={Et[rtAt],tIKL,Et[rtAtβDKL(πθoldπθ)],tIKL. L_{\text{KL-Cov}}(\theta)= \begin{cases} \mathbb E_t[r_t A_t], & t\notin I_{\mathrm{KL}},\\ \mathbb E_t\left[ r_tA_t-\beta D_{\mathrm{KL}} (\pi_{\theta_{\mathrm{old}}}\Vert\pi_\theta) \right], & t\in I_{\mathrm{KL}}. \end{cases}

其中 rt=πθ/πθoldr_t=\pi_\theta/\pi_{\theta_{\mathrm{old}}}。论文 pseudo-code 中 penalty 近似写成 abs(log_prob - old_log_prob),实现层和严格分布级 KL 存在差异;阅读时应把 KL-Cov 理解为“对高 covariance token 增加相对 old policy 的局部更新阻尼”。

实验中 k=2×103k=2\times 10^{-3} for 7B,k=2×104k=2\times 10^{-4} for 32B,β=1\beta=1

6. 结论链条

论文的论证链条可以压缩为:

  1. RLVR 训练中,reward 上升与 entropy 下降高度同步,早期 steps 消耗掉大部分 entropy。
  2. 在作者实验范围内,R=aexp(H)+bR=-a\exp(\mathcal H)+b 可以拟合 performance-entropy curve,并支持早期预测 late-stage performance。
  3. Softmax policy 的 entropy 一阶变化由 logπ\log\pi 与 logit update 的 covariance 决定;在 PG / NPG 下,logit update 和 advantage 相关。
  4. 因此,高概率、高 advantage 的 token 会加速 entropy 下降;少数高 covariance token 可能主导 entropy collapse。
  5. 直接约束高 covariance token,比全局 entropy bonus 或 reference KL 更局部,也更少牺牲普通 token 的 reward learning。
  6. Clip-Cov / KL-Cov 在 Qwen2.5 数学 RL 上提升 average benchmark performance,并维持更高 policy entropy。

关键实验/定理

结果 1:Entropy collapse 与 performance saturation 同步出现

  • 设置:4 个模型家族,11 个 base models,math/code verifiable tasks,GRPO / REINFORCE++ / PRIME 等 RL 训练。
  • 指标:训练过程中的 policy entropy、validation performance、normalized entropy consumption 和 performance gain。
  • 结果:前 200 / 2400 gradient steps 消耗 73% entropy,获得 76% performance gain;前 800 steps 消耗 94% entropy,获得超过 93% performance gain。
  • 解读:在这些设置里,RL 的有效收益高度集中在 entropy 仍然充足的早期阶段;后续训练如果无法维持 exploration,更多 updates 可能只是在低 entropy 分布上重复强化。

结果 2:Performance-entropy curve 可用指数函数拟合

  • 设置:对 math/code validation performance 和 policy entropy 做拟合。
  • 指标:R=aexp(H)+bR=-a\exp(\mathcal H)+b 的拟合效果;用前 36 training steps 预测后续 200 steps。
  • 结果:Qwen2.5 family 上,math / code 平均预测 RMSE 为 0.9% / 1.2%,最终性能 RMSE 为 0.5% / 1.9%。
  • 解读:这是非常强的经验观察,但还应视为 domain-specific scaling regularity。不同 rollout policy、off-policy data、reward shaping、agent environment 可能改变曲线形态。

定理 1:Softmax policy 的 entropy change 由 covariance 决定

  • 设置:tabular softmax policy,一阶 Taylor approximation。
  • 结论:
ΔH(s)Covaπk(logπk(as),Δzs,a). \Delta \mathcal H(s) \approx -\mathrm{Cov}_{a\sim \pi^k} \left( \log\pi^k(a\mid s), \Delta z_{s,a} \right).
  • 解读:这个定理还不能覆盖深度 Transformer 的完整训练过程,但它抓住了 softmax 输出层分布变尖的直接机制。

定理 2:PG / NPG 下 covariance 与 advantage 相连

  • 设置:tabular softmax policy,vanilla policy gradient 或 natural policy gradient。
  • 结果:
ΔHPG(s)ηCov(logπk(as),πk(as)A(s,a)), \Delta \mathcal H_{\mathrm{PG}}(s) \approx -\eta\,\mathrm{Cov} \left(\log\pi^k(a\mid s), \pi^k(a\mid s)A(s,a)\right),
ΔHNPG(s)ηCov(logπk(as),A(s,a)). \Delta \mathcal H_{\mathrm{NPG}}(s) \approx -\eta\,\mathrm{Cov} \left(\log\pi^k(a\mid s), A(s,a)\right).
  • 解读:高概率且高 advantage 的 action 会降低 entropy;rare action 的高 advantage 更可能维持或提升 entropy。这个结论给 Clip-Cov / KL-Cov 的 token selection 提供方向。

结果 3:Naive entropy regularization 与 reference KL 不稳定

  • 设置:在 policy loss 中加入 entropy loss Lent=LαH(πθ)L_{\text{ent}}=L-\alpha\mathcal H(\pi_\theta),或 reference KL LKL=L+βDKL(πθπref)L_{\text{KL}}=L+\beta D_{\mathrm{KL}}(\pi_\theta\Vert\pi_{\mathrm{ref}})
  • 指标:policy entropy、validation accuracy。
  • 结果:entropy loss 对系数敏感;reference KL 能稳定 entropy,但在论文实验中降低 performance。
  • 解读:全局提高 entropy 可能让模型在不该随机的地方随机;全局 reference KL 也可能限制 valid policy improvement。

结果 4:Clip-Cov / KL-Cov 提升 Qwen2.5 math RL

  • 设置:Qwen2.5-7B / 32B,DAPO-MATH 训练;每个 rollout step 采样 256 prompts,每 prompt 8 responses,temperature 1;随后做 8 policy updates;过滤全对/全错 prompts;max generation length 8192。
  • 评测:MATH500、AIME 2024、AIME 2025、AMC、OMNI-MATH、OlympiadBench、Minerva;AIME/AMC 用 temperature 0.6,其余 greedy。
  • 结果:
Model GRPO avg Clip-Higher avg Clip-Cov avg KL-Cov avg
Qwen2.5-7B 38.6 38.8 40.4 40.6
Qwen2.5-32B 45.8 47.2 50.3 52.2
  • 关键点:32B 上 KL-Cov 将 AIME24 从 21.8 提到 36.8,将 AIME25 从 16.2 提到 30.8;论文称相对 GRPO 分别提升 15.0% 和 14.6%。
  • 解读:方法在 32B 上收益更明显,可能因为更强 base model 有更多潜在低概率 reasoning path 可被探索。这个解释需要和 response length、sampling temperature、有效 prompt 分布一起复验。

证据链强度评估

强证据

  • Entropy collapse 现象本身证据强。论文覆盖多个模型家族、模型尺度、math/code tasks 和不同 RL algorithms;这个现象也和 DAPO、ProRL、BroRL、RLVR boundary 等工作中的训练曲线直觉一致。
  • Softmax entropy dynamics 的一阶推导有明确数学结构。虽然假设简化,但公式能解释为什么高概率、高 advantage token 会让 policy 变尖。
  • Clip-Cov / KL-Cov 作为工程干预证据较清楚。它们只改少量 loss 逻辑,在 Qwen2.5 数学 RL 上有 benchmark gain,并已进入 PRIME-RL repo / verl recipe 生态。

中等强度证据

  • R=aexp(H)+bR=-a\exp(\mathcal H)+b 的经验律很整齐,但当前主要来自作者控制的实验集合。它可以作为训练早停、预算预测和 anomaly detection 的候选工具,尚不宜上升为普遍 law。
  • “算法无关、model/data 决定 coefficients” 的说法有启发性,但算法范围主要是 GRPO/RLOO/PRIME 这类相近 RLVR setting。若引入 off-policy data、adaptive environment、self-play、teacher distillation 或 process reward,曲线可能变化。
  • 高 covariance token 主导 entropy collapse 的解释有 batch 统计支持,但需要更多 ablation 证明这些 token 的因果作用,同时排除长度、位置、token type、difficulty、format token 等共同变化因素。

需要谨慎的推论

  • “entropy exhaustion 决定 RL ceiling”容易过强。更稳的表述是:在当前 on-policy RLVR setting 中,entropy 下降可以预测一类训练曲线的 performance plateau;改变数据、environment、sampling、teacher signal 或 reward 形式可能改变 ceiling。
  • 更高 entropy 和更好 exploration 之间不总是同义。无约束的 entropy bonus 已经显示可能损害 performance。有效 entropy 应该指向 reward-relevant low-probability paths,减少随机生成无效 token。
  • KL-Cov 的 penalty 形式需要核对实际实现。论文公式、pseudo-code 和 verl 实现可能存在近似差异,复现实验时要明确是 distribution KL、sample-level KL、absolute log-ratio,还是 PPO-style KL estimator。
  • OpenReview withdrawn status 和 2/2/4/6 的 official review ratings 削弱正式学术背书。当前更适合作为高影响力 arXiv + 工程 recipe,尚不能作为稳定定论。

OpenReview / 审稿意见吸收

  • Venue status: 当前档案未记录公开 peer-review 状态。
  • Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
  • Ratings / confidence: 无公开评分可用于校准。
  • Reviewer consensus: 暂无。
  • Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
  • Author response: 暂无公开 rebuttal 记录。
  • 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。

本地讨论补充

1. 讨论收敛点

  • 这篇论文目前在 RL for reasoning 小圈子里影响力很高,Semantic Scholar 显示约 300+ citations,GitHub repo 有数百 stars,verl 文档也有独立 recipe。它已经进入工程社区视野。
  • 它还不能被表述为“广泛公认的定论”,因为 OpenReview 页面显示 withdrawn submission,且核心经验律与方法泛化性需要更多独立复验。

2. 修正后的理解

  • 本篇最稳的贡献是把 RLVR 训练过程拆成“reward gain 和 entropy consumption”的共同轨迹,并指出 high-probability positive-advantage token update 会让 policy 快速集中。
  • Clip-Cov / KL-Cov 的本质是局部 trust-region:只对最可能继续消耗 entropy 的 token 增加阻尼,保留多数 token 的 reward learning。
  • 这和 DAPO Clip-Higher 的关系很近:Clip-Higher 给低概率正 advantage token 更大更新空间,论文则直接用 covariance 选 token。

3. OpenReview 审稿意见吸收

OpenReview public API 显示,本篇 ICLR 2026 forum 公开部分包含 4 条 official review、1 条 withdrawal 和原始 submission;没有公开 author rebuttal、meta-review 或 decision discussion。4 个 official review 的 ratings 分别为 2、2、4、6,confidence 为 3、4、3、4;页面状态为 withdrawn submission,修改时间 2025-12-04。

审稿人认可的部分集中在三点:

  • 问题诊断有价值:policy entropy collapse 与 performance saturation 同步出现,是 reasoning RL 训练里值得单独记录的状态变量。
  • covariance 视角有一定新意:把 entropy change 写成 log-probability 与 logit update / advantage 的 covariance,给 high-probability positive-advantage token 为什么会让分布变尖提供了可计算解释。
  • Clip-Cov / KL-Cov 是低改动工程 recipe:只对高 covariance token 做 clipping 或 KL penalty,工程上容易加入 GRPO / PPO-like loss。

主要批评可以合并成六类:

  1. 经验律适用范围过窄。强负评认为 R=aexp(H)+bR=-a\exp(\mathcal H)+b 主要在无 entropy / KL regularization 的设置中成立,而实际 RL fine-tuning 常配合 PPO clipping、entropy bonus、reference KL 或 trust-region 约束;因此这个曲线更像 descriptive fit,支撑不了普遍机制。
  2. Baseline 和统计证据不足。评审明确要求 seed 数量、standard error / confidence interval,以及和 well-tuned entropy bonus、reference KL、PPO、NPG、Hindsight Merging 等 entropy-control 方法的正面对照。当前表格只说明 Clip-Cov / KL-Cov 在作者设置里优于 GRPO / Clip-Higher,尚不足以证明方法稳定优于已有探索控制方案。
  3. 理论假设跨度大。tabular softmax、一阶近似、PG/NPG 推导和 Transformer function approximation 之间存在明显距离;另有评审指出 state distribution 从 dθkd_{\theta_k}dθk+1d_{\theta_{k+1}} 的变化被忽略,Agarwal et al. 相关常数和有限/无限 horizon 转换也需要补齐。
  4. Covariance 粒度未闭合。理论使用 action-level expectation,经验验证用 sequence-level covariance,算法实现用 token-level proxy。三者方向一致,但论文没有充分解释 token-level top-kk proxy 为什么能稳定控制 sequence-level entropy dynamics。
  5. 新颖性表述偏强。从经典 RL 理论看,确定性最优策略、entropy 下降、NPG / entropy regularization 的平滑作用都已有背景。论文更像把这些思想迁移到 RLVR token-level 训练日志中,并提出一个局部化实现。
  6. 超参数和实现稳定性需要复验。k/rk/r10410^{-4}10310^{-3} 量级,Figure 6 也显示不同选择会显著改变 entropy curve;random select 是否引入训练方差没有充分报告。

吸收审稿意见后的评价:

  • 这篇论文的传播价值来自“问题命名 + 可记录指标 + 简单 recipe + verl/PRIME-RL 落地”,学术审稿层面的认可度明显弱于社区热度。
  • 最稳妥的定位是 RLVR entropy diagnostics paper。它适合作为训练日志设计和 ablation checklist 的来源,也适合作为 Clip-Cov / KL-Cov recipe 的起点。
  • 经验律 R=aexp(H)+bR=-a\exp(\mathcal H)+b 应降级为作者实验范围内的 early-stage curve fitting 工具。使用时需要注明:on-policy RLVR、无强 entropy/KL 干预、给定 model/data family、给定 decoding/eval protocol。
  • Covariance 推导适合作为局部机制 intuition。把它解释为 Transformer RL 训练的完整理论会超出现有证据;更合理的写法是“softmax 输出层上的一阶解释 + batch token proxy”。
  • Clip-Cov / KL-Cov 仍有工程价值。它们提供了比全局 entropy bonus 更局部的 update damping,但后续复验必须补 well-tuned baselines、多个 seed、误差条、选中 token profile、response length、pass@kk 和 semantic diversity。

4. 后续复验指标

  • policy_entropy/token_entropy: batch-level、position-level、prompt-level 分桶。
  • response_entropy/semantic_diversity: 避免只看 token-level entropy。
  • covariance_distribution: top 0.02%、0.2%、2% 与 all mean。
  • selected_token_profile: Clip-Cov / KL-Cov 选中的 token 类型、位置、是否 format token、是否 high-frequency token。
  • response_length: 区分 entropy control 带来的 exploration 与单纯 length 增长。
  • pass@k / coverage: 判断是否扩大可解路径集合。
  • clip_fraction / KL / K3 / chi2: 和 Schulman KL estimator 的 policy drift 诊断结合。
  • random / format / incorrect reward baselines: 和 2506.10947 对照,排除 prior amplification。

主要启发

  • RLVR 训练日志里应把 entropy 当作一等指标。只看 reward、accuracy、KL 和 response length 容易漏掉 exploration capacity 是否已经耗尽。
  • “维持 entropy”要局部化。全局 entropy bonus 和 reference KL 会影响所有 token;高 covariance token selection 提供更精确的 intervention handle。
  • 对 long-CoT RL,reward gain 应该和 entropy consumption 一起看。一个训练 run 如果早期已经消耗 90% entropy,继续加 steps 的收益可能很有限;更有价值的动作可能是换数据、调采样、增加 rollout width、改变 reward 或引入 environment。
  • 这篇和 2504.13837 的 pass@kk 观点互补:如果 RL 只是把 base model 已有低概率正确路径提升为高概率,entropy collapse 就是这个概率重排过程的可观测结果之一。
  • 这篇和 2505.24864 / 2510.01180 的关系是正向互补:ProRL/BroRL 试图延长或拓宽 RL exploration,本篇提供 entropy-level 诊断和 token-level 控制手段。

局限

  1. 理论假设简化。tabular softmax、一阶 approximation、PG/NPG logit update 无法覆盖深层 Transformer 参数共享、optimizer state、Adam/Muon update、RMSNorm、attention/MLP 非线性和 sequence-level credit assignment。
  2. 实验主效果集中在 Qwen2.5 + DAPO-MATH + math benchmarks。模型家族、数据难度、reward sparsity、rollout temperature、dynamic sampling 和 eval decoding 的交互仍需更细 ablation。
  3. Entropy metric 是 token-level 平均值,不能直接代表 solution diversity。模型可以通过长 response、格式变化或局部 token 随机性提高 entropy,却不增加有效 reasoning paths。
  4. Clip-Cov / KL-Cov 的 token selection 可能和 response length、token position、format token、advantage normalization 相关。论文没有充分展示选中 token 的语义分布。
  5. OpenReview withdrawn status 说明它尚未获得稳定顶会录用背书。工程采用提高了实践参考价值,但不能替代独立复现。
  6. OpenReview official reviews 集中指出缺少 seed / error bar、PPO / entropy bonus / NPG / existing entropy-control baselines,以及 tabular theory 到 Transformer function approximation 的桥接。这些问题会影响“机制发现”和“算法改进”两类主张的强度。

跨论文关系

  • 2501.12948 DeepSeek-R1:R1 展示 verifiable reward + GRPO 可以激发 long-CoT reasoning,本篇解释这类 RL 为什么容易在早期快速集中分布并进入 entropy-limited plateau。
  • 2503.14476 DAPO:DAPO 的 Clip-Higher、Dynamic Sampling 和 token-level loss 是本篇实验和方法比较的直接背景;本篇使用 DAPO-MATH,并把 Clip-Higher 解释为一种间接 entropy control。
  • verl 官方仓库:本篇的 Clip-Cov / KL-Cov 已进入 verl recipe;verl 中的 KL/K3/chi2、rollout correction 和 loss mode 适合承载本篇指标。
  • 2504.13837 RLVR boundary:后者关注 RL 是否扩展 base model reasoning boundary;本篇提供 entropy collapse 和 high-covariance token update 的机制解释。
  • 2506.10947 Spurious Rewards:Spurious Rewards 提醒 RLVR gains 可能来自 prior amplification 和 GRPO clipping bias;本篇的 entropy collapse 可被理解为 prior amplification 的分布动力学表现之一,复验时应加入 random / format reward baselines。
  • 2505.24864 ProRL2510.01180 BroRL:三者共同关注 exploration 如何延长或拓宽。本篇从 entropy control 入手,ProRL 从 prolonged steps / KL reset 入手,BroRL 从 rollout width 入手。
  • 2020-03-07 Schulman KL:KL-Cov、reference KL 和 policy drift 诊断都需要清晰区分可微 KL loss、sample-level KL penalty 和 Monte Carlo KL estimator。
  • 2606.12370 Bebop:Bebop 题目中的 entropy bound 关注 MTP rejection sampling acceptance / TV distance,本篇关注 policy entropy collapse;二者都说明 rollout distribution 的 entropy 会成为 RL scaling 的系统变量。
  • 2604.17312 Data-Scarcity RL Survey:两篇共享作者 Lei Bai;该综述把 entropy / self-certainty 归入内部 reward 与 data-efficient training,本篇提供 token-level entropy dynamics、局部干预和失效边界。综述对内部 reward reliability 的担忧可用本篇的 token selection、semantic diversity 与 reward-relevant exploration 指标进一步具体化。
  • 跨论文关系定位:记录 RLVR Entropy Dynamics 与 Exploration Control,连接 DAPO、DeepSeek-R1、verl、RLVR boundary、Spurious Rewards、ProRL/BroRL、RL compositionality 和 Schulman KL estimator。

Reference Intake Brief

Target

Reusable Elements

  1. Entropy-performance empirical curve: R=aexp(H)+bR=-a\exp(\mathcal H)+b
  2. Entropy dynamics formula: ΔHCov(logπ,Δz)\Delta\mathcal H\approx-\mathrm{Cov}(\log\pi,\Delta z);PG/NPG 下和 advantage covariance 相连。
  3. Engineering recipe: token-wise covariance proxy + Clip-Cov / KL-Cov。
  4. Diagnostics checklist: entropy、covariance distribution、selected token profile、pass@kk、response length、KL/K3/chi2。

Risks

  • Copyright/over-copying: 本笔记只保留少量公式、表格数值和本地分析,不复制论文大段正文。
  • Unsourced or unverifiable claims: 作者身份和方法细节来自 arXiv、TeX source、项目 README、verl docs、作者主页和 OpenReview;对 “widely recognized” 采用谨慎表述。
  • Tone/brand mismatch: 中文技术分析使用直接解释表达,避免把 arXiv preprint 包装为已定论。
  • Safety/compliance issues: 本文为训练机制分析,不包含可直接滥用的攻击流程。
  • Overlap with existing assets: 与 DAPO、verl、RLVR boundary、Spurious Rewards 和 ProRL/BroRL 关系强,但本篇以 entropy dynamics 作为独立机制节点。

Skipped

Material Reason
全部 17 位作者的额外个人主页信息 本篇重点是论文机制分析;核心作者与通讯作者已有作者档案,其他作者保留与论文关系相关的机构信息。
复现代码逐行审计 本轮只阅读 README / TeX / verl recipe;若后续落地实现,需要单独审查 loss implementation。

Recommendation

Decision: merge

Why: 这篇论文是 RLVR entropy collapse / exploration control 的重要近期节点,已被 verl recipe 和 PRIME-RL 工程生态吸收;虽然理论泛化和 formal acceptance 仍需谨慎,但它能显著丰富本地 archive 中 DAPO、DeepSeek-R1、RLVR boundary、Spurious Rewards、ProRL/BroRL 和 KL diagnostics 之间的机制图谱。