2505.22617-entropy-mechanism-rl-reasoning-language-models
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
这篇论文把 reasoning LLM 的 RLVR 训练瓶颈重新表述为 policy entropy 的消耗过程:在没有 entropy / KL 干预时,reward 提升和 entropy 下降之间可以用负指数关系拟合;进一步用 softmax policy 的 entropy dynamics 说明,高概率且高 advantage 的 token update 会持续降低 entropy;工程上提出 Clip-Cov / KL-Cov,只干预极少数高 covariance token,以维持探索并提升 Qwen2.5 数学 RL 结果。
Source
- Title: The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
- arXiv: https://arxiv.org/abs/2505.22617
- PDF: https://arxiv.org/pdf/2505.22617
- Code/Project: https://github.com/PRIME-RL/Entropy-Mechanism-of-RL
- verl Recipe: https://verl.readthedocs.io/en/v0.5.x/algo/entropy.html
- OpenReview: https://openreview.net/forum?id=vXoksdcfqC
- OpenReview API note crawl: https://api2.openreview.net/notes?forum=vXoksdcfqC&details=replyCount,directReplies,replies
- Authors: Ganqu Cui, Yuchen Zhang, Jiacheng Chen, Lifan Yuan, Zhi Wang, Yuxin Zuo, Haozhan Li, Yuchen Fan, Huayu Chen, Weize Chen, Zhiyuan Liu, Hao Peng, Lei Bai, Wanli Ouyang, Yu Cheng, Bowen Zhou, Ning Ding
- Submitted: 2025-05-28
- Current version read: arXiv v1, submitted 2025-05-28; OpenReview page shows ICLR 2026 withdrawn submission, modified 2025-12-04.
- Subjects: Machine Learning (cs.LG), Artificial Intelligence (cs.AI), Computation and Language (cs.CL)
作者与关系
- Ganqu Cui: Shanghai AI Laboratory.
- Yuchen Zhang: Shanghai AI Laboratory / Peking University.
- Jiacheng Chen: Shanghai AI Laboratory.
- Lifan Yuan: UIUC.
- Zhi Wang: Nanjing University.
- Yuxin Zuo: Tsinghua University.
- Haozhan Li: Tsinghua University.
- Yuchen Fan: Shanghai AI Laboratory.
- Huayu Chen: Tsinghua University.
- Weize Chen: Tsinghua University.
- Zhiyuan Liu: Tsinghua University.
- Hao Peng: UIUC.
- Lei Bai: Shanghai AI Laboratory.
- Wanli Ouyang: Shanghai AI Laboratory.
- Yu Cheng: Shanghai AI Laboratory / CUHK.
- Bowen Zhou: Shanghai AI Laboratory / Tsinghua University.
- Ning Ding: Tsinghua University / Shanghai AI Laboratory.
阅读目标与判断边界
本笔记关注:
- 论文如何定义和测量 RLVR 中的 policy entropy,以及它和 validation performance 的经验关系。
- 论文的 covariance 推导到底说明了什么,哪些地方依赖 tabular softmax / first-order approximation / policy gradient 假设。
- Clip-Cov / KL-Cov 相比 entropy bonus、reference KL 和 DAPO Clip-Higher 的实际差异。
- 本篇在当前 RL reasoning 社区中的可信度:工程采纳强,但理论与泛化仍需独立复验。
判断边界:
- 论文在 OpenReview 上显示为 ICLR 2026 withdrawn submission,因此不能当作已完成顶会审稿背书的定论。
- 实验主效果集中在 Qwen2.5-7B / 32B、DAPO-MATH、数学 benchmarks;跨模型、跨 reward、跨 agentic environment 的结论需要复验。
- 理论推导使用 tabular softmax policy 和一阶近似,本地分析只把它当作解释 token update 方向的机制模型。
论文脉络
1. 研究问题、背景和价值
Reasoning LLM 的 RLVR 训练通常使用 verifiable reward:数学答案是否匹配、代码是否通过测试、任务是否满足自动验证条件。DeepSeek-R1、DAPO、ProRL、BroRL 等工作说明这条路线能显著提升 math/code reasoning,但也暴露出几个共同问题:训练早期收益很快出现,后续 steps 的边际收益下降;模型 response 变长,policy 分布更集中;同一套 recipe 对 base model、数据难度、采样温度和动态采样非常敏感。
这篇论文抓住其中一个变量:policy entropy。作者把 entropy 视为当前 policy 在训练 prompts 上继续探索新路径的能力。若 entropy 很快接近 0,模型会把概率质量集中到已经被 reward 强化过的路径上,后续 rollout 很难探索到新的正确解法。这个视角有工程价值,因为它给 RL 训练提供了比单看 reward 更早、更细的诊断信号:如果 reward 还在升,但 entropy 已经被快速消耗,后续训练可能进入低收益区。
论文的价值主要在三点:
- 给出一个经验规律,把 validation performance 和 policy entropy 拟合到
。 - 给出一个 softmax policy 下的 entropy dynamics 解释,把 entropy 下降和
、logit update / advantage 的 covariance 联系起来。 - 用 covariance 指标定位极少数高影响 token,并提出 Clip-Cov / KL-Cov 作为低改动的 entropy control recipe。
2. 已有解决方案与不足
已有 RL / RLHF 中常见的探索控制手段包括 entropy bonus、reference KL penalty、PPO clipping、TRPO-style trust region,以及 DAPO 中的 Clip-Higher。它们确实都在某种意义上控制 policy update 或分布漂移,但在 reasoning LLM 的 RLVR 场景中存在不同不足。
Entropy bonus 会直接鼓励分布更均匀,但论文实验显示它对系数非常敏感:小系数几乎不改变 entropy,大系数可能导致 entropy explosion,中间系数能稳定 entropy 时不一定带来更好 performance。Reference KL penalty 可以把 policy 拉回 reference model,从而维持一定 entropy,但这也可能限制模型向 rewarded reasoning path 移动,论文实验中 performance 反而下降。
DAPO 的 Clip-Higher 提高 PPO ratio 上界,允许正 advantage token 获得更大更新,能改善 long-CoT RL。论文把它解释为间接增加低概率、高 advantage token 的更新机会,也就是鼓励一部分低 covariance token 参与学习。它的问题是粒度较粗:阈值只看 ratio 和 advantage,不直接看某个 token 对 entropy dynamics 的贡献。
这篇论文的切入点是:如果 entropy 下降来自少数高 covariance token 对 policy 的集中推动,那么更直接的控制方式是定位这些 token,再只对它们约束 update。
3. 作者可能的思考路径
从已有背景看,作者可能先观察到一个训练曲线现象:Qwen / Mistral / LLaMA / DeepSeek-Math 等模型在 math/code RL 中,早期 reward 快速上升,entropy 快速下降,后续训练变慢。这个现象和 RL 经典 exploitation-exploration trade-off 对应,但 LLM 训练里更强,因为每个 token 的 softmax 分布会把高 reward 路径迅速变成高概率路径。
接着,作者会自然尝试已有控制手段:加 entropy loss、加 reference KL、调 PPO clip。若这些手段出现系数敏感或 performance 损失,就需要问一个更局部的问题:到底哪些 token update 在消耗 entropy?
softmax policy 给了一个分析入口。entropy 是
由此,方法设计变得直接:先计算 token-wise covariance proxy,找出极少数高 covariance token,然后限制它们的梯度或给它们加 KL penalty。
4. 核心假设或切入点
论文的核心假设可以拆成三层:
- RLVR 中 policy entropy 是限制后续 exploration 和 performance scaling 的关键状态变量。
- 在 softmax policy 下,entropy 的 step-wise change 可以通过
和 logit update / advantage 的 covariance 解释。 - 高 covariance token 具有强长尾分布,干预极少数 token 就能改变整体 entropy dynamics,同时保留多数 token 的正常 policy gradient 学习。
5. 方法 / 系统 / 理论框架
5.1 Policy entropy 定义
论文测量的是训练数据上的平均 token-level policy entropy:
它关心模型在当前 prompts 和 prefixes 下对下一 token 的不确定性。这个定义是 token-level 的,和 sequence-level response diversity、pass@
5.2 经验律:performance 与 entropy 的指数关系
作者在 4 个模型家族、11 个 base models、math/code verifiable tasks 和多个 RL algorithms 上观察到:
其中
解释为给定 policy model 和训练数据下的可预测 ceiling。
关键实验结论:
- 2400 gradient steps 的 11 个 RL runs 中,前 200 steps 消耗 73% entropy,同时获得 76% performance gain。
- 前 800 steps 消耗 94% entropy,同时获得超过 93% performance gain。
- 只用 Qwen2.5 family 前 36 training steps 拟合
,预测后续 200 steps,math / code 的平均 RMSE 为 0.9% / 1.2%,最终性能 RMSE 为 0.5% / 1.9%。 - 在 Qwen2.5-7B 上比较 GRPO、RLOO、PRIME,拟合曲线近似不随算法变化,作者据此认为
反映 model/data 的内在属性。
这个经验律是论文最有传播力的主张,也是最需要复验的部分。它在作者实验范围内很整齐,但论文自己也承认,使用不同 policy model 或 off-policy data 的工作观察到过不同 entropy patterns。
5.3 Softmax policy 的 entropy dynamics
对 softmax policy:
在 tabular softmax 和一阶近似下,论文给出:
这个式子的直觉是:如果某个已经高概率的 action 在更新后 logit 继续上升,分布会变得更集中,entropy 下降。若低概率 action 获得更新,分布可能变平,entropy 上升。
在 vanilla policy gradient 下,论文推导:
代回 entropy change:
在 natural policy gradient 下:
这三个式子给了一个统一解释:当当前 policy 的高概率动作同时具有高 advantage,covariance 为正,entropy 下降;当 rare action 获得高 advantage,covariance 下降甚至为负,entropy 下降速度减慢或转为上升。
5.4 Empirical verification
论文用 Qwen2.5-7B 做 on-policy GRPO without PPO surrogate loss,在 bandit setting 中把 prompt 当 state、整个 response 当 action。response log probability 做长度归一化:
作者记录 covariance 和
5.5 Token-wise covariance proxy
实际算法不能对所有 state-action 做精确全分布 covariance,于是论文用 batch 内 token-wise centered cross-product:
其中
论文报告 Qwen2.5-7B 第一步中 covariance 呈强长尾:
| Group | Mean covariance |
|---|---|
| Top 0.02% | 5.654 |
| Top 0.2% | 3.112 |
| Top 2% | 1.385 |
| Top 20% | 0.351 |
| Top 50% | 0.152 |
| All | 0.003 |
这个表是方法成立的关键动机:总体平均很小,但极少数 token 的 covariance 极大。只要这些 token 反复把高概率、高 advantage 方向推得更尖,整体 entropy curve 就会被明显改变。
5.6 Clip-Cov
Clip-Cov 的动作是从高 covariance 区间中随机选择
实验中
5.7 KL-Cov
KL-Cov 选择 covariance top-
论文公式写作:
其中 abs(log_prob - old_log_prob),实现层和严格分布级 KL 存在差异;阅读时应把 KL-Cov 理解为“对高 covariance token 增加相对 old policy 的局部更新阻尼”。
实验中
6. 结论链条
论文的论证链条可以压缩为:
- RLVR 训练中,reward 上升与 entropy 下降高度同步,早期 steps 消耗掉大部分 entropy。
- 在作者实验范围内,
可以拟合 performance-entropy curve,并支持早期预测 late-stage performance。 - Softmax policy 的 entropy 一阶变化由
与 logit update 的 covariance 决定;在 PG / NPG 下,logit update 和 advantage 相关。 - 因此,高概率、高 advantage 的 token 会加速 entropy 下降;少数高 covariance token 可能主导 entropy collapse。
- 直接约束高 covariance token,比全局 entropy bonus 或 reference KL 更局部,也更少牺牲普通 token 的 reward learning。
- Clip-Cov / KL-Cov 在 Qwen2.5 数学 RL 上提升 average benchmark performance,并维持更高 policy entropy。
关键实验/定理
结果 1:Entropy collapse 与 performance saturation 同步出现
- 设置:4 个模型家族,11 个 base models,math/code verifiable tasks,GRPO / REINFORCE++ / PRIME 等 RL 训练。
- 指标:训练过程中的 policy entropy、validation performance、normalized entropy consumption 和 performance gain。
- 结果:前 200 / 2400 gradient steps 消耗 73% entropy,获得 76% performance gain;前 800 steps 消耗 94% entropy,获得超过 93% performance gain。
- 解读:在这些设置里,RL 的有效收益高度集中在 entropy 仍然充足的早期阶段;后续训练如果无法维持 exploration,更多 updates 可能只是在低 entropy 分布上重复强化。
结果 2:Performance-entropy curve 可用指数函数拟合
- 设置:对 math/code validation performance 和 policy entropy 做拟合。
- 指标:
的拟合效果;用前 36 training steps 预测后续 200 steps。 - 结果:Qwen2.5 family 上,math / code 平均预测 RMSE 为 0.9% / 1.2%,最终性能 RMSE 为 0.5% / 1.9%。
- 解读:这是非常强的经验观察,但还应视为 domain-specific scaling regularity。不同 rollout policy、off-policy data、reward shaping、agent environment 可能改变曲线形态。
定理 1:Softmax policy 的 entropy change 由 covariance 决定
- 设置:tabular softmax policy,一阶 Taylor approximation。
- 结论:
- 解读:这个定理还不能覆盖深度 Transformer 的完整训练过程,但它抓住了 softmax 输出层分布变尖的直接机制。
定理 2:PG / NPG 下 covariance 与 advantage 相连
- 设置:tabular softmax policy,vanilla policy gradient 或 natural policy gradient。
- 结果:
- 解读:高概率且高 advantage 的 action 会降低 entropy;rare action 的高 advantage 更可能维持或提升 entropy。这个结论给 Clip-Cov / KL-Cov 的 token selection 提供方向。
结果 3:Naive entropy regularization 与 reference KL 不稳定
- 设置:在 policy loss 中加入 entropy loss
,或 reference KL 。 - 指标:policy entropy、validation accuracy。
- 结果:entropy loss 对系数敏感;reference KL 能稳定 entropy,但在论文实验中降低 performance。
- 解读:全局提高 entropy 可能让模型在不该随机的地方随机;全局 reference KL 也可能限制 valid policy improvement。
结果 4:Clip-Cov / KL-Cov 提升 Qwen2.5 math RL
- 设置:Qwen2.5-7B / 32B,DAPO-MATH 训练;每个 rollout step 采样 256 prompts,每 prompt 8 responses,temperature 1;随后做 8 policy updates;过滤全对/全错 prompts;max generation length 8192。
- 评测:MATH500、AIME 2024、AIME 2025、AMC、OMNI-MATH、OlympiadBench、Minerva;AIME/AMC 用 temperature 0.6,其余 greedy。
- 结果:
| Model | GRPO avg | Clip-Higher avg | Clip-Cov avg | KL-Cov avg |
|---|---|---|---|---|
| Qwen2.5-7B | 38.6 | 38.8 | 40.4 | 40.6 |
| Qwen2.5-32B | 45.8 | 47.2 | 50.3 | 52.2 |
- 关键点:32B 上 KL-Cov 将 AIME24 从 21.8 提到 36.8,将 AIME25 从 16.2 提到 30.8;论文称相对 GRPO 分别提升 15.0% 和 14.6%。
- 解读:方法在 32B 上收益更明显,可能因为更强 base model 有更多潜在低概率 reasoning path 可被探索。这个解释需要和 response length、sampling temperature、有效 prompt 分布一起复验。
证据链强度评估
强证据
- Entropy collapse 现象本身证据强。论文覆盖多个模型家族、模型尺度、math/code tasks 和不同 RL algorithms;这个现象也和 DAPO、ProRL、BroRL、RLVR boundary 等工作中的训练曲线直觉一致。
- Softmax entropy dynamics 的一阶推导有明确数学结构。虽然假设简化,但公式能解释为什么高概率、高 advantage token 会让 policy 变尖。
- Clip-Cov / KL-Cov 作为工程干预证据较清楚。它们只改少量 loss 逻辑,在 Qwen2.5 数学 RL 上有 benchmark gain,并已进入 PRIME-RL repo / verl recipe 生态。
中等强度证据
的经验律很整齐,但当前主要来自作者控制的实验集合。它可以作为训练早停、预算预测和 anomaly detection 的候选工具,尚不宜上升为普遍 law。 - “算法无关、model/data 决定 coefficients” 的说法有启发性,但算法范围主要是 GRPO/RLOO/PRIME 这类相近 RLVR setting。若引入 off-policy data、adaptive environment、self-play、teacher distillation 或 process reward,曲线可能变化。
- 高 covariance token 主导 entropy collapse 的解释有 batch 统计支持,但需要更多 ablation 证明这些 token 的因果作用,同时排除长度、位置、token type、difficulty、format token 等共同变化因素。
需要谨慎的推论
- “entropy exhaustion 决定 RL ceiling”容易过强。更稳的表述是:在当前 on-policy RLVR setting 中,entropy 下降可以预测一类训练曲线的 performance plateau;改变数据、environment、sampling、teacher signal 或 reward 形式可能改变 ceiling。
- 更高 entropy 和更好 exploration 之间不总是同义。无约束的 entropy bonus 已经显示可能损害 performance。有效 entropy 应该指向 reward-relevant low-probability paths,减少随机生成无效 token。
- KL-Cov 的 penalty 形式需要核对实际实现。论文公式、pseudo-code 和 verl 实现可能存在近似差异,复现实验时要明确是 distribution KL、sample-level KL、absolute log-ratio,还是 PPO-style KL estimator。
- OpenReview withdrawn status 和 2/2/4/6 的 official review ratings 削弱正式学术背书。当前更适合作为高影响力 arXiv + 工程 recipe,尚不能作为稳定定论。
OpenReview / 审稿意见吸收
- Venue status: 当前档案未记录公开 peer-review 状态。
- Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
- Ratings / confidence: 无公开评分可用于校准。
- Reviewer consensus: 暂无。
- Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
- Author response: 暂无公开 rebuttal 记录。
- 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。
本地讨论补充
1. 讨论收敛点
- 这篇论文目前在 RL for reasoning 小圈子里影响力很高,Semantic Scholar 显示约 300+ citations,GitHub repo 有数百 stars,verl 文档也有独立 recipe。它已经进入工程社区视野。
- 它还不能被表述为“广泛公认的定论”,因为 OpenReview 页面显示 withdrawn submission,且核心经验律与方法泛化性需要更多独立复验。
2. 修正后的理解
- 本篇最稳的贡献是把 RLVR 训练过程拆成“reward gain 和 entropy consumption”的共同轨迹,并指出 high-probability positive-advantage token update 会让 policy 快速集中。
- Clip-Cov / KL-Cov 的本质是局部 trust-region:只对最可能继续消耗 entropy 的 token 增加阻尼,保留多数 token 的 reward learning。
- 这和 DAPO Clip-Higher 的关系很近:Clip-Higher 给低概率正 advantage token 更大更新空间,论文则直接用 covariance 选 token。
3. OpenReview 审稿意见吸收
OpenReview public API 显示,本篇 ICLR 2026 forum 公开部分包含 4 条 official review、1 条 withdrawal 和原始 submission;没有公开 author rebuttal、meta-review 或 decision discussion。4 个 official review 的 ratings 分别为 2、2、4、6,confidence 为 3、4、3、4;页面状态为 withdrawn submission,修改时间 2025-12-04。
审稿人认可的部分集中在三点:
- 问题诊断有价值:policy entropy collapse 与 performance saturation 同步出现,是 reasoning RL 训练里值得单独记录的状态变量。
- covariance 视角有一定新意:把 entropy change 写成 log-probability 与 logit update / advantage 的 covariance,给 high-probability positive-advantage token 为什么会让分布变尖提供了可计算解释。
- Clip-Cov / KL-Cov 是低改动工程 recipe:只对高 covariance token 做 clipping 或 KL penalty,工程上容易加入 GRPO / PPO-like loss。
主要批评可以合并成六类:
- 经验律适用范围过窄。强负评认为
主要在无 entropy / KL regularization 的设置中成立,而实际 RL fine-tuning 常配合 PPO clipping、entropy bonus、reference KL 或 trust-region 约束;因此这个曲线更像 descriptive fit,支撑不了普遍机制。 - Baseline 和统计证据不足。评审明确要求 seed 数量、standard error / confidence interval,以及和 well-tuned entropy bonus、reference KL、PPO、NPG、Hindsight Merging 等 entropy-control 方法的正面对照。当前表格只说明 Clip-Cov / KL-Cov 在作者设置里优于 GRPO / Clip-Higher,尚不足以证明方法稳定优于已有探索控制方案。
- 理论假设跨度大。tabular softmax、一阶近似、PG/NPG 推导和 Transformer function approximation 之间存在明显距离;另有评审指出 state distribution 从
到 的变化被忽略,Agarwal et al. 相关常数和有限/无限 horizon 转换也需要补齐。 - Covariance 粒度未闭合。理论使用 action-level expectation,经验验证用 sequence-level covariance,算法实现用 token-level proxy。三者方向一致,但论文没有充分解释 token-level top-
proxy 为什么能稳定控制 sequence-level entropy dynamics。 - 新颖性表述偏强。从经典 RL 理论看,确定性最优策略、entropy 下降、NPG / entropy regularization 的平滑作用都已有背景。论文更像把这些思想迁移到 RLVR token-level 训练日志中,并提出一个局部化实现。
- 超参数和实现稳定性需要复验。
在 到 量级,Figure 6 也显示不同选择会显著改变 entropy curve;random select 是否引入训练方差没有充分报告。
吸收审稿意见后的评价:
- 这篇论文的传播价值来自“问题命名 + 可记录指标 + 简单 recipe + verl/PRIME-RL 落地”,学术审稿层面的认可度明显弱于社区热度。
- 最稳妥的定位是 RLVR entropy diagnostics paper。它适合作为训练日志设计和 ablation checklist 的来源,也适合作为 Clip-Cov / KL-Cov recipe 的起点。
- 经验律
应降级为作者实验范围内的 early-stage curve fitting 工具。使用时需要注明:on-policy RLVR、无强 entropy/KL 干预、给定 model/data family、给定 decoding/eval protocol。 - Covariance 推导适合作为局部机制 intuition。把它解释为 Transformer RL 训练的完整理论会超出现有证据;更合理的写法是“softmax 输出层上的一阶解释 + batch token proxy”。
- Clip-Cov / KL-Cov 仍有工程价值。它们提供了比全局 entropy bonus 更局部的 update damping,但后续复验必须补 well-tuned baselines、多个 seed、误差条、选中 token profile、response length、pass@
和 semantic diversity。
4. 后续复验指标
policy_entropy/token_entropy: batch-level、position-level、prompt-level 分桶。response_entropy/semantic_diversity: 避免只看 token-level entropy。covariance_distribution: top 0.02%、0.2%、2% 与 all mean。selected_token_profile: Clip-Cov / KL-Cov 选中的 token 类型、位置、是否 format token、是否 high-frequency token。response_length: 区分 entropy control 带来的 exploration 与单纯 length 增长。pass@k / coverage: 判断是否扩大可解路径集合。clip_fraction / KL / K3 / chi2: 和 Schulman KL estimator 的 policy drift 诊断结合。random / format / incorrect reward baselines: 和 2506.10947 对照,排除 prior amplification。
主要启发
- RLVR 训练日志里应把 entropy 当作一等指标。只看 reward、accuracy、KL 和 response length 容易漏掉 exploration capacity 是否已经耗尽。
- “维持 entropy”要局部化。全局 entropy bonus 和 reference KL 会影响所有 token;高 covariance token selection 提供更精确的 intervention handle。
- 对 long-CoT RL,reward gain 应该和 entropy consumption 一起看。一个训练 run 如果早期已经消耗 90% entropy,继续加 steps 的收益可能很有限;更有价值的动作可能是换数据、调采样、增加 rollout width、改变 reward 或引入 environment。
- 这篇和 2504.13837 的 pass@
观点互补:如果 RL 只是把 base model 已有低概率正确路径提升为高概率,entropy collapse 就是这个概率重排过程的可观测结果之一。 - 这篇和 2505.24864 / 2510.01180 的关系是正向互补:ProRL/BroRL 试图延长或拓宽 RL exploration,本篇提供 entropy-level 诊断和 token-level 控制手段。
局限
- 理论假设简化。tabular softmax、一阶 approximation、PG/NPG logit update 无法覆盖深层 Transformer 参数共享、optimizer state、Adam/Muon update、RMSNorm、attention/MLP 非线性和 sequence-level credit assignment。
- 实验主效果集中在 Qwen2.5 + DAPO-MATH + math benchmarks。模型家族、数据难度、reward sparsity、rollout temperature、dynamic sampling 和 eval decoding 的交互仍需更细 ablation。
- Entropy metric 是 token-level 平均值,不能直接代表 solution diversity。模型可以通过长 response、格式变化或局部 token 随机性提高 entropy,却不增加有效 reasoning paths。
- Clip-Cov / KL-Cov 的 token selection 可能和 response length、token position、format token、advantage normalization 相关。论文没有充分展示选中 token 的语义分布。
- OpenReview withdrawn status 说明它尚未获得稳定顶会录用背书。工程采用提高了实践参考价值,但不能替代独立复现。
- OpenReview official reviews 集中指出缺少 seed / error bar、PPO / entropy bonus / NPG / existing entropy-control baselines,以及 tabular theory 到 Transformer function approximation 的桥接。这些问题会影响“机制发现”和“算法改进”两类主张的强度。
跨论文关系
- 与 2501.12948 DeepSeek-R1:R1 展示 verifiable reward + GRPO 可以激发 long-CoT reasoning,本篇解释这类 RL 为什么容易在早期快速集中分布并进入 entropy-limited plateau。
- 与 2503.14476 DAPO:DAPO 的 Clip-Higher、Dynamic Sampling 和 token-level loss 是本篇实验和方法比较的直接背景;本篇使用 DAPO-MATH,并把 Clip-Higher 解释为一种间接 entropy control。
- 与 verl 官方仓库:本篇的 Clip-Cov / KL-Cov 已进入 verl recipe;verl 中的 KL/K3/chi2、rollout correction 和 loss mode 适合承载本篇指标。
- 与 2504.13837 RLVR boundary:后者关注 RL 是否扩展 base model reasoning boundary;本篇提供 entropy collapse 和 high-covariance token update 的机制解释。
- 与 2506.10947 Spurious Rewards:Spurious Rewards 提醒 RLVR gains 可能来自 prior amplification 和 GRPO clipping bias;本篇的 entropy collapse 可被理解为 prior amplification 的分布动力学表现之一,复验时应加入 random / format reward baselines。
- 与 2505.24864 ProRL 和 2510.01180 BroRL:三者共同关注 exploration 如何延长或拓宽。本篇从 entropy control 入手,ProRL 从 prolonged steps / KL reset 入手,BroRL 从 rollout width 入手。
- 与 2020-03-07 Schulman KL:KL-Cov、reference KL 和 policy drift 诊断都需要清晰区分可微 KL loss、sample-level KL penalty 和 Monte Carlo KL estimator。
- 与 2606.12370 Bebop:Bebop 题目中的 entropy bound 关注 MTP rejection sampling acceptance / TV distance,本篇关注 policy entropy collapse;二者都说明 rollout distribution 的 entropy 会成为 RL scaling 的系统变量。
- 与 2604.17312 Data-Scarcity RL Survey:两篇共享作者 Lei Bai;该综述把 entropy / self-certainty 归入内部 reward 与 data-efficient training,本篇提供 token-level entropy dynamics、局部干预和失效边界。综述对内部 reward reliability 的担忧可用本篇的 token selection、semantic diversity 与 reward-relevant exploration 指标进一步具体化。
- 跨论文关系定位:记录 RLVR Entropy Dynamics 与 Exploration Control,连接 DAPO、DeepSeek-R1、verl、RLVR boundary、Spurious Rewards、ProRL/BroRL、RL compositionality 和 Schulman KL estimator。
Reference Intake Brief
Target
- Intended target system: 新增论文笔记 / RLVR entropy dynamics 专题节点。
- Existing related assets:
content/utility/papers-index.md、2503.14476、2501.12948、2504.13837、2506.10947、2020-03-07 Schulman KL。 - Proposed form: 新建独立 Markdown 文档,更新索引与核心作者档案。
Reusable Elements
- Entropy-performance empirical curve:
。 - Entropy dynamics formula:
;PG/NPG 下和 advantage covariance 相连。 - Engineering recipe: token-wise covariance proxy + Clip-Cov / KL-Cov。
- Diagnostics checklist: entropy、covariance distribution、selected token profile、pass@
、response length、KL/K3/chi2。
Risks
- Copyright/over-copying: 本笔记只保留少量公式、表格数值和本地分析,不复制论文大段正文。
- Unsourced or unverifiable claims: 作者身份和方法细节来自 arXiv、TeX source、项目 README、verl docs、作者主页和 OpenReview;对 “widely recognized” 采用谨慎表述。
- Tone/brand mismatch: 中文技术分析使用直接解释表达,避免把 arXiv preprint 包装为已定论。
- Safety/compliance issues: 本文为训练机制分析,不包含可直接滥用的攻击流程。
- Overlap with existing assets: 与 DAPO、verl、RLVR boundary、Spurious Rewards 和 ProRL/BroRL 关系强,但本篇以 entropy dynamics 作为独立机制节点。
Skipped
| Material | Reason |
|---|---|
| 全部 17 位作者的额外个人主页信息 | 本篇重点是论文机制分析;核心作者与通讯作者已有作者档案,其他作者保留与论文关系相关的机构信息。 |
| 复现代码逐行审计 | 本轮只阅读 README / TeX / verl recipe;若后续落地实现,需要单独审查 loss implementation。 |
Recommendation
Decision: merge
Why: 这篇论文是 RLVR entropy collapse / exploration control 的重要近期节点,已被 verl recipe 和 PRIME-RL 工程生态吸收;虽然理论泛化和 formal acceptance 仍需谨慎,但它能显著丰富本地 archive 中 DAPO、DeepSeek-R1、RLVR boundary、Spurious Rewards、ProRL/BroRL 和 KL diagnostics 之间的机制图谱。