2602.02710-maximum-likelihood-reinforcement-learning
Maximum Likelihood Reinforcement Learning
MaxRL 把 binary outcome RLVR 改写为对成功 rollout 隐式 likelihood 的近似最大化:标准 RL 只优化 pass@1 的一阶项,MaxRL 根据一组 rollout 的总数和其中的成功样本数做归一化,得到对有限 rollout 数截断 maximum likelihood objective 的无偏 policy-gradient estimator;实验显示它在 ImageNet toy setting、maze、GSM8K 和 Qwen3 math RL 中更好保留 pass@k 覆盖,但结论主要建立在二值可验证奖励和 GRPO/RLOO 系 baseline 上。
Source
- Title: Maximum Likelihood Reinforcement Learning
- arXiv: https://arxiv.org/abs/2602.02710
- PDF: https://arxiv.org/pdf/2602.02710
- Project: https://zanette-labs.github.io/MaxRL/
- Code: https://github.com/tajwarfahim/maxrl
- OpenReview / Review page: https://openreview.net/submissions?venue=ICLR.cc%2F2026%2FWorkshop%2FSPOT
- Authors: Fahim Tajwar, Guanning Zeng, Yueer Zhou, Yuda Song, Daman Arora, Yiding Jiang, Jeff Schneider, Ruslan Salakhutdinov, Haiwen Feng, Andrea Zanette
- Submitted: 2026-02-02
- Current version read: arXiv v1
- Subjects: Machine Learning (cs.LG)
- Venue status: 项目页和代码页标注 ICML 2026 Oral Presentation;SPOT OpenReview 列表标注 ICLR 2026 Workshop SPOT, published 2026-03-03, last modified 2026-04-16;项目页标注 SPOT Best Paper Award。当前检索未看到 PMLR 正式页面。
作者与关系
- Fahim Tajwar: Carnegie Mellon University;历史机构:Stanford University。
- Guanning Zeng: Tsinghua University;历史机构:Carnegie Mellon University。
- Yueer Zhou: Zhejiang University;历史机构:Stanford University, Carnegie Mellon University, University of Southern California。
- Yuda Song: Carnegie Mellon University;历史机构:FAIR Paris, Amazon NYC, Microsoft Research NYC, University of California San Diego。
- Daman Arora: Carnegie Mellon University;历史机构:Microsoft Research India, Indian Institute of Technology Delhi。
- Yiding Jiang: Carnegie Mellon University;历史机构:Google DeepMind, Google Research, Meta AI Research, Cerebras Systems, University of California Berkeley。
- Jeff Schneider: Carnegie Mellon University。
- Ruslan Salakhutdinov: Carnegie Mellon University。
- Haiwen Feng: UC Berkeley, Impossible, Inc.;历史机构:Max Planck Institute for Intelligent Systems, Adobe, University of Tubingen。
- Andrea Zanette: Carnegie Mellon University;历史机构:UC Berkeley, Stanford University。
机构口径说明:arXiv v1 TeX source 将 Guanning Zeng 标为 Tsinghua University,将 Yueer Zhou 标为 Zhejiang University;项目页将 Guanning Zeng 标为 CMU,将 Yueer Zhou 标为 Stanford University。本文档作者列表按 arXiv v1 读取口径记录,并在历史机构里保留后续主页或项目页可核验的变化。
关系结构:
- Fahim Tajwar 和 Guanning Zeng 为 equal contribution;项目页列出 Fahim Tajwar、Guanning Zeng、Andrea Zanette 为 corresponding authors。
- CMU 是核心协作中心:Andrea Zanette 连接 ECE/MLD reasoning RL 线,Fahim Tajwar、Daman Arora、Yuda Song 与 Zanette 组或 close collaborators 关系紧密;Fahim Tajwar 由 Ruslan Salakhutdinov 和 Jeff Schneider 共同指导。
- Tsinghua / Zhejiang / Stanford / UC Berkeley / Impossible 形成跨机构桥接:Guanning Zeng 从 Tsinghua 到 CMU PhD,Yueer Zhou 从 ZJU 与 CMU 协作并进入 Stanford MSCS 线索,Haiwen Feng 连接 Berkeley 视觉/世界模型和 Impossible。
- 当前已归档论文中未发现直接作者重叠;主题上与 2504.13837 RLVR reasoning boundary、2510.01180 BroRL、2505.22617 Entropy Mechanism、2606.20008 VIMPO 和 2503.14476 DAPO 直接相连。
阅读目标与判断边界
本笔记关注:
- MaxRL 如何从 maximum likelihood 推导到可采样的 policy-gradient estimator。
- 它和 REINFORCE / RLOO / GRPO / BroRL 这类 rollout-based RLVR 方法的核心差异。
- 论文实验是否真的支持“更多 rollout compute 改善 objective 本身”这一主张。
判断边界:
- 论文设置主要是 binary outcome feedback。对连续 reward、偏好 reward、多轮 tool-use agent、off-policy PPO 风格训练仍属未来工作。
- 大规模 LLM 实验主对照是 GRPO,未系统纳入 DAPO、Clip-Higher、Dynamic Sampling、ProRL/BroRL tuned recipe。
- 项目页与代码页标注 ICML 2026 Oral;当前检索未看到 PMLR 正式页面,因此会议状态按项目页和作者主页记录。
- GSM8K 部分正文提到 GSM8K-Platinum non-overlapping test,表格标题使用 GSM8K,需要复验时核对数据划分。
论文脉络
1. 研究问题、背景和价值
RLVR 常见设置是:给输入
如果从 likelihood 角度看,理想目标是提高每个输入上至少采出正确轨迹的概率,并在低成功率输入上给足学习信号。标准 binary RL objective 写成:
它直接优化 pass rate。Maximum likelihood 则是:
两者差异在低
2. 已有解决方案与不足
REINFORCE / RLOO / GRPO 都能在二值奖励上做 policy gradient,但它们的目标通常仍接近
GRPO 的 group normalization 会给 hard prompts 一定额外权重,但其 population weight 近似:
这会同时放大
它的重点是低成功率样本。论文试图给出一个可以直接落地到 on-policy RL 的 estimator,而无需显式估计每个
3. 作者可能的思考路径
关键观察来自
对参数求导得到:
这给出一个很清晰的解释:ML 在优化所有
4. 核心假设或切入点
MaxRL 的截断目标定义为:
其梯度为:
当
5. 方法 / 系统 / 理论框架
Theorem 1 给出 ML gradient 的 conditional form:
也就是说,最大化成功 likelihood 的梯度可以看成只在成功轨迹上平均 score function。给
成功数为:
MaxRL estimator 是:
Theorem 2 证明:
这使得实现非常简单。REINFORCE 用
得到:
其中
若
6. 结论链条
论文的逻辑链条是:
- Binary correctness RL 隐含一个成功 likelihood
。 - 标准 RL 优化
,ML 优化 。 可展开为 梯度的 harmonic mixture。 - 对
条 rollout 的成功轨迹做 归一化,得到 截断目标的无偏 estimator。 - 因为低
输入被更强加权,MaxRL 应该改善 pass@k 覆盖,降低 fixed dataset 上的 distribution sharpening,并在 test-time scaling 下更省采样。
关键实验/定理
定理 1:ML gradient 的成功轨迹条件期望
- 设置:二值奖励、正确答案由
判定,模型分布为 。 - 结论:
等于成功轨迹条件分布下的 score function 平均。 - 解读:只要能采到成功轨迹,就可以不显式求和所有
,直接构造 likelihood gradient estimator。
定理 2: rollout estimator 对 MaxRL objective 无偏
- 设置:每个 prompt 采
条独立 rollout,成功数为 。 - 结论:
是 的无偏估计。 - 解读:rollout 数进入目标函数阶数。这个点是 MaxRL 相对普通 variance reduction 的主要理论贡献。
结果 1:ImageNet toy setting 验证近似 exact ML
- 设置:ImageNet / ResNet-50 classification,把预测正确记为
,错误记为 ;cross-entropy 可作为 exact ML 对照。 - Baseline:REINFORCE, GRPO, exact cross-entropy。
- 指标:训练动态、gradient norm、接近 exact ML 的程度。
- 结果:当 rollout 数足够大时,MaxRL 逐步接近 cross-entropy training;REINFORCE 在低初始 pass rate 下难以推进。
- 解读:这个实验把“MaxRL 逼近 ML”放在 exact ML 可计算的环境中验证,是理论到实现的 sanity check。
结果 2:17x17 Maze 的 infinite data regime
- 设置:程序生成 17x17 迷宫,训练集 1M unique mazes,eval 256 held-out mazes;约 3M decoder-only transformer,4 层、hidden 256、FFN 1024、4 attention heads、2 KV heads、RMSNorm、SiLU、RoPE、bf16;SFT 1500 steps 后进入 RL。
- Baseline:GRPO, RLOO, GRPO + entropy, PKPO, Differential Smoothing。
- 指标:pass@1, pass@128, pass@256。
- 结果:
| Method | pass@1 | pass@128 | pass@256 |
|---|---|---|---|
| GRPO | 43.6 | 49.0 | 49.6 |
| RLOO | 25.2 | 28.7 | 29.0 |
| GRPO + entropy | 47.2 | 53.4 | 54.0 |
| PKPO | 74.5 | 77.6 | 77.9 |
| Differential Smoothing | 50.0 | 57.8 | 58.7 |
| MaxRL | 84.4 | 92.0 | 94.3 |
- 解读:maze 是最有利于展示 pass@k coverage 的任务。MaxRL 同时提升 pass@1 和 large-k coverage,说明它在提升 top-1 的同时保留了更宽的可成功轨迹集合。
结果 3:GSM8K data-scarce regime
- 设置:SmolLM2-360M-Instruct,在 GSM8K 训练 1500 steps / up to 50 epochs;batch 256 prompts,每 prompt 128 generations,max response 2048,LR
,KL coeff 0,entropy coeff 0,8x Nvidia GH200。 - Baseline:GRPO, RLOO, GRPO + entropy, PKPO, Differential Smoothing。
- 指标:pass@1, pass@128, pass@1024。
- 结果:
| Method | pass@1 | pass@128 | pass@1024 |
|---|---|---|---|
| GRPO | 29.3 | 45.8 | 48.8 |
| RLOO | 27.5 | 44.6 | 48.5 |
| GRPO + entropy | 31.1 | 48.1 | 51.6 |
| PKPO | 30.7 | 67.2 | 75.9 |
| Differential Smoothing | 31.4 | 48.5 | 52.3 |
| MaxRL | 33.2 | 75.0 | 83.4 |
- 解读:GRPO/RLOO 更快推高 early pass@1,但 pass@k 容易下降;MaxRL 初期更慢,后期保持更多可成功轨迹,符合 likelihood weighting 对 hard prompts 的偏好。
结果 4:Qwen3-1.7B / 4B math RL 的 test-time scaling
- 设置:Qwen3-1.7B-Base 和 Qwen3-4B-Base,在 POLARIS-53K 约 50K math prompts 上训练;256 prompts/batch,16 rollouts/prompt,1000 RL steps;max prompt 1024,max response 4096,LR
,32x Nvidia H200。 - Baseline:主要对照 GRPO。
- Eval:AIME 2025, BeyondAIME, MATH-500, Minerva,并补充 AIME 2024, HMMT 2025, JEEBench。
- 结果:项目页给出 Qwen3-4B 上 7.9x-19.2x test-time scaling efficiency gains;正文总结给出 2.3x-19.2x 采样效率提升;附加 benchmark caption 提到最高 20.5x。
- Qwen3-4B majority voting 摘要:
| Method | AIME 2024 | AIME 2025 | BeyondAIME | MATH-500 | Minerva |
|---|---|---|---|---|---|
| Base | 23.3 | 23.3 | 7.0 | 69.8 | 18.8 |
| GRPO | 23.3 | 23.3 | 7.0 | 72.4 | 27.2 |
| MaxRL | 26.7 | 26.7 | 14.0 | 74.0 | 28.7 |
- 解读:MaxRL 的优势主要体现在同等或略高 pass@1 下,保留更好的 pass@k 和 majority-vote scaling。这与 2504.13837 对 pass@1 / pass@k 分离的诊断语言直接相接。
结果 5:训练动力学解释
- 设置:在 SmolLM、Qwen3-1.7B、Qwen3-4B 等 setting 中分析 prompt pass-rate bins、gradient norm、entropy 和成功覆盖。
- 结果:MaxRL 在接近
pass rate 的 hard prompts 上产生更大 gradient norm;训练过程中“至少一条 rollout 成功”的 prompts 比例更高;Qwen3 setting 中常见更长 CoT、更高 actor entropy 和更大 gradient norm。 - 解读:这支持“MaxRL 同时改变最终指标和训练信号分配”的观点。它把 compute 花在低成功率但仍可探索的输入上,与 BroRL 的 large-
exploration 形成互补。
证据链强度评估
强证据
- 两个定理把 binary reward 下的成功轨迹 likelihood 和
rollout estimator 连接起来,给出清晰目标函数。 - ImageNet toy setting 提供 exact ML 可计算的 sanity check,验证 MaxRL 可逼近 cross-entropy training。
- Maze、GSM8K 和 Qwen3 math RL 展示 pass@1 与 pass@k / majority scaling 的差异,贴合论文主张。
中等强度证据
- 训练动力学分析支持 MaxRL 更关注低成功率但可探索 prompt,但仍主要依赖作者实验设置。
- Qwen3 结果说明大模型 RLVR 中有潜在收益,主对照以 GRPO 为主,强 recipe 覆盖不足。
需要谨慎的推论
- 全错 prompt 在采不到成功样本时仍缺少学习信号,需要与更强 exploration 或 curriculum 结合。
- 二值 reward 假设限制了偏好、多目标、连续 reward 和多轮工具调用场景的直接适用性。
主要启发
- RLVR 可以被重写成对成功轨迹集合的条件 likelihood 估计,从而解释 pass@k 与 pass@1 的分离。
- rollout width 是目标函数的一部分,报告 MaxRL 时必须同时给出
、成功数 分布、decode 成本和 verifier 成本。 - 对 agentic 任务,MaxRL 的
归一化有吸引力,但需要额外处理状态缓存、工具延迟、partial rollout 和 off-policy correction。
局限
- 二值奖励假设很强。代码、数学、迷宫等可验证任务适合该推导;偏好建模、连续 reward、多目标 reward 需要新 estimator 或目标变换。
- 全错 prompt 没有更新。MaxRL 依赖采到至少一个成功轨迹,因此在极低
且 不足时仍会没有学习信号;这也是它和 BroRL / broadened exploration 需要结合的地方。 - 大规模 LLM 主对照主要是 GRPO。若要判断相对当前开源 recipe 的收益,需要加入 DAPO、Clip-Higher、Dynamic Sampling、ProRL/BroRL、entropy-control、OTB/VIMPO 等更强基线。
- 工程成本尚未充分拆解。论文报告设备与若干训练配置,但没有把 rollout width、decode length、vLLM/verifier cost、trainer update、wall-clock 和 test-time scaling cost 统一进一张成本表。
- 多轮 agent setting 尚未覆盖。tool-use agent 的 reward 可能在多轮后才出现,且 API/tool harness 会改变 trajectory distribution;MaxRL 的
归一化仍有吸引力,但需要处理 stateful KV cache、tool latency、partial rollout 和 off-policy correction。 - 机构和数据说明存在小口径差异。arXiv v1 source 与项目页对 Guanning Zeng、Yueer Zhou 的机构标注不同;GSM8K 部分的测试集命名也需要复验。
OpenReview / 审稿意见吸收
- Venue status: 当前档案未记录公开 peer-review 状态。
- Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
- Ratings / confidence: 无公开评分可用于校准。
- Reviewer consensus: 暂无。
- Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
- Author response: 暂无公开 rebuttal 记录。
- 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。
本地讨论补充
- MaxRL 可以作为“rollout width 改 objective”的理论节点,连接 BroRL 的 large-
exploration 与 RLVR boundary 论文中的 pass@k coverage 诊断。 - 若落地到 verl/slime,需要把每个 prompt 的
、 、pass-rate bin、advantage scale、entropy、response length、KL/K3、trainer/rollout logprob mismatch 一起记录。否则很难区分 MaxRL objective 改善、采样预算增加和 backend mismatch 带来的表观收益。 - 对 online agentic server,MaxRL 思路更适合先作为 prompt/trajectory difficulty weighting 的训练信号;若要直接作为 serving route scheduler,还要额外考虑 tool latency、KV cache locality 和多轮 continuation affinity。
跨论文关系
- 与 RLVR reasoning boundary 和 BroRL:三者都把 pass@
coverage 与 rollout width 纳入分析;MaxRL 进一步说明采样宽度 会改变成功轨迹 likelihood objective 的阶数与权重。 - 与 DAPO 和 verl 官方仓库:DAPO 提供 strong long-CoT recipe,verl 提供 advantage estimator 和 rollout metrics 的实现位置,是复验 MaxRL 时需要采用的算法与系统基线。
- 与 VIMPO 和 OTB:三者都在 outcome-only reward 下重分配学习信号;VIMPO 构造 token-level implicit value / advantage,OTB 近似 token-level variance-minimizing baseline,MaxRL 调整 prompt/trajectory-level success likelihood weighting。
- 与 Entropy Mechanism:MaxRL 的 success-count normalization 与 rollout width 会改变样本权重,Entropy Mechanism 提供监测 entropy collapse 和 token-level covariance 的诊断轴。
Reference Intake Brief
| Reference | 在本文中的作用 | 本地处理 |
|---|---|---|
| 2504.13837 RLVR reasoning boundary | 提供 pass@1 / pass@k / coverage set 诊断语言,用来判断 RLVR 是否扩展可解问题集合。 | 已归档;MaxRL 是该争论中的 likelihood-objective 正向节点。 |
| 2510.01180 BroRL | 同样把 rollout width 视为 scaling dimension;BroRL 强调更大 |
已归档;MaxRL 给出 |
| 2503.14476 DAPO | 提供当前 long-CoT GRPO / Dynamic Sampling / token-level loss 的开源 recipe 背景。 | 已归档;后续复验 MaxRL 应纳入 DAPO-style strong baseline。 |
| 2505.22617 Entropy Mechanism | 解释 RLVR 中 entropy collapse 和 token-level covariance;可用于分析 MaxRL 为什么保留更多 pass@k。 | 已归档;本笔记的 跨论文关系 已补充 objective weighting 与 entropy dynamics。 |
| 2606.20008 VIMPO | 同属 outcome-only reward 下改变 learning signal 分配的 RLVR 方法。 | 已归档;VIMPO 处理 token-level credit,MaxRL 处理 prompt/trajectory-level likelihood weighting。 |
| PKPO / Differential Smoothing | 论文中的主要非 GRPO 方法 baseline。 | 暂未单独归档;若后续继续研究 RLVR estimator family,可以补为方法节点。 |
| verl 官方仓库 | MaxRL 代码基于 verl 风格安装与训练流程;实现上需要接入 advantage estimator 和 rollout metrics。 | 保留为外部工程参照,用于定位 estimator 与 rollout metrics 接口。 |