2602.02710-maximum-likelihood-reinforcement-learning

Maximum Likelihood Reinforcement Learning

MaxRL 把 binary outcome RLVR 改写为对成功 rollout 隐式 likelihood 的近似最大化:标准 RL 只优化 pass@1 的一阶项,MaxRL 根据一组 rollout 的总数和其中的成功样本数做归一化,得到对有限 rollout 数截断 maximum likelihood objective 的无偏 policy-gradient estimator;实验显示它在 ImageNet toy setting、maze、GSM8K 和 Qwen3 math RL 中更好保留 pass@k 覆盖,但结论主要建立在二值可验证奖励和 GRPO/RLOO 系 baseline 上。

Authors Fahim Tajwar, Guanning Zeng, Yueer Zhou, Yuda Song, Daman Arora, Yiding Jiang, Jeff Schneider, Ruslan Salakhutdinov, Haiwen Feng, Andrea Zanette

已审阅 Archived 2026-07-03 09:03 CST Updated 2026-07-16 19:17 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Fahim Tajwar: Carnegie Mellon University;历史机构:Stanford University。
  • Guanning Zeng: Tsinghua University;历史机构:Carnegie Mellon University。
  • Yueer Zhou: Zhejiang University;历史机构:Stanford University, Carnegie Mellon University, University of Southern California。
  • Yuda Song: Carnegie Mellon University;历史机构:FAIR Paris, Amazon NYC, Microsoft Research NYC, University of California San Diego。
  • Daman Arora: Carnegie Mellon University;历史机构:Microsoft Research India, Indian Institute of Technology Delhi。
  • Yiding Jiang: Carnegie Mellon University;历史机构:Google DeepMind, Google Research, Meta AI Research, Cerebras Systems, University of California Berkeley。
  • Jeff Schneider: Carnegie Mellon University。
  • Ruslan Salakhutdinov: Carnegie Mellon University。
  • Haiwen Feng: UC Berkeley, Impossible, Inc.;历史机构:Max Planck Institute for Intelligent Systems, Adobe, University of Tubingen。
  • Andrea Zanette: Carnegie Mellon University;历史机构:UC Berkeley, Stanford University。

机构口径说明:arXiv v1 TeX source 将 Guanning Zeng 标为 Tsinghua University,将 Yueer Zhou 标为 Zhejiang University;项目页将 Guanning Zeng 标为 CMU,将 Yueer Zhou 标为 Stanford University。本文档作者列表按 arXiv v1 读取口径记录,并在历史机构里保留后续主页或项目页可核验的变化。

关系结构:

  • Fahim Tajwar 和 Guanning Zeng 为 equal contribution;项目页列出 Fahim Tajwar、Guanning Zeng、Andrea Zanette 为 corresponding authors。
  • CMU 是核心协作中心:Andrea Zanette 连接 ECE/MLD reasoning RL 线,Fahim Tajwar、Daman Arora、Yuda Song 与 Zanette 组或 close collaborators 关系紧密;Fahim Tajwar 由 Ruslan Salakhutdinov 和 Jeff Schneider 共同指导。
  • Tsinghua / Zhejiang / Stanford / UC Berkeley / Impossible 形成跨机构桥接:Guanning Zeng 从 Tsinghua 到 CMU PhD,Yueer Zhou 从 ZJU 与 CMU 协作并进入 Stanford MSCS 线索,Haiwen Feng 连接 Berkeley 视觉/世界模型和 Impossible。
  • 当前已归档论文中未发现直接作者重叠;主题上与 2504.13837 RLVR reasoning boundary2510.01180 BroRL2505.22617 Entropy Mechanism2606.20008 VIMPO2503.14476 DAPO 直接相连。

阅读目标与判断边界

本笔记关注:

  1. MaxRL 如何从 maximum likelihood 推导到可采样的 policy-gradient estimator。
  2. 它和 REINFORCE / RLOO / GRPO / BroRL 这类 rollout-based RLVR 方法的核心差异。
  3. 论文实验是否真的支持“更多 rollout compute 改善 objective 本身”这一主张。

判断边界:

  • 论文设置主要是 binary outcome feedback。对连续 reward、偏好 reward、多轮 tool-use agent、off-policy PPO 风格训练仍属未来工作。
  • 大规模 LLM 实验主对照是 GRPO,未系统纳入 DAPO、Clip-Higher、Dynamic Sampling、ProRL/BroRL tuned recipe。
  • 项目页与代码页标注 ICML 2026 Oral;当前检索未看到 PMLR 正式页面,因此会议状态按项目页和作者主页记录。
  • GSM8K 部分正文提到 GSM8K-Platinum non-overlapping test,表格标题使用 GSM8K,需要复验时核对数据划分。

论文脉络

1. 研究问题、背景和价值

RLVR 常见设置是:给输入 xx,模型采样轨迹 zz,外部 checker 或 verifier 返回二值奖励 r(x,z){0,1}r(x,z)\in\{0,1\}。这类任务包括迷宫、代码、数学题和可判定答案的 reasoning benchmark。模型实际诱导了一个正确答案 likelihood:

pθ(y(x)x)=zmθ(zx)1{f(z)=y(x)} p_\theta(y^*(x)\mid x)=\sum_z m_\theta(z\mid x)\mathbf{1}\{f(z)=y^*(x)\}

如果从 likelihood 角度看,理想目标是提高每个输入上至少采出正确轨迹的概率,并在低成功率输入上给足学习信号。标准 binary RL objective 写成:

JRL(θ)=Ex[Ezmθ(x)[r(x,z)]]=Ex[pθ(x)] J_{\mathrm{RL}}(\theta)=\mathbb{E}_x\left[\mathbb{E}_{z\sim m_\theta(\cdot\mid x)}[r(x,z)]\right]=\mathbb{E}_x[p_\theta(x)]

它直接优化 pass rate。Maximum likelihood 则是:

JML(θ)=Ex[logpθ(x)] J_{\mathrm{ML}}(\theta)=\mathbb{E}_x[\log p_\theta(x)]

两者差异在低 pθ(x)p_\theta(x) 区域最明显。ML 的梯度权重含有 1/pθ(x)1/p_\theta(x),会更强调 hard prompts;标准 RL 的权重近似常数,容易把学习信号分配给已经较容易成功的输入。

2. 已有解决方案与不足

REINFORCE / RLOO / GRPO 都能在二值奖励上做 policy gradient,但它们的目标通常仍接近 pass@1pass@1 或经过 advantage normalization 的 pass-rate surrogate。增大 rollout 数 NN 时,REINFORCE 主要降低估计方差;如果 objective 本身仍是 pass@1pass@1,更多采样不会自动变成对 pass@kpass@k 或 likelihood 的优化。

GRPO 的 group normalization 会给 hard prompts 一定额外权重,但其 population weight 近似:

wGRPO(p)=1p(1p) w_{\mathrm{GRPO}}(p)=\frac{1}{\sqrt{p(1-p)}}

这会同时放大 p0p\to 0p1p\to 1 两端。MaxRL 的目标更接近 likelihood weighting:

wML(p)=1p w_{\mathrm{ML}}(p)=\frac{1}{p}

它的重点是低成功率样本。论文试图给出一个可以直接落地到 on-policy RL 的 estimator,而无需显式估计每个 pass@kpass@k

3. 作者可能的思考路径

关键观察来自 logp\log p 的 Maclaurin expansion。记 fail@k(x)fail@k(x)kk 条独立采样全部失败的概率,即 fail@k(x)=(1p)kfail@k(x)=(1-p)^k。则:

logp=k=1(1p)kk=k=1fail@k(x)k \log p=-\sum_{k=1}^{\infty}\frac{(1-p)^k}{k}=-\sum_{k=1}^{\infty}\frac{fail@k(x)}{k}

对参数求导得到:

θJML(x)=k=11kθpass@k(x) \nabla_\theta J_{\mathrm{ML}}(x)=\sum_{k=1}^{\infty}\frac{1}{k}\nabla_\theta pass@k(x)

这给出一个很清晰的解释:ML 在优化所有 pass@kpass@k 的 harmonic mixture;标准 RL 只取第一项 θpass@1(x)\nabla_\theta pass@1(x)。如果训练时每个 prompt 采 NN 条轨迹,就可以自然对应到一个 T=NT=N 的截断目标。

4. 核心假设或切入点

MaxRL 的截断目标定义为:

JMaxRL(T)(x)=k=1T(1p)kk J_{\mathrm{MaxRL}}^{(T)}(x)=-\sum_{k=1}^{T}\frac{(1-p)^k}{k}

其梯度为:

θJMaxRL(T)(x)=k=1T1kθpass@k(x) \nabla_\theta J_{\mathrm{MaxRL}}^{(T)}(x)=\sum_{k=1}^{T}\frac{1}{k}\nabla_\theta pass@k(x)

T=1T=1 时回到 standard RL;当 TT\to\infty 时回到 exact ML。这个定义把 rollout compute 变成 objective order。更大的 NN 不只是更低方差,也让训练目标纳入更高阶的 pass@kpass@k

5. 方法 / 系统 / 理论框架

Theorem 1 给出 ML gradient 的 conditional form:

θJML(x)=E[θlogmθ(zx)f(z)=y(x)] \nabla_\theta J_{\mathrm{ML}}(x)=\mathbb{E}\left[\nabla_\theta\log m_\theta(z\mid x)\mid f(z)=y^*(x)\right]

也就是说,最大化成功 likelihood 的梯度可以看成只在成功轨迹上平均 score function。给 NN 条 rollout,奖励为 rir_i,score function 为:

Si=θlogmθ(zix) S_i=\nabla_\theta\log m_\theta(z_i\mid x)

成功数为:

K=i=1Nri K=\sum_{i=1}^{N}r_i

MaxRL estimator 是:

g^N(x)={1Ki=1NriSi,K10,K=0 \widehat{g}_N(x)= \begin{cases} \frac{1}{K}\sum_{i=1}^{N}r_iS_i, & K\ge 1\\ 0, & K=0 \end{cases}

Theorem 2 证明:

E[g^N(x)]=θJMaxRL(N)(x) \mathbb{E}[\widehat{g}_N(x)]=\nabla_\theta J_{\mathrm{MaxRL}}^{(N)}(x)

这使得实现非常简单。REINFORCE 用 1NiriSi\frac{1}{N}\sum_i r_iS_i,MaxRL 用 1KiriSi\frac{1}{K}\sum_i r_iS_i。为了降方差,论文再减去零均值 control variate:

VN=1Ni=1NSi V_N=\frac{1}{N}\sum_{i=1}^{N}S_i

得到:

g~N(x)=i=1N(riK1N)Si \widetilde{g}_N(x)=\sum_{i=1}^{N}\left(\frac{r_i}{K}-\frac{1}{N}\right)S_i

其中 K=0K=0 时第一项按 00 处理。落到 on-policy LLM 训练时,核心变化是 advantage normalization:使用 per-task mean reward r^(x)\hat{r}(x) 做归一化,而 GRPO 使用 group reward standard deviation。可写成:

g^(x)=1Nr^(x)j=1N(rjr^(x))Sj,r^(x)>0 \widehat{g}(x)=\frac{1}{N\hat{r}(x)}\sum_{j=1}^{N}(r_j-\hat{r}(x))S_j,\quad \hat{r}(x)>0

r^(x)=0\hat{r}(x)=0,该 prompt 不产生更新。这个形式和 DAPO / dynamic sampling 的有效梯度思想相容:全错 group 没有学习信号,全对 group 经 control variate 后学习信号也弱,最有价值的是能采到少量成功轨迹的 hard prompts。

6. 结论链条

论文的逻辑链条是:

  1. Binary correctness RL 隐含一个成功 likelihood pθ(x)p_\theta(x)
  2. 标准 RL 优化 pθ(x)p_\theta(x),ML 优化 logpθ(x)\log p_\theta(x)
  3. logp\log p 可展开为 pass@kpass@k 梯度的 harmonic mixture。
  4. NN 条 rollout 的成功轨迹做 KK 归一化,得到 T=NT=N 截断目标的无偏 estimator。
  5. 因为低 pp 输入被更强加权,MaxRL 应该改善 pass@k 覆盖,降低 fixed dataset 上的 distribution sharpening,并在 test-time scaling 下更省采样。

关键实验/定理

定理 1:ML gradient 的成功轨迹条件期望

  • 设置:二值奖励、正确答案由 f(z)=y(x)f(z)=y^*(x) 判定,模型分布为 mθ(zx)m_\theta(z\mid x)
  • 结论:θJML(x)\nabla_\theta J_{\mathrm{ML}}(x) 等于成功轨迹条件分布下的 score function 平均。
  • 解读:只要能采到成功轨迹,就可以不显式求和所有 zz,直接构造 likelihood gradient estimator。

定理 2:NN rollout estimator 对 T=NT=N MaxRL objective 无偏

  • 设置:每个 prompt 采 NN 条独立 rollout,成功数为 KK
  • 结论:g^N(x)\widehat{g}_N(x)θJMaxRL(N)(x)\nabla_\theta J_{\mathrm{MaxRL}}^{(N)}(x) 的无偏估计。
  • 解读:rollout 数进入目标函数阶数。这个点是 MaxRL 相对普通 variance reduction 的主要理论贡献。

结果 1:ImageNet toy setting 验证近似 exact ML

  • 设置:ImageNet / ResNet-50 classification,把预测正确记为 11,错误记为 00;cross-entropy 可作为 exact ML 对照。
  • Baseline:REINFORCE, GRPO, exact cross-entropy。
  • 指标:训练动态、gradient norm、接近 exact ML 的程度。
  • 结果:当 rollout 数足够大时,MaxRL 逐步接近 cross-entropy training;REINFORCE 在低初始 pass rate 下难以推进。
  • 解读:这个实验把“MaxRL 逼近 ML”放在 exact ML 可计算的环境中验证,是理论到实现的 sanity check。

结果 2:17x17 Maze 的 infinite data regime

  • 设置:程序生成 17x17 迷宫,训练集 1M unique mazes,eval 256 held-out mazes;约 3M decoder-only transformer,4 层、hidden 256、FFN 1024、4 attention heads、2 KV heads、RMSNorm、SiLU、RoPE、bf16;SFT 1500 steps 后进入 RL。
  • Baseline:GRPO, RLOO, GRPO + entropy, PKPO, Differential Smoothing。
  • 指标:pass@1, pass@128, pass@256。
  • 结果:
Method pass@1 pass@128 pass@256
GRPO 43.6 49.0 49.6
RLOO 25.2 28.7 29.0
GRPO + entropy 47.2 53.4 54.0
PKPO 74.5 77.6 77.9
Differential Smoothing 50.0 57.8 58.7
MaxRL 84.4 92.0 94.3
  • 解读:maze 是最有利于展示 pass@k coverage 的任务。MaxRL 同时提升 pass@1 和 large-k coverage,说明它在提升 top-1 的同时保留了更宽的可成功轨迹集合。

结果 3:GSM8K data-scarce regime

  • 设置:SmolLM2-360M-Instruct,在 GSM8K 训练 1500 steps / up to 50 epochs;batch 256 prompts,每 prompt 128 generations,max response 2048,LR 1e51e^{-5},KL coeff 0,entropy coeff 0,8x Nvidia GH200。
  • Baseline:GRPO, RLOO, GRPO + entropy, PKPO, Differential Smoothing。
  • 指标:pass@1, pass@128, pass@1024。
  • 结果:
Method pass@1 pass@128 pass@1024
GRPO 29.3 45.8 48.8
RLOO 27.5 44.6 48.5
GRPO + entropy 31.1 48.1 51.6
PKPO 30.7 67.2 75.9
Differential Smoothing 31.4 48.5 52.3
MaxRL 33.2 75.0 83.4
  • 解读:GRPO/RLOO 更快推高 early pass@1,但 pass@k 容易下降;MaxRL 初期更慢,后期保持更多可成功轨迹,符合 likelihood weighting 对 hard prompts 的偏好。

结果 4:Qwen3-1.7B / 4B math RL 的 test-time scaling

  • 设置:Qwen3-1.7B-Base 和 Qwen3-4B-Base,在 POLARIS-53K 约 50K math prompts 上训练;256 prompts/batch,16 rollouts/prompt,1000 RL steps;max prompt 1024,max response 4096,LR 1e61e^{-6},32x Nvidia H200。
  • Baseline:主要对照 GRPO。
  • Eval:AIME 2025, BeyondAIME, MATH-500, Minerva,并补充 AIME 2024, HMMT 2025, JEEBench。
  • 结果:项目页给出 Qwen3-4B 上 7.9x-19.2x test-time scaling efficiency gains;正文总结给出 2.3x-19.2x 采样效率提升;附加 benchmark caption 提到最高 20.5x。
  • Qwen3-4B majority voting 摘要:
Method AIME 2024 AIME 2025 BeyondAIME MATH-500 Minerva
Base 23.3 23.3 7.0 69.8 18.8
GRPO 23.3 23.3 7.0 72.4 27.2
MaxRL 26.7 26.7 14.0 74.0 28.7
  • 解读:MaxRL 的优势主要体现在同等或略高 pass@1 下,保留更好的 pass@k 和 majority-vote scaling。这与 2504.13837 对 pass@1 / pass@k 分离的诊断语言直接相接。

结果 5:训练动力学解释

  • 设置:在 SmolLM、Qwen3-1.7B、Qwen3-4B 等 setting 中分析 prompt pass-rate bins、gradient norm、entropy 和成功覆盖。
  • 结果:MaxRL 在接近 00 pass rate 的 hard prompts 上产生更大 gradient norm;训练过程中“至少一条 rollout 成功”的 prompts 比例更高;Qwen3 setting 中常见更长 CoT、更高 actor entropy 和更大 gradient norm。
  • 解读:这支持“MaxRL 同时改变最终指标和训练信号分配”的观点。它把 compute 花在低成功率但仍可探索的输入上,与 BroRL 的 large-NN exploration 形成互补。

证据链强度评估

强证据

  • 两个定理把 binary reward 下的成功轨迹 likelihood 和 NN rollout estimator 连接起来,给出清晰目标函数。
  • ImageNet toy setting 提供 exact ML 可计算的 sanity check,验证 MaxRL 可逼近 cross-entropy training。
  • Maze、GSM8K 和 Qwen3 math RL 展示 pass@1 与 pass@k / majority scaling 的差异,贴合论文主张。

中等强度证据

  • 训练动力学分析支持 MaxRL 更关注低成功率但可探索 prompt,但仍主要依赖作者实验设置。
  • Qwen3 结果说明大模型 RLVR 中有潜在收益,主对照以 GRPO 为主,强 recipe 覆盖不足。

需要谨慎的推论

  • 全错 prompt 在采不到成功样本时仍缺少学习信号,需要与更强 exploration 或 curriculum 结合。
  • 二值 reward 假设限制了偏好、多目标、连续 reward 和多轮工具调用场景的直接适用性。

主要启发

  • RLVR 可以被重写成对成功轨迹集合的条件 likelihood 估计,从而解释 pass@k 与 pass@1 的分离。
  • rollout width 是目标函数的一部分,报告 MaxRL 时必须同时给出 NN、成功数 KK 分布、decode 成本和 verifier 成本。
  • 对 agentic 任务,MaxRL 的 KK 归一化有吸引力,但需要额外处理状态缓存、工具延迟、partial rollout 和 off-policy correction。

局限

  • 二值奖励假设很强。代码、数学、迷宫等可验证任务适合该推导;偏好建模、连续 reward、多目标 reward 需要新 estimator 或目标变换。
  • 全错 prompt 没有更新。MaxRL 依赖采到至少一个成功轨迹,因此在极低 ppNN 不足时仍会没有学习信号;这也是它和 BroRL / broadened exploration 需要结合的地方。
  • 大规模 LLM 主对照主要是 GRPO。若要判断相对当前开源 recipe 的收益,需要加入 DAPO、Clip-Higher、Dynamic Sampling、ProRL/BroRL、entropy-control、OTB/VIMPO 等更强基线。
  • 工程成本尚未充分拆解。论文报告设备与若干训练配置,但没有把 rollout width、decode length、vLLM/verifier cost、trainer update、wall-clock 和 test-time scaling cost 统一进一张成本表。
  • 多轮 agent setting 尚未覆盖。tool-use agent 的 reward 可能在多轮后才出现,且 API/tool harness 会改变 trajectory distribution;MaxRL 的 KK 归一化仍有吸引力,但需要处理 stateful KV cache、tool latency、partial rollout 和 off-policy correction。
  • 机构和数据说明存在小口径差异。arXiv v1 source 与项目页对 Guanning Zeng、Yueer Zhou 的机构标注不同;GSM8K 部分的测试集命名也需要复验。

OpenReview / 审稿意见吸收

  • Venue status: 当前档案未记录公开 peer-review 状态。
  • Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
  • Ratings / confidence: 无公开评分可用于校准。
  • Reviewer consensus: 暂无。
  • Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
  • Author response: 暂无公开 rebuttal 记录。
  • 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。

本地讨论补充

  • MaxRL 可以作为“rollout width 改 objective”的理论节点,连接 BroRL 的 large-NN exploration 与 RLVR boundary 论文中的 pass@k coverage 诊断。
  • 若落地到 verl/slime,需要把每个 prompt 的 KKr^\hat{r}、pass-rate bin、advantage scale、entropy、response length、KL/K3、trainer/rollout logprob mismatch 一起记录。否则很难区分 MaxRL objective 改善、采样预算增加和 backend mismatch 带来的表观收益。
  • 对 online agentic server,MaxRL 思路更适合先作为 prompt/trajectory difficulty weighting 的训练信号;若要直接作为 serving route scheduler,还要额外考虑 tool latency、KV cache locality 和多轮 continuation affinity。

跨论文关系

  • RLVR reasoning boundaryBroRL:三者都把 pass@kk coverage 与 rollout width 纳入分析;MaxRL 进一步说明采样宽度 NN 会改变成功轨迹 likelihood objective 的阶数与权重。
  • DAPOverl 官方仓库:DAPO 提供 strong long-CoT recipe,verl 提供 advantage estimator 和 rollout metrics 的实现位置,是复验 MaxRL 时需要采用的算法与系统基线。
  • VIMPOOTB:三者都在 outcome-only reward 下重分配学习信号;VIMPO 构造 token-level implicit value / advantage,OTB 近似 token-level variance-minimizing baseline,MaxRL 调整 prompt/trajectory-level success likelihood weighting。
  • Entropy Mechanism:MaxRL 的 success-count normalization 与 rollout width 会改变样本权重,Entropy Mechanism 提供监测 entropy collapse 和 token-level covariance 的诊断轴。

Reference Intake Brief

Reference 在本文中的作用 本地处理
2504.13837 RLVR reasoning boundary 提供 pass@1 / pass@k / coverage set 诊断语言,用来判断 RLVR 是否扩展可解问题集合。 已归档;MaxRL 是该争论中的 likelihood-objective 正向节点。
2510.01180 BroRL 同样把 rollout width 视为 scaling dimension;BroRL 强调更大 NN 让训练看到更多成功轨迹。 已归档;MaxRL 给出 NN 对 objective order 的理论解释。
2503.14476 DAPO 提供当前 long-CoT GRPO / Dynamic Sampling / token-level loss 的开源 recipe 背景。 已归档;后续复验 MaxRL 应纳入 DAPO-style strong baseline。
2505.22617 Entropy Mechanism 解释 RLVR 中 entropy collapse 和 token-level covariance;可用于分析 MaxRL 为什么保留更多 pass@k。 已归档;本笔记的 跨论文关系 已补充 objective weighting 与 entropy dynamics。
2606.20008 VIMPO 同属 outcome-only reward 下改变 learning signal 分配的 RLVR 方法。 已归档;VIMPO 处理 token-level credit,MaxRL 处理 prompt/trajectory-level likelihood weighting。
PKPO / Differential Smoothing 论文中的主要非 GRPO 方法 baseline。 暂未单独归档;若后续继续研究 RLVR estimator family,可以补为方法节点。
verl 官方仓库 MaxRL 代码基于 verl 风格安装与训练流程;实现上需要接入 advantage estimator 和 rollout metrics。 保留为外部工程参照,用于定位 estimator 与 rollout metrics 接口。