2510.01180-brorl-broadened-rl-exploration
BroRL: Scaling Reinforcement Learning via Broadened Exploration
BroRL 把 RLVR 的 scaling 轴从“继续训练更多 step”扩展到“每个 prompt 采样更多 rollout”:作者从 one-step RLVR 的 correct-token probability mass 分解出一个可能为负的 unsampled coupling term,并说明增大 rollout 数量会让未采样项的二阶矩衰减,从而让 policy update 更稳定地增加正确 token 概率;实验上,BroRL 在 ProRLv2 已经 3K steps 饱和的 checkpoint 上把每个 prompt 的 rollout 从 16 条放大到 512 条,在相近训练预算下比继续 ProRL step-scaling 更稳定、更高效地提升 math、code 和 Reasoning Gym。
Source
- Title: BroRL: Scaling Reinforcement Learning via Broadened Exploration
- arXiv: https://arxiv.org/abs/2510.01180
- HTML v1: https://arxiv.org/html/2510.01180v1
- PDF v1: https://arxiv.org/pdf/2510.01180v1
- TeX Source v1: https://arxiv.org/e-print/2510.01180v1
- NVIDIA technical blog: https://developer.nvidia.com/blog/breaking-through-rl-training-limits-with-scaling-rollouts-in-brorl/
- Model: https://huggingface.co/nvidia/Nemotron-Research-Reasoning-Qwen-1.5B
- Authors: Jian Hu, Mingjie Liu, Ximing Lu, Fang Wu, Zaid Harchaoui, Shizhe Diao, Yejin Choi, Pavlo Molchanov, Jun Yang, Jan Kautz, Yi Dong
- Submitted: 2025-10-01
- Current version read: v1, submitted 2025-10-01
- Subjects: Machine Learning (
cs.LG); Computation and Language (cs.CL) - arXiv comment: 16 pages, 4 figures
作者与关系
- Jian Hu: NVIDIA.
- Mingjie Liu: NVIDIA.
- Ximing Lu: NVIDIA.
- Fang Wu: Stanford University.
- Zaid Harchaoui: University of Washington.
- Shizhe Diao: NVIDIA.
- Yejin Choi: NVIDIA.
- Pavlo Molchanov: NVIDIA.
- Jun Yang: NVIDIA.
- Jan Kautz: NVIDIA.
- Yi Dong: NVIDIA.
阅读目标与判断边界
本笔记关注:
- BroRL 为什么把 rollout size
作为 RLVR scaling 轴。 - correct-mass decomposition 里的 sampled positive terms 与 unsampled coupling term 分别意味着什么。
相比 ProRL 的 在模型性能、动态采样和硬件效率上带来什么变化。 - 这篇论文如何连接 ProRL、DAPO、RLVR boundary、tool-calling RL efficiency 和 rollout / trainer consistency。
判断边界:
- 理论分析是 token-level one-step RLVR 的局部近似,把 token correct mass 当作 pass@
的 proxy。它提供解释语言,但不能直接等同于完整自回归序列级 PPO / GRPO / DAPO 训练定理。 - 主要实证来自 NVIDIA Nemotron-Research-Reasoning-Qwen-1.5B / ProRLv2 的单一模型线,起点是已经过 3K RL steps 的强 checkpoint。
- 论文主要比较
和 ,没有系统扫 等中间值,最优 、边际收益和任务依赖性仍需复验。 - BroRL 增大 rollout generation 宽度,同时保持 PPO mini-batches 数不变并调整 learning rate。收益不能只归因于
,也受到 batch size、learning rate scaling、dynamic sampling pass rate、硬件利用率和 verl/ vLLM 配置影响。 - 论文没有完整加入 random / format / incorrect reward baseline,因此和 2506.10947 相关的 prior amplification 与 reward artifact 问题仍需外部复验。
论文脉络
1. 问题背景
ProRL 已经展示了 prolonged RL 可能扩展小模型 reasoning boundary,但它也暴露出一个实际瓶颈:训练到几千步后,继续增加 step 会出现收益递减,甚至在部分任务上退化。BroRL 的问题意识是:RLVR 的 scaling 不能只看 depth,也就是训练步数;还需要看 width,也就是每个 prompt 在一次 update 中采样多少 rollout。
这和现有 RLVR 争论直接相关。2504.13837 用 pass@
因此,BroRL 的直觉很直接:在每次 policy update 前,针对同一个 prompt 生成几百个响应,让训练更充分地观察当前策略下的成功和失败轨迹,再让 Dynamic Sampling 和 PPO update 使用更高质量的有效 batch。
2. 核心假设或切入点
作者的核心假设是:RLVR 的训练不稳定有一部分来自 insufficient exploration。小
BroRL 的策略是增大每个 prompt 的 rollout size
3. 理论框架:correct-mass decomposition
作者在 token-level one-step setting 下定义:
其中
sampled reward 的净贡献记作:
Theorem 1 给出 one-step 后 correct probability mass 的一阶变化:
这个式子的解释是:
- sampled-correct term:
,采到正确 token 后提高它们的 logit,归一化会从 incorrect pool 中转移概率质量,因此该项非负。 - sampled-incorrect term:
,采到错误 token 后降低它们的 logit,释放出的概率按 流向正确集合,因此该项也非负。 - unsampled coupling term:
,由未采样 token 的 softmax 归一化耦合产生,符号取决于 batch reward balance 和未采样正确 / 错误概率的集中程度。
作者进一步说明,若一个 token 的采样概率为
因此对一组 token:
这个量随
论文还把 correct mass 和 pass@
所以若某次更新提高
4. BroRL 训练方法
BroRL 采用 ProRLv2 框架,核心是 clipped PPO / REINFORCE++-style advantage normalization,并保留 ProRL / DAPO 生态里的关键组件:
- Dynamic Sampling:过滤一组 rollout 全对或全错的 prompt,只保留有 reward variance 的训练样本。
- Clip-Higher:设置
,鼓励低概率但高 reward 的探索轨迹被强化。 - Reference policy periodic reset:延续 ProRL 的长期训练稳定化机制。
- Truncated importance sampling:处理 inference engine 和 training engine 之间的 off-policy mismatch。
BroRL 的核心改动是将每个 prompt 的 rollout 数从
实证设置中,作者从已经训练 3,000 RL steps、context length 为 8,192 的 ProRLv2 checkpoint 出发,后续训练扩展到 16,384 context window,使用 64 张 NVIDIA H100 GPU 和 verl。评测使用 32K context,temperature 0.6,top-p 0.95,并对每个实例平均 16 个 independent samples 的 pass@1。
5. 实验结果
第一,token-level simulator 支持理论直觉。作者构造 vocabulary size
第二,在真实模型上,BroRL 比继续 ProRL 更能突破 3K-step plateau。主表格中:
| Method | N | Prompts / Step | Continued Steps | Time | Math | Code | Reasoning Gym |
|---|---|---|---|---|---|---|---|
| Baseline | 16 | 512 | 3000 | - | 61.69 | 52.00 | 61.29 |
| ProRL | 16 | 512 | +225 | 56.3h | 62.08 | 52.26 | 62.10 |
| ProRL | 16 | 512 | +535 | 133.8h | 62.02 | 52.74 | 61.45 |
| BroRL | 512 | 128 | +107 | 98.1h | 62.62 | 53.31 | 62.71 |
| BroRL | 512 | 128 | +134 | 122.8h | 62.85 | 53.48 | 62.82 |
| BroRL | 512 | 128 | +191 | 173.8h | 63.03 | 54.20 | 63.09 |
ProRL 继续训练后 math 和 Reasoning Gym 先小幅提高,随后停滞或下降;BroRL 在三个任务族上持续上升。作者强调 BroRL 的收益来自 fewer but higher-quality updates,因为 PPO mini-batches 数保持一致,而每次 update 前的探索宽度更大。
第三,BroRL 的有效样本率和硬件吞吐也提高。Dynamic Sampling pass rate 从 ProRL
第四,细粒度 pass@1 trajectory 显示三类情况:有些任务 ProRL 和 BroRL 都提高但 BroRL 更强;有些任务 ProRL 退化而 BroRL 继续提高;少数更难任务二者都没有稳定收益,作者认为
关键实验/定理
定理 1:correct-mass change 的符号分解
- 设置:token-level one-step RLVR,sampled correct tokens、sampled incorrect tokens 和 unsampled tokens 分开,sampled token 有 binary reward,unsampled token reward 为 0。
- 指标:
,即 correct token probability mass 的一阶变化。 - 结果:
分解为两个非负 sampled terms 和一个可正可负的 unsampled coupling term。随着 增大,unsampled second moments 衰减,负向项影响下降。 - 解读:BroRL 的理论主张是,大 rollout size 通过减少未采样空间的耦合噪声,让 update 更稳定地朝 correct-mass expansion 方向移动。
引理 2:unsampled second moment 随 衰减
- 设置:某 token 每次采样被选中的概率为
,独立采样 次。 - 指标:该 token 未被采样时对二阶矩的贡献。
- 结果:期望为
;一组 token 的总期望为 。 - 解读:高概率 token 留在 unsampled set 的概率随
指数下降,因此大 会系统性削弱 unsampled coupling。
实验 1:token-level simulator 验证 large- 稳定性
- 设置:
vocabulary, correct tokens,TRPO-style surrogate,AdamW,1,000 steps,比较 。 - 指标:correct probability mass、概率上升的 correct token 比例、correct token 的最坏概率下降。
- 结果:大
更快增加 correct mass,并消除 worst-case knowledge shrinkage。 - 解读:simulation 在比定理更宽松的设置中支持 rollout width 能降低负向未采样项。
实验 2:BroRL 突破 ProRLv2 3K-step plateau
- 设置:从 ProRLv2 checkpoint 继续训练;ProRL baseline 用
、512 prompts / step;BroRL 用 、128 prompts / step;同样在 64 H100 和 verl上训练。 - 指标:Math Avg、Code Avg、Reasoning Gym Avg、wall-clock time。
- 结果:ProRL +535 steps 后 Math 62.02、Code 52.74、Reasoning Gym 61.45;BroRL +191 steps 后 Math 63.03、Code 54.20、Reasoning Gym 63.09。
- 解读:对已饱和 checkpoint,增加 rollout width 比继续增加 step depth 更有效。
实验 3:有效采样率和吞吐提升
- 设置:同硬件下比较 ProRL
与 BroRL 。 - 指标:Dynamic Sampling Pass Rate、Generation Throughput。
- 结果:pass rate 41%
62%;throughput 36.5 72.4 samples/s。 - 解读:大
同时改善算法有效样本比例和硬件利用率,这解释了为什么看似更多 rollout 没有线性增加 wall-clock 成本。
实验 4:final checkpoint 上的统计检验
- 设置:跨 benchmarks 收集超过 10,000 个 problem-instance points,比较等训练预算下 final checkpoint 的 pass@1。
- 指标:paired t-test。
- 结果:BroRL 相比 ProRL 的平均优势为
, ,one-tailed 。 - 解读:平均差值较小,但起点是已经训练 3K steps 的强 checkpoint;统计显著性支持 BroRL 提供更稳定的增量收益。
证据链强度评估
强证据
- 论文和 2505.24864 使用同一 NVIDIA Nemotron / ProRL 研究线,续训起点、任务族、训练框架有连续性,比较对象清晰。
- correct-mass decomposition 提供了明确机制语言:sampled terms 非负,unsampled coupling 可能为负,rollout size 直接控制后者。
- simulation 指标和理论项对齐,观察了 correct mass、correct token 改善比例和 worst probability drop,不只报告 benchmark score。
- 主实验把 training time、samples、steps、prompts per step、三类 benchmark 分开报告,能看出 BroRL 的收益和成本结构。
- Dynamic Sampling pass rate 与 generation throughput 解释了为什么大
在特定硬件设置中反而更高效。
中等强度证据
- paired t-test 的样本数很大且显著,但平均优势
很小;实际意义需要结合特定任务和 checkpoint 曲线看。 - 任务覆盖 math、code、Reasoning Gym,但仍集中于 verifiable reasoning,开放式 alignment、tool-use、multi-turn agent 的外推需要新实验。
- Hugging Face 模型卡发布了更新的 BroRL checkpoint,但论文主实验和模型卡最新训练步数不同,复现时需要固定 revision。
需要谨慎的推论
- token-level correct mass 到 full-sequence reasoning success 的映射依赖局部近似和“token improvement composes into correct completion”的假设。
的收益可能依赖 H100、prefix cache、vLLM / verlbatching、prompt length 和 response length 分布;不同集群或 serving backend 的吞吐结论可能变化。- BroRL 扩大 rollout width 会增加生成侧显存、KV cache 和调度压力;在 tool-calling 或超长交互环境中,policy update 成本可能重新主导。
- 论文没有系统分析 reward artifact、format reward 或 random reward baseline;因此对“能力提升来源”的判断仍需和 2506.10947 的诊断框架结合。
OpenReview / 审稿意见吸收
- Venue status: 当前档案未记录公开 peer-review 状态。
- Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
- Ratings / confidence: 无公开评分可用于校准。
- Reviewer consensus: 暂无。
- Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
- Author response: 暂无公开 rebuttal 记录。
- 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。
本地讨论补充
1. 初读后的分析收敛
- BroRL 是 ProRL 的直接续篇。ProRL 证明 step-scaling 在某些条件下有效,BroRL 说明 ProRL 进入 plateau 后,继续增加 step 的边际收益变小,此时把计算转向同 prompt 的 rollout width 更有效。
- 它给 “RL 能不能扩展 reasoning boundary” 增加了一个训练预算维度:同样总 compute 下,探索宽度可能比训练深度更重要。这个结论和 2509.25123 的组合泛化主题相容:RL 需要足够采样覆盖到可强化的成功模式。
- 它也提示 2606.00135 中“减少无效 rollout”的结论需要按场景理解。BroRL 通过大
提高 effective dynamic-sampling pass rate;tool-calling RL 的长轨迹环境中,生成与反传成本结构可能不同。
2. 修正后的理解
- BroRL 的核心是“在每次更新前看见更多同 prompt 候选”。这会把高概率正确 / 错误 tokens 从 unsampled 区域移入 sampled 区域,减少归一化耦合带来的负向扰动。
- 对 RLVR 来说,rollout 数
不只是估计 advantage 的方差参数,也是 policy update 实际观察到的探索覆盖度参数。 - 对系统来说,大
在某些硬件和批处理设置下可以提升吞吐,因为同 prompt 多样本共享 prefix,能提高 cache reuse 和 arithmetic intensity。
3. 与其他论文的争议和冲突
- 与 2504.13837 的冲突在于 RLVR boundary 解释。
2504.13837强调许多 RLVR 提升更像 sampling efficiency,base model 在大 pass@下已覆盖正确解;BroRL 认为小 训练本身会限制探索覆盖,导致 policy update 看不到足够成功轨迹。冲突焦点是:RL 的边界受 base coverage 限制,还是受训练时 rollout width 限制。 - 与 2506.10947 的冲突在于 gain 来源。BroRL 把 large-
后的提升解释为更稳定的 correctness-driven exploration;Spurious Rewards 提醒,RLVR 分数提升也可能来自 random / format / incorrect reward 对已有 prior 的放大。BroRL 需要补充 dummy reward baselines,才能更强地区分真实 verifier informativeness 和 prior amplification。 - 与 2506.19248 的张力在于“多采样”是否总是有益。BroRL 在训练阶段扩大 rollout width,让 policy update 看到更多候选;HedgeTune 论文说明推理阶段 Best-of-
随 增大可能出现 proxy reward overoptimization 和 true reward 下滑。二者提示同一个动作“多采样”在训练和部署中需要不同校准:训练侧关注有效梯度,推理侧关注 proxy / true reward gap。 - 与 2606.00135 的冲突在计算策略。BroRL 主张增大每 prompt rollout 数,提高探索宽度和 Dynamic Sampling pass rate;tool-calling RL 论文主张跳过 all-correct prompts,并对 rollout 做 variance-aware down-sampling 来减少反传成本。冲突焦点是任务轨迹成本结构:短 reasoning rollout 中大
可能提高有效样本率,长 tool-use 轨迹中大 可能放大 policy update 成本。 - 与 2503.14476 的张力在 Dynamic Sampling 的角色。DAPO 把 Dynamic Sampling 当作过滤全对 / 全错 prompt group 的效率技巧;BroRL 进一步说明大
会提高 Dynamic Sampling pass rate。这里的争议是:有效梯度来自更精细过滤,还是来自更宽采样后让过滤器有更多可用候选。后续需要固定总生成 token 和 update token 做 ablation。 - 与 2605.14220 和 TML-2025-09-10 的冲突在系统可靠性。BroRL 的收益依赖 large rollout、vLLM /
verl和高吞吐 batching;TIM/VeXact 与 batch-invariant inference 论文说明 rollout engine 与 trainer engine 的 logprob mismatch、batch-dependent kernels 和 nondeterminism 会改变实际优化目标。BroRL 越依赖大规模 rollout,越需要同时报告 mismatch 指标和 backend 配置。 - 与 2509.25123 的条件差异在“探索宽度”和“可学技能结构”。BroRL 说明 large-
可稳定发现和强化成功轨迹;composition 论文说明 RL 泛化需要已有 atomic skills 和明确 compositional incentive。大 可以改善搜索覆盖,但如果任务缺少可组合的已有技能或 reward 没有指向目标 bottleneck,rollout width 本身不足以保证新能力形成。 - 与 2505.24864 的内部张力在 scaling 资源分配。ProRL 把计算投入更长 step、更长训练阶段和稳定化 recipe;BroRL 在 ProRLv2 plateau 后把计算转向每步更多 rollout。二者应被视为同一模型线的两种 compute allocation 策略,争议点是何时从 step depth 切换到 rollout width。
4. 关于 Best-of- reward hacking 的讨论
- BroRL 会遇到和 Best-of-
同源的风险:当 变大时,采样池里更容易出现“奖励函数高分但真实目标较差”的异常轨迹。如果训练直接强化这些轨迹,大 会放大 reward misspecification,而不只放大真实能力。 - 与 2506.19248 的差别在于作用位置。Best-of-
在推理时从 个候选里选一个最高 proxy reward 输出,风险表现为 true reward 随 增大先升后降;BroRL 在训练时从大 rollout pool 中构造 policy gradient,风险表现为高 proxy reward 异常轨迹进入参数更新并被长期固化。 - BroRL 使用 verifiable rewards,这比开放式 reward model 更稳,但仍依赖 verifier 是否完整覆盖真实目标。数学 final-answer verifier、代码 unit tests、Reasoning Gym 规则 verifier 都可能存在格式、shortcut 或 partial-specification 风险。
- 因此,大
的正面作用需要一个前提:reward / verifier 足够可靠,且过滤机制不会系统性偏向 reward loophole。若 reward 有缺口,大 会更快发现缺口。 - 最直接的复验是:对 BroRL 增加 proxy / true reward sweep、random / format / incorrect reward baseline、unit-test exploitation 检查、response behavior distribution,以及随
变化的 reward-hacking rate。
5. 后续复验指标
- 系统扫
,报告 performance、wall-clock、tokens/s、KV memory、dynamic sampling pass rate 和 policy update time。 - 加入 random / format / incorrect reward baseline,确认 large-
强化的是 correctness signal 还是已有 prior。 - 对比固定总 generated samples 下的 “small
many steps” 与 “large fewer steps”,并固定 PPO mini-batches、learning rate scaling 和 batch tokens。 - 报告 per-task pass@
、pass@1 distribution shift 和 response diversity,避免只看 aggregate pass@1。 - 在 tool-use、multi-turn agent、code repair、STV / verifier-guided RL 上复验大
是否仍提升 effective signal。 - 记录 rollout engine 与 trainer engine 的 logprob mismatch,尤其在
verl+ vLLM + long context + large batch 下结合 2605.14220 的 TIM / VeXact 指标。
主要启发
- RLVR scaling 至少有两个训练时维度:step depth 和 rollout width。ProRL 主要扩展 depth,BroRL 主要扩展 width。
- 大
的价值来自探索覆盖、advantage 稳定性、dynamic sampling 有效率和硬件吞吐共同作用,不能只按“多生成了多少样本”线性估算成本。 - 对已经饱和的 reasoning checkpoint,继续训练小
step 可能带来退化;更宽的 rollout 可以恢复有效学习信号。 - pass@
是评估模型输出分布覆盖度的推理指标,训练时的 是影响 policy update 覆盖度的控制变量,两者在理论上通过 连接。 - 后续 RL 系统设计需要同时优化采样宽度、有效样本过滤、trainer cost 和 backend consistency。
局限
- 论文只比较小
与大 ,缺少中间点和更大 的系统扫描。 - 主实验集中在 1.5B Nemotron / ProRLv2 单一模型线,7B、32B、MoE 或不同 base family 需要额外验证。
- 理论分析是 token-level one-step 近似,对多 token 自回归 rollout、PPO clipping、多 epoch update 和 sequence-level reward 的覆盖有限。
- 论文没有组件级拆开
、prompts per step、learning rate scaling、PPO mini-batches、dynamic sampling pass rate 和 hardware batching 的独立贡献。 - 评测主要是 verifiable reasoning,开放式 reward model、alignment、tool-use 和 agentic multi-turn 任务的成本结构可能不同。
- 能力收益仍需加入 spurious reward / format reward baseline,避免把 prior amplification 或 verifier artifact 解释为 reasoning improvement。
- 模型卡最新 BroRL checkpoint 与论文 v1 表格存在训练步数差异,后续使用权重时需要记录 revision 和 release note。
跨论文关系
- 与 2505.24864 的关系最直接。两者共享 NVIDIA Nemotron 作者线和模型线;ProRL 讨论 step-scaling 与 prolonged RL,BroRL 在 ProRLv2 3K-step plateau 后切换到 rollout-width scaling。
- 与 2503.14476 的方法关系强。BroRL 继承 Dynamic Sampling、Clip-Higher、
verl和 long-CoT RL 系统生态;区别在于 DAPO 重点是 recipe 组件,BroRL 重点是大探索宽度。 - 与 2504.13837 的主题关系在 pass@
与 coverage。 2504.13837关注 RL 后模型是否只是重排 base samples;BroRL 说明训练阶段的小也会限制 policy update 的探索覆盖。 - 与 2509.25123 互补。
2509.25123说明 RL 可以在已有 atomic skills 上学组合泛化;BroRL 说明训练时需要足够 rollout width 才能稳定发现和强化可用轨迹。 - 与 2506.10947 构成诊断互补。BroRL 展示 large-
correctness-RL 的正向证据;Spurious Rewards 提醒任何 RLVR gain 都应配 random / format / incorrect reward baseline 和跨模型家族复验。 - 与 2606.00135 在 rollout 预算上互补。Tool-calling RL 论文减少无效 rollout 和反传成本;BroRL 增大每 prompt rollout 以提升探索宽度与有效样本率。二者共同说明 rollout 数量、轨迹长度和有效梯度比例必须一起优化。
- 与 2605.14220 和 TML-2025-09-10 共享复现可靠性问题。BroRL 使用大规模 long rollout、vLLM /
verl和 pass@1 / pass@评估;sampler/trainer mismatch 或 batch nondeterminism 会影响收益判断。 - 与 2409.19256 的系统关系在
verl基础设施。BroRL 依赖大规模 rollout generation、Dynamic Sampling 和 policy update 编排,是 HybridFlow /verl系统栈在 reasoning RL scaling 上的应用。
Reference Intake Brief
Target
- Intended target system: 论文阅读归档、RLVR scaling 专题、NVIDIA Nemotron / ProRL 研究线、rollout efficiency 与 training system 主题索引。
- Existing related assets: papers-index.md;2505.24864;2503.14476;2504.13837;2606.00135。
- Proposed form: 新建独立 Markdown 文档,更新索引行,并维护对应论文的关系章节。
Reusable Elements
- rollout size
作为 RLVR training-time scaling axis。 - correct-mass decomposition:sampled nonnegative terms + unsampled coupling term。
- unsampled second moment
作为探索覆盖度诊断语言。 - Dynamic Sampling pass rate + generation throughput 作为大
系统效率指标。 - “small
many steps vs large fewer steps” 作为后续 RLVR compute allocation 对照实验。
Risks
- Copyright/over-copying: 本笔记只保留公式、实验数值和必要表格摘要,避免长段复制论文原文。
- Tone/brand mismatch: 保持技术归档语气,避免把 NVIDIA blog 的营销表达写成论文结论。
- Safety/compliance issues: 论文提升 reasoning / coding capability,保留 broader impact 风险和复验建议,不沉淀可直接滥用流程。
- Overlap with existing assets: 与 ProRL 高度重叠,但它新增 rollout-width scaling 和 unsampled coupling 理论,因此应独立成篇并强连接 ProRL。
Skipped
| Material | Reason |
|---|---|
| 第三方中文/日文 paper review 页面 | 非 primary source,未用于结论。 |
| ResearchGate / Chatpaper 摘要页 | 信息可由 arXiv、NVIDIA blog 和 Hugging Face 模型卡覆盖。 |
Recommendation
Decision: merge
Why: BroRL 是 ProRL 的直接后续,新增 RLVR scaling 轴、理论分解和系统效率证据,应纳入当前 RLVR boundary / training systems 专题。