tracked author Ximing Lu ProRL/BroRL recurring author; homepage lists NVIDIA ProRL work and links the GXiming X identity. 2 archived notes X: high HomepageX Related Notes 按论文归档时间排序,展示该作者在本站已经出现的材料。 归档 Apr 08, 2026 更新 Apr 08, 2026 BroRL: Scaling Reinforcement Learning via Broadened Exploration 把 RLVR scaling 轴扩展到 rollout width,并用 correct mass decomposition 解释宽采样收益。 待审阅 2510.01180-brorl-broadened-rl-exploration Rollout OptimizationReasoning RLRL Algorithm 归档 Mar 10, 2026 更新 Mar 10, 2026 ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models 用高温探索、动态采样、周期 reference / optimizer reset 延长 RL,测试 reasoning boundary 扩展。 待审阅 2505.24864-prorl-prolonged-rl-reasoning-boundaries Reasoning RLRL AlgorithmRollout Optimization
归档 Apr 08, 2026 更新 Apr 08, 2026 BroRL: Scaling Reinforcement Learning via Broadened Exploration 把 RLVR scaling 轴扩展到 rollout width,并用 correct mass decomposition 解释宽采样收益。 待审阅 2510.01180-brorl-broadened-rl-exploration Rollout OptimizationReasoning RLRL Algorithm
归档 Mar 10, 2026 更新 Mar 10, 2026 ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models 用高温探索、动态采样、周期 reference / optimizer reset 延长 RL,测试 reasoning boundary 扩展。 待审阅 2505.24864-prorl-prolonged-rl-reasoning-boundaries Reasoning RLRL AlgorithmRollout Optimization