tracked author Mingxuan Wang DAPO通讯作者与 VAPO 合作者。论文作者块与 OpenReview 身份资料共同确认其 ByteDance Seed 和 SIA-Lab 关系。 1 archived notes Related Notes 按论文归档时间排序,展示该作者在本站已经出现的材料。 归档 Mar 03, 2026 更新 Aug 04, 2026 DAPO: An Open Source LLM Reinforcement Learning System at Scale 在 Qwen2.5 32B 与 AIME 2024 设置中,用解耦裁剪、动态采样、token 级损失和超长奖励整形将朴素 GRPO 的 avg@32 从 30 提高到 50,并开源代码、数据与模型。 待审阅 2503.14476-dapo-long-cot-rl-system RL AlgorithmReasoning RLRL Infrastructure
归档 Mar 03, 2026 更新 Aug 04, 2026 DAPO: An Open Source LLM Reinforcement Learning System at Scale 在 Qwen2.5 32B 与 AIME 2024 设置中,用解耦裁剪、动态采样、token 级损失和超长奖励整形将朴素 GRPO 的 avg@32 从 30 提高到 50,并开源代码、数据与模型。 待审阅 2503.14476-dapo-long-cot-rl-system RL AlgorithmReasoning RLRL Infrastructure