recurring author
Ru Zhang
2 archived notes
Related Notes
按论文归档时间排序,展示该作者在本站已经出现的材料。
归档 更新
DAPO: An Open Source LLM Reinforcement Learning System at Scale
在 Qwen2.5 32B 与 AIME 2024 设置中,用解耦裁剪、动态采样、token 级损失和超长奖励整形将朴素 GRPO 的 avg@32 从 30 提高到 50,并开源代码、数据与模型。
归档 更新
HybridFlow: A Flexible and Efficient RLHF Framework
用跨模型 single controller 与模型内 multi controller 统一编排 RLHF dataflow 和并行执行。