2509.25123-rl-compositional-skill-acquisition
From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones
这篇论文给 RLVR 争论提供了一个可控的正向证据:当模型已经通过预训练或 SFT 掌握 atomic skills,且 RL 训练目标明确奖励组合这些 atomic skills 时,RL 可以训练模型形成可泛化的 compositional skill,把见过的浅层模式迁移到更深嵌套、未见函数组合和跨任务组合场景;同样 Level-2 数据上的 RFT 和只训练 atomic tasks 的 RL 都没有得到类似泛化。
Source
- Title: From
and to : LLMs Learn New Skills in RL by Composing Old Ones - arXiv: https://arxiv.org/abs/2509.25123
- HTML v3: https://arxiv.org/html/2509.25123v3
- PDF v3: https://arxiv.org/pdf/2509.25123v3
- TeX Source v3: https://arxiv.org/e-print/2509.25123v3
- Code/Project: https://github.com/PRIME-RL/RL-Compositionality
- Hugging Face collection: https://huggingface.co/collections/weizechen/rl-compositionality-68f2391946d9a68ae279aceb
- Authors: Lifan Yuan, Weize Chen, Yuchen Zhang, Ganqu Cui, Hanbin Wang, Ziming You, Ning Ding, Zhiyuan Liu, Maosong Sun, Hao Peng
- Submitted: 2025-09-29
- Current version read: v3, last revised 2025-12-19
- Subjects: Artificial Intelligence (
cs.AI); Computation and Language (cs.CL)
作者与关系
- Lifan Yuan: University of Illinois Urbana-Champaign.
- Weize Chen: Tsinghua University.
- Yuchen Zhang: Shanghai AI Laboratory and Peking University。
- Ganqu Cui: Shanghai AI Laboratory.
- Hanbin Wang: Peking University。
- Ziming You: Peking University。
- Ning Ding: Tsinghua University and Shanghai AI Laboratory.
- Zhiyuan Liu: Tsinghua University.
- Maosong Sun: Tsinghua University。
- Hao Peng: University of Illinois Urbana-Champaign。
阅读目标与判断边界
本笔记关注:
- 作者如何定义 atomic skill、compositional skill 和 new skill。
- 两阶段训练协议如何隔离 atomic skill acquisition 与 compositional skill acquisition。
- RL、RFT、Level-1-only RL、Level-2 RL、Level-1+2 RL 的差异证据。
- 论文如何回应 2504.13837 与 2506.10947 对 RLVR gain 来源的质疑。
- 这篇论文对“base model 负责 atomic skill,RL 负责 compositional meta-skill”的资源分配视角有什么启发。
判断边界:
- 本文最强证据来自 synthetic string transformation task。该设置清晰隔离技能和难度,但真实数学、代码、科学推理中的 skill 边界更模糊。
- 实验主体是 Llama-3.1-8B-Instruct 与作者构造的 RFT/RL pipeline;更大模型、其他模型家族、不同 RL 算法和真实任务需要后续复验。
- Stage 1 通过 RFT 提供 atomic skills;论文证明的是 RL 在已有 atomic skills 上学习 composition 的充分条件,没有证明 RL 可以高效从零学习 atomic skills。
- RFT baseline 是 offline iterative RFT,RL 是 online outcome-reward training。两者差异既包含 objective 差异,也包含在线采样、过滤和更新方式差异。
- 论文的 “new skill” 指可观察的新组合策略和 failure mode 变化;它是行为和泛化意义上的技能定义,不等同于对模型内部表示机制的直接证明。
论文脉络
1. 问题背景
过去几篇 RLVR 论文围绕一个问题展开:RL 后训练到底是在教 LLM 新能力,还是把 base model 已有低概率轨迹变成高概率输出?2504.13837 用 pass@
本篇作者认为,已有争论经常混在真实 benchmark 上做总体指标比较,很难知道某项能力是否真的被学到。原因有三点:真实任务里 skill 不好定义;数据污染和 base prior 很难控制;聚合 pass@
2. 核心假设
作者提出 RL Compositionality Hypothesis:当模型已经掌握任务所需的 atomic, non-decomposable skills 后,带有合适激励的 RL 可以让模型通过组合这些 atomic skills 学到更复杂的新能力。
这里的 atomic skill 是单个字符串变换函数的行为,例如
任务难度由嵌套深度定义。Level
3. Synthetic testbed
作者构造 25 个 deterministic string transformation functions,覆盖 character manipulation、reordering、filtering、structural modifications 等模式。为了降低函数名泄漏和数据污染,所有函数都替换成无语义标识,例如 func_16。训练和评估时,模型只看到函数名和输入字符串,需要输出最终变换结果。
这个 testbed 有三个用途:
- skill boundary 清楚:每个函数是 atomic skill,函数嵌套是 composition。
- 难度可控:Level 由嵌套深度决定。
- held-out generalization 可控:Stage 2 把函数分成 train set 和 held-out set,模型只在一组函数组合上训练,在另一组函数组合上评估。
4. 两阶段训练协议
Stage 1 用 RFT 学 atomic skills。作者生成 50k Level-1 problems,每个问题从 Llama-3.1-8B-Instruct 采样 10 个 responses,过滤掉 base model 已经 100% 正确的问题,然后收集正确 responses。RFT 前删除函数定义,只保留函数 identifier 和 input,使模型只能把函数行为内化到参数中。最终得到约 116k training instances,训练 2 epochs,learning rate 为
Stage 2 学 composition,函数定义始终隐藏。训练数据可以是 Level 1 only、Level 2 only 或 Level 1+2 mixed。Level 1 only 和 Level 2 only 各 50k problems;mixed 设置为 25k Level 1 加 25k Level 2。
Stage 2 比较两种方法:
- RL:使用 DAPO 作为优化算法,每个 prompt 生成 16 rollouts,temperature 1.0,max response length 8192;过滤掉所有 rollouts 全对或全错的问题;learning rate 为
;KL divergence 和 entropy loss 系数都设为 0。 - RFT:使用 iterative RFT,让上一轮模型生成 rollouts,过滤正确样本形成新的 SFT 数据,再训练下一轮。
评估集包含 string task 中每个 Level 1-8 各 256 个问题;Countdown 任务每个 level 128 个问题。评估采样 temperature 1.0,max response length 8192。
5. 结果链条
第一,RL 需要 compositional incentive。只在 Level 1 atomic tasks 上做 RL,可以让 Level 1 accuracy 最高达到约 90%,但 Level 2 低于 25%,Level 3-6 接近 0。加入 Level 2 composition 后,RL Level 2 和 RL Level 1+2 都能泛化到更深组合:Level 3 从约 5% 提升到约 30%,Level 4 从约 1% 提升到约 15%,Level 5 也继续出现提升。
第二,同样的 Level-2 数据下,RFT 泛化明显弱于 RL。iterative RFT 在 Level 3 上从未超过 2.6%,在 held-out Level-2 problems 上也只有约 15%;RL Level 2 在 Level 2 达到约 64%,在 Level 3 达到约 27%。这说明只看见正确组合轨迹不足以形成同样的泛化能力,online RL outcome reward 和 compositional training signal 起到了关键作用。
第三,composition 可以跨任务迁移,但 target task 的 atomic skills 是前提。作者用 Countdown 做迁移:所有模型在 Stage 2 都只做 string task RL,没有做 Countdown RL。结果显示,只有 string composition skill、没有 Countdown atomic skills 的 String-Base + RL L1+2 在 Countdown 上失败;拥有 string 和 Countdown atomic skills 的 Multi-Base 在 Countdown Level 3 约 17%;Multi-Base + string atomic RL L1 约 20%;Multi-Base + string compositional RL L1+2 达到约 35%,并在 Level 4 达到约 6%。这说明 string task 学到的 composition 更像 meta-skill,可以帮助组合 target task 已有 atomic skills。
第四,pass@
第五,failure mode 发生改变。Gemini-2.5-Pro 对 Level 3 responses 做分类:RFT Base、RFT Level 2、RL Level 1 的错误主要是 ignoring composition(均超过 50%)和 incorrect composition(均超过 35%)。RL Level 2 消除了 ignoring composition 类错误,正确率达到 28.1%,剩余主要错误转向 atomic error(约 55%)。这说明 RL 改变了模型处理组合结构的方式。
关键实验/定理
结果 1:Level-2 compositional RL 带来 easy-to-hard 泛化
- 设置:从同一个 Stage-1 RFT base 出发,比较 RL Level 1、RL Level 2、RL Level 1+2,并在 held-out functions 的 Level 1-6 上评估。
- 指标:held-out test accuracy。
- 结果:RL Level 1 只提升 atomic skill,Level 3-6 接近 0;RL Level 2 / Level 1+2 让 Level 3 达到约 30%,Level 4 达到约 15%,Level 5 继续出现非零泛化。
- 解读:RL 训练目标必须显式奖励 composition,模型才会学到可迁移到更深组合的策略。
结果 2:RFT 使用同样 Level-2 数据也难以得到相同泛化
- 设置:同一个 Stage-1 base,同样 Level-2 compositional problems,一边用 DAPO/RL,一边用 iterative RFT。
- 指标:Level 2-6 held-out accuracy。
- 结果:RFT 在 Level 3 从未超过 2.6%,Level 2 也只有约 15%;RL Level 2 达到 Level 2 约 64%、Level 3 约 27%。
- 解读:看到 correct reasoning trajectories 还不够。online RL 的采样、binary outcome reward、group-based updates 和 composition incentive 共同推动了泛化。
结果 3:跨任务迁移依赖 target atomic skills
- 设置:用 string task 做 Stage 2 RL,不在 Countdown 上做 RL;比较是否拥有 Countdown atomic RFT、是否接受 string compositional RL。
- 指标:Countdown Level 3-5 Avg@32。
- 结果:Multi-Base + RL L1+2 在 Countdown Level 3 约 35%,超过 Multi-Base 的约 17% 和 Multi-Base + RL L1 的约 20%;没有 Countdown atomic skills 的 String-Base + RL L1+2 基本失败。
- 解读:composition skill 可以跨任务迁移,但 target domain 需要先具备可被组合的 atomic skills。
结果 4:pass@ 分层后呈现 reranking illusion
- 设置:比较 RFT base、RL Level 1、RL Level 1+2 在 Level 1-8 的 pass@
,主要报告到 pass@1000 / pass@1024。 - 指标:按难度分层的 pass@
。 - 结果:Level 1-2 上 gap 随
增大收缩;Level 3-8 上 RL Level 1+2 相对 RFT base 的 gap 扩大。Level 5 gap 从 pass@1 约 4% 增至 pass@1024 约 25%。 - 解读:在 base model 已经高 pass@
的任务上,RL 看起来像 reranking;在 base model 缺少组合策略的任务上,合适 RL 会扩大 performance limit。
结果 5:failure mode 从组合错误转向 atomic execution error
- 设置:用 Gemini-2.5-Pro 分类 Level 3 string responses 的错误类型。
- 指标:Correct、Ignores Composition、Incomplete Trace、Incorrect Composition、Atomic Error。
- 结果:RFT Base、RFT Level 2、RL Level 1 的错误以 ignoring composition 和 incorrect composition 为主;RL Level 2 的 ignoring composition 为 0,正确率 28.1%,剩余错误主要是 atomic error。
- 解读:RL Level 2 的收益超出单纯输出分布重加权,表现为模型解析和执行组合结构的行为模式发生改变。
证据链强度评估
强证据
- synthetic testbed 把 atomic skill、composition depth、held-out functions 和 difficulty levels 分开,使因果解释比真实 benchmark 更清晰。
- RL Level 1、RL Level 2、RL Level 1+2、RFT Level 2 的对照直接支撑“composition incentive + RL objective”这一机制判断。
- Countdown transfer 实验验证了 composition skill 的跨任务迁移条件:需要 target atomic skills。
- pass@
按 difficulty levels 展开,直接回应了 2504.13837 的采样效率观点。 - behavior analysis 把“新技能”的证据从准确率变化推进到错误类型分布变化。
中等强度证据
- 论文选择 Llama-3.1-8B-Instruct 作为 cleaner testbed,这有助于降低 contamination,但也限制了模型家族外推。
- RFT baseline 很有价值,但它和 RL 的差异包含 online/offline、数据过滤、采样分布和 objective 等多个变量。
- 官方仓库提供复现实验脚本、数据与模型集合,增强可复验性;具体 checkpoint、verl 版本和运行设置仍需复现时记录。
需要谨慎的推论
- synthetic composition 的清晰性是优点,也是外部有效性的边界。真实数学和代码任务中的 atomic skills 更难枚举。
- “RL 学到新技能”在本文中指行为层面的泛化和 failure mode 改变;内部表征是否形成可解释的新模块,需要额外 mechanistic evidence。
- Stage 1 RFT 是前提。论文没有证明 RL 可以高效发现完全缺失的 atomic skills。
- RL 的收益可能依赖 DAPO/GRPO recipe、rollout temperature、过滤全对/全错 prompt、response length 和 function split。
- Countdown transfer 说明了跨任务 meta-skill 可能存在,但只覆盖一个 target task,需要在代码、数学、科学 reasoning 上继续复验。
OpenReview / 审稿意见吸收
- Venue status: 当前档案未记录公开 peer-review 状态。
- Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
- Ratings / confidence: 无公开评分可用于校准。
- Reviewer consensus: 暂无。
- Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
- Author response: 暂无公开 rebuttal 记录。
- 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。
本地讨论补充
1. 初读后的分析收敛
- 这篇论文是 2504.13837 和 2505.24864 之间的一块机制拼图。它给出一个更精确条件:base / SFT 先提供 atomic skills,RL 再通过合适 reward 训练 composition。
- 它把 “RL 是否只是 reranking” 这个问题改写成 “评测任务里是否存在 base model 尚未掌握、但可由已有 atomic skills 组合得到的 bottleneck skill”。如果有,且 RL 训练显式奖励这个 bottleneck,pass@
gap 可能随难度增大而扩大。 - 它也回应了 2506.10947 的担忧:单纯 benchmark gain 可能来自 prior amplification;本篇通过 held-out function split、anonymous names、Level 分层和 RFT/RL 对照,试图把 prior amplification 与 composition learning 区分开。
2. 修正后的理解
对 RLVR gain 来源的判断可以拆成三层:
- sampling efficiency:把 base 已有正确轨迹从低概率推到高概率。
- prior amplification / artifact exploitation:强化模型家族已有格式、代码、prompt 或 spurious behavior。
- compositional skill acquisition:在已有 atomic skills 上学会新的组合策略,并能迁移到更深组合或新任务。
本文主张第三层在特定条件下成立。关键条件包括:atomic skills 已经存在;训练任务显式包含 composition;reward 能稳定区分组合是否成功;评估按 skill bottleneck 和难度分层。
更简短地说,本篇的核心要义是 RL 可以提高模型的组合泛化能力:模型先见过
3. 后续复验指标
- 在真实 math/code tasks 中构造可标注的 atomic skill / compositional skill 分解。
- 同时报 pass@1、pass@
、difficulty-conditioned pass@ 、held-out composition accuracy 和 behavior taxonomy。 - 加入 random / format / incorrect reward baseline,检查 composition gain 是否依赖真实 correctness signal。
- 在非 Llama 模型、Qwen general model、Qwen-Math、DeepSeek-R1-Distill、MoE 模型上复验。
- 对比 DAPO、GRPO、PPO、REINFORCE++、RLOO,并固定 rollout count、temperature、filtering 和 response length。
- 检查 composition skill 是否能迁移到 code function composition、multi-hop math、tool-use plan composition 和 scientific reasoning。
主要启发
- RL 后训练的一个合理分工是:pretraining / SFT 提供广泛 atomic skills,RL 提供对组合、搜索和策略选择的激励。
- 讨论 RL 是否扩展能力边界时,应避免只看整体 pass@
。需要按难度、skill bottleneck 和 base pass@ 分层。 - RFT 与 RL 的差别在 compositional setting 中可能很大。正确轨迹监督可以学习表面样本,online outcome reward 更可能把模型推向能在新组合上复用的策略。
- “跨任务 RL 泛化”需要 target task atomic skills。缺少 atomic skills 时,source task 学到的 composition meta-skill无法落地。
- 这篇论文给 ProRL / DAPO 类方法提供了机制解释:持续 RL 的收益可能来自某类可组合技能被显式激励,以及这种激励在更长训练中持续塑造策略分布。
局限
- synthetic string transformation 和真实 reasoning domain 的结构差异明显,外推到数学、代码和科学任务需要额外证据。
- 模型规模和家族单一,主体实验集中在 Llama-3.1-8B-Instruct。
- Stage 1 RFT 人为提供 atomic skills,降低了问题难度;真实 base model 的 atomic skill 覆盖范围更难测量。
- RFT baseline 与 RL 在在线采样、过滤和优化轨迹上不同,不能把所有差异都归因给 reward objective。
- failure mode 分类使用 Gemini-2.5-Pro,需要人工抽样或多 judge 复核来估计分类噪声。
- 论文主要证明 composition skill 的行为效果,没有直接解释参数或表示层面的机制。
跨论文关系
- 与 2504.13837 的关系最核心。
2504.13837显示许多 RLVR 模型在高 pass@下像 sampling efficiency 提升;本篇指出这种观察可能来自任务已有高 base pass@ 或 RL 训练未激励新 skill。按 difficulty 和 compositional bottleneck 分层后,hard levels 上 gap 会扩大。 - 与 2505.24864 互补。ProRL 从多任务 prolonged RL 角度论证 boundary expansion;本篇从 synthetic compositional mechanism 角度解释什么样的 skill 可能被 RL 学到。
- 与 2506.10947 形成方法论张力。Spurious Rewards 提醒 random / format / incorrect reward 可以放大 prior;本篇用匿名函数、held-out composition、RFT/RL 对照和 behavior analysis 降低该 confound。后续复验应给本篇 setup 加 spurious reward baselines。
- 与 2503.14476 方法关系直接。本文 Stage 2 RL 使用 DAPO,训练也采用过滤全对/全错 prompt 的有效梯度思路,并基于
verl生态发布代码。 - 与 2501.12948 共享 outcome reward 激发 reasoning 的主线。本篇提供更小、更可控的 testbed 来解释 R1-style RL 中可能发生的 atomic-to-compositional transition。
- 与 2605.30290 都关注 feedback 如何推动 self-improvement。STV 研究 verifier feedback 和自训练,本文研究 correctness reward 如何把已有 atomic skills 组合成新策略。
- 与 2606.00135 的连接在 multi-step composition。tool-use agent 的核心难点常常是把已有工具能力组合成计划,本文的 synthetic composition 可以看作 tool-plan composition 的简化版本。
- 与 2605.14220 和 TML-2025-09-10 的关系在复现可靠性上。本文依赖 long responses、temperature 1.0、16 rollouts 和 pass@
,rollout backend、sampler determinism 和 trainer-rollout consistency 都会影响复验。
Reference Intake Brief
Target
- Intended target system: 论文阅读归档、RLVR reasoning boundary 专题、post-training skill acquisition 主题索引。
- Existing related assets: papers-index.md;2504.13837;2505.24864;2506.10947;2503.14476。
- Proposed form: 新建独立 Markdown 文档,更新索引行,并维护对应论文的关系章节。
Reusable Elements
atomic skill -> compositional RL -> held-out deeper composition可作为评估 RL 是否学到新技能的最小实验范式。- difficulty-conditioned pass@
可以避免聚合指标造成的 reranking illusion。 - target-task atomic skill prerequisite 可以作为跨任务 RL 泛化的诊断条件。
- behavior taxonomy 可以补充 accuracy,观察模型是否真的解析组合结构。
Risks
- synthetic task 结论不能直接替代真实 benchmark 结论。
- 如果后续只引用“RL learns new skills”这个结论,容易忽略 atomic skill prerequisite 和 compositional incentive 两个前提。
- 官方仓库包含复现实验脚本和数据生成器,使用时应记录版本、checkpoint、数据 split 和
verl配置。