2509.25123-rl-compositional-skill-acquisition

From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones

这篇论文给 RLVR 争论提供了一个可控的正向证据:当模型已经通过预训练或 SFT 掌握 atomic skills,且 RL 训练目标明确奖励组合这些 atomic skills 时,RL 可以训练模型形成可泛化的 compositional skill,把见过的浅层模式迁移到更深嵌套、未见函数组合和跨任务组合场景;同样 Level-2 数据上的 RFT 和只训练 atomic tasks 的 RL 都没有得到类似泛化。

Authors Lifan Yuan (袁立凡), Weize Chen, Yuchen Zhang, Ganqu Cui, Hanbin Wang, Ziming You, Ning Ding (丁宁), Zhiyuan Liu, Maosong Sun, Hao Peng

已审阅 Archived 2026-03-20 17:10 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Lifan Yuan: University of Illinois Urbana-Champaign.
  • Weize Chen: Tsinghua University.
  • Yuchen Zhang: Shanghai AI Laboratory and Peking University。
  • Ganqu Cui: Shanghai AI Laboratory.
  • Hanbin Wang: Peking University。
  • Ziming You: Peking University。
  • Ning Ding: Tsinghua University and Shanghai AI Laboratory.
  • Zhiyuan Liu: Tsinghua University.
  • Maosong Sun: Tsinghua University。
  • Hao Peng: University of Illinois Urbana-Champaign。

阅读目标与判断边界

本笔记关注:

  1. 作者如何定义 atomic skill、compositional skill 和 new skill。
  2. 两阶段训练协议如何隔离 atomic skill acquisition 与 compositional skill acquisition。
  3. RL、RFT、Level-1-only RL、Level-2 RL、Level-1+2 RL 的差异证据。
  4. 论文如何回应 2504.138372506.10947 对 RLVR gain 来源的质疑。
  5. 这篇论文对“base model 负责 atomic skill,RL 负责 compositional meta-skill”的资源分配视角有什么启发。

判断边界:

  • 本文最强证据来自 synthetic string transformation task。该设置清晰隔离技能和难度,但真实数学、代码、科学推理中的 skill 边界更模糊。
  • 实验主体是 Llama-3.1-8B-Instruct 与作者构造的 RFT/RL pipeline;更大模型、其他模型家族、不同 RL 算法和真实任务需要后续复验。
  • Stage 1 通过 RFT 提供 atomic skills;论文证明的是 RL 在已有 atomic skills 上学习 composition 的充分条件,没有证明 RL 可以高效从零学习 atomic skills。
  • RFT baseline 是 offline iterative RFT,RL 是 online outcome-reward training。两者差异既包含 objective 差异,也包含在线采样、过滤和更新方式差异。
  • 论文的 “new skill” 指可观察的新组合策略和 failure mode 变化;它是行为和泛化意义上的技能定义,不等同于对模型内部表示机制的直接证明。

论文脉络

1. 问题背景

过去几篇 RLVR 论文围绕一个问题展开:RL 后训练到底是在教 LLM 新能力,还是把 base model 已有低概率轨迹变成高概率输出?2504.13837 用 pass@kk 显示许多 RLVR 模型在小 kk 上提升明显,但大 kk 下 base model 常常追上甚至超过 RL model;2506.10947 进一步说明一些分数提升可能来自 model prior、format behavior 和 GRPO clipping bias。

本篇作者认为,已有争论经常混在真实 benchmark 上做总体指标比较,很难知道某项能力是否真的被学到。原因有三点:真实任务里 skill 不好定义;数据污染和 base prior 很难控制;聚合 pass@kk 容易把容易题、困难题和不同 skill bottleneck 混在一起。为了解决这个问题,作者构造 synthetic string transformation testbed。

2. 核心假设

作者提出 RL Compositionality Hypothesis:当模型已经掌握任务所需的 atomic, non-decomposable skills 后,带有合适激励的 RL 可以让模型通过组合这些 atomic skills 学到更复杂的新能力。

这里的 atomic skill 是单个字符串变换函数的行为,例如 f(x)f(x);compositional skill 是把多个函数按嵌套结构应用,例如:

h(x)=g(f(x)). h(x)=g(f(x)).

任务难度由嵌套深度定义。Level nn 表示需要组合 nn 个 atomic functions。Level 1 是单函数,Level 2 是二层组合,Level 3 及以上是更深组合。

3. Synthetic testbed

作者构造 25 个 deterministic string transformation functions,覆盖 character manipulation、reordering、filtering、structural modifications 等模式。为了降低函数名泄漏和数据污染,所有函数都替换成无语义标识,例如 func_16。训练和评估时,模型只看到函数名和输入字符串,需要输出最终变换结果。

这个 testbed 有三个用途:

  • skill boundary 清楚:每个函数是 atomic skill,函数嵌套是 composition。
  • 难度可控:Level 由嵌套深度决定。
  • held-out generalization 可控:Stage 2 把函数分成 train set 和 held-out set,模型只在一组函数组合上训练,在另一组函数组合上评估。

4. 两阶段训练协议

Stage 1 用 RFT 学 atomic skills。作者生成 50k Level-1 problems,每个问题从 Llama-3.1-8B-Instruct 采样 10 个 responses,过滤掉 base model 已经 100% 正确的问题,然后收集正确 responses。RFT 前删除函数定义,只保留函数 identifier 和 input,使模型只能把函数行为内化到参数中。最终得到约 116k training instances,训练 2 epochs,learning rate 为 2×1052\times 10^{-5},global batch size 为 128。

Stage 2 学 composition,函数定义始终隐藏。训练数据可以是 Level 1 only、Level 2 only 或 Level 1+2 mixed。Level 1 only 和 Level 2 only 各 50k problems;mixed 设置为 25k Level 1 加 25k Level 2。

Stage 2 比较两种方法:

  • RL:使用 DAPO 作为优化算法,每个 prompt 生成 16 rollouts,temperature 1.0,max response length 8192;过滤掉所有 rollouts 全对或全错的问题;learning rate 为 1×1061\times 10^{-6};KL divergence 和 entropy loss 系数都设为 0。
  • RFT:使用 iterative RFT,让上一轮模型生成 rollouts,过滤正确样本形成新的 SFT 数据,再训练下一轮。

评估集包含 string task 中每个 Level 1-8 各 256 个问题;Countdown 任务每个 level 128 个问题。评估采样 temperature 1.0,max response length 8192。

5. 结果链条

第一,RL 需要 compositional incentive。只在 Level 1 atomic tasks 上做 RL,可以让 Level 1 accuracy 最高达到约 90%,但 Level 2 低于 25%,Level 3-6 接近 0。加入 Level 2 composition 后,RL Level 2 和 RL Level 1+2 都能泛化到更深组合:Level 3 从约 5% 提升到约 30%,Level 4 从约 1% 提升到约 15%,Level 5 也继续出现提升。

第二,同样的 Level-2 数据下,RFT 泛化明显弱于 RL。iterative RFT 在 Level 3 上从未超过 2.6%,在 held-out Level-2 problems 上也只有约 15%;RL Level 2 在 Level 2 达到约 64%,在 Level 3 达到约 27%。这说明只看见正确组合轨迹不足以形成同样的泛化能力,online RL outcome reward 和 compositional training signal 起到了关键作用。

第三,composition 可以跨任务迁移,但 target task 的 atomic skills 是前提。作者用 Countdown 做迁移:所有模型在 Stage 2 都只做 string task RL,没有做 Countdown RL。结果显示,只有 string composition skill、没有 Countdown atomic skills 的 String-Base + RL L1+2 在 Countdown 上失败;拥有 string 和 Countdown atomic skills 的 Multi-Base 在 Countdown Level 3 约 17%;Multi-Base + string atomic RL L1 约 20%;Multi-Base + string compositional RL L1+2 达到约 35%,并在 Level 4 达到约 6%。这说明 string task 学到的 composition 更像 meta-skill,可以帮助组合 target task 已有 atomic skills。

第四,pass@kk 需要按难度分解。Level 1-2 这类 base/RFT model 已经有较高 pass@kk 的问题上,RL 和 base 的 gap 会随 kk 增大而收缩,符合 reranking 叙事;Level 3-8 上,RL Level 1+2 和 RFT base 的 gap 随 kk 增大而扩大。例如 Level 5 上,gap 从 pass@1 的约 4% 增长到 pass@1024 的约 25%。作者把聚合指标误读称为 reranking illusion。

第五,failure mode 发生改变。Gemini-2.5-Pro 对 Level 3 responses 做分类:RFT Base、RFT Level 2、RL Level 1 的错误主要是 ignoring composition(均超过 50%)和 incorrect composition(均超过 35%)。RL Level 2 消除了 ignoring composition 类错误,正确率达到 28.1%,剩余主要错误转向 atomic error(约 55%)。这说明 RL 改变了模型处理组合结构的方式。

关键实验/定理

结果 1:Level-2 compositional RL 带来 easy-to-hard 泛化

  • 设置:从同一个 Stage-1 RFT base 出发,比较 RL Level 1、RL Level 2、RL Level 1+2,并在 held-out functions 的 Level 1-6 上评估。
  • 指标:held-out test accuracy。
  • 结果:RL Level 1 只提升 atomic skill,Level 3-6 接近 0;RL Level 2 / Level 1+2 让 Level 3 达到约 30%,Level 4 达到约 15%,Level 5 继续出现非零泛化。
  • 解读:RL 训练目标必须显式奖励 composition,模型才会学到可迁移到更深组合的策略。

结果 2:RFT 使用同样 Level-2 数据也难以得到相同泛化

  • 设置:同一个 Stage-1 base,同样 Level-2 compositional problems,一边用 DAPO/RL,一边用 iterative RFT。
  • 指标:Level 2-6 held-out accuracy。
  • 结果:RFT 在 Level 3 从未超过 2.6%,Level 2 也只有约 15%;RL Level 2 达到 Level 2 约 64%、Level 3 约 27%。
  • 解读:看到 correct reasoning trajectories 还不够。online RL 的采样、binary outcome reward、group-based updates 和 composition incentive 共同推动了泛化。

结果 3:跨任务迁移依赖 target atomic skills

  • 设置:用 string task 做 Stage 2 RL,不在 Countdown 上做 RL;比较是否拥有 Countdown atomic RFT、是否接受 string compositional RL。
  • 指标:Countdown Level 3-5 Avg@32。
  • 结果:Multi-Base + RL L1+2 在 Countdown Level 3 约 35%,超过 Multi-Base 的约 17% 和 Multi-Base + RL L1 的约 20%;没有 Countdown atomic skills 的 String-Base + RL L1+2 基本失败。
  • 解读:composition skill 可以跨任务迁移,但 target domain 需要先具备可被组合的 atomic skills。

结果 4:pass@kk 分层后呈现 reranking illusion

  • 设置:比较 RFT base、RL Level 1、RL Level 1+2 在 Level 1-8 的 pass@kk,主要报告到 pass@1000 / pass@1024。
  • 指标:按难度分层的 pass@kk
  • 结果:Level 1-2 上 gap 随 kk 增大收缩;Level 3-8 上 RL Level 1+2 相对 RFT base 的 gap 扩大。Level 5 gap 从 pass@1 约 4% 增至 pass@1024 约 25%。
  • 解读:在 base model 已经高 pass@kk 的任务上,RL 看起来像 reranking;在 base model 缺少组合策略的任务上,合适 RL 会扩大 performance limit。

结果 5:failure mode 从组合错误转向 atomic execution error

  • 设置:用 Gemini-2.5-Pro 分类 Level 3 string responses 的错误类型。
  • 指标:Correct、Ignores Composition、Incomplete Trace、Incorrect Composition、Atomic Error。
  • 结果:RFT Base、RFT Level 2、RL Level 1 的错误以 ignoring composition 和 incorrect composition 为主;RL Level 2 的 ignoring composition 为 0,正确率 28.1%,剩余错误主要是 atomic error。
  • 解读:RL Level 2 的收益超出单纯输出分布重加权,表现为模型解析和执行组合结构的行为模式发生改变。

证据链强度评估

强证据

  • synthetic testbed 把 atomic skill、composition depth、held-out functions 和 difficulty levels 分开,使因果解释比真实 benchmark 更清晰。
  • RL Level 1、RL Level 2、RL Level 1+2、RFT Level 2 的对照直接支撑“composition incentive + RL objective”这一机制判断。
  • Countdown transfer 实验验证了 composition skill 的跨任务迁移条件:需要 target atomic skills。
  • pass@kk 按 difficulty levels 展开,直接回应了 2504.13837 的采样效率观点。
  • behavior analysis 把“新技能”的证据从准确率变化推进到错误类型分布变化。

中等强度证据

  • 论文选择 Llama-3.1-8B-Instruct 作为 cleaner testbed,这有助于降低 contamination,但也限制了模型家族外推。
  • RFT baseline 很有价值,但它和 RL 的差异包含 online/offline、数据过滤、采样分布和 objective 等多个变量。
  • 官方仓库提供复现实验脚本、数据与模型集合,增强可复验性;具体 checkpoint、verl 版本和运行设置仍需复现时记录。

需要谨慎的推论

  • synthetic composition 的清晰性是优点,也是外部有效性的边界。真实数学和代码任务中的 atomic skills 更难枚举。
  • “RL 学到新技能”在本文中指行为层面的泛化和 failure mode 改变;内部表征是否形成可解释的新模块,需要额外 mechanistic evidence。
  • Stage 1 RFT 是前提。论文没有证明 RL 可以高效发现完全缺失的 atomic skills。
  • RL 的收益可能依赖 DAPO/GRPO recipe、rollout temperature、过滤全对/全错 prompt、response length 和 function split。
  • Countdown transfer 说明了跨任务 meta-skill 可能存在,但只覆盖一个 target task,需要在代码、数学、科学 reasoning 上继续复验。

OpenReview / 审稿意见吸收

  • Venue status: 当前档案未记录公开 peer-review 状态。
  • Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
  • Ratings / confidence: 无公开评分可用于校准。
  • Reviewer consensus: 暂无。
  • Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
  • Author response: 暂无公开 rebuttal 记录。
  • 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。

本地讨论补充

1. 初读后的分析收敛

  • 这篇论文是 2504.138372505.24864 之间的一块机制拼图。它给出一个更精确条件:base / SFT 先提供 atomic skills,RL 再通过合适 reward 训练 composition。
  • 它把 “RL 是否只是 reranking” 这个问题改写成 “评测任务里是否存在 base model 尚未掌握、但可由已有 atomic skills 组合得到的 bottleneck skill”。如果有,且 RL 训练显式奖励这个 bottleneck,pass@kk gap 可能随难度增大而扩大。
  • 它也回应了 2506.10947 的担忧:单纯 benchmark gain 可能来自 prior amplification;本篇通过 held-out function split、anonymous names、Level 分层和 RFT/RL 对照,试图把 prior amplification 与 composition learning 区分开。

2. 修正后的理解

对 RLVR gain 来源的判断可以拆成三层:

  1. sampling efficiency:把 base 已有正确轨迹从低概率推到高概率。
  2. prior amplification / artifact exploitation:强化模型家族已有格式、代码、prompt 或 spurious behavior。
  3. compositional skill acquisition:在已有 atomic skills 上学会新的组合策略,并能迁移到更深组合或新任务。

本文主张第三层在特定条件下成立。关键条件包括:atomic skills 已经存在;训练任务显式包含 composition;reward 能稳定区分组合是否成功;评估按 skill bottleneck 和难度分层。

更简短地说,本篇的核心要义是 RL 可以提高模型的组合泛化能力:模型先见过 f(x)f(x)g(x)g(x) 等浅层模式,再通过 RL 学会迁移到 f(g(x))f(g(x))h(g(f(x)))h(g(f(x))) 等嵌套结构。SFT/RFT 即使看到正确轨迹,也更容易拟合训练样本里的组合形式,在 held-out functions、更深 nesting levels 和 Countdown 迁移上明显弱于 RL。

3. 后续复验指标

  • 在真实 math/code tasks 中构造可标注的 atomic skill / compositional skill 分解。
  • 同时报 pass@1、pass@kk、difficulty-conditioned pass@kk、held-out composition accuracy 和 behavior taxonomy。
  • 加入 random / format / incorrect reward baseline,检查 composition gain 是否依赖真实 correctness signal。
  • 在非 Llama 模型、Qwen general model、Qwen-Math、DeepSeek-R1-Distill、MoE 模型上复验。
  • 对比 DAPO、GRPO、PPO、REINFORCE++、RLOO,并固定 rollout count、temperature、filtering 和 response length。
  • 检查 composition skill 是否能迁移到 code function composition、multi-hop math、tool-use plan composition 和 scientific reasoning。

主要启发

  • RL 后训练的一个合理分工是:pretraining / SFT 提供广泛 atomic skills,RL 提供对组合、搜索和策略选择的激励。
  • 讨论 RL 是否扩展能力边界时,应避免只看整体 pass@kk。需要按难度、skill bottleneck 和 base pass@kk 分层。
  • RFT 与 RL 的差别在 compositional setting 中可能很大。正确轨迹监督可以学习表面样本,online outcome reward 更可能把模型推向能在新组合上复用的策略。
  • “跨任务 RL 泛化”需要 target task atomic skills。缺少 atomic skills 时,source task 学到的 composition meta-skill无法落地。
  • 这篇论文给 ProRL / DAPO 类方法提供了机制解释:持续 RL 的收益可能来自某类可组合技能被显式激励,以及这种激励在更长训练中持续塑造策略分布。

局限

  1. synthetic string transformation 和真实 reasoning domain 的结构差异明显,外推到数学、代码和科学任务需要额外证据。
  2. 模型规模和家族单一,主体实验集中在 Llama-3.1-8B-Instruct。
  3. Stage 1 RFT 人为提供 atomic skills,降低了问题难度;真实 base model 的 atomic skill 覆盖范围更难测量。
  4. RFT baseline 与 RL 在在线采样、过滤和优化轨迹上不同,不能把所有差异都归因给 reward objective。
  5. failure mode 分类使用 Gemini-2.5-Pro,需要人工抽样或多 judge 复核来估计分类噪声。
  6. 论文主要证明 composition skill 的行为效果,没有直接解释参数或表示层面的机制。

跨论文关系

  • 2504.13837 的关系最核心。2504.13837 显示许多 RLVR 模型在高 pass@kk 下像 sampling efficiency 提升;本篇指出这种观察可能来自任务已有高 base pass@kk 或 RL 训练未激励新 skill。按 difficulty 和 compositional bottleneck 分层后,hard levels 上 gap 会扩大。
  • 2505.24864 互补。ProRL 从多任务 prolonged RL 角度论证 boundary expansion;本篇从 synthetic compositional mechanism 角度解释什么样的 skill 可能被 RL 学到。
  • 2506.10947 形成方法论张力。Spurious Rewards 提醒 random / format / incorrect reward 可以放大 prior;本篇用匿名函数、held-out composition、RFT/RL 对照和 behavior analysis 降低该 confound。后续复验应给本篇 setup 加 spurious reward baselines。
  • 2503.14476 方法关系直接。本文 Stage 2 RL 使用 DAPO,训练也采用过滤全对/全错 prompt 的有效梯度思路,并基于 verl 生态发布代码。
  • 2501.12948 共享 outcome reward 激发 reasoning 的主线。本篇提供更小、更可控的 testbed 来解释 R1-style RL 中可能发生的 atomic-to-compositional transition。
  • 2605.30290 都关注 feedback 如何推动 self-improvement。STV 研究 verifier feedback 和自训练,本文研究 correctness reward 如何把已有 atomic skills 组合成新策略。
  • 2606.00135 的连接在 multi-step composition。tool-use agent 的核心难点常常是把已有工具能力组合成计划,本文的 synthetic composition 可以看作 tool-plan composition 的简化版本。
  • 2605.14220TML-2025-09-10 的关系在复现可靠性上。本文依赖 long responses、temperature 1.0、16 rollouts 和 pass@kk,rollout backend、sampler determinism 和 trainer-rollout consistency 都会影响复验。

Reference Intake Brief

Target

  • Intended target system: 论文阅读归档、RLVR reasoning boundary 专题、post-training skill acquisition 主题索引。
  • Existing related assets: papers-index.md2504.138372505.248642506.109472503.14476
  • Proposed form: 新建独立 Markdown 文档,更新索引行,并维护对应论文的关系章节。

Reusable Elements

  1. atomic skill -> compositional RL -> held-out deeper composition 可作为评估 RL 是否学到新技能的最小实验范式。
  2. difficulty-conditioned pass@kk 可以避免聚合指标造成的 reranking illusion。
  3. target-task atomic skill prerequisite 可以作为跨任务 RL 泛化的诊断条件。
  4. behavior taxonomy 可以补充 accuracy,观察模型是否真的解析组合结构。

Risks

  • synthetic task 结论不能直接替代真实 benchmark 结论。
  • 如果后续只引用“RL learns new skills”这个结论,容易忽略 atomic skill prerequisite 和 compositional incentive 两个前提。
  • 官方仓库包含复现实验脚本和数据生成器,使用时应记录版本、checkpoint、数据 split 和 verl 配置。