2607.05378-compactionrl-context-compaction-agent-rl

CompactionRL: Reinforcement Learning with Context Compaction for Long Horizon Agents

CompactionRL 在固定峰值上下文下让同一策略生成执行动作与摘要,并用独立 critic、全批次 token 归一化和按后续 token 数折扣的跨段优势训练压缩轨迹;30B 与 106B 模型在启用压缩的 SWE-bench Verified 子集和 Terminal-Bench 2.0 上均较各自基座提高 Pass@1,但收益依赖测试时压缩,且缺少与 SUPO 的直接对照、总计算报告和独立训练复验。

Authors Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang (唐杰), Yuxiao Dong

已审阅 Archived 2026-07-13 13:51 Updated 2026-08-04 11:24 Reviewed 2026-07-22 11:23 Source

Source

  • Workflow version: v2.1
  • Material type: research-paper
  • Analysis modules: experiment, system, theory
  • Canonical source: https://arxiv.org/abs/2607.05378
  • Title: CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents
  • Authors: Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang, Yuxiao Dong
  • Responsible organization: Tsinghua University;Yujiang Li、Zhenyu Hou 与 Yi Jing 在 Z.AI 实习期间完成该工作
  • arXiv: https://arxiv.org/abs/2607.05378
  • PDF: https://arxiv.org/pdf/2607.05378v1
  • HTML: https://arxiv.org/html/2607.05378v1
  • TeX Source: https://arxiv.org/src/2607.05378v1
  • Code/Project: 未发现作者公开实现;THUDM/slime issue #2212 询问 SAO 与 CompactionRL 的开源计划,截至复核时间尚无维护者答复
  • OpenReview / Review page: 未发现与完整标题、作者和 arXiv id 可可靠匹配的公开评审页
  • Submitted: 2026-07-06 17:55:12 UTC
  • Published / updated: 2026-07-06(arXiv v1)
  • Current version read: arXiv v1;HTML;TeX source
  • Version / revision read: arXiv:2607.05378v1
  • Accessed: 2026-08-04
  • Key figure decision: include
  • Key figure rationale: Figure 2 同时展示压缩触发、上下文重建、执行与摘要分段、共享终局奖励和跨段优势修正,能够覆盖方法的完整训练链
  • Review status: page-type=not-found; match-confidence=high; observed-at=2026-08-04; venue-status=arXiv preprint
  • Subjects: cs.LG

作者与关系

Yujiang Li 与 Zhenyu Hou 为共同贡献作者。Yujiang Li、Zhenyu Hou 与 Yi Jing 在 Z.AI 实习期间完成该工作,五位作者均以清华大学署名。Yuxiao Dong 的公开主页将 Yujiang Li 和 Zhenyu Hou 列为博士生;Zhenyu Hou 的个人主页同时确认 Yuxiao Dong 与 Jie Tang 为导师;Yi Jing 的个人主页确认其为清华大学新雅书院与计算机系本科生,并曾在 THUKEG 与 PKUICL 实习。

本论文与 SAO 共享 Yujiang Li、Zhenyu Hou、Jie Tang、Yuxiao Dong 四位作者。两篇论文均采用独立 critic,并声明相关方法进入 GLM-5.2 的智能体强化学习训练流程。CompactionRL 处理上下文压缩产生的变长分段和跨段信用分配;SAO 处理异步单 rollout、策略滞后与跳过 observation 的 GAE。两项工作构成清华 KEG 与 Z.AI 同一训练体系中的连续方法节点。

论文脉络

1. 研究问题、背景和价值

长程 coding agent 会反复读取仓库、修改文件、执行测试并处理错误。完整历史持续追加后,工具输出、失败命令和中间推理会占满上下文窗口。任务此时可能尚未完成,固定窗口便同时限制可见历史和最长交互步数。

上下文压缩(context compaction)在窗口将满时把旧历史总结为自然语言摘要,再以摘要和少量近期原文继续执行。压缩进入强化学习后会产生两个相互关联的问题。第一,摘要成为后续策略状态的一部分;文件路径、失败原因或未完成计划一旦遗漏,后续动作均基于不完整状态。第二,一条完整 rollout 被压缩边界切成数量和长度不同的训练分段,分段方式会改变样本权重和终局奖励的时间位置。

本文的首要目标是在不提高单次工作上下文峰值的条件下训练这种压缩轨迹。由此得到的能力边界也很明确:方法扩展的是累计交互跨度,单次前向与反向仍受 64K 或 80K 峰值窗口约束,累计生成 token、预填充、摘要解码和 critic 计算量可能随工作窗口数量增加。

证据定位:Abstract;Sections 1、4.1、4.2;Figures 1–2。

2. 已有解决方案与不足

更长上下文窗口直接提高峰值容量,同时增加注意力计算和显存需求。外部记忆、提示压缩、反思和滚动摘要可以控制输入长度,这些路径通常把压缩器作为固定组件或推理时工具。

与本文最接近的训练方法已经覆盖部分机制:

方法 上下文操作 学习信号 与 CompactionRL 的关系
ReSum / ReSum-GRPO 外部摘要工具周期压缩 最终奖励的 advantage broadcasting 覆盖分段轨迹 训练执行策略适应压缩状态,摘要器可以保持外部
SUPO 同一 LLM 生成摘要与工具动作 完整 rollout 的组内相对优势广播到所有分段,并以全部生成 token 为分母 已覆盖摘要—执行联合训练与全 token 归一化
Context-Folding / FoldGRPO 策略主动分支子任务并折叠摘要 任务奖励与上下文管理过程奖励 将上下文管理与任务分解控制绑定
ECHO 逐轮生成压缩发现并选择带来源编号的记忆 向被选来源轮次和选择动作路由信用 保留来源关系,可进行细粒度因果追踪
CompactionRL 阈值触发前缀摘要并保留最近两轮 独立 critic、token-level PPO、跨段位置修正 支持 group size 1 和随状态变化的 token 优势

SUPO 的公开目标函数先在完整 rollout 层计算组内相对优势,再广播到同一 rollout 的所有分段,损失分母采用所有生成 token。CompactionRL 对组内方法的批评适用于把每个分段直接放入组统计的实现;SUPO 已给出保持完整 rollout 统计单位的另一条路径。因此,CompactionRL 相对 SUPO 最明确的新增内容是支持单 rollout 的独立 critic、随状态变化的 token 优势,以及按跨段 token 距离修正终局信号。共享策略生成摘要、最终任务奖励联合训练和全 token 归一化均有直接前作。

论文未在相同基座、数据、智能体脚手架、峰值上下文和计算预算下运行 SUPO、ReSum-GRPO、Context-Folding 或 ECHO。现有结果能够识别 CompactionRL 相对作者基座与标准 PPO 配置的变化,无法确定其相对最近前作的总体质量或计算收益。

证据定位:Section 2;Section 4.2 Ill-Suited Group-Wise MethodsSUPO arXiv:2510.06727 Eq. 6 与 Algorithm 1。

3. 作者可能的思考路径

以下为依据论文实验顺序和设计约束形成的本地重建:

  1. 在固定执行模型下替换摘要模型,SWE-bench Verified 的 Pass@1 出现 6.5 个百分点差距,说明摘要内容会实质影响最终任务结果。
  2. 摘要已经构成策略决策,因此把摘要 token 与执行 token 一并纳入最终任务奖励驱动的策略损失。
  3. 压缩使每条 rollout 产生不同数量和长度的分段,逐段平均会改变样本权重,因此改为对全批次可训练 token 统一平均。
  4. group size 1 可以减少同一问题的多 rollout 采样,独立 critic 则为各重建状态提供随 token 变化的优势估计。
  5. 每段独立计算 GAE 会把复制的终局奖励放到每个分段末尾,早期动作到终局结果的折扣距离被缩短,因此按后续分段的 token 数补回距离。
  6. critic 需要跟随策略分布变化,训练配方加入 50 步 value 预训练、较高 critic 学习率和每批次两次 value 更新。

该重建解释了方法组件的依赖顺序,不等同于作者披露的发现过程。

4. 核心假设或切入点

CompactionRL 的成立依赖以下判断:

  1. 最终任务正确性可以同时训练执行行为和摘要内容,无需单独设计摘要质量奖励。
  2. 同一策略可以通过不同指令承担执行与摘要两种角色,共享参数更新不会造成无法控制的角色干扰。
  3. 摘要与最近两轮原始交互能够构成足够的后续决策状态。
  4. 每个可训练 token 等权适合当前优化目标;长 rollout 和长摘要由此获得与 token 数成比例的总梯度权重。
  5. 独立 critic 能够在重建上下文上给出可用的状态基线,并通过更频繁更新跟上 actor。
  6. 复制终局奖励后的主要跨段误差来自时间距离,按后续 token 数折扣能够提供有用近似。

摘要 token 消融、损失归一化消融和跨段修正消融为第 1、4、6 项提供内部证据。论文未直接评测重建状态充分性、critic 校准或不同角色间的参数干扰,第 2、3、5 项仍属方法假设。

5. 贡献全景与方法总览

本文的首要贡献是一套面向压缩分段轨迹的 actor-critic 训练配方。辅助贡献包括两个模型规模和两个 coding agent 评测上的内部验证,以及作者关于该配方用于 GLM-5.2 训练流程的应用声明。方法由一条多阶段流水线组成:

阶段 输入 核心操作 传递对象 作用与输出
1. 压缩触发与状态重建 即将达到峰值预算的完整交互历史 同一 actor 生成摘要,并与最近两轮组成新上下文 摘要、近期原文、重建状态 在固定峰值窗口内继续 rollout
2. 轨迹分段与共享奖励 多次压缩形成的完整任务轨迹 划分执行分段与摘要分段,向每个可训练分段分配同一终局任务奖励 分段、旧策略 log probability、终局奖励 把摘要 token 和执行 token 纳入同一 PPO 更新
3. 全 token 策略损失 长度和数量不同的分段 在全批次可训练 assistant token 上统一归一化 clipped PPO loss 每 token 概率比和优势 消除每个分段一票造成的权重偏差
4. 局部 GAE 与跨段位置修正 每段 critic value、局部 TD residual、后续分段长度 先计算段内 GAE,再按同一 rollout 后续 token 数折扣 修正后的 token 优势 恢复复制终局奖励的跨段 token 距离
5. actor-critic 更新 全部修正优势与 value target actor 更新一次,独立 critic 更新两次 新 actor 与 critic 参数 进入下一轮异步采样与训练

角色关系需要明确区分:执行策略和摘要器是同一个 actor,参数完全共享;critic 从对应模型 checkpoint 初始化,随后使用独立参数训练。摘要进入后续 prompt 时属于条件状态,原始摘要 token 在其生成分段中属于策略动作。所有分段共享同一个任务结果来源,各 token 的优势数值仍会因 critic、段内位置和后续 token 数而不同。

Figure 1: CompactionRL 的压缩、分段与训练信号总览
Figure 1: rollout 在剩余上下文低于阈值时生成摘要,以摘要和近期轮次恢复执行;执行分段与摘要分段共享终局奖励,跨段 GAE 按后续 token 数修正局部优势。Image Source: arXiv HTML Figure 2.

证据定位:Sections 4.1、4.2、5.1;Figure 2;Eqs. 6–15。

6. 压缩触发与状态重建

压缩阶段首先定义可被安全切分的交互单位。历史由 system prompt ss、用户任务 uu 和若干 assistant–observation 对 zi=(ai,oi)z_i=(a_i,o_i) 组成:

ht=(s,u,z1,,zt). h_t=(s,u,z_1,\ldots,z_t).

把 assistant response 与对应 observation 绑定为原子步骤,可以避免工具调用和工具结果落在压缩边界两侧。给定工作上下文预算 CC 与压缩阈值 TcompT_{\mathrm{comp}},触发条件为:

Cht<Tcomp. C-|h_t|<T_{\mathrm{comp}}.

同一个 actor 接收固定摘要指令 qsumq_{\mathrm{sum}} 并生成摘要:

Stπθ(htqsum). S_t\sim\pi_\theta(\cdot\mid h_t\oplus q_{\mathrm{sum}}).

运行时随后用 system prompt、包含摘要的恢复指令和最近 kk 轮原始交互重建状态:

hˉt=(s)uresume(St)(ztk+1,,zt). \bar h_t=(s)\oplus u_{\mathrm{resume}}(S_t)\oplus(z_{t-k+1},\ldots,z_t).

默认 k=2k=2,重建结果仍超预算时继续减小。摘要承担长程信息,近期原文保留精确局部状态。当前触发时机由固定 token 阈值决定,策略只学习摘要内容;保留哪些近期轮次也由固定规则决定。摘要遗漏会传播到全部后续动作,论文未保留来源编号或原文回溯接口。

证据定位:Section 4.1;Eqs. 6–9。

7. 轨迹分段、共享奖励与角色更新

压缩后的完整 rollout 写成分段序列:

τ=(σ1,,σK), \tau=(\sigma_1,\ldots,\sigma_K),

其中每个 σs\sigma_s 是执行分段或摘要分段。发生三次压缩时,一条任务最多包含四个执行窗口和三个摘要生成阶段。论文向同一 rollout 的所有可训练分段分配终局任务奖励 R(τ)R(\tau),没有额外的摘要事实性、完整性或压缩率奖励。

该数据路径使成功轨迹中的有利摘要可以获得正向更新,失败轨迹中的摘要也可能获得负向更新;具体符号和幅度取决于 critic baseline 与 GAE。最终奖励只能识别“摘要与任务成功共同出现”,无法单独区分摘要遗漏、后续执行错误、环境随机性和 critic 估计误差。

执行 actor 与摘要器共享 πθ\pi_\theta 的全部参数。独立 critic 从同一模型 checkpoint 初始化,强化学习开始前进行 50 步 value 预训练;每个批次执行两次 value 更新和一次 policy 更新。actor 学习率为 2×1062\times10^{-6},critic 学习率为 3×1063\times10^{-6}。论文未披露 value head、value clipping、value loss coefficient、critic 并行方式或额外 FLOPs。

证据定位:Sections 4.1、5.1;Figure 2。

8. 全 token PPO 归一化

压缩产生的分段数量和长度不同。若先对每段求平均、再对分段求平均,每个分段获得一票,压缩次数更多的 rollout 会贡献更多等权样本。本文将全批次可训练 assistant-token 位置记为 M\mathcal M,先计算每个 token 的新旧策略概率比:

ρs,i(θ)=πθ(ys,ixs,i)πθold(ys,ixs,i). \rho_{s,i}(\theta) = \frac{\pi_\theta(y_{s,i}\mid x_{s,i})} {\pi_{\theta_{\mathrm{old}}}(y_{s,i}\mid x_{s,i})}.

随后在 M|\mathcal M| 个 token 上统一平均 clipped PPO 目标:

Lπ=1M(s,i)Mmin(ρs,iA^s,i,clip(ρs,i,1ϵ,1+ϵ)A^s,i). \mathcal L_\pi = -\frac{1}{|\mathcal M|} \sum_{(s,i)\in\mathcal M} \min\left( \rho_{s,i}\widehat A_{s,i}, \operatorname{clip}(\rho_{s,i},1-\epsilon,1+\epsilon)\widehat A_{s,i} \right).

这一归一化消除的是“每个分段等权”造成的人工偏差。它采用每个可训练 token 等权,因此 token 更多的长 rollout、长摘要或多压缩轨迹仍贡献更多总梯度。该目标没有实现每条 rollout 等权,也没有从机制上排除长度与难度、失败率或压缩次数之间的相关性。SUPO 已采用所有分段生成 token 的全局分母,所以全 token 归一化本身不构成本文相对 SUPO 的独有机制。

证据定位:Section 4.2;Eqs. 11–12;SUPO Eq. 6

9. 跨段优势修正的作用与数学边界

每个分段独立优化时,朴素实现会把共享终局奖励放到每段末尾。对于早期分段,这会缩短动作或摘要到最终任务结果的折扣距离。本文先在分段 σs\sigma_s 内计算局部 GAE:

As,iloc==0nsi(γλ)δs,i+,δs,i=rs,i+γVϕ(xs,i+1)Vϕ(xs,i). A^{\mathrm{loc}}_{s,i} = \sum_{\ell=0}^{n_s-i}(\gamma\lambda)^\ell\delta_{s,i+\ell}, \qquad \delta_{s,i} = r_{s,i}+\gamma V_\phi(x_{s,i+1})-V_\phi(x_{s,i}).

再统计同一原始 rollout 中位于分段 ss 之后的可训练 token 数:

N>s=j>snj. N_{>s}=\sum_{j>s}n_j.

最终优势把整个局部 GAE 乘以后续 token 距离对应的折扣:

A^s,i=(γλ)N>sAs,iloc. \widehat A_{s,i} =(\gamma\lambda)^{N_{>s}}A^{\mathrm{loc}}_{s,i}.

若共享终局奖励被复制到每个独立分段的最后一个 token,token (s,i)(s,i) 对应的奖励项获得指数:

(γλ)N>s+nsi. (\gamma\lambda)^{N_{>s}+n_s-i}.

该指数与该 token 到拼接后 rollout 最终结果的后续可训练 token 数一致。这解释了公式能够修正的局部问题,也给出“cross-trajectory”一词的准确边界:它只连接同一原始 rollout 内的压缩分段,可更具体地理解为跨段轨迹位置修正(cross-segment trajectory-position correction),不涉及不同任务或独立 rollout 之间的信用传播。

进一步比较完整拼接 GAE 可以看出近似项。令 q=γλq=\gamma\lambda,并令 δfull\delta^{\mathrm{full}} 表示沿拼接状态序列计算的 TD residual:分段边界使用下一重建分段的起始 value,终局奖励只在完整 rollout 末尾出现。从分段 ss 的 token ii 开始,完整 GAE 应覆盖当前分段剩余位置和全部后续分段:

As,ifull==0nsiqδs,i+full+j>sqnsi+1+s<u<jnum=1njqm1δj,mfull. A^{\mathrm{full}}_{s,i} = \sum_{\ell=0}^{n_s-i} q^\ell\delta^{\mathrm{full}}_{s,i+\ell} + \sum_{j>s} q^{n_s-i+1+\sum_{s<u<j}n_u} \sum_{m=1}^{n_j}q^{m-1}\delta^{\mathrm{full}}_{j,m}.

这是本地独立推导,用于比较估计量结构。第一项只有在边界奖励和 bootstrap 定义一致时才等于论文的局部 GAE;论文向每段分配终局奖励并独立优化,因此两者通常不同。论文的 A^s,i\widehat A_{s,i} 对整个局部 GAE 额外乘以 qN>sq^{N_{>s}},同时折扣了段内 TD residual;它没有加入后续分段的 TD residual,也没有显式使用下一重建分段起始 value 进行边界 bootstrap。由此可得最窄判断:该方法恢复了复制终局奖励项的 token 距离,没有代数重建完整轨迹 GAE。论文在 Limitations 中也将其称为完整信用分配的近似。

γλ<1\gamma\lambda<1 且后续 token 很多时,早期摘要的优势可能快速衰减。实验采用长度自适应 λ=11/(1.5l)\lambda=1-1/(1.5l),正文只说明 ll 为 response length,没有明确变长分段下按分段、完整 rollout 或其他口径取值,也未披露 γ\gamma。这些细节会直接影响多次压缩后的早期信用强度。

证据定位:Section 4.2;Eqs. 13–15;Section 6 Limitations。完整 GAE 分解为本地独立推导。

10. 异步训练与系统成本边界

端到端训练数据流如下:

  1. actor 在 64K 或 80K 峰值上下文内通过 Harbor 与任务环境交互。
  2. 剩余预算低于 10,240 token 时,同一 actor 生成摘要。
  3. 运行时用 system prompt、摘要和最近两轮重建上下文,最多执行三次压缩。
  4. 采样端保存执行与摘要分段、旧策略 log probability 和最终任务奖励。
  5. learner 以全局 batch 128、group size 1 计算 critic value、局部 GAE、跨段折扣和全 token PPO loss。
  6. critic 每批次更新两次,actor 更新一次,更新后的参数进入下一轮异步采样。

训练使用开源 SWE-Dev 数据和 slime 异步强化学习框架。论文没有公开队列、partial rollout、参数同步频率、策略滞后或 staleness correction 配置,因此目前只能确认框架和算法接口,无法重建完整异步执行语义。

表中的 64K × 480K × 4 表示复用同一峰值窗口并允许最多三次压缩。它约束单次 active context 和相应显存峰值,累计生成量仍可达到多个窗口,并增加摘要生成、重复预填充和独立 critic 前向与反向。论文未报告硬件、GPU·小时、wall-clock、吞吐、峰值显存或 critic FLOPs,现有证据无法判断总训练或推理成本是否下降。

证据定位:Section 5.1;Figure 2;Tables 2–3。

11. 结论链条

  1. 固定执行模型、替换摘要模型会产生 6.5 个百分点的 SWE-bench Verified 差距,支持“摘要内容是影响任务结果的策略变量”。
  2. 同一 actor 生成摘要与执行动作,终局任务奖励同时更新两类 token;摘要 token 消融在两个模型的压缩评测上均降低 Pass@1。
  3. 全 token 归一化与跨段位置修正在 106B 模型上分别具有正向消融结果,支持分段权重和终局距离需要专门处理。
  4. 30B 与 106B 模型在启用压缩的两个 coding 评测上均高于对应基座和标准 PPO 配置,支持当前训练配方与测试时压缩协议的组合。
  5. 单窗口结果没有稳定提高,closest-prior 对照、总计算、多训练 seed 和跨领域实验也未提供,因此结论范围限于作者当前的压缩式 coding agent 设置。

关键实验/定理

结果 1:摘要模型选择对应 6.5 个百分点的 SWE 差距

执行模型 摘要模型 SWE-Verified Pass@1 每条轨迹平均摘要次数
GLM-4.7-Flash Qwen3.5-27B 55.5 1.010
GLM-4.7-Flash GLM-4.7-Flash 50.5 1.075
GLM-4.7-Flash Qwen3-30B-A3B 49.0 1.126
  • 设置:固定 GLM-4.7-Flash 执行模型,只替换推理时摘要模型。
  • Baseline:GLM-4.7-Flash 自身作为摘要模型,以及 Qwen3-30B-A3B 摘要模型。
  • 指标:SWE-bench Verified 随机 200 题子集 Pass@1;每条轨迹平均摘要次数。
  • 结果:最高与最低 Pass@1 相差 6.5 个百分点,平均摘要次数相差 0.116。
  • 系统条件:执行模型和智能体脚手架保持一致;摘要模型的参数量、训练语料和生成成本不同。
  • 指标定义:Pass@1 表示一次采样完成任务的比例;论文报告两次评测运行的均值。
  • 成本归因:论文只报告摘要次数,未报告各模型摘要 token、延迟或计算量。
  • 对照是否可比:该对照适合识别“摘要模型选择是否影响结果”,无法把差值归因到摘要事实性、长度或模型规模中的单一因素。
  • 证据定位:Section 4.1;Table 1。
  • 支持的最窄结论:在当前 GLM-4.7-Flash 与 SWE 设置中,摘要模型选择会显著改变压缩式智能体的任务成功率。
  • 解读:这组结果支持训练摘要策略的动机,没有直接比较共享 actor 联合训练与冻结的强摘要模型。

结果 2:主要收益集中在启用压缩的评测协议

模型与训练 SWE Single SWE Compacted TB2 Single TB2 Compacted
GLM-4.7-Flash base 47.5 50.5 14.6 13.4
GLM-4.7-Flash + PPO w/o compaction 50.0 48.0 16.9 12.4
GLM-4.7-Flash + CompactionRL 43.7 56.0 16.9 20.2
GLM-4.5-Air-SFT base 57.8 59.8 17.9 21.4
GLM-4.5-Air-SFT + PPO w/o compaction 58.3 62.5 20.2 23.6
GLM-4.5-Air-SFT + CompactionRL 57.3 66.8 21.4 24.5
  • 设置:30B 模型峰值上下文 64K,106B 模型峰值上下文 80K;Compacted 评测最多执行三次压缩,Single 评测禁用压缩。
  • Baseline:对应 base/SFT checkpoint;相同峰值长度的标准 PPO,不在训练时使用压缩。
  • 指标:SWE-bench Verified 随机 200 题子集和完整 Terminal-Bench 2.0 的 Pass@1,两次评测运行均值。
  • 结果:相对各自 base 的 Compacted 结果,30B 在 SWE / TB2 提高 5.5 / 6.8 个百分点,106B 提高 7.0 / 3.1 个百分点;30B 与 106B 的 Single SWE 分别较 base 下降 3.8 和 0.5 个百分点。
  • 系统条件:Harbor 环境、Terminus-KIRA 脚手架、temperature 1.0、top-p 1.0、最多 250 轮。
  • 指标定义:Compacted 允许最多四个工作窗口;Single 只允许一个峰值窗口,两者的累计生成预算不同。
  • 成本归因:内部配置对齐峰值上下文,没有对齐总生成 token、摘要成本、critic 计算、GPU·小时或 wall-clock。
  • 对照是否可比:同一基座内部的模型、脚手架和峰值长度可比;CompactionRL 可使用更多累计窗口和独立 critic,因此不构成总计算匹配实验。
  • 证据定位:Section 5.2;Table 2。
  • 支持的最窄结论:在作者的压缩式评测协议中,CompactionRL 比对应 base 和标准 PPO 获得更高 Pass@1,收益与测试时压缩共同成立。
  • 解读:结果支持压缩训练与压缩推理的协议对齐;现有 Single 结果不支持一般性的单窗口能力提升。

结果 3:直接优化摘要 token 在两个模型上均提高压缩评测分数

  • 设置:保持压缩式 rollout 不变,将摘要 response token 从 policy loss 中屏蔽,形成 CompactionRL w/o sum.
  • Baseline:使用相同压缩轨迹但不优化摘要 token 的方法变体。
  • 指标:SWE-bench Verified 与 Terminal-Bench 2.0 的 Compacted Pass@1。
  • 结果:30B 从 54.5 / 12.4 提高到 56.0 / 20.2;106B 从 64.5 / 21.5 提高到 66.8 / 24.5。
  • 系统条件:30B 使用 64K 峰值上下文,106B 使用 80K 峰值上下文,均允许最多三次压缩。
  • 指标定义:结果为两次评测运行均值,论文未报告独立训练 seed 或置信区间。
  • 成本归因:两组均生成摘要;差异主要来自摘要 token 是否进入策略损失,额外反向计算未单列。
  • 对照是否可比:压缩暴露和峰值窗口一致;30B Terminal-Bench 的 7.8 个百分点差值仍可能包含训练与评测方差。
  • 证据定位:Section 5.3;Table 3。
  • 支持的最窄结论:在两个测试模型的 Compacted 评测中,将摘要 token 纳入共享终局奖励的策略损失均对应更高 Pass@1。
  • 解读:该消融直接支持“摘要可训练”组件,适用范围限于测试时采用相同压缩协议的 coding agent。

结果 4:全 token 损失与跨段修正均有正向消融结果

GLM-4.5-Air-SFT,80K × 4 SWE Compacted TB2 Compacted
Base 59.8 21.4
CompactionRL 66.8 24.5
w/o token-level loss 60.0 21.3
w/o cross-trajectory GAE 63.0 22.5
  • 设置:106B-A30B 模型,80K 峰值上下文,允许最多四个工作窗口。
  • Baseline:完整 CompactionRL 及分别移除一个组件的方法变体。
  • 指标:SWE-bench Verified 与 Terminal-Bench 2.0 Compacted Pass@1。
  • 结果:移除全 token loss 后分别下降 6.8 / 3.2 个百分点;移除跨段 GAE 后下降 3.8 / 2.0 个百分点。
  • 系统条件:其余训练和评测配置按论文保持一致。
  • 指标定义:论文报告两次评测运行均值,没有误差线。
  • 成本归因:两项修正主要改变 loss reduction 与优势权重,计算增量未单列;独立 critic 在各组中保留。
  • 对照是否可比:局部组件对照清楚;论文未说明 w/o token-level loss 使用的具体 sequence/segment reduction,也未提供二者的析因交互实验。
  • 证据定位:Section 5.3;Table 4。
  • 支持的最窄结论:在当前 106B 压缩设置中,两项修正均与更高最终分数相关,全 token reduction 的消融差值更大。
  • 解读:该结果识别了组件必要性,尚未识别每 token 等权、每 rollout 等权或其他归一化目标的相对质量。

结果 5:跨段公式准确恢复复制终局奖励的 token 距离

  • 设置:考虑同一 rollout 被切成多个分段,并把同一终局奖励放在每个独立分段末尾的论文设定。
  • 假设:token 距离是所用折扣的时间尺度;各分段长度 nsn_s 与顺序已知;终局奖励项位于分段末尾。
  • 指标:从 token (s,i)(s,i) 到最终结果的折扣指数。
  • 结果:论文修正后的终局奖励指数为 N>s+nsiN_{>s}+n_s-i,与拼接轨迹中的后续可训练 token 数一致。
  • 适用域:同一原始 rollout 内的执行与摘要分段;不覆盖不同 rollout,也不恢复后续分段的全部 TD residual。
  • 对照是否可比:与逐段局部 GAE 的指数可以直接比较;与完整拼接 GAE 的估计量结构不同。
  • 证据定位:Section 4.2;Eqs. 13–15;Section 6 Limitations
  • 支持的最窄结论:跨段乘数修正了复制终局奖励的时间位置,完整 GAE 等价性不成立。
  • 解读:这是有针对性的终局位置近似。边界 value、后续 residual 和早期摘要信号衰减需要单独复验。

结果 6:摘要长度和后续交互行为发生同步变化

  • 设置:比较 base、标准 PPO、CompactionRL w/o summary training 和完整 CompactionRL 的压缩次数、工具调用、摘要长度、每轮推理 token 与 entropy。
  • Baseline:base、标准 PPO 以及不优化摘要 token 的压缩方法变体。
  • 指标:平均压缩次数、工具调用数、触发压缩任务子集的准确率、摘要长度、每轮推理 token 和 entropy。
  • 结果:完整方法比 base 和不优化摘要 token 的方法变体使用更少压缩与工具调用;摘要长度和推理 token 随训练增加,并在触发压缩的任务子集上取得最高准确率。
  • 系统条件:GLM-4.5-Air-SFT 的训练过程;图中未提供全部原始数值。
  • 指标定义:摘要长度只反映 token 数,未直接测量事实正确率、遗漏率或有效压缩率。
  • 成本归因:更长摘要会增加生成和后续预填充成本,论文未报告对应延迟或 FLOPs。
  • 对照是否可比:训练设置内部可比;图形证据缺少误差区间和长度控制后的摘要质量指标。
  • 证据定位:Section 5.4;Figures 3–4。
  • 支持的最窄结论:摘要 token 优化改变了长度分配和压缩后的行为,并与更高的压缩任务准确率同时出现。
  • 解读:作者将更长摘要解释为信息更充分;现有观测无法排除冗余长度、训练阶段变化或其他共同因素。

实验设置与复验口径

维度 论文设置与证据边界
基座 GLM-4.7-Flash 30B-A3B;GLM-4.5-Air-SFT 106B-A30B,后者先用 GLM-4.7 轨迹监督微调
训练数据 开源 SWE-Dev;样本数量、过滤规则、奖励实现和任务复用未展开
运行时 slime 异步强化学习框架;Harbor 环境;Terminus-KIRA 智能体脚手架
Batch / grouping 全局 batch 128;group size 1
上下文 30B 峰值 64K;106B 峰值 80K;单次 assistant response 上限 10,240 token;剩余预算低于 10,240 时压缩;最多三次
优化器 Adam;actor 学习率 2×1062\times10^{-6};critic 学习率 3×1063\times10^{-6}
Critic 同 checkpoint 初始化;强化学习前 value 预训练 50 步;每批次 value 更新两次、policy 更新一次
优势 长度自适应 GAE,λ=11/(1.5l)\lambda=1-1/(1.5l);按后续 token 数做跨段修正;γ\gammall 的分段口径未充分披露
评测 SWE-bench Verified 随机 200 题;完整 Terminal-Bench 2.0;temperature 1.0;top-p 1.0;最多 250 轮;两次评测运行均值
最近前作对照 未运行 SUPO、ReSum-GRPO、Context-Folding、ECHO 或冻结强摘要模型的完整联合系统
成本匹配 只对齐峰值上下文;累计窗口、生成 token、摘要成本、critic FLOPs、GPU·小时和 wall-clock 未对齐
统计充分性 未报告独立训练 seed、误差线、置信区间或显著性检验

局限

  1. 跨段 GAE 只恢复复制终局奖励的 token 距离,没有构造完整的跨边界 TD recursion;γ\gamma、长度自适应 λ\lambda 的分段口径和 boundary bootstrap 细节未披露。
  2. 论文没有直接运行 SUPO、ReSum-GRPO、Context-Folding 或 ECHO,最近前作之间的算法质量与计算收益尚未识别。
  3. 全 token 损失消除了分段等权偏差,长轨迹仍按生成 token 数获得更大总权重;长度、难度与压缩次数可能继续影响训练分布。
  4. 摘要质量由最终任务奖励和长度间接反映,缺少事实正确率、遗漏率、压缩率、来源可追溯性和错误传播评测。
  5. 固定峰值上下文允许最多四个工作窗口,并增加摘要与 critic 计算;硬件、GPU·小时、wall-clock、吞吐、峰值显存和 FLOPs 均未报告。
  6. SWE-bench Verified 只使用未公布题号的随机 200 题子集,每个结果是两次评测运行均值,独立训练 seed、置信区间和显著性检验均缺失。
  7. 训练与评测集中于 coding 和 terminal agent,搜索、GUI、网页、多智能体和非二元长期奖励任务尚未验证。
  8. Single-window 结果没有稳定提高,部署需要保留测试时压缩协议,方法效果存在明确的训练—推理耦合。
  9. 未公开实现,分段打包、prompt mask、value head、GAE 边界处理、损失 reduction 和 slime 异步运行时无法核验。
  10. GLM-5.2 的应用只由摘要和结论中的作者声明支持,论文没有给出 750B-A40B 配置、训练曲线或消融。

跨论文关系

  • 与已有论文的作者或机构关系:Yujiang Li、Zhenyu Hou、Jie Tang、Yuxiao Dong 同时参与 SAO;两篇论文均连接清华大学 KEG 与 Z.AI,并声明进入 GLM-5.2 的智能体强化学习流程。
  • SUPO 的方法关系:两者均由同一 actor 生成摘要与工具动作,并以最终任务奖励联合训练。SUPO 已覆盖 rollout-level group advantage 广播与全生成 token 归一化;CompactionRL 的差异集中于 group size 1 独立 critic 和跨段终局位置修正,当前缺少同设置实验。
  • SAO 的系统关系:两者均采用 group size 1 与独立 critic。CompactionRL 处理压缩分段和跨段奖励距离;SAO 处理异步单 rollout readiness、过期 token mask 和跳过 observation 的 GAE。共同风险包括 critic 计算、value tracking 和生产规模细节缺失。
  • ECHO 的记忆关系:CompactionRL 生成不带来源标识的完整前缀摘要,以 critic 和 GAE 训练全部生成 token;ECHO 保留带来源编号的压缩发现,并向被选来源轮次路由信用。两者分别代表稠密端到端信用与可追溯选择信用。
  • SelfCompact 的控制关系:两者均由执行 actor 生成摘要并从压缩状态继续;SelfCompact 在推理时用任务 rubric 选择压缩时机,CompactionRL 用固定预算阈值触发并训练摘要内容。该关系将触发控制与压缩后的强化学习估计器区分开。
  • GLM-5.2 的发布关系:GLM-5.2 材料提到压缩轨迹、critic-based PPO 和 token-level loss;CompactionRL 公开了阈值、状态重建、跨段 GAE 和 30B/106B 消融,为该训练配方补充了方法证据。
  • LLM 与 Agent 强化学习中的信用分配 的主线关系:该主线将 CompactionRL 归入压缩状态 critic 路线;其有符号时间信用依赖 critic 校准,跨边界估计仍是主要误差来源。

主要启发

1. 上下文管理动作与分段估计器构成两个独立的创新维度

SUPO 已直接支持同一策略生成摘要和工具动作,并用终局奖励联合训练;CompactionRL 的清晰增量集中于独立 critic、group size 1 和跨段终局位置修正。评估后续方法时,应分别比较状态如何压缩、摘要是否可训练、分段如何计权和信用如何跨边界传播。任何一个维度的改进都无法自动证明整套方法优于最近前作,相同基座与计算预算下的析因对照仍是必要证据。

2. 固定峰值上下文只约束单次工作集

CompactionRL 允许在 64K 或 80K 峰值窗口上继续最多四个执行窗口,这有助于控制单次模型调用的 active sequence 和显存上限。累计 token、重复预填充、摘要解码与独立 critic 仍会增加总计算。长程智能体论文因此需要同时报告峰值上下文、有效交互跨度、生成与摘要 token、critic FLOPs、GPU·小时和 wall-clock;只给 ×4 工作窗口无法支持总效率结论。

3. 压缩边界会同时改变策略状态与训练测度

摘要替换旧历史后,后续策略面对的新状态可能遗漏关键信息;同一边界也把完整 rollout 切成多个优化样本,改变损失权重和奖励距离。CompactionRL 分别用状态重建、全 token 归一化和跨段折扣处理这三项变化。其分析边界表明,loss reduction 与信用分配需要独立验证:每 token 等权仍会偏向更长轨迹,终局距离修正仍缺少后续 TD residual 和边界 value。可复验系统应同时记录摘要来源、分段权重直方图、早期与晚期摘要优势、value calibration 和完整 stitched GAE 对照。