2607.05378-compactionrl-context-compaction-agent-rl

CompactionRL: Reinforcement Learning with Context Compaction for Long Horizon Agents

CompactionRL 沿用同一 actor 生成摘要与工具动作、由最终任务 reward 联合训练的框架,并在变长压缩轨迹上加入支持 group size 1 的独立 critic、全 batch token 归一化和跨 segment GAE 位置修正;两个模型在启用 compaction 的 coding 评测中均提高 Pass@1,但 SUPO 已覆盖 summary–execution joint RL 与全 token 归一化,论文也没有运行这一最近前作,因此更合适的定位是面向 segmented rollout 的 actor-critic credit/loss 配方与规模化 coding-agent 实证。

Authors Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang (唐杰), Yuxiao Dong

已审阅 Archived 2026-07-13 13:51 Updated 2026-07-22 11:23 Reviewed 2026-07-22 11:23 Source

Source

作者与关系

Yujiang Li 与 Zhenyu Hou 为共同贡献作者,Yujiang Li、Zhenyu Hou 与 Yi Jing 在 Z.AI 实习期间完成该工作。五位作者都以清华大学署名。Yuxiao Dong 的公开主页将 Yujiang Li 和 Zhenyu Hou 列为博士生,Zhenyu Hou 的个人主页同时确认 Yuxiao Dong 与 Jie Tang 为导师;Yi Jing 的个人主页确认其为清华大学新雅书院与计算机系本科生,并在 THUKEG 与 PKUICL 实习。

本论文与 SAO 共享 Yujiang Li、Zhenyu Hou、Jie Tang、Yuxiao Dong 四位作者。两篇论文都恢复独立 critic,并都声明方法已用于 GLM-5.2 的 agentic RL pipeline。CompactionRL 处理 context compaction 后的变长 segment 与跨 segment credit;SAO 处理异步单 rollout、policy lag 和 observation-aware GAE。它们构成清华 KEG / Z.AI 在同一生产训练链上的连续方法节点。

阅读目标与判断边界

本笔记关注:

  1. compaction 在 rollout 中何时触发,摘要如何进入后续 agent state。
  2. 摘要模型、执行模型和 critic 是否共享参数,以及各自接受什么训练信号。
  3. 最终 task reward 如何经过 segment、critic 和 GAE 分配到执行与摘要 token。
  4. token-level normalization 与 cross-trajectory GAE 分别修正哪类偏差,还留下哪些 weighting 与 credit 近似。
  5. 论文相对 SUPO、ReSum-GRPO、Context-Folding 和 ECHO 的真实新增范围。

判断边界:

  • 论文只报告 SWE-bench Verified 的随机 200 题子集与完整 Terminal-Bench 2.0;SWE 子集 id、独立训练 seed、置信区间和显著性检验均未公开。
  • 每个实验结果是两次随机解码评测的均值,无法替代多次独立 RL training runs。
  • 作者没有公开代码、硬件、GPU hours、wall-clock、rollout throughput、critic compute 或异步 staleness 统计。
  • 64k x 4 / 80k x 4 表示单窗口峰值不变且最多执行三次 compaction,总生成 horizon 和总计算量可以明显增加。
  • TeX 使用 NeurIPS 2026 preprint style;当前没有公开 venue 页面,因此模板不能用于确认投稿或录用状态。
  • GLM-5.2 deployment 只由摘要和结论中的作者声明支持,论文没有公开 750B-A40B 配置、曲线或消融。

证据写法:

  • 论文事实:正文、公式、表格、图和 TeX source 直接给出的设计、数字与限制。
  • 作者主张:摘要、引言、实验分析和结论中的效果解释。
  • 本地分析:对 segment weighting、跨边界 GAE、closest-prior novelty 和 compute 可比性的重建。
  • 关键判断附 证据定位,使用章节、公式、表、图或规范 URL。

术语预备

  • Context compaction:把即将溢出的历史压缩成自然语言摘要,再用摘要和少量最新原始 turn 继续 rollout。
  • Working context / peak length:任一时刻实际送入模型的最大上下文长度;它和整条任务累计消费的 token 数不同。
  • Segment:一次完整 rollout 被 compaction boundary 划分出的训练单元,分为 execution segment 和 summarization segment。
  • PPO:用独立 value function 估计 advantage,并用 clipped importance ratio 更新 actor。
  • GAE:对 temporal-difference residual 做指数加权,平衡 advantage 的偏差与方差。
  • Cross-trajectory GAE:论文对跨 compaction segment 的位置修正。这里的 trajectory 指同一原始 rollout 内的 reconstructed traces,并未连接不同 prompt 或独立 rollout。
  • SUPO:2025 年提出的 summarization-augmented policy optimization,已用同一 LLM 生成摘要和工具 action,并把 rollout-level group advantage 广播到所有 split trajectories。

论文脉络

1. 研究问题、背景和价值

长程 coding agent 会反复读取仓库、修改文件、执行测试并处理错误。完整历史持续追加后,tool output、失败命令和中间 reasoning 会先占满上下文窗口。直接终止会把 context length 变成 rollout horizon 的硬上限;扩大窗口会增加训练显存、attention compute 和 serving 成本,同时无法保证模型能稳定利用很长的历史。

Inference-time compaction 可以在窗口将满时总结旧历史并继续执行。进入 RL 后,摘要成为后续 policy state 的一部分:文件路径、失败原因或未完成计划一旦丢失,所有后续 action 都基于不完整状态。摘要质量因此会影响最终 reward,训练目标需要同时覆盖执行和摘要。

第二个问题来自训练数据结构。一次原始 rollout 经多次 compaction 后产生数量和长度都不同的 segments。若每个 segment 作为等权 sample,compaction 次数多的 rollout 会得到更多 sample-level 权重;若每段都把最终 reward 放在段尾,早期 action 到最终结果的时间距离会被缩短。论文的目标是保留固定峰值工作上下文,同时让 actor 能从这些 split segments 接受一致的 PPO 信号。

证据定位:Abstract;Sections 1、4.1、4.2;Figures 1-2。

2. 已有解决方案与不足

更长 context window 直接提高峰值容量,但训练和推理成本随 active sequence 增加,长上下文利用率也可能下降。外部 memory、prompt compression、reflection 和 rolling summary 控制输入长度,通常把压缩器作为固定组件或 inference-time tool。

与本文最接近的前作已经进入训练环节:

方法 Context action 学习信号 关键差异
ReSum / ReSum-GRPO 外部 summary tool 周期压缩 final reward 通过 advantage broadcasting 覆盖 segmented trajectories summarizer 本身可以保持外部;重点是 search agent 适应压缩上下文
SUPO 同一 LLM 生成 summary 与 tool action rollout-level group-relative advantage 广播到所有 split trajectories;全 token 归一化 已联合训练摘要与执行,依赖同 prompt group,所有 token 共享同一 rollout advantage
Context-Folding / FoldGRPO policy 主动 branch 子任务并 fold summary task reward 加 context-management process rewards context management 与 task decomposition 绑定,控制接口更主动
ECHO 逐 turn 生成 compact finding,再选择带 source id 的 memory final trace 对 selected source turns 和 selection actions 做 traceable credit routing 保留 provenance,重建上下文时选择具体 source memories
CompactionRL 阈值触发 full-prefix summary,保留最近两轮 independent critic + token-level PPO + cross-segment GAE group size 1,token advantage 随 state 和原 rollout 位置变化

SUPO 的公开 TeX objective 已对同一 rollout 的所有 split trajectories 做全局 token 数归一化,并从 rollout group 计算一次 advantage。CompactionRL 对 group-wise method 的批评适用于“把 segment 直接塞进 group statistics”的实现;SUPO 已展示一种 rollout-level group normalization 路径。本文采用 critic 的主要增量来自 group size 1 和 token-level temporal credit;variable segments 仍可接入设计得当的 group-relative objective。

论文没有把 SUPO、ReSum-GRPO、Context-Folding 或 ECHO 放入实验表。现有结果可以识别 CompactionRL 相对 base model 和作者的 standard PPO baseline 的收益,无法识别它相对 closest prior 的总体优势。

证据定位:Section 2;Section 4.2 Ill-Suited Group-Wise MethodsSUPO arXiv:2510.06727, Eq. 6 与 Algorithm 1;ReSum arXiv:2509.13313Context-Folding arXiv:2510.11967

3. 作者可能的思考路径

以下为本地分析的受约束重建:

  1. 先在长程 coding rollout 中加入 inference-time summary,观察同一执行模型搭配不同 summary model 时,SWE-bench Verified 相差 6.5 个百分点。
  2. 这说明 summary 已经是影响最终 task success 的 policy decision,需要把 summary token 纳入 RL loss。
  3. 一个 rollout 被切成多个训练 segment 后,segment-average loss 会把每段都当作一份完整样本,于是改为全 batch generated-token average。
  4. 同 prompt 多 rollout group 会增加采样成本;团队已有 critic-based agentic RL 经验,因此选择 group size 1 的 PPO,并从 actor checkpoint 初始化独立 critic。
  5. 每段独立计算 GAE 会把共享终局 reward 人为移到每个 segment 尾部,于是按后续 generated-token 数量补回 discount distance。
  6. 训练中 critic 容易跟不上 actor,最终采用 value pretraining、critic 较高 learning rate 和每 batch 两次 value update。

4. 核心假设或切入点

CompactionRL 依赖六项假设:

  1. 任务最终正确性足以同时训练 execution behavior 和 summary quality,无需手工 summary reward。
  2. 同一 actor 可以通过不同 instruction 在 execution 与 summarization 两种角色间切换,并共享可迁移的参数更新。
  3. summary 加最近两轮原始 assistant-observation pair 能构成足够的近似 Markov state。
  4. 全 token 平均能消除 segment 数量产生的人工 sample weight,同时允许更长 trajectory 按 generated-token 数获得更多梯度质量。
  5. 独立 critic 可以在 reconstructed context 上给出有用的 state-dependent baseline,并通过更频繁更新跟上 actor。
  6. 用后续 trainable-token 数量恢复 discount distance,足以近似 full-trajectory GAE 的主要终局 reward 项。

其中第 1、4 项有直接消融支持;第 5 项只有最终性能和训练 recipe 支持;第 3、6 项仍需要状态充分性、value calibration 和多 boundary credit 的专门评测。

5. 方法 / 系统 / 理论框架

5.1 Compaction 触发与上下文重建

历史写为:

ht=(s,u,z1,,zt),zi=(ai,oi), h_t=(s,u,z_1,\ldots,z_t),\qquad z_i=(a_i,o_i),

其中 ss 是 system prompt,uu 是原始任务,aia_i 是 assistant response,oio_i 是环境 observation。论文把 (ai,oi)(a_i,o_i) 视为不可拆分的 atomic step,避免 tool call 和对应结果跨 compaction boundary 分离。

给定工作上下文预算 CC 和阈值 TcompT_{\mathrm{comp}},触发条件为:

Cht<Tcomp. C-|h_t|<T_{\mathrm{comp}}.

同一个 actor policy 接收固定 summarization instruction,并采样摘要:

Stπθ(htqsum). S_t\sim\pi_\theta(\cdot\mid h_t\oplus q_{\mathrm{sum}}).

摘要 prompt 要求保留原始目标、已完成 action、重要 observation、未解决错误、当前状态和下一步。后续上下文重建为:

hˉt=(s)uresume(St)(ztk+1,,zt). \bar h_t=(s)\oplus u_{\mathrm{resume}}(S_t)\oplus(z_{t-k+1},\ldots,z_t).

默认 k=2k=2,若超预算则继续减小。摘要承担长程信息,最近两轮原文承担精确局部状态。触发是固定 token threshold,policy 学习 summary content,当前方法没有学习何时 compaction 或保留哪些原始 turns。

证据定位:Section 4.1;Eqs. 6-9。

5.2 Segment、共享 reward 与可训练 token

一条原始 rollout 被写成:

τ=(σ1,,σK), \tau=(\sigma_1,\ldots,\sigma_K),

其中 σs\sigma_s 是 execution segment 或 summarization segment。若发生三次 compaction,最多会形成四段 execution window 和三段 summary generation;表中的 x4 指四个工作窗口,训练 segment 数量可以达到七段。

所有 segments 共享同一个最终任务 reward R(τ)R(\tau)。论文没有定义单独的 summary-quality reward,因此摘要只有在帮助后续完成任务时才获得正向学习信号。summary 被复制进 reconstructed prompt 后承担 conditioning state;RL 更新针对 policy 原先生成的 execution 和 summary token。

“共享 reward”只描述 outcome source。各 token 的最终 advantage 还会经过 critic value、段内 GAE 和跨段位置折扣,因此同一成功 rollout 中的 token 不会得到完全相同的数值。

证据定位:Section 4.1 Training Segments;Figure 2。

5.3 Actor、summarizer 与 critic 的参数关系

角色 初始化与参数 输入 更新方式
Execution actor πθ\pi_\theta task state、tool history 或 reconstructed context task execution token 的 PPO loss
Summarizer 与 execution actor 完全同一个 πθ\pi_\theta,共享全部 actor 参数 full pre-compaction history + fixed summary instruction summary token 的同一 PPO loss
Critic 从对应 actor/model checkpoint 初始化的独立 value model,训练后参数与 actor 分开 每个 generated-token state value regression;每 batch 更新两次

actor learning rate 为 2×1062\times10^{-6},critic 为 3×1063\times10^{-6}。critic 在 RL 前做 50 steps value pretraining,每个 batch 采用两次 value update 和一次 policy update。论文没有披露 value head、critic parallelism、value loss coefficient、value clipping 或 critic 额外 FLOPs。

诊断实验中可以替换 summary agent 以测量 summary quality;正式 CompactionRL 训练使用同一个 actor 同时执行和总结。

证据定位:Sections 4.1、5.1;Table 1。

5.4 Token-level PPO normalization

对全 batch 可训练 assistant-token 集合 M\mathcal M,token probability ratio 为:

ρs,i(θ)=πθ(ys,ixs,i)πθold(ys,ixs,i). \rho_{s,i}(\theta) = \frac{\pi_\theta(y_{s,i}\mid x_{s,i})} {\pi_{\theta_{\mathrm{old}}}(y_{s,i}\mid x_{s,i})}.

actor objective 对 M|\mathcal M| 个 generated tokens 做一次平均:

Lπ=1M(s,i)Mmin(ρs,iA^s,i,clip(ρs,i,1ϵ,1+ϵ)A^s,i). \mathcal L_\pi = -\frac{1}{|\mathcal M|} \sum_{(s,i)\in\mathcal M} \min\left( \rho_{s,i}\widehat A_{s,i}, \operatorname{clip}(\rho_{s,i},1-\epsilon,1+\epsilon)\widehat A_{s,i} \right).

若先对每个 segment 平均,再对 segments 平均,一条被切成更多段的 rollout 会获得更多等权 sample mass。全 token 平均移除了这项 segment-count artifact。它仍然让长 rollout、长 summary 和多次 compaction 产生的额外 token 占据更多总权重,因此“每条 trajectory 等权”并未成立。该选择更准确的描述是“每个 trainable token 等权”。

证据定位:Section 4.2;Eqs. 11-12。

5.5 Cross-trajectory GAE 如何分配 advantage

对 segment σs\sigma_s 内第 ii 个 token,先计算 local GAE:

As,iloc==0nsi(γλ)δs,i+,δs,i=rs,i+γVϕ(xs,i+1)Vϕ(xs,i). A^{\mathrm{loc}}_{s,i} = \sum_{\ell=0}^{n_s-i}(\gamma\lambda)^\ell\delta_{s,i+\ell}, \qquad \delta_{s,i} = r_{s,i}+\gamma V_\phi(x_{s,i+1})-V_\phi(x_{s,i}).

再统计同一原始 rollout 中位于 segment ss 之后的 trainable token 数:

N>s=j>snj. N_{>s}=\sum_{j>s}n_j.

最终 advantage 为:

A^s,i=(γλ)N>sAs,iloc. \widehat A_{s,i} =(\gamma\lambda)^{N_{>s}}A^{\mathrm{loc}}_{s,i}.

若 local implementation 把共享终局 reward 放在每段最后一个 token,token (s,i)(s,i) 的 reward contribution 会从 naive 的

(γλ)nsiR (\gamma\lambda)^{n_s-i}R

修正为

(γλ)N>s+nsiR. (\gamma\lambda)^{N_{>s}+n_s-i}R.

这个指数等于该 token 到原始 rollout 最终 outcome 之间的后续 trainable-token 距离。直观上,一条 execution_1 -> summary -> execution_2 轨迹中,summary 前部 token 的 discount 会包含 summary 剩余 token 和整个 execution_2;最后执行段靠近终局的 token 得到更短距离。

该修正主要恢复 terminal reward 的位置。它没有逐段串行传播所有后续 TD residual,也没有显式用下一 reconstructed segment 的起始 value 做 boundary bootstrap。论文因此把它列为 full-trajectory credit assignment 的 approximation。若 γλ<1\gamma\lambda<1 且后续 token 很多,早期 summary 的 advantage 还可能快速衰减;实验使用 length-adaptive λ=11/(1.5l)\lambda=1-1/(1.5l),但没有说明 variable segments 中 ll 的精确定义和跨段一致性。

证据定位:Section 4.2;Eqs. 13-15;Section 6 Limitations

5.6 Rollout 与训练数据流

  1. actor 在 64K 或 80K peak context 内与 Harbor 环境交互。
  2. 剩余预算低于 10,240 tokens 时,actor 生成 summary。
  3. runtime 用 system prompt、summary user message 和最近两轮重建新 context。
  4. 最多重复三次 compaction,单条任务最多使用四个工作窗口。
  5. runtime 保存 execution 与 summary segments、old-policy logprob 和最终 task reward。
  6. learner 以 global batch 128、group size 1 训练;critic 更新两次,actor 更新一次。
  7. token-level loss 聚合所有 generated tokens,cross-trajectory GAE 按原 rollout 位置修正 advantage。

训练使用 SWE-Dev 数据与 slime asynchronous RL framework。论文没有公开 queue、partial rollout、weight sync、policy lag 或 staleness correction 配置,因此目前只能确认框架选择,不能重建完整异步执行语义。

证据定位:Section 5.1;Figure 2。

6. 结论链条

论文的证据链可以收敛为:

  1. 固定 execution model、替换 summary model 会产生 6.5 pp SWE 差距,说明 summary quality 是实质变量。
  2. 在 compacted evaluation 下,CompactionRL 在 30B-A3B 和 106B-A30B 两个模型、两个 coding benchmark 上都高于 base model。
  3. 去掉 summary-token training、token-level normalization 或 cross-trajectory GAE 都会降低 compacted performance。
  4. CompactionRL 在 single-window evaluation 上没有稳定收益,效果与 test-time compaction 强绑定。
  5. 论文支持“compaction-aware PPO 优于作者的 base / standard PPO 配置”;closest-prior superiority、总体 compute efficiency、跨领域泛化和 GLM-5.2 scale-up 效果仍待验证。

关键实验/定理

结果 1:Summary agent 单独变化可带来 6.5 pp SWE 差距

Execution agent Summary agent SWE-Verified Pass@1 Avg. summaries / trace
GLM-4.7-Flash Qwen3.5-27B 55.5 1.010
GLM-4.7-Flash GLM-4.7-Flash 50.5 1.075
GLM-4.7-Flash Qwen3-30B-A3B 49.0 1.126
  • 设置:固定 GLM-4.7-Flash execution agent,只替换 inference-time summary agent。
  • 指标:SWE-bench Verified 200 题子集 Pass@1;每 trace 平均 summary 次数。
  • 结果:最佳与最低配置相差 6.5 pp,summary 次数只从 1.126 降到 1.010。
  • 证据定位:Section 4.1;Table 1。
  • 对照是否可比:execution agent 和 scaffold 对齐;summary models 的参数量、训练语料和生成成本不同,结果证明敏感性,无法把差异归因到单一 summary 属性。
  • 支持的最窄结论:在当前 GLM-4.7-Flash SWE setup 中,summary model choice 会显著改变 compacted-agent 成功率。
  • 解读:这组实验支持训练 summary 的动机,但没有证明 shared-actor joint RL 优于固定强 summarizer。

结果 2:CompactionRL 的收益集中在 compaction-enabled evaluation

Model / training SWE Single SWE Compacted TB2 Single TB2 Compacted
GLM-4.7-Flash base 47.5 50.5 14.6 13.4
+ PPO w/o compaction 50.0 48.0 16.9 12.4
+ CompactionRL 43.7 56.0 16.9 20.2
GLM-4.5-Air-SFT base 57.8 59.8 17.9 21.4
+ PPO w/o compaction 58.3 62.5 20.2 23.6
+ CompactionRL 57.3 66.8 21.4 24.5
  • 设置:30B 模型 peak 64K,106B 模型 peak 80K;compacted evaluation 最多三次 compaction;single evaluation 禁用 compaction。
  • Baseline:对应 base/SFT checkpoint;相同 peak length 的 standard PPO w/o compaction。
  • 指标:SWE-bench Verified 200 题子集和完整 Terminal-Bench 2.0 的 Pass@1,两次 evaluation runs 均值。
  • 结果:相对 base compacted inference,30B 提升 5.5 / 6.8 pp,106B 提升 7.0 / 3.1 pp。30B single SWE 从 47.5 降到 43.7;106B single SWE 从 57.8 小幅降到 57.3。
  • 证据定位:Section 5.2;Table 2。
  • 对照是否可比:内部三组共享 backbone、scaffold 和 peak length;CompactionRL 可以使用最多四个工作窗口,standard PPO 训练只有一个窗口,总 generated tokens、critic compute 和 wall-clock 未对齐。
  • 支持的最窄结论:在作者的 Harbor + Terminus-KIRA compacted evaluation 中,CompactionRL 比 base 和 standard PPO 获得更高 Pass@1,收益依赖启用 compaction。
  • 解读:结果支持 train-test alignment。它没有显示 CompactionRL 形成通用 single-window 能力提升。

结果 3:直接训练 summary token 在两个模型上方向一致

  • 设置:compaction-aware rollout 保持不变,将 summary response token 从 policy loss 中 mask,得到 CompactionRL w/o sum.
  • 结果:30B compacted SWE / TB2 从 54.5 / 12.4 提升到 56.0 / 20.2;106B 从 64.5 / 21.5 提升到 66.8 / 24.5。
  • 证据定位:Section 5.3;Table 3。
  • 对照是否可比:两组共享 compaction exposure 和 peak context;summary-token mask 是主要差异。论文没有报告多 seed,30B Terminal-Bench 的 7.8 pp 幅度可能包含评测方差。
  • 支持的最窄结论:在两个 paper-tested backbones 上,将 summary generation 纳入 shared task-reward PPO loss 均提高 compacted Pass@1。
  • 解读:这组消融是“summary 可训练”最直接的内部证据。

结果 4:Token-level loss 与 cross-trajectory GAE 都有正向消融

GLM-4.5-Air-SFT, 80K x 4 SWE Compacted TB2 Compacted
Base 59.8 21.4
CompactionRL 66.8 24.5
w/o token-level loss 60.0 21.3
w/o cross-trajectory GAE 63.0 22.5
  • 设置:106B-A30B 单一模型,compaction-enabled 80K x 4 evaluation。
  • 指标:SWE-bench Verified 和 Terminal-Bench 2.0 Pass@1。
  • 结果:去掉 token-level loss 分别下降 6.8 / 3.2 pp;去掉 cross-trajectory GAE 下降 3.8 / 2.0 pp。
  • 证据定位:Section 5.3;Table 4。
  • 对照是否可比:局部组件对照清楚;论文没有说明 w/o token-level loss 改用何种 sequence/segment reduction,也没有给出 seed、error bar 或两个组件的交互消融。
  • 支持的最窄结论:在当前 106B compacted setup 中,两项 correction 都与更高最终分数相关,token reduction choice 的影响更大。
  • 解读:结果支持 segment weighting 是主要训练风险;对具体因果机制仍需 loss-weight histogram 和多 seed 验证。

结果 5:训练后的摘要更长,agent 仍会使用更长 interaction horizon

  • 设置:比较 base、standard PPO、CompactionRL w/o summary training 和完整 CompactionRL 的 compaction 次数、tool calls、summary length、reasoning tokens 与 entropy。
  • 结果:完整方法比 base 和无 summary 训练版本使用更少 compactions / tool calls,同时 summary length 与 reasoning tokens 随训练增加;在触发 compaction 的任务子集上 accuracy 最高。
  • 证据定位:Section 5.4;Figures 3-4。
  • 对照是否可比:图中多项结论只给曲线或柱图,没有原始数值、置信区间和 length-controlled quality metric。更长摘要可能增加信息,也会增加 token 成本。
  • 支持的最窄结论:在当前 GLM-4.5-Air run 中,summary-token optimization 改变了摘要长度和 post-compaction behavior,并与更高 compacted-task accuracy 同时出现。
  • 解读:论文证明 actor 学会分配更多 token 给 summary,尚未直接测量摘要事实正确率、遗漏率或压缩率。

实验设置与 baseline 审计

维度 记录
Backbones GLM-4.7-Flash 30B-A3B;GLM-4.5-Air 106B-A30B。后者先用 GLM-4.7 trajectories 做 SFT。
Training data Open-source SWE-Dev。训练样本数量、过滤、reward implementation 和 task reuse 未展开。
Runtime slime asynchronous RL framework;Harbor environment;Terminus-KIRA agent scaffold。
Batch / grouping Global batch 128;group size 1。
Context 30B peak 64K;106B peak 80K;response cap 10,240;remaining budget <10,240 时 compaction;最多三次。
Optimizer Adam;actor LR 2×1062\times10^{-6};critic LR 3×1063\times10^{-6}
Critic 同 checkpoint 初始化;RL 前 value pretraining 50 steps;每 batch value x2、policy x1。
Advantage Length-adaptive GAE,λ=11/(1.5l)\lambda=1-1/(1.5l);cross-segment token-distance correction。γ\gammall 的 segment 语义和 value details 未充分说明。
Evaluation SWE Verified 随机 200 题;完整 Terminal-Bench 2.0;temperature 1.0;top-p 1.0;最多 250 turns;两次 runs 均值。
Strongest internal baseline Same-backbone standard PPO w/o compaction;另有 128K / 160K long-context PPO reference。
Closest-prior baseline 未运行 SUPO、ReSum-GRPO、Context-Folding、ECHO 或强固定 summarizer joint system。
Compute matching Peak context 对齐;累计窗口数、generated tokens、summary cost、critic cost、GPU hours 和 wall-clock 未对齐。
Statistics 无独立 training seeds、error bars、confidence interval 或 significance test。

证据链强度评估

强证据

  • 同一 execution agent 搭配不同 summary agents 的受控比较,直接显示 summary quality 会改变 task success。
  • 两个模型规模、两个 coding benchmarks 的 compacted setting 都呈一致正向结果。
  • summary-token training、token-level reduction 和 cross-trajectory GAE 都有局部消融,核心组件与效果方向一致。
  • TeX source 提供完整公式、训练 learning rate、context threshold、batch、critic update ratio 和主要表格。

中等强度证据

  • 64K x 4 / 80K x 4 在更低 peak context 下达到或超过部分 128K / 160K long-context reference,支持 memory-footprint 方向;总计算和累计 token 未对齐。
  • Figure 3-4 支持 summary behavior 发生变化,但缺少 raw data、summary factuality 和压缩率。
  • GLM-5.2 应用声明提供 production relevance,缺少对应规模实验和独立 release-level 方法映射。

需要谨慎的推论

  • CompactionRL 没有直接证明 group-wise methods 无法处理 variable segments;SUPO 已在 rollout level 计算 group advantage 并做全 token 归一化。
  • 更高 compacted Pass@1 不能直接转写为更低总成本。最多四个窗口、summary generation 和独立 106B critic 都会增加 compute。
  • Cross-trajectory GAE 只恢复 terminal reward 的 token distance,没有构造完整 boundary-aware Bellman recursion。
  • 随机 200 题 SWE 子集、两次 evaluation runs 和无 training seeds 使小幅差异的统计可信度有限。
  • 公共模型表采用不同 benchmark coverage 和 agent scaffolds,论文也明确把它们列为 reference only。

OpenReview / 审稿意见吸收

  • Page type: not-found
  • Match confidence: high
  • Observed at: 2026-07-13
  • Venue status: arXiv preprint;TeX 使用 NeurIPS 2026 style,正式投稿或录用状态 unknown。
  • Public reviews: 未发现与完整标题、五位作者或 arXiv:2607.05378 可可靠匹配的公开 reviews。
  • Ratings / confidence: 无公开数据。
  • Reviewer consensus: 无可吸收的正式 reviewer consensus。
  • Main criticisms: 无公开正式审稿文本;本地审计重点放在 SUPO novelty overlap、closest-prior baseline 缺失、cross-segment GAE approximation、compute matching 与统计充分性。
  • Author response: 未发现公开 rebuttal。
  • 对可信度的影响: 方法公式和内部实验可由 TeX source 复核;创新强度、实现正确性、跨任务泛化和大规模部署仍缺公开同行评审、代码和独立复验校准。

本地讨论补充

1. “Cross-trajectory” 的实际边界

该名称容易让人联想到不同 rollout 之间的信息传播。论文公式只连接同一原始 rollout 被 compaction 切出的 segments:N>sN_{>s} 统计的是同一 τ\tau 中后续 trainable tokens。它更准确的工程名称可以写成 cross-segment trajectory-position correction

2. 最终 reward 如何落到摘要 token

直观数据流如下:

task final reward R
        |
        +--> execution segment 1 -- local critic/GAE -- position discount --> token advantages
        +--> summary segment     -- local critic/GAE -- position discount --> token advantages
        +--> execution segment 2 -- local critic/GAE -- position discount --> token advantages

成功轨迹中的 summary token 可以获得正 advantage,失败轨迹中的 summary token 可以获得负 advantage;具体符号和幅度取决于 critic baseline、local TD residual 和后续 token distance。该机制训练的是“哪些摘要表达最终有利于任务”,没有显式监督事实完整性、压缩率或格式质量。

3. Group-wise method 的批评需要收紧

若把每个 segment 当作 group sample,compaction 多的 rollout 会重复进入 reward statistics,论文指出的偏差成立。SUPO 采用另一种组织方式:先按 complete rollout 计算 group-relative advantage,再把同一个 advantage 广播到该 rollout 的所有 split trajectories,loss denominator 使用所有 generated tokens。CompactionRL 的 critic 提供 state/token-dependent credit,并允许 group size 1;这两点构成更准确的差异。

4. Token-level normalization 修正了什么

它修正的是每 segment 一票的 reduction artifact。设 rollout A 被切成 2 段,rollout B 被切成 6 段;segment mean 再平均会让 B 获得约三倍 sample mass。全 token mean 改为按真实 generated-token 数加权。若 B 本身生成更多 summary 与 execution tokens,它仍会贡献更多梯度。这是按 token 计权的设计选择,需要和 trajectory-balanced objective 分开。

5. 固定 peak context 与总计算的关系

CompactionRL 控制任一时刻的 active context 峰值,因此有利于单次 forward/backward 的显存上限和 kernel 可执行性。它允许任务跨四个窗口继续,累计生成 token、prefill、summary decode 和 critic compute 都会上升。论文证明的是“固定峰值窗口下扩展可用 horizon”,当前数据没有证明 total FLOPs、GPU hours 或 wall-clock 更低。

6. Cross-segment GAE 的复验重点

  • 明确 ll 在 length-adaptive λ\lambda 中使用 segment length、原始 rollout length还是 batch statistic。
  • 对每个 boundary 记录 next-segment initial value,比较完整 stitched GAE、当前指数修正和简单 reward broadcast。
  • 报告 early-summary / late-summary advantage magnitude、sign agreement、explained variance 与 return calibration。
  • 比较按 generated-token distance、environment step distance 和 wall-clock action distance 的 discount。
  • 运行 γλ\gamma\lambda sweep,检查多次 compaction 后 early summary signal 是否消失。

7. 最关键的公平对照

同一 backbone、数据、scaffold 和峰值 context 下至少需要:

Context training Advantage Summary policy 目的
SUPO-style segments rollout-level group advantage shared actor closest-prior direct baseline
CompactionRL segments critic + local GAE shared actor 当前方法
CompactionRL segments critic + stitched full GAE shared actor 检验位置修正近似
CompactionRL segments critic + cross-segment GAE frozen strong summarizer 分离 shared-actor summary learning
ECHO-style memory traceable selected-turn credit shared actor 比较 opaque summary 与 source-indexed memory

同时对齐 rollout tokens、actor updates、critic FLOPs、summary tokens、peak HBM、GPU hours 和 wall-clock,才能判断算法质量与系统成本的净变化。

8. 与 SUPO 的创新边界与最终定位

CompactionRL 相对 SUPO 的新增机制集中在训练估计器。SUPO 已经让同一 LLM 生成摘要和工具动作,从完整 rollout group 计算一次相对 advantage,再把该信号广播到所有 split trajectories;其目标也使用全局 generated-token denominator。CompactionRL 的 summary 同样属于 policy action,由最终任务 reward 更新,没有额外 summary label。

两篇方法的差异集中在训练估计器:

维度 SUPO CompactionRL 创新判断
Summary / execution policy 同一模型联合生成与训练 同一模型联合生成与训练 已有共同骨架
Advantage 同 prompt rollout group 的单一 group-relative advantage 独立 critic 给出 state/token-dependent advantage 支持 group size 1,是相对 SUPO 的明确配方增量
Segment weighting 全部 split trajectories 的 generated-token denominator 全 batch generated-token mean SUPO 已覆盖核心归一化思路
Boundary credit 同一 rollout advantage 广播到各 segment cross-segment GAE 按后续 token 距离修正终局信号 本文最明确的算法增量,但仍是 full-trajectory GAE 的近似
实证范围 长程搜索 30B/106B coding 与 terminal agents 提供新的任务和规模证据

因此,CompactionRL 的贡献重心应放在三点:第一,独立 critic 把 compaction-aware RL 扩展到 group size 1;第二,cross-segment GAE 尝试恢复压缩边界改变的终局 reward 距离;第三,在两个模型规模和两个 coding benchmarks 上验证这套 recipe。Context summary、shared-actor joint training 和全 token 归一化均有直接前作。

论文缺少同 backbone、scaffold、compaction prompt、peak context 与总计算预算下的 SUPO objective 对照。现有消融只能说明 summary-token training、token reduction 和 GAE correction 在 CompactionRL 内部有效,无法识别 critic 路线相对 rollout-level group objective 的净收益。最终定位采用“segmented rollout 的 actor-critic credit/loss recipe”,并把 coding-agent 规模实验视为实证贡献。

主要启发

  • Context compaction 的机制创新与 segmented-rollout estimator 应分别判断;CompactionRL 的真实增量主要位于 critic、跨 segment credit 和 coding-agent 规模验证。
  • Agent context manager 可以直接作为 policy action 训练,summary content 的价值由后续 task outcome 定义。
  • Compaction boundary 同时改变 policy state 和训练 sample boundary,loss reduction 与 credit assignment 需要一起设计。
  • 同一 actor 承担 execution 和 summary 可以减少额外 serving model,独立 critic 仍带来显著训练参数与计算成本。
  • 长程 RL 报告需要同时给 peak context、effective horizon、generated tokens、summary tokens 和 total compute。
  • Context reconstruction 的 provenance 决定可用的 credit 粒度。Opaque summary 适合简单端到端训练,ECHO 式 source id 更利于因果追踪。
  • Group size 1 降低同 prompt 多 rollout 需求,也把 baseline 质量和 critic tracking 重新放回系统中心。

局限

  1. 没有公开代码,segment packing、prompt masking、value head、GAE boundary、loss reduction 和 slime async runtime 无法核验。
  2. 没有与 SUPO、ReSum-GRPO、Context-Folding 或 ECHO 的直接实验,closest-prior novelty 和质量优势未被识别。
  3. Token-level loss 只移除 segment-equal weighting,长 trajectory 仍按 generated-token 数获得更大总权重。
  4. Cross-trajectory GAE 是终局 reward 位置修正,没有恢复完整跨 boundary TD recursion;llγ\gamma 与 boundary bootstrap 细节不足。
  5. CompactionRL 可以使用最多四个工作窗口并增加 summary/critic compute,实验没有 GPU hours、wall-clock、throughput 或 memory 分项。
  6. SWE-bench Verified 只评随机 200 题,未公开子集 id;每个结果只有两次 evaluation runs,缺少 training seeds 和误差线。
  7. 训练与评测集中在 coding / terminal agent;search、GUI、web、multi-agent 和非二元长期 reward 尚未验证。
  8. Summary quality 主要通过最终 task score 与长度间接判断,缺少事实正确率、遗漏率、压缩率和 error propagation 分析。
  9. Single-window 结果没有稳定提升,部署必须保留 test-time compaction protocol,形成明确的 train-test coupling。
  10. GLM-5.2 deployment 没有对应 750B-A40B 配置、消融和效果表,只能作为作者应用声明。

跨论文关系

  • 与已有论文的作者或机构关系:Yujiang Li、Zhenyu Hou、Jie Tang、Yuxiao Dong 同时参与 SAO;两篇论文都连接清华大学 KEG 与 Z.AI,并都声明接入 GLM-5.2 agentic RL pipeline。
  • SUPO:两者都让同一 actor 生成 summary 与 tool action,并用最终任务 reward 联合训练;SUPO 已在 rollout level 计算 group-relative advantage 并按全部 generated tokens 归一化。CompactionRL 的新增集中在 group size 1 独立 critic 与跨 segment GAE 位置修正,缺少同设置直接实验,因此当前无法判断两种 estimator 的相对质量和计算收益。
  • SAO:两者都选择 group size 1 / critic 路线。CompactionRL 处理 variable compaction segments 与跨 segment reward distance;SAO 处理 async single-rollout readiness、stale-token mask 和 skip-observation GAE。共同风险包括 critic compute、value tracking 和 production scale 细节缺失。
  • ECHO:两者都把 context reconstruction action 纳入 RL。CompactionRL 生成 opaque full-prefix summary,并用 critic/GAE dense 地训练所有 generated tokens;ECHO 保留 source-indexed compact findings,通过 selected source trace 路由 credit。
  • SelfCompact:两者都让同一个 actor 生成摘要并从压缩 state 继续。SelfCompact 用任务专用 rubric 在 inference time 选择压缩时机,不更新权重;其 search 附录声明单次摘要上限与 30% context backstop,但触发图、定性案例和公开代码没有形成一致协议。CompactionRL 用预算阈值触发多段 compaction,再通过 critic、token-level PPO 与跨 segment GAE 联合训练摘要和 execution。该对照把 timing controller 的收益与 compaction-aware RL credit 分开。
  • GLM-5.2:GLM-5.2 release 已提到 compact trajectory、critic-based PPO 和 token-level loss;CompactionRL 给出 threshold、summary reconstruction、cross-segment GAE 和 30B/106B 消融,补充该 production recipe 的公开方法证据。
  • slime:论文明确使用 slime 完成 asynchronous RL training,是该框架支持 custom agent rollout、critic 和 token loss 的直接下游案例;具体 queue 与 weight-sync 配置仍未公开。
  • Credit Assignment Survey:CompactionRL 属于 outcome reward 下的 token/segment credit assignment。它通过 critic 和 token-distance discount 处理 compaction boundary,仍保留 delayed reward 与 state compression 的因果近似。
  • VIMPO:VIMPO 从 policy/reference ratio 构造 implicit value,省去独立 critic;CompactionRL 恢复完整 critic,以支持 reconstructed contexts 和 group size 1 token advantage。
  • LLM 与 Agent 强化学习中的信用分配:该主线将 CompactionRL 归入压缩状态 critic 路线,并与 ECHO 的来源 mask、Memory-R2 / HiMPO 的同状态局部比较对照;其优势是有符号时间信用,主要估计风险来自 critic 校准与边界 bootstrap。

Reference Intake Brief

Target

  • Intended target system: 新增 CompactionRL 论文笔记,并更新索引行、主题标签、作者档案和对应论文的关系章节。
  • Existing related assets: content/utility/papers-index.mdSAOECHOGLM-5.2Credit Assignment Survey
  • Proposed form: 新建独立 Markdown 文档;更新索引行、四个 controlled tags、五位作者档案和对应论文的关系章节。

Reusable Elements

  1. Context transition:threshold -> shared-actor summary -> summary + recent tail reconstruction。
  2. Training representation:execution / summary segments 共享 final reward,生成 token 统一进入 PPO。
  3. Weighting correction:全 batch token average 消除 segment-count reduction artifact。
  4. Credit correction:local GAE 乘 (γλ)N>s(\gamma\lambda)^{N_{>s}},恢复 terminal reward 的跨段 token distance。
  5. Model topology:shared actor/summarizer + independently initialized critic + 2:1 value/policy update ratio。
  6. Audit frame:peak context、effective windows、generated tokens、summary tokens、critic FLOPs 与 wall-clock 分开报告。

Risks

  • Copyright/over-copying: 只保留必要公式、实验数字和本地重组分析,没有复制长段正文。
  • Unsourced or unverifiable claims: closest-prior、compute 和 GAE 边界均标为本地分析;论文事实附章节、公式、表或 URL。
  • Tone/brand mismatch: 采用方法审计语气,不把作者 deployment statement 写成独立复验结果。
  • Safety/compliance issues: 本文属于 agentic RL 与 context management,没有沉淀可直接滥用的操作细节。
  • Overlap with existing assets: 与 ECHO、SAO、GLM-5.2 关系紧密;本节点聚焦 shared-summary PPO 和 cross-segment advantage。

Skipped

Material Reason
公开代码实现 作者未提供,无法核验 segment packing、GAE 和 runtime。
公开 reviewer comments 未发现可可靠匹配的 OpenReview / conference review page。
GLM-5.2 scale-up 配置 论文只有 deployment statement,没有 750B training table 或 curve。
公共闭源 / 开源模型横向排名 SWE 子集、agent scaffold 和 context protocol 不一致,只作为论文中的 reference。
Figure 原图缓存 方法公式和表格已完整覆盖核心机制,本次不增加二进制站点资产。

Recommendation

Decision: merge

Why: CompactionRL 为长程 coding agent 的 context compaction 提供了一套完整的 actor-critic training recipe,并把 summary token、segment weighting 和跨 boundary credit 放进同一个 PPO 数据流。归档同时保留 SUPO 已覆盖 joint summarization 的先验、group-wise method 的可行替代、token weighting 边界和 cross-segment GAE approximation,将其核心贡献定位为具体的 critic、credit 与 system recipe。