2606.23525-self-compacting-language-model-agents

Self Compacting Language Model Agents

SelfCompact 把长轨迹摘要做成同一模型可执行的 hard-reset 操作,再用任务专用、要求引用当前轨迹证据的 rubric 决定何时压缩;它在七个开放权重模型的数学与搜索实验中优于无压缩,并在大多数质量对照上优于固定时机摘要。最可靠的增量是把 timing 判断拆成可审计的状态 predicate,消融支持含 rubric 的完整 policy 优于自由摘要工具;search 附录声明的 40k token gate、30% backstop 和单次上限与触发图、定性案例及公开代码无法完全对齐,raw logs 又未公开,因此 Table 4 的精确 controller 版本仍不确定,成本下降也只相对无压缩成立。

Authors Tianjian Li, Jingyu Zhang (张景昱), William Jurayj, Xi Wang, Chuanyang Jin, Mehrdad Farajtabar, Eric Nalisnick, Daniel Khashabi

已审阅 Archived 2026-07-16 18:29 Updated 2026-07-23 16:59 Reviewed 2026-07-23 16:59 Source

Source

作者与关系

论文把七位 Johns Hopkins University 作者与 Apple 的 Mehrdad Farajtabar 连接起来;致谢同时列出 Apple、DARPA、ONR 与 Johns Hopkins DSAI cluster。Tianjian Li 的个人主页列出本论文,官方代码仓库位于其 GitHub 账号下。Tianjian Li 由 Daniel Khashabi 指导,Jingyu Zhang 由 Daniel Khashabi 与 Benjamin Van Durme 共同指导,William Jurayj 由 Benjamin Van Durme 指导;Eric Nalisnick 的研究组将 Xi Wang 列为博士生,Chuanyang Jin 则连接 Tianmin Shu 的 Social Cognitive AI Lab 与长程 agent 研究。论文没有标注共同一作或共同通讯作者,作者角色不宜从排序单独推断。

Eric Nalisnick 与 Daniel Khashabi 还共同参与 ICML 2026 的 Conformal Thinking,合作者包含本论文中的 Xi Wang、William Jurayj 与 Mehrdad Farajtabar;该合作线关注推理停止、风险控制和 corrupted context。SelfCompact 将同一作者群的上下文可靠性问题推进到长程 agent 的压缩时机。

当前归档中的 MegaScale-MoE 也列有一位 Xi Wang,其论文时机构为 ByteDance Seed。本论文 Xi Wang 的 Johns Hopkins 身份由 Eric Nalisnick 研究组及其公开账号交叉支持;两位同名作者当前不视为同一作者,也不建立作者重叠关系。

阅读目标与判断边界

本笔记关注:

  1. SelfCompact 新增的是摘要内容生成、压缩时机判断,还是两者的组合。
  2. 数学与搜索 rubric 如何定义“可安全压缩”,实际执行中还包含哪些硬门槛和兜底规则。
  3. fixed interval、delete-all、keep-last-N 与 rubric-free tool baseline 是否足以识别 timing 的贡献。
  4. 论文中的 accuracy、token budget、USD cost 与 KV-cache 论证分别支持到什么范围。
  5. arXiv v2 与当前公开代码能否复现论文实验,哪些默认值已经发生变化。

判断边界:

  • 论文只测试竞争数学和 agentic search,模型均为开放权重模型;coding、GUI、multimodal、multi-agent、长期对话和持续记忆没有进入实验。
  • Search 每个 benchmark 抽样 150 题并报告 5 次运行的标准差;数学每题采样 16 次,缺少独立实验 seed、置信区间和显著性检验。
  • Search 附录声明 SelfCompact 受 minimum round、40k token、probe period、最多一次摘要和 30% context 强制兜底共同控制;Figure 2、定性案例和公开代码与该声明存在冲突,Table 4 的实际 trigger mix 无法由现有材料恢复。
  • 论文使用 provider price 与推导出的 token lifecycle 估算成本,没有报告真实账单 cache-hit telemetry、端到端 latency、TTFT、吞吐或能耗。
  • 当前代码仓库只覆盖 search agent,默认 selfcheck_cap=1000,也没有实现论文附录声明的 30% SelfCompact backstop;仓库缺少数学实验实现、paper command manifest、raw trajectories 或结果文件。
  • TeX source 启用了 neurips_2026main, final 样式。NeurIPS 2026 官方作者通知日期为 2026-09-24,当前也没有公开 venue page;该样式只能证明排版选择,无法确认投稿或录用状态。

证据写法:

  • 论文事实:arXiv v2 正文、附录、表格、算法、TeX source 与官方仓库直接给出的内容。
  • 作者主张:摘要、实验分析和结论对 context rot、metacognitive gap 与成本收益的归因。
  • 本地分析:对 controller 边界、baseline 可比性、成本口径、代码差异与外部有效性的重建。
  • 关键判断附 证据定位,使用章节、表、图、附录、代码路径、commit 或官方网页 URL。

术语预备

  • Context rot:长轨迹中的旧错误、已放弃候选和重复 observation 持续影响后续生成,形成随上下文积累而增长的干扰。
  • Context compaction:用更短表示替换当前历史,再从重建后的上下文继续执行。
  • Hard reset:摘要生成后丢弃原轨迹,只保留原始问题与摘要;search 代码还加入 system message 和 continue turn。
  • Rubric probe:把判断提示追加到当前完整前缀,让同一模型输出结构化状态判断;probe 结果不保留在后续轨迹中。
  • Fixed interval:按固定 token 或 context 比例触发同一种摘要操作,不读取当前语义状态。
  • Prefix-cache reuse:probe 与 summarizer prompt 在 message-list 层追加到共同历史;服务端序列化后若仍形成相同 token prefix 并保留对应 KV cache,可以减少重复 prefill。

论文脉络

1. 研究问题、背景和价值

长程推理和工具 agent 会持续追加思考、工具调用、网页内容与失败尝试。上下文窗口给出了容量上限,注意力与输入计费还会随每轮携带的历史增长。更早出现的风险来自语义干扰:模型可能已经放弃某条路线,旧内容仍留在 prompt 中,并继续影响新一轮生成。

工程系统通常在接近窗口上限时压缩,或每隔固定 token / turn 做一次摘要。这类规则能控制长度,却无法识别当前轨迹正在推导中间步骤、刚完成一个闭合子任务,还是反复停留在错误线索。一次摘要会不可逆地改变后续 state;触发时机因此和摘要内容同样重要。

论文的问题可以写成:在不训练新 policy、也不引入外部 judge 的条件下,现有模型能否根据自身轨迹结构判断“现在是否适合摘要”,并在准确率、上下文成本和实现复杂度之间形成更好的折中。

这一问题有直接产品价值。若轻量 scaffold 已能提供有效 timing,部署者可以在 post-training 之前先获得一条低改造成本的 context-management 路线;若模型无法稳定自判,系统仍需要可学习 policy、外部 verifier、structured memory 或 provenance-aware reconstruction。

证据定位:Sections 1-2;Figure 1;Section 3 Triggering the summarizer

2. 已有解决方案与不足

论文把先前路径分成四组:

路径 典型触发 保留形式 主要边界
Reactive compaction 接近 context budget 自然语言摘要 触发较晚,旧错误已经参与多轮生成
Periodic / threshold compaction kk token、每 kk turn 或 30% context 自然语言摘要 容易在 active subgoal 中间切断状态
Training-based compaction SFT / RL 学习摘要或压缩 action 摘要、folded state 或 memory 需要训练数据、reward 与 rollout infrastructure
KV eviction / sparse retention recency、attention 或 learned importance token / KV 子集 降低 attention 与显存成本,保留表示通常不可直接检查

ReasoningCache、ReSum、InfThought 等方法已经使用“生成一段轨迹—摘要—继续”的循环,其中多数仍按固定长度触发。RE-TRAC 提供 training-free 版本,但由外部 frontier summarizer 在完整 search trajectory 之后按固定时机压缩。2026 年 3 月的 LangChain autonomous context compression 也暴露 summary tool;论文将自身增量定位在显式 rubric 对 timing 的约束。

这些比较揭示了一个更窄的空白:模型已经具备工具调用与摘要能力,scaffold 缺少一份可执行的“安全压缩条件”。SelfCompact 尝试用少量文字和证据要求补上这层 controller。

证据定位:Sections 2、6;arXiv:2602.03773(ReasoningCache);arXiv:2509.13313(ReSum);arXiv:2602.02486(RE-TRAC)。

3. 作者可能的思考路径

以下为本地分析的受约束重建:

  1. 固定摘要在平均分上可能有效,同时存在大量单次 correct -> wrong 转移,说明“是否压缩”需要读取当前任务状态。
  2. 让模型自由输出 summary tool token 的实现成本很低,rubric-free 消融却显示不同模型会过早调用、很少调用或在无效时机调用。
  3. 直接训练 timing policy 会混入训练数据、reward 与 optimizer 的影响;先使用 inference-time prompt 可以单独检验 timing guidance 的价值。
  4. 把抽象的“已经完成子任务”拆成可逐项判断的问题,并要求模型引用当前轨迹中的证据,可以降低无依据的自我报告。
  5. probe 与 summary 都追加在已有 message history 后,为同一 serving engine 的前缀缓存提供复用机会;触发后只 prefill 短摘要,后续每轮的 prompt 也随之缩短。
  6. 数学和搜索具有不同的闭合状态,因此分别设计 rubric:数学关注已有答案、停滞与明确下一步;搜索关注 closed unit、可压缩事实、实际进展与卡住状态。
  7. 在目标设计中保留硬 token gate 和 budget backstop,可以把模型判断放入一个有界 controller,避免 probe 过密或一直拒绝压缩导致 overflow。

4. 核心假设或切入点

SelfCompact 依赖以下假设:

  1. 同一个模型能在 actor、rubric judge 与 summarizer 三种角色之间切换,且 judge 的错误和 actor 的错误不会完全相关。
  2. “引用轨迹证据”足以让二元判断反映当前状态,无需校准过的 verifier probability。
  3. 任务存在可辨识的 semantic checkpoint;在 checkpoint 摘要会比固定长度切分少丢失 active state。
  4. 自然语言摘要是后续决策的近似充分状态,原始工具输出、失败路径和 provenance 可以安全删除。
  5. 任务专用 rubric 的手工成本明显低于 post-training 成本,并能迁移到同类 benchmark。
  6. serving path 会复用追加式 prefix cache;摘要后的未来调用足够多,可以摊销 probe、summary decode 与新前缀 prefill。
  7. Search 附录声明的硬门槛与强制 backstop 能稳定执行,并且不会掩盖 rubric timing 的主要效果。

实验对第 1、3、5 项提供了间接支持,对第 2、4、6、7 项仍缺少 judge calibration、summary fidelity、真实 cache telemetry、可自洽的冻结协议和 gate interaction 消融。

5. 方法 / 系统 / 理论框架

5.1 首要贡献:rubric-gated compaction controller

设原始问题为 xx,当前轨迹为 y1:ty_{1:t},模型为 π\pi。摘要操作写为:

y~=S(x,y1:t),Ct+=xy~. \tilde y = \mathcal S(x,y_{1:t}), \qquad \mathcal C_{t^+}=x\circ \tilde y.

到达检查间隔时,运行框架在当前轨迹后追加评分量规提示(论文记为 P_R)。同一模型读取原始问题、当前轨迹和该提示,输出 COMPRESSCONTINUE

若输出 CONTINUE,评分提示与此次判断会从当前上下文中移除,原轨迹继续执行;若输出 COMPRESS,系统在完整前缀后追加摘要提示(P_S),生成新摘要,再执行 hard reset。决策、摘要和任务执行共享模型参数,整个过程不更新权重。

这一机制把 context manager 分成三个层次:

task trajectory
      |
      v
cheap hard gates ------> skip probe
      |
      v
same-model rubric -----> CONTINUE -> restore unchanged trajectory
      |
   COMPRESS
      v
same-model summary ----> [original question + summary] -> resume

核心新增位于第二层。摘要生成和 hard reset 已存在于多项前作;SelfCompact 为触发时机增加一组可以审计的 semantic predicates。

证据定位:Section 3;Algorithm 1;Appendices Math experimental setupAgentic-search experimental setup

5.2 数学 rubric:答案锁定与停滞后重启

数学 probe 每个 round boundary 判断:

  • Q1 ANSWER:最新一轮是否给出具体 final answer。
  • Q2 STUCK:最近两轮是否没有新增非平凡事实。
  • Q3 HAS-NEXT:是否能写出一个精确下一步。

触发规则为:

COMPRESSQ1=Y  (Q2=YQ3=Y). \mathrm{COMPRESS} \Longleftrightarrow Q_1=Y\ \lor\ (Q_2=Y\land Q_3=Y).

第一分支把已得到的 boxed answer 固定到摘要中,第二分支清理停滞轨迹并保留一个明确下一步。每个判断都要求一条短 evidence;无 evidence 默认 N。摘要最长 512 tokens,后续模型收到原问题、上一轮摘要与 continuation instruction。

该规则同时做了两件事:在得到候选答案后压缩以减少后续反复改写;在连续停滞且仍存在下一步时清除旧尝试。它没有判断候选答案是否正确,Q1=Y 只检查答案形式。因此 answer-lock 可能保存错误答案,后续 prompt 仍要求验证并改进。

证据定位:Appendix Math experimental setup,Box Math rubric prompt、Box Math summarizer prompt

5.3 Search rubric:闭合单元、可约简状态、进展与非停滞

Search probe 要求四项同时通过:

COMPRESSC1=YC2=YC3=YN1=N. \mathrm{COMPRESS} \Longleftrightarrow C_1=Y\land C_2=Y\land C_3=Y\land N_1=N.
  • C1 CLOSED-UNIT:最近 assistant message 已经结束一个工具调用或子分析。
  • C2 SUMMARIZABLE:后续所需状态可约简为 3-5 条带引用事实。
  • C3 PROGRESS:上次压缩后获得新事实或细化了子问题。
  • N1 STUCK:最近四次 search 至少三次没有新 URL / fact;Y 会阻止压缩,先要求切换搜索策略。

附录的 search 实验设置声明四个 cheap gates:iteration 至少 3、prompt 至少 40,000 tokens、距上次 probe 至少 2 rounds、总摘要数小于 1;prompt 达到模型 context window 的 30% 时,backstop 会绕过 rubric 直接触发摘要。三种模型的窗口 / 声明 backstop 分别为 128,000 / 38,400、196,608 / 58,982、262,144 / 78,643 tokens。

这份声明内部存在可复查的协议冲突。GLM 的 40k rubric gate 高于 38.4k backstop,按该规则无法出现位于 30% 左侧的 rubric trigger,但 Figure 2 文字称三个模型的 rubric-fired 分布都向阈值左侧偏移。MiniMax 的 backstop 为 58,982 tokens,三个定性 SelfCompact 案例却分别在 70.0k、70.2k 和 118.6k 才压缩,并明确描述轨迹可以越过 30% 继续增长。当前公开代码及其 Git 历史也没有这条 backstop。

因此,“一次 rubric-gated checkpoint + 固定 budget safety backstop”只能作为附录声明的 controller。Algorithm 1 省略 minimum token、cap 与 backstop,公开 artifact 采用另一套触发逻辑;raw trajectories、trigger-reason counts 和冻结命令缺失,使 Table 4 实际使用的 runner 版本无法确认。

证据定位:Appendix Agentic-search experimental setup;Table search_model_config;Box Search rubric probe

5.4 摘要重建与 KV-cache 路径

在 message-list 层,probe 和 summarizer 都作为 trailing user message 追加到完整轨迹,这为 prefix cache 复用提供了机会。当前 artifact 中,actor request 携带 tools,probe / summarizer 移除 tool schemas,GLM probe 还会改变 thinking flag;论文没有证明 chat template 与 request serialization 后仍保留 byte-identical token prefix,也没有报告 cache telemetry。摘要生成后,live context 重建为:

Creset=[system,original_question,assistant_summary,user_continue]. \mathcal C_{\mathrm{reset}} = \left[ \mathrm{system}, \mathrm{original\_question}, \mathrm{assistant\_summary}, \mathrm{user\_continue} \right].

设摘要长度为 \ell。论文把 summary decode 写成 O(L)\mathcal O(L\ell),新 prefix prefill 写成 O(2)\mathcal O(\ell^2);后续每轮从携带 LL tokens 变为携带 \ell tokens。Search 中观测到 5050-100100k prefix 压到 11-33k,对应约 2020-80×80\times 的长度收缩。

若 serving endpoint 对序列化后的公共部分执行 exact-prefix caching,已有 LL-token prefix 才能避免为 probe 与 summary 重复 prefill。这条收益链还要求压缩后仍有足够多的后续调用。任务很快结束、provider 没有 cache hit、摘要过长或遗漏导致重复搜索时,额外 probe 与 summary decode 可能无法摊销。正文声称附录推导了 L/>10L/\ell>10 的 break-even;当前 v2 附录列出 cost model 和 token tables,却没有给出该不等式的完整推导与所需 future-call 假设。

证据定位:Section 3 Summarizer designCost analysis;Appendix Cost analysis of summarizationTrajectory token consumption

5.5 当前代码 artifact 与论文协议

官方仓库公开了 ReAct search agent、Serper / crawl4ai 工具、BrowseComp-Plus corpus retriever、LLM-as-judge evaluator 和 scorer。agent.py 中的 parse_rubricfirst_principles_verdictrun_selfchecksummarize_decide_compaction 对应 search 方法主路径;rubric 调用不计入 tool-call budget,summary 成功后重建四条 message。

当前 artifact 与论文协议之间至少有以下差异:

  1. 论文附录要求 total summaries < 1;commit 7d7715a 把默认 selfcheck_cap 从 1 改为 1000,当前 main 与 README 都描述为 effectively unbounded。
  2. 当前公开 Git 历史没有实现 30% SelfCompact backstop;fixed 按每 6 次 tool calls 压缩,论文按 30% context token threshold。代码也没有 paper table 中的 delete-all 与 keep-last-3 policies。
  3. Runner 默认 4 rollouts,论文报告 5 runs;代码统一使用 max_tokens=108000,论文列出 128k / 196,608 / 262,144 context。当前 GLM actor 开启 thinking,rubric probe 关闭 thinking,论文配置写 enable_thinking=True, clear_thinking=False;probe 额外固定 top_k=40,论文未披露该参数。代码的 summary 上限为 GLM 8,192、其余模型 65,536,论文 search call 上限为 10,000。
  4. utils.py 按相邻请求的正向 input delta 乘 uncached input rate 计费,既不等同于正文的累计 prompt 全按 cache-read rate,也不等同于附录的 two-rate lifecycle。MODEL_COSTS 没有 MiMo-V2-Flash,当前 runner 会为该模型返回零 rollout cost。
  5. 论文实验通过 OpenRouter 访问三个模型;README 默认展示本地 OpenAI-compatible / vLLM endpoint。两条 serving 路径的 cache、价格与 model revision 语义不同。
  6. 仓库没有数学 scaffold、math rubric runner、ReasoningCache adaptation 或对应 scoring script,无法从当前 artifact 复现 Table 1-3 的数学结果。
  7. 仓库没有论文实验的 command manifest、150 题采样 id、raw rollout、trigger reason、5-run outputs、provider revision 或 dependency lock;requirements.txt 只有非锁定依赖,仓库也没有 release / tag。

因此当前代码适合检查 controller 的一种实现结构,并可作为新的 search experiment 起点;公开历史中没有可直接充当论文 v2 结果 frozen reproduction package 的完整版本。

证据定位:官方仓库 commit 12958172dacb77e71883d189b40638f693cd20deagent.pyrun.pyREADME.md;commit 7d7715a2dade20e6776898975ce65754eb24cfe0

6. 结论链条

论文的有效结论链可以收紧为:

  1. 固定摘要存在大量有害状态转移,说明 token count 不能充分表示安全压缩时机。
  2. 同一模型自由调用摘要 tool 的表现接近 fixed baseline,单独暴露工具不足以稳定选择时机。
  3. 加入任务专用、evidence-grounded rubric 后,数学平均准确率在四个模型上提高,search 平均准确率在三个模型上提高。
  4. Search 表中标为 SelfCompact 的条件按作者的单费率和双费率模型都低于 no-compaction,fixed / truncate 通常仍更便宜。
  5. 当前数据支持论文所报告的 rubric-equipped policy 优于作者实现的 fixed timing / free tool timing;search 的 trigger 版本与 rubric / backstop 占比仍未确认,通用 metacognition、摘要事实完整性、真实 latency 优势和相对所有 context manager 的 Pareto dominance 也没有得到识别。

关键实验/定理

结果 1:竞争数学在 11/12 个模型-数据集单元领先 fixed interval

Model No Compaction avg. Fixed avg. SelfCompact avg. SelfCompact vs. Fixed
Qwen3-4B-Instruct-2507 38.7 [16k] 41.5 [44k] 45.1 [48k] +3.6 pp
Qwen3-30B-A3B-Instruct-2507 50.6 [16k] 54.9 [26k] 56.4 [29k] +1.5 pp
Qwen3.5-9B, thinking disabled 32.5 [16k] 40.1 [90k] 47.3 [93k] +7.2 pp
Qwen3.5-4B, thinking disabled 21.9 [16k] 30.7 [64k] 33.8 [67k] +3.1 pp
  • 设置:IMO-Answerbench、HMMT Nov 2025、HMMT Feb 2026;temperature 1.0、top-p 0.7;每题 n=16n=16;每轮 16,384 tokens,最多 12 rounds;summary cap 512 tokens。30B-A3B 使用 TP=2,其余各使用单张 H200。
  • Baseline:单轮 16k no-compaction;每轮末固定摘要;rubric-gated SelfCompact。三组使用相同 ReasoningCache continuation scaffold;fixed 与 SelfCompact 共享 summarizer / continuation contract,no-compaction 只执行单轮 16k,不调用摘要。
  • 指标:math_verify final-answer accuracy;表中括号为平均 output token budget,subscript 为 samples 标准差。
  • 结果:SelfCompact 在 11/12 个单元最高;唯一例外为 Qwen3-30B-A3B 的 HMMT Feb,fixed 58.7、SelfCompact 57.6。最大相对 no-compaction 增益为 Qwen3.5-9B HMMT Feb 的 +18.1 pp。
  • 证据定位:Section 4.1;Table 1;Appendix Math experimental setup;Appendix Table tokens_math
  • 对照是否可比:模型、scaffold、采样与 round cap 对齐;SelfCompact 的平均 output budget比 fixed 高 3-4k,附录的 prompt+output total 高 3-5k,与正文“相同”及“±3\pm3k”表述不完全一致。SelfCompact 还使用额外 rubric calls,计算量和 wall-clock 未计入 bracket。
  • 支持的最窄结论:在四个 paper-tested Qwen 配置和三个数学集上,任务专用 rubric 配合稍高平均生成预算,比每 16k 强制摘要获得更高总体 accuracy。
  • 解读:方向在四个配置上一致,支持 timing 有效;Qwen3.5 在表中明确关闭 thinking,正文将其称为 thinking-enabled models 属于文字口径冲突。

结果 2:固定摘要的有害转移与 oracle headroom

  • 设置:Qwen3-4B-Instruct-2507、IMO-Answerbench;跟踪 12 次 fixed summarization 前后的答案正确性。
  • Baseline:no compaction、fixed interval、SelfCompact;另构造 skip if current answer is correct 的不可部署 oracle。
  • 指标:answer transition count 与最终 accuracy。
  • 结果:wrong -> correct 1,486 次,correct -> wrong 1,009 次;所有发生变化的转移中 40.4% 为退化。Oracle 达到 52.9%,高于 fixed 41.4、SelfCompact 45.5 和 no-compaction 38.9。
  • 证据定位:Section 4.1;Tables 2-3。
  • 对照是否可比:transition 统计直接观测 fixed schedule;oracle 使用 ground-truth correctness,在 fixed 调用点做选择,只用于估计 headroom。
  • 支持的最窄结论:当前 fixed math scaffold 中,摘要会同时修复和破坏答案;若能在压缩前识别当前答案正确性,仍存在显著提升空间。
  • 解读:该结果支持 timing 的研究动机。它没有证明 SelfCompact rubric 正在检测正确性;数学 rubric 的 Q1 只检测是否出现具体答案。

结果 3:Agentic search 的平均准确率提升与成本边界

Model No Compaction Acc./Cost Fixed Acc./Cost Keep-last-3 Acc./Cost SelfCompact Acc./Cost
GLM-4.7-Flash 36.6 / 0.13 41.5 / 0.05 41.2 / 0.04 46.4 / 0.07
MiniMax-M2.5 54.6 / 0.19 59.3 / 0.06 59.6 / 0.06 63.9 / 0.08
MiMo-V2-Flash 48.9 / 0.25 54.7 / 0.14 55.4 / 0.10 59.2 / 0.13
  • 设置:BrowseComp、BrowseComp-Plus、DeepSearchQA 各抽样 150 题;temperature 1.0、top-p 0.95、每 call 最多 10k output tokens、100 LLM calls;标准 ReAct search / visit 或 benchmark corpus tools;5 runs。
  • Baseline:no compaction、30% context fixed summary、30% delete-all、30% keep-last-3;SelfCompact 使用同模型 rubric 与 summarizer。
  • 指标:三集 accuracy 平均;单费率 USD / question,全部 prompt token 按 cache-read price 计,completion 按 output price 计。
  • 结果:SelfCompact 相对 no-compaction 平均提高 9.8 / 9.3 / 10.3 pp;BrowseComp-Plus 分别提高 8.5 / 9.2 / 5.3 pp。单费率成本相对 no-compaction 下降 46% / 58% / 48%。GLM / MiniMax 的 SelfCompact 平均成本比 fixed 高 40% / 33%,MiMo 低约 7%;其成本也普遍高于 delete-all / keep-last-3。
  • 证据定位:Section 4.2;Table 4;Appendices Agentic-search experimental setupCost analysis of summarization、Table tokens_all
  • 对照是否可比:同一模型与 benchmark 下的 agent loop、tool cap 和 evaluator 对齐;各策略会改变有效 horizon、搜索次数和 prompt 重用。Fixed 可以多次摘要,附录声明 SelfCompact 最多一次,Table 4 的实际 operation count 无法确认。成本来自模型化 token accounting,缺少真实 provider bill 与 latency。
  • 支持的最窄结论:在作者报告的三种 search agent 上,标为 SelfCompact 的完整 policy 在平均 accuracy 上超过作者实现的 fixed / truncate baselines,并以低于 no-compaction 的估算 prompt + output token cost 运行;现有材料无法恢复 rubric verdict 与声明 backstop 各自触发了多少次。
  • 解读:摘要和结论中的“30-70% lower cost”对应 no-compaction。表格不支持“SelfCompact 比 fixed interval 成本低 30-70%”;多数单元中 fixed 更便宜。MiMo BrowseComp-Plus 还出现 keep-last-3 63.5 高于 SelfCompact 62.9,说明逐 benchmark 最优并不稳定。

结果 4:rubric 消融支持含 rubric 的完整 policy

  • 设置:GLM-4.7-Flash 的三个 search benchmark;Qwen3-4B-Instruct-2507 的 IMOBench。
  • Baseline:full SelfCompact;移除 rubric 后让模型自由决定何时调用 summary;fixed 与 no-compaction。
  • 指标:accuracy,search 为 5 runs 标准差。
  • 结果:Search 平均从 full 46.4 降到 rubric-free 41.0,接近 fixed 41.5;IMOBench 从 45.5 降到 40.9,接近 fixed 41.4。
  • 证据定位:Section 4.2 Ablation on the effect of rubrics;Tables 5-6。
  • 对照是否可比:模型、任务和 summary function 对齐;论文没有报告 rubric-free 的压缩次数、触发长度、summary tokens 或成本,因此干预同时改变 trigger policy 和可能的 operation frequency。
  • 支持的最窄结论:在两个被测试的模型上,paper-specific rubric-equipped policy 比自由工具调用获得更高 accuracy;工具暴露本身不能解释 full method 的收益。
  • 解读:这组证据支持“显式状态条件参与改进”。它不能拆分 rubric 文本、evidence requirement、hard gates 与触发频率各自的独立因果贡献。

结果 5:较早触发、困难分桶与定性案例

  • 设置:BrowseComp-Plus;按 no-compaction output tokens 划分五个模型内 quantile;另选取 MiniMax-M2.5 上 fixed 与 no-compaction 都失败、SelfCompact 成功的三个案例。
  • Baseline:30% fixed threshold、no compaction、SelfCompact。
  • 指标:触发时 context length、difficulty-bin accuracy、案例轨迹。
  • 结果:论文称 SelfCompact 触发分布位于 30% threshold 左侧;最难两个 bins 相对 fixed 提高约 5-20 pp。三个案例中,SelfCompact 各做一次 70k-119k 到 0.8k-1.1k 的摘要并得到正确答案,fixed 多次压缩后失败。案例触发均晚于 MiniMax 的 58,982-token backstop,和附录的强制规则冲突。
  • 证据定位:Section 4.2;Figures 2-3;Appendix Qualitative trajectories
  • 对照是否可比:触发长度来自论文统计;difficulty 由 no-compaction 的输出长度定义,带有模型行为相关的内生性;定性案例按 no/fixed wrong + SelfCompact correct 条件选择。声明协议与这些触发值不自洽,缺少 raw logs 使行为来源无法复核。
  • 支持的最窄结论:Figure 2 与三个条件筛选案例分别报告阈值左侧和右侧触发;它们可能来自不同 controller revisions,只能确认公开材料不自洽,不能建立同一 adaptive policy 的双侧触发分布或验证声明 backstop 的执行情况。
  • 解读:左移本身无法证明触发点“正确”,困难分桶也不能替代外部难度标签。定性案例解释了可能机制,不能估计总体发生率或修复 controller 协议冲突。

实验设置与 baseline 审计

维度 记录
评测协议 数学:3 benchmarks、4 Qwen configs、每题 16 stochastic samples;search:3 benchmarks x 150 sampled questions x 3 models,paper table 报 5 runs std。
统计报告 数学报告 sample mean/std,search 报 run std;无 confidence interval、significance test、paired per-question test 或独立 replication。
Baseline 是否 tuned Fixed threshold 沿用 ReasoningCache / WebExplorer 风格;未报告 threshold sweep、probe interval sweep、rubric prompt sweep 或各 baseline 的单独 tuning budget。
Baseline 是否 compute-matched 数学仅近似匹配 output budget,SelfCompact 高 3-5k 且 rubric compute 未进入 bracket;search 使用共同 call cap,但不同策略的 summary/probe/search call 与累计 prompt 不同。
Baseline 是否 implementation-matched Fixed 与 SelfCompact 共享 summarizer / scaffold;delete-all 和 keep-last-3 使用相同 30% trigger。Search 的 fixed 可多次压缩,附录声明 SelfCompact 最多一次;公开代码和案例没有提供完整对齐的实现证据。
Baseline 是否覆盖强替代方案 覆盖 no/fixed/delete/recency/free-tool;缺少 learned trigger、external verifier、retrieval memory、source-indexed memory、summary-quality selector、threshold sweep 和等次数 adaptive baseline。
Baseline 是否存在弱化风险 单一 30% fixed threshold 的模型内最优性未验证;fixed 没有使用 SelfCompact 的平均触发长度或相同摘要次数;数学 fixed budget略低。
成本口径 Main table 将所有 prompt token 按 cache rate 计;appendix two-rate 将首次 prefill 按 input rate计。两者都来自 token lifecycle reconstruction,未使用 provider cache-hit / bill。
双费率稳健性 SelfCompact 相对 no-compaction 仍更便宜;多数单元 fixed 仍明显更便宜。质量-成本 Pareto 需按模型与 benchmark 单独比较。
模型与版本 Qwen checkpoint 名较具体;search 只给 OpenRouter model names,未给 provider routing、revision hash 或 exact endpoint。
数据与任务 Search 每集 150 题,采样 id 未披露;BrowseComp/DeepSearchQA 使用 live web,网页与 Serper 结果随时间变化。
系统配置 Math:vLLM,1-2 H200;search:OpenRouter + AggAgent runtime,context windows / flags 已披露。Search 没有硬件、区域、并发、cache policy 或 latency。
框架基座 / paper base Math 基于 ReasoningCache continuation scaffold;search 使用 AggAgent react_agent_selfcheck;Serper + crawl4ai 或 BrowseComp-Plus corpus;math_verify / LLM-as-judge evaluator。
框架版本与证据来源 论文未给 ReasoningCache、AggAgent、vLLM、crawl4ai、Serper index 或 evaluator 的 commit;官方代码当前 head 为 1295817
框架改动范围 新增 rubric probe、hard gates、summary reset、debug accounting 与三种 compaction policies;search 工具和 evaluator 从 AggAgent adapted。
未披露项 Raw outputs、采样 ids、完整 run commands、trigger-reason counts、provider revision、cache telemetry、wall-clock、真实账单、错误类型、summary fidelity 和 threshold sensitivity。
结论边界 支持当前两类任务中论文所报告的 rubric-equipped policy;search 精确 controller 版本、通用 metacognition、最低成本、跨任务 rubric 迁移和生产 latency 仍待验证。

证据链强度评估

强证据

  • Fixed transition audit 显示 1,009 次 correct -> wrong,证明强制摘要具有可测的状态破坏风险。
  • 七个模型、六个 benchmark 上论文报告的 full method 相对 no-compaction 的准确率方向一致;相对 fixed 在 math 11/12、search 9/9 单元领先。
  • 附录披露了 exact rubric、summary prompts、主要 sampling parameters、token accounting 与双费率成本表,数学协议可由这些材料较完整地重建。

中等强度证据

  • Rubric-free 与 full SelfCompact 的局部消融在 math / search 两类任务上方向一致,支持含 rubric 的完整 policy;operation count 未报告,rubric 文本的独立效应无法拆出。
  • Search 5 runs standard deviation 和 150 题抽样提供一定重复性,采样 ids、live-web snapshot 与 paired test 仍缺失。
  • 两种成本模型都显示相对 no-compaction 的节省,cache hit 和价格来自推导 / provider list,缺少真实账单与 latency。
  • Difficulty bins 显示长轨迹收益更大,其难度代理依赖 no-compaction 的模型输出长度。
  • 20-80x summary compression ratio 支持后续 prompt 缩短,摘要是否保留决策所需事实只由最终 accuracy 间接反映。
  • 公开代码允许核对一种 search controller、消息重建和 rubric parser;触发、baseline、运行次数与成本实现均未和论文完整对齐。

需要谨慎的推论

  • “metacognitive gap” 是作者对 rubric-free 与 full 差异的解释。实验识别了 scaffolded classification 的效果,没有测量独立、可校准的模型 introspection capability。
  • “30-70% lower cost”只相对 no-compaction;fixed / truncate baselines 通常更便宜。
  • Algorithm 1 的自由周期 controller 无法代表附录声明的 search 系统;附录加入单次 cap、40k gate 与 30% backstop,Figure 2、定性案例和公开代码又与这套规则冲突。
  • Figure 2 报告的提前触发只说明统计分布左移,无法单独证明该点是最优 semantic checkpoint;声明 backstop 是否执行也未确认。
  • 三个成功案例按结果筛选,适合解释错误模式,无法作为总体因果频率。
  • TeX 的 NeurIPS final 选项与当前时间线冲突,不能转换为录用证据。

OpenReview / 审稿意见吸收

  • Page type: not-found
  • Match confidence: high
  • Observed at: 2026-07-16
  • Venue status: arXiv preprint。TeX source 使用 NeurIPS 2026 main-final style;NeurIPS 官方 author notification 为 2026-09-24,当前不能确认投稿结果或录用。
  • Public reviews: 未发现与完整标题、八位作者或 arXiv:2606.23525 可可靠匹配的公开 reviews。
  • Ratings / confidence: 无公开数据。
  • Reviewer consensus: 无可吸收的正式 reviewer consensus。
  • Main criticisms: 无公开正式审稿文本;本地审计重点为 search controller 隐含硬规则、fixed cost 口径、math compute matching、summary fidelity、统计充分性和 artifact drift。
  • Author response: 未发现公开 rebuttal。
  • 对可信度的影响: 方法与主要数字可由 v2 TeX source 复核,公开代码可核对一种 search controller;论文内部协议冲突、代码默认值、数学实现、原始运行和 venue peer review 尚未提供完整校准。

本地讨论补充

1. 讨论收敛点:核心贡献是一层有界 controller

SelfCompact 的摘要函数沿用“同模型生成自然语言 summary,再 hard reset”的常见结构。论文最有价值的新增是一份任务专用状态判据,并让模型对每项判据引用当前轨迹证据。附录声明的 search controller 还叠加 hard gates 与 backstop;将其用于生产设计时可以抽象成:

fire=budget-eligiblesemantic-safeprogress-made¬stuck, \text{fire}= \text{budget-eligible} \land \text{semantic-safe} \land \text{progress-made} \land \neg\text{stuck},

另保留接近窗口上限时的 safety override。这个抽象表达了附录所述目标 controller;现有触发材料与代码仍不足以确认 Table 4 实际运行了同一版本。

2. 修正后的成本理解

质量、成本和峰值 context 需要分开报告:

  • 相对 no-compaction,论文表中的 SelfCompact 条件同时提高平均 accuracy 并减少估算累计 prompt token。
  • 相对 fixed / truncate,SelfCompact 通常使用更高估算成本换取更高 accuracy。
  • 相对真实 production bill,论文只提供基于 token lifecycle 的估算;provider cache miss、routing 和 wall-clock 可能改变绝对值。

Main text 把所有 prompt 按较低 cache rate 计,并称为 conservative approximation。由于 uncached input price 更高,这个口径在绝对美元上构成偏低估算。附录的 two-rate table 修正了首次 prefill,结论在“低于 no-compaction”上保持不变。

3. 附录把 Search 描述为一次 checkpoint policy

附录的 cap < 1 意味着 full method 每条轨迹最多摘要一次,Figure 2 的“触发更早”也主要回答“唯一 checkpoint 应放在哪里”。三个案例越过声明 backstop 才压缩,公开代码也没有 backstop,因此该解释属于 paper-declared policy,Table 4 的真实触发版本仍待 raw logs 或冻结代码确认。当前代码采用近似无限 cap,摘要后的新轨迹可能再次跨过 40k gate;后续 rubric 会面对由上一份摘要构成的 lossy state,错误可以递归累积。多次 compaction 需要单独测量每代摘要的事实保真度与累计遗漏。

4. 更稳健的生产化接口

一条可复验的 production controller 可以同时记录:

semantic state: closed unit / active derivation / stuck / answer candidate
budget state: current tokens / context cap / expected future calls
summary state: source ids / retained facts / unresolved branches / confidence
runtime state: cache-hit bytes / prefill / decode / latency / billed cost

自然语言 summary 适合跨模型读取;source ids、工具结果 hash 与 unresolved-branch list 可以补回 provenance。对安全、合规或高价值任务,摘要应保留可回溯引用,同时提供从原始 trace 受控恢复的路径。

5. Artifact 复验需要先取得冻结版本

当前公开历史没有完整对齐论文 search 表的版本,显式传入 --selfcheck_cap 1 只能恢复单次上限。严格复验还需要取得作者冻结代码,或重建 model-specific 30% backstop / fixed trigger、delete-all / keep-last-3、context 与 decoding flags、5-run sampling 和论文成本口径,再固定 model provider、sample ids、Serper / crawl snapshot、judge、价格与 dependency lock。评估当前 main 时应把“多次 rubric-gated compaction”作为新的实验条件,与 v2 table 分开报告。

6. 后续复验指标

  • Trigger precision / recall:由人工或独立 oracle 标注 closed checkpoint,与 rubric verdict 对齐。
  • Summary fidelity:关键事实 recall、错误事实率、未决分支 recall、source attribution 与压缩率。
  • Recursive drift:第 1/2/3 次 compaction 后的事实存活率和错误累积。
  • Controller calibration:每项 predicate 的一致性、不同 prompt/paraphrase 稳定性和 self-judge / external-judge agreement。
  • Pareto frontier:accuracy 对 cumulative prompt、output、prefill、cache read、wall-clock、TTFT 与真实 USD。
  • Fair timing baselines:同摘要次数、同平均触发长度、threshold sweep、随机 checkpoint、external verifier 与 learned policy。
  • Domain transfer:coding、GUI、long dialogue、multimodal tool use、multi-agent handoff 与需要保留负面证据的调查任务。

7. 贡献层级判断:有效的 harness 控制器,概念增量有限

本地讨论将 SelfCompact 定位为 agent 运行框架(harness)层的方法。自然语言摘要、hard reset 和前缀缓存利用均有既有路径;论文的主要增量是任务专用、要求引用轨迹证据的评分量规,以及围绕它组织的触发门槛和兜底逻辑。其最值得保留的设计原则是把上下文压缩视为有损状态转换:压缩时机应读取当前语义状态,完成闭合子任务后适合生成摘要,停滞状态更适合触发诊断或策略切换。

现有实验支持这套完整控制策略在作者测试的数学与搜索设置中优于作者实现的固定阈值和自由摘要工具基线。证据范围仍限于手工设计的领域量规;rubric-free 消融同时改变规则文本、证据要求、硬门槛和操作频率,无法单独识别通用模型自省能力。固定阈值没有经过 sweep,也缺少相同摘要次数、相同平均触发长度、随机 checkpoint 和外部 verifier 对照。论文因此适合作为强工程 baseline 和可复用的 runtime 设计模式,尚不足以建立通用压缩机制或一般性的 “metacognitive gap” 结论。

主要启发

  • Context compaction 是一项 state transition;触发条件、summary contract 和恢复路径需要一起设计。
  • Evidence-grounded rubric 可以把含糊的“模型自省”改写成可解析、可日志化的 predicate checks。
  • “卡住”适合触发策略切换或诊断,直接摘要可能删除约束搜索空间的负面证据。
  • Message-level prefix append 提供缓存复用机会;tools、chat template 和 thinking flags 参与序列化后仍需核对 token prefix,并用 serving telemetry 验证实际收益。
  • 一次摘要与递归摘要具有不同风险。多次压缩需要 provenance、generation number 和 fidelity monitoring。
  • Context manager 的报告应同时给出 peak context、累计 token、摘要次数、未来调用数、真实延迟与账单。
  • Training-free rubric 可以作为后续 RL / SFT 的行为规范或 teacher signal,部署前先用它收集 timing labels 和 failure cases。

局限

  1. Rubric 针对数学和搜索手工设计,尚未证明 prompt 迁移、跨领域泛化或低维护成本。
  2. 同一模型兼任 actor、judge 与 summarizer,三种角色可能共享错误;论文没有测量 verdict calibration、inter-rater agreement 或外部 judge 对照。
  3. Search 附录声明的 40k gate、period、单次 cap 与 30% backstop 缺少逐项消融;GLM gate / backstop、Figure 2、MiniMax 案例与公开代码之间还存在协议冲突,full method 的精确触发版本和 rubric 独立贡献均无法恢复。
  4. Math fixed baseline 的平均 token budget比 SelfCompact 低 3-5k,额外 rubric calls 没有进入 compute tag;严格 compute matching 尚未完成。
  5. Cost reduction只相对 no-compaction稳定;fixed、delete-all 和 keep-last-3 常以更低成本运行,论文结论对比较对象的表述存在歧义。
  6. 单费率模型低估 uncached input;双费率模型仍依赖假设的 token lifecycle,没有 provider cache-hit、真实账单或端到端 latency。
  7. Summary quality只通过最终任务分数间接评估,缺少事实正确率、遗漏率、provenance、恢复失败和 error propagation 指标。
  8. Search 抽样 ids 与 live-web snapshot 未公开;数学只有每题 16 samples,search 虽有 5 runs 也缺 paired test 和 confidence interval。
  9. 困难分桶由 no-compaction output length 定义,可能把模型停滞与任务难度混合;定性案例按 SelfCompact 成功条件筛选。
  10. 当前仓库缺少数学实验代码、paper commands、raw trajectories 和 locked environment;search 默认 cap 已从 1 改为 1000,30% backstop、token-threshold fixed、truncate baselines、5-run default 与 paper cost accounting 也没有对应实现。
  11. L/\ell>10 break-even 在正文被称为附录推导,v2 source 未给完整推导或 future-call 条件。
  12. 开放权重模型和六个 benchmark 不能支持 frontier closed models、coding、GUI、multimodal、multi-agent 或持续数日 agent 的结论。
  13. 自然语言 hard reset 删除原始 trace,涉及审计、隐私、安全或高价值决策时需要可恢复日志和访问控制。
  14. 论文当前是 arXiv preprint,尚无可吸收的公开同行评审;NeurIPS final 模板不能作为录用状态证据。

跨论文关系

  • 与已有论文的作者或机构关系:当前没有确认的直接作者重叠。本论文连接 Johns Hopkins University 与 Apple;MegaScale-MoE 的 Xi Wang 属于 ByteDance Seed 同名作者,论文时机构和公开身份链不同,当前不建立作者关系。
  • CompactionRL:两者都让同一个 actor 生成摘要并从压缩 state 继续。SelfCompact 用 training-free rubric 选择时机,附录的 search protocol 声明每条轨迹最多一次摘要;CompactionRL 用固定预算阈值触发,并通过 critic、token-level PPO 与跨 segment GAE 联合训练摘要和 execution。前者提供 inference-time controller,后者处理训练 credit 与 variable segments。
  • ECHO:SelfCompact 生成 opaque summary 并删除原 prefix,summary 不保留 source-turn 地址,无法直接支持 source-level credit routing;ECHO 保留 source-indexed findings 和 selection action,并把 credit 路由到被最终使用的来源。该对照说明 timing 与 provenance 是两条独立设计轴。
  • LLM 与 Agent 强化学习中的信用分配:SelfCompact 提供一条纯推理期 baseline,用于区分上下文重建本身的收益与 RL 信用分配的收益。它也暴露了该主线中的关键边界:压缩后的状态可比性会先于奖励路由影响 Agent 行为。
  • GLM-5.2:GLM-5.2 / CompactionRL 路线把 compact trajectory 纳入训练;SelfCompact 表明相同 search 模型家族中的 GLM-4.7-Flash 可以通过 rubric scaffold 获得 context-management 收益,为训练前 controller baseline 提供证据。

Reference Intake Brief

Target

  • Intended target system: 新增 SelfCompact 论文笔记,并更新索引行、controlled tags、作者档案和对应论文的关系章节。
  • Existing related assets: content/utility/papers-index.mdCompactionRLECHOLLM 与 Agent 强化学习中的信用分配
  • Proposed form: 新建独立 Markdown 文档;更新索引行、标签与作者 profile,并在对应论文的关系章节补充双向关系。

Reusable Elements

  1. hard gates -> semantic rubric -> summary -> hard reset 的有界 context-controller 分层。
  2. Math 的 ANSWER / STUCK / HAS-NEXT 与 search 的 CLOSED / SUMMARIZABLE / PROGRESS / NOT-STUCK predicate 模板。
  3. Summary timing audit:correctness transition、同次数 timing baseline、trigger-length distribution 与 oracle headroom。
  4. 成本审计:prefill、cache read、output、summary generation、未来调用数与真实账单分开记录。
  5. Artifact audit:paper protocol、当前 default、model provider、live-web snapshot 与 raw rollout 固定到同一 revision。

Risks

  • Copyright/over-copying: 只保留方法公式、rubric 语义、关键数字与本地分析,没有复制完整 prompt 或案例文本。
  • Unsourced or unverifiable claims: 录用状态、cache hit、真实成本和模型 introspection 均按未确认边界记录;作者身份只保留一手来源支持的稳定事实。
  • Tone/brand mismatch: 将作者主张、论文事实、代码事实和本地推论分开。
  • Safety/compliance issues: 方法本身风险较低;生产 hard reset 的审计、隐私与恢复风险已记录。
  • Overlap with existing assets: SelfCompact 保留 inference-time timing controller;CompactionRL / ECHO 保留 training credit 与 provenance。

Skipped

Material Reason
公开 reviewer comments 未发现可可靠匹配的 OpenReview / NeurIPS 公开审稿页。
Teaser 与案例截图 机制可由文字和状态流清楚表达,案例又按结果条件筛选,缓存图片不会增加证据强度。
完整数学 / search prompts 版权和篇幅考虑;本笔记保留 predicate、fire rule 与必要 contract,完整文字可查 arXiv v2 附录。
数学复现实验 当前官方仓库没有 math runner / scaffold,无法在本仓库完成等价运行。

Recommendation

Decision: merge

Why: SelfCompact 为 context compaction 增加了一层简单、可审计且无需训练的 timing controller;数学与搜索消融以一致方向支持含 rubric 的 policy 优于自由 tool use,operation frequency 仍未对齐。归档同时记录 search 的 cap / backstop 协议冲突、成本比较对象、math budget、summary fidelity 和公开 artifact 差异,使其适合作为后续 learned compaction、provenance memory 与 cache-aware runtime 的待复验 inference-time baseline。