2606.31650-echo-selective-turn-memory-agentic-rl

ECHO: Prune to act, trace to learn with selective turn memory in agentic RL

ECHO 的核心价值在于把 long horizon agent 的 context management 从“压缩历史以继续行动”推进到“保留 source indexed reconstruction trace 以便学习”:每个已完成工具 turn 被压成带原始 turn id 的 memory record,policy 在上下文触顶时选择可复用记忆来重建 bounded context,并把最终正确轨迹的正向 outcome...

Authors Zijun Xie, Binbin Zheng, Enlei Gong, Jihua Liu, Yuyang You, Lingfeng Liu, Jiayao Tang, Guanqun Zhao, Aoqi Hu, Zeyu Chen

2026-07-03 14:01 Updated 2026-07-16 19:17 v1, 2026 06 30 Source Agent MemoryAgent RLLong ContextAgent Workflow

Source

作者与关系

一句话结论

ECHO 的核心价值在于把 long-horizon agent 的 context management 从“压缩历史以继续行动”推进到“保留 source-indexed reconstruction trace 以便学习”:每个已完成工具 turn 被压成带原始 turn id 的 memory record,policy 在上下文触顶时选择可复用记忆来重建 bounded context,并把最终正确轨迹的正向 outcome credit 只路由到 final answer、被选 source turn、对应 finding token 和 selection action,从而在 BrowseComp-Plus 上同时提高 pass@1、减少 SUPO 式 rolling summary 的 turn/trajectory volume 膨胀。

本地评价:ECHO 的核心贡献应理解为 context reconstruction 与 outcome-credit routing 的连接机制。强 rolling summary 在 inference-time 信息保留上可能已经足够有效;ECHO 更稳定的增量是把历史证据保存为 source-indexed memory,使旧 turn 复用变成显式选择、可记录轨迹和可回传 credit 的训练对象。这个判断会改变对实验的读法:SUPO 的提升说明 summary 能支持长搜索,ECHO 的优势主要体现在 provenance 保留、selection action 学习和冗余 trajectory volume 控制。

阅读目标与判断边界

本笔记关注:

  1. ECHO 如何把 context reconstruction 的 source trace 转成 RL credit assignment 的训练 mask。
  2. 它相对 GRPO 和 SUPO 解决了什么 long-horizon agentic RL 失败模式。
  3. 实验是否足以支撑“source-indexed memory selection 比 rolling summary 更适合 agentic RL”的结论。

判断边界:

  • 论文主实验集中在 BrowseComp-Plus 和 Qwen3 系列 backbone,外部任务主要是 zero-shot transfer;更广泛 GUI、embodied、多智能体环境仍未验证。
  • ECHO 的 credit assignment 使用 final-trace approximation,只追溯最终上下文中被选中的 source turns,没有递归追踪更深依赖链。
  • 代码已公开,但论文没有报告 seed、置信区间或完整成本拆分,训练稳定性结论仍需要独立复现。

论文脉络

1. 研究问题、背景和价值

长时程语言 agent 需要反复搜索、打开页面、调用工具、积累证据,再在有限上下文窗口内做最后决策。传统 reasoning RLVR 多数把一个 prompt 的 rollout 看成相对短的 response;tool-use agent 的 trajectory 会包含多轮 action、observation、summary、tool result 和 final answer。此时上下文窗口与 credit assignment 同时成为瓶颈。

第一类瓶颈是行动侧。agent 如果 append-only 保留所有历史,很快触及 context budget;如果截断或滚动摘要,后续行动可以继续,但远处细粒度证据会被删除或折叠。

第二类瓶颈是学习侧。最终 reward 只在答案完成后出现,GRPO (Group Relative Policy Optimization,组内相对优势策略优化) 这类方法通常把同一个 trajectory-level advantage 广播到很多 generated tokens。若上下文管理已经把原始证据折叠成 summary,训练时很难知道最终成功依赖了哪些旧 turn,容易同时强化有用搜索、冗余搜索、偶然推理和摘要行为。

ECHO 试图把这两个瓶颈用同一个设计处理:context reconstruction 必须保留 source-level addressability,随后 RL update 直接复用这条 source trace。

2. 已有解决方案与不足

论文把已有方法分成几类:

  • Append-only prompting:traceability 最强,但 context 不可扩展。
  • Sliding-window truncation:满足预算,但丢失远处证据。
  • Recursive folding / rolling summary:SUPO、MemAgent 这类方法把旧历史折叠成 compact state,支持长 rollout,但 source turns 被 collapse。
  • Pruning / omission / memory actions:能显式删改 memory 或选取一部分 history,但未必给 outcome reward 留下可复用 source-indexed trace。

这些方法多从“如何让 agent 继续行动”出发。ECHO 的切入点是:context manager 的接口同时决定 policy 看到什么,也决定最终 reward 能否回到原始证据。

3. 作者可能的思考路径

从 agentic RL 的失败模式看,SUPO 式 rolling summary 能延长 rollout,但论文诊断显示它会带来 turn proliferation、response length 增长、generation time 增长和 trajectory volume 膨胀。这个现象可以理解为:summary 让 agent 继续探索,但每次折叠都降低了细粒度 provenance,policy 学到的是“继续搜、继续总结”的行为模式,最终 reward 又被 dense 地广播到这些行为上。

如果把每个完成 turn 独立压缩成一个带 source id 的 evidence clue,agent 行动时仍然只读 compact context;当最终答案正确时,训练端可以知道 policy 最后选择复用哪些旧证据。这样 context pruning 和 credit routing 共享同一条 trace。

4. 核心假设或切入点

核心假设有三条:

  1. Long-horizon agent 的上下文压缩要保留 source-level addressability,单纯压缩成 summary 会损失学习所需的 provenance。
  2. 对 sparse outcome reward,正向 credit 应沿最终成功使用的 evidence path 路由,避免强化未被复用的冗余搜索。
  3. memory selection 应由 policy 根据当前 search state 自回归选择;静态 semantic top-kk retrieval 很难覆盖“当前下一步需要哪些历史证据”。

5. 方法 / 系统 / 理论框架

论文先定义 multi-turn GRPO。对同一 prompt xx 采样 NN 条完整 trajectory,二元最终 reward R(τ)R(\tau) 形成组内优势:

A(n)=R(τ(n))mean({R(τ(i))}i=1N)std({R(τ(i))}i=1N)+ϵ. A^{(n)} = \frac{ R(\tau^{(n)})-\operatorname{mean}(\{R(\tau^{(i)})\}_{i=1}^{N}) }{ \operatorname{std}(\{R(\tau^{(i)})\}_{i=1}^{N})+\epsilon }.

在 context-managed rollout 中,完整历史 HtH_t 与 policy context ctc_t 被区分开。上下文管理接口写成:

zj(n)=M ⁣(HKj1(n)(n)),cj,t(n)=xΦ ⁣(zj(n),Hj,t(n),loc;B). z_j^{(n)} = \mathcal{M}\!\left(H_{K_{j-1}^{(n)}}^{(n)}\right), \qquad c_{j,t}^{(n)} = x \oplus \Phi\!\left(z_j^{(n)}, H_{j,t}^{(n),\mathrm{loc}};B\right).

M\mathcal{M} 表示 completed prefix 如何被管理,Φ\Phi 表示如何把 managed state 和局部历史渲染进预算 BB 内。这个接口让 append-only、truncation、rolling summary、memory action 和 ECHO 可以在同一框架下比较。

ECHO 的方法分两段。

第一段是 Prune to Act。每个完成的工具 turn ui=(ai,oi)u_i=(a_i,o_i) 之后,policy 生成一个 compact finding mim_i,形成 memory record:

ei=(i,αi,mi),Mj={ei}iKj1. e_i=(i,\alpha_i,m_i), \qquad M_j=\{e_i\}_{i\le K_{j-1}}.

这里 ii 是 source-turn index,αi\alpha_i 是 action/tool call 的 compact rendering,mim_i 是 latest-turn finding。MjM_j 是非折叠集合,每个 memory 都保留原始 turn id。

当 context 达到压缩边界时,policy 看到当前 bounded segment、source-indexed memory list 和 selection instruction,输出要复用的历史 turn ids:

I^jsel=ρB,S,K ⁣(parse(ajsel),Mj). \widehat{\mathcal I}^{\mathrm{sel}}_j = \rho_{B,S,K}\!\left(\operatorname{parse}(a_j^{\mathrm{sel}}),M_j\right).

ρB,S,K\rho_{B,S,K} 负责修复非法 id、去重、保留至多 SS 个 model-selected turns、自动合并最近 KK 个 turns,并满足 context budget。论文实验里 S=8S=8K=3K=3

第二段是 Trace to Learn。最终 reconstructed context 选择的 source indices 被用作 credit route。对 token position qq,论文定义 hard credit mask:

μq(n)=1{gq(n)=1dq(n)Isrc(n)fq(n)Isrc(n)bq(n)=1}. \mu_q^{(n)} = \mathbf{1} \left\{ g_q^{(n)}=1 \vee d_q^{(n)}\in\mathcal I_{\mathrm{src}}^{(n)} \vee f_q^{(n)}\in\mathcal I_{\mathrm{src}}^{(n)} \vee b_q^{(n)}=1 \right\}.

其中 gqg_q 标记 final response token,dqd_q 标记 normal action token 对应的 source turn,fqf_q 标记 finding token 对应的 source turn,bqb_q 标记 memory-selection span。训练时只给正向优势的 trace token 非零更新:

A~q(n)=A+(n)μq(n),A+(n)=max(A(n),0). \widetilde A_q^{(n)} = A_+^{(n)}\mu_q^{(n)}, \qquad A_+^{(n)}=\max(A^{(n)},0).

这个设计只强化高于组内平均的正确轨迹;错误轨迹即使选中了某些 memory,也不把负向或噪声 credit 路由到这些 source turns。

6. 结论链条

论文的结论链条是:

  1. Rolling summary 在长搜索中能延长 rollout,但会制造不可 source-addressable 的 collapsed state,并观察到 turn/volume 膨胀。
  2. ECHO 用 source-indexed turn memory 保留可选择、可追踪的 evidence clue。
  3. Policy-driven selection 比静态 top-kk retrieval 更适合动态搜索状态。
  4. 正向 traceable credit mask 比 dense all-token credit 更稳定。
  5. 在 BrowseComp-Plus、zero-shot 多目标 QA / code / deep information seeking 和 dense/MoE backbone 上,ECHO 均优于 GRPO/SUPO 或关键 ablation。

关键实验/定理

结果 1:BrowseComp-Plus 主实验

  • 设置:BrowseComp-Plus 长时程 tool-use QA;训练集 747,held-out validation 83;主 backbone 为 Qwen3-32B-Instruct;context budget 为 32K tokens;每 prompt 采样 8 rollouts;SUPO 和 ECHO 在 context 触顶时压缩,最多 5 次 compression,因此有效交互预算最高为 6×32k=192k6\times32\mathrm{k}=192\mathrm{k} tokens。
  • Baseline:GRPO;SUPO-style rolling summarization;三者使用相同工具环境、verifier、rollout budget 和 sampling 配置。
  • 指标:held-out pass@1、平均 tool-use turns、trajectory split rate、每 rollout trajectory 数、trajectory volume。
  • 结果:ECHO held-out accuracy 为 43.4%,GRPO 为 28.9%,SUPO 为 36.1%。最终 turn count 为 GRPO 11.2、SUPO 62.5、ECHO 45.3;SUPO split rate 为 85.5%,ECHO 为 57.8%;SUPO 平均 4.18 trajectories / rollout,ECHO 为 3.13。
  • 解读:GRPO 缺少长上下文探索;SUPO 通过 rolling summary 提升准确率但伴随轨迹膨胀;ECHO 在更高准确率下控制了 turn 和 trajectory volume,支持“source-indexed reconstruction 让长搜索更有效”的主张。

结果 2:Memory component ablation

  • 设置:保持 ECHO 的训练/rollout 环境,替换 memory selection 和 retrieved content format。
  • Baseline:ECHO learned source selection;semantic top-kk retrieval;semantic top-kk retrieval with full observations。
  • 指标:BrowseComp-Plus held-out accuracy 和训练动态。
  • 结果:论文图 4a 显示 learned source selection 是主要贡献;semantic top-kk retrieval 能保持 rollout compact,但 accuracy 明显低于完整 ECHO;把 compact finding 换成 full observation 没有带来清晰收益。
  • 解读:ECHO 的收益主要来自 policy 根据当前 search state 选择 source turns,而非把更多原始 observation 塞回上下文。这个结果对真实 agent memory 很重要:memory item 的 “retrieval decision” 比 memory item 的全文长度更关键。

结果 3:Credit assignment ablation

  • 设置:保持 ECHO reconstruction,替换 credit assignment。
  • Baseline:完整 ECHO traceable credit;ECHO w/o Traceable CA,即 dense all-token GRPO-style objective;ECHO w/o Traceable CA & Turn-level IS,即把 token-level importance-sampling ratio 换成 turn-level geometric mean。
  • 指标:BrowseComp-Plus accuracy、稳定性、turn growth。
  • 结果:论文图 4b 显示移除 traceable credit 会降低 accuracy 和 stability;turn-level IS 会进一步诱导 turn growth 和较低 accuracy。
  • 解读:在长时程 tool-use trajectory 中,把最终 reward 广播到所有 generated tokens 会强化冗余搜索;把每个 turn 粗化成 macro unit 也会强化长 continuation pattern。ECHO 的 token-level mask 更接近“最终证据链使用了哪些 token”。

结果 4:Zero-shot generalization 与 MoE backbone

  • 设置:BrowseComp-Plus 训练后,不额外调参,在 Multi-Objective QA、CodeGym、LoCoBench-Agent、GAIA、HLE、Frames 上评测;同时比较 Qwen3-32B-Instruct 和 Qwen3-30B-A3B-Instruct MoE。
  • Baseline:GRPO、SUPO、ECHO 及 ablations。
  • 指标:各 benchmark 分数和平均值。
  • 结果:Qwen3-32B 上,ECHO 平均 40.2%,GRPO 33.6%,SUPO 34.8%;Top-K retrieval ablation 38.2%,w/o traceable CA 为 35.6%。Qwen3-30B-A3B MoE 上,ECHO 平均 30.5%,GRPO 25.9%,SUPO 26.9%。BrowseComp-Plus MoE 训练中,GRPO 最终约 22.9%,SUPO 在 step 50 后进入 collapsed regime 并降到 13.3%,ECHO 稳定到约 35.0%。
  • 解读:结果说明 ECHO 的 learned context-management behavior 有一定跨任务迁移,并且对 dense / MoE backbone 都有效。证据强度仍受单一训练 benchmark、有限模型族和缺少 seed 统计影响。

实验设置与 baseline 审计

维度 记录
模型与初始化 Qwen3-32B-Instruct 为主;Qwen3-30B-A3B-Instruct sparse MoE 做 backbone transfer。
数据与任务 BrowseComp-Plus 训练集 747、held-out 83;zero-shot 覆盖 Multi-Objective QA、CodeGym、LoCoBench-Agent、GAIA、HLE、Frames。
RL / 训练配置 GRPO-style outcome objective;每 prompt 8 rollouts;二元 verifier reward;ECHO 使用 positive group-relative advantage 和 token-level hard credit mask。
系统配置 BrowseComp-Plus rollout 使用 searchopen_pagefinish;search 使用 Qwen3-Embedding-8B 本地 dense retrieval,默认 top-5;open_page 最多返回 16,000 characters;每 assistant turn 最多 5 个并行 tool calls。
技术报告训练配置 代码仓库说明实现基于 verl,Megatron backend + SGLang rollout;论文附录写 fully asynchronous rollout-training pipeline。
训练硬件与拓扑 附录写 4 nodes,每节点 8 GPUs;GitHub README 写目标环境为 4-node × 8×H800,H800 80GB。
并行方式与框架 verl、Megatron、SGLang;partial rollouts enabled,staleness threshold 0.5。
训练数据规模与组成 BrowseComp-Plus prompt parquet;训练/验证规模披露,语料构造和 judge prompt 细节较少。
训练过程与超参 32K working context;最多 5 compression rounds;ECHO latest turns K=3K=3,selection cap S=8S=8;compression methods 通过代码环境变量切换。
训练时间 / GPU hours / 成本 未披露 GPU hours、wall-clock 总训练时间和成本;只报告 generation time/trajectory volume 方向性诊断。
未披露项 seed 数量、误差线、显著性检验、完整 wall-clock 成本、judge model 具体版本在论文正文中没有系统披露;代码 README 示例使用 OpenAI-compatible judge endpoint。
评测协议 BrowseComp-Plus held-out pass@1;zero-shot benchmark 使用各自协议,Multi-Objective QA 使用 LLM-as-a-Judge。
统计报告 未见 seed / confidence interval / significance test。
Baseline 是否 tuned GRPO、SUPO、ECHO 使用相同工具环境和 rollout budget;baseline 调参范围未完整披露。
Baseline 是否 compute-matched 训练预算和采样配置相同;但 SUPO/ECHO 的实际 generated tokens、turns、trajectory volume 不同,compute 使用是实验对象之一。
Baseline 是否 implementation-matched 论文称相同 verifier、tool environment、sampling configuration;代码仓库给出对应脚本。
Baseline 是否覆盖强替代方案 覆盖 GRPO 和 SUPO;没有覆盖 MemAgent、Memory-R1、Agent-Omit、MemPO、turn-level CA、hindsight CA、milestone CA 等更广 agent memory / credit assignment baselines。
Baseline 是否存在弱化风险 SUPO 是 rolling-summary baseline,但不清楚是否为最优 summary prompt / compression schedule;semantic top-kk retrieval 作为 ablation,不能代表强 trainable retrieval memory。
结论边界 可较强支持 ECHO 优于该实现中的 GRPO/SUPO;对所有 agent memory 和 credit assignment 方法的泛化胜出仍需更多 baseline 和复现。

证据链强度评估

强证据

  • BrowseComp-Plus 主实验、memory ablation、credit assignment ablation 和 zero-shot 表格给出一致方向:learned source-indexed selection + traceable credit 比 rolling summary / dense credit 更稳。
  • Dense backbone 与 MoE backbone 都呈现相同 ranking,降低了“只适用于 Qwen3-32B dense”的风险。
  • 代码仓库公开了训练脚本、ablation knobs、依赖版本和硬件目标,复现实验路径比纯论文描述更清楚。

中等强度证据

  • “full observation 没有优于 compact finding” 支持 compact memory 的有效性,但数值主要通过图呈现,缺少表格和统计区间。
  • Zero-shot transfer 覆盖多目标 QA、代码和信息检索,但所有模型都从 BrowseComp-Plus 训练迁移,不能说明 ECHO 在每类环境中端到端训练都同样有效。
  • SUPO turn proliferation 诊断很有启发,但论文也承认不能证明该现象完全由 lost provenance 导致。

需要谨慎的推论

  • ECHO 的 final-trace approximation 可能漏掉递归依赖。如果最终被选 source turn 本身依赖更早未选 turn,credit 会中断。
  • 正向 credit 只强化正确轨迹的 selected trace,对错误轨迹中的有用但误用证据不更新;这降低噪声,也可能降低纠错学习能力。
  • 目前实验不覆盖 GUI、embodied、多 agent、真实网页浏览或开放互联网环境,BrowseComp-Plus 的本地 retrieval 和 verifier 设置可能降低部署复杂度。

OpenReview / 审稿意见吸收

  • Venue status: arXiv v1,观察日期 2026-07-03;未发现可靠公开会议投稿或录用状态。
  • Public reviews: 未发现公开 reviewer comments。
  • Ratings / confidence: 无公开 rating / confidence。
  • Reviewer consensus: 无公开审稿共识可吸收。
  • Main criticisms: 无公开审稿批评;本地可见主要风险是 baseline 覆盖、统计报告、final-trace approximation 和环境覆盖。
  • Author response: 未发现公开 rebuttal。
  • 对可信度的影响: 可信度主要来自 arXiv 论文、TeX 源和 GitHub 代码;缺少公开审稿意味着 novelty、baseline 强度和统计稳定性仍需后续社区复验。

本地讨论补充

1. 讨论收敛点

  • 初始归档判断:ECHO 是 agentic RL 中“memory 作为 action context”和“memory 作为 credit provenance”的连接点。它比单纯 context compression 更重要的地方在于训练端可以复用 selection trace。

2. 修正后的理解

  • ECHO 的 memory item 属于 trajectory-local evidence clue。它服务当前 rollout 的 bounded context 和后续 policy update,不等同于跨任务 persistent memory。
  • ECHO 的 traceable credit mask 更像 positive evidence-path distillation:它把最终成功答案使用到的证据路径强化到 policy;每个历史 action 的完整因果贡献仍是近似边界。

3. Summary 与 ECHO 的真实分界

强 rolling summary 在信息选择上未必天然弱于 ECHO。如果 summarizer 足够强,任务结构清楚,关键信息量有限,summary 可以把真正有用的旧 turn 内容保留下来。ECHO 的核心优势更集中在 source traceability 和 RL credit assignment:它让“哪些历史被复用”从摘要文本里的隐式选择,变成带 source id 的显式 action trace。

论文机制支持这个判断。每个 completed turn ui=(ai,oi)u_i=(a_i,o_i) 后,ECHO 生成只针对 latest tool/function result 的 local finding。附录 prompt 要求下一条 assistant message 先输出一个 <sum_last_turn>...</sum_last_turn> block,且该 block 只用一句 factual sentence 记录最新工具结果。随后 memory record 写成:

ei=(i,αi,mi) e_i=(i,\alpha_i,m_i)

其中 ii 是 source turn index,αi\alpha_i 是 action/tool call 的 compact rendering,mim_i 是 parsed last-turn finding。也就是说,ECHO 保留的是“内容 + 地址”:内容来自 αi\alpha_imim_i,地址来自 ii

当 context 接近预算时,ECHO 先让 policy 从 memory set MjM_j 中选择 source ids,经过 repair 得到 I^jsel\widehat{\mathcal I}^{\mathrm{sel}}_j,再用被选 memory 重构上下文:

cj,t=xrender ⁣(Mj[I^jsel])Φlocal(Hj,tloc;B),cj,tB. c_{j,t} = x \oplus \operatorname{render}\!\left(M_j[\widehat{\mathcal I}^{\mathrm{sel}}_j]\right) \oplus \Phi_{\mathrm{local}}(H_{j,t}^{\mathrm{loc}};B), \qquad |c_{j,t}|\le B.

这里旧历史以 selected compact memory 的形式进入上下文;当前 segment 内的新鲜历史仍由 Φlocal(Hj,tloc;B)\Phi_{\mathrm{local}}(H_{j,t}^{\mathrm{loc}};B) 保留。不同 compression segment 可以重新选择不同 source memories,因此选择过程跟随当前 search state 变化。

rolling summary 的主要差异在于 provenance。它可以保留“已经确认 X”这类内容,却通常无法稳定保留“X 来自 turn 17、对应 action 是什么、哪些 generated tokens 产生了这个 finding”。成功轨迹的 reward 如果继续 dense 地广播到整条轨迹,冗余 search、open page 和 summary token 也容易一起被强化。ECHO 的 source id 让训练端可以把正向 advantage 路由到 final answer、selected source turn、selected finding tokens 和 memory-selection action。

实验也支持这个边界。主实验中 SUPO rolling summary 相比 GRPO 提高准确率,说明 summary 的信息选择并不失效;但 SUPO 的 final turn count、split rate 和 trajectory volume 更高。ECHO 在更高准确率下控制了这些膨胀指标。component ablation 显示 learned source selection 是主要贡献,compact finding 换成 full observation 没有清晰收益;credit assignment ablation 显示去掉 traceable CA 后准确率和稳定性下降。这些结果更像是在支持“source-indexed selection + traceable credit”这条训练路径;summary 本身的信息压缩能力强弱仍需要单独比较。

4. 后续复验指标

  • 递归依赖深度:最终 selected turns 中有多少依赖未被最终 trace 覆盖的早期 turns。
  • 选择开销:selection prompt 的 token 和 latency 占 rollout 总成本比例。
  • 错误轨迹利用率:错误 rollout 中被选 memory 是否可用于 contrastive 或 counterfactual update。
  • 多环境稳定性:GUI agent、真实浏览、代码仓库操作和多 agent 协作中的 memory selection 质量。

主要启发

  • Agentic RL 的 context manager 应同时暴露 acting interface 和 learning provenance。只优化 prompt length 可能把训练可追溯性丢掉。
  • 选择历史 memory 的决策本身应进入 trajectory,并作为可学习 action 处理。ECHO 把 memory selection token 纳入 credit mask,提供了一个清晰实现路径。
  • 对长工具轨迹,credit assignment 不能只按 token / turn 粗粒度定义,还要看 policy context 是如何重建出来的。
  • 如果要设计 online agentic server 或 RL rollout 系统,memory/KV/cache 的复用策略可以与 reward credit trace 统一记录,后续能减少“推理用了什么证据”和“训练更新了什么 token”之间的断裂。

局限

  1. Final-trace approximation 只覆盖最终上下文中被选 source turns,没有递归追踪 evidence dependency graph。
  2. 公开实验主要是 text-based tool-use agents;GUI、embodied、multi-agent 和真实开放网页环境仍缺验证。
  3. Baseline 覆盖有限,缺少与 Memory-R1、MemPO、Agent-Omit、hindsight/milestone/turn-level CA 等强替代路线的直接对照。
  4. 统计报告不足,缺少 seed、误差线、显著性和完整训练成本。
  5. ECHO 增加 finding generation 和 memory selection 开销,论文没有给出 end-to-end cost-benefit 的完整分项表。

跨论文关系

  • 与已有论文的作者关系:当前未发现与已存档论文的直接作者重叠。机构层面连接 Peking University / Baidu Inc. / USTC,其中 PKU 已在 DeepSeek、Xiaomi MiMo、MegaScale/UltraEP、MiniMax-M3 等节点多次出现,但该作者群未与这些节点确认同人。
  • 与已有论文的主题关系:与 2606.00135 tool-calling RL 共享 long-horizon tool-use RL 主题;2606.00135 关注 harness、zero-variance prompts 和 rollout/policy update 成本,ECHO 关注 context reconstruction 与 source-level credit routing。
  • 与已有论文的方法或系统关系:与 2604.09459 credit assignment survey 形成直接关系,ECHO 可放入 agentic turn/source-level credit assignment;与 2511.14617 Seer2512.22560 RollArtslime2602.15763 GLM-5 形成互补:这些系统优化 rollout/training pipeline,ECHO 优化 trajectory 内的 memory trace 与 update mask。
  • CompactionRL:两者都让 shared actor 生成 context-management action。CompactionRL 把旧 prefix 压成 opaque summary,保留最近两轮,并用 critic + cross-segment GAE 训练全部 execution / summary tokens;ECHO 把旧历史变成带 source id 的 turn memories,训练 selection action,并把正向 credit 路由到最终使用的 source turns。该对照连接了 dense outcome credit 与 provenance-aware selective credit 两条路线。
  • SelfCompact:两者都在 agent trajectory 内选择保留状态。SelfCompact 用 evidence-grounded rubric 决定自然语言 hard reset 的时机,训练信号和 source-level provenance 均不进入 controller;ECHO 生成带 source id 的 compact findings,再学习 memory selection 并把正向 credit 路由到最终使用的来源。二者分别覆盖 semantic timing 与 traceable selection。
  • RL Credit Assignment Watch:该综合把 ECHO 定位为 provenance-aware positive credit router,并与 Memory-R2 的 same-state rerollout、HiMPO 的 memory counterfactual 和 CompactionRL 的 compressed-state critic 分开比较;这收紧了“使用证据”与“估计证据边际贡献”的边界。
  • 跨论文关系定位:记录 ECHO / Source-Indexed Agentic Memory Credit Assignment,连接 agent memory、context management、tool-use RL、credit assignment 和 long-horizon rollout systems。

Reference Intake Brief

Target

  • Intended target system: content/papers/2606.31650-echo-selective-turn-memory-agentic-rl.md 论文存档。
  • Existing related assets: content/utility/papers-index.md2606.001352604.094592511.146172512.225602602.15763
  • Proposed form: 新建独立 Markdown 文档,更新索引和作者档案。

Reusable Elements

  1. source-indexed reconstruction trace 可作为评估 agent memory 方法的重要维度。
  2. positive traceable credit mask 可用于分析 outcome-only reward 下的长轨迹 credit routing。
  3. ECHO/SUPO/GRPO 的对照给 agentic RL 系统提供了“准确率、turn 数、split rate、trajectory volume”四维审计模板。

Risks

  • Copyright/over-copying: 只记录少量必要数字、公式和结论,避免复制长段论文/README。
  • Unsourced or unverifiable claims: 作者公开 profile 资料较少,作者档案以 arXiv/GitHub 可核验证据为主。
  • Tone/brand mismatch: 按本地论文档案的分析语气写作,不写成项目宣传。
  • Safety/compliance issues: 无明显双用途操作细节;方法属于 agentic RL training 和 context memory。
  • Overlap with existing assets: 与 tool-calling RL、credit assignment survey、Seer/RollArt 有交叉,但 ECHO 的 source-indexed memory + credit routing 是独立节点。

Skipped

Material Reason
公开 reviewer comments 未发现 OpenReview/ARR/会议公开审稿页,或无法可靠匹配到当前论文版本。
完整 PDF 图像解析 TeX 源和 arXiv HTML 已覆盖正文、公式、表格和附录,未单独解析 PDF 图像。

Recommendation

Decision: merge

Why: 这篇论文补齐本地 agentic RL 图谱中的 memory/context reconstruction 与 credit assignment 连接点。它把“长轨迹如何继续行动”和“最终 reward 如何回到证据 turn”放入同一个 source-indexed interface,适合作为 tool-use RL、Seer/RollArt/slime/GLM-5 和 credit assignment survey 之间的桥接论文。