2606.31650-echo-selective-turn-memory-agentic-rl
ECHO: Prune to act, trace to learn with selective turn memory in agentic RL
ECHO 的核心价值在于把 long-horizon agent 的 context management 从“压缩历史以继续行动”推进到“保留 source-indexed reconstruction trace 以便学习”:每个已完成工具 turn 被压成带原始 turn id 的 memory record,policy 在上下文触顶时选择可复用记忆来重建 bounded context,并把最终正确轨迹的正向 outcome credit 只路由到 final answer、被选 source turn、对应 finding token 和 selection action,从而在 BrowseComp-Plus 上同时提高 pass@1、减少 SUPO 式 rolling summary 的 turn/trajectory volume 膨胀。
本地评价:ECHO 的核心贡献应理解为 context reconstruction 与 outcome-credit routing 的连接机制。强 rolling summary 在 inference-time 信息保留上可能已经足够有效;ECHO 更稳定的增量是把历史证据保存为 source-indexed memory,使旧 turn 复用变成显式选择、可记录轨迹和可回传 credit 的训练对象。这个判断会改变对实验的读法:SUPO 的提升说明 summary 能支持长搜索,ECHO 的优势主要体现在 provenance 保留、selection action 学习和冗余 trajectory volume 控制。
Source
- Title: ECHO: Prune to act, trace to learn with selective turn memory in agentic RL
- arXiv: https://arxiv.org/abs/2606.31650
- HTML: https://arxiv.org/html/2606.31650v1
- PDF: https://arxiv.org/pdf/2606.31650
- TeX Source: https://arxiv.org/e-print/2606.31650
- Code/Project: https://github.com/xiezijun714-lang/Echo
- OpenReview / Review page: 未发现可靠公开审稿页。
- Authors: Zijun Xie, Binbin Zheng, Enlei Gong, Jihua Liu, Yuyang You, Lingfeng Liu, Jiayao Tang, Guanqun Zhao, Aoqi Hu, Zeyu Chen
- Submitted: 2026-06-30
- Current version read: v1, 2026-06-30
- Key figure decision: include
- Subjects: Machine Learning (cs.LG); Artificial Intelligence (cs.AI)
作者与关系
- Zijun Xie: School of Mathematical Sciences, Peking University; Baidu Inc.
- Binbin Zheng: Baidu Inc.; University of Science and Technology of China.
- Enlei Gong: Baidu Inc.
- Jihua Liu: Baidu Inc.
- Yuyang You: School of Mathematical Sciences, Peking University.
- Lingfeng Liu: School of Mathematical Sciences, Peking University.
- Jiayao Tang: School of Mathematical Sciences, Peking University.
- Guanqun Zhao: Baidu Inc.
- Aoqi Hu: Baidu Inc.
- Zeyu Chen: Baidu Inc.
阅读目标与判断边界
本笔记关注:
- ECHO 如何把 context reconstruction 的 source trace 转成 RL credit assignment 的训练 mask。
- 它相对 GRPO 和 SUPO 解决了什么 long-horizon agentic RL 失败模式。
- 实验是否足以支撑“source-indexed memory selection 比 rolling summary 更适合 agentic RL”的结论。
判断边界:
- 论文主实验集中在 BrowseComp-Plus 和 Qwen3 系列 backbone,外部任务主要是 zero-shot transfer;更广泛 GUI、embodied、多智能体环境仍未验证。
- ECHO 的 credit assignment 使用 final-trace approximation,只追溯最终上下文中被选中的 source turns,没有递归追踪更深依赖链。
- 代码已公开,但论文没有报告 seed、置信区间或完整成本拆分,训练稳定性结论仍需要独立复现。
论文脉络
1. 研究问题、背景和价值
长时程语言 agent 需要反复搜索、打开页面、调用工具、积累证据,再在有限上下文窗口内做最后决策。传统 reasoning RLVR 多数把一个 prompt 的 rollout 看成相对短的 response;tool-use agent 的 trajectory 会包含多轮 action、observation、summary、tool result 和 final answer。此时上下文窗口与 credit assignment 同时成为瓶颈。
第一类瓶颈是行动侧。agent 如果 append-only 保留所有历史,很快触及 context budget;如果截断或滚动摘要,后续行动可以继续,但远处细粒度证据会被删除或折叠。
第二类瓶颈是学习侧。最终 reward 只在答案完成后出现,GRPO (Group Relative Policy Optimization,组内相对优势策略优化) 这类方法通常把同一个 trajectory-level advantage 广播到很多 generated tokens。若上下文管理已经把原始证据折叠成 summary,训练时很难知道最终成功依赖了哪些旧 turn,容易同时强化有用搜索、冗余搜索、偶然推理和摘要行为。
ECHO 试图把这两个瓶颈用同一个设计处理:context reconstruction 必须保留 source-level addressability,随后 RL update 直接复用这条 source trace。
2. 已有解决方案与不足
论文把已有方法分成几类:
- Append-only prompting:traceability 最强,但 context 不可扩展。
- Sliding-window truncation:满足预算,但丢失远处证据。
- Recursive folding / rolling summary:SUPO、MemAgent 这类方法把旧历史折叠成 compact state,支持长 rollout,但 source turns 被 collapse。
- Pruning / omission / memory actions:能显式删改 memory 或选取一部分 history,但未必给 outcome reward 留下可复用 source-indexed trace。
这些方法多从“如何让 agent 继续行动”出发。ECHO 的切入点是:context manager 的接口同时决定 policy 看到什么,也决定最终 reward 能否回到原始证据。
3. 作者可能的思考路径
从 agentic RL 的失败模式看,SUPO 式 rolling summary 能延长 rollout,但论文诊断显示它会带来 turn proliferation、response length 增长、generation time 增长和 trajectory volume 膨胀。这个现象可以理解为:summary 让 agent 继续探索,但每次折叠都降低了细粒度 provenance,policy 学到的是“继续搜、继续总结”的行为模式,最终 reward 又被 dense 地广播到这些行为上。
如果把每个完成 turn 独立压缩成一个带 source id 的 evidence clue,agent 行动时仍然只读 compact context;当最终答案正确时,训练端可以知道 policy 最后选择复用哪些旧证据。这样 context pruning 和 credit routing 共享同一条 trace。
4. 核心假设或切入点
核心假设有三条:
- Long-horizon agent 的上下文压缩要保留 source-level addressability,单纯压缩成 summary 会损失学习所需的 provenance。
- 对 sparse outcome reward,正向 credit 应沿最终成功使用的 evidence path 路由,避免强化未被复用的冗余搜索。
- memory selection 应由 policy 根据当前 search state 自回归选择;静态 semantic top-
retrieval 很难覆盖“当前下一步需要哪些历史证据”。
5. 方法 / 系统 / 理论框架
论文先定义 multi-turn GRPO。对同一 prompt
在 context-managed rollout 中,完整历史
ECHO 的方法分两段。

第一段是 Prune to Act。每个完成的工具 turn
这里
当 context 达到压缩边界时,policy 看到当前 bounded segment、source-indexed memory list 和 selection instruction,输出要复用的历史 turn ids:
第二段是 Trace to Learn。最终 reconstructed context 选择的 source indices 被用作 credit route。对 token position
其中
这个设计只强化高于组内平均的正确轨迹;错误轨迹即使选中了某些 memory,也不把负向或噪声 credit 路由到这些 source turns。
6. 结论链条
论文的结论链条是:
- Rolling summary 在长搜索中能延长 rollout,但会制造不可 source-addressable 的 collapsed state,并观察到 turn/volume 膨胀。
- ECHO 用 source-indexed turn memory 保留可选择、可追踪的 evidence clue。
- Policy-driven selection 比静态 top-
retrieval 更适合动态搜索状态。 - 正向 traceable credit mask 比 dense all-token credit 更稳定。
- 在 BrowseComp-Plus、zero-shot 多目标 QA / code / deep information seeking 和 dense/MoE backbone 上,ECHO 均优于 GRPO/SUPO 或关键 ablation。
关键实验/定理
结果 1:BrowseComp-Plus 主实验
- 设置:BrowseComp-Plus 长时程 tool-use QA;训练集 747,held-out validation 83;主 backbone 为 Qwen3-32B-Instruct;context budget 为 32K tokens;每 prompt 采样 8 rollouts;SUPO 和 ECHO 在 context 触顶时压缩,最多 5 次 compression,因此有效交互预算最高为
tokens。 - Baseline:GRPO;SUPO-style rolling summarization;三者使用相同工具环境、verifier、rollout budget 和 sampling 配置。
- 指标:held-out pass@1、平均 tool-use turns、trajectory split rate、每 rollout trajectory 数、trajectory volume。
- 结果:ECHO held-out accuracy 为 43.4%,GRPO 为 28.9%,SUPO 为 36.1%。最终 turn count 为 GRPO 11.2、SUPO 62.5、ECHO 45.3;SUPO split rate 为 85.5%,ECHO 为 57.8%;SUPO 平均 4.18 trajectories / rollout,ECHO 为 3.13。
- 解读:GRPO 缺少长上下文探索;SUPO 通过 rolling summary 提升准确率但伴随轨迹膨胀;ECHO 在更高准确率下控制了 turn 和 trajectory volume,支持“source-indexed reconstruction 让长搜索更有效”的主张。

结果 2:Memory component ablation
- 设置:保持 ECHO 的训练/rollout 环境,替换 memory selection 和 retrieved content format。
- Baseline:ECHO learned source selection;semantic top-
retrieval;semantic top- retrieval with full observations。 - 指标:BrowseComp-Plus held-out accuracy 和训练动态。
- 结果:论文图 4a 显示 learned source selection 是主要贡献;semantic top-
retrieval 能保持 rollout compact,但 accuracy 明显低于完整 ECHO;把 compact finding 换成 full observation 没有带来清晰收益。 - 解读:ECHO 的收益主要来自 policy 根据当前 search state 选择 source turns,而非把更多原始 observation 塞回上下文。这个结果对真实 agent memory 很重要:memory item 的 “retrieval decision” 比 memory item 的全文长度更关键。

结果 3:Credit assignment ablation
- 设置:保持 ECHO reconstruction,替换 credit assignment。
- Baseline:完整 ECHO traceable credit;ECHO w/o Traceable CA,即 dense all-token GRPO-style objective;ECHO w/o Traceable CA & Turn-level IS,即把 token-level importance-sampling ratio 换成 turn-level geometric mean。
- 指标:BrowseComp-Plus accuracy、稳定性、turn growth。
- 结果:论文图 4b 显示移除 traceable credit 会降低 accuracy 和 stability;turn-level IS 会进一步诱导 turn growth 和较低 accuracy。
- 解读:在长时程 tool-use trajectory 中,把最终 reward 广播到所有 generated tokens 会强化冗余搜索;把每个 turn 粗化成 macro unit 也会强化长 continuation pattern。ECHO 的 token-level mask 更接近“最终证据链使用了哪些 token”。

结果 4:Zero-shot generalization 与 MoE backbone
- 设置:BrowseComp-Plus 训练后,不额外调参,在 Multi-Objective QA、CodeGym、LoCoBench-Agent、GAIA、HLE、Frames 上评测;同时比较 Qwen3-32B-Instruct 和 Qwen3-30B-A3B-Instruct MoE。
- Baseline:GRPO、SUPO、ECHO 及 ablations。
- 指标:各 benchmark 分数和平均值。
- 结果:Qwen3-32B 上,ECHO 平均 40.2%,GRPO 33.6%,SUPO 34.8%;Top-K retrieval ablation 38.2%,w/o traceable CA 为 35.6%。Qwen3-30B-A3B MoE 上,ECHO 平均 30.5%,GRPO 25.9%,SUPO 26.9%。BrowseComp-Plus MoE 训练中,GRPO 最终约 22.9%,SUPO 在 step 50 后进入 collapsed regime 并降到 13.3%,ECHO 稳定到约 35.0%。
- 解读:结果说明 ECHO 的 learned context-management behavior 有一定跨任务迁移,并且对 dense / MoE backbone 都有效。证据强度仍受单一训练 benchmark、有限模型族和缺少 seed 统计影响。
实验设置与 baseline 审计
| 维度 | 记录 |
|---|---|
| 模型与初始化 | Qwen3-32B-Instruct 为主;Qwen3-30B-A3B-Instruct sparse MoE 做 backbone transfer。 |
| 数据与任务 | BrowseComp-Plus 训练集 747、held-out 83;zero-shot 覆盖 Multi-Objective QA、CodeGym、LoCoBench-Agent、GAIA、HLE、Frames。 |
| RL / 训练配置 | GRPO-style outcome objective;每 prompt 8 rollouts;二元 verifier reward;ECHO 使用 positive group-relative advantage 和 token-level hard credit mask。 |
| 系统配置 | BrowseComp-Plus rollout 使用 search、open_page、finish;search 使用 Qwen3-Embedding-8B 本地 dense retrieval,默认 top-5;open_page 最多返回 16,000 characters;每 assistant turn 最多 5 个并行 tool calls。 |
| 技术报告训练配置 | 代码仓库说明实现基于 verl,Megatron backend + SGLang rollout;论文附录写 fully asynchronous rollout-training pipeline。 |
| 训练硬件与拓扑 | 附录写 4 nodes,每节点 8 GPUs;GitHub README 写目标环境为 4-node × 8×H800,H800 80GB。 |
| 并行方式与框架 | verl、Megatron、SGLang;partial rollouts enabled,staleness threshold 0.5。 |
| 训练数据规模与组成 | BrowseComp-Plus prompt parquet;训练/验证规模披露,语料构造和 judge prompt 细节较少。 |
| 训练过程与超参 | 32K working context;最多 5 compression rounds;ECHO latest turns |
| 训练时间 / GPU hours / 成本 | 未披露 GPU hours、wall-clock 总训练时间和成本;只报告 generation time/trajectory volume 方向性诊断。 |
| 未披露项 | seed 数量、误差线、显著性检验、完整 wall-clock 成本、judge model 具体版本在论文正文中没有系统披露;代码 README 示例使用 OpenAI-compatible judge endpoint。 |
| 评测协议 | BrowseComp-Plus held-out pass@1;zero-shot benchmark 使用各自协议,Multi-Objective QA 使用 LLM-as-a-Judge。 |
| 统计报告 | 未见 seed / confidence interval / significance test。 |
| Baseline 是否 tuned | GRPO、SUPO、ECHO 使用相同工具环境和 rollout budget;baseline 调参范围未完整披露。 |
| Baseline 是否 compute-matched | 训练预算和采样配置相同;但 SUPO/ECHO 的实际 generated tokens、turns、trajectory volume 不同,compute 使用是实验对象之一。 |
| Baseline 是否 implementation-matched | 论文称相同 verifier、tool environment、sampling configuration;代码仓库给出对应脚本。 |
| Baseline 是否覆盖强替代方案 | 覆盖 GRPO 和 SUPO;没有覆盖 MemAgent、Memory-R1、Agent-Omit、MemPO、turn-level CA、hindsight CA、milestone CA 等更广 agent memory / credit assignment baselines。 |
| Baseline 是否存在弱化风险 | SUPO 是 rolling-summary baseline,但不清楚是否为最优 summary prompt / compression schedule;semantic top- |
| 结论边界 | 可较强支持 ECHO 优于该实现中的 GRPO/SUPO;对所有 agent memory 和 credit assignment 方法的泛化胜出仍需更多 baseline 和复现。 |
证据链强度评估
强证据
- BrowseComp-Plus 主实验、memory ablation、credit assignment ablation 和 zero-shot 表格给出一致方向:learned source-indexed selection + traceable credit 比 rolling summary / dense credit 更稳。
- Dense backbone 与 MoE backbone 都呈现相同 ranking,降低了“只适用于 Qwen3-32B dense”的风险。
- 代码仓库公开了训练脚本、ablation knobs、依赖版本和硬件目标,复现实验路径比纯论文描述更清楚。
中等强度证据
- “full observation 没有优于 compact finding” 支持 compact memory 的有效性,但数值主要通过图呈现,缺少表格和统计区间。
- Zero-shot transfer 覆盖多目标 QA、代码和信息检索,但所有模型都从 BrowseComp-Plus 训练迁移,不能说明 ECHO 在每类环境中端到端训练都同样有效。
- SUPO turn proliferation 诊断很有启发,但论文也承认不能证明该现象完全由 lost provenance 导致。
需要谨慎的推论
- ECHO 的 final-trace approximation 可能漏掉递归依赖。如果最终被选 source turn 本身依赖更早未选 turn,credit 会中断。
- 正向 credit 只强化正确轨迹的 selected trace,对错误轨迹中的有用但误用证据不更新;这降低噪声,也可能降低纠错学习能力。
- 目前实验不覆盖 GUI、embodied、多 agent、真实网页浏览或开放互联网环境,BrowseComp-Plus 的本地 retrieval 和 verifier 设置可能降低部署复杂度。
OpenReview / 审稿意见吸收
- Venue status: arXiv v1,观察日期 2026-07-03;未发现可靠公开会议投稿或录用状态。
- Public reviews: 未发现公开 reviewer comments。
- Ratings / confidence: 无公开 rating / confidence。
- Reviewer consensus: 无公开审稿共识可吸收。
- Main criticisms: 无公开审稿批评;本地可见主要风险是 baseline 覆盖、统计报告、final-trace approximation 和环境覆盖。
- Author response: 未发现公开 rebuttal。
- 对可信度的影响: 可信度主要来自 arXiv 论文、TeX 源和 GitHub 代码;缺少公开审稿意味着 novelty、baseline 强度和统计稳定性仍需后续社区复验。
本地讨论补充
1. 讨论收敛点
- 初始归档判断:ECHO 是 agentic RL 中“memory 作为 action context”和“memory 作为 credit provenance”的连接点。它比单纯 context compression 更重要的地方在于训练端可以复用 selection trace。
2. 修正后的理解
- ECHO 的 memory item 属于 trajectory-local evidence clue。它服务当前 rollout 的 bounded context 和后续 policy update,不等同于跨任务 persistent memory。
- ECHO 的 traceable credit mask 更像 positive evidence-path distillation:它把最终成功答案使用到的证据路径强化到 policy;每个历史 action 的完整因果贡献仍是近似边界。
3. Summary 与 ECHO 的真实分界
强 rolling summary 在信息选择上未必天然弱于 ECHO。如果 summarizer 足够强,任务结构清楚,关键信息量有限,summary 可以把真正有用的旧 turn 内容保留下来。ECHO 的核心优势更集中在 source traceability 和 RL credit assignment:它让“哪些历史被复用”从摘要文本里的隐式选择,变成带 source id 的显式 action trace。
论文机制支持这个判断。每个 completed turn <sum_last_turn>...</sum_last_turn> block,且该 block 只用一句 factual sentence 记录最新工具结果。随后 memory record 写成:
其中
当 context 接近预算时,ECHO 先让 policy 从 memory set
这里旧历史以 selected compact memory 的形式进入上下文;当前 segment 内的新鲜历史仍由
rolling summary 的主要差异在于 provenance。它可以保留“已经确认 X”这类内容,却通常无法稳定保留“X 来自 turn 17、对应 action 是什么、哪些 generated tokens 产生了这个 finding”。成功轨迹的 reward 如果继续 dense 地广播到整条轨迹,冗余 search、open page 和 summary token 也容易一起被强化。ECHO 的 source id 让训练端可以把正向 advantage 路由到 final answer、selected source turn、selected finding tokens 和 memory-selection action。
实验也支持这个边界。主实验中 SUPO rolling summary 相比 GRPO 提高准确率,说明 summary 的信息选择并不失效;但 SUPO 的 final turn count、split rate 和 trajectory volume 更高。ECHO 在更高准确率下控制了这些膨胀指标。component ablation 显示 learned source selection 是主要贡献,compact finding 换成 full observation 没有清晰收益;credit assignment ablation 显示去掉 traceable CA 后准确率和稳定性下降。这些结果更像是在支持“source-indexed selection + traceable credit”这条训练路径;summary 本身的信息压缩能力强弱仍需要单独比较。
4. 后续复验指标
- 递归依赖深度:最终 selected turns 中有多少依赖未被最终 trace 覆盖的早期 turns。
- 选择开销:selection prompt 的 token 和 latency 占 rollout 总成本比例。
- 错误轨迹利用率:错误 rollout 中被选 memory 是否可用于 contrastive 或 counterfactual update。
- 多环境稳定性:GUI agent、真实浏览、代码仓库操作和多 agent 协作中的 memory selection 质量。
5. 关键图回填判断
- Figure 3 直接压缩了本地讨论中最重要的机制链:source-indexed memory selection 同时服务 context reconstruction 与 credit routing,适合作为快速理解 ECHO 的首要入口。
- Figure 1 与 Figure 4a/4b 分别补足主结果和两项关键消融,使准确率、turn/trajectory volume、selection 与 credit assignment 的证据能够直接复查。
主要启发
- Agentic RL 的 context manager 应同时暴露 acting interface 和 learning provenance。只优化 prompt length 可能把训练可追溯性丢掉。
- 选择历史 memory 的决策本身应进入 trajectory,并作为可学习 action 处理。ECHO 把 memory selection token 纳入 credit mask,提供了一个清晰实现路径。
- 对长工具轨迹,credit assignment 不能只按 token / turn 粗粒度定义,还要看 policy context 是如何重建出来的。
- 如果要设计 online agentic server 或 RL rollout 系统,memory/KV/cache 的复用策略可以与 reward credit trace 统一记录,后续能减少“推理用了什么证据”和“训练更新了什么 token”之间的断裂。
局限
- Final-trace approximation 只覆盖最终上下文中被选 source turns,没有递归追踪 evidence dependency graph。
- 公开实验主要是 text-based tool-use agents;GUI、embodied、multi-agent 和真实开放网页环境仍缺验证。
- Baseline 覆盖有限,缺少与 Memory-R1、MemPO、Agent-Omit、hindsight/milestone/turn-level CA 等强替代路线的直接对照。
- 统计报告不足,缺少 seed、误差线、显著性和完整训练成本。
- ECHO 增加 finding generation 和 memory selection 开销,论文没有给出 end-to-end cost-benefit 的完整分项表。
跨论文关系
- 与已有论文的作者关系:当前未发现与已存档论文的直接作者重叠。机构层面连接 Peking University / Baidu Inc. / USTC,其中 PKU 已在 DeepSeek、Xiaomi MiMo、MegaScale/UltraEP、MiniMax-M3 等节点多次出现,但该作者群未与这些节点确认同人。
- 与已有论文的主题关系:与 2606.00135 tool-calling RL 共享 long-horizon tool-use RL 主题;2606.00135 关注 harness、zero-variance prompts 和 rollout/policy update 成本,ECHO 关注 context reconstruction 与 source-level credit routing。
- 与已有论文的方法或系统关系:与 2604.09459 credit assignment survey 形成直接关系,ECHO 可放入 agentic turn/source-level credit assignment;与 2511.14617 Seer、2512.22560 RollArt、slime 和 2602.15763 GLM-5 形成互补:这些系统优化 rollout/training pipeline,ECHO 优化 trajectory 内的 memory trace 与 update mask。
- 与 CompactionRL:两者都让 shared actor 生成 context-management action。CompactionRL 把旧 prefix 压成 opaque summary,保留最近两轮,并用 critic + cross-segment GAE 训练全部 execution / summary tokens;ECHO 把旧历史变成带 source id 的 turn memories,训练 selection action,并把正向 credit 路由到最终使用的 source turns。该对照连接了 dense outcome credit 与 provenance-aware selective credit 两条路线。
- 与 SelfCompact:两者都在 agent trajectory 内选择保留状态。SelfCompact 用 evidence-grounded rubric 决定自然语言 hard reset 的时机,训练信号和 source-level provenance 均不进入 controller;ECHO 生成带 source id 的 compact findings,再学习 memory selection 并把正向 credit 路由到最终使用的来源。二者分别覆盖 semantic timing 与 traceable selection。
- 与 LLM 与 Agent 强化学习中的信用分配:该主线把 ECHO 定位为保留来源的正向信用路由器,并与 Memory-R2 的同状态重采样、HiMPO 的记忆反事实和 CompactionRL 的压缩状态 critic 分开比较;这收紧了“使用证据”与“估计证据边际贡献”的边界。
- 跨论文关系定位:记录 ECHO / Source-Indexed Agentic Memory Credit Assignment,连接 agent memory、context management、tool-use RL、credit assignment 和 long-horizon rollout systems。
Reference Intake Brief
Target
- Intended target system:
content/papers/2606.31650-echo-selective-turn-memory-agentic-rl.md论文存档。 - Existing related assets:
content/utility/papers-index.md;2606.00135、2604.09459、2511.14617、2512.22560、2602.15763。 - Proposed form: 新建独立 Markdown 文档,更新索引和作者档案。
Reusable Elements
source-indexed reconstruction trace可作为评估 agent memory 方法的重要维度。positive traceable credit mask可用于分析 outcome-only reward 下的长轨迹 credit routing。- ECHO/SUPO/GRPO 的对照给 agentic RL 系统提供了“准确率、turn 数、split rate、trajectory volume”四维审计模板。
Risks
- Copyright/over-copying: 只记录少量必要数字、公式和结论,避免复制长段论文/README。
- Unsourced or unverifiable claims: 作者公开 profile 资料较少,作者档案以 arXiv/GitHub 可核验证据为主。
- Tone/brand mismatch: 按本地论文档案的分析语气写作,不写成项目宣传。
- Safety/compliance issues: 无明显双用途操作细节;方法属于 agentic RL training 和 context memory。
- Overlap with existing assets: 与 tool-calling RL、credit assignment survey、Seer/RollArt 有交叉,但 ECHO 的 source-indexed memory + credit routing 是独立节点。
Skipped
| Material | Reason |
|---|---|
| 公开 reviewer comments | 未发现 OpenReview/ARR/会议公开审稿页,或无法可靠匹配到当前论文版本。 |
Recommendation
Decision: merge
Why: 这篇论文补齐本地 agentic RL 图谱中的 memory/context reconstruction 与 credit assignment 连接点。它把“长轨迹如何继续行动”和“最终 reward 如何回到证据 turn”放入同一个 source-indexed interface,适合作为 tool-use RL、Seer/RollArt/slime/GLM-5 和 credit assignment survey 之间的桥接论文。