2606.20954-lre-learned-relevance-eviction
Learning What Not to Forget: Long Horizon Agent Memory from a Few Kilobytes of Learning
LRE 用日志中的未来复用信号训练轻量逻辑回归,对历史单元进行因果、查询无关的相关性打分,并在预算内逐字保留高分单元;单随机种子 AppWorld 实验中它以零额外压缩器调用取得 41.1% 的任务目标完成率,接近全历史的 44.0%,LoCoMo 的 20% 保留率实验中也成为最佳受预算策略,但 Hard 任务明显退化、LongMemEval 由 TF-IDF 内容显著性方法胜出,2048 token 又只约束较旧历史,因此现有证据支持一种低成本的主动淘汰基线,尚不足以支持与全历史等效或跨域占优。
Source
- Workflow version: v2.1
- Material type: research-paper
- Analysis modules: experiment, system
- Canonical source: https://arxiv.org/abs/2606.20954
- Title: Learning What Not to Forget: Long-Horizon Agent Memory from a Few Kilobytes of Learning
- Authors: Nusrat Jahan Lia, Aritra Mazumder
- Responsible organization: Institute of Information Technology, University of Dhaka;University of Utah
- arXiv: https://arxiv.org/abs/2606.20954
- HTML: https://arxiv.org/html/2606.20954v1
- PDF: https://arxiv.org/pdf/2606.20954v1
- TeX Source: https://arxiv.org/e-print/2606.20954v1
- Code/Project: https://github.com/NusRAT-LiA/LRE
- OpenReview / Review page: 未发现与完整标题、两位作者或 arXiv:2606.20954 可可靠匹配的公开审稿页或正式会议论文页
- Submitted: 2026-06-18
- Published / updated: 2026-06-18(arXiv v1)
- Current version read: arXiv v1;HTML、PDF 与 TeX source;公开代码仓库
- Version / revision read: arXiv:2606.20954v1;代码 commit
1aa51d672d772b27a272cab1393cd9968c13d158 - License: 论文 CC BY 4.0;代码包元数据声明 MIT,但仓库没有独立
LICENSE文件 - Accessed: 2026-07-27
- Key figure decision: include
- Review status: page-type=not-found; match-confidence=high; observed-at=2026-07-27; venue-status=arXiv preprint
- Subjects: Computation and Language (cs.CL); Artificial Intelligence (cs.AI)
TeX source 的首行注释写有 “LRE - EMNLP 2026 Industry Track”,文档仍使用 preprint 选项,当前也没有可核验的 Anthology、会议程序或公开审稿记录。本笔记因此把它视为 arXiv 预印本,不据该注释推断投稿或录用状态。
作者与关系
- Nusrat Jahan Lia: Institute of Information Technology, University of Dhaka.
- Aritra Mazumder: University of Utah.
论文连接了 University of Dhaka 的自然语言处理研究者与 University of Utah 的数据系统研究者。Nusrat Jahan Lia 的个人主页把 LRE 作为独立研究卡片重点展示,公开代码仓库也位于其 GitHub 账号下;Aritra Mazumder 的个人主页把 LRE 与 AgentCollabBench 并列放在单独的在审论文区域。他目前是 University of Utah UtahDB Lab 的博士生,研究简介覆盖数据系统与可靠智能体。论文和 TeX source 没有标注共同一作、通讯作者或作者贡献,作者角色只按公开仓库归属和个人主页陈述记录。
两位作者此前都未出现在本地论文档案中,当前没有可靠的跨论文作者重叠关系。
阅读目标与判断边界
本笔记关注:
- 主动淘汰与查询时检索的决策时序有何差异,LRE 实际学习了什么。
- “几 KB”“零神经成本”“严格 2048 token 预算”“最高减少 52%”分别采用什么口径。
- AppWorld、LoCoMo 和 LongMemEval 的实验能支持多窄的结论。
- 公开代码能否复现论文表格,论文协议与仓库默认配置是否一致。
判断边界:
- AppWorld 主表只报告一个随机种子,GPT-4.1-mini 的非确定性没有由重复实验量化。
- LoCoMo 只有 10 个 conversation groups;LongMemEval 的每个问题自带一组约 50 个候选 session,和“对同一份长期记忆先淘汰、以后才出现未知问题”的在线设置仍有差别。
- 对话实验使用 GPT-4.1-mini 生成答案,并在 LongMemEval 上使用 GPT-4o 裁判;论文没有报告人工一致性、重复调用方差或置信区间。
- 仓库公开了方法、数据下载和运行脚本,没有公开原始轨迹、训练好的打分器、结果 JSON 或 LLM 输出;表格数值目前只能从论文读取。
论文脉络
1. 研究问题、背景和价值
长程智能体会持续积累工具调用、观察结果、登录凭据、对象 ID 和中间代码;长期对话会跨多个 session 积累身份事实与事件。当活动上下文达到预算时,系统要决定哪些旧内容继续进入后续提示。
这个决策发生在未来调用或问题到来之前。查询时检索可以拿当前问题计算相似度,主动淘汰需要在写入或触发压缩时预测一个历史单元的未来效用。工具任务还要求保留精确字符串:摘要即使保存了计划,也可能改写 access token、对象 ID、路径或参数值。
LRE 要回答的问题很窄:系统能否从历史日志构造廉价监督,用一个 CPU 线性分类器提前预测哪些完整历史单元值得保留,并以逐字抽取降低摘要调用和状态改写风险。
2. 已有解决方案与不足
论文比较的路径可以按决策信息和表示形式整理:
| 路径 | 决策信号 | 保留形式 | 主要边界 |
|---|---|---|---|
| FIFO / recency / decay | 时间位置 | 原文 | 远处凭据和早期事实会固定退出 |
| 内容显著性 | 单元相对全文中心的 TF-IDF 相似度 | 原文 | 能捕捉主题代表性,未直接学习未来任务效用 |
| Dense salience / LLMLingua-2 | 神经编码器或 token 分类器 | 向量分数或删减后的文本 | 每个单元需要神经前向计算 |
| ACON 历史压缩 | 当前任务与完整历史上的 LLM 摘要调用 | 改写后的摘要 | 增加关键路径调用,也可能改写精确状态 |
| KV 淘汰与稀疏注意力 | 模型内部 attention / gate | token 或 KV 子集 | 依赖模型内部信号,作用层级低于消息或步骤 |
LRE 的位置是查询无关、模型外部、历史单元级的学习式抽取。它保留完整 action–observation pair、对话 turn 或 session,后续仍可在单元内部叠加 token/KV 级方法。
3. 作者可能的思考路径
以下为本地分析:
- AppWorld 的失败常由少量早期字符串引起,历史的大部分文本对最终调用没有持续价值。
- 完成轨迹天然记录“某个字符串后来有没有再次使用”,对话日志也记录“某个事实后来有没有出现在答案中”。未来行为可以离线生成训练标签。
- 若特征只读取当前单元和此前前缀,线上打分阶段无需等待未来,也无需知道未来查询。
- 逻辑回归足以把位置、长度、代码、错误、稀有词和标识符等表面信号组合成排序分数;推理只需特征提取和点积。
- 对预算内选中的单元保持原文和时间顺序,可以减少摘要改写导致的执行状态损失。
这条路径的实质是把历史管理写成一个离线监督的排序问题。共享部分是“打分—保留—淘汰”框架;智能体与对话使用不同特征、不同标签和分别训练的参数,论文没有得到一个跨域通用的权重向量。
4. 核心假设或切入点
LRE 依赖以下条件:
- 日志中的未来复用与未来任务效用具有稳定相关性。
- 单元当前文本及其前缀统计包含足够信号,可以在未知未来查询时预测重要性。
- 历史可拆成有语义的 action–observation pair、turn 或 session,关键状态不会只存在于被拆开的局部 token 中。
- 各单元的价值近似可加,按单元概率求和能够代表组合后的上下文效用。
- 最近五个智能体步骤无条件保留是合理的系统先验,较旧状态能进入 2048 token 的独立预算。
- 逐字保留能提高状态保真度,选错单元造成的遗漏风险仍可由分类器控制。
- 训练日志的 host model、工具格式和任务分布与部署阶段足够接近。
5. 因果、查询无关的单元打分
设历史为
L2 正则化逻辑回归输出保留概率:
训练标签可以使用未来信息,因为它们只在离线阶段构造;线上特征和打分都不能读取
6. 预算选择与逐字重建
令
重建后的历史按原时间顺序排列:
实现按

7. 智能体实例
每个单元是一组 action 与 observation。十维特征覆盖相对位置、token 数、对数长度、数字数量、错误指示、代码指示、前缀内稀有词密度、大写词数量、与前一步的集合相似度,以及 URL 或 ID 指示。
一个步骤首次引入的标识符若在至少三个后续步骤中再次出现,就得到正标签。作者在 90 个不淘汰的 AppWorld 训练任务上生成轨迹并训练打分器。测试时:
- 较旧历史预算
tokens; - 最近五个单元
始终保留; - system prompt 与 task 也不进入
; - 选中单元按原文和时间顺序重新发给 GPT-4.1-mini。
因此 2048 是旧历史子集预算。完整 prompt 的上界还要加 system、task 和最近五步,主表中的 LRE 平均峰值也达到 6.91k tokens。
8. 对话实例
每个单元是 LoCoMo 的对话 turn 或 LongMemEval 的完整 session。表示由最多 10,000 维 TF-IDF 与六个标准化轨迹特征组成:位置、近因性、对数长度、数字数量、问号指示和大写词数量。
监督版本使用 gold evidence;自监督版本把“某单元覆盖某个最终答案至少 40% 的内容 token”作为正标签。LoCoMo 按 10 个完整 conversation 做 leave-one-group-out,LongMemEval 按问题做五折 grouped cross-validation,并删除训练折中和测试 haystack 文本完全相同的 session。
这里的“几 KB”需要按域理解。论文直接报告的是十维智能体打分器 1.7 KB;对话版本还包含最多 10,000 个 TF-IDF 词项、词项权重、标准化器和逻辑回归参数,论文没有报告完整序列化体积。它仍然远小于神经编码器,现有材料无法支持对完整对话流水线作 1.7 KB 的量化。
9. “零神经成本”的系统口径
LRE 在每次淘汰时不调用额外 LLM,也不执行额外神经网络前向。系统仍需支付:
- CPU 文本解析和特征提取;
- TF-IDF 变换或十维特征计算;
- 逻辑回归点积和排序;
- 离线轨迹生成、标签构造与训练;
- 重建后提示进入 host model 时的 prefill。
因此“零神经成本”准确指向淘汰策略的边际神经调用数,不代表端到端成本为零。
10. 结论链条
- 主动淘汰必须在未知未来请求时选择历史,查询条件检索无法直接充当这一决策器。
- 已完成日志可以用“未来再次使用”产生后见标签,因果特征可以在部署时提前打分。
- 逻辑回归以较低边际成本排序历史单元,原文抽取保存精确凭据、标识符和代码。
- AppWorld 的单次运行显示这种选择比 FIFO 和仓库内 ACON 设置更接近全历史成功率;LoCoMo 显示学习式排序优于其他受预算策略。
- Hard AppWorld 与 LongMemEval 的负结果表明,浅层、查询无关信号会在状态量超出预算或数据结构变化时失效。
- 最窄结论是:在论文测试的 host model、任务分布和预算协议下,轻量因果排序器构成了值得保留的低成本基线。
关键实验/定理
结果 1:AppWorld 任务目标完成率
- 设置:在 90 个不重叠
train任务的全历史轨迹上训练智能体打分器;在test_normal的 168 个任务上评估,其中 Easy 57、Medium 48、Hard 63;所有策略使用 GPT-4.1-mini 和随机种子 1。 - Baseline:全历史、FIFO、ACON 仓库内历史压缩设置、LRE。
- 对照是否可比:host model、seed、任务、运行框架和旧历史阈值相同;ACON 沿用其发布配置的
preserve_last_k_turns=1,FIFO/LRE 使用 5,且 ACON 使用未经针对本任务调优的发布版压缩提示,因此比较仍含最近窗口和提示配置差异。 - 系统条件:LRE/FIFO 的最近五步在 2048 token 预算外;system prompt 和 task 同样不计入。ACON 平均每题执行 5.45 次额外压缩器调用。
- 指标定义:Task Goal Completion(TGC)要求重放后的最终 AppWorld 状态通过该任务全部隐藏单元测试;Steps 是平均智能体生成步数;Peak 是每题最大输入 token 数。
- 结果:
| 方法 | 总体 TGC | 平均步数 | 平均峰值 | Easy | Medium | Hard | 压缩器调用/题 |
|---|---|---|---|---|---|---|---|
| 全历史 | 44.0% | 19.1 | 9.23k | 57.9% | 43.8% | 31.7% | 0 |
| FIFO | 34.5% | 30.6 | 5.65k | 59.6% | 27.1% | 17.5% | 0 |
| ACON | 26.2% | 33.5 | 5.12k | 57.9% | 16.7% | 4.8% | 5.45 |
| LRE | 41.1% | 21.8 | 6.91k | 73.7% | 37.5% | 14.3% | 0 |
- 成本归因:LRE 相对全历史的平均 prompt 峰值降低约 25.1%,同时多执行 2.7 个智能体步骤;相对 ACON 取消额外压缩调用,但平均峰值高 1.79k。
- 证据定位:Section 5.1、Table 2;Appendix B.3;代码
experiments/agents/configs/、experiments/agents/run_study.sh,commit1aa51d672d772b27a272cab1393cd9968c13d158。 - 支持的最窄结论:在 seed 1 的 AppWorld
test_normal上,LRE 的总体 TGC 高于 FIFO 和该 ACON 配置,并在减少平均 prompt 峰值时保留了大部分全历史 TGC。 - 解读:41.1% 与 44.0% 相差 2.9 个百分点,论文没有给出置信区间、等效界值或多 seed 检验,因此“matches full history”应读作单次点估计接近。Easy 的增益与 Hard 的 17.4 个百分点下降同时存在,固定 2048 token 旧历史预算对复杂任务约束明显。
结果 2:重放评测、峰值口径与定性机制
- 设置:作者把每条轨迹中的动作确定性重放到新的 AppWorld 环境,再运行隐藏单元测试;另追踪一个跨 Simple Note 与 Spotify 的任务。
- Baseline:四种历史策略的 agent 自报完成信号与重放 TGC;定性任务比较全历史、FIFO、ACON 和 LRE。
- 对照是否可比:同一策略的自报与重放共享轨迹;定性案例只有一个主案例和一个补充 Venmo 案例,不能估计总体发生率。
- 系统条件:任务步数上限为 49;ACON 在主案例执行 49 次智能体调用和 8 次压缩调用。
- 指标定义:自报膨胀倍数为 self-reported success 除以 replay TGC;最大峰值是每种策略跨任务的最大单题 prompt 峰值。
- 结果:自报成功率相对真实 TGC 膨胀 1.76 至 2.30 倍,合并为 2.12 倍。LRE 在主案例以 19 次调用完成任务,全历史为 30 次,FIFO 与 ACON 均运行到 49 次上限;seed 1 有 14 个任务只被 LRE 完整解决。
- 成本归因:LRE 的最大峰值为 15,388,低于全历史的 25,043、FIFO 的 28,565 和 ACON 的 31,918。“最高减少 52%”使用 ACON 的 31,918 作为分母;相对全历史最大峰值的下降约为 38.6%。
- 证据定位:Appendix B.3 的 replay 协议、Appendix H、Figure 1、Section 5.2。
- 支持的最窄结论:AppWorld agent 的自报完成信号严重高估最终环境正确性,确定性动作重放能够修正该偏差;个案日志支持“逐字保留凭据和 ID 可避免重复认证与重复读取”的机制解释。
- 解读:重放评测是论文中独立于 LRE 的高价值方法贡献。14 个独占成功任务与单案例都来自同一 seed,仍需多次运行确认。
结果 3:对话证据排序
- 设置:LoCoMo 含 5,882 个 turn、10 个 conversation groups,采用 leave-one-group-out;LongMemEval 最多 500 个问题、每题约 50 个 session,采用五折 grouped cross-validation,并删除约 51,000 个跨折重复训练实例。
- Baseline:recency、MemoryBank、TF-IDF 内容显著性、LLMLingua-2、冻结 BGE,以及 LRE 的 content-only、自监督和监督版本。
- 对照是否可比:所有报告为查询无关方法;LLMLingua-2 与 BGE 只在 LongMemEval 给出数值。各方法的表示能力和运行硬件不同,AUC 本身不受吞吐硬件影响。
- 系统条件:LRE 在每个训练折内拟合 TF-IDF、标准化器与分类器,测试时不读问题。
- 指标定义:macro-AUC 先在每个 conversation 或 question group 内计算证据与非证据的 ROC-AUC,再对 group 等权平均。
- 结果:
| 方法 | LongMemEval | LoCoMo | 每单元神经前向 |
|---|---|---|---|
| Recency / MemoryBank | 0.527 | 0.478 | 0 |
| 内容显著性 | 0.752 | 0.414 | 0 |
| LLMLingua-2 | 0.402 | — | 1 |
| 冻结 BGE | 0.643 | — | 1 |
| LRE-content | 0.686 | 0.782 | 0 |
| LRE-self-sup | 0.698 | 0.769 | 0 |
| LRE-supervised | 0.708 | 0.829 | 0 |
- 成本归因:LRE 不执行神经前向;对话版本仍需 TF-IDF 稀疏变换和逻辑回归计算。
- 证据定位:Section 5.3、Table 3;Appendix B.1–B.2;代码
experiments/conversational_qa/lre_qa.py。 - 支持的最窄结论:LRE 在 LoCoMo 上是最强查询无关排序器,并在 LongMemEval 上超过论文测试的两个神经基线。
- 解读:LongMemEval 的内容显著性 0.752 高于全部 LRE 版本,因而实验不支持 LRE 在每个数据集占优。两域共享方法框架,排名模式明显依赖数据组织。
结果 4:20% 保留率下的回答质量
- 设置:每种策略保留 20% 的 turn 或 session,把原文交给 GPT-4.1-mini 回答;LoCoMo 使用 token-F1,LongMemEval 使用 GPT-4o 正误裁判。
- Baseline:全历史、recency、内容显著性、LRE 自监督和监督版本。
- 对照是否可比:各受预算策略保留相同比例的单元,实际 token 数因单元长度不同;全历史没有相同 token 预算。
- 系统条件:代码 README 的完整命令令
--n 100000,从而覆盖可用问题;论文表格没有单独报告实际成功返回的调用数、重试数或裁判方差。 - 指标定义:LoCoMo 是答案与参考答案的 token-level F1;LongMemEval 是独立 GPT-4o 对 GPT-4.1-mini 答案的二元正确率。
- 结果:
| 策略 | LoCoMo F1 / context | LongMemEval judge / context |
|---|---|---|
| 全历史 | 0.233 / 18.8k | 0.242 / 50.0k |
| Recency | 0.100 / 3.6k | 0.276 / 26.1k |
| 内容显著性 | 0.081 / 4.0k | 0.338 / 36.5k |
| LRE-self-sup | 0.160 / 6.5k | 0.280 / 38.9k |
| LRE-supervised | 0.177 / 6.0k | 0.296 / 38.8k |
- 成本归因:LoCoMo 上 LRE-supervised 相对全历史少读约 68% token,回答 F1 仍低 0.056;LongMemEval 上内容显著性同时取得最高裁判分和更少 context token。
- 证据定位:Section 5.4;Appendix I、Table 12;代码
experiments/conversational_qa/run_downstream.py。 - 支持的最窄结论:LRE 是 LoCoMo 上质量最高的 20% 保留策略;LongMemEval 上的最佳策略是内容显著性。
- 解读:LongMemEval 的全历史分数最低可以与长上下文干扰相容,论文没有通过位置扰动、长度对齐或注意力诊断隔离 lost-in-the-middle 因果机制。
结果 5:自监督恢复率与在线打分成本
- 设置:对话单元的自监督阈值从 0.2 扫到 0.8,依据两个 benchmark 的 gold-alignment AUC 选择 0.4;服务吞吐在 LoCoMo 的 Apple M2 和 LongMemEval 的 8 vCPU + NVIDIA T4 环境分别测量。
- Baseline:LRE 自监督对监督版本;吞吐比较 recency、内容显著性、BGE 和 LLMLingua-2。
- 对照是否可比:同一数据集内的吞吐比较受控;跨数据集的硬件和单元长度不同。LongMemEval 的 BGE/LLMLingua 使用 T4,论文表头仍写
units/sec (CPU),该标签不能用于解释它们的执行设备。 - 系统条件:LongMemEval 上 LRE 为 1,181 units/s,BGE 为 103,LLMLingua-2 为 36;LoCoMo 上 LRE 为 129,081。
- 指标定义:恢复率只计算高于随机 AUC 0.5 的部分,即自监督版本的超随机增量除以监督版本的超随机增量。
- 结果:LongMemEval 的自监督/监督 AUC 为 0.698/0.708,恢复率 95%;LoCoMo 为 0.769/0.829,恢复率 82%。智能体标识符复用标签迁移到两项对话数据时分别只有 0.527 和 0.620。
- 成本归因:淘汰时只增加 CPU 特征计算、线性打分与排序;生成训练日志、调用下游 QA/裁判以及 host model prefill 不计入该“零神经前向”口径。
- 证据定位:Section 5.5、Table 4;Appendix D、I.2;代码
experiments/conversational_qa/proxy_labels.py、run_retrieval_auc.py。 - 支持的最窄结论:由后续答案构造的标签能在两项数据上恢复监督排序信号的一部分,其中 LongMemEval 的恢复率达到 95%。
- 解读:95% 是一个数据集上的最高恢复率,LoCoMo 为 82%。阈值 0.4 通过 gold AUC 扫描选择,所以标签生成不需要人工逐单元标注,超参数选择仍使用了 gold relevance;真实部署需要另行确定目标正例率或验证集规则。
代码与复现
公开仓库:NusRAT-LiA/LRE,本笔记核验 commit 1aa51d672d772b27a272cab1393cd9968c13d158。
可复用部分包括:
lre/features.py:十维智能体因果特征;lre/labels.py:未来标识符复用标签;lre/scorer.py:逻辑回归与梯度提升树后端;lre/select.py:按分数/token 贪心选择、最近窗口保护和时间顺序重建;experiments/conversational_qa/:LoCoMo/LongMemEval 数据、折分、基线、AUC、下游 QA 和成本脚本;experiments/agents/:AppWorld/ACON patch、冻结任务 ID、训练、重放 TGC 与报告脚本。
复现边界:
- 仓库明确说明只发布代码;
data/raw/与results/被排除,训练好的results/lre_model_lr_s90.joblib、结果 JSON、原始轨迹和模型输出都需要重新生成。 - 下游 QA、裁判和智能体运行通过 OpenRouter 调用付费模型;AppWorld 与 ACON 需要单独安装。README 固定 ACON commit
d63f9ae18959dc7215ff62899c94c5e8c56847ae,AppWorld 安装步骤固定 commita072b7a86e7c1d5b1d7175659d750ebb9b79f10a。 - 论文 AppWorld 主表覆盖 Easy/Medium/Hard 和 seed 1;当前 README 默认
BUCKETS="med hard"、SEEDS="1 2 3",并写有“use ≥3 for the reported result”。该默认配置会生成更稳健的新实验,无法直接还原论文表格。 - README 概述写 “LRE matches ACON's ... task success”,论文 Table 2 的 LRE 与 ACON TGC 分别为 41.1% 与 26.2%。这句概述与当前论文数值不一致。
pyproject.toml声明 MIT,GitHub 仓库没有可检测的独立许可证文件;复用者需要作者补充许可证正文。- 仓库没有自动化测试。代码结构足以审计算法和重新运行实验,缺少已发布结果工件使数值级复验成本较高。
局限
- 单随机种子。 AppWorld 只报告 seed 1;模型输出和每题成败具有运行间波动,点估计无法证明与全历史等效,也无法判断 Easy 增益是否稳定。
- 预算只覆盖较旧历史。 2048 token 不含 system prompt、task 和最近五步,实际 prompt 平均峰值为 6.91k;生产系统若要求完整 prompt 或 KV cache 的硬上限,需要重新定义并测量预算。
- ACON 对照含配置差异。 ACON 保留最近一步,FIFO/LRE 保留最近五步;ACON 又沿用未调优压缩提示。结果支持对该发布配置的比较,无法概括所有 LLM 摘要器。
- 抽取与选择没有完全分离。 FIFO 同样逐字保留但选择较弱,ACON 能选择内容但会改写且 recent-window 不同。缺少强查询无关抽取器、调优后的摘要器,以及在相同淘汰触发、相同最近窗口和相同完整 token 预算下固定选择结果、只改变表示形式的消融。
- 贪心选择的最优性有限。 智能体单元成本不同,按概率/token 排序只是 0/1 背包启发式;单元价值还可能有互补和冗余,目标函数没有建模组合效应。
- “几 KB”只得到局部量化。 1.7 KB 对应十维智能体打分器;对话流水线的 10,000 维 TF-IDF 词表和参数没有报告序列化大小。
- 自监督调参仍读 gold。 对话标签由日志自动生成,0.4 阈值通过 gold relevance AUC 选择;新部署若没有 gold,需要另设校准协议。
- LongMemEval 的在线外部有效性有限。 打分器不读问题,但每个候选 haystack 本身按具体问题组织。实验没有直接模拟同一份持久历史只淘汰一次、随后接受多个未知问题。
- 对话统计不确定性。 LoCoMo 只有 10 个 group,LongMemEval 下游使用 LLM 裁判;论文没有报告 bootstrap 区间、多次生成或人工裁判一致性。
- host model 与域迁移。 智能体打分器只在 GPT-4.1-mini 的 AppWorld 轨迹上验证,智能体标签迁移到对话接近随机;跨模型、Web、开放代码、GUI、多模态、多智能体和动态外部状态仍待验证。
- 模型输入成本仍存在。 被保留原文在每轮继续进入 host model,论文没有测量真实端到端延迟、TTFT、prefix-cache 命中、API 账单或能耗。
- 隐含逻辑依赖尚未评测。 三项实验都没有覆盖数学证明或复杂逻辑轨迹;这一适用边界对打分机制的含义和待验证对照见“主要启发”第 2 条。
跨论文关系
- 与 ECHO:两者都选择历史单元并保留来源结构。LRE 用离线日志标签训练固定逻辑回归,输出原始 action–observation 单元,训练不进入 host policy;ECHO 让 policy 生成带 source id 的压缩 finding 和选择动作,再把最终结果信用路由到被复用来源。LRE 提供低成本推理基线,ECHO 处理可学习选择与训练信用。
- 与 SelfCompact:SelfCompact 用同一 LLM 和任务评分量规判断压缩时机,再生成自然语言摘要并 hard reset;LRE 用外部 CPU 分类器决定保留内容,触发后逐字重建。两者分别控制“何时摘要”和“保留哪些原文”,可以组成时机控制与内容选择两层系统。
- 与 CompactionRL:CompactionRL 通过 actor–critic 与跨 segment GAE 联合学习摘要和执行,换取更高训练成本;LRE 固定 host model,只学习轻量历史排序器。该对照区分了压缩策略学习与完整智能体策略学习。
- 与 SmoothAgent:SmoothAgent 预测 context transformation 的执行时机并异步预建变换后 KV cache;LRE 决定变换结果应包含哪些历史单元。前者优化 transformation 的关键路径延迟,后者优化内容选择,机制互补。
- 与 FlashMemory:FlashMemory 在模型内部预测未来需要驻留 GPU 的 KV chunks,减少物理 KV footprint;LRE 在模型外部选择消息或步骤并重新构造 prompt。两者分别作用于内容层历史和表示层 KV,可以联合,但论文没有测试组合收益。
主要启发
以下三点由用户在本次讨论中提出。“承重细节(load-bearing details)”是原文术语;“表面显式线索”和对数学场景的判断属于本地归纳与待验证外推。
1. 原文保真保护的是会改变结果的承重细节
摘要通常优先覆盖主题、计划和主要事件,未来执行所需的 access token、对象 ID 或路径可能只占很少文本。它们对语义概括的贡献较小,遗漏后却会直接改变工具调用结果。原文 Section 5.2 的 AppWorld 个案正好展示了这种不对称:抽象压缩保留了任务计划、对象和 API 信息,同时遗漏精确 token 或逐字歌单并进入循环;LRE 选中笔记内容和登录状态后逐字保留,因而能够继续执行。论文直接验证的是工具调用中的精确执行状态;把同一风险推广到技术文本的参数边界和原句限定条件,属于用户提出的待验证假说。
这项证据支持“先选择高价值单元,再对承重单元保留原文”的设计。它没有要求保存全部原始历史,也没有证明摘要必然损坏精确状态。当前 ACON 与 LRE 的最近窗口分别为一步和五步,个案及汇总结果仍未隔离表示形式本身的贡献;更强的机制检验应固定被选中的单元,只比较逐字保留、普通摘要和带受保护字段的结构化摘要。证据定位:Figure 2、Section 5.2。
2. 简单特征有效的前提是未来效用具有可观测代理
AppWorld 的十维特征直接读取数字、URL 或 ID、代码、错误、大小写词、稀有词和局部重复,训练标签又由标识符后续复用构造。LoCoMo 与 LongMemEval 使用 TF-IDF 加位置、近因性、长度、数字、问句和大写词等轨迹特征;LoCoMo 上仅使用 TF-IDF 的 LRE-content 已取得 0.782 macro-AUC,加入六项轨迹特征后升至 0.829。用户把这类容易从文本形式和日志结构中读取的信号概括为“表面显式线索(surface artifacts)”。论文没有使用这个术语。
这些结果说明,当承重信息会投影为稳定的词汇或结构代理时,特征工程与线性模型可以保存大量未来有用信息。LongMemEval 中内容显著性达到 0.752,高于 LRE-supervised 的 0.708,也说明最有效的浅层代理会随数据组织变化。数学与复杂逻辑场景构成这项判断的待验证边界:论文的实验没有覆盖数学推理;若关键性由跨步骤的定义、引理、约束或不变量依赖决定,且缺少词面复现,现有特征可能失效。此时需要能够表示依赖结构的打分机制,语言模型是一个候选,依赖图、程序分析或更小的学习模型也应进入对照。证据定位:Table 3、Table 6、Section 7。
3. 时间距离不能单独决定历史价值
Figure 2 的 LoCoMo 案例中,第 5 轮身份事实支持 400 多轮后的问题;AppWorld 案例中,第 3 步凭据与第 10 步标识符分别在后续调用中再次成为必要状态。对话实验里的 recency 与 MemoryBank 排序在 LoCoMo 上只有 0.478 macro-AUC,在 LongMemEval 上为 0.527,接近随机排序。LRE 在 AppWorld 中仍无条件保留最近五步,再从更早历史中选择高分单元,因此它采用的是近期工作窗口与远端状态选择相结合的设计。
LoCoMo 的问题设置会主动查询跨 session 的旧事实,因此它可能放大远距离依赖;AppWorld 的精确状态案例提供了另一种任务形态下的局部支持。跨域结论仍需按依赖距离分桶,并分别测量身份事实、工具状态和隐含推理前提的保留率。当前最稳妥的系统原则是把时间位置作为一个候选特征,同时让后续复用或任务依赖决定是否长期保留。证据定位:Figure 2、Section 5.3。