202607.1328-towards-long-horizon-agents-survey
Towards Long Horizon Agents: A Survey
这篇综述将长程智能体刻画为基础策略与运行时 harness 的耦合系统,再用 H1/H2/H3 任务层级和“外部 harness—内部优化”双支柱统一 context、memory、tool、orchestration、verification、agentic RL、OPD 与 self-evolution;它提供了一套覆盖面广、可用于系统定位的概念地图,证据边界集中在检索协议、分类一致性、因果归因、跨领域评测与同行评审均尚未完备。
Source
- Workflow version: v2.1
- Material type: survey
- Analysis modules: survey, theory, docs
- Canonical source: OpenReview forum
- Title: Towards Long-Horizon Agents: A Survey
- Authors: Guanting Dong, Xiaoshuai Song, Yuyang Hu, Jiajie Jin, Chenghao Zhang, Yifei Chen, Xiaoxi Li, Huaying Yuan, Xinyu Yang, Tongyu Wen, Jiejun Tan, Hongjin Qian, Shijue Huang, Junting Lu, Zhenyu Li, Wanjun Zhong, Yutao Zhu, Tat-Seng Chua, Zhicheng Dou, Ji-Rong Wen
- Responsible organization: Renmin University of China; Peking University; Tsinghua University; Sun Yat-Sen University; Hong Kong University of Science and Technology; National University of Singapore
- Preprints.org: manuscript 202607.1328 v1
- DOI: 10.20944/preprints202607.1328.v1
- PDF: OpenReview PDF;GitHub PDF
- Code/Project: RUC-NLPIR/Awesome-Long-Horizon-Agents;project website
- OpenReview / Review page: OpenReview Archive direct upload;API v2 当前只返回 submission Note。
- Submitted: 2026-07-16(OpenReview
pdate);公开 Note 创建于 2026-07-17 04:12 UTC - Published / updated: Preprints.org v1,2026年7月;项目仓库快照更新至 2026-07-17
- Current version read: OpenReview / GitHub PDF,149 页,PDF metadata 创建时间 2026-07-16 19:15 UTC
- Version / revision read: Preprints v1;OpenReview Note version 2;GitHub commit
9433a85f1ae812edb1e0b8b03668861c2867f3c0(2026-07-17 19:21 +08:00) - Accessed: 2026-07-18
- Key figure decision: include
- Review status: page-type=metadata-only; match-confidence=high; observed-at=2026-07-18; venue-status=OpenReview Archive direct upload / Preprints v1,未发现公开 review、rebuttal、meta-review 或 decision
- Subjects: long-horizon agents; runtime harness; context and memory; tool use; agent orchestration; verification; agentic reinforcement learning; on-policy distillation; self-evolution; agent evaluation
作者与关系
- Guanting Dong: Renmin University of China.
- Xiaoshuai Song: Renmin University of China.
- Yuyang Hu: Renmin University of China.
- Jiajie Jin: Renmin University of China.
- Chenghao Zhang: Renmin University of China.
- Yifei Chen: Renmin University of China.
- Xiaoxi Li: Renmin University of China.
- Huaying Yuan: Renmin University of China.
- Xinyu Yang: Renmin University of China.
- Tongyu Wen: Renmin University of China.
- Jiejun Tan: Renmin University of China.
- Hongjin Qian: Peking University.
- Shijue Huang: Hong Kong University of Science and Technology.
- Junting Lu: Peking University.
- Zhenyu Li: Tsinghua University.
- Wanjun Zhong: Sun Yat-Sen University.
- Yutao Zhu: Renmin University of China.
- Tat-Seng Chua: National University of Singapore.
- Zhicheng Dou: Renmin University of China.
- Ji-Rong Wen: Renmin University of China.
论文由 RUC GSAI / NLPIR 团队主导,14 位作者来自 RUC,另外五个机构各形成一条跨机构连接。标题页将前五位作者标为 Core Contributors,将 Zhicheng Dou 标为通讯作者。项目仓库在所读 commit 上共有 203 个 commits;git shortlog 显示 Jiajie Jin 对应的 ignorejjj 为 138 个、Guanting Dong 对应的 KABI 为 37 个、Xiaoshuai Song 为 8 个、Yuyang Hu 对应的 namespace-ERI 为 5 个,说明论文框架与动态阅读清单由核心贡献者持续共同维护。本文的 RUC 作者 Xinyu Yang 与已存档 ThunderAgent 的 CMU 同名作者属于不同身份。
Ji-Rong Wen 也参与了 LLM-in-Sandbox,把 RUC 的通用 computer environment 研究与本篇 harness / application taxonomy 连接起来。Guanting Dong、Xiaoshuai Song、Yuyang Hu、Jiajie Jin、Chenghao Zhang 与 Zhicheng Dou 的公开主页、机构页、项目贡献或学术档案共同指向 RUC agent / information retrieval 研究线。
阅读目标与判断边界
本笔记关注四个问题:
- 论文如何定义 long horizon,以及逻辑依赖、运行时间、上下文长度、自治程度和自进化之间的边界。
能否为 agent 能力归因提供稳定的系统边界。 - H1/H2/H3、外部 harness 和内部优化如何组成可操作的设计空间。
- 149 页正文、906 条编号参考文献与动态 Awesome List 能支持多强的覆盖与趋势判断。
判断边界:
- 本文是 narrative survey、taxonomy 与 position synthesis,没有提出新 agent 算法、统一复现实验或受控消融。
- H1/H2/H3 是操作性层级,context boundary 用作依赖负担的代理变量;分钟、小时、天和 lifelong 只描述当前系统的常见尺度。
- METR 时间趋势是对公开 live estimates 的二次拟合,使用软件工程、机器学习工程和 computer-use 类任务,且历史序列拼接了 TH1.0 与 TH1.1。
- PDF 是 2026-07-16 的固定快照,GitHub README 持续更新;论文论述、参考文献和动态清单可能逐步分叉。
- OpenReview 当前是 Archive direct upload,公开页面没有 reviewer comments、评分、rebuttal、meta-review 或 decision。
论文脉络
1. 研究问题、背景和价值
近期 agent 已经能够持续执行搜索、软件工程、computer use 和多模态任务。常见能力报告使用 token 数、上下文窗口、运行时长或自治程度描述“long horizon”,这些量难以解释系统为何成功,也难以区分改进来自基础模型、prompt、memory、工具、workflow、verifier 还是训练数据。
论文把问题收敛为“多步决策之间的耦合依赖”。一个任务需要反复执行规划、动作、观察和修订,并让早期状态持续影响后续决策时,它形成长程依赖。运行时间和 token 数提供观测尺度,依赖结构与反馈闭环决定任务性质。这一定义允许两类边界案例进入同一语言:运行数天的独立批处理逻辑耦合较弱;单个 context 内的复杂交互任务也可能具有密集长程依赖。
长程执行的主要困难被归纳为三组:目标漂移与误差累积、context rot 与窗口压力、稀疏延迟反馈与不可逆动作。它们分别推动 workflow / verification、context / memory、credit assignment / governance 的系统设计。
2. 已有解决方案与不足
相关综述通常围绕 memory、context engineering、agent harness、self-evolution 或 agentic RL 展开。单一组件的视角能够深入机制,但很难回答完整 agent system 的能力放置问题。产品系统和论文还会同时改变 model、prompt、tool、memory、budget 与 evaluation protocol,最终得分缺少可分解的归因。
术语也承载不同问题:
- long-running 描述执行持续时间与恢复机制;
- autonomy 描述人类参与和权限边界;
- self-evolution 描述经验是否持续改变未来系统;
- long-horizon 描述耦合决策能否在反馈中维持一致状态并完成任务。
本文希望用一个 model–harness 系统对象容纳这些相邻概念,再把研究进展按能力位于 runtime 还是 weights 进行组织。
3. 作者可能的思考路径
以下为本地重建。作者很可能从现代 agent 产品的工程结构出发:同一个 foundation model 接入不同 tool、memory、workflow、hooks 和 verifier 后,长程任务能力会显著变化。只用模型参数解释结果会丢失运行时结构,于是先把 deployed agent 写成
第二步是处理 horizon 的定义。时长容易测量,却会把批处理和耦合决策混在一起;逻辑依赖更接近任务本质,却缺少统一可观测量。作者因此使用 context boundary 作为 operational proxy,并从单窗口、跨窗口/会话扩展到跨任务经验。
第三步是把能力变化写成双向迁移。工程团队常先在 harness 中快速实现 memory、search、verification 或 workflow,成熟轨迹再进入训练;更强的 policy 又能支撑更开放的工具和更复杂的 harness。这个观察形成 externalized harness 与 internalized optimization 的 co-evolution 叙事。
4. 核心假设或切入点
论文依赖五项核心判断:
- 长程难度主要来自耦合决策与持续反馈,elapsed time 和 token count 只提供间接观测。
- 部署能力属于 policy 与 harness 的联合属性,单独报告 base model 难以覆盖真实 agent system。
- context boundary 能近似标记状态持久化难度,并支持 H1/H2/H3 的嵌套层级。
- 外部 scaffolding 与参数内部能力之间存在反复迁移,二者共同决定能力上限与迭代速度。
- agent–environment interface 的反馈结构比应用名称更能解释长程系统需要哪些机制。
第 1、2 项能直接改善概念和报告口径;第 3 项依赖模型窗口、memory API 和系统架构;第 4 项是跨文献综合形成的研究命题;第 5 项适合作为应用比较轴,仍需要统一 benchmark 验证。
5. 方法 / 系统 / 理论框架
5.1 部署对象:基础策略与 harness 的运行时耦合
论文将长程 agent 写成:
在环境中,harness 从历史构造当前 contextual signal:
环境按
这个公式适合定义 deployed system boundary。它暂时没有提供可识别的因果分解:更换 prompt、model、tool schema、memory policy、verifier 或 budget 都会改变
5.2 H1/H2/H3:按状态需要跨越的边界分层
| 任务层级 | 操作性范围 | 主要新增失败模式 | 对应能力 |
|---|---|---|---|
| H1:Intra-context | 单个工作窗口,常见为分钟级 | 多个耦合步骤中的误差累积与方向偏移 | C1:持续交互推理、反馈吸收、局部验证与恢复 |
| H2:Cross-context | 跨窗口、会话或 agent,常见为小时到天 | 完整历史不可见,handoff、压缩和恢复会丢失状态 | C2:外部状态、memory、checkpoint、context reconstruction 与 faithful resume |
| H3:Cross-task | 开放任务流,时间尺度可延伸到长期运行 | 目标、环境和数据分布变化,单次经验无法自动转为持续能力 | C3:跨任务经验积累、skill reuse、continual learning 与系统更新 |
作者给出
5.3 三阶段演进:控制面逐步外扩
论文将近期演进概括为:
- Prompt engineering(2020–2023):主要控制信号位于一次模型调用的指令和 reasoning pattern。
- Context engineering(2023–2025):RAG、GraphRAG、摘要和 memory 让系统主动选择、重组和压缩输入状态。
- Runtime harness(2025–present):控制面扩展到 workflow、tool execution、orchestration、hooks、middleware、verification 和权限边界。
这个时间轴表达的是主导控制面扩张。三个阶段在当前系统中同时存在,后续机制继续依赖 prompt 和 context;年份适合表示趋势,无法作为互斥分期。
5.4 双支柱:Externalized Harness 与 Internalized Optimization
| 支柱 | 论文分类 | 主要控制变量 | 典型反馈周期 |
|---|---|---|---|
| Externalized harness | loops/workflows;context/memory;tools/MCP/skills;orchestration;hooks/middleware;verification | runtime state、action routing、tool permissions、checkpoint、verifier 与 recovery policy | 每 step、每 trajectory 或部署迭代 |
| Internalized optimization | architecture;data/environment synthesis;pre/mid-training;fine-tuning;agentic RL;OPD;self-evolution | representations、policy distribution、training data、reward、credit assignment 与持久能力 | 训练 run、模型版本或跨任务更新 |

assets/landscape.png.这套分类的核心价值是 capability placement。相同能力可以先由外部组件提供,再经数据或 distillation 写入模型;模型增强后也可能把更复杂的状态管理和工具组合交回 runtime。实际系统可以用三个问题定位每项能力:状态存在哪里、反馈由谁生成、更新影响当前轨迹还是未来任务。
5.5 应用与前沿:按交互接口组织
论文用五种 agent–environment interface 组织应用:software engineering、information seeking、computer use、multimodal agents、general-purpose agents。这个选择可进一步解释为不同反馈结构:
| 应用接口 | 可观测状态与反馈 | 长程系统重点 |
|---|---|---|
| 软件工程 | repository、compiler、tests、runtime logs,存在较强 executable oracle | 状态恢复、分支规划、测试驱动 repair、不可逆修改控制 |
| 信息搜索 | 页面与证据不断出现,最终 synthesis 的正确性较难自动验证 | provenance、去重、coverage、source quality 与长链引用一致性 |
| Computer use | GUI observation 部分可见,动作具有延迟和副作用 | grounding、state tracking、permission gate 与 recovery |
| 多模态 | observation 成本高,反馈稀疏且语义异构 | modality selection、压缩、跨模态记忆与预算控制 |
| 通用 agent | tool、任务和环境不断切换 | protocol generalization、skill transfer、统一 governance 与 mixed feedback |
Frontier 再按 evolution、effectiveness、efficiency、trustworthiness 四条轴展开九个方向:self-evolving harness/agents、harness transfer、lifelong learning、real-world interaction、digital-to-embodied、cost-aware agency、omni harness、error robustness、safety/governance。
5.6 本地统一视图:能力放置矩阵
为了把 taxonomy 转成工程判断,可以将每项能力放入“时间跨度 × 更新位置”矩阵:
| 当前 context / trajectory | 跨 context / session | 跨 task / model version | |
|---|---|---|---|
| Harness state | scratchpad、tool result、local verifier | memory、checkpoint、artifact、handoff state | skill library、workflow template、policy/config version |
| Model state | in-context reasoning | learned retrieval/compression habit | fine-tuning、agentic RL、OPD、continual learning |
| Evaluation | step/terminal correctness | resume fidelity、state consistency、cost | retention、transfer、safety delta、capability attribution |
这个矩阵将 H1/H2/H3 与
6. 结论链条
论文主线可以压缩为:
- 长程任务由多步决策间的逻辑耦合和持续反馈定义。
- 完成这类任务的部署对象包含基础策略与 runtime harness。
- 任务依赖跨越 context、session 和 task stream 时,能力需求由 C1 累积到 C3。
- 工程能力可以外置到 harness,也可以经训练内化到 policy;长期进展来自二者的联动。
- 应用差异可由 agent–environment interface 和 feedback structure 解释。
- 随 horizon 增长,transfer、cost、error robustness、permissions 和 governance 成为共同约束。
第 1–3 步形成清楚的概念框架;第 4 步是跨文献综合命题;第 5 步提供应用导航;第 6 步构成研究议程。全文缺少统一实验来证明这套分类对预测成功率、选择架构或归因增益具有额外效度。
关键实验/定理
本文没有新模型实验或形式定理。以下结果记录定义、二次数据分析、文献覆盖和版本化资产。
结果 1:H1/H2/H3 将逻辑依赖映射到三类状态边界
- 设置:论文 §2.1–2.2 将 agent 放入 POMDP,并按执行是否跨越单个 context、多个 context/session、多个 task 划分层级。
- 指标:dependency coupling、state persistence boundary、required capability。
- 结果:H1 对应 C1 interactive reasoning;H2 增加 C2 cross-context state/memory;H3 增加 C3 cross-task experience accumulation。时间范围被明确标为 descriptive range。
- 假设:context boundary 能够代理状态持久化难度;能力需求按 C1→C2→C3 累积。
- 适用域:需要多步环境反馈、历史状态与 side effects 的 agent task。
- 纳入范围:定义综合自 agent、memory、context engineering、self-evolution 与长程评测文献。
- 证据定位:§2.1,Equation 1;§2.2,Figure 3,pp. 7–11。
- 支持的最窄结论:这套层级能区分单窗口交互、跨窗口状态和跨任务经验三类工程压力。
- 解读:它是有用的 operational vocabulary。层级嵌套和边界尚未经过独立标注一致性、预测效度或跨 benchmark 校准。
结果 2:METR time horizon 二次拟合显示 frontier proxy 快速增长
- 设置:作者使用 METR live dashboard 截至 2026-05-08 的 50%-task-completion time horizon;完整历史拼接早期 TH1.0 与后期 TH1.1,2023 年后子集使用 TH1.1。
- 指标:模型能够以 50% 预测成功率完成的任务,其人类专家完成时长;指数拟合 doubling time
。 - 结果:完整期拟合
天(6.5 个月);2023 年后拟合 天(4.3 个月)。图中最高区域约为 16 小时,METR 对该边界附近估计标记较高不确定性。 - 假设:release date 与 time horizon 可用单一指数关系近似;所选 frontier models 和软件类任务能代表趋势。
- 适用域:METR 当前自动评分的软件工程、机器学习工程和 computer-use 任务。
- 证据定位:§2.3,Figure 4,Equation 2,pp. 11–12;METR time-horizon dashboard。
- 支持的最窄结论:在 METR 的特定任务和版本口径下,frontier agent 的可靠可完成任务时长显著增长。
- 解读:两段拟合无法单独证明增长速度已经因果性加速,也无法识别增益来自 model、harness、benchmark coverage 或两者共同变化。
结果 3:论文与 Awesome List 提供大规模、可定位的阅读快照
- 设置:本地复核 GitHub PDF、提取后的 bibliography 和 README;仓库固定在 commit
9433a85f1ae812edb1e0b8b03668861c2867f3c0。 - 指标:PDF 页数、编号参考文献、README list entries、显式 paper links 与 URL 去重。
- 结果:PDF 共 149 页、906 条编号参考文献;README 有 762 个章节列表项、716 次显式
paper链接、682 个唯一 paper URL,重复出现 34 次。列表项还包含文档、规范、产品与项目资源,不能将 762 直接解释为唯一论文数。 - 适用版本:GitHub HEAD
9433a85f1ae812edb1e0b8b03668861c2867f3c0,2026-07-17 19:21 +08:00,共 203 commits。 - 纳入范围:正文声明同时使用 indexed publications、official documentation、open-source implementations 与 emerging specifications。
- 证据定位:PDF pp. 76–149(bibliography);GitHub commit snapshot 中的
README.md;commit9433a85f1ae812edb1e0b8b03668861c2867f3c0。 - 支持的最窄结论:作者提供了一个覆盖六大视角、可沿章节定位、仍在持续维护的广泛阅读入口。
- 解读:条目规模支持 breadth 与导航价值;完整性、去重规则、质量筛选和引用偏差仍缺少可复现协议。
结果 4:六视角 taxonomy 覆盖 build、deploy、evaluate 与 research agenda
- 设置:Figure 2 将研究组织为 Foundation、Evolution、Harness、Optimization、Application、Frontier;正文按相同结构展开。
- 指标:分类对象、组件覆盖、application interface 与 frontier axis。
- 结果:Harness 含六类 runtime components,Optimization 含七类训练/架构环节,Application 含五种接口和 benchmark/resources,Frontier 含四轴九方向。
- 假设:能力放置和 agent–environment interface 是稳定的主分类轴。
- 适用域:LLM-centric long-horizon agents;一般 ML platform infrastructure 仅在影响长轨迹时纳入。
- 证据定位:Figures 1–2;§§3–7,pp. 15–74。
- 支持的最窄结论:taxonomy 能覆盖从 runtime system 到 model training、应用接口与开放问题的主要设计位置。
- 解读:同一工作可能跨多个叶节点,论文没有披露 multi-label rule、annotator 数量、冲突解决或 inter-rater agreement。这套结构适合作为多视图地图。
综述纳入与可复现性审计
| 维度 | 观察 |
|---|---|
| 目标范围 | 聚焦影响 long-horizon competence 的 agent runtime、model optimization、应用与评测。 |
| 明示排除 | 一般 LLM agent 全景、通用 ML platform infrastructure,以及与长轨迹无直接关系的 inference / architecture 工作。 |
| 来源类型 | indexed papers、preprints、official docs、open-source implementation、specification、project website。 |
| 检索数据库与查询式 | 未披露。 |
| 检索截止时间 | 未给出统一截止日期;METR 数据单独标记访问于 2026-05-08,PDF metadata 为 2026-07-16。 |
| 纳入 / 排除标准 | 只给出主题边界,没有逐条 screening criteria、质量门槛或版本选择规则。 |
| 去重与多标签 | 未披露;README 的唯一 paper URL 少于链接出现次数,反映跨章节复用。 |
| 分类标注流程 | 未披露 annotator、coding guide、冲突处理和一致性统计。 |
| 证据质量评估 | 没有按同行评审状态、实证强度、代码可用性或复现情况分层。 |
| 更新机制 | GitHub README 可持续更新;PDF、Preprints v1 与 OpenReview Note 是固定公开版本。 |
| 可复现资产 | PDF、README、commit history 可访问;没有 scripted literature search、machine-readable inclusion table 或分类数据集。 |
证据链强度评估
强证据
明确区分 base policy 与 deployed runtime,能够避免将 prompt、tool、memory 和 verifier 增益全部归入模型参数。 - H1/H2/H3 将 interactive reasoning、跨 context state 和跨 task experience 分开,直接对应三类工程故障与状态持久化需求。
- 149 页正文、906 条参考文献、公开 README 和 commit history 提供高密度、可追溯的阅读入口。
- 软件工程、搜索、GUI、多模态与通用 agent 的 interface 差异能解释 verifier strength、observability、side effects 和 recovery requirements。
中等强度证据
- prompt→context→runtime harness 的时间线与近年系统形态一致,年份划分来自叙事综合。
- capability 在 harness 与 weights 间迁移是合理的工程模式,当前材料没有提供统一 longitudinal dataset 验证其普遍性。
- METR 数据支持软件类 frontier task horizon 快速增长,跨领域、跨评测版本和 ceiling 附近的外推需要保留不确定性。
需要谨慎的推论
- H1/H2/H3 的嵌套关系来自概念设计,尚无证据证明 context boundary 是跨系统稳定的难度尺度。
定义了系统对象,尚未给出 attribution protocol;模型、harness、budget 与 benchmark 同时改变时仍会混杂。 - 906 条引用和 682 个唯一 paper URL表达 breadth,无法直接给出 coverage rate、质量或无偏性。
- “co-evolution”是本文的统一解释框架,当前证据更接近案例归纳与设计经验。
- safety/governance 被放在 frontier 中,同时也是当前部署的必要约束;论文缺少统一 threat model、权限分级和风险量化实验。
局限
- 文献检索缺少数据库、查询式、时间窗口、screening、质量评估和编码一致性,系统性覆盖主张无法复算。
- 分类同时使用时间阶段、组件、训练环节、应用接口和研究目标,多轴结构适合导航,难以形成互斥 taxonomy。
- context boundary 受 context length、external memory、agent protocol 和 task packaging 影响,H1/H2 边界会随实现变化。
- H3 将 open-ended task stream、skill accumulation、continual learning 与 self-evolution 放入相邻区域,持久变化的对象和验证周期仍需细分。
- 部署公式没有提供组件级因果归因、成本归一化或同预算比较协议。
- METR 二次拟合覆盖特定软件类任务,历史版本拼接、16 小时 ceiling 和模型选择限制精确斜率与跨领域外推。
- 论文混合同行评审论文、preprint、产品文档、GitHub、协议与网页材料,引用条目的证据责任和稳定性差异较大。
- PDF 与动态 README 的更新时间不同,新增工作可能只进入列表,taxonomy 论述和 reference numbering 会滞后。
- OpenReview 当前没有公开同行评审内容,本文的定义、覆盖与趋势判断仍需后续独立审阅和版本更新。
跨论文关系
- 作者与机构关系:Ji-Rong Wen 同时参与 LLM-in-Sandbox 与本篇综述;前者是通用 computer environment 的具体系统证据,后者把它放入 tools/environment/application 的广义 harness 版图。RUC GSAI / NLPIR 团队构成本篇的主要组织中心,并通过 PKU、Tsinghua、SYSU、HKUST、NUS 扩展到 memory、search、multimodal 与 agent optimization 研究线。
- 与 Self-Improving Agents 的概念关系:Self-Improving Agents 用 trace-to-capability 和 skills/memory/environment/model/meta-layer 描述经验如何改变系统;本篇将 self-evolution 放在 H3/C3 和 internalized optimization 中。前者细化“更新写到哪里”,本篇细化“任务依赖跨越什么边界、部署能力位于 policy 还是 harness”。
- 与 context/memory 系统的关系:SelfCompact 与 SmoothAgent 分别从 policy 侧的 trajectory summary 和 serving runtime 侧的异步 transform/KV cache 处理 C2 问题。它们把本篇 H2 的压缩与恢复要求落实到两个系统位置。
- 与 agentic environment 的关系:LLM-in-Sandbox 提供可执行计算机接口;Agentic RL 的可学习环境演进 进一步区分真实沙箱、可执行环境生成与学习型转移。它们为本文 Optimization §5.2 和真实交互前沿提供更细的环境真实性与 sim-to-real 判断轴。
- 与训练路线的关系:GKD 是本文 OPD 分类的代表性起点;SDFT 把同模型 teacher 与 continual retention 接入跨任务更新;Credit Assignment Survey 细化本文 §5.5 中被压缩处理的 token/step/turn/trajectory 归因问题。
- 与 agent serving 的关系:ThunderAgent 把 phase、tool wait 和 KV working set 编入服务系统。它说明
还会延伸到 serving scheduler 与 resource state;本文只在 inference/runtime 明显影响长轨迹时纳入这类基础设施。
本地讨论补充
1. 最实用的检查单位是“边界穿越”
阅读或设计一个 long-horizon agent 时,可以先判断轨迹需要穿越哪些边界:model call、context window、process、session、agent、task、model version。每次跨越都要明确 state serialization、resume invariant、feedback provenance、permission 与 rollback。H1/H2/H3 提供粗粒度分组,边界穿越清单给出更细的工程验收条件。
2. 能力归因需要固定四组变量
比较
若一次实验同时升级模型、memory、tool、token budget 和 verifier,最终成功率只能归属于整个 deployed system。组件归因需要逐项消融、相同任务快照、相同权限、相同预算,以及错误类型与成本分解。
3. H3 需要单独衡量经验是否稳定转移
H3 的关键指标应覆盖 forward transfer、retention、negative transfer、update cost、safety delta 和 provenance。完成更多独立任务只说明任务吞吐;经验被验证、写入稳定状态、在后续分布中复用,并保持旧能力和权限边界,才能支持 C3 主张。
4. 动态 Awesome List 适合发现工作,固定论文适合引用判断
README 的更新速度高于 PDF,适合追踪新项目和工程文档。需要复验 taxonomy、引用编号或统计时,应固定 commit 和 PDF version。后续版本可同时发布 machine-readable bibliography、section tags、source type、peer-review status 与 inclusion date,降低 900 余条材料的版本漂移。
主要启发
- 报告 agent 能力时同时写明 base model、harness、environment、verifier、权限与预算。
- 将 long horizon 表达为依赖边界和状态持久化需求,运行时长作为补充指标。
- 为 H2 系统测试 checkpoint/resume fidelity、summary loss、tool side-effect recovery 与 cross-agent handoff。
- 为 H3 系统测试经验 admission、retention、negative transfer、safety regression 与可撤销更新。
- 将 harness 视为主要的权限、可观测性和恢复控制面;model-side alignment 与 runtime governance 需要共同验证。
- 使用 Awesome List 进行探索时固定 commit;形成研究结论时回到论文、代码、评测和正式审稿来源。