← 研究主线

用户定义研究主线

Agentic RL 的可学习环境演进

Agentic RL 的环境供给如何从可执行沙箱发展到可训练、可校准的环境模型,各类方案分别替代真实交互的哪一部分?

材料窗口 检索截止 2026-07-22 17:20 CST
待审阅 主线综合 SOP Started 2026-07-13 16:59 Updated 2026-07-22 17:20 22 项材料
环境角色状态权威转移权威奖励权威真实数据校准闭环

检索与纳入协议

检索围绕 agent world modellearned environmentexperience modelenvironment synthesistool simulatorweb world modelsoftware engineering surrogateagentic reinforcement learning 展开。核心集合纳入直接改变语言 Agent 训练环境供给方式的原始工作:模型生成动作后的观测或反馈;程序化生成可执行、有状态环境;把世界模型内化为规划或训练信号。统一沙箱、评测环境和 rollout 系统只在它们建立后续方法所依赖的状态、复位与验证契约时纳入演进脉络。

语言 Agent 是本文的任务边界,覆盖 Web、工具调用、GUI、软件工程与多轮用户交互。连续控制、机器人和自动驾驶中的传统 model-based RL 仅在术语核验时检索,不进入比较表;例如 Learning Task-Sufficient World Models 研究连续控制中的任务充分世界模型,因任务和环境接口不同而排除。Agentic World Modeling 作为分类框架的交叉核验材料使用,不替代原始方法证据。每次更新记录检索截止时间、纳入的新材料和明确排除项。

综合判断

Agentic RL 的环境供给形成了五种可组合角色:可执行基础环境保存真实状态并提供验证;局部模拟器生成用户、页面或开放式反馈;学习型环境代理真实状态转移;环境生成系统批量构造可执行任务;内部世界模型把后果预测写入 Agent 的规划或表示。2024 年的统一接口与有状态评测建立了状态隔离、复位和终态验证,2025 年的模拟轨迹开始进入训练数据面,2026 年的专用环境模型进一步覆盖软件工程、Web 和多领域工具交互。

当前证据支持混合闭环。真实环境提供状态与奖励锚点,学习型环境扩大低成本 rollout 和课程覆盖,抽样真实执行负责发现分布偏移并刷新环境模型。完全移除真实交互需要同时证明长程状态一致性、奖励独立性、面对新策略时的稳健性和持续更新能力;现有工作通常只覆盖其中一部分。

核心问题与边界

环境供给为何成为训练约束

Agent 在数学推理任务中可能只需要答案验证器。进入浏览器、代码仓库和业务工具后,一次 rollout 同时依赖文件系统、数据库、依赖、权限、用户回复、网络内容和终态检查。训练成本由任务数、每个任务的采样数、轨迹长度、复位成本和环境响应成本共同决定。策略持续更新还会改变访问的状态分布,使固定离线轨迹很快偏离当前策略。

本文所说的“可学习环境”包含两层含义。外部 learned environment 直接近似动作后的观测、奖励或终止信号;内部 world model 学习动作后果,用于规划、表示或辅助奖励。环境生成系统输出程序、数据库与任务规格,实际转移仍由程序执行。三者都能扩大经验供给,误差来源和可验证性存在明显差异。

本文保留的判断边界

  • 跨论文分数不作横向排名。模型规模、任务集合、Agent scaffold、训练预算和验证器均不一致。
  • “模拟准确”至少包含格式合法、局部转移正确、隐藏状态一致、长程一致、奖励正确和面对策略探索时的稳健性。
  • learned environment 的成本优势主要指低边际复制与 rollout 成本;真实轨迹收集、模型训练、抽样审计和重新校准仍计入总成本。
  • 论文摘要或项目页中的生产部署陈述按作者证据处理;公开代码、同预算对照和独立复验提供更强支持。

分类框架

五类环境角色

角色 动作后的响应来源 主要用途 典型失效
可执行基础环境 浏览器、数据库、容器、测试或真实 API 保存状态、执行高风险动作、提供可复查奖励 构建、复位、并发与外部服务成本高
局部模拟器 LLM 用户、页面描述或工具返回模型 扩展交互分支,减少人工和 API 调用 隐藏状态丢失,模型同时生成结果与评价
学习型环境 从真实交互训练的状态转移模型 低成本复制环境并生成训练轨迹 多步误差累积,策略利用模型偏差
可执行环境生成 自动生成程序、数据库、工具与任务 扩大任务和环境分布,保留程序验证 生成分布和真实业务分布存在差距
内部世界模型 Agent 内部的后果预测表示或生成器 规划、表征学习、辅助奖励与预训练 外部执行成本仍在,预测能力难以单独度量

三类权威与一个闭环

一个环境方案可以写成“环境角色 × 状态权威 × 转移权威 × 奖励权威 × 校准闭环”。

  • 状态权威回答 canonical state 存在哪里。数据库、文件系统、虚拟机快照和版本化结构状态提供强锚点;只保留自然语言历史时,隐藏状态更容易丢失。
  • 转移权威回答谁决定下一状态。程序执行具有明确语义;从真实 transition 训练并持续校准的模型提供可扩展近似;通用 LLM 按常识补全的约束最弱。
  • 奖励权威回答谁判断任务完成。单元测试、数据库目标状态和规则验证器可复查性较高;环境模型同时生成结果与评分时,共同偏差会影响训练。
  • 校准闭环回答新策略访问的新状态如何回流。on-policy 真实抽检、replay 刷新、版本化快照和不确定性门控共同决定模拟器能否长期使用。

这一框架允许 Docker、程序生成和 learned environment 出现在同一条轨迹中。容器负责状态隔离,模型负责低风险反馈,规则或测试负责奖励,真实执行抽检用于更新模型。

演进脉络

2024:统一接口、有状态模拟与终态验证

AgentGym 把多类环境封装为统一的创建、观测、执行和复位接口;τ\tau-bench 将用户模拟器、领域 API、政策约束和数据库终态检查放入多轮任务;ToolSandbox 加入有状态工具、隐式状态依赖和中间里程碑。它们的转移仍主要来自程序和数据库,LLM 承担用户侧动态。后续学习型环境沿用了这套契约:轨迹状态需要隔离,动作效果需要可追踪,复位需要可靠,奖励需要落到可检查状态。

WebDreamer 让语言模型预测候选 Web 动作的结果,再把选中的动作交给真实网站执行。世界模型在这一阶段承担推理期预演,真实环境继续保存状态并执行最终动作。

2025:模拟轨迹进入训练数据面

WebEvolver 同时使用虚拟 Web server 与推理期前瞻,生成合成轨迹参与自改进;论文对模拟深度的分析显示,多步质量会随深度增加而下降。MUA-RL 将用户模拟接入多轮工具 RL,使用户能够补充私有信息和回应澄清。CodeGym 从代码问题构造可执行工具,继续依靠代码执行验证状态和奖励。

UI-Simulator 生成结构化 UI 状态、转移和训练轨迹;DreamGym 把 reasoning-based experience model、真实数据初始化的 replay 与自适应课程组合起来,直接用合成 transition 收集 RL rollout。环境模型由推理辅助组件进入训练经验服务。

2026 年初:学习型转移与可执行生成并行发展

Computer Environments 以容器、文件系统、shell 和网络建立通用可执行底座。SYNTHAGENT 联合生成任务、用户私有信息、模拟工具与评分标准。SWE-World 从真实软件工程交互训练环境代理,预测中间执行结果和测试反馈,直接服务免容器训练。Agent World Model 批量生成代码、数据库和工具组成的可执行环境,保持状态与奖励可检查。

WebWorld 用大规模真实 Web 轨迹训练长程、多格式世界模型;CM2 组合工具模拟与学习型检查表奖励。这一阶段把环境规模与环境真实性拆成两个工程目标:程序生成扩大可验证任务分布,学习型代理降低开放式反馈的边际成本。

2026 年中:多领域环境模型与内部化路线

EnvFactory 从真实资源探索并验证有状态工具环境,再生成自然的多轮任务与轨迹,强化可执行生成路线。Qwen-AgentWorld 从覆盖多个领域的真实环境交互训练 language world model,并通过持续预训练、监督微调和强化学习提高模拟质量;模型既可作为外部环境服务,也可用于 Agent 的 world-model warm-up。

Internalizing the Future 代表另一条内部化路线:训练 Agent 预测可能的未来状态并把预测用于规划。它减少外部环境模型作为独立服务的需要,同时仍依赖真实环境完成动作和验证。外部代理与内部后果预测可以共享真实轨迹,承担的系统职责不同。

跨材料比较

材料 环境角色 状态权威 转移权威 奖励权威 校准方式 最窄证据
AgentGym / ToolSandbox 可执行基础环境 + 局部用户模拟 程序与工具状态 程序执行 规则、里程碑与终态 固定环境与任务 统一接口和有状态评测可支撑多环境 Agent 交互
WebDreamer 推理期局部模拟 真实网站 LLM 预演后真实执行 真实任务评价 每步返回真实网站 自然语言后果预测可用于动作选择
WebEvolver 学习型 Web 环境 模拟历史与部分真实状态 world model 任务评价 真实数据初始化与有限深度分析 合成轨迹能参与自改进,多步误差限制有效深度
DreamGym 训练经验模型 replay 状态 reasoning experience model 任务奖励 真实数据初始化与课程更新 learned transition 能直接产生在线训练经验
SWE-World 单域学习型环境 仓库交互轨迹 专用 LLM surrogate 预测测试反馈与真实评测 真实软件工程轨迹训练 软件工程环境可被专用模型近似并用于 RL
Agent World Model / EnvFactory 可执行环境生成 生成的程序与数据库 程序执行 测试、规则与目标状态 生成后执行验证 自动生成能扩大有状态、可验证任务覆盖
WebWorld 大规模学习型环境 轨迹历史 Web world model 任务或模型评价 大规模真实轨迹训练 长程、多格式 Web 转移可被专用模型学习
Qwen-AgentWorld 多领域学习型环境 交互轨迹与模型上下文 language world model 规则与评分标准混合 多领域真实交互、SFT 与 RL 同一环境模型可覆盖多领域并产生 Agent 训练轨迹
Internalizing the Future 内部世界模型 真实环境保存 Agent 内部预测辅助规划 外部任务奖励 真实未来状态监督 后果预测可以内化到策略侧,外部执行仍承担验证

比较表刻意分开环境角色与权威来源。SWE-World 和 Qwen-AgentWorld 的主要变化位于转移权威;Agent World Model 与 EnvFactory 保留程序转移;DreamGym 把学习型转移正式接入训练循环;内部化路线改变策略的表示和规划过程。它们可在同一系统中分层组合。

证据强度

结论 强度 直接证据与限制
统一接口、独立状态、可靠复位和终态验证是规模化 Agent RL 的基础契约 多个 2024 环境平台提供公开接口、任务和评测;结论限定在基础设施能力
模型生成的转移能够产生有下游价值的 Agent 训练经验 中强 WebEvolver、DreamGym、SWE-World、WebWorld 和 Qwen-AgentWorld 均报告同设置内增益;任务、模型与预算不可跨论文直接比较
可执行环境生成能扩大任务覆盖并保留可检查状态与奖励 中强 Agent World Model 与 EnvFactory 提供生成、执行和验证链;真实业务分布覆盖仍需外部核验
多领域 learned environment 可以长期替代真实环境 现有结果集中在有限训练期和固定评测,缺少新策略持续探索下的长期漂移、利用偏差和重校准实验
混合真实—模拟闭环优于纯真实或纯模拟方案 多项工作分别支持其中的组件,统一预算下的端到端三方对照仍少,当前判断包含跨材料推断
内部世界模型与外部环境模型可以共享数据并承担不同职责 机制兼容且已有各自实证,联合训练与联合部署的直接比较仍待补全

证据强度按结论评估。单篇论文的高分无法自动提高“完全替代真实环境”这一更宽结论的强度;能够定位状态、转移、奖励和校准来源的实验才直接支持系统级判断。

当前判断

当前更稳健的训练架构由四个参数生命周期相互独立的部分组成:策略负责动作;环境模型从真实 transition 学习并在一个策略更新窗口内冻结;验证器优先使用测试、规则或数据库差分;风险门控根据不确定性、状态新颖度、动作权限和奖励重要性选择模拟或真实执行。真实抽检结果进入 replay 刷新和环境模型重校准。

环境模型的主要价值是把昂贵真实交互前置并摊薄到更多后续 rollout,同时提供可复制的课程和失败分支。真实环境继续承担三个职责:提供 canonical state,发现新策略进入的分布外区域,完成高价值动作和最终验收。模型规模提升有助于局部模拟质量,无法单独解决奖励共同偏差和策略主动利用误差的问题。

内部化路线适合把后果预测变成规划能力,外部 learned environment 适合独立扩展 rollout 服务。可执行环境生成适合需要强状态和奖励语义的任务。选择方案时,应先确定哪一类权威可以近似,再确定哪些动作必须保留真实执行。

开放问题

  1. 如何在策略持续更新时度量 simulator exploitation,并将发现的分布外状态自动送回真实环境采样?
  2. 长程环境质量应如何同时报告单步正确率、状态一致性、奖励正确率和完整任务回报偏差?
  3. 当同一基础模型承担策略、环境和评分时,怎样识别并限制共同偏差?
  4. 可执行生成环境的任务分布如何与真实用户、实时 Web 和组织内部工具保持可量化的一致性?
  5. 外部环境模型与内部世界模型联合训练时,哪些表示可以共享,哪些参数需要隔离?
  6. 峰值并发、环境训练、真实抽检和重校准计入后,混合方案在 GPU 时间、服务成本和完成任务时间上何时占优?

局限

  • 检索以公开英文材料为主,项目更新、撤稿和版本变化可能在截止时间后改变判断。
  • 2026 年多项工作仍处于预印本或项目发布阶段,训练数据、代码和环境实现的开放程度不一致。
  • 跨论文实验的环境、策略、验证器和预算差异较大,本文只比较机制和最窄结论。
  • 机器人与连续控制工作被排除,本文分类框架不能直接替代该领域成熟的 model-based RL 术语和评测。
  • 真实—模拟闭环的建议来自多项局部证据与系统推断,仍缺同一任务、同一预算下的长期统一实验。

更新记录

  • 2026-07-13:根据 Agentic RL learned environment 方向总结请求建立初始综合。
  • 2026-07-22:取得正式主线身份;迁出论文目录,采用独立综合结构;补入内部世界模型路线、排除连续控制材料,并把检索截止更新至 2026-07-22。