用户定义研究主线
Agentic RL 的可学习环境演进
Agentic RL 的环境供给如何从可执行沙箱发展到可训练、可校准的环境模型,各类方案分别替代真实交互的哪一部分?
检索与纳入协议
检索围绕 agent world model、learned environment、experience model、environment synthesis、tool simulator、web world model、software engineering surrogate 与 agentic reinforcement learning 展开。核心集合纳入直接改变语言 Agent 训练环境供给方式的原始工作:模型生成动作后的观测或反馈;程序化生成可执行、有状态环境;把世界模型内化为规划或训练信号。统一沙箱、评测环境和 rollout 系统只在它们建立后续方法所依赖的状态、复位与验证契约时纳入演进脉络。
语言 Agent 是本文的任务边界,覆盖 Web、工具调用、GUI、软件工程与多轮用户交互。连续控制、机器人和自动驾驶中的传统 model-based RL 仅在术语核验时检索,不进入比较表;例如 Learning Task-Sufficient World Models 研究连续控制中的任务充分世界模型,因任务和环境接口不同而排除。Agentic World Modeling 作为分类框架的交叉核验材料使用,不替代原始方法证据。每次更新记录检索截止时间、纳入的新材料和明确排除项。
综合判断
Agentic RL 的环境供给形成了五种可组合角色:可执行基础环境保存真实状态并提供验证;局部模拟器生成用户、页面或开放式反馈;学习型环境代理真实状态转移;环境生成系统批量构造可执行任务;内部世界模型把后果预测写入 Agent 的规划或表示。2024 年的统一接口与有状态评测建立了状态隔离、复位和终态验证,2025 年的模拟轨迹开始进入训练数据面,2026 年的专用环境模型进一步覆盖软件工程、Web 和多领域工具交互。
当前证据支持混合闭环。真实环境提供状态与奖励锚点,学习型环境扩大低成本 rollout 和课程覆盖,抽样真实执行负责发现分布偏移并刷新环境模型。完全移除真实交互需要同时证明长程状态一致性、奖励独立性、面对新策略时的稳健性和持续更新能力;现有工作通常只覆盖其中一部分。
核心问题与边界
环境供给为何成为训练约束
Agent 在数学推理任务中可能只需要答案验证器。进入浏览器、代码仓库和业务工具后,一次 rollout 同时依赖文件系统、数据库、依赖、权限、用户回复、网络内容和终态检查。训练成本由任务数、每个任务的采样数、轨迹长度、复位成本和环境响应成本共同决定。策略持续更新还会改变访问的状态分布,使固定离线轨迹很快偏离当前策略。
本文所说的“可学习环境”包含两层含义。外部 learned environment 直接近似动作后的观测、奖励或终止信号;内部 world model 学习动作后果,用于规划、表示或辅助奖励。环境生成系统输出程序、数据库与任务规格,实际转移仍由程序执行。三者都能扩大经验供给,误差来源和可验证性存在明显差异。
本文保留的判断边界
- 跨论文分数不作横向排名。模型规模、任务集合、Agent scaffold、训练预算和验证器均不一致。
- “模拟准确”至少包含格式合法、局部转移正确、隐藏状态一致、长程一致、奖励正确和面对策略探索时的稳健性。
- learned environment 的成本优势主要指低边际复制与 rollout 成本;真实轨迹收集、模型训练、抽样审计和重新校准仍计入总成本。
- 论文摘要或项目页中的生产部署陈述按作者证据处理;公开代码、同预算对照和独立复验提供更强支持。
分类框架
五类环境角色
| 角色 | 动作后的响应来源 | 主要用途 | 典型失效 |
|---|---|---|---|
| 可执行基础环境 | 浏览器、数据库、容器、测试或真实 API | 保存状态、执行高风险动作、提供可复查奖励 | 构建、复位、并发与外部服务成本高 |
| 局部模拟器 | LLM 用户、页面描述或工具返回模型 | 扩展交互分支,减少人工和 API 调用 | 隐藏状态丢失,模型同时生成结果与评价 |
| 学习型环境 | 从真实交互训练的状态转移模型 | 低成本复制环境并生成训练轨迹 | 多步误差累积,策略利用模型偏差 |
| 可执行环境生成 | 自动生成程序、数据库、工具与任务 | 扩大任务和环境分布,保留程序验证 | 生成分布和真实业务分布存在差距 |
| 内部世界模型 | Agent 内部的后果预测表示或生成器 | 规划、表征学习、辅助奖励与预训练 | 外部执行成本仍在,预测能力难以单独度量 |
三类权威与一个闭环
一个环境方案可以写成“环境角色 × 状态权威 × 转移权威 × 奖励权威 × 校准闭环”。
- 状态权威回答 canonical state 存在哪里。数据库、文件系统、虚拟机快照和版本化结构状态提供强锚点;只保留自然语言历史时,隐藏状态更容易丢失。
- 转移权威回答谁决定下一状态。程序执行具有明确语义;从真实 transition 训练并持续校准的模型提供可扩展近似;通用 LLM 按常识补全的约束最弱。
- 奖励权威回答谁判断任务完成。单元测试、数据库目标状态和规则验证器可复查性较高;环境模型同时生成结果与评分时,共同偏差会影响训练。
- 校准闭环回答新策略访问的新状态如何回流。on-policy 真实抽检、replay 刷新、版本化快照和不确定性门控共同决定模拟器能否长期使用。
这一框架允许 Docker、程序生成和 learned environment 出现在同一条轨迹中。容器负责状态隔离,模型负责低风险反馈,规则或测试负责奖励,真实执行抽检用于更新模型。
演进脉络
2024:统一接口、有状态模拟与终态验证
AgentGym 把多类环境封装为统一的创建、观测、执行和复位接口;
WebDreamer 让语言模型预测候选 Web 动作的结果,再把选中的动作交给真实网站执行。世界模型在这一阶段承担推理期预演,真实环境继续保存状态并执行最终动作。
2025:模拟轨迹进入训练数据面
WebEvolver 同时使用虚拟 Web server 与推理期前瞻,生成合成轨迹参与自改进;论文对模拟深度的分析显示,多步质量会随深度增加而下降。MUA-RL 将用户模拟接入多轮工具 RL,使用户能够补充私有信息和回应澄清。CodeGym 从代码问题构造可执行工具,继续依靠代码执行验证状态和奖励。
UI-Simulator 生成结构化 UI 状态、转移和训练轨迹;DreamGym 把 reasoning-based experience model、真实数据初始化的 replay 与自适应课程组合起来,直接用合成 transition 收集 RL rollout。环境模型由推理辅助组件进入训练经验服务。
2026 年初:学习型转移与可执行生成并行发展
Computer Environments 以容器、文件系统、shell 和网络建立通用可执行底座。SYNTHAGENT 联合生成任务、用户私有信息、模拟工具与评分标准。SWE-World 从真实软件工程交互训练环境代理,预测中间执行结果和测试反馈,直接服务免容器训练。Agent World Model 批量生成代码、数据库和工具组成的可执行环境,保持状态与奖励可检查。
WebWorld 用大规模真实 Web 轨迹训练长程、多格式世界模型;CM2 组合工具模拟与学习型检查表奖励。这一阶段把环境规模与环境真实性拆成两个工程目标:程序生成扩大可验证任务分布,学习型代理降低开放式反馈的边际成本。
2026 年中:多领域环境模型与内部化路线
EnvFactory 从真实资源探索并验证有状态工具环境,再生成自然的多轮任务与轨迹,强化可执行生成路线。Qwen-AgentWorld 从覆盖多个领域的真实环境交互训练 language world model,并通过持续预训练、监督微调和强化学习提高模拟质量;模型既可作为外部环境服务,也可用于 Agent 的 world-model warm-up。
Internalizing the Future 代表另一条内部化路线:训练 Agent 预测可能的未来状态并把预测用于规划。它减少外部环境模型作为独立服务的需要,同时仍依赖真实环境完成动作和验证。外部代理与内部后果预测可以共享真实轨迹,承担的系统职责不同。
跨材料比较
| 材料 | 环境角色 | 状态权威 | 转移权威 | 奖励权威 | 校准方式 | 最窄证据 |
|---|---|---|---|---|---|---|
| AgentGym / ToolSandbox | 可执行基础环境 + 局部用户模拟 | 程序与工具状态 | 程序执行 | 规则、里程碑与终态 | 固定环境与任务 | 统一接口和有状态评测可支撑多环境 Agent 交互 |
| WebDreamer | 推理期局部模拟 | 真实网站 | LLM 预演后真实执行 | 真实任务评价 | 每步返回真实网站 | 自然语言后果预测可用于动作选择 |
| WebEvolver | 学习型 Web 环境 | 模拟历史与部分真实状态 | world model | 任务评价 | 真实数据初始化与有限深度分析 | 合成轨迹能参与自改进,多步误差限制有效深度 |
| DreamGym | 训练经验模型 | replay 状态 | reasoning experience model | 任务奖励 | 真实数据初始化与课程更新 | learned transition 能直接产生在线训练经验 |
| SWE-World | 单域学习型环境 | 仓库交互轨迹 | 专用 LLM surrogate | 预测测试反馈与真实评测 | 真实软件工程轨迹训练 | 软件工程环境可被专用模型近似并用于 RL |
| Agent World Model / EnvFactory | 可执行环境生成 | 生成的程序与数据库 | 程序执行 | 测试、规则与目标状态 | 生成后执行验证 | 自动生成能扩大有状态、可验证任务覆盖 |
| WebWorld | 大规模学习型环境 | 轨迹历史 | Web world model | 任务或模型评价 | 大规模真实轨迹训练 | 长程、多格式 Web 转移可被专用模型学习 |
| Qwen-AgentWorld | 多领域学习型环境 | 交互轨迹与模型上下文 | language world model | 规则与评分标准混合 | 多领域真实交互、SFT 与 RL | 同一环境模型可覆盖多领域并产生 Agent 训练轨迹 |
| Internalizing the Future | 内部世界模型 | 真实环境保存 | Agent 内部预测辅助规划 | 外部任务奖励 | 真实未来状态监督 | 后果预测可以内化到策略侧,外部执行仍承担验证 |
比较表刻意分开环境角色与权威来源。SWE-World 和 Qwen-AgentWorld 的主要变化位于转移权威;Agent World Model 与 EnvFactory 保留程序转移;DreamGym 把学习型转移正式接入训练循环;内部化路线改变策略的表示和规划过程。它们可在同一系统中分层组合。
证据强度
| 结论 | 强度 | 直接证据与限制 |
|---|---|---|
| 统一接口、独立状态、可靠复位和终态验证是规模化 Agent RL 的基础契约 | 强 | 多个 2024 环境平台提供公开接口、任务和评测;结论限定在基础设施能力 |
| 模型生成的转移能够产生有下游价值的 Agent 训练经验 | 中强 | WebEvolver、DreamGym、SWE-World、WebWorld 和 Qwen-AgentWorld 均报告同设置内增益;任务、模型与预算不可跨论文直接比较 |
| 可执行环境生成能扩大任务覆盖并保留可检查状态与奖励 | 中强 | Agent World Model 与 EnvFactory 提供生成、执行和验证链;真实业务分布覆盖仍需外部核验 |
| 多领域 learned environment 可以长期替代真实环境 | 弱 | 现有结果集中在有限训练期和固定评测,缺少新策略持续探索下的长期漂移、利用偏差和重校准实验 |
| 混合真实—模拟闭环优于纯真实或纯模拟方案 | 中 | 多项工作分别支持其中的组件,统一预算下的端到端三方对照仍少,当前判断包含跨材料推断 |
| 内部世界模型与外部环境模型可以共享数据并承担不同职责 | 中 | 机制兼容且已有各自实证,联合训练与联合部署的直接比较仍待补全 |
证据强度按结论评估。单篇论文的高分无法自动提高“完全替代真实环境”这一更宽结论的强度;能够定位状态、转移、奖励和校准来源的实验才直接支持系统级判断。
当前判断
当前更稳健的训练架构由四个参数生命周期相互独立的部分组成:策略负责动作;环境模型从真实 transition 学习并在一个策略更新窗口内冻结;验证器优先使用测试、规则或数据库差分;风险门控根据不确定性、状态新颖度、动作权限和奖励重要性选择模拟或真实执行。真实抽检结果进入 replay 刷新和环境模型重校准。
环境模型的主要价值是把昂贵真实交互前置并摊薄到更多后续 rollout,同时提供可复制的课程和失败分支。真实环境继续承担三个职责:提供 canonical state,发现新策略进入的分布外区域,完成高价值动作和最终验收。模型规模提升有助于局部模拟质量,无法单独解决奖励共同偏差和策略主动利用误差的问题。
内部化路线适合把后果预测变成规划能力,外部 learned environment 适合独立扩展 rollout 服务。可执行环境生成适合需要强状态和奖励语义的任务。选择方案时,应先确定哪一类权威可以近似,再确定哪些动作必须保留真实执行。
开放问题
- 如何在策略持续更新时度量 simulator exploitation,并将发现的分布外状态自动送回真实环境采样?
- 长程环境质量应如何同时报告单步正确率、状态一致性、奖励正确率和完整任务回报偏差?
- 当同一基础模型承担策略、环境和评分时,怎样识别并限制共同偏差?
- 可执行生成环境的任务分布如何与真实用户、实时 Web 和组织内部工具保持可量化的一致性?
- 外部环境模型与内部世界模型联合训练时,哪些表示可以共享,哪些参数需要隔离?
- 峰值并发、环境训练、真实抽检和重校准计入后,混合方案在 GPU 时间、服务成本和完成任务时间上何时占优?
局限
- 检索以公开英文材料为主,项目更新、撤稿和版本变化可能在截止时间后改变判断。
- 2026 年多项工作仍处于预印本或项目发布阶段,训练数据、代码和环境实现的开放程度不一致。
- 跨论文实验的环境、策略、验证器和预算差异较大,本文只比较机制和最窄结论。
- 机器人与连续控制工作被排除,本文分类框架不能直接替代该领域成熟的 model-based RL 术语和评测。
- 真实—模拟闭环的建议来自多项局部证据与系统推断,仍缺同一任务、同一预算下的长期统一实验。
更新记录
- 2026-07-13:根据 Agentic RL learned environment 方向总结请求建立初始综合。
- 2026-07-22:取得正式主线身份;迁出论文目录,采用独立综合结构;补入内部世界模型路线、排除连续控制材料,并把检索截止更新至 2026-07-22。