2601.16206-computer-environments-agentic-intelligence

Computer Environments Elicit General Agentic Intelligence in LLMs

LLM-in-Sandbox 只给模型 shell、文件编辑和完成信号,使具备工具规划能力的模型通过外部资源、文件管理与代码执行在多个非代码任务上获得收益,最高增益为 Qwen3-Coder 数学任务的 15.5 个百分点;进一步用一般文件型任务训练 Qwen3-4B 后,模型在 sandbox 模式中的平均交互轮次从 23.7 降到 7.0,并提高六个非代码域与 SWE-bench Verified 的表内成绩。收益覆盖部分模型—任务组合,这些数值来自允许联网的特定文件布局、prompt、turn limit 和 Docker 环境;论文将“强模型”定义为接入 sandbox 后整体受益的模型,因此组别结论含有按结果筛选的边界。

Authors Daixuan Cheng (成岱璇), Shaohan Huang, Yuxian Gu, Huatong Song (宋华彤), Guoxin Chen, Li Dong (董力), Wayne Xin Zhao, Ji-Rong Wen, Furu Wei (韦福如)

已审阅 Archived 2026-07-09 17:28 Updated 2026-07-21 14:18 Reviewed 2026-07-21 14:18 Source

Source

作者与关系

  • Daixuan Cheng: GSAI, Renmin University of China; Microsoft Research;历史机构:Beijing University of Posts and Telecommunications, Tsinghua University CoAI, Beijing Institute for General Artificial Intelligence.
  • Shaohan Huang: Microsoft Research.
  • Yuxian Gu: Tsinghua University;历史机构:Microsoft Research Asia, MIT HAN Lab.
  • Huatong Song: GSAI, Renmin University of China.
  • Guoxin Chen: GSAI, Renmin University of China;历史机构:Institute of Computing Technology, Chinese Academy of Sciences.
  • Li Dong: Microsoft Research;历史机构:University of Edinburgh, Beihang University.
  • Wayne Xin Zhao: GSAI, Renmin University of China;历史机构:Peking University.
  • Ji-Rong Wen: GSAI, Renmin University of China.
  • Furu Wei: Microsoft Research;历史机构:Wuhan University, IBM Research China.

这篇论文形成一条清晰的 RUC / Microsoft Research / Tsinghua 桥接线。Daixuan Cheng 同时属于 RUC GSAI 和 Microsoft Research GenAI 实习线;其主页显示研究重点已经从 pre-training / post-training 扩展到 agentic LLM training。Shaohan Huang、Li Dong 和 Furu Wei 构成 Microsoft Research GenAI 侧的模型与后训练线;Wayne Xin Zhao、Ji-Rong Wen、Huatong Song 和 Guoxin Chen 构成 RUC GSAI 侧的 LLM / agent / information retrieval 线;Yuxian Gu 连接 Tsinghua CoAI 与 Microsoft Research 的高效 LLM 训练线。

Ji-Rong Wen 也参与了 Towards Long-Horizon Agents;该综述在 environment synthesis 中把本篇列入 symbolic terminal / command-line environments,使 LLM-in-Sandbox 成为 RUC 长程 agent 研究线中的可执行 computer-interface 节点。主题上,它与 2602.13692 ThunderAgent2512.22560 RollArt2507.20534 Kimi K22602.15763 GLM-52026-04-24 DeepSeek-V4slime 官方项目 的 agentic environment / sandbox / rollout infrastructure 关系最强。Learned Environment Roadmap 进一步把它定位为 real-executable anchor,并通过 Huatong Song、Wayne Xin Zhao 与 SWE-World 的作者重叠连接到 learned execution surrogate。

阅读目标与判断边界

本笔记关注:

  1. LLM-in-Sandbox 如何构建 sandbox,并让模型与 sandbox 多轮交互。
  2. LLM-in-Sandbox-RL 如何把普通 context-based 数据转成可训练的环境探索任务。
  3. 实验证据是否支撑“computer environment 本身能引出 general agentic intelligence”这一主张。

判断边界:

  • 论文评估的是 sandbox as inference / training harness 对模型行为的影响,未提供 adversarial sandbox security 评测。
  • 部分实验允许 internet access,论文通过问题改写和人工轨迹抽检降低 benchmark hacking 风险,但无法完全替代封闭可复现实验。
  • 论文报告了代码仓库、Docker image 和 RL 代码,但大量结果仍依赖特定模型版本、prompt、benchmark 抽样和执行环境。
  • “general intelligence”在本文中具体落在任务解题能力、工具使用行为、文件型长上下文和可执行产物生成上,本笔记按这些可观测指标解释。

论文脉络

1. 研究问题、背景和价值

agentic LLM 的真实执行越来越接近“模型在计算机里完成任务”:模型读取文件、运行命令、安装包、写脚本、检查输出,并把最后结果保存给用户。已有 code agent、SWE agent 和 GUI agent 已经大量使用 sandbox,但这些 sandbox 多数围绕代码修复或网页操作任务定制。

这篇论文提出的问题更基础:如果只给模型一个通用、轻量的计算机环境,环境本身是否能把模型已有能力组织成更强的通用解题能力。换句话说,提升来自模型参数、外部工具集合、任务专用环境,还是来自“可探索的计算机接口”这个中间层。

这个问题有两个价值。第一,若最小 computer environment 已经有效,后续 agent training 可以把文件系统、shell、包管理和可执行反馈当作基础接口,减少按任务手工设计工具的工作量。第二,若弱模型在 sandbox 里效果下降,说明 agentic post-training 的训练目标需要覆盖“如何探索环境”和 tool-call 格式两层能力。

2. 已有解决方案与不足

已有路线可以分成三类。

第一类是 text-only LLM generation 或 LLM-RL。它们在 prompt 中放入全部上下文,模型一次性生成答案,reward 只看最终输出。这类方法适合可验证的数学、问答和格式任务,但无法训练模型使用文件系统、外部库和执行反馈。

第二类是 SWE / coding agent sandbox。它们通常为每个 repo 或 benchmark 准备独立镜像、依赖和测试脚本,适合软件工程评测,但存储和维护成本随任务增长。论文引用的对照中,任务专用环境可能需要数百 GB 到 TB 级存储。

第三类是固定 API tool use。它把工具调用变成 schema matching 问题,可靠性高,但工具边界由系统预先定义。LLM-in-Sandbox 把 bash 视为 meta-tool,让模型在环境里安装包、写脚本和组合新工具,因此工具空间从固定 API 扩展到计算机可执行空间。

3. 作者可能的思考路径

作者的思路可以还原为三步。

第一步,把“通用工具调用”压缩到最小接口。只提供 bashfile_editorfinish,让模型通过 shell 和文件系统自行构造领域工具。这样可以观察模型是否真的会探索环境,并减少对任务方预设 API 的依赖。

第二步,把 long-context 和输入输出都移到文件系统。长文档放在 /testbed/documents/,用户输入可放入 /testbed/input,最终答案写入 /testbed/output/answer.txt 或指定输出目录。这样,模型需要主动 lsgrepcat、写脚本和汇总结果。

第三步,用一般 context-based 任务训练环境探索能力。Instruction Pre-Training 的 seed data 本来是普通阅读理解 / 指令任务;论文把背景材料切成文件并加入干扰文件,让模型必须通过 sandbox 找到相关证据,再用 outcome reward 更新策略。训练目标没有额外 agentic demonstration,环境交互本身提供探索压力。

4. 核心假设或切入点

论文的核心假设是:计算机环境提供三种可跨任务迁移的 meta-capability。

  1. External resource access:通过网络、包管理器和领域库获取外部资源。
  2. File management:用文件系统存储、检索、组织和过滤上下文。
  3. Code execution:把计算、搜索、验证、仿真和格式检查交给程序执行。

这三个能力共同构成 agent-computer interface。模型的自然语言推理负责提出计划和解释状态;sandbox 负责保存中间状态、执行可验证操作、返回 observation。强模型已经能把这套接口用起来,弱模型需要通过 RL 学会更短、更有目的的探索轨迹。

5. 方法 / 系统 / 理论框架

Sandbox 构建。 LLM-in-Sandbox 使用 Ubuntu / Docker 风格的 code sandbox。默认环境只提供标准 Python 解释器和常用科学计算库,例如 NumPy、SciPy;领域包由模型在运行时按需安装或创建。项目仓库说明默认 Docker image 为 cdx123/llm-in-sandbox:v0.1,首次运行自动拉取,安装包版本为 llm-in-sandbox==0.2.0

Tool interface。 模型只有三个基础工具:bash 用于执行 shell 命令、安装包和运行程序;file_editor 用于创建、查看和修改文件;finish 表示任务完成。这个设计让 bash 成为可组合的 meta-tool,模型可以把领域库、脚本、命令行工具和自写程序纳入同一交互循环。

Agent loop。 工作流基于 ReAct:每一轮模型根据 prompt、历史和 observation 生成 tool call;sandbox 执行动作并返回 observation;系统把 observation 追加到交互历史;直到模型调用 finish 或达到最大 turn。任务输出从指定文件读取,例如 /testbed/answer.txt/testbed/output/answer.txt,中间探索过程与最终答案分离。

Figure 1: LLM-in-Sandbox 的最小计算机环境与跨域使用方式
Figure 1: 模型通过 bashfile_editorfinish 与通用 sandbox 循环交互,并在数学、物理、化学、生医、长上下文和指令遵循任务中组合外部资源、文件管理与代码执行。图中的跨域提升属于作者汇总;逐模型—任务单元仍包含下降结果。Image Source: arXiv v3 HTML Figure 1

文件型上下文。 对 long-context 或多文档任务,系统把文档放在 /testbed/documents/,每个文件保留原始标题或章节名。对单文件任务,训练时加入同数据集干扰文件,迫使模型通过目录遍历、搜索和内容过滤找到相关材料。

LLM-in-Sandbox-RL。 RL 训练和 text-only LLM-RL 使用同一 outcome-based paradigm,差异在于 rollout generation 发生在 LLM-in-Sandbox mode。reward 按任务类型计算:multiple choice 用正确性或 F1,free-form generation 用 ROUGE-L,binary correctness 用 0/1。训练框架基于 rLLM 中的 DeepSWE,算法为 GRPO++,并对超过最大 turn / token 的轨迹直接终止并给零 reward。

系统成本。 论文用共享镜像承载 sandbox,避免每个任务维护独立镜像。报告的 infra 数字包括单一 Docker image 1.1 GB、单容器 idle 约 50 MB、peak 约 200 MB;在 2 TB RAM DGX 节点上,500 个并发 sandbox 约 100 GB 内存。推理侧兼容 API 模型和 OpenAI-compatible endpoint,也兼容 vLLM / SGLang 自托管模型。

6. 结论链条

论文的结论链条如下:

  1. 给强模型接入最小 computer environment,多个非代码域的 performance 相比 vanilla LLM mode 提升,最大提升达到 +15.5 points。
  2. 行为分析显示,提升对应到三类 meta-capability 的实际使用:数学任务更多代码计算,化学任务更多外部资源,长上下文任务更多文件操作。
  3. 文件型上下文能显著减少长文档 prompt tokens,并让部分模型在 long-context QA 上超过 prompt-only context。
  4. 弱模型在未训练时会低效探索,平均 turn 更多而 capability usage 更低;LLM-in-Sandbox-RL 让弱模型的探索更短、更有效。
  5. 训练只使用一般 context-based 数据,也能迁移到数学、物理、化学、生医、长上下文、指令遵循和 SWE-bench Verified 的 sandbox evaluation。
  6. sandbox 能生成实际文件、图像、视频、音频和交互页面,说明它的输出空间超出 text-in-text-out,但这些示例的质量仍偏展示性质。

关键实验/定理

结果 1:无训练的 sandbox mode 提升强模型跨域任务表现

  • 设置:比较 vanilla LLM generation 与 LLM-in-Sandbox generation,模型覆盖 Claude-Sonnet-4.5-Think、GPT-5、DeepSeek-V3.2-Thinking、MiniMax-M2、Kimi-K2-Thinking、Qwen3-Coder-30B-A3B、Qwen3-4B-Instruct-2507;任务覆盖数学、物理、化学、生医、长上下文和指令遵循。
  • Baseline:同一模型的 vanilla LLM mode,直接生成输出,无环境访问。
  • 指标:各 domain accuracy / benchmark score。
  • 结果:作者定义的强模型组整体受益。Qwen3-Coder 数学从 26.0 到 41.5,提升 15.5 个百分点;GPT-5 数学从 87.8 到 97.9;DeepSeek 指令遵循从 60.3 到 74.7;Claude 指令遵循从 59.3 到 72.0。逐单元结果仍有回落,例如 GPT-5 生医下降 6.8、MiniMax 指令遵循下降 11.7,Qwen3-4B 在数学、化学和指令遵循等任务下降。
  • 证据定位:Section 2.3, Table 2
  • 对照是否可比:同一模型的 LLM mode 与 sandbox mode 使用相同任务和评分指标,提供直接配对比较;两种模式的计算预算、可访问资源与交互轮次不同,且 API 端点、采样波动和多 seed 结果未完整披露。
  • 支持的最窄结论:在论文指定的模型版本、prompt、网络与执行环境下,sandbox mode 改善多个模型—任务单元,最大增益为 15.5 个百分点;它没有在所有单元上稳定占优,“强模型”组也由整体受益结果定义。
  • 解读:sandbox 接入对“已经能规划并执行工具动作”的模型是放大器;对探索能力弱的模型会引入额外动作空间和错误机会。

结果 2:三类 meta-capability 与任务类型匹配

  • 设置:对模型动作中的 bash 命令和 Python 代码做 pattern matching,统计 external resource、file management、computation 三类能力使用率。
  • Baseline:不同任务域与强弱模型分组。
  • 指标:capability usage rate 和平均 turn 数。
  • 结果:数学任务 computation 使用率最高,约 43.4%;化学任务 external resource 使用率最高,约 18.4%;长上下文任务主要使用文件操作。强模型 external / file / computation 使用率约为 6.2% / 21.1% / 12.5%,平均 12.6 turns;弱模型约为 0.8% / 2.9% / 2.9%,平均 23.7 turns。
  • 证据定位:Section 2.4, Figure 2 与 Table 4
  • 对照是否可比:行为统计使用同一套命令与代码 pattern matching 规则;强弱分组按 Table 2 中接入 sandbox 后是否整体受益划分,分类会把结果信息带入行为比较,且 pattern matching 不能覆盖所有等价操作。
  • 支持的最窄结论:论文观察到任务域与三类已定义操作模式相关,且结果定义下的强模型组以更少轮次触发更多有效操作;该相关性不能单独建立工具行为导致成绩提升的因果关系。
  • 解读:performance gain 与可解释的 environment behavior 对应。弱模型的问题主要表现为动作多但有效工具使用少。

结果 3:文件型 long-context 降低 token 成本并改变性能

  • 设置:在 LLM-in-Sandbox mode 下比较两种 context placement:直接把文档放入 prompt,或把文档作为文件放入 sandbox。
  • Baseline:prompt context placement。
  • 指标:long-context benchmark accuracy 和 token consumption。
  • 结果:long-context 平均分从 35.6 提升到 49.6;Claude 从 11.9 到 61.8,DeepSeek 从 16.8 到 63.8,Kimi 从 51.0 到 61.8。token consumption 上,长上下文任务的 token 大幅下降,例如 Qwen 从约 102.9K 降到 12.9K。
  • 证据定位:Section 2.4, Table 3Section 3.1, Table 5
  • 对照是否可比:两组均在 sandbox mode 中运行,只改变文档位于 prompt 还是环境文件,性能对照较直接;token 表按后端聚合且不同模型对文件探索的实现不同,Qwen3-Coder 与 Qwen3-4B 的环境文件成绩下降。
  • 支持的最窄结论:在已测长上下文任务中,文件放置将七模型平均分从 35.6 提高到 49.6,并显著减少长文档输入 token;平均收益主要由 Claude、DeepSeek 和 Kimi 拉动,不能外推为每个模型都受益。
  • 解读:文件系统可以把“全量塞进 prompt”变成“按需检索和处理”。收益依赖模型会不会主动查看相关文件;Qwen-Coder 和 Qwen-4B 在该设置中表现下降,说明文件型上下文需要探索训练配合。

结果 4:部署成本可控,但吞吐收益不均

  • 设置:DeepSeek 和 Kimi 使用 SGLang serving,MiniMax 和 Qwen 使用 vLLM serving;单 DGX 节点,query concurrency 64。
  • Baseline:同一模型的 vanilla LLM mode。
  • 指标:总 token、environment token 占比、environment execution time 占比、QPM ratio、sandbox storage / memory。
  • 结果:全任务聚合后,LLM-in-Sandbox 的 token consumption 约为 LLM mode 的 0.5 到 0.8;environment tokens 占 37% 到 51%,但 environment execution time 低于 4%。QPM ratio 中 MiniMax 为 2.2,DeepSeek 为 0.6,Kimi 为 1.0,Qwen 为 1.1。sandbox storage 为 1.1 GB,共享镜像;500 个 sandbox 约占 2 TB RAM 的 5%。
  • 证据定位:Section 3, Tables 5、6、7
  • 对照是否可比:token 与 QPM 比率来自同模型两种模式,但四个本地模型分别使用 SGLang 或 vLLM,任务混合和多轮轨迹长度不同;内存数字来自共享镜像、约 50 MB idle 与约 200 MB peak 的容器设置,未覆盖冷启动和运行时安装峰值。
  • 支持的最窄结论:在单 DGX、并发 64 和论文任务混合下,sandbox 执行时间占比低于 4%,共享镜像与容器内存开销可控;端到端吞吐从 0.6 倍到 2.2 倍,无法概括为统一加速。
  • 解读:长上下文任务会显著降低 prompt tokens;多轮探索任务会增加总 token。吞吐取决于模型服务后端、decode 速度、prefill 占比和任务组合。

结果 5:LLM-in-Sandbox-RL 让弱模型学会有效环境探索

  • 设置:从 Qwen3-4B-Instruct-2507 和 Qwen3-Coder-30B-A3B 出发,用 general context-based data 做 RL。对照 LLM-RL 使用同类数据但无环境交互;另有数据来源与 context placement ablation。
  • Baseline:base LLM、text-only LLM-RL、不同数据源训练。
  • 指标:六个非代码域加 SWE-bench Verified;同时测能力使用和 vanilla LLM mode 的 reasoning pattern。
  • 结果:按 Table 9 的 sandbox-mode 列,Qwen3-4B 从 base 到 LLM-in-Sandbox-RL 后,数学为 32.5 到 53.3、物理 25.6 到 30.3、化学 49.3 到 63.3、生医 9.4 到 13.2、长上下文 10.5 到 17.6、指令遵循 29.0 到 38.7、SWE-bench Verified 11.2 到 12.8;平均 turn 从 23.7 降到 7.0。Section 4.2 正文列出的生医“14.4 对 10.0”和指令遵循“37.7 对 33.7”与 Table 9 不一致,本笔记以完整表格为准。
  • 证据定位:Section 4.2, Table 9Section 4.3, Table 11Table 10 数据消融
  • 对照是否可比:base 与 RL 模型在同一表内接受 LLM mode 和 sandbox mode 评测,任务与评分一致;训练数据、轨迹计算量和模型权重发生变化,实验未报告多 seed,且正文示例与 Table 9 存在数值冲突。
  • 支持的最窄结论:在作者的单次训练与评测配置中,文件型通用数据强化学习提高了 Qwen3-4B 的七项 sandbox-mode 表内成绩并缩短平均轨迹;现有证据无法区分文件探索、额外训练计算与具体 GRPO++ 配方各自的净贡献。
  • 解读:环境训练学到的内容包含两层:一层是如何查文件、写脚本和执行命令;另一层是结构化分解与自检习惯,它能部分迁移到 text-only generation。

实验设置与 baseline 审计

维度 记录
模型与初始化 无训练实验覆盖 Claude-Sonnet-4.5-Think、GPT-5、DeepSeek-V3.2-Thinking、MiniMax-M2、Kimi-K2-Thinking、Qwen3-Coder-30B-A3B 和 Qwen3-4B-Instruct-2507。RL 使用 Qwen3-4B-Instruct-2507 与 Qwen3-Coder-30B-A3B。
数据与任务 数学、物理、化学、生医、长上下文理解、指令遵循;RL 数据来自 Instruction Pre-Training seed data 的 general context-based tasks;额外评测 SWE-bench Verified。
RL / 训练配置 GRPO++;learning rate 1e-6;train prompt batch 8;rollouts per prompt 8;Qwen3-4B 150 steps,Qwen3-Coder 50 steps;max turns 100;max response length 65,536 tokens;无 KL reward / loss。
系统配置 Ubuntu / Docker code sandbox;共享 Docker image;工具为 bashfile_editorfinish;输出文件路径为 /testbed/output/answer.txt 或任务指定目录。
框架基座 / paper base Agent loop 基于 ReAct;RL framework 基于 rLLM 的 DeepSWE;serving 侧使用 vLLM / SGLang 或 OpenAI-compatible API endpoint。
框架版本与证据来源 项目 README 披露 llm-in-sandbox==0.2.0、Docker image cdx123/llm-in-sandbox:v0.1、Python 3.10+、Docker;论文 v3 与 README 对齐。
框架改动范围 论文提供独立 library 与 benchmark module;RL 代码单独开源;相对 DeepSWE/rLLM 的具体改动主要集中在 sandbox rollout、context file placement、reward adapter 和超长轨迹惩罚。
技术报告训练配置 仅 RL 超参公开;SFT、base model 训练和模型供应方细节按模型公开版本处理。
训练硬件与拓扑 RL 训练硬件未充分披露;推理 efficiency 使用单 NVIDIA DGX 节点,concurrency 64。
并行方式与框架 推理本地 serving 使用 SGLang 和 vLLM;API 模型通过 OpenAI-compatible endpoint。
训练数据规模与组成 general context-based tasks 来自 Instruction Pre-Training seed data,覆盖百科、小说、专家材料、学术测试、新闻、社交媒体和 trivia;具体样本规模未完整列入主文。
训练过程与超参 见 Appendix E;超过最大 turns / tokens 且未提交答案的 episode 给零 reward。
训练时间 / GPU hours / 成本 未披露。
未披露项 完整 benchmark sampling seed、人工轨迹抽检比例、internet access 的缓存状态、所有模型 endpoint 配置、RL 训练硬件。
评测协议 长上下文任务把相关文档放入 /testbed/documents/;指令遵循使用 IFBench single-turn subset loose mode;SWE 使用 SWE-bench Verified 与 R2E-Gym sandbox setup。
统计报告 多数表格给平均数与单次设置;缺少多 seed、误差线和显著性检验。
Baseline 是否 tuned vanilla LLM baseline 使用同模型直接生成;prompt 调优程度披露有限。
Baseline 是否 compute-matched token 和 wall-clock 未严格 compute-matched;论文另报告 token / QPM,便于做成本解释。
Baseline 是否 implementation-matched 同一模型对比相对公平;不同模型后端和 API 行为存在实现差异。
Baseline 是否覆盖强替代方案 覆盖 text-only LLM mode、LLM-RL、SWE-RL 方向性对照;未覆盖多工具固定 API agent、retrieval-only RAG、planner-executor agent 的系统调参版。
Baseline 是否存在弱化风险 long-context prompt-only baseline 可能受上下文窗口和检索困难影响;sandbox mode 有 internet access 和 runtime package installation,任务改写虽降低风险,仍需封闭复验。
结论边界 结论最稳的是 minimal sandbox 能提升强模型和训练弱模型的环境探索;对安全隔离、真实产品可靠性和通用创造质量的推论需要额外实验。
  • 系统条件:效率实验在单 NVIDIA DGX 节点、query concurrency 64 下运行,DeepSeek 与 Kimi 使用 SGLang,MiniMax 与 Qwen 使用 vLLM;sandbox 共享约 1.1 GB Docker image,容器约 50 MB idle、200 MB peak,512 个并发容器的内存估算基于 2 TB RAM。
  • 指标定义:QPM 表示从提交 query 到最终答案的每分钟完成数;token consumption 包含 prompt、模型输出和 environment output;environment execution share 只计算环境执行时间占端到端时间的比例,内存数字区分 idle 与 peak。
  • 成本归因:文件型长上下文减少 prompt prefill,ReAct 多轮探索增加生成与交互 token,environment output 主要走 prefill,SGLang / vLLM 后端和任务混合共同决定 QPM;表内吞吐变化不能归因于 Docker sandbox 单一因素。
  • 威胁模型:模型拥有 shell、文件读写、运行时安装与部分网络访问能力,研究风险包括 benchmark 信息泄漏、非预期外部资源、恶意代码执行与网络外传;论文没有按主动攻击者设计 adversarial isolation 评测。
  • 披露边界:本笔记记录接口、评测风险和隔离成立条件,省略可直接用于逃逸、外传或供应链滥用的操作细节;Docker 结果只代表论文研究配置,不构成生产安全保证。
  • 适用版本:论文数值对应 arXiv v3(2026-04-08);实现说明核对 llm-in-sandbox==0.2.0cdx123/llm-in-sandbox:v0.1 及两个官方仓库在 2026-07-21 的公开状态,未固定仓库 commit。

证据链强度评估

强证据

  • 同一模型在 LLM mode 与 LLM-in-Sandbox mode 的 side-by-side 对比覆盖多个任务域,能支持“sandbox access 会改变强模型表现”。
  • 行为统计把 performance gain 与 external resource、file management、computation 使用联系起来,减少了纯 benchmark 分数解释的模糊性。
  • RL ablation 区分了 text-only LLM-RL、general data in prompt、general data in sandbox 和 SWE / math data,能支持“文件型环境交互本身有训练价值”。
  • README、项目页和代码仓库提供可运行工具、Docker image、安装方式和 benchmark module,增强了工程可复验性。

中等强度证据

  • text-only LLM mode 的 reasoning pattern 变化说明 sandbox RL 可能内化结构化分解和自检习惯;pattern matching 指标较粗,适合作为行为线索。
  • beyond text generation 的 map、poster、video、music 示例展示了输出文件能力;这些案例更适合说明可能性,难以单独证明高质量创作能力。
  • efficiency 分析说明 environment tokens 可通过 fast prefill 处理,sandbox memory / storage 成本可控;不同 serving backend 和任务组合会改变实际吞吐。

需要谨慎的推论

  • internet access 会引入外部检索、package state 和 benchmark leakage 风险。论文做了问题改写和人工抽检,但封闭环境复现仍是必要补充。
  • Docker isolation 适合研究原型和常规安全边界,不能直接等同于 adversarial isolation。生产系统可能需要 microVM、seccomp、network policy、resource quota 和 audit log。
  • 弱模型训练后的提升依赖 prompt、reward、turn limit、文件布局和 data mixture;换成更弱模型或更复杂工具空间可能需要额外 curriculum。
  • “computer environments elicit general intelligence”这一表述应理解为“计算机接口提升多个任务域的 agentic problem solving”,还没有覆盖长期自主性、开放世界目标管理和人类级创造质量。

本地讨论补充

1. 讨论收敛点

  • 对“当前 agentic request 中 sandbox 如何实现”的问题,这篇论文是当前最直接的基础材料之一。它把 sandbox 写成 agent-computer interface:Docker / Ubuntu 环境、bash / file_editor / finish 三工具、ReAct multi-turn loop、文件型输入输出和 outcome extraction。
  • sandbox 与 agent 交互的基础机制来自多条路线。InterCode 代表“code as action, execution feedback as observation”的早期 benchmark 化路线;SWE-agent 强化了 agent-computer interface 在软件工程任务中的作用;ToolEmu 侧重用语言模型模拟 tool execution sandbox。LLM-in-Sandbox 的贡献在于把这些思想压缩成通用 code sandbox,并跨非代码任务和 RL 训练验证。
  • 这篇论文提供了一个简洁判断:sandbox 的核心是给模型一个可读写、可执行、可反馈、可保存中间状态的计算环境。

2. 修正后的理解

  • “sandbox 构建”包含三层:隔离执行层、agent tool protocol、任务 I/O 协议。隔离执行层由 Docker 容器承载;tool protocol 把 shell、文件编辑和结束信号暴露给模型;I/O 协议规定 /testbed/input/testbed/documents/testbed/output 等路径和答案提取方式。
  • “agent 相互交互”可以理解为一个状态机:model response 选择 action,sandbox 执行 action 并产生 observation,controller 把 observation 写回 history,直到 finish 或 turn limit。训练时整条 trajectory 的 reward 仍来自最终文件或最终答案。
  • RL 的关键是把普通阅读任务变成必须查找文件、过滤干扰和写答案的环境任务。这样 outcome reward 会奖励有效环境探索。

3. 后续复验指标

  • 封闭网络版本下的数学、化学、生医和长上下文结果,区分“外部检索收益”和“本地计算 / 文件管理收益”。
  • 不同 sandbox substrate 的安全和成本对比:Docker、rootless Docker、Firecracker microVM、full VM。
  • 文件型 long-context 的真实吞吐:prefill tokens、decode tokens、工具等待、container cold start、package installation latency。
  • RL 后模型的 tool action distribution、turn length、无效命令率、文件搜索 recall 和 final answer error taxonomy。

主要启发

  • 对 agentic training,environment design 是训练目标的一部分。把 context 放进文件系统会改变 state distribution 和 credit assignment,模型必须学会查找、执行和验证。
  • 对 long-context serving,文件系统可以作为外部 working memory,减少全量 prompt stuffing;但它要求模型具备检索计划和证据整合能力。
  • 对 production sandbox,最小工具协议便于标准化,但安全、资源隔离、网络访问、日志、恢复和 quota 需要由底层 substrate 和 orchestrator 单独保证。

局限

  1. 安全隔离只按研究环境描述,缺少 adversarial code execution、network exfiltration、side channel 和 supply-chain package risk 的系统评测。
  2. 互联网访问让部分知识密集任务的可复现性变弱;任务改写和人工抽检只能降低风险,不能完全替代 sealed benchmark。
  3. 多数结果缺少多 seed、置信区间和完整 prompt / endpoint telemetry;不同 API 模型和本地 serving backend 的版本差异会影响数值。
  4. 弱模型未训练时可能在 sandbox 中退化,说明环境本身会扩大搜索空间;模型能力、prompt、turn limit 和 reward shaping 都会影响结论。
  5. beyond text 的文件生成案例展示了可行性,但图像、视频、音乐和网页质量仍需要专门评测。

跨论文关系

  • 与已有论文的作者关系:当前未发现直接作者重叠;机构层面连接 Renmin University of China、Microsoft Research 和 Tsinghua University,补充 RUC GSAI / Microsoft Research GenAI 的 agentic LLM training 线。Learned Environment Roadmap 记录了 Huatong Song、Wayne Xin Zhao 与外部论文 SWE-World 的作者重叠。
  • 与已有论文的主题关系:它是 OR-IUltZSgLMm Self-Improving Agents 中 environment side / experience side 的具体实现节点;和 2507.20534 Kimi K22602.15763 GLM-52026-04-24 DeepSeek-V4 共享 sandbox + tool-use + agentic RL 主题;Learned Environment Roadmap 把它定位为 real-executable anchor。
  • 与已有论文的方法或系统关系:2602.13692 ThunderAgent2512.22560 RollArt 解释 agentic serving / RL rollout 中 sandbox 生命周期、工具等待和异步调度的系统压力;LLM-in-Sandbox 提供 sandbox harness 与训练数据构造层面的上游对象。slime 官方项目 提供把 sandbox rollout 接入大规模 RL 框架的系统接口语言。
  • 跨论文关系定位:连接 Self-Improving Agents、Harness、Experience Infrastructure 与 Learned Environment Roadmap,并记录 LLM-in-Sandbox、Computer Environment 与 Sandbox-Agent Interaction。