2607.07508-sao-single-rollout-asynchronous-agentic-rl
Single Rollout Asynchronous Optimization for Agentic Reinforcement Learning
SAO 把异步 agentic reinforcement learning 的 prompt-local 采样单位改为一条 rollout,用独立 value model 的更高更新频率、冻结 attention 和跳过 observation 的 token-level Generalized Advantage Estimation (GAE) 代替组内 reward baseline,再用 rollout token log-probability 上的双侧硬掩码控制 policy lag;实验最清楚地显示 Direct Double-Sided Importance Sampling (DIS) 承担防止早期训练崩溃的主要作用,single-rollout 与 critic 组合在约 400 步后进一步超过同样采用 DIS 的 GRPO,而论文没有提供吞吐、训练成本和多 seed 收敛证据。
Source
- Workflow version: v2
- Material type: research-paper
- Canonical source: https://arxiv.org/abs/2607.07508
- Title: Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- Authors: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong
- Responsible organization: Tsinghua University;Z.AI 为前两位作者完成该工作时的实习机构
- arXiv: https://arxiv.org/abs/2607.07508
- PDF: https://arxiv.org/pdf/2607.07508
- HTML: https://arxiv.org/html/2607.07508
- TeX Source: https://arxiv.org/src/2607.07508
- Code/Project: 未发现作者公开实现;arXiv v1、TeX source 与精确标题检索均未给出项目 URL(复核于 2026-07-13)
- OpenReview / Review page: 未发现与标题、作者和 arXiv id 可可靠匹配的公开审稿页(复核于 2026-07-13)
- Submitted: 2026-07-08 15:02:19 UTC
- Published / updated: 2026-07-08(arXiv v1)
- Current version read: arXiv v1;HTML;PDF;TeX source
- Version / revision read: arXiv:2607.07508v1
- Accessed: 2026-07-13
- Subjects: cs.LG(primary);cs.AI
作者与关系
- Zhenyu Hou: Tsinghua University;Z.AI.
- Yujiang Li: Tsinghua University;Z.AI.
- Jie Tang: Tsinghua University.
- Yuxiao Dong: Tsinghua University;历史机构:Meta AI、Microsoft Research Redmond、University of Notre Dame.
Zhenyu Hou 与 Yujiang Li 为共同贡献作者。Yuxiao Dong 的公开主页将二人列为清华大学博士生,Zhenyu Hou 从 2021 年开始攻读博士,Yujiang Li 于 2025 年从清华本科转入博士阶段;Zhenyu Hou 的个人主页同时确认 Yuxiao Dong 与 Jie Tang 为导师。四位作者因此形成清华大学 Knowledge Engineering Group (KEG) 内部的学生、导师合作关系,前两位作者在 Z.AI 的实习经历又把 SAO 连接到 GLM 的生产训练管线。
与当前档案的直接项目关系来自 GLM-5 和 GLM-5.2:GLM-5 已公开与 DIS 相同的直接双侧 importance-sampling 公式,SAO 摘要进一步声称该方法已用于 750B-A40B GLM-5.2 的 agentic RL pipeline。Zhenyu Hou 的个人主页也将 GLM-4.5 / GLM-5 系列列为近期工作。当前证据支持同一研究与工程生态的连续产出;GLM-5.2 release blog 采用团队署名,因此这里不把博客作者关系扩写成可逐人核验的正式作者重叠。
阅读目标与判断边界
本笔记关注:
single rollout在采样、batching 和异步队列中的准确含义。- DIS、value model、faster critic update、frozen attention 与 skip-observation GAE 分别解决哪类不稳定性。
- SAO 与 GRPO + DIS 的对照能够识别哪些因果贡献,以及 prompt 多样性和 critic compute 带来哪些混杂。
- 论文声称的稳定性、在线适应和 GLM-5.2 部署各自有多强的证据。
判断边界:
- 论文只公开 Qwen3-30B-A3B 主实验,未公开训练代码、异步 runtime、硬件、wall-clock、GPU hours、队列策略、权重同步周期或 staleness histogram。
single rollout表示每个 prompt 在一次采样组中只产生一条 trajectory;训练 batch size 仍为 128,论文没有说明每条轨迹是否单独触发 optimizer step。- 数学评测的 16 次或 4 次运行是随机解码评测重复,不等同于独立 RL training seeds。
- TeX 使用
neurips_2026.sty,并保留Under review, Feb 2026.的自定义 notice。两项都属于草稿元数据,无法确认正式投稿 venue。 - 论文声称 SAO 用于 GLM-5.2 训练,但没有给出 750B-A40B 上的 SAO 配置、消融或训练曲线。
证据写法:
- 论文事实:正文、附录、表格、图、TeX source 直接给出的设计、数字和限制。
- 作者主张:摘要、引言、结论对稳定性、效率、泛化和部署的解释。
- 本地分析:对目标函数梯度语义、baseline 公平性、异步数据流和外部有效性的重建。
- 关键判断附
证据定位,使用章节、公式、图、表、附录或规范 URL。
术语预备
- GRPO (Group Relative Policy Optimization,组相对策略优化):同一 prompt 采样多条 response,用组内 reward 均值与标准差构造 advantage,通常不训练 critic。
- PPO (Proximal Policy Optimization,近端策略优化):用 actor-critic、importance ratio 与 clipped surrogate 控制 policy update。
- GAE (Generalized Advantage Estimation,广义优势估计):用 temporal-difference residual 的指数加权和折中 advantage 的偏差与方差。
- IS (Importance Sampling,重要性采样):用 current policy 与 behavior policy 的概率比修正 off-policy sample。
- DIS (Direct Double-Sided Importance Sampling,直接双侧重要性采样):SAO 中直接读取 rollout engine 保存的 sampled-token logprob,并把 ratio 超出上下界的 token 从梯度中移除。
- SFT (Supervised Fine-Tuning,监督微调):用带目标 response 的数据把 base checkpoint 适配到工具推理格式。
- TIR (Tool-Integrated Reasoning,工具集成推理):让模型在自然语言推理中交错调用 Python 等工具的训练与评测设置。
- MoE (Mixture of Experts,混合专家):每个 token 只激活部分 routed experts 的稀疏模型结构;本文 backbone 为 Qwen3-30B-A3B。
- Policy lag:rollout 生成样本时的 behavior policy 与 learner 更新时的 current policy 之间的版本或概率差异。
- Critic / value model:估计状态 expected return 的模型,用作 single-rollout advantage baseline。
论文脉络
1. 研究问题、背景和价值
长程 agentic task 的 rollout 时间分布很宽。一条数学工具轨迹可能几轮结束,软件工程 agent 可能持续数百轮;同步 pipeline 要等一批轨迹全部完成,短轨迹完成后的 rollout GPU 和 trainer 会暴露大量等待。异步 actor-learner 可以在 trajectory 到达后持续组 batch、持续更新 learner,从而减少 batch barrier。
异步化同时改变了数据分布。某条 trajectory 开始生成时使用
GRPO 又增加了一层 prompt-local barrier。对同一个 prompt 采样
证据定位:Abstract;Sections 1、3;Figure 2。
2. 已有解决方案与不足
同步 PPO / GRPO 在每轮固定 rollout snapshot、收齐完整 batch 后训练。它们的行为策略边界清楚,长尾轨迹会把等待扩散到整批样本。
异步 RL 系统把 rollout、reward、training 和 weight synchronization 解耦,常见控制包括 bounded staleness、experience buffer、trajectory dropping、importance correction 和更频繁的 weight sync。这些方案提高系统利用率,但算法仍需回答 stale data 的 advantage 与 trust-region 问题。
GRPO 通过同 prompt group baseline 避免独立 critic,带来两项约束:
- 一个 group 的所有 trajectory 要同时可用,prompt-local completion barrier 会延迟快样本。
- 在线交互往往只得到当前 user request 的一次反馈,无法在同一时刻构造同 prompt group。
PPO / REINFORCE 风格 single-rollout 可以直接消费一条 trajectory,但单样本 return 的方差更大。learned critic 能按 state 给 baseline,也引入一份大模型参数、value pretraining、额外 forward/backward 和 critic tracking instability。
SAO 的方案由两部分组成:DIS 控制 stale sampled-token update;single-rollout + value model 移除 prompt-local group dependency。论文又加入 faster critic update、frozen attention 与 skip-observation GAE,使这个 critic 在 128K、多轮、MoE agentic RL 中可训练。
证据定位:Sections 1、2、3.1、3.2;Section 5 Related Work。
3. 作者可能的思考路径
以下为本地分析的受约束重建:
- 先观察 synchronous agentic RL 的 straggler,采用 trajectory-level async 后又遇到 rollout/current policy ratio 长尾和早期 collapse。
- rollout engine 已经能在生成时保存每个 sampled token 的 logprob,因此可以直接把实际 behavior probability 带进 learner,省去为不同历史版本重新运行 old policy。
- 对 ratio outlier 继续做 PPO clipped surrogate仍可能留下方向相关的梯度;将上下界外 token 全部 mask,可以构造更直接的 stale-token gate。
- GRPO group barrier 会重新引入等待,于是把每 prompt rollout 数降为 1。组均值 baseline 随之消失,训练需要重新引入 value model。
- pilot run 显示 critic gradient 大且追不上快速变化的 actor,于是同时提高 critic learning rate 与 update count,并冻结 critic attention、只更新 MoE projections。
- agent trajectory 的 observation 由环境写入,逐 observation token 计算 value transition 会让 token 数量和外部文本噪声进入 GAE;跨 observation span 直接连接相邻 action token,形成 skip-observation GAE。
4. 核心假设或切入点
SAO 依赖五项核心假设:
- GRPO 的同 prompt group completion barrier 是异步 policy lag 的重要增量来源。
- rollout engine 记录的 sampled-token logprob 足以构造实用的局部 off-policy correction。
- ratio 双侧越界 token 的风险高于其当前训练价值,直接 mask 能提高长期稳定性。
- 预训练 attention 已具备足够的状态读取能力,critic 的 MoE projections 可以承担 return fitting 的主要变化。
- value model 的 state-dependent baseline 能用单条反馈训练,并比历史 running mean 更快跟踪 policy 与 reward distribution。
这些假设的证据强度并不相同。DIS 被 GRPO + DIS 的稳定训练直接支持;faster critic 与 frozen attention 有局部消融;prompt-local barrier、实际 staleness 缩短和系统吞吐没有对应的 lag histogram 或 wall-clock 测量。
5. 方法 / 系统 / 理论框架
5.1 single rollout 的数据流与 batch 语义

Ready for training 表示 sample dependency 已解除,正文仍使用 batch size 128。Image Source: arXiv HTML image / Figure 2.主实验把同样的 128 条 rollout 组织成两种 batch:
| 方法 | 每 batch prompt 数 | 每 prompt rollout 数 | 总 rollout 数 | Advantage baseline |
|---|---|---|---|---|
| GRPO variants | 16 | 8 | 128 | 同 prompt group reward statistics |
| SAO | 128 | 1 | 128 | learned token-level value model |
单条 SAO trajectory 完成后无需等待同 prompt 的 7 条 sibling trajectories。它可以进入异步 buffer,learner 再从 ready trajectories 组成 batch。论文未披露 buffer policy、batch formation、minimum ready samples、prompt scheduler、sample reuse、staleness threshold 和 weight-sync cadence,因此 Figure 2 支持 dependency-level 解释,尚不足以证明 optimizer 每到一条 sample 就更新一次。
这个改动还同时增加了每 batch 的 prompt diversity:16 个 prompt 变成 128 个 prompt。更广的 prompt coverage 可能改善 gradient diversity 与泛化,也可能改变任务难度构成。主对照没有增加 128 prompts x 1 rollout + nonparametric baseline、16 prompts x 8 rollouts + learned critic 或 prompt-count-matched control,因此 single-rollout dependency、critic 与 prompt diversity 的贡献没有完全分离。
5.2 DIS:直接使用 behavior logprob,并双侧移除 ratio outlier
为避免和 reward
SAO 定义双侧 calibration function:
论文写出的 token objective 为:
与常见 PPO clipping 相比,SAO 的差异集中在两个动作:
- denominator 直接使用 rollout 时保存的 token logprob,不再维护单一
latest old policy或历史 checkpoint 集合。 - 只要
越过任一边界,该 token 在正负 advantage 下都被置零;PPO clipped surrogate 的梯度是否消失还取决于 advantage 符号和 ratio 方向。
这组 current policy / rollout behavior policy 比值、双侧硬 mask 和
实验阈值为:
| 任务 | 保留的 ratio 区间 | ||
|---|---|---|---|
| Math reasoning with Python | 0.3 | 5.0 | |
| SWE-Bench Verified coding | 0.8 | 3.0 |
strict double-sided 描述的是两侧统一硬 mask 的规则。数值区间本身较宽,尤其 reasoning upper ratio 达到 6.0。论文没有提供 threshold sweep、mask rate 对长度/难度的条件分布,或越界 token 的 advantage 分布。
从实现语义看,若作者想得到标准的 truncated importance-weighted score-function gradient,权重需要停止梯度:
直观实现会接近:
ratio = (logp_current - logp_rollout).exp()
mask = (ratio > 1 - eps_low) & (ratio < 1 + eps_high)
loss = -(mask * ratio.detach() * advantage * logp_current).mean()
论文公式没有写 stop-gradient / detach。若自动微分同时穿过
DIS 控制的是已采样 token 上的局部 ratio。它没有估计 full-vocabulary KL,也没有显式控制长 trajectory 的 prefix-distribution shift。论文接受这种 token-level approximation 引入的 off-policy bias,以换取无需历史模型推理的低实现成本。
证据定位:Section 3.1;Equations 1-3;Section 4.1。
5.3 actor 与 critic 是否使用同一个模型
SAO 维护两个参数角色:policy
| 维度 | Actor / policy | Critic / value model |
|---|---|---|
| 初始化 | TIR-SFT Qwen3-30B-A3B | 同一 TIR-SFT checkpoint |
| 输出 | next-token distribution | token-level expected return |
| Learning rate | ||
| 每 batch update | 1 | 2( |
| RL 阶段 trainable part | 论文未进一步拆分 actor parameter group | attention 冻结,MoE projections 更新 |
| Advantage role | 接收 |
产生 |
frozen attention 表示 critic 内部的 attention weights 保持固定。它不表示 actor 与 critic 在线共享同一份 attention parameter。正文把
critic 适应速度同时来自两项设置:learning rate 是 actor 的 5 倍,每个 batch 又执行 2 次 update。因此 faster value update 的实际时间尺度差异大于单独的
作者还强调扩大 value pretraining corpus 以缓解 cold start,但未披露数据量、数据组成、label / return 构造、训练步数和 pretraining cost。这个未披露阶段会直接影响 running-mean 与 learned critic 的公平比较。
证据定位:Sections 2、3.2、4.1;Table 3;Appendix B Limitations。
5.4 faster critic update 与 frozen attention
single-rollout 的 advantage 依赖
这里的 attention gradient norm(注意力参数梯度范数)通常指 value loss 对 critic 全部 attention 参数所产生梯度的聚合大小:
它衡量当前 batch 的 value loss 向 attention 参数传递了多强的更新信号,与 attention probability 或 attention weight 是不同量。数值较大可能来自损失对该模块更敏感,也可能受到参数数量、参数尺度、梯度噪声和训练不稳定性的影响;单凭这个数值无法推出 attention 更重要或更需要更新。
作者对异常梯度的发现只给出两步文字说明:pilot experiments 先观察到 value model 的整体 gradient norm 显著高于对应的 policy model,进一步按模块拆分后,将主要来源定位到 Full Attention,并称 MoE layers 相对稳定。论文没有披露 pilot 的数据、训练步数、模块 norm 的归一化方法、异常阈值、逐层统计或多 seed 结果,也没有画出 attention 与 MoE gradient norm 的直接对照曲线。因此,“异常来自 Full Attention”是作者报告的诊断结论,公开证据还不足以独立复核这个定位过程。
作者把该现象视为优化不稳定性的定位信号,据此冻结 value model attention,只训练 MoE projections,并假设预训练 attention 已能从长上下文中选择 relevant state,critic 主要需要调整 state-to-value mapping。


这个设计与 Qwen3-30B-A3B 的 MoE 架构紧密相关。dense model 没有 MoE projections 作为同等容量的可训练部分,较小模型和不同 attention/MoE 参数占比也可能改变结论。
5.5 skip-observation token-level GAE 如何分配 advantage
多轮 agent trajectory 写成:
其中
SAO 只在 model-generated action token 上训练 value 与 policy。对 action
直观表示为:
action 0 tokens observation 0 action 1 tokens
a0,0 -> ... -> a0,N [no value / no loss] a1,0 -> ... -> a1,M
\____________________________/
TD / GAE bridge
action span 内部仍按相邻生成 token 递推;跨 turn 时只跳过 observation token positions。每个 action token 最终获得自己的
这里的“跳过 observation”只描述 credit-assignment index。
附录还比较 step-level action:先把一轮内 token values 做平均,或只取末 token,再把同一个 step advantage广播给该轮全部 token。400 步时 token-level 在 AIME2025 / BeyondAIME 得到 89.8 / 66.8,step average 为 85.8 / 60.5,step last-token 为 87.3 / 62.8。这个结果支持 tested setting 下保留 token-level credit;它没有单独消融 skip-observation bridge 与普通 action-only token GAE。
证据定位:Section 3.2;Equations 4-5;Appendix A.1;Table 5。
5.6 simulated online learning
在线写作模拟依次把 reward preference 切换为 cute、chuunibyou、classical。GLM-4.7 judge 分别给 response quality 与 style adherence 二元分数,最终 reward 为二者乘积。SAO 用 state-dependent critic 处理每个 prompt 的单次 feedback;baseline 保存最近 128 个 reward 的 running mean:
reward distribution 切换后,running window 会暂时保留上一阶段统计,SAO 曲线恢复更快。这个实验说明 critic 可以在 controlled non-stationary reward 中跟踪变化。比较双方的容量并未匹配:SAO critic 是预训练大模型并持续更新,running mean 只有一个 128-sample scalar window;window size、critic pretraining 和 transition schedule 都缺少 sweep。
证据定位:Section 4.5;Figure 5。
5.7 论文没有展开的异步 runtime
算法要在真实异步系统中运行,至少还需要以下组件:
- rollout worker 在每个 generated action token 上保存 token id、loss mask、behavior logprob 与 model version。
- completed trajectory 进入 buffer,并保留 prompt id、reward、turn boundary 与 observation mask。
- learner 从不同 prompt 的 ready samples 组成 batch 128,计算 current logprob、DIS mask、critic value 和 skip-observation GAE。
- critic 每 batch 更新两次,actor 更新一次;新 actor weights 再同步到 rollout replicas。
- buffer 或 learner 需要处理过旧样本、失败 environment、超长 trajectory 与有效 batch size 波动。
论文只明确第 1 步所需的 rollout logprob、第 3 步的 batch / loss 和第 4 步的 update ratio。buffer、版本协议、weight transport、丢弃规则与 fault tolerance 没有披露。SAO 目前更接近一套 asynchronous RL optimization recipe,系统实现仍依赖 slime / AReaL / RollArt / Laminar 一类 runtime。
6. 结论链条
论文的证据链可以拆成四层:
- Standard GRPO 约 160 步 collapse,VAPO 约 90 步 collapse;加入 DIS 的 GRPO 可以稳定继续训练,因此 sampled-token 双侧 mask 是主要的 anti-collapse 机制。
- SAO 与 GRPO + DIS 在前 400 步接近,之后 SAO 在多个 math benchmark 持续领先,支持 single-rollout + learned critic 的长期收益。
- critic 更新次数、attention freezing 和 token-level action granularity 各有消融,说明 value-model recipe 对最终效果有贡献。
- simulated online writing 展示单 feedback 与 reward shift 下的适应能力,作者报告的 GLM-5.2 deployment 提供大规模应用线索;两者都缺少足够配置和对照,适合作为 transfer evidence。
这条链条支持“SAO 在 paper-tested 30B MoE agentic RL 中稳定且优于作者实现的 GRPO variants”。它尚未支持异步吞吐更高、总训练 compute 更低、跨 backbone 普适或 750B 上同等增益。
关键实验/定理
结果 1:SAO 在四个 math benchmark 上超过 GRPO + DIS
| 方法 | AIME2025 | BeyondAIME | HMMT Nov 2025 | IMOAnswerBench |
|---|---|---|---|---|
| TIR-SFT (w/ Python) | 80.4 | 53.3 | 75.2 | 53.3 |
| GRPO (w/ Python) | 84.2 | 54.8 | 76.0 | 55.8 |
| GRPO + DIS | 93.5 | 70.8 | 84.0 | 70.0 |
| SAO (DIS only label) | 94.2 | 71.5 | 86.7 | 71.3 |
| SAO | 97.3 | 74.8 | 88.3 | 74.0 |
- 设置:Qwen3-30B-A3B-Thinking-2507 先在 GPT-OSS-120B 生成的 Tool-Integrated Reasoning (TIR) data 上 SFT 3 epochs,再做 128K、最多 50 turns 的 asynchronous RL。
- Baseline:TIR-SFT;standard GRPO with Clip-Higher;GRPO + DIS;论文标记为
SAO (w/ DIS only)的变体。 - 指标:Pass@1 accuracy;AIME2025、HMMT、IMOAnswerBench 平均 16 次 evaluation runs,BeyondAIME 平均 4 次。
- 结果:SAO 相对 GRPO + DIS 提升 3.8、4.0、4.3、4.0 个百分点。
- 证据定位:Section 4.1-4.2;Table 1;Figure 3。
- 对照是否可比:backbone、总 rollout count 和大部分训练设置对齐;SAO 使用 128 prompts x 1,GRPO 使用 16 prompts x 8,且 SAO 增加预训练 critic、两次 critic update 和不同 advantage estimator。
SAO (DIS only)的具体关闭项也没有完整定义。 - 支持的最窄结论:在当前 Qwen3-30B-A3B TIR setup 中,完整 SAO 的最终 accuracy 高于同一作者实现的 GRPO + DIS。
- 解读:GRPO + DIS 已获得大部分相对 vanilla GRPO 的提升;完整 SAO 提供后续 3.8 到 4.3 pp 增益。
结果 2:DIS 负责早期稳定,single-rollout + critic 负责后期分离
- 设置:同一 math RL run,最长训练约 1000 steps,绘制 AIME2025、BeyondAIME 与 HMMT evaluation curve。
- Baseline:vanilla GRPO;GRPO + DIS;SAO。
- 指标:training step 上的 benchmark accuracy;token clip ratio。
- 结果:vanilla GRPO 约 160 steps collapse;VAPO ablation 约 90 steps collapse;GRPO + DIS 可持续训练。SAO 与 GRPO + DIS 初期接近,约 400 steps 后形成持续差距。
- 证据定位:Section 4.2、4.4;Figure 3;Figure 4(c)。
- 对照是否可比:GRPO 与 GRPO + DIS 直接识别 DIS 作用;SAO 同时改变 prompt grouping、critic 与 advantage,后期差距不能进一步归因到单一设计。
- 支持的最窄结论:双侧 token mask 足以稳定作者的异步 GRPO baseline,完整 SAO 在长期训练中获得额外质量收益。
- 解读:标题强调 single rollout,训练不崩溃的直接证据首先指向 DIS。
结果 3:critic recipe 的两个消融方向一致,幅度依 benchmark 变化
| 配置 | Value training | Critic updates / batch | AIME2025 | BeyondAIME |
|---|---|---|---|---|
| SAO | Frozen attention | 2 | 97.3 | 74.8 |
| 单次 critic update | Frozen attention | 1 | 95.0 | 69.8 |
| Full-parameter critic | Full parameter | 2 | 90.6 | 74.5 |
| Single-rollout running mean | Per-prompt 8-reward window | 0 | 79.8 | 55.3 |
- 设置:其余 SAO 配置保持一致;比较 update count 与 critic trainable parameter scope。
- Baseline:
critic update;full-parameter value training;每个 prompt 保存最近 8 个 reward 的 single-rollout running mean。 - 指标:AIME2025、BeyondAIME accuracy;explained variance;critic gradient norm。
- 结果:
相对 提升 2.3 / 5.0 pp;frozen attention 相对 full parameter 提升 6.7 / 0.3 pp。per-prompt 8-reward running mean 为 79.8 / 55.3,明显低于完整 SAO。 的 explained variance 后期更高,frozen-attention gradient norm 更低。 - 证据定位:Section 4.3-4.4;Tables 3-4;Figure 4(a-b)。
- 对照是否可比:局部配置基本匹配;没有多 seed、critic LR 单独消融、value pretraining ablation或 dense-backbone 对照。
- 支持的最窄结论:在当前 MoE critic 上,两次 update 与冻结 attention 都没有降低主表结果,至少在一个 benchmark 上带来明显增益。
- 解读:full-parameter critic 的高 gradient norm 与 AIME 降分相关;BeyondAIME 几乎持平,因果解释仍需更多 seed 与 value-error metric。
Table 4 的数学基线和 online simulation 使用两种不同的 running-mean 定义。前者为每个 prompt 单独保存最近 8 个 rewards,用于主数学任务的 79.8 / 55.3 对照;后者在连续在线数据流中保存最近 128 个 rewards,用于观察偏好切换后的恢复。两组 window size、统计范围和任务均不同,需要分别解读。
结果 4:token-level action advantage 优于两种 step-level广播
| Action granularity | AIME2025 | BeyondAIME |
|---|---|---|
| Step-level average | 85.8 | 60.5 |
| Step-level last token | 87.3 | 62.8 |
| Token-level | 89.8 | 66.8 |
- 设置:相同训练步数 400;step 定义为一个 conversation turn。
- Baseline:step value 取 token value 平均;step value 只取末 token;两种都把一个
广播到 step 内全部 tokens。 - 指标:AIME2025、BeyondAIME accuracy。
- 结果:token-level 分别领先 step average 4.0 / 6.3 pp,领先 last-token 2.5 / 4.0 pp。
- 证据定位:Appendix A.1;Table 5;Figure 6。
- 对照是否可比:训练 steps 对齐;论文未披露各 variant 的 token count、gradient normalization 与独立 seed。
- 支持的最窄结论:当前 TIR 环境下,保留每 token value / advantage 优于把同一 step signal 广播到整轮。
- 解读:结果支持 token granularity,仍无法单独识别 skip-observation bridge 的贡献。
结果 5:SWE-Bench Verified 提升有限但方向一致
- 设置:Qwen3-30B-A3B-Thinking-2507,OpenHands scaffold,最大 300 turns,128K context;coding DIS 区间
。 - Baseline:base Qwen3-30B-A3B;GRPO + DIS。
- 指标:SWE-Bench Verified accuracy。
- 结果:23.0 -> 27.0 -> 29.8,SAO 相对 GRPO + DIS 提升 2.8 pp。
- 证据定位:Section 4.1-4.2;Table 2。
- 对照是否可比:同 backbone 与 scaffold;论文未报告 run count、confidence interval、task subset、reward construction、container version或训练样本 contamination audit。
- 支持的最窄结论:SAO 在作者的单个 SWE-Bench Verified setup 上高于 GRPO + DIS。
- 解读:coding 结果补充跨域方向性,统计强度低于多次评测的 math 结果。
结果 6:online writing simulation 中 critic 比 running mean 恢复更快
- 设置:三阶段写作风格偏好切换;GLM-4.7 judge 给 quality 与 style binary reward;单 trajectory feedback。
- Baseline:最近 128 rewards 的 running-mean advantage。
- 指标:held-out style accuracy;training reward 在 preference shift 后的恢复速度。
- 结果:SAO 在每次 shift 后更快转向新 target style,running mean 出现更明显滞后并收敛到较低 reward。
- 证据定位:Section 4.5;Figure 5。
- 对照是否可比:双方都可单 rollout 更新;critic 拥有预训练、state input 和大量参数,running mean 只有固定 window。论文未报告 exact phase length、seed、置信区间或 window sweep。
- 支持的最窄结论:在 controlled style-switch simulation 中,state-dependent learned baseline 比固定 128-sample running mean 更快适应。
- 解读:实验展示 single-feedback 可行性;真实 user-facing online learning 还需要 privacy、safety、rollback 和 non-stationary evaluation。
实验设置与 baseline 审计
| 维度 | 记录 |
|---|---|
| 评测协议 | Math 用 top- |
| 统计报告 | AIME2025 / HMMT / IMOAnswerBench 平均 16 次 stochastic evaluation,BeyondAIME 平均 4 次;未给标准差、confidence interval、显著性检验或独立 RL seeds。 |
| Baseline 是否 tuned | GRPO 使用 Clip-Higher,并增加采用 DIS 的强 baseline;VAPO 与两类 running mean 也有对照。完整调参预算和 threshold sweep 未披露。 |
| Baseline 是否 compute-matched | 总 rollout count / batch 都为 128;SAO 增加一份 30B-A3B critic、critic value pretraining、每 batch 两次 critic update,训练 FLOPs 和 memory 没有对齐。 |
| Baseline 是否 implementation-matched | 主方法与 GRPO variants 由同一实验栈实现的可能性高,但 runtime、framework、commit 与 code 未公开,无法直接审计。 |
| Baseline 是否覆盖强替代方案 | 覆盖 vanilla GRPO、GRPO + DIS、VAPO、数学任务 per-prompt 8-reward running mean 与在线任务 128-reward running mean;SPO 只在附录文字中提及,没有完整主表数字。缺少 RLOO、VIMPO、OTB、staleness-aware PPO 与 critic-enabled group control。 |
| Baseline 是否存在弱化风险 | SAO 为 128 prompts x 1,GRPO 为 16 prompts x 8;prompt diversity、critic capacity 和 single-rollout dependency 同时变化。两类 running-mean window 均未调优。 |
| 结论边界 | 支持 30B-A3B、agentic math / coding、作者实现的异步 setup;吞吐、总成本、dense model、不同 scale、真实 online users 与作者声称的 750B deployment 待复验。 |
| 模型与初始化 | Qwen3-30B-A3B-Thinking-2507;math policy / critic 从 3-epoch TIR-SFT 初始化;coding 直接从原 checkpoint 开始,critic 初始化细节未单独说明。 |
| 数据与任务 | GPT-OSS-120B 生成 TIR SFT data;RL training dataset 规模、prompt reuse、reward details 未披露。评测 AIME2025、BeyondAIME、HMMT Nov 2025、IMOAnswerBench、SWE-Bench Verified。 |
| RL / 训练配置 | Batch 128;SAO group size 1;GRPO 16 prompts x 8;actor LR |
| 系统配置 | 未披露 GPU、node、trainer/rollout placement、queue、buffer、weight-sync、staleness limit、throughput、wall-clock、failure handling。 |
| 框架基座 / paper base | Coding agent 使用 OpenHands;trainer、rollout engine、distributed runtime、reward framework 未披露。作者声称的 GLM-5.2 deployment 可能连接 slime,但本文没有明确声明具体实现 commit。 |
| 框架版本与证据来源 | 只有 Qwen checkpoint 与 OpenHands 名称;版本和 commit 均未披露。 |
| 框架改动范围 | 算法层新增 behavior-logprob ratio、双侧 token mask、single-rollout batching、critic update schedule、attention freezing 与 observation-aware GAE;系统集成范围未披露。 |
| 技术报告训练配置 | arXiv v1 只给主实验 recipe;GLM-5.2 750B-A40B 训练配置未给出。 |
| 训练硬件与拓扑 | 未披露。 |
| 并行方式与框架 | 未披露 tensor / expert / data parallel,未披露 actor-critic placement。 |
| 训练数据规模与组成 | TIR data 由 GPT-OSS-120B 生成;样本数、RL prompt 数、value pretraining corpus 与重复策略未披露。 |
| 训练过程与超参 | 约 1000 RL steps;optimizer、betas、weight decay、gradient clipping、KL coefficient、reward normalization、gamma、value loss coefficient未披露。 |
| 训练时间 / GPU hours / 成本 | 未披露。 |
| 未披露项 | Code、hardware、runtime、throughput、staleness histogram、mask/rejection distribution、prompt scheduling、training seeds、完整 reward、value pretraining、GLM-5.2 scale-up 细节。 |
证据链强度评估
强证据
- arXiv v1 提供 HTML、PDF 与 TeX source,DIS 公式、critic update、attention freezing、skip-observation GAE、主表和附录消融可直接定位。
- GRPO + DIS 相对 vanilla GRPO 的训练曲线把 anti-collapse 作用较清楚地归因到 DIS。
- SAO 相对 GRPO + DIS 在四个 math benchmark 方向一致,且在约 400 steps 后形成曲线分离。
- critic update count、parameter freezing 与 action granularity均有 matched ablation。
中等强度证据
- SWE-Bench Verified 从 27.0 提升到 29.8,支持 coding transfer;缺少多 run、置信区间和数据审计。
- online writing simulation 支持单反馈与 reward shift 下的可行性;baseline capacity 与超参未匹配。
- 约 1000 steps 的单次长训练说明当前 recipe 可运行;缺少独立 seed,稳定性仍可能依赖初始化和数据顺序。
需要谨慎的推论
- 论文没有实际 throughput / utilization / wall-clock 数据,因此
asynchronous efficiency主要来自去除 dependency barrier 的结构推断。 - SAO 与 GRPO 的 batch 同为 128 trajectories,训练 compute 差异明显;“更高效”不等于“总 FLOPs 更低”。
single rollout improves generalization与 128 个不同 prompts / batch 同时出现,prompt diversity 可能承担部分收益。- DIS objective 未写 stop-gradient,代码语义无法核验;ratio 上界较宽,也缺少 threshold robustness。
- GLM-5.2 deployment 只作为作者的一句应用声明出现,其证据强度低于 750B 实验表、系统说明和独立复验。
OpenReview / 审稿意见吸收
- Page type: not-found
- Match confidence: high
- Observed at: 2026-07-11
- Venue status: arXiv preprint;正式投稿或录用状态 unknown。TeX 使用 NeurIPS 2026 style 并保留
Under review, Feb 2026.notice,当前没有公开 venue 页面可交叉确认。 - Public reviews: 未发现与完整标题、四位作者或 arXiv:2607.07508 可可靠匹配的公开 reviews。
- Ratings / confidence: 无公开数据。
- Reviewer consensus: 无可吸收的正式 reviewer consensus。
- Main criticisms: 无公开正式审稿文本;本地审计重点放在 stop-gradient 歧义、prompt-diversity confound、critic compute、系统指标缺失和 single-seed stability。
- Author response: 未发现公开 rebuttal。
- 对可信度的影响: 方法与主实验可由 TeX source 复核;novelty、实现正确性、统计充分性与大规模部署尚未获得公开同行评审或代码校准。
本地讨论补充
1. single rollout 需要按三个粒度理解
| 粒度 | SAO 的含义 |
|---|---|
| Prompt-local sampling | 同一个 prompt 在当前 sample group 里只生成 1 条 trajectory。 |
| Async readiness | trajectory 完成后即可进入 ready buffer,无需等待同 prompt siblings。 |
| Learner batch | 仍以 128 trajectories 组成训练 batch;batch size 没有降到 1。 |
因此,SAO 移除的是 prompt group dependency。global batch formation、GPU microbatch 和 optimizer accumulation 仍可保留。
2. GRPO 与异步训练的关系应如何表述
GRPO 可以接入异步系统,现有 runtime 已能用 buffer、bounded staleness 或异步生成实现 group-wise update。它的难点来自 group advantage 的联合可用性:同 prompt 的
因此更审慎的表述是:GRPO group semantics 与“每条 trajectory 完成后立即具备训练资格”的目标存在结构张力;在支持等待、跨时间重组或 delayed grouping 的异步 runtime 中,GRPO 仍然可实现。
3. DIS 修正到什么程度
rollout token logprob 给出实际 sampled action 的 behavior probability。保存它可以避免用最新 old model 重新估计 denominator,也能处理 trajectory 内版本变化,只要每个 token 的 logprob确实来自生成它的那次 forward。
它仍保留三类近似:
- token ratio 替代整条 trajectory importance product,以较低方差换取偏差。
- sampled-token probability 不能恢复 full-vocabulary divergence,也无法发现 sampled action 之外的 distribution shift。
- hard mask 改变有效数据分布,越旧、越长、越困难的轨迹可能更常被部分删除。
复验时需要同时记录 token mask rate、trajectory age、response length、task difficulty 与 advantage sign,才能判断稳定性是否来自合理 trust region,或来自系统性过滤某类样本。
4. GAE 到底估计什么,以及 advantage 最终如何分配
GAE 全称 Generalized Advantage Estimation(广义优势估计)。它估计某个已选 action 或 token 相对 critic 基线的优势:正值表示这次选择的后续回报高于当前状态的通常预期,负值表示低于预期。标准 GAE 先计算一步 temporal-difference residual:
再把当前及未来 residual 做指数加权:
SAO 每个 prompt 只有一条 rollout,无法使用 GRPO 的同 prompt 组均值作为 baseline,因此训练独立 critic
SAO 的 skip-observation 版本把 action 末 token 直接连接到下一 action 首 token。下一 action 的 causal prefix 已经包含工具 observation,因此 value estimate 会读取环境反馈;observation token positions 不单独接受 value target、discount step 或 policy loss。
terminal 或 sparse reward 先通过 critic TD residual 与 GAE 沿 action tokens 向前传播。observation positions 不获得 advantage;跨 observation boundary 时,前一 action 末 token 直接 bootstrap 到后一 action 首 token。得到的
trajectory reward
|
v
critic values on action tokens
|
v
skip-observation token GAE -> A_t for every model token
|
v
DIS: keep and weight token if ratio is inside interval
|
v
policy-gradient update on log pi_theta(token | prefix)
这条路径将 credit assignment 与 off-policy admission 分成两步:critic / GAE 决定 token 应朝哪个方向更新、幅度多大;DIS 决定 stale token 是否进入梯度以及 importance weight。
5. Attention gradient norm 的解释边界
高 attention gradient norm 表示 value loss 对这组参数给出了较强的聚合更新信号。原始数值还会受到参数量、参数尺度、gradient clipping 和 optimizer preconditioning 影响,因此跨模块比较时最好同时报告 per-parameter gradient RMS 与 relative update norm。论文没有说明 gradient norm 的精确定义、聚合范围和归一化方式,也没有公开其所称的 attention / MoE decomposition;Figure 4(b) 只比较 full-parameter 与 frozen-attention critic 的整体 norm。作者将这项 pilot 诊断、full-parameter critic 的性能下降和 frozen-attention 曲线更平滑放在一起,形成冻结 attention 的经验依据;这些结果仍不足以单独验证“预训练 attention 已经完成 relevant state selection、MoE 只需学习 state-to-value mapping”这一机制假设。
6. 目前最关键的公平对照
一组更有识别力的实验应形成
| Prompt grouping | Baseline type | 目的 |
|---|---|---|
| 16 prompts x 8 | group mean | 当前 GRPO + DIS |
| 16 prompts x 8 | learned critic | 分离 critic 与 prompt diversity |
| 128 prompts x 1 | running mean / RLOO-like global baseline | 分离 single-rollout 与 critic capacity |
| 128 prompts x 1 | learned critic | 当前 SAO |
四组还要对齐 rollout tokens、actor updates、critic FLOPs、value pretraining cost 与 wall-clock。这样才能分别估计 group barrier、prompt coverage、critic baseline 和额外 compute 的作用。
7. 后续复验指标
- 每条 trajectory 的开始/结束 model version、进入 learner 时 age、token-level ratio quantiles 和 masked fraction。
- group wait time、ready-buffer wait time、rollout utilization、trainer utilization、samples/s 与 tokens/s。
- actor FLOPs、critic FLOPs、value pretraining FLOPs、peak HBM、GPU hours 与 time-to-score。
- 独立 RL seeds 下的 collapse rate、reward、evaluation accuracy、entropy、gradient norm 与 explained variance。
- prompt count matched、critic matched、token budget matched 和 wall-clock matched 四类 baseline。
- dense model、较小模型、不同 MoE ratio、browser / OS / multi-agent environment 与真实 online feedback。
- DIS objective 的 detached / non-detached implementation test,以及
sweep。
8. 2026-07-13 状态复核
- arXiv 仍只有 2026-07-08 提交的 v1,正文、实验表和版本判断无需迁移。
- 以论文精确标题、arXiv id、作者与 GitHub / OpenReview 组合检索,仍未发现作者公开训练代码或公开审稿 forum。
- 搜索出现的 AgentRL、AReaL 与 verl 异步 agentic RL 项目可作为实现参照,当前没有证据表明它们是 SAO 主实验所用 runtime,因此不写入 Source 的 official code 字段。
- 本次复核没有改变核心信号、索引行与跨论文关系。
9. SAO 相较 GRPO 是否更像普通 PPO
按 advantage estimator 与训练骨架判断,SAO 明显更接近 PPO。它移除了 GRPO 的同 prompt 组内 reward baseline,重新引入独立 critic,并用 token-level GAE 为一条 trajectory 内的 action tokens 计算 advantage。每个 prompt 只生成一条 rollout 也与常规 actor-critic 数据收集兼容;这里的 single rollout 仍然表示 group size 为 1,learner batch 仍包含 128 条 trajectories。
这种归类需要同时保留策略目标和数据流上的区别:
| 层面 | 普通 PPO | SAO |
|---|---|---|
| Advantage | critic + GAE | 独立 critic + skip-observation token-level GAE |
| 数据生成 | 通常由固定 old policy 同步收集一批相对新鲜的 trajectories | trajectories 完成后异步入队,batch 可以包含不同 rollout model versions 生成的数据 |
| Importance ratio | current policy / fixed old policy | current policy / 生成该 token 时记录的 rollout behavior probability |
| 策略约束 | clipped surrogate 是否停止梯度取决于 advantage 符号与 ratio 方向 | ratio 越过任一边界时直接移除该 token 的梯度 |
因此,二选一比较 PPO 与 GRPO 时,SAO 应归到 PPO 一侧。更精确的方法描述是:PPO 式 actor-critic 骨架,加上面向异步 policy lag 的 DIS 与专门强化的 critic 训练。普通 PPO 可以作为相对 GRPO 的简写;完整算法标签还需要包含 asynchronous dataflow 和 DIS,因为这两点改变了 behavior-policy reference、样本新鲜度与 token admission rule。
主要启发
- agentic RL 的异步调度单位可以降到单条 trajectory,advantage estimator 也要消除同 prompt group 的联合依赖。
- rollout logprob 是异步训练的关键数据字段。它把 behavior-policy identity 从历史 checkpoint 转成 per-token trace metadata。
- 稳定性与 sample efficiency 需要分开读:DIS 负责过滤极端 policy lag,critic 负责降低 single-sample advantage variance。
- observation-aware credit assignment 应按模型可控 token 定义时间轴,同时保留 observation 作为下一 action 的 state context。
- critic-free GRPO 节省模型内存;SAO 用额外 critic compute 换取 prompt-level independence。系统报告应同时给 throughput 与总训练成本。
- 长期曲线比单个 final score 更能识别贡献。本文的约 400-step 分离显示 anti-collapse 与最终质量来自不同组件。
局限
- 没有公开代码,DIS 的 stop-gradient、normalization、value loss、mask 聚合与异步 queue 无法核验。
- 没有硬件、throughput、utilization、wall-clock 或 GPU-hour 结果,异步效率主张缺少直接系统证据。
- SAO 与 GRPO 同时改变 prompt count、group size、baseline type 和 critic compute,主对照存在多重混杂。
- 只报告一类 30B-A3B MoE backbone;frozen-attention critic 对 dense / small model 的适用性未知。
- 训练稳定性缺少独立 seeds、collapse rate 与置信区间;evaluation repetitions 不能替代 training repetitions。
- value pretraining corpus、RL data、reward、prompt reuse 和 optimizer details 缺失,复现成本高。
- online learning 只使用 controlled style shift 与 GLM-4.7 judge,和真实用户分布、延迟反馈、privacy 与 safety constraints 有明显距离。
- GLM-5.2 deployment 缺少 scale-up 配置和结果;当前证据只能确认论文提出了生产采用声明,尚无法独立核验该 recipe 的具体接入方式和效果。
- DIS 只看 sampled-token ratio,无法完整控制 prefix shift 或 full-distribution divergence;hard mask 还可能引入长度与难度选择偏差。
- TeX 中 venue notice 与 arXiv 日期存在草稿残留,正式投稿状态需要后续来源确认。
跨论文关系
- 与已有论文的作者或机构关系:四位作者均来自清华大学 KEG,Zhenyu Hou 与 Yujiang Li 在 Z.AI 实习期间完成该工作;SAO 作者报告该方法用于 GLM-5.2 的 750B-A40B agentic RL pipeline,连接清华研究组与 Z.AI 模型训练。
- 与 CompactionRL:Yujiang Li、Zhenyu Hou、Jie Tang、Yuxiao Dong 四位作者重叠,两篇论文都采用独立 critic 并声明进入 GLM-5.2 的 agentic RL pipeline。CompactionRL 处理 context compaction 产生的 variable segments、token-level reduction 和跨 segment reward distance;SAO 处理异步 single-rollout readiness、stale-token admission 与 skip-observation GAE。它们共同显示该团队正在用 critic-based PPO 统一长程 agent 的 context boundary 和 async boundary。
- 与已有论文的方法关系:GLM-5 已经公开
current policy / rollout behavior policy的直接 ratio、双侧越界置零和目标。SAO 延续这项设计,将其命名为 DIS,并补充 single-rollout critic、skip-observation GAE 与独立实验;DIS 的核心公式因此属于 GLM-5 到 SAO 的方法延展。 - 与已有论文的主题关系:与 Laminar 和 RollArt 共同讨论 trajectory-level asynchronous RL。Laminar / RollArt 重点处理 rollout、weight sync、resource placement 与 bounded staleness;SAO 重点处理 single-rollout advantage 和 stale-token optimization。
- 与已有论文的方法或系统关系:与 Trust Region Masking 都用 rollout/current divergence 决定样本准入。SAO 在 token 级按 sampled-token ratio 双侧 mask;TRM 在 sequence 级结合 max / average divergence,覆盖长轨迹累计 drift。
- 与已有论文的方法或系统关系:与 MiniMax-M1 / CISPO 都采用 importance weight 乘 REINFORCE-style logprob 的形式。CISPO clip detached weight 并保留 token gradient;SAO 对区间外 token 直接置零,且当前公式缺少 stop-gradient 标记。
- 与已有论文的方法或系统关系:与 OTB 和 VIMPO 形成 single/group rollout baseline 路线对照。OTB 用 group samples 估计 variance-minimizing token baseline,VIMPO 从 policy/reference ratio 构造隐式 value;SAO 恢复一份显式 learned critic 以支持每 prompt 单 rollout。
- 与已有论文的方法或系统关系:与 TIM / VeXact 共享 rollout logprob consistency 问题。TIM/VeXact 关注同 checkpoint 在 trainer / rollout engine 上的数值一致性;SAO 还叠加异步 policy version lag,并直接使用生成时 logprob 作为 denominator。
- 与已有论文的方法或系统关系:与 slime 和 verl 的关系在实现层。两类框架提供 async rollout、behavior logprob、rollout correction、critic training 与 agent loop 等基础组件,SAO 没有披露具体 runtime 接入方式。
Reference Intake Brief
Target
- Intended target system: 新增 SAO 论文笔记,并更新索引行、作者档案和对应论文的关系章节。
- Existing related assets:
content/utility/papers-index.md;GLM-5;GLM-5.2;Laminar;RollArt;Trust Region Masking;OTB;MiniMax-M1。 - Proposed form: 新建独立 Markdown 文档;缓存三张 arXiv HTML 原图;更新索引行、作者档案与对应论文的关系章节。
Reusable Elements
- Async dataflow:single rollout per prompt -> ready buffer -> batch 128 -> critic x2 / actor x1 -> weight sync。
- DIS:rollout logprob denominator、双侧 token mask、ratio 区间与 stop-gradient 实现检查。
- Value recipe:同 checkpoint 独立 actor/critic、critic LR 5 倍、update count 2 倍、frozen attention、MoE projection update。
- Agent credit assignment:observation token 不参与 value / policy loss,GAE 跨 observation span 连接相邻 action tokens。
- Baseline audit:128 prompts x1 与 16 prompts x8 同时改变 prompt diversity、baseline capacity 和 compute。
Risks
- Copyright/over-copying: 只保留公式、必要数字、原图与本地重组分析;没有复制大段正文。
- Unsourced or unverifiable claims: 论文事实均附章节、公式、表或图定位;runtime 与 stop-gradient 判断明确标为本地分析。
- Tone/brand mismatch: 使用技术审计语言,避免把作者主张写成已证实的系统结论。
- Safety/compliance issues: 本文不涉及可直接滥用的操作步骤;在线学习部分保留 privacy、safety 与 rollback 风险。
- Overlap with existing assets: 与 async system、trust-region masking、token baseline 和 GLM-5.2 有强关系;本笔记聚焦 single-rollout optimization recipe。
Skipped
| Material | Reason |
|---|---|
| 公开代码实现 | 作者未提供,无法核验 objective detach、queue 与 distributed runtime。 |
| 公开 reviewer comments | 未发现可可靠匹配的 OpenReview / conference review page。 |
| 750B GLM-5.2 SAO 配置 | 论文摘要提供一条 deployment statement,未提供可抽取的训练表、曲线或系统 trace。 |
| 闭源模型横向分数的能力排序 | GPT-5、Claude、GLM-4.7 与 SAO 的 tool / harness 条件不完全统一,不用于算法因果比较。 |
Recommendation
Decision: merge
Why: SAO 把 trajectory-level async system 问题推进到优化器与 advantage estimator 层,明确给出 single-rollout、behavior-logprob masking、critic stabilization 和 agent observation boundary 的组合 recipe;同时,GRPO + DIS 与 SAO 的长期曲线提供了可复用的“先稳定 stale update,再降低 single-rollout variance”证据链。归档中保留 prompt-diversity confound、critic compute、stop-gradient 歧义和系统指标缺失,能够避免把算法有效性直接外推为总体训练效率。