2607.14777-seed-self-evolving-on-policy-distillation

SEED: Self Evolving On Policy Distillation for Agentic Reinforcement Learning

SEED 先用 GLM-5.2 标注的轨迹—技能数据把策略模型训练成轨迹分析器,再让每轮最新策略从自身完整轨迹生成事后技能,并以技能上下文引起的采样 token 概率变化构造门控似然辅助项;三种小模型在 12 个汇总指标中取得 10 个最优或并列最优,但方法沿用了 OPID 的在线轨迹技能闭环和 SDAR 的门控损失,直接前作 OPID 未进入主表,且证据缺少多随机种子、技能正确性评测和总训练成本对齐。

Authors Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao

Source

  • Workflow version: v2.1
  • Material type: research-paper
  • Analysis modules: experiment, system, theory
  • Canonical source: https://arxiv.org/abs/2607.14777
  • Title: SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
  • Authors: Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao
  • Responsible organization: Tsinghua University;Zhejiang University;The Chinese University of Hong Kong;Nanyang Technological University;Tongji University
  • arXiv: https://arxiv.org/abs/2607.14777
  • PDF: https://arxiv.org/pdf/2607.14777
  • HTML: https://arxiv.org/html/2607.14777v1
  • Code/Project: project pageGitHub repositoryreleased checkpoint
  • OpenReview / Review page: 未发现与题名、作者或 arXiv ID 匹配的公开 OpenReview / conference review page
  • Submitted: 2026-07-16 09:57 UTC
  • Published / updated: arXiv v1,2026-07-16
  • Current version read: v1
  • Version / revision read: arXiv v1 PDF、TeX source;GitHub commit 2cf2fadca3c5aba28da68e8e1405182ba8d90e6c
  • Accessed: 2026-07-23
  • Key figure decision: include
  • Review status: page-type=not-found; match-confidence=high; observed-at=2026-07-23; venue-status=arXiv preprint
  • Subjects: Computation and Language (cs.CL)

作者与关系

  • Jinyang Wu: Tsinghua University。
  • Shuo Yang: Tsinghua University。
  • Zhengxi Lu: Zhejiang University。
  • Fan Zhang: The Chinese University of Hong Kong。
  • Yuhao Shen: Zhejiang University。
  • Lang Feng: Nanyang Technological University。
  • Haoran Luo: Nanyang Technological University。
  • Zheng Lian: Tongji University。
  • Shuai Zhang: Tsinghua University。
  • Zhengqi Wen: Tsinghua University。
  • Jianhua Tao: Tsinghua University。

这项工作由五所高校组成跨机构合作网络,Tsinghua University 提供最多作者并承担项目负责人和通讯角色。Jinyang Wu 与 Shuo Yang 是共同一作;论文作者块还明确标注 Jinyang Wu 为 Project Leader。

SEED 与直接前作 OPID 的 11 位作者完全重合,只交换了 Jinyang Wu 与 Shuo Yang 的署名顺序。两篇论文在三周内先后公开,并使用相同的三个文本智能体基准、三个模型骨干和大部分基线结果。当前归档中,Lang Feng 还参与了 GraphGPO,该工作从状态图与后继可达性构造逐步优势;SEED 改用完整轨迹生成的自然语言技能对采样 token 进行相对重加权。

论文脉络

1. 研究问题、背景和价值

长程智能体通常只在整条轨迹结束后得到成功、准确率或任务完成分数。GRPO 等结果奖励方法把同一条轨迹的相对优势广播到全部有效 token,因此一个成功轨迹中的绕路动作和关键动作会得到同方向信号;组内结果全部相同时,奖励驱动的策略梯度还会消失。

完整轨迹在训练结束后提供了更丰富的信息:后续观察和最终结果可以帮助分析哪些行为有效、失败发生在哪里、下一次应采用什么流程。SEED 研究怎样把这类事后信息转成训练时的细粒度辅助信号,同时让部署模型继续在普通交互历史下行动,不依赖技能提示、外部分析器或技能库。

真正需要检验的增量集中在两个问题:

  1. 当前策略能否同时承担环境执行与完整轨迹分析,并在策略更新后继续保持可靠的分析能力。
  2. 由同一策略生成的自然语言技能能否让采样 token 的门控重加权持续朝高回报方向变化。

2. 已有解决方案与不足

  • 结果奖励强化学习:GRPO 直接优化可验证的终局结果,监督稳定且实现简单,局部决策共享一个轨迹级优势。
  • 提示式技能与静态技能库:Skill-Prompt、Skill-GRPO 和 Skill-SD 在推理或训练上下文中加入预先构造的技能;固定库可能逐渐偏离更新后策略访问的状态,并引入检索与维护路径。
  • 自蒸馏:OPSD、RLSD 和 SDAR 用同一模型在普通上下文与特权上下文中的概率差形成 token 级信号。SEED 的门控似然项直接沿用 SDAR 的 sigmoid 置信门。
  • 在线事后技能蒸馏OPID 已经从当前策略的完整轨迹抽取 episode-level 与 step-level 事后技能,让策略在技能增强上下文中重新评分同一批采样动作,并把 token 级技能信号与结果奖励共同优化;推理时同样移除技能和分析器。

因此,SEED 的方法定位应收敛到“共享策略分析器的同步刷新”。它先用外部模型标注启动分析能力,此后每轮用最新策略快照同时采样轨迹和生成技能;OPD 辅助项则将 OPID 的带符号技能优势换成 SDAR 风格的门控似然训练。论文将静态方法纳入主表,却省略了机制和作者均最接近的 OPID。

3. 作者可能的思考路径

以下为本地分析。

第一步来自 OPID 的运行路径:当前策略生成的完整轨迹能够提供与当前访问分布一致的事后技能,但外部分析器仍是一项独立组件。若策略模型先学会“完整轨迹到技能”的映射,同一 checkpoint 就能在不同提示模板下分别执行任务和分析轨迹。

第二步来自 checkpoint 同步:每轮训练后用新策略替换旧快照,下一轮的执行器和分析器会一起刷新。这样可以消除跨轮次固定分析器带来的参数版本差异,且无需维护另一条分析器训练链。

第三步来自 SDAR 的门控损失:技能上下文提高某个已采样 token 的概率时,为它分配更大的辅助似然权重;概率下降时减小权重。将该项与 GRPO 相加,形成一条“轨迹采样—事后分析—技能重评分—策略更新”的循环。

4. 核心假设或切入点

  1. Stage 1 的外部标注足以让每个模型骨干获得可用的完整轨迹分析能力。
  2. 后续 actor 更新会同时改善或至少保留 analyzer 能力;Stage 2 没有直接监督技能生成质量。
  3. 技能引起的 token 概率增量与真实动作价值正相关。理论将这一条件写成门控系数与动作价值的正协方差,实验没有直接测量该量。
  4. 对同一批已采样动作重新评分,能够提供足够的局部区分信息;未采样替代动作只能通过 softmax 归一化间接改变概率。
  5. 每轮额外生成完整轨迹技能并执行技能上下文重评分的训练成本可以接受。
  6. 格式正确的自然语言技能大体具有行为意义。论文和主流程代码都没有用环境回放或人工标注验证技能正确性。

5. 方法 / 系统 / 理论框架

5.1 Stage 1:用外部标注启动轨迹分析能力

每个模型—基准配置先抽取 180 个训练任务,每个任务用基础策略生成 8 条轨迹,共 1,440 条。GLM-5.2 在看到任务、动作、观察、奖励与最终结果后,为成功或失败轨迹生成事后技能(hindsight skill)。作者只保留格式有效的输出,再用“完整轨迹输入—技能文本目标”做三轮监督微调。

得到的 SFT checkpoint 同时初始化后续 actor 与 analyzer。这里的外部模型承担能力启动,后续 Stage 2 不再调用 GLM-5.2。公开的 ALFWorld SFT 脚本明确标记 no_skill_validation,所以“retained”表示能够解析和满足格式要求,未表示该技能经过环境收益验证。

5.2 Stage 2:同一快照生成轨迹与事后技能

每轮更新先冻结当前策略为 πθold\pi_{\theta_{\mathrm{old}}}。它对每个任务采样 N=8N=8 条完整轨迹,随后在轨迹分析提示下,为每条轨迹生成一个事后技能。可训练策略 πθ\pi_\theta 从同一 checkpoint 初始化,并在两个上下文中重新评分原始采样动作:

  • ordinary branch 只看到部署时可用的普通交互历史;
  • skill branch 在相同历史中加入完整轨迹生成的技能。

skill branch 和 ordinary branch 都使用当前可训练模型 πθ\pi_\theta 计算概率,门控系数与 skill branch 的概率被停止梯度;轨迹采样、技能生成和重要性比率来自冻结快照。优化结束后,πθ\pi_\theta 成为下一轮新的执行器与分析器。

Figure 1: SEED 的两阶段训练与共享策略分析循环
Figure 1:Stage 1 用外部分析器标注完整轨迹并通过 SFT 启动轨迹分析能力;Stage 2 让最新策略快照同时执行任务和生成事后技能,再把技能上下文对同批动作的影响蒸馏回普通策略。Image Source: arXiv v1 TeX source, figures/SEED_framework.pdf.

5.3 门控 OPD 的实际梯度

对某个已采样 token,普通上下文和技能上下文下的对数概率分别记为 θ\ell^\thetaskill\ell^{\mathrm{skill}}。SEED 先计算停止梯度的概率差和门控系数:

Δ=sg ⁣[skillθ],g=σ(βopdΔ), \Delta=\operatorname{sg}\!\left[\ell^{\mathrm{skill}}-\ell^\theta\right], \qquad g=\sigma(\beta_{\mathrm{opd}}\Delta),

其中 βopd=5\beta_{\mathrm{opd}}=5。辅助损失为

Lopd=E ⁣[mg(sg ⁣[skill]θ)]. \mathcal L_{\mathrm{opd}} = \mathbb E\!\left[ m\,g\left(\operatorname{sg}\!\left[\ell^{\mathrm{skill}}\right]-\ell^\theta\right) \right].

停止梯度后,skill branch 的概率只决定权重,梯度简化为

θLopd=E ⁣[mgθθ]. \nabla_\theta\mathcal L_{\mathrm{opd}} = -\mathbb E\!\left[m\,g\,\nabla_\theta\ell^\theta\right].

因此,每个实际采样 token 接受的是正权门控交叉熵:技能概率差为负时,门控系数趋近零并减弱强化;该 token 不会由这一项直接获得负权重。带符号的相对效果在对候选 token 取期望并经过 softmax 归一化后出现。若某个候选的期望门控高于当前策略下的门控均值,它的相对概率上升;低于均值的候选相对概率下降。

这个区别影响“token 级信用分配”的解释。单条失败轨迹中的错误 token 仍可能被 OPD 以较小正权重强化,并与 GRPO 的负优势部分抵消;未被采样的更优替代动作没有直接教师目标。SEED 提供的是完整轨迹条件下的蒙特卡洛相对重加权信号,现有证据没有建立因果 token 归因。

5.4 与 GRPO 联合优化

SEED 继续计算每组轨迹的标准化结果优势,把同一轨迹优势广播到全部有效动作 token,并使用 PPO-style clipping 与参考策略 KL。总损失为:

LSEED=LGRPO+βKLDKL+λopdLopd, \mathcal L_{\mathrm{SEED}} = \mathcal L_{\mathrm{GRPO}} +\beta_{\mathrm{KL}}D_{\mathrm{KL}} +\lambda_{\mathrm{opd}}\mathcal L_{\mathrm{opd}},

其中论文报告 βKL=0.01\beta_{\mathrm{KL}}=0.01λopd=0.01\lambda_{\mathrm{opd}}=0.01。部署时只保留 ordinary actor,不生成技能,也不执行技能上下文重评分。

5.5 真正增量:把外部分析器蒸馏进当前策略

维度 OPID SDAR SEED
事后信息来源 当前策略完整轨迹,由外部分析器抽取分层技能 静态或预设的技能增强上下文 当前策略完整轨迹,由共享策略快照生成单条轨迹技能
actor / analyzer 关系 策略与外部分析器分离 同模型普通分支与技能分支 同一最新 checkpoint 分别承担 actor 与 analyzer 角色
token 更新 技能概率差形成带符号优势并进入 PPO sigmoid 门控的采样 token 似然项 沿用 SDAR 风格门控似然项,与 GRPO 相加
推理路径 只保留普通策略 只保留普通策略 只保留普通策略

SEED 的区别性机制由两部分组成:外部 GLM 标注加 SFT 使策略获得轨迹分析能力;每轮新 checkpoint 同时刷新行为分布和分析器。在线轨迹技能闭环已由 OPID 建立,门控辅助损失已由 SDAR 建立。SEED 的贡献更适合描述为这两条路线的共享参数化与同步更新配方。

5.6 训练计算路径

论文报告每个模型训练 150 次策略更新,ALFWorld / WebShop batch size 为 16,Search 为 128,group size 为 8,学习率为 10610^{-6},动作回答上限为 512 token,环境步数上限分别为 30、15 和 4,并使用 8 张 80GB A800。

每轮相对 GRPO 增加两类工作:

  1. 对每条完整轨迹执行一次 analyzer generation;
  2. 在技能增强上下文中对相同动作执行额外 log-probability scoring。

Stage 1 还包含额外的 1,440 条轨迹、GLM-5.2 标注和三轮 SFT。论文的“sample efficiency”只按训练任务比例计量,未计入这些 token、前向计算、外部模型调用、显存、FLOPs 或实际用时。

6. 结论链条

  1. 假设:完整轨迹生成的技能能区分局部候选行为,且这种支持度与真实动作价值正相关。
  2. 机制:先把外部轨迹分析能力蒸馏进策略,再让最新 checkpoint 每轮同时采样轨迹与生成技能,以技能概率差门控普通上下文中的采样 token 似然。
  3. 直接证据:三种小模型在 ALFWorld、Search-based QA 和 WebShop 的 12 个汇总指标中取得 10 个最优或并列最优;单一 ALFWorld 配置的组件消融分别下降 4.8–7.4 分。
  4. 最窄结论:在作者的三个文本环境、三个 Qwen 小模型和单次报告协议中,Stage 1 轨迹分析 SFT 加同步技能门控辅助训练能提高结果奖励强化学习的汇总表现。
  5. 边界:直接前作 OPID 缺席主表,方法增加明显训练计算,且缺少多随机种子、技能质量演化、计算对齐和更广泛环境验证。

关键实验/定理

结果 1:相对纳入主表的基线,12 个汇总指标中有 10 个最优或并列最优

  • 设置:Qwen2.5-3B-Instruct、Qwen2.5-7B-Instruct、Qwen3-1.7B-Instruct;ALFWorld 六类任务、Search-based QA 七个数据集、WebShop 128 个测试任务;每个训练任务采样 8 条轨迹,训练 150 次策略更新。
  • Baseline:Vanilla、Skill-Prompt、OPSD、GRPO、Skill-GRPO、GRPO+OPSD、Skill-SD、RLSD 和 SDAR。
  • 指标:ALFWorld macro success、Search macro accuracy、WebShop mean task-completion score 与 exact success。
  • 结果:
骨干 方法 ALFWorld Search WebShop score WebShop success
Qwen2.5-3B GRPO 75.0 36.4 79.8 63.3
Qwen2.5-3B SEED 91.8 45.7 88.5 78.9
Qwen2.5-7B GRPO 81.2 42.0 80.9 72.6
Qwen2.5-7B SEED 96.1 48.6 89.7 78.1
Qwen3-1.7B GRPO 46.1 40.8 67.3 38.3
Qwen3-1.7B SEED 92.0 42.2 87.1 77.3
  • 对照是否可比:作者称 reproduced post-training baselines 使用相同骨干、rollout budget 和训练日程;没有披露每项基线的调参范围、随机种子数或置信区间。Qwen2.5-7B 上,SDAR 的 Search 49.0 与 WebShop success 82.8 高于 SEED。
  • 系统条件:8×A800 80GB;论文未报告 baseline 与 SEED 的实际用时、FLOPs、训练 token 或 analyzer 服务成本。
  • 证据定位:Section 4.1–4.2;Table 1;Appendix B.4;Tables 6–9;PDF pp. 6–8、15–17。
  • 支持的最窄结论:在主表纳入的方法与作者单次报告协议下,SEED 对三个模型的 ALFWorld 和 WebShop score 都取得最高汇总值,并在 12 个汇总指标中有 10 个最优或并列最优。
  • 解读:Qwen3-1.7B 的 ALFWorld 和 WebShop 提升最大,Search 的增量只有 1.4 分;收益随环境和模型明显变化。

结果 2:外部复原的 OPID 直接对照显示增量集中于部分模型与环境

  • 设置:将 SEED Table 1 与三周前 OPID Table 1 的相同骨干、基准和汇总指标并列。两篇论文的共同基线逐项数值完全相同,支持它们使用同一评测协议;该比较仍属于跨论文复原,缺少作者提供的配对实验和随机种子。
  • Baseline:OPID,SEED 作者团队的直接前作。
  • 指标:与结果 1 相同的 12 个汇总指标。
  • 结果:
骨干 ALFWorld Search WebShop score WebShop success
Qwen2.5-3B:SEED − OPID +7.5 +0.7 +3.5 +4.7
Qwen2.5-7B:SEED − OPID +6.1 -0.6 +4.4 -1.6
Qwen3-1.7B:SEED − OPID +33.1 +1.8 +7.5 +12.5
  • 对照是否可比:共同 baseline、模型与评测数值一致,使汇总值具有较强可比线索;两篇论文都没有多随机种子,训练初始化、代码版本和未披露配置可能不同。
  • 证据定位:SEED arXiv v1 Table 1OPID arXiv v1 Table 1
  • 支持的最窄结论:SEED 在 12 项中有 10 项高于 OPID,优势主要来自 Qwen3-1.7B 的 ALFWorld 与 WebShop;Qwen2.5-7B 的 Search 和 WebShop success 低于 OPID。
  • 解读:这组复原结果提示共享策略分析器可能有增量价值,也显示“全面优于外部分析器 OPID”的结论缺少正式实验支持。主表省略 OPID 会显著影响读者对新颖性和收益来源的判断。

结果 3:单一 ALFWorld 配置的消融支持三项组件共同存在

  • 设置:Qwen2.5-3B-Instruct、ALFWorld;比较完整 SEED、去除事后技能 SFT、去除同步 OPD、用静态离线技能库替代当前策略技能。
  • Baseline:完整 SEED 91.8;对应消融分别为 86.0、87.0、84.4。
  • 指标:ALFWorld 六类任务 macro success。
  • 结果:去除 Stage 1 SFT 下降 5.8 分;去除 Stage 2 同步 OPD 下降 4.8 分;换成静态技能下降 7.4 分。静态技能变体的 84.4 与主表 SDAR 完全相同。
  • 对照是否可比:同一模型和环境内可比较,论文未报告多次训练或 factorial design。完整方法与 “w/o Self-Evolving OPD” 的 4.8 分差最接近在线循环的增量;相对 GRPO 的 16.8 分还包含不同 SFT 初始化和外部标注数据。
  • 证据定位:Section 4.6;Table 2;PDF p. 9;TeX source tables/ablation_on_seed.tex
  • 支持的最窄结论:在一个模型—环境配置中,Stage 1 初始化、Stage 2 辅助训练和当前策略技能三项分别对最终结果有正向贡献。
  • 解读:当前消融支持完整配方,尚未分离“共享分析器”“每轮刷新”“技能文本内容”和“额外前向计算”各自的净贡献。

结果 4:训练任务利用率提高,完整计算效率尚未测量

  • 设置:Qwen2.5-3B 的 ALFWorld 与 WebShop,分别使用 20%、40%、60%、80% 和 100% 训练实例。
  • Baseline:相同比例训练数据下的 GRPO。
  • 指标定义:ALFWorld success 与 WebShop success;横轴是可用训练任务比例。
  • 结果:ALFWorld 中,SEED 使用 60% 数据得到 80.7,高于 GRPO 使用 100% 数据的 75.0;WebShop 中,SEED 使用 80% 数据得到 75.0,高于 GRPO 使用 100% 数据的 63.3。五个数据比例下 SEED 都高于 GRPO。
  • 对照是否可比:训练任务比例对齐,单任务计算未对齐。SEED 额外执行 Stage 1 GLM 标注、在线 analyzer generation 和技能上下文重评分。
  • 成本归因:证据支持“每个训练任务产生更高最终分数”;它未支持更低总 token、GPU-hours、FLOPs、外部模型成本或墙钟时间。
  • 证据定位:Section 4.4;Figure 3;Appendix B.5;Table 10;PDF pp. 8、17。
  • 支持的最窄结论:在两个环境和一个 3B 模型中,SEED 的训练任务利用率高于 GRPO。
  • 解读:论文使用 “sample efficiency” 合理描述数据轴;工程部署需要补充 compute-matched 和 wall-clock-matched 曲线。

结果 5:ALFWorld 未见配置和两个视觉任务提供范围扩展证据

  • 设置:Qwen2.5-3B 在 ALFWorld unseen split 上评测;Qwen2.5-VL-3B-Instruct 在 Sokoban 6×6 与 EZPoints 上评测。
  • Baseline:ALFWorld unseen 的 GRPO;视觉任务的 ReAct 与 GRPO。
  • 指标:success rate。
  • 结果:ALFWorld unseen 中 SEED 平均 86.2,GRPO 为 70.9,六类中五类提高,Clean 下降 2.9 分;Sokoban / EZPoints 中 SEED 为 82.0 / 100.0,GRPO 为 67.1 / 86.9,平均提高 14.0 分。
  • 对照是否可比:ALFWorld 仍属于同一 benchmark 与相同任务家族,适合称为 held-out scene/configuration transfer;视觉附录未给出完整训练数据量、超参数、测试样本量或多随机种子。
  • 证据定位:Section 4.5;Figure 3;Appendix B.6,Table 11;Appendix B.10,Table 17;PDF pp. 8、17、21。
  • 支持的最窄结论:SEED 的收益在 ALFWorld 未见配置与两个小型视觉智能体任务中保持正向。
  • 解读:这组结果扩大了模态覆盖,尚未建立跨 benchmark、开放网页或软件工程环境的广泛泛化能力。

结果 6:三个命题刻画了更新结构,没有保证回报单调改善

  • 假设:softmax 策略具有正支持;token score gradient 有界;价值解释还要求门控系数与真实动作价值正相关。
  • 适用域:每轮开始时行为策略、分析器和被评分策略同步的局部更新;staleness 结果比较固定当前策略下不同分析器产生的技能影响。
  • 对照是否可比:三个命题分析 SEED 自身的期望梯度、奖励平局情形和分析器版本差,没有经验 baseline 或收敛率对照;它们用于界定更新结构,不能替代对 OPID、SDAR 或 GRPO 的实验比较。
  • 结果:
    1. Proposition 1 将期望 OPD 梯度写成当前 token-context occupancy 上、朝技能门控重加权目标的 KL 梯度;旧轨迹引起的差异受 TV / KL 距离上界约束。
    2. Proposition 2 证明组内奖励相同时 GRPO 结果梯度为零,而 OPD logit 梯度在候选 token 的期望门控不恒定时非零;梯度加权范数等于门控方差。
    3. Proposition 3 用技能引起的 log-probability shift 差上界旧分析器与当前分析器的 OPD 梯度差;同步 checkpoint 在轨迹生成阶段令跨轮次版本差为零。
  • 证据定位:Appendix C,Propositions 1–3,Eqs. (18)–(35);TeX source theoretical_analysis.tex
  • 支持的最窄结论:SEED 的辅助项在形式上构成当前访问分布上的候选相对重加权,并且同步分析器消除了数据生成阶段的跨 checkpoint 版本差。
  • 解读:论文明确说明这些是局部结构结论。命题 3 没有证明新分析器更准确;命题 2 只证明信号非退化;回报改善需要门控支持度与真实价值正相关。

结果 7:公开代码能核对核心损失,也暴露了配置与质量验证缺口

  • 适用版本:GitHub commit 2cf2fadca3c5aba28da68e8e1405182ba8d90e6c,提交时间 2026-07-17 13:09 +08:00;核验于 2026-07-23。
  • 结果:
    • verl/trainer/ppo/core_algos.py::compute_opd_loss 实现 teacher log-probability 停止梯度、sigmoid gate 与门控似然项,和论文公式一致。
    • scripts/sft/alfworld/pipeline.py 明确说明跳过 downstream skill validation,并将数据版本写成 no_skill_validation
    • ALFWorld / WebShop 公共启动脚本设置 trainer.total_epochs=160,论文报告 150 次策略更新。
    • Search 公共启动脚本设置 actor_rollout_ref.actor.kl_loss_coef=0.001,论文超参数表报告 0.01。
  • 对照是否可比:仓库 HEAD 比 arXiv v1 晚一天,仓库没有与论文实验绑定的 release / tag;配置差异可能来自公开代码后续修改或论文正文误差。
  • 证据定位:GitHub commitverl/trainer/ppo/core_algos.pyscripts/sft/alfworld/pipeline.pyexamples/seed_trainer/_common/alfworld.shexamples/seed_trainer/_common/webshop.shexamples/seed_trainer/_common/search.sh
  • 支持的最窄结论:公开代码足以确认核心 OPD 梯度和训练路径,当前 HEAD 无法唯一复原论文的全部实验配置与技能质量筛选。
  • 解读:复现时应先固定 paper commit、统一 150/160 次更新与 Search KL 系数,再记录 analyzer token、技能解析通过率和每轮额外 scoring 成本。

实验与系统设置审计

维度 记录
模型 Qwen2.5-3B-Instruct、Qwen2.5-7B-Instruct、Qwen3-1.7B-Instruct;视觉附录使用 Qwen2.5-VL-3B-Instruct。
文本环境 ALFWorld、WebShop、Search-R1 protocol 下的七个 QA 数据集。
SFT 数据 每个配置 180 个任务×8 rollouts,共 1,440 条轨迹;GLM-5.2 生成技能;三轮 SFT。
RL 预算 150 policy updates;batch size 16 / 16 / 128;group size 8;response length 512。
硬件 8×A800 80GB。
随机性 未报告训练 seed 数、均值、方差、置信区间或显著性;公共环境代码出现固定 seed 0。
成本报告 未报告 GPU-hours、墙钟时间、FLOPs、训练 token、外部 GLM 调用成本或 analyzer generation 占比。
代码状态 MIT;无 release / tag;当前核验 commit 晚于 arXiv v1 一天。

局限

  1. 增量基线缺失。 OPID 已覆盖当前策略轨迹、完整轨迹事后技能、同批动作重评分、训练时技能与推理时移除,并且作者团队完全相同。主表不含 OPID,使共享策略分析器相对外部分析器的净收益无法由论文内部直接判断。
  2. 方法由已有机制组合形成。 在线轨迹技能闭环来自 OPID,sigmoid 门控似然项来自 SDAR;SEED 的区别性部分是轨迹分析 SFT、共享参数化和 checkpoint 同步刷新。论文对这三项的独立消融不足。
  3. 分析器没有持续的直接训练目标。 Stage 2 只用 GRPO 与普通 actor branch 的 OPD 更新参数,未继续训练“完整轨迹到正确技能”的生成任务。参数共享会让 analyzer 随 actor 一起变化,方向可能改善也可能退化。
  4. 技能质量只做格式过滤。 论文没有人工正确率、环境回放收益、跨轮次一致性、失败技能错误率或技能—动作价值协方差;公开主 SFT 脚本明确跳过 downstream skill validation。
  5. 局部信用解释受采样限制。 每个已采样 token 的 OPD 权重始终为正,负向效果通过候选间归一化产生。失败轨迹的坏 token 仍可能获得辅助强化,未采样替代动作没有直接监督。
  6. 数据利用率与计算效率尚未区分。 每轮增加完整轨迹 analyzer generation 和技能上下文 scoring,Stage 1 还增加外部 GLM 标注与 SFT;论文只按训练任务比例报告 sample efficiency。
  7. 统计证据不足。 主结果、消融、未见配置与视觉任务均没有多随机种子、误差条、置信区间或显著性。ALFWorld 主测试约 140 条、WebShop 128 条,小差值不宜解释为稳定排序。
  8. 消融范围窄。 全部核心消融只覆盖 Qwen2.5-3B / ALFWorld,没有 factorial design,也没有分别固定 actor、analyzer、技能库和额外计算预算。
  9. 理论结论较局部。 三个命题证明更新结构、信号非退化和版本差上界;它们没有证明技能正确、当前分析器优于旧分析器、token 具有因果归因或回报单调提高。
  10. 可复现配置存在差异。 论文的 150 次更新、KL 系数 0.01 与公共脚本的 160 epochs、Search KL 系数 0.001 不完全一致,且缺少论文实验对应 tag。
  11. 外部有效性有限。 文本主实验集中于三个受控环境和三个 1.7B–7B Qwen 模型;ALFWorld unseen 仍在同一 benchmark 内,视觉附录披露不足,开放网页、软件工程、动态工具和更大模型尚未验证。

跨论文关系

  • 与直接前作 OPID:两者共享完整作者列表、三个文本环境、三个骨干和共同基线结果。OPID 已建立当前策略轨迹到事后技能再到 token 级重评分的闭环;SEED 把外部 analyzer 的能力先蒸馏进策略,并在每轮用最新 checkpoint 同步刷新 actor 与 analyzer。
  • 与 SDAR(arXiv:2605.15155):SEED 明确沿用其 sigmoid 门控 OPD 损失;主要变化位于特权上下文的来源和更新方式,从静态技能转为当前策略完整轨迹生成的技能。
  • CriPO:两者都让同一模型在普通上下文和特权上下文下重评分当前采样 token。CriPO 用评分项诊断选择局部自教师或改写优势;SEED 用完整轨迹事后技能给全部有效 token 分配连续门控系数。
  • ReOPD:ReOPD 用教师轨迹前缀关闭 student distillation 阶段的环境,并由独立教师提供分布监督;SEED 持续执行在线环境交互,教师信息由同一策略对完整轨迹的事后分析产生。两者分别优化环境成本和事后监督适配。
  • GraphGPO:GraphGPO 依赖状态可合并与成功节点可达性,构造可解释的逐步优势;SEED 不建状态图,使用自然语言技能对采样 token 做相对重加权。Lang Feng 同时参与两项工作。
  • Credit Assignment Survey:SEED 位于 trajectory hindsight、privileged-context self-distillation 与 token-level shaping 的交界。其 token 信号具有细粒度系数,仍依赖整条轨迹完成后的蒙特卡洛分析,适合归为事后条件重加权,暂不宜等同于因果信用识别。