2607.04763-reopd-prefix-replay-agentic-distillation

Multi Turn On Policy Distillation with Prefix Replay

ReOPD 把教师 RL 轨迹拆成按轮次采样的 replayed prefixes,让学生只在选定的当前步生成动作并接受 teacher reverse-KL token supervision,从而在学生训练阶段实现零工具调用;Qwen3 数学与搜索实验显示其单次 rollout 至少快于在线 OPD 4 倍且平均准确率持平或更高,可信边界包括必须具备带 observation 的教师轨迹池、教师支持度只是可靠性的代理、固定为 0.6 的采样衰减系数尚无自适应保证,以及当前仓库缺少核心 prefix-pool 构造脚本。

Authors Baohao Liao, Hanze Dong, Christof Monz, Xinxing Xu, Li Dong (董力), Furu Wei (韦福如)

已审阅 Archived 2026-07-18 18:00 Updated 2026-07-23 18:09 Reviewed 2026-07-23 18:12 Source

Source

  • Workflow version: v2.1
  • Material type: research-paper
  • Analysis modules: experiment, system, theory
  • Canonical source: https://arxiv.org/abs/2607.04763
  • Title: Multi-Turn On-Policy Distillation with Prefix Replay
  • Authors: Baohao Liao, Hanze Dong, Christof Monz, Xinxing Xu, Li Dong, Furu Wei
  • Responsible organization: Microsoft Research;University of Amsterdam
  • arXiv: https://arxiv.org/abs/2607.04763
  • PDF: https://arxiv.org/pdf/2607.04763
  • HTML: https://arxiv.org/html/2607.04763
  • Code/Project: GitHub repositoryproject page
  • Models/Data: https://huggingface.co/collections/baohao/reopd
  • OpenReview / Review page: 未发现与题名、作者和 arXiv ID 匹配的公开 OpenReview / conference review page
  • Submitted: 2026-07-06
  • Published / updated: v2 updated 2026-07-16
  • Current version read: v2
  • Version / revision read: arXiv v2 PDF、HTML、TeX source;代码仓库 commit 68042688f73c928d25e4caff95e28c74c27a24ba
  • Accessed: 2026-07-18
  • Key figure decision: include
  • Review status: page-type=not-found; match-confidence=high; observed-at=2026-07-18; venue-status=arXiv preprint
  • Subjects: Machine Learning (cs.LG);Artificial Intelligence (cs.AI);Computation and Language (cs.CL);Machine Learning (stat.ML)

作者与关系

作者关系呈现一条明确的 Microsoft Research—University of Amsterdam 桥接。Baohao Liao 同时属于两家机构,并在个人主页确认 Christof Monz 是其博士导师;Baohao Liao 与 Hanze Dong 为共同一作,此前也共同完成过 Reward-Guided Speculative Decoding 和 Fractured Chain-of-Thought Reasoning 等工作。Microsoft Research 侧的 Hanze Dong、Xinxing Xu、Li Dong 与 Furu Wei 组成同机构后训练团队。

当前归档中,Li DongFuru Wei 还共同出现在 LLM-in-Sandbox;前一篇研究怎样用在线 computer environment 训练和评测 agent,ReOPD 进一步研究怎样复用这类 teacher RL 轨迹,在 student distillation 阶段关闭环境。

论文脉络

1. 研究问题、背景和价值

On-policy distillation(OPD)让学生先沿自身策略生成,再由教师在学生访问到的 token context 上提供分布监督。单轮文本任务中,主要成本来自 student generation 和 teacher prefill。多轮 agent 任务还需要执行 Python、搜索或其它工具:学生每生成一次动作,环境必须返回 observation,下一轮历史也随之改变。在线 OPD 因而在每次更新中重复承担 student rollout、环境执行和 teacher query。

论文关注一个更具体的系统问题:教师通常已经通过 GRPO 等 RL 训练,并留下了完整的 action—observation trajectories。能否把这些轨迹转为学生 OPD 的 roll-in,继续保留学生自身动作上的 dense teacher supervision,同时停止环境调用?这一改写将环境交互从每次 student update 的在线依赖,转成可跨学生、任务和训练轮次复用的离线数据资源。

2. 已有解决方案与不足

  • 在线 multi-turn OPD:学生在 live environment 中重跑完整轨迹,history 与部署时 student occupancy 最接近,代价是持续部署工具、检索器、sandbox 与并发 worker。
  • 教师轨迹 SFT:直接模仿 teacher actions,训练简单且无需在线环境,监督 context 全部来自 teacher,学生在自己的当前动作上得不到 teacher distribution feedback。
  • 普通 replay / imitation:可以复用历史轨迹,但容易把“行为数据来自谁”和“当前被监督动作由谁生成”混为一个分布问题。
  • 单轮 GKD / OPD:已经说明 student-generated token context 能缓解 exposure bias,尚未处理 environment transition 使历史分布逐轮累积偏移的问题。

多轮场景还多出一项教师可靠性约束。完全沿学生 roll-in 虽然贴近 student occupancy,教师可能在自己很少访问的异常历史上给出低质量 target;完全沿 teacher roll-in 能保持 teacher support,又会偏离学生部署时到达的历史。论文把这两项偏差放进同一 prefix-distribution 设计问题。

3. 作者可能的思考路径

以下为本地分析。

第一步来自系统复用:teacher RL 已经支付了环境 rollout 成本,且轨迹保存了全部 observation。学生训练若只需要一个历史前缀作为条件,可以直接回放这些 observation,无需重新执行动作。

第二步来自 OPD 定义的拆分:多轮 history 的 roll-in 来源与当前 action 的生成策略可以分开。前缀采用 teacher trajectory,当前 action 仍由 student 生成;teacher 再沿 student action 的 token prefixes 给 reverse-KL target。这样保留了局部 token context 的 on-policy 性质。

第三步来自误差随深度累积:学生完全复现 teacher 前 t1t-1 个动作的概率会随 tt 下降,teacher prefix 越深,越难代表 student 自己会访问的 history。把精确 student/teacher occupancy ratio 近似为只依赖 step index 的几何衰减,就得到低成本的 κt\kappa^t 采样日程。

4. 核心假设或切入点

  1. 可获得带完整 action 和 observation 的 teacher trajectory pool;最理想来源是 teacher RL 期间已经保存的 rollouts。
  2. 教师在接近自身 interaction occupancy 的 histories 上更可靠,离开该 support 后 target 质量可能下降。论文没有直接观测 ideal target,因此用 teacher support 距离作为 reliability surrogate。
  3. 学生与教师在同一 replayed history 上计算 action likelihood,环境转移项可以在 occupancy ratio 中抵消。
  4. 累积 student/teacher likelihood ratio 的主要变化可由 interaction depth 解释,因而 κt\kappa^t 能近似高方差的 per-history ratio。
  5. “on-policy”作用在被监督的当前 student action 及其 token contexts;此前的多轮 roll-in 由 teacher 强制回放。方法的命名应按这个局部定义理解。

5. 方法 / 系统 / 理论框架

5.1 多轮 OPD 的两侧偏差

对输入 xx 和第 tt 个交互步,history 记为

Ht=(O1,A1,,At1,Ot). H_t=(O_1,A_1,\ldots,A_{t-1},O_t).

当前学生与环境共同诱导 occupancy dθoldtd_{\theta_{\mathrm{old}}}^t,教师与环境诱导 dTtd_T^t。理想 improvement target qtq_t^\star 无法获得,作者先定义在 student occupancy 上评估新学生的理想目标 R\mathcal R^\star,再比较使用 teacher target、有效 prefix distribution ρt\rho_t 的 replayed objective Lρ\mathcal L_\rho

在 ideal-target loss 有界的条件下,Proposition 1 给出:

RLρExt=1Tαt{2BTV ⁣(dθoldt,ρt)+EHtρt ⁣[ϵT,tθ(x,Ht)]}. \left|\mathcal R^\star-\mathcal L_\rho\right| \le \mathbb E_x\sum_{t=1}^T\alpha_t \left\{ 2B\,\mathrm{TV}\!\left(d_{\theta_{\mathrm{old}}}^t,\rho_t\right) + \mathbb E_{H_t\sim\rho_t}\!\left[\epsilon_{T,t}^{\theta}(x,H_t)\right] \right\}.

第一项衡量 replay distribution 与学生实际 occupancy 的距离;第二项衡量 teacher target 与未知 ideal target 之间的 loss 差。这个分解说明完全 student-on-policy 只能消除第一项,teacher-forced roll-in 主要约束第二项。

5.2 从可靠性代理到 geometric bridge

真实的 ϵT,tθ\epsilon_{T,t}^{\theta} 无法直接估计。论文用到 teacher occupancy 的 KL 距离代理可靠性,求解

minρtλstu,tDKL(ρtdθoldt)+λtea,tDKL(ρtdTt). \min_{\rho_t} \lambda_{\mathrm{stu},t}D_{\mathrm{KL}}(\rho_t\Vert d_{\theta_{\mathrm{old}}}^t) + \lambda_{\mathrm{tea},t}D_{\mathrm{KL}}(\rho_t\Vert d_T^t).

当两个分布 support 重叠时,解是 geometric bridge:

ρt(htx)[dθoldt(htx)]γt[dTt(htx)]1γt,γt=λstu,tλstu,t+λtea,t. \rho_t^\star(h_t\mid x) \propto \left[d_{\theta_{\mathrm{old}}}^t(h_t\mid x)\right]^{\gamma_t} \left[d_T^t(h_t\mid x)\right]^{1-\gamma_t}, \qquad \gamma_t=\frac{\lambda_{\mathrm{stu},t}} {\lambda_{\mathrm{stu},t}+\lambda_{\mathrm{tea},t}}.

γt=1\gamma_t=1 对应 student occupancy,γt=0\gamma_t=0 对应 teacher occupancy。它是一项由代理目标导出的分布插值,没有直接证明 teacher support 等价于 teacher reliability。

5.3 从 exact density ratio 到 step decay

teacher pool 的采样分布 PtdTt\mathcal P_t\approx d_T^t。要用该池实现 bridge,精确 importance weight 为

wt(x,ht)(dθoldt(htx)dTt(htx))γt. w_t(x,h_t)\propto \left(\frac{d_{\theta_{\mathrm{old}}}^t(h_t\mid x)}{d_T^t(h_t\mid x)}\right)^{\gamma_t}.

在同一 recorded prefix 上,环境 transition factors 抵消,剩下此前 teacher actions 的累计策略 likelihood ratio:

r^t(x,ht)=s<tπθold(asx,hs)πT(asx,hs). \widehat r_t(x,h_t)= \prod_{s<t} \frac{\pi_{\theta_{\mathrm{old}}}(a_s\mid x,h_s)} {\pi_T(a_s\mid x,h_s)}.

精确 r^tγt\widehat r_t^{\gamma_t} 会随 history 波动,估计方差高。若平均每步 teacher—student reverse-KL gap 近似稳定,

logr^t(t1)cˉ,r^tγtκt,κ=exp(γtcˉ)(0,1]. \log \widehat r_t\approx-(t-1)\bar c, \qquad \widehat r_t^{\gamma_t}\approx\kappa^t, \qquad \kappa=\exp(-\gamma_t\bar c)\in(0,1].

实际算法统一采用 ω(t;κ)=κt\omega(t;\kappa)=\kappa^t,默认 κ=0.6\kappa=0.6,按 ptκtp_t\propto\kappa^t 抽取训练位置。这里存在一个重要近似边界:exact weight 在同一 step 内区分不同 histories,step-decay 在 step 之间重新分配训练质量;后者保留平均深度趋势,也丢失了 per-history support 差异。

5.4 离线训练数据流

Figure 2: OPD and ReOPD training workflows
Figure 2:在线 OPD 持续执行 student–environment rollout;ReOPD 从离线 teacher trajectory pool 回放 prefix,只让 student 在采样位置生成当前 action,并用随深度衰减的权重控制 teacher reliability。Image Source: arXiv HTML Figure 2.

对 teacher trajectory 中选定的第 tt 步:

  1. 回放此前所有 teacher actions A<tA_{<t} 和 recorded observations OtO_{\le t}
  2. Student 在该 prefix 上自回归生成当前 action AtA_t,该 action 不发送给环境。
  3. Teacher 在 student 已生成的 token contexts 上提供每 token distribution。
  4. DKL(πθπT)D_{\mathrm{KL}}(\pi_\theta\Vert\pi_T) 更新 student。
  5. 下一条样本继续从离线 pool 独立构造,因而学生生成的 action 不产生后续 observation。

采样 schedule 在 data preparation 阶段生效,训练 loss 保持普通 OPD 形式。若 teacher RL rollouts 已保存,student 阶段无需部署 environment;若没有可复用轨迹,可先让 teacher 一次性收集全部 prefixes,再关闭环境。

6. 结论链条

  1. Multi-turn OPD 的在线成本主要来自每次更新都需要重新执行 environment transitions。
  2. Teacher RL traces 已包含 action—observation histories,可以提供无需执行的 roll-in prefixes。
  3. 在 replayed prefix 上让 student 生成当前 action,可保留当前 action token contexts 的 on-policy supervision。
  4. Replayed histories 同时受到 student occupancy mismatch 与 teacher reliability mismatch;两侧分解支持在两种 occupancy 之间选择有效分布。
  5. Exact density ratio 可由 student/teacher action likelihood 计算,step index 是更便宜的粗粒度代理。
  6. 数学与搜索实验支持“离线 prefix replay 能达到 OPD 级别准确率并显著降低 student rollout 成本”;现有证据覆盖两个受控工具环境和 Qwen3 模型族。

关键实验/定理

结果 1:两侧误差分解定位了 prefix distribution 的两个目标

  • 假设:ideal-target loss 一致有界;KL 情况还需要 target conditional 在 support 上存在概率下界。
  • 适用域:固定 input distribution、有限交互步数、可定义 student / teacher environment occupancy 的 multi-turn distillation。
  • 对照是否可比:该结果是目标函数分解,没有经验 baseline;比较对象是同一 student update 下的 ideal objective 与 replayed teacher objective。
  • 结果:Proposition 1 将 ideal objective 与 replayed teacher objective 的差上界为 student occupancy TV mismatch 与 teacher reliability error 之和。
  • 证据定位:Section 3, Proposition 1, Eq. (6);TeX source sections/formulation.tex
  • 支持的最窄结论:prefix distribution 同时决定训练 history 是否贴近 student,以及 teacher 是否在可靠 region 内被查询。
  • 解读:该命题提供诊断框架。它没有给出可观测的 reliability estimator,也没有证明固定 κ\kappa 最优。

结果 2:数学任务上 ReOPD 全部四组 teacher—student 设定达到或超过 OPD

  • 设置:Python-tool mathematical reasoning;2K ReTool cold-start traces,6.4K DAPO prompts;Qwen3-4B / 8B / 30B-A3B teachers 与 Qwen3-4B / 8B students;训练 200 steps。
  • Baseline:Cold Start、teacher-trajectory SFT、fully online student-on-policy OPD;OPD 与 ReOPD 共用 teacher target、batch size 和 update steps,prefix distribution 不同。
  • 指标:AIME24、AIME25、AMC23、Minerva、OlympiadBench、MATH500 的 macro average。
  • 结果:4B→4B 为 55.157.255.1\to57.2;8B→4B 为 51.053.751.0\to53.7;30B-A3B→4B 为 51.152.551.1\to52.5;30B-A3B→8B 为 56.556.856.5\to56.8。8B→4B 的 AIME24 从 28.328.3 提升到 36.736.7
  • 对照是否可比:模型、训练步数和 teacher signal 对齐;online OPD 执行真实环境,ReOPD 使用 teacher pool,系统路径因方法定义而不同。
  • 证据定位:Section 5.2,Table 4;Section 5.3 “Two regimes in practice”。
  • 支持的最窄结论:在论文的 Qwen3 数学设置中,teacher-supported replay 没有损失平均准确率,teacher—student gap 较大时优势更明显。
  • 解读:四组结果方向一致,但论文没有报告多训练 seed、误差线或显著性,+0.3+0.3 这类小差值应视为持平。

结果 3:搜索与双环境训练主要显示 accuracy preservation

  • 设置:Search-R1 风格 retrieval environment;2K cold start,6.5K NQ + HotpotQA prompts;2018 Wikipedia、E5 retriever、top-3 passages;七个 QA benchmarks。双环境实验把 math 和 search data 合并训练同一 Qwen3-4B student,并分别使用两个领域 teacher。
  • Baseline:fully online OPD。
  • 指标:搜索 micro average;数学 macro average。
  • 结果:搜索 4B teacher 下 OPD / ReOPD 为 40.6/40.540.6/40.5,8B teacher 下为 39.1/39.039.1/39.0。双环境中 math 为 55.2/55.355.2/55.3,search 均为 41.041.0
  • 对照是否可比:共享 student、数据、teacher target 与训练配置;ReOPD 省去在线 retriever 路径。
  • 证据定位:Section 5.2,Tables 5–6。
  • 支持的最窄结论:在受控离线 Wikipedia 搜索环境和两个领域的 joint training 中,prefix replay 可以保持在线 OPD 的 aggregate accuracy。
  • 解读:这些结果支撑环境下线后的能力保持;尚未覆盖 open-web search、状态会变化的工具或软件工程 sandbox。

结果 4:学生训练阶段零工具调用,单次 rollout 至少加速 4 倍

  • 设置:全部实验在 8×8\timesH100 上使用 Slime;ReOPD 训练可在 3 小时内完成。数学在线 OPD 需要 32 个并发 Python processes;搜索环境部署 retriever 与 Wikipedia embeddings 需要 80GB GPU memory。
  • 系统条件:主效率比较把 teacher RL 轨迹视为已有资源,只比较 student distillation rollouts;附加实验把 teacher 一次性 resampling 时间计入。
  • 对照是否可比:OPD 与 ReOPD 使用同一 teacher target、batch size 和 update steps;两者的 environment execution 差异就是被测系统机制,完整 pipeline compute 未严格匹配。
  • 指标定义:tool-call count、rollout-step / per-rollout time、环境进程和显存需求。
  • 结果:ReOPD student training 为零工具调用,per-rollout 至少快 4×4\times,图中不同设置约为 449×9\times;计入单次 teacher resampling 后仍高于 2×2\times
  • 成本归因:teacher RL、teacher trajectory collection 和 teacher inference 仍有成本;“至少 4×4\times”属于 rollout 路径,不能直接扩展成完整研究 pipeline 或 end-to-end training cost。
  • 证据定位:Figure 1、Figure 8、Section 5.2 “Efficiency”、Figure 6。
  • 支持的最窄结论:已有 teacher pool 时,ReOPD 能消除 student distillation 的在线 environment dependency,并显著缩短该阶段 rollout。
  • 解读:它对环境昂贵、难并发或多环境共同训练的场景价值最高。

结果 5:早期 prefix、teacher 自身 prefix 与混合 RL pool 支持可靠性解释

  • 设置:固定 student Qwen3-4B;改变 sampled trajectory chunk、κ\kappa、prefix generator 和 trajectory pool source。
  • Baseline:uniform sampling κ=1\kappa=1、later chunks、其它更强 prefix generators、final-teacher stationary pool。
  • 指标:数学 benchmark average。
  • 结果:早期 chunks 和 moderate decay 优于 uniform / late sampling;固定 8B teacher 时,teacher 自身生成的 prefixes 优于更大或更强 prefix generator;final-teacher pool 与 mixed RL rollouts 的平均分为 53.453.453.753.7
  • 对照是否可比:target teacher 固定,主要改变 prefix 来源或采样位置;pool-source 结果只覆盖一组 teacher—student 设置。
  • 证据定位:Figures 5 and 7;Table 7。
  • 支持的最窄结论:depth 和 teacher-support overlap 与最终性能有关,已有 mixed-policy RL rollouts 在该数学设置中可替代专门的 final-teacher collection。
  • 解读:结果支持 schedule 的方向性;固定 κ=0.6\kappa=0.6 的任务普适性和可靠性校准仍待更多验证。

结果 6:当前仓库尚未提供核心 prefix-pool 构造实现

  • 适用版本:GitHub commit 68042688f73c928d25e4caff95e28c74c27a24ba,核验于 2026-07-18。
  • 对照是否可比:以论文 Algorithm 1 和 repository README 声明的 prefix fan-out / decay sampling 流程为预期实现,对照该 commit 的 tracked files;这项审计只判断公开代码完整性,不判断作者未公开环境中的实现状态。
  • 结果:README 声明已发布 ReOPD reproduction code;data/README.md 的 “Prefix-pool construction” 标注 “to be added”,仅描述应将每条 teacher trajectory 拆成 per-turn rows 并按 ptκtp_t\propto\kappa^t 采样。仓库中未定位到实现该 fan-out / decay sampling 的脚本。
  • 证据定位:https://github.com/BaohaoLiao/ReOPD/blob/68042688f73c928d25e4caff95e28c74c27a24ba/data/README.md
  • 支持的最窄结论:公开仓库能说明训练接口和整体流程,当前 commit 尚不足以独立复现 ReOPD 最核心的数据构造步骤。
  • 解读:该缺口会影响第三方核对 position indexing、trajectory truncation、normalization、sampling seed 和 pool mixing 细节。

实验与系统设置审计

维度 记录
模型 Qwen3-4B-Instruct-2507、Qwen3-8B、Qwen3-30B-A3B-Instruct-2507;teacher 与 student 均来自 Qwen3 系列。
训练流程 2K trajectory SFT cold start → teacher GRPO → student OPD / ReOPD;student distillation 共 200 steps。
任务 Python 数学推理与固定 2018 Wikipedia retrieval search;另做二者 joint training。
ReOPD 默认值 Position sampling ptκtp_t\propto\kappa^tκ=0.6\kappa=0.6;当前 step 使用 per-token reverse KL。
硬件 / 框架 8×8\timesH100,Slime;论文报告 ReOPD 在 3 小时内完成。
统计报告 主表给单一 aggregate scores;未报告多 seed、置信区间、误差线或显著性检验。
效率口径 主要是 student rollout / rollout-step;teacher RL 和 pool collection 通常作为可复用前置成本。
代码复现 训练代码与接口已公开;core prefix-pool construction script 在核验 commit 中待补。

主要启发

分布约束下的策略组合

以下为本地分析。ReOPD 的可迁移价值可以抽象为分布约束下的策略组合与轨迹复用。多轮蒸馏中的历史前缀、当前动作和监督目标可以分别指定来源,由此在 student relevance、teacher reliability 与环境成本之间进行配置:

方法 历史前缀来源 当前动作来源 监督信号
SFT teacher trajectory teacher teacher action 的 token 标签
在线 multi-turn OPD student 与在线环境 student teacher 的逐 token 分布
ReOPD 离线 teacher trajectory student teacher 的逐 token 分布

ReOPD 用 teacher prefix 将历史保持在 teacher 较常访问的区域,让 student 在当前训练位置生成动作,再由 teacher 沿 student action 的 token prefixes 提供稠密监督。这里的 on-policy 属性只覆盖当前动作;student action 的作用范围止于当前训练位置,下一条样本重新从离线池构造历史。实际训练采用“teacher 历史 + student 当前动作”的分角色组合;由两种策略交替执行环境的完整混合轨迹属于更一般的扩展。

论文中的 geometric bridge 描述 student 与 teacher 访问分布之间的理论插值;默认实现使用 κt\kappa^t 在不同交互深度之间重新分配训练样本。前者在同一步内选择或重加权 histories,后者降低后期位置的总体训练占比,两者作用维度不同。Geometric bridge 为固定衰减提供方向性解释,当前算法使用深度作为粗粒度代理。

轨迹池提高三类数据利用率

Teacher RL 轨迹可以沿三个方向复用。第一,一条包含 TT 个交互步的轨迹可以按训练位置展开为约 TT 条 prefix 样本,形成纵向复用。第二,同一轨迹池可以跨 student、训练轮次和任务组合重复使用,形成横向复用。第三,每个 student action 都接受 teacher 的 full-vocabulary token distribution,单条 prefix 提供的监督密度高于序列级标签或回合级标量 reward。

这种复用把 live environment 集中到 teacher data-production 阶段,并以可版本化的轨迹池支撑后续 student iteration。环境调用昂贵、多环境难以同时部署或多个 student 共享同一 teacher 时,轨迹池的摊销价值最高。相应代价是覆盖范围受 teacher pool 限制,student 特有失败历史和工具错误恢复路径需要额外收集。

从固定回放到预算受控的混合策略

更一般的扩展可以直接估计每个 prefix 的 student–teacher KL、likelihood ratio、teacher uncertainty 或 support overlap,据此决定继续回放 teacher history,还是执行一次 student action 并收集新的环境分支。高信息量或高分布偏移的位置使用有限环境预算,其余位置继续离线 replay;teacher 负责维持监督可靠性,student 分支负责扩展部署状态覆盖。

这一扩展会把固定 κ=0.6\kappa=0.6 的深度衰减升级为数据依赖的采样策略,也会生成真正由 teacher replay 与 student environment branch 共同构成的混合访问分布。可复验指标应同时包括新分支覆盖率、teacher 校准误差、student–teacher KL、每次环境调用带来的性能增益和端到端训练成本。

局限

  1. 理论中的 ideal target qtq_t^\star 与 teacher reliability error 不可观测;teacher support KL 是建模代理,缺少直接 calibration 实验。
  2. Geometric bridge 的 exact weight 在同一步内区分 histories,κt\kappa^t 只在步骤之间分配样本;这一降维近似会忽略同深度 history 的可靠性差异。
  3. 固定 κ=0.6\kappa=0.6 在所有任务中复用,论文没有给出在线估计 cˉ\bar c 后自动设定 schedule 的完整算法。
  4. 全部模型属于 Qwen3 家族,任务只有 Python math 与固定语料 retrieval;跨模型族、open-web、浏览器、代码仓库和有状态 API 的外部有效性未验证。
  5. Aggregate results 缺少多 seed 与统计区间,搜索中的 0.10.1 差值和数学中的 0.30.3 差值只能支持近似持平。
  6. 4×4\times 加速主要针对有现成 teacher pool 的 student rollout。完整成本还包括 teacher GRPO、trajectory storage、teacher target inference,以及没有 pool 时的一次性 teacher resampling。
  7. Pool quality 与 coverage 形成能力上限。教师轨迹没有访问到的状态、工具错误恢复路径或学生特有失败历史不会自动进入训练。
  8. 当前公开仓库缺少 prefix-pool construction script,关键数据变换和 sampling 细节尚未达到端到端复现条件。

跨论文关系

  • GKD / On-Policy Distillation:GKD 让 teacher 在 student 自生成 token prefixes 上提供分布监督;ReOPD 将该原则扩展到带 environment transitions 的多轮 histories,并明确把 teacher-forced roll-in 与当前 student action 分开。
  • MOPD:MOPD 解决多个领域 teacher 怎样在 student on-policy trajectories 上整合能力;ReOPD 的双环境实验同样使用两个领域 teacher,同时把环境 rollouts 离线化。二者可组合为“多教师路由 + prefix pool replay”的能力整合路径。
  • LLM-in-Sandbox:两篇论文通过 Li DongFuru Wei 直接相连。LLM-in-Sandbox 把 live computer environment 纳入 agent RL;ReOPD 把该阶段产生的轨迹转成 student distillation 的离线输入,形成 environment data production 与 downstream transfer 的上下游关系。
  • DAPO:ReOPD 数学实验直接复用 6.4K DAPO prompts 训练 teacher 和 student;DAPO 提供 reasoning RL 的 prompt / rollout 基础,ReOPD 关注这些 teacher rollouts 的再利用。
  • Qwen3:所有 controlled experiments 都在 Qwen3-4B / 8B / 30B-A3B 上完成;ReOPD 为 Qwen 系 strong-to-weak / OPD 路线补充多轮工具环境下的 prefix-distribution 机制。

Reference Intake Brief

Source Used for Reliability Notes
arXiv v2 PDF / HTML / TeX source 方法、公式、实验表格、附录与限制 High 论文主来源,读取版本为 2026-07-16 的 v2。
Official project page 摘要、图表和资源入口 High 与 arXiv 作者资源一致。
GitHub repository commit 6804268 训练接口、数据流程与复现完整性 High data/README.md 明示 prefix-pool script 待补。
Author homepages / institutional profiles 机构、共同一作、导师关系与稳定作者字段 Medium-High 只保存可由论文、个人主页或机构页交叉确认的事实。
Existing local notes GKD、MOPD、LLM-in-Sandbox、DAPO、Qwen3 关系 High 用于定位方法谱系、作者重叠和系统上下游。