2607.04763-reopd-prefix-replay-agentic-distillation
Multi Turn On Policy Distillation with Prefix Replay
ReOPD 把教师 RL 轨迹拆成按轮次采样的 replayed prefixes,让学生只在选定的当前步生成动作并接受 teacher reverse-KL token supervision,从而在学生训练阶段实现零工具调用;Qwen3 数学与搜索实验显示其单次 rollout 至少快于在线 OPD 4 倍且平均准确率持平或更高,可信边界包括必须具备带 observation 的教师轨迹池、教师支持度只是可靠性的代理、固定为 0.6 的采样衰减系数尚无自适应保证,以及当前仓库缺少核心 prefix-pool 构造脚本。
Source
- Workflow version: v2.1
- Material type: research-paper
- Analysis modules: experiment, system, theory
- Canonical source: https://arxiv.org/abs/2607.04763
- Title: Multi-Turn On-Policy Distillation with Prefix Replay
- Authors: Baohao Liao, Hanze Dong, Christof Monz, Xinxing Xu, Li Dong, Furu Wei
- Responsible organization: Microsoft Research;University of Amsterdam
- arXiv: https://arxiv.org/abs/2607.04763
- PDF: https://arxiv.org/pdf/2607.04763
- HTML: https://arxiv.org/html/2607.04763
- Code/Project: GitHub repository;project page
- Models/Data: https://huggingface.co/collections/baohao/reopd
- OpenReview / Review page: 未发现与题名、作者和 arXiv ID 匹配的公开 OpenReview / conference review page
- Submitted: 2026-07-06
- Published / updated: v2 updated 2026-07-16
- Current version read: v2
- Version / revision read: arXiv v2 PDF、HTML、TeX source;代码仓库 commit
68042688f73c928d25e4caff95e28c74c27a24ba - Accessed: 2026-07-18
- Key figure decision: include
- Review status: page-type=not-found; match-confidence=high; observed-at=2026-07-18; venue-status=arXiv preprint
- Subjects: Machine Learning (cs.LG);Artificial Intelligence (cs.AI);Computation and Language (cs.CL);Machine Learning (stat.ML)
作者与关系
- Baohao Liao: Microsoft Research / University of Amsterdam。
- Hanze Dong: Microsoft Research。
- Christof Monz: University of Amsterdam。
- Xinxing Xu: Microsoft Research。
- Li Dong: Microsoft Research。
- Furu Wei: Microsoft Research。
作者关系呈现一条明确的 Microsoft Research—University of Amsterdam 桥接。Baohao Liao 同时属于两家机构,并在个人主页确认 Christof Monz 是其博士导师;Baohao Liao 与 Hanze Dong 为共同一作,此前也共同完成过 Reward-Guided Speculative Decoding 和 Fractured Chain-of-Thought Reasoning 等工作。Microsoft Research 侧的 Hanze Dong、Xinxing Xu、Li Dong 与 Furu Wei 组成同机构后训练团队。
当前归档中,Li Dong 与 Furu Wei 还共同出现在 LLM-in-Sandbox;前一篇研究怎样用在线 computer environment 训练和评测 agent,ReOPD 进一步研究怎样复用这类 teacher RL 轨迹,在 student distillation 阶段关闭环境。
论文脉络
1. 研究问题、背景和价值
On-policy distillation(OPD)让学生先沿自身策略生成,再由教师在学生访问到的 token context 上提供分布监督。单轮文本任务中,主要成本来自 student generation 和 teacher prefill。多轮 agent 任务还需要执行 Python、搜索或其它工具:学生每生成一次动作,环境必须返回 observation,下一轮历史也随之改变。在线 OPD 因而在每次更新中重复承担 student rollout、环境执行和 teacher query。
论文关注一个更具体的系统问题:教师通常已经通过 GRPO 等 RL 训练,并留下了完整的 action—observation trajectories。能否把这些轨迹转为学生 OPD 的 roll-in,继续保留学生自身动作上的 dense teacher supervision,同时停止环境调用?这一改写将环境交互从每次 student update 的在线依赖,转成可跨学生、任务和训练轮次复用的离线数据资源。
2. 已有解决方案与不足
- 在线 multi-turn OPD:学生在 live environment 中重跑完整轨迹,history 与部署时 student occupancy 最接近,代价是持续部署工具、检索器、sandbox 与并发 worker。
- 教师轨迹 SFT:直接模仿 teacher actions,训练简单且无需在线环境,监督 context 全部来自 teacher,学生在自己的当前动作上得不到 teacher distribution feedback。
- 普通 replay / imitation:可以复用历史轨迹,但容易把“行为数据来自谁”和“当前被监督动作由谁生成”混为一个分布问题。
- 单轮 GKD / OPD:已经说明 student-generated token context 能缓解 exposure bias,尚未处理 environment transition 使历史分布逐轮累积偏移的问题。
多轮场景还多出一项教师可靠性约束。完全沿学生 roll-in 虽然贴近 student occupancy,教师可能在自己很少访问的异常历史上给出低质量 target;完全沿 teacher roll-in 能保持 teacher support,又会偏离学生部署时到达的历史。论文把这两项偏差放进同一 prefix-distribution 设计问题。
3. 作者可能的思考路径
以下为本地分析。
第一步来自系统复用:teacher RL 已经支付了环境 rollout 成本,且轨迹保存了全部 observation。学生训练若只需要一个历史前缀作为条件,可以直接回放这些 observation,无需重新执行动作。
第二步来自 OPD 定义的拆分:多轮 history 的 roll-in 来源与当前 action 的生成策略可以分开。前缀采用 teacher trajectory,当前 action 仍由 student 生成;teacher 再沿 student action 的 token prefixes 给 reverse-KL target。这样保留了局部 token context 的 on-policy 性质。
第三步来自误差随深度累积:学生完全复现 teacher 前
4. 核心假设或切入点
- 可获得带完整 action 和 observation 的 teacher trajectory pool;最理想来源是 teacher RL 期间已经保存的 rollouts。
- 教师在接近自身 interaction occupancy 的 histories 上更可靠,离开该 support 后 target 质量可能下降。论文没有直接观测 ideal target,因此用 teacher support 距离作为 reliability surrogate。
- 学生与教师在同一 replayed history 上计算 action likelihood,环境转移项可以在 occupancy ratio 中抵消。
- 累积 student/teacher likelihood ratio 的主要变化可由 interaction depth 解释,因而
能近似高方差的 per-history ratio。 - “on-policy”作用在被监督的当前 student action 及其 token contexts;此前的多轮 roll-in 由 teacher 强制回放。方法的命名应按这个局部定义理解。
5. 方法 / 系统 / 理论框架
5.1 多轮 OPD 的两侧偏差
对输入
当前学生与环境共同诱导 occupancy
在 ideal-target loss 有界的条件下,Proposition 1 给出:
第一项衡量 replay distribution 与学生实际 occupancy 的距离;第二项衡量 teacher target 与未知 ideal target 之间的 loss 差。这个分解说明完全 student-on-policy 只能消除第一项,teacher-forced roll-in 主要约束第二项。
5.2 从可靠性代理到 geometric bridge
真实的
当两个分布 support 重叠时,解是 geometric bridge:
5.3 从 exact density ratio 到 step decay
teacher pool 的采样分布
在同一 recorded prefix 上,环境 transition factors 抵消,剩下此前 teacher actions 的累计策略 likelihood ratio:
精确
实际算法统一采用
5.4 离线训练数据流

对 teacher trajectory 中选定的第
- 回放此前所有 teacher actions
和 recorded observations 。 - Student 在该 prefix 上自回归生成当前 action
,该 action 不发送给环境。 - Teacher 在 student 已生成的 token contexts 上提供每 token distribution。
- 以
更新 student。 - 下一条样本继续从离线 pool 独立构造,因而学生生成的 action 不产生后续 observation。
采样 schedule 在 data preparation 阶段生效,训练 loss 保持普通 OPD 形式。若 teacher RL rollouts 已保存,student 阶段无需部署 environment;若没有可复用轨迹,可先让 teacher 一次性收集全部 prefixes,再关闭环境。
6. 结论链条
- Multi-turn OPD 的在线成本主要来自每次更新都需要重新执行 environment transitions。
- Teacher RL traces 已包含 action—observation histories,可以提供无需执行的 roll-in prefixes。
- 在 replayed prefix 上让 student 生成当前 action,可保留当前 action token contexts 的 on-policy supervision。
- Replayed histories 同时受到 student occupancy mismatch 与 teacher reliability mismatch;两侧分解支持在两种 occupancy 之间选择有效分布。
- Exact density ratio 可由 student/teacher action likelihood 计算,step index 是更便宜的粗粒度代理。
- 数学与搜索实验支持“离线 prefix replay 能达到 OPD 级别准确率并显著降低 student rollout 成本”;现有证据覆盖两个受控工具环境和 Qwen3 模型族。
关键实验/定理
结果 1:两侧误差分解定位了 prefix distribution 的两个目标
- 假设:ideal-target loss 一致有界;KL 情况还需要 target conditional 在 support 上存在概率下界。
- 适用域:固定 input distribution、有限交互步数、可定义 student / teacher environment occupancy 的 multi-turn distillation。
- 对照是否可比:该结果是目标函数分解,没有经验 baseline;比较对象是同一 student update 下的 ideal objective 与 replayed teacher objective。
- 结果:Proposition 1 将 ideal objective 与 replayed teacher objective 的差上界为 student occupancy TV mismatch 与 teacher reliability error 之和。
- 证据定位:Section 3, Proposition 1, Eq. (6);TeX source
sections/formulation.tex。 - 支持的最窄结论:prefix distribution 同时决定训练 history 是否贴近 student,以及 teacher 是否在可靠 region 内被查询。
- 解读:该命题提供诊断框架。它没有给出可观测的 reliability estimator,也没有证明固定
最优。
结果 2:数学任务上 ReOPD 全部四组 teacher—student 设定达到或超过 OPD
- 设置:Python-tool mathematical reasoning;2K ReTool cold-start traces,6.4K DAPO prompts;Qwen3-4B / 8B / 30B-A3B teachers 与 Qwen3-4B / 8B students;训练 200 steps。
- Baseline:Cold Start、teacher-trajectory SFT、fully online student-on-policy OPD;OPD 与 ReOPD 共用 teacher target、batch size 和 update steps,prefix distribution 不同。
- 指标:AIME24、AIME25、AMC23、Minerva、OlympiadBench、MATH500 的 macro average。
- 结果:4B→4B 为
;8B→4B 为 ;30B-A3B→4B 为 ;30B-A3B→8B 为 。8B→4B 的 AIME24 从 提升到 。 - 对照是否可比:模型、训练步数和 teacher signal 对齐;online OPD 执行真实环境,ReOPD 使用 teacher pool,系统路径因方法定义而不同。
- 证据定位:Section 5.2,Table 4;Section 5.3 “Two regimes in practice”。
- 支持的最窄结论:在论文的 Qwen3 数学设置中,teacher-supported replay 没有损失平均准确率,teacher—student gap 较大时优势更明显。
- 解读:四组结果方向一致,但论文没有报告多训练 seed、误差线或显著性,
这类小差值应视为持平。
结果 3:搜索与双环境训练主要显示 accuracy preservation
- 设置:Search-R1 风格 retrieval environment;2K cold start,6.5K NQ + HotpotQA prompts;2018 Wikipedia、E5 retriever、top-3 passages;七个 QA benchmarks。双环境实验把 math 和 search data 合并训练同一 Qwen3-4B student,并分别使用两个领域 teacher。
- Baseline:fully online OPD。
- 指标:搜索 micro average;数学 macro average。
- 结果:搜索 4B teacher 下 OPD / ReOPD 为
,8B teacher 下为 。双环境中 math 为 ,search 均为 。 - 对照是否可比:共享 student、数据、teacher target 与训练配置;ReOPD 省去在线 retriever 路径。
- 证据定位:Section 5.2,Tables 5–6。
- 支持的最窄结论:在受控离线 Wikipedia 搜索环境和两个领域的 joint training 中,prefix replay 可以保持在线 OPD 的 aggregate accuracy。
- 解读:这些结果支撑环境下线后的能力保持;尚未覆盖 open-web search、状态会变化的工具或软件工程 sandbox。
结果 4:学生训练阶段零工具调用,单次 rollout 至少加速 4 倍
- 设置:全部实验在
H100 上使用 Slime;ReOPD 训练可在 3 小时内完成。数学在线 OPD 需要 32 个并发 Python processes;搜索环境部署 retriever 与 Wikipedia embeddings 需要 80GB GPU memory。 - 系统条件:主效率比较把 teacher RL 轨迹视为已有资源,只比较 student distillation rollouts;附加实验把 teacher 一次性 resampling 时间计入。
- 对照是否可比:OPD 与 ReOPD 使用同一 teacher target、batch size 和 update steps;两者的 environment execution 差异就是被测系统机制,完整 pipeline compute 未严格匹配。
- 指标定义:tool-call count、rollout-step / per-rollout time、环境进程和显存需求。
- 结果:ReOPD student training 为零工具调用,per-rollout 至少快
,图中不同设置约为 – ;计入单次 teacher resampling 后仍高于 。 - 成本归因:teacher RL、teacher trajectory collection 和 teacher inference 仍有成本;“至少
”属于 rollout 路径,不能直接扩展成完整研究 pipeline 或 end-to-end training cost。 - 证据定位:Figure 1、Figure 8、Section 5.2 “Efficiency”、Figure 6。
- 支持的最窄结论:已有 teacher pool 时,ReOPD 能消除 student distillation 的在线 environment dependency,并显著缩短该阶段 rollout。
- 解读:它对环境昂贵、难并发或多环境共同训练的场景价值最高。
结果 5:早期 prefix、teacher 自身 prefix 与混合 RL pool 支持可靠性解释
- 设置:固定 student Qwen3-4B;改变 sampled trajectory chunk、
、prefix generator 和 trajectory pool source。 - Baseline:uniform sampling
、later chunks、其它更强 prefix generators、final-teacher stationary pool。 - 指标:数学 benchmark average。
- 结果:早期 chunks 和 moderate decay 优于 uniform / late sampling;固定 8B teacher 时,teacher 自身生成的 prefixes 优于更大或更强 prefix generator;final-teacher pool 与 mixed RL rollouts 的平均分为
与 。 - 对照是否可比:target teacher 固定,主要改变 prefix 来源或采样位置;pool-source 结果只覆盖一组 teacher—student 设置。
- 证据定位:Figures 5 and 7;Table 7。
- 支持的最窄结论:depth 和 teacher-support overlap 与最终性能有关,已有 mixed-policy RL rollouts 在该数学设置中可替代专门的 final-teacher collection。
- 解读:结果支持 schedule 的方向性;固定
的任务普适性和可靠性校准仍待更多验证。
结果 6:当前仓库尚未提供核心 prefix-pool 构造实现
- 适用版本:GitHub commit
68042688f73c928d25e4caff95e28c74c27a24ba,核验于 2026-07-18。 - 对照是否可比:以论文 Algorithm 1 和 repository README 声明的 prefix fan-out / decay sampling 流程为预期实现,对照该 commit 的 tracked files;这项审计只判断公开代码完整性,不判断作者未公开环境中的实现状态。
- 结果:README 声明已发布 ReOPD reproduction code;
data/README.md的 “Prefix-pool construction” 标注 “to be added”,仅描述应将每条 teacher trajectory 拆成 per-turn rows 并按采样。仓库中未定位到实现该 fan-out / decay sampling 的脚本。 - 证据定位:https://github.com/BaohaoLiao/ReOPD/blob/68042688f73c928d25e4caff95e28c74c27a24ba/data/README.md
- 支持的最窄结论:公开仓库能说明训练接口和整体流程,当前 commit 尚不足以独立复现 ReOPD 最核心的数据构造步骤。
- 解读:该缺口会影响第三方核对 position indexing、trajectory truncation、normalization、sampling seed 和 pool mixing 细节。
实验与系统设置审计
| 维度 | 记录 |
|---|---|
| 模型 | Qwen3-4B-Instruct-2507、Qwen3-8B、Qwen3-30B-A3B-Instruct-2507;teacher 与 student 均来自 Qwen3 系列。 |
| 训练流程 | 2K trajectory SFT cold start → teacher GRPO → student OPD / ReOPD;student distillation 共 200 steps。 |
| 任务 | Python 数学推理与固定 2018 Wikipedia retrieval search;另做二者 joint training。 |
| ReOPD 默认值 | Position sampling |
| 硬件 / 框架 | |
| 统计报告 | 主表给单一 aggregate scores;未报告多 seed、置信区间、误差线或显著性检验。 |
| 效率口径 | 主要是 student rollout / rollout-step;teacher RL 和 pool collection 通常作为可复用前置成本。 |
| 代码复现 | 训练代码与接口已公开;core prefix-pool construction script 在核验 commit 中待补。 |
主要启发
分布约束下的策略组合
以下为本地分析。ReOPD 的可迁移价值可以抽象为分布约束下的策略组合与轨迹复用。多轮蒸馏中的历史前缀、当前动作和监督目标可以分别指定来源,由此在 student relevance、teacher reliability 与环境成本之间进行配置:
| 方法 | 历史前缀来源 | 当前动作来源 | 监督信号 |
|---|---|---|---|
| SFT | teacher trajectory | teacher | teacher action 的 token 标签 |
| 在线 multi-turn OPD | student 与在线环境 | student | teacher 的逐 token 分布 |
| ReOPD | 离线 teacher trajectory | student | teacher 的逐 token 分布 |
ReOPD 用 teacher prefix 将历史保持在 teacher 较常访问的区域,让 student 在当前训练位置生成动作,再由 teacher 沿 student action 的 token prefixes 提供稠密监督。这里的 on-policy 属性只覆盖当前动作;student action 的作用范围止于当前训练位置,下一条样本重新从离线池构造历史。实际训练采用“teacher 历史 + student 当前动作”的分角色组合;由两种策略交替执行环境的完整混合轨迹属于更一般的扩展。
论文中的 geometric bridge 描述 student 与 teacher 访问分布之间的理论插值;默认实现使用
轨迹池提高三类数据利用率
Teacher RL 轨迹可以沿三个方向复用。第一,一条包含
这种复用把 live environment 集中到 teacher data-production 阶段,并以可版本化的轨迹池支撑后续 student iteration。环境调用昂贵、多环境难以同时部署或多个 student 共享同一 teacher 时,轨迹池的摊销价值最高。相应代价是覆盖范围受 teacher pool 限制,student 特有失败历史和工具错误恢复路径需要额外收集。
从固定回放到预算受控的混合策略
更一般的扩展可以直接估计每个 prefix 的 student–teacher KL、likelihood ratio、teacher uncertainty 或 support overlap,据此决定继续回放 teacher history,还是执行一次 student action 并收集新的环境分支。高信息量或高分布偏移的位置使用有限环境预算,其余位置继续离线 replay;teacher 负责维持监督可靠性,student 分支负责扩展部署状态覆盖。
这一扩展会把固定
局限
- 理论中的 ideal target
与 teacher reliability error 不可观测;teacher support KL 是建模代理,缺少直接 calibration 实验。 - Geometric bridge 的 exact weight 在同一步内区分 histories,
只在步骤之间分配样本;这一降维近似会忽略同深度 history 的可靠性差异。 - 固定
在所有任务中复用,论文没有给出在线估计 后自动设定 schedule 的完整算法。 - 全部模型属于 Qwen3 家族,任务只有 Python math 与固定语料 retrieval;跨模型族、open-web、浏览器、代码仓库和有状态 API 的外部有效性未验证。
- Aggregate results 缺少多 seed 与统计区间,搜索中的
差值和数学中的 差值只能支持近似持平。 加速主要针对有现成 teacher pool 的 student rollout。完整成本还包括 teacher GRPO、trajectory storage、teacher target inference,以及没有 pool 时的一次性 teacher resampling。 - Pool quality 与 coverage 形成能力上限。教师轨迹没有访问到的状态、工具错误恢复路径或学生特有失败历史不会自动进入训练。
- 当前公开仓库缺少 prefix-pool construction script,关键数据变换和 sampling 细节尚未达到端到端复现条件。
跨论文关系
- 与 GKD / On-Policy Distillation:GKD 让 teacher 在 student 自生成 token prefixes 上提供分布监督;ReOPD 将该原则扩展到带 environment transitions 的多轮 histories,并明确把 teacher-forced roll-in 与当前 student action 分开。
- 与 MOPD:MOPD 解决多个领域 teacher 怎样在 student on-policy trajectories 上整合能力;ReOPD 的双环境实验同样使用两个领域 teacher,同时把环境 rollouts 离线化。二者可组合为“多教师路由 + prefix pool replay”的能力整合路径。
- 与 LLM-in-Sandbox:两篇论文通过 Li Dong 与 Furu Wei 直接相连。LLM-in-Sandbox 把 live computer environment 纳入 agent RL;ReOPD 把该阶段产生的轨迹转成 student distillation 的离线输入,形成 environment data production 与 downstream transfer 的上下游关系。
- 与 DAPO:ReOPD 数学实验直接复用 6.4K DAPO prompts 训练 teacher 和 student;DAPO 提供 reasoning RL 的 prompt / rollout 基础,ReOPD 关注这些 teacher rollouts 的再利用。
- 与 Qwen3:所有 controlled experiments 都在 Qwen3-4B / 8B / 30B-A3B 上完成;ReOPD 为 Qwen 系 strong-to-weak / OPD 路线补充多轮工具环境下的 prefix-distribution 机制。
Reference Intake Brief
| Source | Used for | Reliability | Notes |
|---|---|---|---|
| arXiv v2 PDF / HTML / TeX source | 方法、公式、实验表格、附录与限制 | High | 论文主来源,读取版本为 2026-07-16 的 v2。 |
| Official project page | 摘要、图表和资源入口 | High | 与 arXiv 作者资源一致。 |
GitHub repository commit 6804268 |
训练接口、数据流程与复现完整性 | High | data/README.md 明示 prefix-pool script 待补。 |
| Author homepages / institutional profiles | 机构、共同一作、导师关系与稳定作者字段 | Medium-High | 只保存可由论文、个人主页或机构页交叉确认的事实。 |
| Existing local notes | GKD、MOPD、LLM-in-Sandbox、DAPO、Qwen3 关系 | High | 用于定位方法谱系、作者重叠和系统上下游。 |