Multi Turn On Policy Distillation with Prefix Replay
把教师 RL 轨迹回放为按轮次衰减采样的前缀,只让学生在当前步生成并接受教师分布监督,从而在学生蒸馏阶段关闭环境。
papers.chlience.com
面向训练、推理、架构、Agent、评测、安全与理论的论文阅读档案。每篇笔记保留来源、作者关系、证据边界、局限,以及它和其它论文的连接。
每篇笔记都把论文主张、本地判断和后续讨论分开记录。
跨材料问题的长期分析入口。每条主线保留自己的检索窗口、分类框架和逐结论证据强度。
Agentic RL 的环境供给如何从可执行沙箱发展到可训练、可校准的环境模型,各类方案分别替代真实交互的哪一部分?
稀疏终局奖励如何被分配到 LLM 与 Agent 轨迹中的 token、步骤、工具调用、记忆操作、摘要、角色和策略,各方法依赖什么可比性与额外模型?
国产前沿模型组织如何在技术报告和官方发布材料中推进基础架构、推理强化学习、长上下文、Agent 系统与训练—服务协同,公开证据的强度如何变化?
置顶条目优先,其余按审阅时间列出最近完成本地审阅的论文和技术文章。
把教师 RL 轨迹回放为按轮次衰减采样的前缀,只让学生在当前步生成并接受教师分布监督,从而在学生蒸馏阶段关闭环境。
让 student 在自身轨迹上接受 query specific demonstration conditioned EMA 同模型的 token distribution,在提升新任务准确率时显著减少旧能力遗忘。
用要求引用轨迹证据的任务专用 rubric 选择摘要时机,让同一模型在无需训练时压缩并重建长程 agent 上下文。
把可提前确定的 context transformation 移入异步 lookahead stream,并用 SLO aware scheduling 预建变换后 KV cache,降低 transform point TTFT。
用 loss guided layer search 或 multi layer distillation 划分 Full / Shared 层,跨层复用 top k positions 并跳过最多 75% 的 DSA indexer 计算。
在 SUPO 已覆盖摘要与执行联合训练的前提下,用支持单 rollout 的独立 critic 和跨 segment GAE 处理压缩轨迹;两个模型在 compacted coding 评测中均提高 Pass@1,但缺少与 SUPO 的直接对照。
用每 prompt 单 rollout、强化 critic 与双侧 token mask 替代异步 GRPO 的组内等待和 group baseline。
ECHO 为长程智能体保留带原始轮次标识的选择性记忆,用它重建有限上下文并将结果信用路由到被复用历史轮次及其选择动作,在 BrowseComp Plus 上同时提高一次通过率并减少滚动摘要造成的轨迹膨胀。
主题入口用于快速进入同一问题域,数量来自当前归档。