recurring author

Yuhao Shen

2 archived notes

Related Notes

按论文归档时间排序,展示该作者在本站已经出现的材料。

归档

SEED: Self Evolving On Policy Distillation for Agentic Reinforcement Learning

先用外部模型标注的轨迹—技能数据把策略训练成轨迹分析器,再让每轮最新策略从自身完整轨迹生成事后技能并对同批采样 token 做门控似然训练;三种小模型在 12 个汇总指标中取得 10 个最优或并列最优,但直接前作 OPID 未进入主表,且证据缺少多随机种子、技能正确性评测与总训练成本对齐。

待审阅 2607.14777-seed-self-evolving-on-policy-distillation On-Policy DistillationAgent RLCredit Assignment