tracked author

Fangxu Yu

W2S-OPD 第一作者。个人主页将其列为 University of Maryland, College Park 计算机科学博士生、Tianyi Zhou 的学生,并将 W2S-OPD 列入近期大语言模型推理与后训练研究;论文注明该工作在 Microsoft Research 实习期间完成。

1 archived notes HomepageGitHub

Representative Papers

来自作者已核验个人主页的重点论文;本站单篇归档见下方 Related Notes。

  1. 01 Weak-to-Strong On-Policy Distillation arXiv · 2026

Related Notes

按论文归档时间排序,展示该作者在本站已经出现的材料。

归档

Weak to Strong On Policy Distillation

W2S OPD 将较弱正负模型的 logits 差分叠加到冻结的强学生基座分布,再在学生自身轨迹上执行逐 token 反向 KL;Qwen3 8B 的强化学习前后对比设置相对直接 OPD 的数学与代码平均准确率分别提高 5.3 和 2.2 个百分点,跨模型家族与独立训练复验仍待验证。

待审阅 2607.26246-w2s-opd-weak-to-strong-distillation On-Policy DistillationReasoning RLTraining Stability