tracked author

Weijia Xu

W2S-OPD 第二作者。个人主页将其列为 Microsoft Research Redmond Senior Researcher,并记录其在 University of Maryland, College Park 获得计算机科学博士学位。

1 archived notes HomepageGitHub

Related Notes

按论文归档时间排序,展示该作者在本站已经出现的材料。

归档

Weak to Strong On Policy Distillation

W2S OPD 将较弱正负模型的 logits 差分叠加到冻结的强学生基座分布,再在学生自身轨迹上执行逐 token 反向 KL;Qwen3 8B 的强化学习前后对比设置相对直接 OPD 的数学与代码平均准确率分别提高 5.3 和 2.2 个百分点,跨模型家族与独立训练复验仍待验证。

待审阅 2607.26246-w2s-opd-weak-to-strong-distillation On-Policy DistillationReasoning RLTraining Stability