tracked author

Daniel R. Jiang

Meta AI research scientist working on reinforcement learning and RLHF. Homepage states interests in AI agents that plan over long horizons and acquire information under uncertainty, and directly links Twitter, Scholar and LinkedIn.

1 archived notes X: high HomepageX

Related Notes

按论文归档时间排序,展示该作者在本站已经出现的材料。

Jun 23, 2026

Credit Assignment with Resets in Language Model Reasoning

这篇把 reset 变成 RLVR credit assignment 的训练时原语:从失败轨迹中选一个中间 thought prefix,重采样多个后缀 continuation,只对后缀 token 做 group relative policy update。SRPO 用模型自定位的首个错误 thought 近似 credit assignment oracle,在无需外部 step level label 或 critic 的...

2605.25507-credit-assignment-resets-language-model-reasoning Credit AssignmentReasoning RLRollout Optimization