tracked author

Kavosh Asadi

Meta RL team senior scientist. Homepage states a PhD background in theoretical and empirical reinforcement learning, value-function optimization interests, and affiliation history from Meta, Amazon, Brown and University of Alberta; homepage directly links Twitter, Scholar, LinkedIn and DBLP.

1 archived notes X: high HomepageX

Related Notes

按论文归档时间排序,展示该作者在本站已经出现的材料。

Jun 23, 2026

Credit Assignment with Resets in Language Model Reasoning

这篇把 reset 变成 RLVR credit assignment 的训练时原语:从失败轨迹中选一个中间 thought prefix,重采样多个后缀 continuation,只对后缀 token 做 group relative policy update。SRPO 用模型自定位的首个错误 thought 近似 credit assignment oracle,在无需外部 step level label 或 critic 的...

2605.25507-credit-assignment-resets-language-model-reasoning Credit AssignmentReasoning RLRollout Optimization