tracked author

Kaveh Hassani

Meta Superintelligence Labs research scientist. Homepage states current focus on self-improving LLMs, LLM reasoning, multi-agent RL and post-training, and directly links Google Scholar, GitHub, LinkedIn and X.

1 archived notes X: high HomepageGitHubX

Related Notes

按论文归档时间排序,展示该作者在本站已经出现的材料。

Jun 23, 2026

Credit Assignment with Resets in Language Model Reasoning

这篇把 reset 变成 RLVR credit assignment 的训练时原语:从失败轨迹中选一个中间 thought prefix,重采样多个后缀 continuation,只对后缀 token 做 group relative policy update。SRPO 用模型自定位的首个错误 thought 近似 credit assignment oracle,在无需外部 step level label 或 critic 的...

2605.25507-credit-assignment-resets-language-model-reasoning Credit AssignmentReasoning RLRollout Optimization