2604.09459-credit-assignment-reasoning-agentic-llm-rl

From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models

这篇是 LLM 强化学习 credit assignment 的综述与索引节点:它把 RL (Reinforcement Learning,强化学习) for LLM (Large Language Model,大语言模型) 中的 CA (Credit Assignment,信用分配/功劳分配) 拆成两个问题域,reasoning RL 主要在单条长 CoT (Chain-of-Thought,思维链) 内把 outcome reward 分到 token / segment / step,agentic RL 则在多轮环境交互里同时面对 turn-level、token-level 和 cross-agent credit。它的价值主要是 taxonomy、47 篇方法清单、方法选择树和 reporting checklist;它自身没有受控重现实验,因此更适合作为阅读路线图和审稿 checklist,而非某个算法结论的实证证据。

Authors Chenchen Zhang

已审阅 Archived 2026-06-23 16:42 Updated 2026-07-16 16:02 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

阅读目标与判断边界

归档关注:

  1. 这篇如何界定 reasoning RL 与 agentic RL 的 credit assignment 差异。
  2. token、segment、step/turn、multi-agent 四类 granularity 和 MC / TD / LLM-as-Critic / game-theoretic / information-theoretic 五类方法轴如何组织已有工作。
  3. 这篇给出的 reporting checklist 如何反向审计我们已读的 RLVR、PRM、reset credit、token baseline、rollout mismatch 和 agentic RL 论文。
  4. 作者维护的 GitHub living list 和 arXiv v2 snapshot 之间如何区分。

判断边界:

  • 这是一篇单作者 preprint survey,当前未发现公开 peer review。
  • 论文覆盖 2024 到 early 2026 的 47 个方法,其中多数是新近 arXiv preprint;许多结果来自各自原论文,缺少统一复现。
  • GitHub repo 是持续更新的 living list,已经包含 arXiv v2 之后的新条目;引用时要区分 v2 survey 的 47-method snapshot 和 repo 后续追加内容。
  • 定量表格只能作为趋势线索,因为 base model、benchmark、训练数据、baseline recipe 和 compute budget 都不同。

术语预备

  • RLHF (Reinforcement Learning from Human Feedback,基于人类反馈的强化学习): 用偏好数据训练 reward model,再用 PPO 等方法微调 LLM。
  • RLVR (Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习): 用数学答案、代码测试、工具执行等可自动验证信号作为 reward。
  • PPO (Proximal Policy Optimization,近端策略优化): RLHF 常用 policy optimization 方法,通常配 value model / critic。
  • GRPO (Group Relative Policy Optimization,组相对策略优化): DeepSeek-R1 生态常用 critic-free 方法,用同一 prompt 下多条 rollout 的 group reward 做 baseline。
  • PRM (Process Reward Model,过程奖励模型): 给中间步骤、片段或 turn 打分的 reward / verifier。
  • ORM (Outcome Reward Model,结果奖励模型): 只判断最终 response / trajectory 成败或质量的 reward model。
  • MDP (Markov Decision Process,马尔可夫决策过程): 完全可观测状态、动作、转移和 reward 的 RL 抽象。
  • POMDP (Partially Observable Markov Decision Process,部分可观测马尔可夫决策过程): agent 只能看到 observation,真实环境 state 不完全可见。
  • MC (Monte Carlo,蒙特卡洛估计): 通过 rollout / completion 估计 return 或局部 value。
  • TD (Temporal Difference,时序差分): 用 bootstrapping 的 value estimate 更新当前 value / advantage。
  • LLM-as-Critic: 用 LLM 判断中间 state、turn、trajectory 或 counterfactual 的贡献。

论文脉络

1. 研究问题、背景和价值

LLM RL 的奖励越来越稀疏。数学 reasoning 里,reward 常常只有最终答案对错;代码或工具任务里,reward 可能来自测试是否通过;agentic workflow 里,reward 甚至只在几十轮交互后给出。policy gradient 必须把这个末端信号分配给之前成百上千个 token、若干 reasoning step、多个 tool call 和多名 agent 的动作。

如果把所有 token 或 turn 都拿同一个 episode-level advantage 更新,训练信号会被两类噪声稀释。第一类是长度噪声:长 CoT 中大量格式、铺垫和中间计算 token 对最终成败的贡献不同。第二类是交互噪声:agentic RL 中工具返回、网页状态、sandbox 执行和多 agent 通信会改变后续 state distribution,同一个最终 reward 很难说明哪个 turn 产生了关键影响。

这篇把 credit assignment 当作 LLM RL 的中心问题来整理。它的直接价值是给读者一个坐标系:面对一篇新 RLVR / agentic RL 论文时,先问它把 credit 分配到哪个 granularity,再问它使用哪类 estimator 或 critic,最后审计它的 baseline、compute 和 trajectory metadata 是否足够可比。

2. 已有解决方案与不足

已有综述往往从 broader RLHF、reasoning model、agentic LLM 或 classical temporal credit assignment 角度切入。它们会讨论 PPO、GRPO、PRM、value model、agent benchmark 或 RL theory,但 credit assignment 只是其中一节。对当前 LLM RL 来说,这种视角会漏掉一个共同结构:很多看似不同的方法都在处理同一个问题,即 terminal outcome reward 如何变成局部训练信号。

已有方法本身也很分散:

  • reasoning RL 里,PRM / verifier 路线强调 step correctness;VinePPO、SPO、VIMPO、OTB、SRPO 这类方法分别从 MC continuation、segment advantage、policy-implied value、token baseline、reset suffix resampling 切入。
  • agentic RL 里,AgentPRM、Turn-PPO、SORL 等方法把 turn 当作更自然的 macro-action;HCAPO、C3、CCPO 等方法用 hindsight / counterfactual 估计某个 turn 的贡献;CARL、IGPO 等方法用 entropy / information gain 找 critical action。
  • multi-agent RL 里,credit 还要分到 agent、role、message 和团队贡献,Shapley / counterfactual / hierarchical advantage 成本迅速上升。

论文的综述目标是把这些路线放到统一表格里,同时指出哪些方法的证据来自 controlled benchmark,哪些只是作者综合判断。

3. 作者可能的思考路径

作者的思路大概率从两个观察出发。

第一个观察是 GRPO / REINFORCE 的 episode-level credit 在 reasoning RL 中仍能工作,原因在于单条 generation 的环境转移是自回归确定的,最终答案 verifier 明确,关键决策数量相对有限。随着 response length 到 10K-30K token,token-level variance 和 step-level error localization 变成瓶颈,于是出现 PRM、MC continuation、token baseline、reset 等方法。

第二个观察是 agentic RL 把这个问题推到另一种 regime。turn 之间有工具执行、网页变化、file system 状态、外部 API 和多 agent 通信,trajectory 可能到 100+ turns、100K-1M tokens。这里的关键 action 未必是单个 token,而可能是某个 tool call、某次检索、某个 plan revision 或某个 sub-agent delegation。reasoning RL 的 token/step 方法可以迁移一部分 intuition,但 agentic setting 需要 hindsight、privileged critic、turn-level MDP 和 cross-agent decomposition。

4. 核心假设或切入点

核心切入点是二维分类:

维度 取值 主要问题
Granularity token / segment / step-turn / multi-agent credit 分配到多细,和任务自然 action unit 是否一致
Methodology MC / TD / LLM-as-Critic / game-theoretic / information-theoretic credit 如何估计,成本来自 rollout、critic、counterfactual 还是信息量计算

这张二维表背后的判断是:更细 granularity 通常带来更准确的训练信号,也带来更高计算成本和更强建模假设;更粗 granularity 更贴近 agentic turn / tool interaction,但容易把一个 turn 内的 token-level 决策继续混在一起。

5. 方法 / 系统 / 理论框架

论文先把 reasoning RL 写成 token-level MDP:state 是 prompt 加已生成 tokens,action 是 next token,transition 是确定的 autoregressive append,reward 通常只在终点给出。这里 credit assignment 的问题是:哪些 token、segment 或 reasoning step 真正推动最终答案正确。

然后把 agentic RL 写成 turn-level POMDP:state 包括 conversation history、environment state 和 retrieved context,agent 只看 observation;action 通常是一整个 LLM response,里面可能包含 tool call 或自然语言;transition 来自工具、网页、sandbox 或其他 agent,具有随机性和部分可观测性。这里 credit assignment 是层级问题:先判断哪个 turn / tool action 关键,再判断 turn 内哪些 token 或 action field 关键。

论文把方法分成几组:

方法族 典型代表 信号来源 成本与风险
token-level MC / redistribution VinePPO, RED, T-REG, OTB / VIMPO 相关线索 从中间 token 前缀 rollout 或重分配 return 长序列下 rollout / full distribution / estimator 成本高
segment / step-level process SPO, PRM, Math-Shepherd, HICRA, CAPO step correctness、completion potential、LLM critic 依赖 step boundary、PRM 质量或 judge 可靠性
turn-level process AgentPRM, SWEET-RL, Turn-PPO, SORL, ITPO turn-level value、privileged critic、implicit turn reward 适合 agent,但可能丢失 turn 内 token credit
hindsight / counterfactual HCAPO, C3, CCPO, CriticSearch 完整 trajectory 后回看关键 turn 或 counterfactual LLM critic bias、环境重放成本、counterfactual 近似误差
multi-agent M-GRPO, LLM-MCA, SHARP, MAPPA, Dr. MAS team reward 分解到 agent / action / message Shapley / leave-one-out 成本高,通信 credit 仍薄弱

6. 结论链条

论文的结论链可以压缩为四步:

  1. RLHF -> reasoning RL -> agentic RL 的演化带来更长 horizon、更稀疏 reward、更复杂 state transition。
  2. episode-level credit 在 single-turn reasoning 中已经粗糙,在 multi-turn agentic setting 中信噪比进一步下降。
  3. 社区方法正在从 token/step-level reasoning credit 扩展到 turn-level、hindsight、privileged critic 和 multi-agent decomposition。
  4. 当前最大短板是实验不可比:benchmark 分散、baseline recipe 不统一、compute overhead 和 trajectory metadata 报告不足,因此需要 reporting checklist 和 benchmark protocol。

关键实验/定理

结果 1:47-method taxonomy 和 coverage protocol

  • 设置:覆盖 2024-01 到 2026-04 的 LLM RL credit assignment 相关工作;通过 arXiv、Semantic Scholar、Google Scholar、citation chasing 和 venue monitoring 收集。
  • Baseline:无训练 baseline;这是文献覆盖和分类任务。
  • 指标:方法数量、core vs adjacent、granularity / methodology labels、benchmark / evidence level。
  • 结果:作者收录 47 个方法,其中 41 个 core CA methods、6 个 CA-adjacent enablers;另把 Math-Shepherd、OmegaPRM、GRPO、DeepSeek-R1 等作为 foundational background。
  • 解读:这张表的主要价值是地图,而非 ranking。单作者 screening 和 fast-moving preprint landscape 会带来漏收和分类边界问题。

结果 2:reasoning MDP 与 agentic POMDP 的问题分解

  • 设置:把 reasoning RL 抽象为 token-level MDP,把 agentic RL 抽象为 turn-level POMDP。
  • Baseline:GRPO / REINFORCE 的 episode-level credit。
  • 指标:trajectory length、turn count、transition stochasticity、partial observability、credit granularity。
  • 结果:reasoning RL 通常是单 generation、500-30K+ tokens、terminal reward;agentic RL 是 10-100+ turns、100K-1M tokens、stochastic environment 和 partial observability。
  • 解读:这个分解是全文最有用的概念贡献。它解释了为什么 reasoning RL 的 token/step 方法不能原样覆盖 agentic workflow:agentic 任务的自然 action unit 往往是 turn、tool call、message 或 sub-agent decision。

结果 3:跨论文定量综合只支持趋势判断

  • 设置:汇总各原论文公开报告的 reasoning / agentic CA 结果。
  • Baseline:各论文自己的 GRPO / PPO / ORM / DPO baseline。
  • 指标:相对各自 baseline 的 benchmark improvement。
  • 结果:作者观察到 agentic subset 相对 episode-level baseline 的改善均值更高,但样本少、base model 和 benchmark 异质性强,且 agentic subset 被少数方法主导。
  • 解读:这个结果可以支持“trajectory 更长时 episode-level credit 更吃力”的趋势判断,不应作为 agentic CA 方法普遍优于 reasoning CA 方法的实验证明。

结果 4:reporting checklist 对后续论文更有复用价值

  • 设置:从 survey 中抽取常见报告缺口,并在 HICRA、GiGPO、M-GRPO 三个代表方法上验证 checklist。
  • Baseline:没有模型训练 baseline;这是论文报告质量审计。
  • 指标:是否报告 base model、training data、CA granularity、methodology family、episode-level baseline、baseline recipe、CA ablation、benchmark split、metric、variance、GPU-hours、CA overhead、trajectory length。
  • 结果:checklist 明确要求至少一个同 base model 的 episode-level baseline,并要求报告 compute budget 或显式 compute comparison。
  • 解读:这部分应直接纳入我们后续读 LLM RL 论文的审稿标准。尤其是 reset、PRM、agentic RL、rollout correction 和 token baseline 论文,都要补查 rollout 数、trajectory length、baseline tuning 和 CA-specific overhead。

实验设置与 baseline 审计

  • 模型与初始化:survey 自身没有训练模型;被综述方法使用的 base model 分散,包括 Qwen、Llama、DeepSeek 系列和若干 task-specific agents。
  • 数据与任务:reasoning 侧常见 GSM8K、MATH、AIME、CodeContests;agentic 侧包括 WebShop、WebArena、ALFWorld、SWE-bench、ScienceWorld、multi-agent suites。agentic benchmark 明显更碎片化。
  • RL / 训练配置:survey 记录 PPO、GRPO、DPO-style、critic-free、actor-critic、PRM、hindsight、counterfactual、implicit reward 等方法族,但不统一复现超参。
  • 系统配置:没有统一 GPU / rollout engine / trainer engine 复现;部分原论文报告 compute,部分缺失。
  • 评测协议:以原论文 reported numbers 为主;作者也明确 cross-paper numbers 不能直接比较。
  • 统计报告:survey 试图标注 evidence level,但大量原论文缺 seed、CI、compute 和 CA overhead。
  • Baseline 强度:
    • 是否 tuned:无法统一确认;survey 只能依赖原论文报告。
    • 是否 compute-matched:多数跨论文比较无法 compute-match。
    • 是否 implementation-matched:不匹配;base model、data、trainer、rollout engine 和 reward 都不同。
    • 是否覆盖强替代方案:survey 尽量覆盖多类方法,但每篇原论文自己的 baseline 覆盖强度差异很大。
    • 是否存在弱化风险:定量表格容易被误读为排行榜;更合理的用法是定位方法族和检查实验报告缺口。
    • 结论边界:survey 支持 taxonomy 和 research-gap 判断;不支持对具体方法做统一性能排名。

证据链强度评估

强证据

  • arXiv v2、GitHub living list 和 Hugging Face paper page 给出一致的标题、作者、项目和 47-method snapshot 线索。
  • reasoning RL / agentic RL 的 MDP/POMDP 区分清晰,和我们已读的 DAPO、OTB、SRPO、VIMPO、TRM、tool-calling RL 经验一致。
  • reporting checklist 直接击中当前 LLM RL 论文常见短板:baseline recipe、compute-match、CA-specific overhead、trajectory length distribution 和 variance estimate。

中等强度证据

  • taxonomy 覆盖了主要方法族,但分类来自单作者判断;某些方法可以同时属于 reward shaping、infrastructure、verifier training 或 credit assignment。
  • 方法选择树对阅读者有帮助,但验证只在已知方法上做 retrospective mapping,缺少 out-of-sample 测试。
  • GitHub repo 有 70+ stars 和后续维护,说明有一定社区关注;这个信号不同于正式 peer review 或方法被广泛采用。

需要谨慎的推论

  • “agentic RL reshapes credit assignment”是合理的作者综合,但强度主要来自概念分析和异质实证结果。
  • 表格中的 reported gains 来自不同论文,横向比较风险很高。
  • 很多 2026 方法仍是 preprint,后续标题、结果、代码和审稿状态可能变化。
  • 外部博客/速读站点可能误标作者机构;归档时以 arXiv 标题页和高置信 profile 为准。

OpenReview / 审稿意见吸收

  • Venue status: arXiv preprint;未发现可可靠匹配当前版本的公开 OpenReview / ARR / 会议审稿页。
  • Public reviews: 未发现公开 official review。
  • Ratings / confidence: 未发现。
  • Reviewer consensus: 未发现公开 reviewer consensus。
  • Main criticisms: 无公开 reviewer comments;本地可信度判断主要来自论文自身 threats to validity 和 survey 方法边界。
  • Author response: 未发现公开 rebuttal。
  • 对可信度的影响: taxonomy / checklist 可作为阅读工具使用;关于方法强弱和定量趋势的判断应保持 preprint survey 级别,不按正式审稿结论引用。

本地讨论补充

1. 归档定位

这篇应放在本地 archive 的“credit assignment 总图谱”位置。它不替代 OTB、SRPO、VIMPO、PRM、STV、TRM 等单篇方法分析,但可以帮助我们给每篇新 RL 论文贴上 granularity、methodology、baseline strength 和 evidence level 标签。

2. 和我们已有文档的互补关系

OTB、VIMPO、SRPO 都在 reasoning RL 里把 outcome reward 往更细粒度移动;TRM / TIM 处理 rollout 和 optimization policy 分布不一致;tool-calling RL 论文处理 agentic harness、有效 rollout 和 policy update 成本。Chenchen Zhang 这篇把这些线索放在一张 credit assignment 地图里,尤其提醒 agentic RL 的自然 credit unit 往往是 turn / tool action / sub-agent decision。

3. 后续复验指标

读新的 CA 论文时,至少记录:

  • credit granularity: token、segment、step、turn、agent、message。
  • estimator family: MC、TD、LLM critic、counterfactual、information gain、implicit value。
  • baseline: GRPO / PPO / DAPO / OTB / PRM / random reset / sequence rejection / BoN 等是否足够强。
  • compute: rollout 数、environment resets、extra LLM critic calls、GPU-hours、wall-clock。
  • trajectory: tokens / turns 的 mean、median、max 和 length distribution。
  • mismatch: rollout policy、old policy、current policy、reference policy 是否区分,logprob path 是否一致。

主要启发

  • credit assignment 是连接 reasoning RL、agentic RL 和 multi-agent RL 的共同轴。很多论文表面上谈 verifier、reset、baseline、trust region 或 tool-calling efficiency,底层都在处理 terminal reward 如何变成可学习的局部信号。
  • granularity 应该跟任务自然 action unit 对齐。math CoT 适合 token / step / segment;tool-use agent 更适合 turn / action field;multi-agent workflow 还要考虑 role、message 和 delegation。
  • 更细 credit 通常消耗更多 compute。方法论文必须报告 CA-specific overhead,包括额外 forward、environment reset、LLM critic call、counterfactual rollout、PRM 训练和 wall-clock。
  • 对 agentic RL,benchmark fragmentation 会严重影响结论可信度。没有 shared tasks 和 compute-matched baseline 时,reported gain 只能在原论文 setting 内解释。

局限

  1. 单作者 survey,paper inclusion、classification 和 evidence coding 都可能存在主观边界。
  2. 大量被综述方法是 2026 前后的 preprint,正式审稿和复现状态不稳定。
  3. 定量比较没有统一训练和评测协议,不适合作为算法排行榜。
  4. GitHub living list 会持续加入新论文,arXiv v2 的 47-method snapshot 会随时间过期。
  5. survey 没有直接复现关键 CA 方法,因此无法校准各原论文 baseline 是否充分 tuned。
  6. 对 open-world agent reward uncertainty、多 agent communication credit、memory credit 和 exploration-credit coupling 的讨论偏 roadmap,缺少实证闭环。

跨论文关系

  • 2604.17312 Data-Scarcity RL Survey:两篇均在 2026 年 4 月首次公开。本文按 token / segment / step / turn / agent 解释稀疏 reward 如何进入局部 update,后者按 data / training / framework 解释有限监督与 rollout 如何被生产和利用;credit assignment 可视为其 reward engineering 与 policy optimization 之间的细化接口。
  • LLM 与 Agent 强化学习中的信用分配:该主线把 survey 的 early-2026 taxonomy 延伸到 2026 年 5—7 月,并为 memory / compaction 方法增加状态可比性、来源路由与有符号时间信用三个审计维度。
  • LLM-as-a-Verifier:该文用 frozen LLM 的连续 pairwise score 构造 prefix progress 与 dense RL feedback,落在 survey 的 process feedback / LLM-as-Critic 坐标;现有 RL 实验为 single-turn,尚未覆盖 survey 强调的 turn-level 与 long-horizon agent credit。
  • 2602.07078 OTB:OTB 是 token-level variance reduction / baseline 节点;这篇给它所在的 token-level CA 坐标系和 reporting checklist。
  • 2605.25507 SRPO:SRPO 属于 reset / suffix resampling 的 reasoning CA 方法;这篇帮助区分 reset-based local credit 与 generic episode-level GRPO。
  • 2606.20008 VIMPO:VIMPO 属于 critic-free token-level value / advantage 方法;这篇强调此类方法要报告 compute overhead 和 baseline strength。
  • 2305.20050 PRM800K2312.08935 Math-Shepherd:两者是 step-level process supervision 的历史节点;survey 将 PRM 路线放入 reasoning CA 的成熟方向。
  • 2605.30290 STV:STV 训练 verifier feedback,不直接输出 step PRM label;survey 的 LLM-as-Critic / process feedback 轴可以帮助定位 STV 和传统 PRM 的差异。
  • 2512.23075 TRM2605.14220 TIM/VeXact:TRM/TIM 关注 rollout/current 或 trainer/rollout mismatch;survey 提醒 CA 方法要放回完整 RL pipeline,而 mismatch 会改变 credit signal 的有效分布。
  • 2606.00135 tool-calling RL:tool-calling RL 是 agentic setting 的具体 workload;survey 的 turn-level / hindsight / privileged critic taxonomy 为后续分析 agent harness credit 提供语言。
  • 跨论文关系定位:记录 LLM RL Credit Assignment Survey 与 Reasoning-to-Agentic Taxonomy。

Reference Intake Brief

Target

Reusable Elements

  1. 二维 taxonomy: granularity x methodology。
  2. reasoning RL token-level MDP 与 agentic RL turn-level POMDP 的区分。
  3. CA paper reporting checklist:baseline、compute、trajectory length、variance、CA overhead。
  4. 读新论文的定位问题:它把 terminal reward 分到哪里,用什么 estimator,baseline 是否够强,开销是否报告。

Risks

  • Copyright/over-copying: 只转述核心结构和少量术语,不复制长段原文或完整表格。
  • Tone/brand mismatch: 保持技术归档语气,把热度、综述价值和实证可信度分开。
  • Safety/compliance issues: 主题是 RL credit assignment;归档内容服务方法审计,不提供可滥用流程。
  • Overlap with existing assets: 与多篇 RLVR / PRM / agentic RL 笔记重叠;本文只作为总图谱和 checklist 节点。

Skipped

Material Reason
公开 reviewer comments 未发现可可靠匹配当前 arXiv v2 的 OpenReview / ARR / 会议公开审稿页。
X account 搜索到的 @chenchenzh 对应国际关系方向同名作者;缺少 arXiv email、GitHub/HF handle 或 Scholar 交叉证据。
统一复现实验 论文自身为 survey,不提供统一 reimplementation;本地不进行方法复现。

Recommendation

Decision: merge

Why: 这篇补齐本地 archive 中 credit assignment 总览节点,能把 OTB、SRPO、VIMPO、PRM、STV、TRM、TIM 和 agentic tool-calling RL 放进同一坐标系。引用时需要明确 preprint survey、单作者分类和非统一复现的边界。