2605.26684-graphgpo-graph-credit-assignment-agentic-rl

Beyond Trajectory Level Attribution: Graph Based Credit Assignment for Agentic Reinforcement Learning

GraphGPO 将同一任务的一组智能体轨迹合并为状态转移图,以各后继状态到成功节点的最短路径距离构造逐步优势,再与终局优势联合更新策略;它在状态可稳定合并、目标可验证的 ALFWorld、WebShop 和 Sokoban 设置中优于 GRPO 与 GiGPO,现有证据尚未覆盖随机或开放式环境。

Authors Xin Cheng, Shuo He, Lang Feng, HaiYang Xu, Ming Yan, Lei Feng (冯磊), Bo An

待审阅 Archived 2026-07-22 14:40 Source

Source

  • Workflow version: v2.1
  • Material type: research-paper
  • Analysis modules: experiment, theory
  • Canonical source: https://arxiv.org/abs/2605.26684
  • Title: Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning
  • Authors: Xin Cheng, Shuo He, Lang Feng, HaiYang Xu, Ming Yan, Lei Feng, Bo An
  • Responsible organization: Nanyang Technological University;Tongyi Lab, Alibaba Group;Southeast University
  • arXiv: https://arxiv.org/abs/2605.26684
  • PDF: https://arxiv.org/pdf/2605.26684v2
  • Code/Project: GraphGPO in verl-agentrevision 20bd331bdbc9026a5668e11362178e10ab7400c8
  • OpenReview / Review page: https://openreview.net/forum?id=zAFrIOeTCp
  • Submitted: OpenReview submission 2026-01-23;arXiv v1 2026-05-26
  • Published / updated: ICML 2026 regular paper accepted;arXiv v2 2026-06-01
  • Current version read: OpenReview Camera Ready Revision PDF;arXiv v2 HTML、TeX source 与 PDF;公开代码 revision 20bd331bdbc9026a5668e11362178e10ab7400c8
  • Version / revision read: OpenReview Camera Ready Revision;arXiv v2;code commit 20bd331bdbc9026a5668e11362178e10ab7400c8
  • Accessed: 2026-07-22
  • Key figure decision: include
  • Key figure rationale: Figure 3 同时展示跨轨迹状态合并、到成功节点的最短路径距离和同源状态动作比较,能够直接解释论文的首要贡献与成立条件。
  • Review status: page-type=official-review; match-confidence=high; observed-at=2026-07-22; venue-status=ICML 2026 regular accept
  • Subjects: agentic reinforcement learning, credit assignment, group policy optimization, state-transition graph, shortest-path distance, multi-turn agents

作者与关系

  • Xin Cheng:Nanyang Technological University。论文、OpenReview 与 HGPO 的身份链指向 NTU 研究者,与归档中的 DeepSeek / Peking University 同名作者属于不同身份;当前保留论文级身份。
  • Shuo He:Nanyang Technological University。
  • Lang Feng:Nanyang Technological University。
  • HaiYang Xu:Tongyi Lab, Alibaba Group。
  • Ming Yan:Tongyi Lab, Alibaba Group。
  • Lei Feng:Southeast University;通讯作者。
  • Bo An:Nanyang Technological University。

作者网络由三条机构关系组成:Xin Cheng、Shuo He、Lang Feng 与 Bo An 构成 NTU 主体;HaiYang Xu 和 Ming Yan 提供 Alibaba Tongyi Lab 桥接;Lei Feng 从 Southeast University 参与并担任通讯作者。Shuo He、Lang Feng、Xin Cheng、Lei Feng 与 Bo An 也共同署名 HGPO,Lang Feng 与 Bo An 署名 GiGPO,因此 GraphGPO 属于这一团队围绕多轮智能体分组优势估计的连续工作。

论文脉络

1. 研究问题、背景和价值

多轮智能体通常在轨迹结束时才获得成功或失败信号。GRPO 一类分组强化学习方法把同一问题的多条轨迹作为比较组,再把轨迹级优势广播到轨迹内各步。这样会出现两类系统性误标:成功轨迹中的绕路和错误步骤得到正信用,失败轨迹中已经完成的有效步骤得到负信用。

论文在早期 ALFWorld 训练中统计了这个现象:失败轨迹内仍有 22.0% 的步骤被标为 progress,成功轨迹内有 65.3% 的步骤被标为 non-progress;设置为每组 8 条 rollout、最多 50 步。这个统计依赖作者的 progress 分类规则,仍足以说明终局结果与单步质量存在明显错位。

GraphGPO 试图从已采样经验中恢复更细的比较关系。它利用多条轨迹可能重复访问相同状态这一结构,把一条失败轨迹的正确前缀与另一条成功轨迹的后缀连接起来,从而判断某一步是否把智能体带到更接近成功的状态。

2. 已有解决方案与不足

GRPO 只在完整轨迹之间计算相对优势,单步信用完全继承终局结果。GiGPO 增加同状态步骤分组:从相同 anchor state 出发的动作可以直接比较,但各步回报仍由所属轨迹的最终结果经过时间折扣得到。它改善了比较粒度,同时保留了“成功轨迹中的步骤整体较好”这一归因来源。

显式 critic 或过程奖励模型可以给每一步估值,训练和校准会增加模型、数据或推理成本;从中间状态重新采样 continuation 可以提供更接近反事实的比较,但会增加环境交互。GraphGPO 选择复用当前分组已经产生的轨迹,通过状态重合把多个局部片段组合成一个经验图,再从图上的成功可达性生成训练信号。

3. 作者可能的思考路径

以下为本地分析。GiGPO 已经证明“从同一状态出发的动作”是有意义的局部比较单元。下一步自然问题是:相同状态之后的价值能否利用其它轨迹提供,而不继续绑定原轨迹的终点。把组内轨迹合并后,一条轨迹的前缀可以接上另一条轨迹的成功后缀;成功节点到各状态的反向最短路径便成为一个无需参数模型的进度估计器。这样既保持 critic-free,也不新增 rollout。

这条思路的关键增量是跨轨迹路径组合。图数据结构承载具体实现,信用来源则改为“某个后继状态在组内经验图中距离成功有多远”。

4. 核心假设或切入点

GraphGPO 依赖四项关键条件:

  1. 环境状态可以形成稳定表示,同一决策状态能够被可靠合并,不同决策状态不会被错误合并。
  2. 同一任务的组内 rollout 会重复访问足够多的状态,并至少包含一条成功路径;状态只出现一次时,图优势直接置零。
  3. 到成功节点的观测最短路径能够充当动作质量的进度代理。这个代理偏好更短、成本更低的已观测路径。
  4. 环境近似确定,或状态表示已经吸收影响后继分布的随机因素。论文的两个命题都显式使用确定性条件。

这些条件在 ALFWorld、WebShop 和确定性 Sokoban 中经过任务定制后较容易满足。网页噪声、局部可观测、随机工具结果和开放式目标会直接削弱状态合并与最短路径估值。

5. 方法 / 系统 / 理论框架

5.1 当前批次的任务级状态图

对一个任务的 MM 条 rollout,GraphGPO 构造有向图 G=(S,E)\mathcal G=(\mathcal S,\mathcal E):节点是观测状态,边记录 (s,a,s,c)(s,a,s',c)。相同状态合并为一个节点;成功终止统一连接到 ssuccs_{\mathrm{succ}},超出步数上限的终止状态视为失败。实验中的边成本均为 1。

这张图按任务、按当前 rollout 组临时建立。它没有跨批次学习环境模型,也不参与测试时规划。其“全局”范围只覆盖当前任务组内所有已观测轨迹,没有覆盖完整环境状态空间。

5.2 从成功可达距离得到逐步回报

作者在反向图上运行 Dijkstra,计算每个状态到成功节点的最小观测成本:

d(s)=min(s,a,s,c)E(c(s,a)+d(s)),d(ssucc)=0. d(s)=\min_{(s,a,s',c)\in\mathcal E}\bigl(c(s,a)+d(s')\bigr), \qquad d(s_{\mathrm{succ}})=0.

论文把边的图回报定义为:

RG(s,a,s)=rsuccωd(s)+c(s,a),0<ω<1. R^G(s,a,s')=r_{\mathrm{succ}}\,\omega^{d(s')+c(s,a)}, \qquad 0<\omega<1.

组内没有观测到成功路径的状态原本距离为无穷大;实现将其替换为最大有限距离加一,避免指数回报完全消失。在同一个源状态且成本相同时,后继状态距离越短,图回报越高。

5.3 同源状态比较与策略更新

所有从同一状态出发的边组成局部比较组 GG(s)G^G(s),边回报在组内做均值和标准差归一化:

AG(s,a,s)=RG(s,a,s)μ(GG(s))σ(GG(s)). A^G(s,a,s')=\frac{R^G(s,a,s')-\mu(G^G(s))}{\sigma(G^G(s))}.

当一个源状态只有一条观测边时,AGA^G 设为 0。最终优势为图优势与 episode-level group advantage 的加权和:

A=βGAG+βEAE, A=\beta^G A^G+\beta^E A^E,

实验中两项权重都设为 1,再送入带 clipping 和参考策略 KL 的 PPO / GRPO 式目标。由此可见,图信号补充局部动作排序,终局优势继续覆盖没有局部比较对象的步骤和整条轨迹质量。

Figure 3: GraphGPO 的状态图聚合与图优势估计
Figure 3: 左侧把多条 rollout 中相同状态合并,并以到成功节点的最短路径标记各状态;右侧只在同一源状态的外出边之间比较图回报。失败轨迹中的早期正确动作可以借由其它轨迹的成功后缀得到正信用。Image Source: official arXiv HTML image / Figure 3.

5.4 真正的创新位置

GraphGPO 保留 GiGPO 的同状态分组、episode advantage 和策略优化骨架,新增一项批次内、任务特定、非参数化的进度估计器。它把“这一步所在轨迹最后是否成功”改写为“这一步的后继状态能否经组内已观测路径到达成功,以及最短路径有多长”。这一变化允许跨轨迹拼接证据,也把信用质量直接绑定到状态规范化和组内探索覆盖。

图回报在同源状态内标准化后,主要作用是排序候选动作。论文常用的“global progress”表述需要按这个局部口径理解:不同源状态之间的绝对距离没有直接形成统一 value scale。

6. 结论链条

  • 假设:状态可稳定合并,组内轨迹覆盖可连接的成功路径,最短观测路径可作为任务进度代理。
  • 机制:合并组内轨迹,反向计算成功可达距离,在同源状态的外出边之间标准化距离回报,再与终局优势相加。
  • 直接证据:GraphGPO 在相同 backbone、任务和训练超参数下,高于 GRPO 与直接前身 GiGPO;去掉终局优势会系统性下降,说明两种信号互补。
  • 最窄结论:在三个可定义成功节点、状态可任务化表示的交互环境中,批次状态图提供了有效的局部动作排序信号。
  • 边界:观测图的不可达性同时混入探索不足;最短路径表示经验可达性,未直接识别某一步对最终成功的因果贡献。

关键实验/定理

结果 1:对直接前身 GiGPO 的增量在不同环境中差异明显

  • 设置:Qwen2.5-1.5B-Instruct 与 Qwen2.5-7B-Instruct 用于 ALFWorld、WebShop;Qwen2.5-VL-3B-Instruct 用于 6×6 Sokoban;每组 8 条 rollout,训练 150 epochs。ALFWorld 和 WebShop 只保留最近两步交互历史。1.5B / VL-3B 使用 2 张 H100 80GB,7B 使用 4 张;训练时共运行 128 个环境。
  • 训练配置:rollout / validation temperature 分别为 1.0 / 0.4,actor learning rate 为 1e-6,KL coefficient 为 0.01;成功、失败和非法动作 reward 分别为 10、0、-0.1。ALFWorld / WebShop / Sokoban 的最大环境步数为 50 / 15 / 15,prompt 上限为 2048 / 5120 / 1024 tokens,response 上限均为 512,mini-batch size 为 256 / 64 / 64,GraphGPO 的距离折扣为 0.1 / 0.2 / 0.8。
  • Baseline:PPO、RLOO、GRPO、GiGPO,以及若干 prompting / closed-source 参照;最能隔离图信用贡献的对照是 GiGPO。
  • 指标:测试成功率;WebShop 另报 task score。
  • 结果:
Backbone / 环境 GRPO GiGPO GraphGPO GraphGPO 相对 GiGPO
Qwen2.5-1.5B / ALFWorld overall 77.86±1.33 90.88±0.97 92.71±1.32 +1.83 pp
Qwen2.5-1.5B / WebShop success 71.35±2.05 73.83±2.30 78.65±3.86 +4.82 pp
Qwen2.5-7B / ALFWorld overall 83.33±2.05 94.27±1.33 95.31±1.10 +1.04 pp
Qwen2.5-7B / WebShop success 75.00±2.78 78.38±1.94 80.31±1.33 +1.93 pp
Qwen2.5-VL-3B / Sokoban success 67.10 76.92 86.98±0.73 +10.06 pp
  • 对照是否可比:论文称所有训练方法共享超参数,并在作者增强后的同一环境中复现 baseline。ALFWorld 增加当前位置和持有物品等观测,WebShop 使用 text-rich 版本,因此表内算法对照可比,不能直接与其它论文报告的原始环境数值互换。论文没有给出显著性检验、entropy coefficient、逐 seed checkpoint 选择规则、总训练 token 或完整 wall-clock。
  • 证据定位:Section 5.1–5.2;Tables 1–2;arXiv v2 PDF pp. 6–8。
  • 支持的最窄结论:GraphGPO 在五组 matched comparisons 中均高于 GiGPO;增量在四组文本环境对照中为 1.04–4.82 个百分点,在确定性 Sokoban 中为 10.06 个百分点。
  • 解读:论文摘要式结论主要依赖相对 GRPO 的大幅提升;GiGPO 已经吸收同状态分组带来的大部分收益。图距离相对 GiGPO 的独立增量更适合衡量新增机制。

结果 2:图优势需要终局优势补充,训练步数上的收敛更早

  • 设置:1.5B 模型上的 ALFWorld、WebShop 与 VL-3B Sokoban;分别移除 episode advantage,并比较 dynamic sampling 版本。验证曲线比较达到相近性能所需的 optimizer steps。
  • Baseline:GiGPO 的对应消融与完整 GRPO / GiGPO。
  • 指标:成功率与验证性能达到相近水平的训练步数。
  • 结果:移除 AEA^E 后,GraphGPO 从 92.71 降至 91.67(ALFWorld)、78.65 降至 75.00(WebShop)、86.98 降至 83.07(Sokoban);GiGPO 也下降。作者报告 GraphGPO 在 ALFWorld 约比 GiGPO 提前 30 步、比 GRPO 提前 110 步达到相近验证性能,在 WebShop 分别提前约 80 和 90 步。dynamic sampling 会同时提高 GiGPO 与 GraphGPO。
  • 对照是否可比:消融共用模型与任务;训练曲线横轴为优化步数,没有换算 wall-clock、环境交互次数或总 token。
  • 证据定位:Table 3;Figure 4;Appendix C.2;arXiv v2 PDF pp. 8–9、Appendix。
  • 支持的最窄结论:图信号可以提高局部信用质量,终局优势仍是完整方法的必要组成;论文支持 update-step efficiency,wall-clock 效率还需按完整 rollout 与训练成本复验。
  • 解读:状态只出现一次时图优势为零,部分观测图也可能缺少成功连接。终局优势承担了这些覆盖缺口,因此 GraphGPO 的有效形式是组合估计器。

结果 3:较小 rollout 组仍有收益,噪声实验依赖额外状态匹配机制

  • 设置:WebShop 上把 group size 设为 4、6、8;另向页面随机插入广告,比较 raw-text matching 与作者称为 embedding-based matching 的 95% 阈值匹配。
  • Baseline:相同 group size 下的 GRPO、GiGPO;噪声环境中比较两种状态匹配。
  • 指标:WebShop 测试成功率,三次随机种子。
  • 结果:group size 为 4、6、8 时,GraphGPO 分别为 74.06±2.88、74.58±3.00、78.65±3.86;对应 GiGPO 为 69.90±2.19、73.34±1.98、73.83±2.30。四组广告噪声设置中,raw-text matching 为 74.22–77.85,匹配增强版本为 77.42–78.26。
  • 对照是否可比:组大小对照匹配;噪声实验同时改变状态合并算法,证明的是附加匹配机制可以缓解图碎片化。公开实现的相似度路径使用 Python difflib.SequenceMatcher 字符串相似度,和论文所称 embedding-based matching 不一致。
  • 证据定位:Appendix C.5–C.6;Tables 8–9;code recipe/GraphGPO/core_graph.py at commit 20bd331bdbc9026a5668e11362178e10ab7400c8
  • 支持的最窄结论:GraphGPO 在 4–8 条 rollout 的 WebShop 组中保持相对优势;带噪状态需要额外规范化,公开代码尚未复现论文描述的 embedding matcher。
  • 解读:图覆盖度随组大小提升,组内 rollout 同时决定 GRPO baseline 的统计质量和 GraphGPO 的连通性。更开放的任务还需要联合报告节点复用率、错误合并率、成功可达覆盖率与性能。

结果 4:理论给出距离排序和条件方差性质,结论范围较窄

  • 假设:环境确定;两个动作从同一状态出发;图距离和边成本固定;方差命题还要求同一转移可出现在成功与失败轨迹中,并假设该转移与出现时刻独立。
  • 适用域:固定经验图上的单步反馈排序与条件方差。
  • 结果:Proposition 4.1 由 0<ω<10<\omega<1 的单调性推出,距离成功更近的后继得到更高图优势。Proposition 4.2 证明固定图后 RG(s,a,s)R^G(s,a,s') 对给定转移是确定值,条件方差为零,因此不高于仍随轨迹结果变化的反馈。
  • 对照是否可比:两个命题比较固定转移上的反馈性质,没有直接比较经验图估计误差或完整训练算法;该理论对象与实验中的批次间策略更新只形成局部映射。
  • 证据定位:Section 4.3–4.4;Appendix A.2–A.3;arXiv v2 PDF pp. 5–6、Appendix。
  • 支持的最窄结论:在给定图和确定转移条件下,图回报会保持距离排序,并消除同一观测转移因所属轨迹结果不同产生的条件波动。
  • 解读:方差结论主要来自“固定图后回报为确定函数”。它没有覆盖经验图估计误差、批次间图变化、状态混叠、随机后继或最终 policy-gradient 方差;这些项决定实际信用是否更准确。

结果 5:图计算本身很轻,论文公式与公开实现存在一格指数偏移

  • 设置:作者分解一次训练迭代的 rollout、图构建、回报估计、优势计算、概率重算和策略更新耗时;代码审计使用公开仓库 commit 20bd331bdbc9026a5668e11362178e10ab7400c8
  • 指标:每阶段秒数与总迭代占比;公式和实现的一致性。
  • 结果:图构建 0.108 秒,图优势计算 0.025 秒;rollout 216.9 秒,policy update 74.2 秒。作者把新增图计算合计为每次迭代的 0.04%。论文 Eq. 4 在单位边成本下使用 10ωd(s)+110\omega^{d(s')+1},公开代码默认分支使用 10 * gamma ** (d(s')),相差一个全局 γ\gamma 倍数。
  • 对照是否可比:同源状态内采用 mean/std normalization 时,全局正比例会被归一化抵消,因此默认实验的动作排序和标准化优势不受这一偏移影响;mean_norm、非单位成本或其它组合可能保留尺度差异。
  • 证据定位:Section 5.2 Figure 5;Eq. 4;code recipe/GraphGPO/core_graph.py:774-838;code README。
  • 支持的最窄结论:在作者的 group size 8 设置中,图后处理相对 LLM rollout 与反向传播开销很小;公开实现足以展示核心路径,但还存在论文—代码口径差异。
  • 解读:0.04% 描述固定 rollout 数据之后的图计算增量。方法仍需要同任务多条 rollout 来形成图,完整训练成本受组大小和环境交互主导。

局限

  1. 状态等价决定方法上限。 默认实现做精确匹配;文本格式、历史窗口或随机观察的微小变化会把语义相同状态拆开。近似匹配会引入反向风险,把决策上不同的状态合并后产生虚假捷径。
  2. 未观测与不可达被压到同一类别。 当前批次没有发现成功后缀的状态会被赋为 dmax+1d_{\max}+1。这可能表示坏状态,也可能只表示 rollout 数量有限。早期训练成功稀疏时,这项偏差尤其重要。
  3. 最短路径是进度代理。 它偏好组内已观测的短路径,无法单独识别某一步对成功的因果贡献;必要探索、暂时绕行、资源收集和存在陷阱的环境可能违反“更近即更好”。
  4. 随机与开放式环境尚未验证。 主实验环境经过状态定制,Sokoban 明确确定;论文没有在随机后继、部分可观测工具链、动态网页或多种有效终点上检验图稳定性。把 LLM judge 接成成功节点仍需校准 judge 误差和目标漂移。
  5. 独立增量和统计证据有限。 相对 GiGPO 的四个文本环境增量为 1.04–4.82 个百分点,标准差区间存在重叠;论文多数结果用三次种子,没有显著性检验或置信区间。
  6. 环境改造限制外部比较。 ALFWorld 补充位置与持有物品,WebShop 使用 text-rich 观测;表内 baseline 已重跑,跨论文绝对数值仍需对齐 harness。
  7. 理论没有覆盖估计误差。 方差命题固定了经验图,因此结论不涉及图本身随 rollout 变化的方差,也不保证更低偏差或更高 policy-gradient 信噪比。
  8. 公开产物存在两处复现缺口。 噪声附录写 embedding-based matching,代码使用 SequenceMatcher;论文公式与默认代码的指数相差一个单位。默认归一化缓解第二项,第一项仍会影响状态图结构。

跨论文关系

  • 与已有论文的作者或机构关系:GraphGPO 延续 NTU、Southeast University 与 Alibaba 之间的智能体强化学习合作。Lang Feng 与 Bo An 是 GiGPO 作者;Shuo He、Lang Feng、Xin Cheng、Lei Feng 与 Bo An 共同署名 HGPO
  • LLM 与 Agent 强化学习中的信用分配 的关系:该主线把 GraphGPO 放在 2026 年 5 月的结构先验路线中;本笔记进一步把它定位为批次内、任务特定的非参数进度估计器,并补充状态合并、图覆盖和实现差异。
  • Credit Assignment Survey 的关系:GraphGPO 位于 step-level、critic-free、cross-rollout aggregation 象限,信用单元是环境转移,识别信号是经验图中的成功可达距离。
  • TRACE 的关系:TRACE 用冻结参考模型测量工具边界后答案可预测性的变化;GraphGPO 用同任务轨迹图的环境状态距离估计进度。前者依赖 reference scorer 和已知答案,后者依赖可合并状态和成功节点。
  • SRPO 的关系:SRPO 从定位出的错误前缀重新采样后缀,形成局部 continuation 对照;GraphGPO 不新增 rollout,利用组内已有路径跨轨迹组合证据,反事实强度较弱但后处理成本更低。
  • VIMPOOTB 的关系:VIMPO 与 OTB 在 token-level policy-gradient estimator 或 baseline 上降低方差,GraphGPO 在环境 step-level 改写信用来源;三者可以作为不同层级的估计器设计理解。

OpenReview / 审稿意见吸收

  • 访问状态:官方 API v2 已认证;论坛中可读 Note 共 18 条,包括 1 个 submission、4 份 official review、4 份 author rebuttal、4 份 acknowledgement、4 条后续 comment 和 1 个 decision。
  • 初始评分:四位 reviewer 的 overall recommendation 依次为 4、3、4、5,confidence 依次为 3、4、4、3。各 reviewer 对问题重要性和 critic-free 图信用思路总体认可,对原创性与普适性的判断更保守。
  • Reviewer consensus: 主要优点包括明确量化轨迹级误标、利用组内轨迹恢复逐步信号、跨 ALFWorld / WebShop / Sokoban 的一致提升、理论说明和较低图计算开销。
  • Main criticisms: 高频问题集中在精确状态匹配导致图碎片化、开放目标与随机环境的适用性、图规模与探索覆盖、最短路径遇到陷阱时的可靠性、相对 GiGPO 的机制增量,以及成本函数、成功回报和距离折扣参数的表述与公平性。至少一位 reviewer 要求直接展示经验图是否真的提供有用结构。
  • Author response: 作者澄清主实验全部使用单位边成本,成本函数是可选扩展;补充广告噪声、不同 group size、短程 QA、超参数和案例分析,并给出同任务图辅助提示实验。短程 QA 平均分仅从 GiGPO 的 42.10 提升到 42.63,支持方法更适合长程、可复访状态任务。作者还报告同任务提示实验从 32.50% 提升到 92.50%,该结果复用了同任务图,不能外推到未见任务。
  • 回复后的判断:acknowledgement 中有 reviewer 表示问题已充分解决,也有 reviewer 继续保留对状态匹配、成本表述和直接图证据的疑问;一份 final justification 随后说明作者已处理其主要关切。公开记录没有显示 reviewer 修改初始分数。
  • Final decision:meta-review 最终给出 Accept (regular)。决定认可问题重要性、图优势机制、实验和写作,同时保留精确匹配、开放目标适应性与成本函数表述三项弱点。
  • 对可信度的影响: 补充实验提高了“组内状态可复用时方法有效”的可信度,也把边界收窄到确定或经过规范化的环境。评审过程没有消除状态等价误差、部分图偏差、随机环境外推和公开代码相似度实现差异,因此这些问题继续限制“faithful credit assignment”的广义主张。

主要启发

  1. 多条 rollout 可以形成一个批次内的非参数 value / progress surrogate。它适合成功节点明确、状态重访率高、环境转移较稳定的任务。
  2. 状态规范化属于信用估计器的一部分,需要单独测量节点复用率、错误合并率、成功可达覆盖率和不同批次图的一致性。
  3. 评价新增机制时应优先比较 GiGPO 这类共享同状态分组的直接前身;相对 GRPO 的总增益会同时包含分组粒度和图距离两部分。
  4. “更低条件方差”与“更准确的信用”需要分别验证。前者可以由固定图后的确定函数得到,后者还依赖图覆盖、状态表示与环境随机性。
  5. 适合后续复验的关键对照包括:固定总 rollout token 的 group-size sweep、随机转移环境、人工可知真实距离的小型 MDP、exact / lexical / embedding state matcher,以及图估值和真实 success probability 的校准曲线。