2607.13988-trace-turn-level-reward-assignment

TRACE: Turn level Reward Assignment via Credit Estimation for Long Horizon Agents

TRACE 用冻结初始化模型在每个工具调用边界上评估已知短答案的可预测性,把相邻前缀的相对剩余似然缺口变化做有限步时序差信用并与 GRPO 终局优势混合;在相同数据、接口和 outcome reward 下,Qwen3-4B 与 Qwen3-30B-A3B 的 BrowseComp-Plus 分数分别由 GRPO 的 30.0 和 36.4 提高到 35.6 和 42.6,三项开放网页评测也保持同向增益,当前证据限于短答案搜索任务,主表未报告重复训练或置信区间,也没有计入参考模型评分成本。

Authors Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge (葛涛), Hao Cheng, Mike Hang Wang, Jianfeng Gao, Sharon Li

待审阅 Archived 2026-07-21 15:52 Updated 2026-07-22 15:28 Source

Source

  • Workflow version: v2.1
  • Material type: research-paper
  • Analysis modules: experiment, system
  • Canonical source: https://arxiv.org/abs/2607.13988
  • Title: TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
  • Authors: Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge, Hao Cheng, Mike Hang Wang, Jianfeng Gao, Sharon Li
  • Responsible organization: University of Wisconsin–Madison;Microsoft Research
  • arXiv: https://arxiv.org/abs/2607.13988
  • PDF: https://arxiv.org/pdf/2607.13988
  • HTML: https://arxiv.org/html/2607.13988v1
  • TeX Source: https://arxiv.org/e-print/2607.13988
  • Code/Project: 截至 2026-07-21,arXiv 页面、HTML、PDF 与 TeX source 均未链接作者公开代码、checkpoint、数据或项目页
  • OpenReview / Review page: 通过标题、arXiv ID 与作者组合核验 OpenReview API,未发现可可靠匹配的公开 forum、审稿、rebuttal 或 decision
  • Submitted: 2026-07-15 16:16:42 UTC
  • Published / updated: 2026-07-15(arXiv v1)
  • Current version read: arXiv v1;PDF;HTML;TeX source
  • Version / revision read: arXiv:2607.13988v1
  • Accessed: 2026-07-21
  • Key figure decision: include
  • Review status: page-type=not-found; match-confidence=high; observed-at=2026-07-21; venue-status=arXiv preprint (v1)
  • License: CC BY 4.0
  • Subjects: Machine Learning(cs.LG)

作者与关系

Leitian Tao 是首位作者和 arXiv submitter,也是唯一同时署名 University of Wisconsin–Madison 与 Microsoft Research 的作者。其个人主页与 Sharon Li 的组页共同确认导师关系;这条学生—导师关系构成 UW–Madison 一侧的合作主线,Leitian Tao 的双署名连接 Microsoft Research 的企业研究团队。Baolin Peng、Wenlin Yao、Tao Ge、Hao Cheng、Mike Hang Wang 与 Jianfeng Gao 均在稳定公开资料中持续从事 LLM agent、tool use、reinforcement learning 或相关研究。

论文没有声明共同一作、通讯作者或 author contribution。TeX 作者块只对 Jianfeng Gao 与 Sharon Li 使用粗体,却没有解释粗体含义,因此本笔记不据此分配通讯或资深作者角色。当前档案未发现 8 位作者与既有论文的直接作者重叠,也没有姓名或别名冲突;Hao Cheng 存在外部同名作者,其 profile 使用逐篇显式链接消歧。

论文脉络

1. 研究问题、背景和价值

长程 agentic reinforcement learning 常在轨迹结束后才获得答案正确性 reward。一条搜索轨迹可能先找到多个有效线索,随后因一次错误检索或错误归纳而失败;成功轨迹也可能包含重复搜索、无关页面和无效确认。GRPO 等 outcome-only 方法把同一条轨迹的组相对优势广播给全部 assistant token,因此无法区分这些 turn 的局部作用。

轨迹增长会同时带来两类问题:成功信号变稀疏,单个终局 reward 对早期动作的解释力下降;同一优势覆盖更多异质决策,梯度中混入的无关更新增加。工具调用边界提供了自然的分析单元,因为每次边界都对应一组“模型动作—环境返回—可用信息变化”。TRACE 的目标是在这些边界上构造稳定的局部进度信号,同时保留可验证终局答案作为全局训练目标。

2. 已有解决方案与不足

已有细粒度信用路线主要包括:

  1. 训练 critic 或 process reward model,为每个状态或步骤估值;这条路线需要额外模型、训练数据和校准。
  2. 对中间前缀执行 Monte Carlo continuation 或同状态重采样,直接估计后续成功概率;其局部对照更强,rollout 成本也更高。
  3. 用人工、合成 judge 或结构化任务图标注关键步骤;适用范围受标注器和任务结构影响。
  4. 从 policy/reference 分布、模型内部状态或 attention 构造 proxy;这类方法降低额外 rollout,proxy 的校准成为主要假设。

TRACE 属于第四类。它用冻结模型对标准答案做 teacher-forced likelihood scoring,把答案条件信号转成 turn-level value proxy。相对既有 outcome broadcast,它改变 reward localization;相对 learned critic,它把训练成本换成逐前缀 reference inference;相对同状态重采样,它采用单条已发生轨迹上的相邻前缀比较,因此归因更便宜,反事实解释也更弱。

3. 作者可能的思考路径

以下为本地分析:

  1. 先把长程搜索轨迹按工具调用切开,使局部动作与环境 observation 形成可复查的状态转移。
  2. 训练数据已经包含标准答案,可以询问一个固定模型:加入当前 observation 后,标准答案是否更容易生成。
  3. 直接使用平均 log-probability 差会让不同置信区间的相同绝对变化获得相同权重,于是将其改写为“剩余平滑负对数似然缺口”的相对缩减。
  4. 相邻 value 差可以提供 signed credit;正值对应标准答案更容易生成,负值对应前缀使答案更难生成。
  5. search 的价值有时要在后续 openfind 后才显现,因此再用有限窗口把未来几个 TD 变化折扣回传。
  6. 局部 proxy 可能奖励与最终正确性不一致的行为,训练目标继续保留 GRPO outcome advantage,并用较小权重加入 turn credit。

4. 核心假设或切入点

假设 在 TRACE 中的作用 失效方式
标准答案短、唯一且训练时已知 允许对每个前缀直接计算 gold-answer likelihood 同义答案、长结构化输出和开放偏好缺少稳定目标串
冻结初始化模型能识别 evidence 把前缀 likelihood 当作稳定进度探针 reference model 忽略证据、受位置影响或偏好表面词匹配
相邻前缀的 likelihood 变化反映该工具转移的价值 将 signed TD credit 分给当前 assistant action 同一转移同时包含动作与环境返回,无法分离动作质量、检索噪声和 observation 内容
三步窗口能覆盖主要延迟效应 open 后出现的证据回传给此前 search 更长依赖得不到信用,过大窗口会混入后续无关变化
局部 credit 与终局优势的尺度可由全局系数平衡 在同一 clipped GRPO objective 中混合两类信号 不同问题的初始 gap、答案长度和 reference calibration 使 turn reward 尺度不同

5. 方法 / 系统 / 理论框架

5.1 工具边界状态

对问题 xx、标准答案 yy^\star 与含 TT 次工具调用的轨迹,论文写成:

τ=(x,a1,o1,a2,o2,,aT,oT,y^). \tau=(x,a_1,o_1,a_2,o_2,\ldots,a_T,o_T,\hat y).

SkS_k 包含问题和前 kk 组 action–observation。训练 loss 只作用于 assistant 生成的 reasoning、tool-call 与 final-answer token,环境 observation 被 mask。第 kk 个工具转移的信用会分给生成该 action 的 assistant token。

5.2 冻结参考模型的答案就绪度

参考模型 πref\pi_{\mathrm{ref}} 是 policy initialization 的冻结副本。对每个前缀,TRACE 用 teacher forcing 计算标准答案的平均 token log-probability:

ˉk=1yt=1ylogπref(ytSk,y<t). \bar\ell_k = \frac{1}{|y^\star|} \sum_{t=1}^{|y^\star|} \log \pi_{\mathrm{ref}} \left(y_t^\star\mid S_k,y_{<t}^\star\right).

论文随后定义平滑的平均负对数似然缺口:

dk=ˉk+ϵ, d_k=-\bar\ell_k+\epsilon,

以及状态值:

V(Sk)=logd0dk. V(S_k)=\log\frac{d_0}{d_k}.

这里的 log-ratio 作用在 dkd_k 上。它没有直接计算相邻状态的答案概率比;论文所说“gap 减半得到 log2\log 2”也指平滑平均负对数似然减半。平均 log-probability 先消除答案 token 数的线性尺度,ϵ\epsilon 再限制接近零负对数似然时的数值增长。主训练使用 ϵtrain=0.1\epsilon_{\mathrm{train}}=0.1;Appendix A.2 的相关性诊断另用 ϵdiag=0.001\epsilon_{\mathrm{diag}}=0.001,诊断数值不能直接替代训练 credit 的尺度。

Figure 2: TRACE 在工具调用边界构造 turn credit
Figure 2: 每个工具边界前缀由冻结参考模型评分,相邻 value 变化形成 TD credit,再与 trajectory-level outcome advantage 混合。Image Source: official arXiv HTML image / Figure 2.

5.3 一步 TD credit 与望远镜求和

相邻状态的局部信用为:

δk=V(Sk+1)V(Sk)=logdkdk+1. \delta_k =V(S_{k+1})-V(S_k) =\log\frac{d_k}{d_{k+1}}.

若新 observation 让标准答案在参考模型下更容易生成,则 dk+1<dkd_{k+1}<d_k,当前转移获得正 credit。一步项满足:

k=0T1δk=logd0dT. \sum_{k=0}^{T-1}\delta_k =\log\frac{d_0}{d_T}.

这个等式说明,在起点和终点不变时插入中间状态不会增加一步 credit 的总和。raw log-probability difference 同样能望远镜求和;log-ratio 的区别性设计来自相对剩余 gap 的尺度变换和较缓的近终点放大。

5.4 实际训练使用有限步回传和终局填充

search 的价值经常要等到后续 open 才显现。TRACE 对当前 turn 和之后最多 K1K-1 个转移的 δ\delta 做归一化折扣平均:

cg,k(K)=1Zg,ku=khg,kγtdukδg,u,hg,k=min(k+K1,Tg1). c_{g,k}^{(K)} = \frac{1}{Z_{g,k}} \sum_{u=k}^{h_{g,k}} \gamma_{\mathrm{td}}^{u-k}\delta_{g,u}, \qquad h_{g,k}=\min(k+K-1,T_g-1).

当窗口触达轨迹尾部时,再加入折扣后的 GRPO outcome advantage:

rg,kturn=cg,k(K)+1[hg,k=Tg1]λtermγtdTgkAgout. r_{g,k}^{\mathrm{turn}} =c_{g,k}^{(K)} +\mathbf 1[h_{g,k}=T_g-1] \lambda_{\mathrm{term}} \gamma_{\mathrm{td}}^{T_g-k} A_g^{\mathrm{out}}.

主实验使用 K=3K=3γtd=0.8\gamma_{\mathrm{td}}=0.8λterm=2.0\lambda_{\mathrm{term}}=2.0。有限步窗口会让同一个未来 δ\delta 进入多个较早 turn,终局填充又加入额外 outcome 项;实际训练信号因此不再保持一步项的精确端点求和性质。论文在 Equation 10 后明确承认这一点。

5.5 与 outcome advantage 联合优化

工具交互 token 的最终优势为:

A^g,t=αoutAgout+αturnrg,turn(t)turn. \widehat A_{g,t} = \alpha_{\mathrm{out}}A_g^{\mathrm{out}} +\alpha_{\mathrm{turn}} r_{g,\mathrm{turn}(t)}^{\mathrm{turn}}.

主实验报告 αout=1.0\alpha_{\mathrm{out}}=1.0αturn=0.2\alpha_{\mathrm{turn}}=0.2,turn credit 不做 prompt-group normalization。final-answer token 使用 outcome component;Section 4.1 将 answer-tail weighting 记为 scale 0.05 的 group-mean rule,正文没有给出完整定义,所引用的附录表格行在 TeX source 中被注释。混合优势进入 per-token clipped GRPO objective。

一个重要训练差异出现在同一 prompt 的 8 条 rollout 全部成功或全部失败时。GRPO 的组标准差为零,论文把全部 outcome advantage 设为零;TRACE 的 reference-based 局部 δk\delta_k 仍可产生梯度。这条机制为早期训练更快启动提供了合理解释,也意味着 TRACE 使用的监督信息多于二元 outcome group advantage。

5.6 critic-freepure RL 的准确含义

critic-free 表示 TRACE 不训练一份随 policy 更新的 value model。每条 rollout 仍需由冻结 reference model 对全部增长前缀执行 teacher-forced gold-answer scoring。论文称这些分数可在一次 batched forward 中获得,附录同时说明训练通过 remote reference-model scoring endpoint 启用这条路径。

pure RL 表示本文 recipe 省去 cold-start agentic SFT、agentic mid-training 和 live-web training。初始化 checkpoint 是 Qwen3-4B-Thinking-2507 或 Qwen3-30B-A3B-Thinking-2507;文中 Base 指未接受本文 search-agent RL 的 Thinking checkpoint。训练数据由 LLM 生成和验证,turn reward 也持续读取已知 gold answer,因此该表述主要限定训练阶段类型。

5.7 数据、工具与训练系统

训练问题建立在 OpenResearcher 离线语料上,使用 Qwen3-Embedding-8B 与 FAISS 检索。合成流程从相关文档集合生成 BRIDGE_ENTITYINTERSECTIONCOUNTING_FILTEREDCOMPARATIVEREVERSE_LOOKUP 五类多文档问题,再经程序规则和独立 LLM answer verification 过滤。作者要求至少两份不可替代来源,并用实体遮蔽、角色描述和模糊时间等方式降低直接关键词检索。

Agent 使用 ReAct-style harness,工具只有 browser.searchbrowser.openbrowser.find。训练使用 Adam、常数学习率 10610^{-6}、global batch size 128、每 prompt 8 条 rollout、最长 60 个工具 turn、48K trajectory tokens 与 4K response tokens;KL loss 和 entropy coefficient 均为零。Appendix A.1 只对 30B-A3B Search-R1 run 披露 rollout engine 为 SGLang、每个 engine 使用 1 张 GPU;论文没有披露 engine 数量、reference endpoint 硬件、总 GPU 数、训练时长或 wall-clock。

6. 结论链条

  1. Outcome-only GRPO 把同一终局优势广播给整条工具轨迹,长轨迹中的有效、冗余和有害动作无法区分。
  2. 已知短答案可以作为冻结模型的前缀进度探针;加入有效 evidence 后,gold-answer average log-probability 通常会上升。
  3. 平滑负对数似然 gap 的 log-ratio 把绝对变化改成相对 gap closure,一步相邻差提供 signed turn credit。
  4. 三步折扣窗口把延迟出现的 evidence credit 回传给此前工具动作,终局填充与 GRPO outcome advantage 保持最终正确性约束。
  5. 在两个 Qwen3 Thinking 尺度、同数据与接口的控制实验中,TRACE 在四项评测上均高于 GRPO、GSPO 与 GiGRPO;Qwen3-4B 的训练曲线还显示交互 turn 数更早增长。
  6. 这些证据支持 gold-conditioned turn shaping 在本文短答案搜索设置中的有效性;逐动作因果归因、策略不变性、长结构化输出迁移和等计算效率仍待验证。

关键实验/定理

结果 1:相对 outcome-only GRPO 的增益跨模型尺度与检索环境保持一致

  • 设置:Qwen3-4B-Thinking-2507 与 Qwen3-30B-A3B-Thinking-2507;相同合成训练数据、browser interface、terminal reward 与评测协议;闭网 BrowseComp-Plus 和经 Serper API 的三项开网评测。
  • Baseline:未训练的 search policy、GRPO、GSPO、GiGRPO;外部 deep-research agents 只作非控制参照。
  • 系统条件:训练每 prompt 8 rollouts、global batch 128、最多 60 tool turns;评测每 prompt 1 rollout、最多 80 tool turns。TRACE 额外使用 remote frozen-reference scoring。
  • 指标定义:Table 1 报告各 benchmark 的 accuracy 及四项未加权平均,论文没有披露 benchmark-specific grader 的归一化细节;训练 outcome reward 另用 normalized exact match,并附加小幅 format component。
  • 结果:
模型 方法 BrowseComp-Plus BrowseComp GAIA xbench-DeepSearch 平均
Qwen3-4B Base 7.2 3.3 24.2 19.0 13.4
Qwen3-4B GRPO 30.0 5.1 38.8 44.0 29.5
Qwen3-4B TRACE 35.6 6.7 44.6 49.0 34.0
Qwen3-30B-A3B Base 8.4 4.4 34.1 20.0 16.7
Qwen3-30B-A3B GRPO 36.4 10.8 45.6 37.0 32.5
Qwen3-30B-A3B TRACE 42.6 12.9 52.0 45.0 38.1
  • 对照是否可比:TRACE 与三种 controlled RL baseline 共享 backbone、数据、terminal reward、工具和评测;算法计算量不同,TRACE 增加逐前缀 reference inference。外部 agents 使用不同模型、数据和 harness,不能用于归因。
  • 证据定位:Section 4.1–4.2;Table 1;PDF pp. 6–8;arXiv HTML Section 4.2
  • 支持的最窄结论:在作者的 search-agent recipe 中,加入 TRACE credit 后,两个模型尺度的四项 accuracy 均高于 outcome-only GRPO,四榜平均分别提高 4.5 和 5.6 个百分点。
  • 解读:摘要强调的 Base 到 TRACE 增益为 7.2→35.6 和 8.4→42.6,其中 outcome-only GRPO 已经达到 30.0 和 36.4。最直接归属于 TRACE 局部信号的控制增量是 5.6 和 6.2 个百分点。

结果 2:相对 gap 变换优于 raw delta,但差距来自单次训练

  • 设置:Qwen3-4B;BrowseComp-Plus;相同训练配置下比较 outcome-only、raw log-probability delta、linear remaining-gap normalization 与 log-ratio TD。
  • Baseline:GRPO 30.0。
  • 指标:BrowseComp-Plus accuracy。
  • 结果:raw delta 32.4,linear remaining gap 34.6,log-ratio 35.5。
  • 对照是否可比:内部训练设置保持一致;论文明确说明 controlled ablations 通常只有一次 training run,没有 seed、误差线或置信区间。
  • 证据定位:Section 4.4,Table 2;Appendix A.2,Tables 5–6;PDF pp. 9、19–20。
  • 支持的最窄结论:三种 dense transition signal 都高于这次 GRPO run,log-ratio 在这次 run 中最高;它相对 linear variant 的差距为 0.9 个百分点。
  • 解读:Appendix A.2 的 830 条 rollout、3742 个 tool turns 诊断中,log-ratio 累计分数与终点 reference score 和 outcome 的相关性最高。累计 log-ratio 本身由起终点决定,与终点分数的相关性带有构造性循环,无法验证每个 turn 的因果归因;该诊断平均每条 rollout 只有 4.51 个工具 turn,也未覆盖“数十到数百 turn”的长程区间。

结果 3:优化步数上的学习更早,交互轨迹也更快变长

  • 设置:Qwen3-4B 与 Qwen3-30B-A3B;比较 TRACE、GRPO、GSPO 与 GiGRPO 的 training reward 和 held-out BrowseComp-Plus accuracy;另在 4B 上比较 TRACE 与 GRPO 的 tool-turn count。
  • Baseline:outcome-only GRPO 及其它 trajectory-level RL variants。
  • 指标:optimizer step 上的 training reward、evaluation accuracy、平均 tool-call turn count。
  • 结果:TRACE 曲线较早上升并达到更高 plateau;30B-A3B 的 step-160 TRACE checkpoint 已高于 step-200 outcome baseline;4B 的 TRACE turn count 在早期训练更快增长到十余轮。
  • 对照是否可比:横轴是 optimizer step,TRACE 每步包含额外 reference scoring;图中没有误差带、wall-clock、FLOPs、API 成本、固定 tool-call budget accuracy 或重复调用诊断。
  • 成本归因:曲线支持 sample/update-step efficiency;它无法单独支持 wall-clock efficiency。更长轨迹同时增加 rollout、检索和上下文成本。
  • 证据定位:Section 4.3;Figures 3–4;PDF pp. 8–9。
  • 支持的最窄结论:在作者实现和训练步数口径下,turn credit 使模型更早学习增加工具交互,并较早获得更高准确率。
  • 解读:论文记录 repeated queries、reopened documents 和 navigation errors 等诊断,却没有报告它们。轨迹变长说明 agent 更愿意继续搜索,尚不能说明交互效率提高。

结果 4:两组超参数 sweep 呈非单调变化,图文配置映射存在冲突

Figure 5: TRACE 的 turn-credit 消融
Figure 5: Qwen3-4B 在 BrowseComp-Plus 上的 turn-reward 系数、TD look-ahead 和 reference checkpoint 消融。前两个 panel 的横轴与正文默认超参数存在明显错配,读数需要结合下文复核。Image Source: official arXiv HTML image / Figure 5.
  • 设置:Qwen3-4B;BrowseComp-Plus;单次训练消融。
  • Baseline:无 prefix scorer 的 30.0。
  • 结果:论文正文把 Figure 5(a) 描述为 coefficient 从 1、3、5、7 变化,accuracy 为 33.6、35.6、34.5、31.1;把 Figure 5(b) 描述为 look-ahead horizon,图上却标 0、0.1、0.2、0.5,对应 30.0、34.7、35.6、28.9;Figure 5(c) 的 baseline、step-0 reference 与 step-200 reference 为 30.0、35.6、36.1。
  • 对照是否可比:三组均在同一 backbone 和 benchmark 下执行;论文没有报告多 seed,也没有给出完整 run/config 对应表。
  • 证据定位:Section 4.4;Figure 5;Appendix A.1 Tables 3–4;PDF pp. 9–10、18–19;TeX source sections/4_experiments.texfigures/ablation.pdf
  • 支持的最窄结论:Figure 5(a)(b) 的两组 sweep 都呈非单调变化,最佳柱的横轴数值分别为 3 和 0.2;图文映射冲突使当前版本无法确定两组结果分别属于 turn-reward coefficient 还是 look-ahead horizon。step-200 reference 在这次 run 中比 step-0 reference 高 0.5 个百分点。
  • 解读:正文和附录默认值为 αturn=0.2\alpha_{\mathrm{turn}}=0.2K=3K=3,与 Figure 5(a)(b) 的横轴正好形成 3 与 0.2 的交换关系。一个与默认值一致的解释是两个 panel 的标题或横轴发生交换;论文当前版本不足以确认这项推断,也不足以把低分柱分别归因于权重或传播范围。

结果 5:定性案例展示 signed credit,诊断记号没有与训练算法完全对齐

  • 设置:从 rollout batches 0140–0149 选取 5 条成功和 5 条失败轨迹;成功案例展示最大正 credit,失败案例要求先进入作者定义的 answer-secured region,再出现一个大负值 turn。
  • 指标:一步 δk\delta_k 序列、关键 search/open/find turn 及最终答案正确性。
  • 结果:成功案例的主要正 credit 常落在首次暴露决定性证据的 searchopen;失败案例的大负 credit 常落在误读 find 结果、把无匹配当事实否定或匹配到错误上下文的 turn。
  • 对照是否可比:案例经过定向筛选,没有随机样本率、precision/recall、人工标注一致性或与替代 attribution 方法的比较。
  • 证据定位:Appendix A.5;PDF pp. 21–26;TeX source sections/9_data_synthesis.tex
  • 支持的最窄结论:这些案例说明 reference score 可以产生符合直觉的正负局部解释;它们无法建立总体定位准确率。
  • 解读:Equation 6 规定 V(S0)=0V(S_0)=0,Appendix A.5 却用 V0.3V\ge -0.3 定义 answer-secured prefix,按同一记号会让起始状态始终满足条件。附录还记录 T+2T+2 个 value 并包含 answer-generation 后的额外 delta,Algorithm 1 只为 S0,,STS_0,\ldots,S_T 构造 TT 个工具转移 credit。定性诊断很可能使用了实现中的额外分数或状态,论文没有说明映射。

证据强度评估

较强证据

  • 两个模型尺度、四项 benchmark 上,TRACE 相对相同数据和接口的 GRPO 都得到同向增益。
  • raw、linear 与 log-ratio 的内部消融直接检验了 state-value transform;三种 dense signal 均高于 outcome-only run。
  • 论文完整给出 reference scoring、一步 credit、有限步回传、terminal fill 与 policy loss 的公式和主要算法超参数;附录的完整脚本级表格明确对应 30B-A3B Search-R1 run。

中等证据

  • 开网 BrowseComp、GAIA 与中文 xbench-DeepSearch 的增益说明行为能够跨语料、检索后端与语言迁移;任务形态仍是短答案 search。
  • learning curves 支持更早获得 reward 和 accuracy;optimizer step 没有反映 reference scoring 的额外计算。
  • step-0 与 step-200 reference 在这次单次 run 中只相差 0.5 个百分点,没有显示明显差异;reference 家族、尺度和更远 checkpoint 尚未测试。

需要谨慎的推论

  • 一步 TD 信号是 reference-model readiness proxy,论文没有无偏性、方差下降、Bellman calibration、收敛或最优策略保持证明。
  • 同一 transition 合并 action 与 observation,缺少 matched replacement、相同 state counterfactual 或 intervention,无法解释为动作的独立因果贡献。
  • 10 条定性案例和 Appendix A.2 的短轨迹诊断不足以证明 credit 在数十或数百 turn 上保持校准。
  • “更快收敛”当前只覆盖 optimizer step,“更高效率”还需要等 FLOPs、wall-clock、GPU 和工具预算测量。

局限

  1. 输出形态受限。 当前方法依赖短、已知、可 teacher-force 的 gold answer。多文件代码 patch、结构化计划和开放式偏好需要新的 state-value target。
  2. Proxy 可能错位。 reference model 对标准答案的可预测性会受到词面重复、答案泄露、位置、上下文长度和自身知识偏差影响;有效探索也可能先降低 gold likelihood,三步窗口只能回传有限距离。
  3. 信用属于联合转移。 每个 δk\delta_k 同时包含 assistant action 和环境 observation 的影响,无法分离查询质量、retriever 随机性与返回内容。
  4. 望远镜性质覆盖范围有限。 精确端点求和只属于一步 δ\delta;实际 K=3K=3 backup、terminal fill、逐 turn token 复制和 clipped objective 都改变总梯度语义。论文没有给出策略不变性证明。
  5. 统计证据不足。 主表没有训练 seed 数、置信区间或显著性;论文明确说明大多数 controlled ablation 为单次训练。评测每 prompt 只有一次 rollout。
  6. 训练数据不可复查。 论文没有披露最终样本数、生成器和验证器模型、相关文档阈值、best-of 数量、重生成次数、数据 snapshot、完整 split 或 train/eval overlap audit。
  7. 计算对照不等价。 TRACE 为每条轨迹的增长前缀增加 reference forward。若没有 KV/tree-attention 共享,前缀累计 prefill 成本可能随 turn 数近似二次增长;论文没有给出 scorer throughput、总 GPU、显存、wall-clock 或等计算 GRPO 对照。
  8. 复现字段存在冲突。 Figure 5 前两个 panel 的轴与默认 K=3K=3αturn=0.2\alpha_{\mathrm{turn}}=0.2 对不上;Algorithm 1 的 K=0K=0 分支仍可能给最后一个 turn 加 terminal fill;answer-tail weighting 的完整定义未公开,相关表格行在 TeX 中被注释。
  9. 定性诊断记号冲突。 Appendix A.5 的 answer-secured threshold、状态数量和 answer-generation delta 没有与 Equation 6 和 Algorithm 1 对齐。
  10. 外部有效性仍窄。 开网评测改变语料和检索 API,却保留短答案 deep-search 任务。软件工程、OS 操作、多模态交互和长期用户任务仍未覆盖。

本地讨论补充

1. 核心归因口径

Base 到 TRACE 的 28.4 和 34.2 个百分点提升展示完整 search-agent RL recipe 的效果。TRACE 自身最干净的对照是 GRPO 到 TRACE:BrowseComp-Plus 分别提高 5.6 和 6.2 个百分点,四榜平均提高 4.5 和 5.6 个百分点。后续引用应优先使用这一控制口径。

2. Credit 的含义

TRACE 的 turn credit 回答“加入这次 action–observation 后,冻结模型生成已知答案是否更容易”。它提供 signed temporal localization,仍属于单轨迹 proxy。真正的局部因果问题需要固定同一前缀,对当前 action 做替换、删除或多次 continuation,再比较后续成功率。

3. 后续复验指标

  • 按实际 tool-turn 数分桶报告 accuracy、credit calibration、正负 credit 分布和 GRPO 差值,至少覆盖 1–5、6–15、16–30、30+ turns。
  • 固定 policy optimizer steps、actor tokens、总 FLOPs、GPU hours 与 wall-clock 分别比较,单独记录 reference scorer 的 prefill tokens、KV reuse、吞吐和显存。
  • 为每个 turn 构造 matched action replacement 或 leave-one-observation-out,对比 δk\delta_k 与真实 outcome change 的相关性、排序准确率和符号准确率。
  • 报告重复 query、reopen、find no-match、navigation error、平均 turn、成功所需 turn 和单位正确答案工具成本。
  • 分别消融 ϵ\epsilon、terminal fill、answer-tail weighting、KKγtd\gamma_{\mathrm{td}}、reference 尺度/家族和 turn-reward normalization,并发布实际配置映射。
  • 在代码 patch 或结构化输出上比较 gold-token likelihood、test execution progress、subgoal verifier 与 learned critic,检验 value target 的迁移边界。

主要启发

  • 长程 credit 方法可以拆成四个可审计轴:credit unit、identification signal、assignment operator 和 comparability condition。TRACE 分别选择 tool turn、frozen gold-answer likelihood、K-step TD plus outcome mixture,以及同一轨迹的相邻前缀。
  • critic-free 会把成本从 value-model training 转移到 reference inference。方法比较需要同时记录 estimator 假设、额外 forward、prefix reuse 和 wall-clock。
  • 结论应区分 reward localization 与 estimator variance。TRACE 改变局部 reward 的时间位置;OTB 等方法改变 baseline 以降低梯度方差,两者可组合,也需要分别验证。
  • 逐步可解释性需要诊断协议。少量直觉案例可以展示机制,随机样本上的局部 counterfactual、符号准确率和 horizon calibration 才能支持 attribution 主张。

跨论文关系

  • Credit Assignment Survey:TRACE 为 agentic turn-level credit 提供冻结 gold-answer probability probe 的实例,补充该综述的 token / step / turn / trajectory 分类;其 estimator 属于 answer-conditioned proxy,因果强度低于同状态重采样。
  • LLM 与 Agent 强化学习中的信用分配:该主线已把检索截止扩展到 2026-07-22,并将 TRACE 纳入 turn + frozen answer-likelihood + TD shaping + adjacent-prefix comparability 路线;冻结参考策略也成为策略角色配置中的独立类型。
  • OTB:两者都省去可训练 critic。OTB 用 sampled-token gradient energy 构造 variance-minimizing baseline,处理 estimator variance;TRACE 用冻结模型的 gold-answer prefix likelihood 构造局部 reward,处理 temporal localization。
  • SRPO:SRPO 从同一前缀重采样后缀,局部对照更接近 counterfactual;TRACE 比较单条轨迹的相邻前缀,减少 rollout 成本并引入 reference-proxy 混杂。
  • ECHO:ECHO 沿最终 reconstruction 使用的 source IDs 路由 positive outcome credit,保留 evidence provenance;TRACE 根据 gold-answer readiness 的升降为全部工具 turn 分配 signed credit。两篇的 BrowseComp-Plus 环境和训练 recipe 不同,分数不宜横向比较。
  • SAO:SAO 使用 learned critic、skip-observation GAE 和每 prompt 单 rollout;TRACE 使用冻结 gold-answer probe、K-step TD 与 GRPO group outcome。两者都 mask observation loss,并把 temporal credit 分给 assistant action token。
  • VIMPO:两者都用模型概率构造隐式 value 或 TD signal。VIMPO 使用 policy/reference action-distribution log-ratio 分配 token credit;TRACE 使用冻结模型对 gold answer 的 prefix likelihood 分配 turn credit。
  • SPIRAL:两者都从下游答案正确性向上游搜索分配信用。SPIRAL 在并行候选集合之间分配 trajectory-set credit;TRACE 在一条串行工具轨迹内分配 signed turn credit,主要噪声分别来自共现成员和 reference proxy。