2605.09539-tacomas-test-time-coevolution-mas
TacoMAS: Test Time Co Evolution of Topology and Capability in LLM based Multi Agent Systems
TacoMAS 把单个查询的多智能体推理组织成双时间尺度在线适应:每轮根据轨迹与贡献评分改写代理的提示和记忆,每两轮再按预算增删代理及重连通信边;在 Gemini-2.5-Flash-Lite、最多十轮和四个工具基准的作者实验中,它相对各数据集最强基线平均提高 13.3 个准确率百分点,Finance 上的时序消融支持能力快、拓扑慢的配置,但主表缺少统一推理预算、重复运行与统计不确定性,理论收敛还依赖尚未充分验证且证明链存在缺口的评分与拓扑改进假设。
Source
- Workflow version: v2.1
- Material type: research-paper
- Analysis modules: experiment, system, theory, docs
- Canonical source: https://arxiv.org/abs/2605.09539
- Title: TacoMAS: Test-Time Co-Evolution of Topology and Capability in LLM-based Multi-Agent Systems
- Authors: Chen Xu, Yicheng Hu, Ruizi Wang, Xinyu Lin, Wenjie Wang, Dongrui Liu, Fuli Feng
- Responsible organization: Carnegie Mellon University;University of Science and Technology of China;National University of Singapore;Shanghai AI Laboratory
- arXiv: https://arxiv.org/abs/2605.09539
- PDF: https://arxiv.org/pdf/2605.09539
- TeX source: https://arxiv.org/e-print/2605.09539v1
- Code/Project: https://github.com/chenxu2-gif/TacoMAS-MultiAgent
- OpenReview / Review page: 未发现标题、作者或 arXiv ID 对应的正式公开评审页面;TeX source 中的 NeurIPS 2026 style/checklist 文件没有对应公开 submission 或 proceedings 记录
- Submitted: 2026-05-10 13:52:00 UTC
- Published / updated: arXiv v1,2026-05-10
- Current version read: arXiv:2605.09539v1,27 页 PDF;TeX source;GitHub
maincommit6f0d545f2493cf95d2eb6a325d1a6686acf658eb - Version / revision read: arXiv v1;公开代码 commit
6f0d545,commit time 2026-05-12 20:03:28 +08:00 - Accessed: 2026-07-22
- Key figure decision: include
- Review status: page-type=not-found; match-confidence=high; observed-at=2026-07-22; venue-status=arXiv preprint
- Subjects: cs.CL;LLM multi-agent systems;test-time adaptation;dynamic graph;agent memory;agent-level credit assignment
作者与关系
- Chen Xu: Carnegie Mellon University;历史机构:Renmin University of China、University of Amsterdam、National University of Singapore。
- Yicheng Hu: University of Science and Technology of China / School of Artificial Intelligence and Data Science。
- Ruizi Wang: University of Science and Technology of China。
- Xinyu Lin: National University of Singapore / NExT++;历史机构:Shandong University。
- Wenjie Wang: University of Science and Technology of China;历史机构:National University of Singapore、Shandong University。
- Dongrui Liu: Shanghai AI Laboratory;历史机构:Shanghai Jiao Tong University、Northeastern University。
- Fuli Feng: University of Science and Technology of China / School of Artificial Intelligence and Data Science;历史机构:National University of Singapore、Beihang University。
作者关系的主体由 USTC–NUS 长期合作形成。Wenjie Wang、Fuli Feng 与 Xinyu Lin 在生成式推荐、因果推荐和 LLM agent 上已有连续共同产出;Yicheng Hu 也与三人在 CARE、CAPSUL 等项目中合作。Chen Xu 在 RUC、NUS、UvA 与 CMU 之间连接信息检索、公平性、经济学建模和 agent systems。Dongrui Liu 从 Shanghai AI Lab 引入可信 agent、推理和安全研究背景。
论文作者块把 Chen Xu 的机构列为 CMU;其个人主页把 CMU 博士后起始时间写为 2026 年 6 月,晚于 arXiv v1 提交约一个月。
Xinyu Lin 与 Wenjie Wang 是论文明确标注的通讯作者。公开代码当前 commit 的 author/committer 为 Linxyhaha <xylin1028@gmail.com>,与 Xinyu Lin 的个人主页和 GitHub 身份一致,支持其 artifact 维护角色。Chen Xu 是第一作者,个人主页列出 TacoMAS;论文所链仓库位于另一个 GitHub handle chenxu2-gif 下,当前没有把该 handle 归入个人作者档案。
本地 data/authors.json 和已存档论文中未发现七位作者的既有 profile、同名冲突或直接作者重叠。跨论文联系当前集中在主题、理论对象和 agent-level credit assignment。
论文脉络
1. 研究问题、背景和价值
多智能体 LLM 系统通常先确定角色、通信图和工具,再让同一套组织结构处理整条 query。执行过程中会出现新的子问题:检索证据不足、数值计算缺位、验证路径断开、多个代理重复工作。固定图无法利用这些实例内信号重新分工;只改 prompt 或 memory 仍受原通信路径限制;只改边和角色又会保留已有代理的错误策略。
论文处理的核心问题是:怎样在单个 query 的推理期间同时更新“代理会做什么”和“代理怎样协作”,并控制两类更新相互干扰。这个问题的价值来自两个方面:其一,任务分解在执行前往往不完整;其二,test-time compute 可以用于组织调整,覆盖普通延长轨迹或增加候选样本之外的路径。
2. 已有解决方案与不足
论文把相关方法按适应发生的时间和对象分成四组:
- 固定拓扑:SAS、centralized、decentralized、hybrid 等模板在整个 query 内保持结构。
- 离线演化:AFlow、AgentSquare、ADAS、EvoAgentX 等在部署前搜索 workflow,推理时使用已选方案。
- 逐实例设计后冻结:ARG-Designer、MaAS、MetaAgent、SwarmAgentic 等先为 query 生成图,再用该图完成执行。
- 实例内单轴更新:SelfOrg 调整通信拓扑;CORAL 更新 memory/skill;ChatDev-Puppeteer 在固定 persona pool 中选择下一代理。
TacoMAS 的区别性机制是把能力状态和通信图都放进实例内循环。论文对 baseline 的分类有助于定位研究空缺,同时把多个系统压缩为单一“更新时间轴”会隐藏它们的预算、实现成熟度和控制器能力差异。主实验没有给出统一的实现质量或 compute-matched 比较,分类本身不能替代因果消融。
3. 作者可能的思考路径
以下为本地分析的受约束重建:
- 将 MAS 状态拆成节点能力与边结构,区分局部策略错误和全局信息流错误。
- 用每轮完整轨迹生成代理级贡献分数与文字诊断,让 prompt/memory 可以在下一轮直接吸收反馈。
- 观察到结构变化会改变代理收到的输入和协作对象,因此给图更新设置更长 dwell time(驻留时间)与编辑预算。
- 用 birth/death 扩展或缩减角色支持集,用 edge edit 修复证据、验证和汇总路径。
- 把快循环类比为 replicator dynamics,把慢循环类比为 mutation,再尝试给双时间尺度设计提供稳定性解释。
- 用 Finance 的时序消融和四个 benchmark 的主表验证联合适应,同时检查角色数、模型 backbone、调用预算和演化轨迹。
4. 核心假设或切入点
TacoMAS 的有效性依赖以下条件:
- meta-judge 能从完整轨迹给出具有行动价值的代理级贡献信号;分数至少要稳定地区分阻塞者、冗余者和关键证据生产者。
- meta-LLM 的文字反馈能让 prompt/memory 更新沿着提高任务表现的方向移动,并且新上下文不会引入更大的行为漂移。
- 固定拓扑持续两个 fast rounds 足以让能力更新显现效果,当前的固定
对四类任务都处于可用区间。 - 预设 role pool、dataset-specific tools 和 prompt template 覆盖任务所需能力;birth 主要在这些原型上产生 specialization。
- answer-quality judge 和 agent-contribution judge 的 proxy 与最终任务准确率一致,阈值停止不会提前保留高分错误答案。
- 多轮代理执行、评分、重写和图编辑带来的额外 API 调用可被准确率收益抵消。
- 单个中央 meta-controller 能读取压缩后的全局轨迹并保持有效 credit assignment;长轨迹中的信息损失处于可控范围。
5. 方法 / 系统 / 理论框架
5.1 状态表示:图结构与能力状态
论文把第
这层拆分很实用:能力更新改变节点处理信息的方式,拓扑更新改变信息到达哪些节点。它也暴露了理论映射的难点:实际
5.2 快循环:用轨迹反馈改写能力
每个 fast round 中,代理沿当前图执行工具与消息传递,产生 per-agent trajectory。Meta-judge 根据完整轨迹给每个代理贡献分数与理由,meta-LLM 再根据该代理轨迹和评分生成 workflow_correction 与 next_round_workflow,下一轮把这些文字写进上下文。能力更新因此表现为 inference-time prompt/memory refinement,没有更新模型参数。
论文算法把这一步描述为每轮执行。公开代码 commit 6f0d545 的 tacomas/meta_evolution/mas_runtime.py 只在 slow-update round 调用 LLM contribution judge 和 final-answer evaluator;其余 fast rounds 使用 _score_text heuristic,并记录 heuristic_only_non_slow_round。实现保留了逐轮状态更新,但评分来源与论文 Figure 1 / Algorithm 1 的逐轮 meta-judge 描述存在差异。
5.3 慢循环:受预算约束的 birth/death 与边编辑
每隔
Birth 增加缺失角色或能力变体;death 删除持续低贡献代理;edge reconfiguration 增删或改写证据流、验证流和汇总路径。论文主设置为
公开实现加入了约束投影、关键角色保护、高分路径保护和 anti-stagnation 强制编辑。evolution_controller.py 在分数停滞或连续没有结构变化时可以强制最小图编辑;meta_llm.py 的 prompt 也要求在多个条件下避免空结构决策。这些工程规则提高触发率,同时让“meta-LLM 自发发现结构改进”的解释混入规则驱动行为。

figures/method_v2.pdf.证据定位:Section 3;Figure 1;Algorithm 1;PDF pp. 4–7;代码 tacomas/meta_evolution/mas_runtime.py、evolution_controller.py、meta_llm.py at 6f0d545。
5.4 Replicator–mutator 理论抽象
论文用指数乘法更新表示快循环:
归一化后得到 role-frequency vector
理论部分提供了清晰直觉:先在固定图上吸收局部反馈,再用较慢的小幅结构变化离开当前 plateau。形式保证存在三处关键缺口:
- 实现映射缺口:实际系统执行文本 prompt/memory rewrite,代码没有乘法权重或
。 replicator-biasassumption 直接要求 meta-LLM 更新具有期望正向偏置,实验只观察 judge score 的均值变化。 - fast-loop 推导缺口:Appendix 令
依赖 ,却把 team mean fitness 的时间导数直接化为 fitness variance。频率依赖 fitness 通常还包含 自身随 变化的导数项;需要固定 fitness、potential-game 结构或其它梯度条件才能得到该等式,论文没有给出相应假设。 - slow-loop 收缩缺口:Assumption 3 只要求 topology edit 以大于二分之一的概率提高该 topology 的最佳可达贡献;证明随后把它转换为 graph symmetric-difference distance 的乘性收缩。提高 fitness ceiling 并不自动减少到某个局部最优图的编辑距离,这个桥接需要额外单调性或 drift assumption。
此外,主定理按单步
因此,理论结果适合作为条件性设计模型。当前证明尚未建立公开实现会收敛到任务条件稳定平衡。
证据定位:Section 3.3 Assumption 1;Section 4 Propositions/Theorem 1,PDF pp. 6–8;Appendix B,PDF pp. 15–18。
5.5 公开 artifact 与论文主张的映射
公开仓库在 commit 6f0d545 提供四个 benchmark 的转换后数据、dataset-specific tools、role prompts、TacoMAS runtime、graph controller 和 SLURM demo。主机制能定位到可执行代码路径,Python 文件也能进行静态语法检查。
- 适用版本:arXiv v1 与 GitHub
maincommit6f0d545f2493cf95d2eb6a325d1a6686acf658eb,观察于 2026-07-22。
复现链仍有多项差异:
- 论文写每次最多四个 edge edits;
scripts/run_demo.slurm和 CLI 默认值使用八个,configs/experiments/default.json又使用四个。 - 论文主设置为十轮、
、五个初始代理;默认 JSON 使用十八轮、 、三到八个初始代理,并包含本机 Windows 绝对路径和不同 OpenAI meta models。 - README 所称 20-method evaluation toolkit 使用
<toolkit-repo>占位链接;当前仓库没有 baseline runner、raw result、主表复现脚本或 figure generation pipeline。 requirements.txt只给 lower bounds,没有 lockfile/container;仓库没有测试文件,README 声明的LICENSE文件也不存在。- 公开代码的非 slow rounds 使用 heuristic contribution score;论文方法图和算法把 meta-judge 写为逐轮操作。
这些差异允许读者审计机制意图,也允许运行单个 TacoMAS 实例;它们目前不足以独立复现主表、时序消融和 13.3 个百分点结论。
证据定位:GitHub repository tree、README、configs/experiments/default.json、scripts/run_demo.slurm、scripts/run_evolution.py、tacomas/meta_evolution/mas_runtime.py at 6f0d545,观察于 2026-07-22。
6. 结论链条
- 假设:轨迹中的代理级贡献可以被 judge 稳定识别,prompt/memory refinement 能在固定图内改善行为,小幅图编辑能够修复持续存在的信息流或角色缺口。
- 机制:每轮写入贡献反馈和下一轮计划;每两轮以受限 birth/death 与 edge edit 调整角色支持集和通信路径;中央 meta-controller 同时管理停止条件。
- 直接证据:四个 benchmark 的主表均给出最高 rubric accuracy;Finance 的 schedule ablation 中 fast/slow 配置优于同速、拓扑更快和拓扑冻结;所测 agent/meta backbones 上演化后准确率均提高。
- 最窄结论:在作者的闭源模型组合、工具环境、rubric judge、最多十轮和当前实现下,双循环 TacoMAS 的任务得分高于所报告 baseline,Finance 上
的配置优于三个结构更新节奏变体。 - 边界:结果没有隔离更多总调用、meta-controller 强度、judge proxy、结构适应和 memory refinement 的独立贡献;缺少 seed、置信区间、统一成本与完整 artifact;理论抽象没有覆盖实现级文字状态更新。
关键实验/定理
结果 1:四个 benchmark 上的主结果
| Benchmark | 实例数 | TacoMAS accuracy | 各数据集最强 baseline | Baseline accuracy | 绝对提升 |
|---|---|---|---|---|---|
| finance | 50 | 0.767 | SAS | 0.539 | 22.8 个百分点 |
| browsecomp-plus | 100 | 0.745 | SelfOrg | 0.688 | 5.7 个百分点 |
| plancraft | 580 | 0.887 | SwarmAgentic | 0.812 | 7.5 个百分点 |
| workbench | 690 | 0.824 | SwarmAgentic | 0.651 | 17.3 个百分点 |
- 设置:Agent LLM 为 Gemini-2.5-Flash-Lite;meta-LLM 为 Gemini-2.5-Pro;rubric judge 为 GPT-4o-mini;TacoMAS 最多十轮、
、五个初始角色、二十个代理上限。实例数来自公开仓库数据与 README。 - 系统条件:四个任务使用各自预设的角色模板与工具环境;能力和结构更新由中央 meta-controller 驱动,模型服务均为闭源 API。
- 指标:每个实例包含一个或多个 correctness / contradiction rubrics;instance accuracy 是通过 rubric 的比例,表中报告实例均值。
- 指标定义:主表 accuracy 等于实例级 rubric 通过比例的样本均值;四项提升按 TacoMAS 与各数据集最高 baseline 的绝对差计算。
- 成本归因:论文没有给出主表各方法的总调用、token、延迟或费用,因而无法把准确率增益分解到额外推理轮次、judge/meta 调用、能力改写与结构编辑。
- Baseline:5 个 offline-evolved、7 个 per-instance graph design、5 个 fixed-topology 和 3 个 within-instance evolution 方法,共 20 个。
- 对照是否可比:论文声明同一 base LLM 与 dataset-specific tools;主表没有列出各方法调用数、context/token budget、meta-controller 模型、官方实现版本、调参强度或失败重试策略。统一模型与工具提高了任务层可比性,compute 和 implementation 仍未匹配。
- 结果:四项绝对提升平均为 13.325 个百分点。摘要中的“13.3%”应按主表解释为平均绝对百分点,不能读成相对百分比。
- 证据定位:Section 5.1–5.2;Table 1,PDF pp. 8–9;公开仓库 README datasets table。
- 支持的最窄结论:作者的统一 harness 记录中,TacoMAS 在四个 benchmark 上的 rubric accuracy 均高于表内最佳 baseline。
- 解读:跨任务一致领先值得关注;主表未完成 budget-normalized comparison,当前证据同时包含联合适应、更多迭代评审和更强 meta-LLM 的影响。
结果 2:Finance 上的快慢节奏消融
- 设置:Finance benchmark;比较 fast capability / slow topology 的
默认配置、同速 、structure-faster 和 structure-fixed。 - 指标:最终 accuracy,以及相对初始化的 gain。
- 结果:默认 fast/slow 为 0.77,gain 0.35;同速为 0.45 / 0.03;structure-faster 为 0.58 / 0.17;structure-fixed 为 0.69 / 0.27。
- Baseline:三个 topology schedule 变体;图和正文没有完整定义
structure-faster的更新频率与其它超参数。 - 对照是否可比:同一 Finance 数据和总体框架,能直接检查更新节奏;缺少重复运行、误差线、调用数匹配与其它三个 benchmark 的 schedule ablation。
- 证据定位:Section 5.3;Figure 3(a),PDF p. 10。
- 支持的最窄结论:Finance 的单次作者实验中,
配置同时高于每轮改图、较快改图和冻结图。 - 解读:这是“能力快、拓扑慢”的最直接经验支持,覆盖范围限于一个 benchmark 和一组离散节奏。

figures/analysis_2x2-V2.pdf.结果 3:演化轮数会随任务困难增加,收益解释仍需区分“主动分配”和“持续失败”
- 设置:Finance 按 expert-time annotation 分 easy(不超过 5 分钟,22 题)和 hard(至少 10 分钟,28 题);模型看不到该 annotation。附录同时统计四个数据集的 slow-update count 与 stop reason。
- 指标:accuracy、median slow updates、quality-threshold stop 与 budget exhaustion 比例。
- 结果:主文 Figure 3(b) 给 easy 0.91 / 1 次、hard 0.65 / 8 次;Appendix fine-grained table 把 hard median 写成 10 次,两个位置不一致。Finance 另有 48% 实例耗尽轮数预算;Plancraft、Workbench、BrowseComp 的预算耗尽比例分别约 6.4%、2.9%、21%。
- Baseline:按外部难度标注分组,没有与固定计算分配策略进行等总预算对照。
- 对照是否可比:同一 TacoMAS controller 内部比较,能说明困难样本运行更久;停止阈值和最大轮数共同决定 slow-update count。
- 证据定位:Section 5.3 Figure 3(b),PDF p. 10;Appendix C.4–C.6,Figures 6–7、Table 2,PDF pp. 21–23。
- 支持的最窄结论:TacoMAS 的运行长度与作者提供的任务难度分组正相关。
- 解读:困难任务触发更多结构更新,也更常耗尽预算。该相关性同时符合“按需分配计算”和“未解问题持续运行”,现有结果无法分离两种机制。
结果 4:所测 backbone 上,演化后的 Finance accuracy 均高于初始化
- 设置:固定其余组件,分别替换 agent backbone 为 Gemini-2.5-Flash-Lite、Claude-3.5-Haiku、GPT-4o-mini;替换 meta-LLM 为 Gemini-2.5-Pro、Flash、Flash-Lite。
- 指标:Finance 的 pre- vs post-evolution accuracy。
- 结果:agent backbone 三组从 0.417/0.425/0.442 提升至 0.767/0.731/0.715;meta-LLM 三组从 0.417/0.387/0.449 提升至 0.767/0.719/0.718。
- Baseline:各 backbone 的 initial graph performance。
- 对照是否可比:每组内替换一个模型角色,方向可比;图中没有 seed、误差线、调用成本和模型版本日期。
- 证据定位:Section 5.4;Figure 4,PDF p. 11。
- 支持的最窄结论:Finance 上六个所测 agent/meta model 配置都记录到正向演化增益。
- 解读:结果降低了收益只来自单一 backbone 的可能性,仍未覆盖开放权重模型、不同 judge 或其它 benchmark。
结果 5:replicator-bias 的经验检查只支持微弱的 judge-score 均值趋势
- 假设:meta-LLM rewrite 后,下一轮平均 agent contribution score 在期望上不下降;更强版本还要求本轮 contribution variance 预测下一轮正增量。
- 适用域:四个 benchmark 的连续 fast-round pairs;分数由系统的 meta-judge / heuristic 产生。
- 指标:team mean contribution
、 、正增量比例与 SEM band。 - 结果:Finance、BrowseComp、Plancraft、Workbench 的平均
分别约为 0.008、0.012、0.018、0.009;正增量比例分别为 0.44、0.44、0.51、0.46。 - Baseline:零均值变化,没有 task accuracy、counterfactual agent removal 或人工 contribution label。
- 对照是否可比:同一评分器跨轮比较;prompt、图、存活代理集合和任务完成阶段同时变化,
的变化不能单独归因于 capability rewrite。 - 证据定位:Appendix C.3;Figure 5,PDF pp. 19–20。
- 支持的最窄结论:样本均值略高于零;逐轮正增量事件接近一半。
- 解读:图中没有报告 variance 与后续增量的回归或相关系数,也没有检验均值显著性。它为“平均 judge score 早期上升”提供描述性证据,对 replicator dynamics 和实际任务性能的支持较弱。
定理 1:双时间尺度收敛是强条件下的抽象递推,当前证明不足以覆盖实现
- 假设:贡献噪声有界;能力状态遵循论文给出的乘法 replicator update;topology edit 受预算约束,并以大于二分之一的概率提高 topology 的最佳可达贡献;fitness 具有所需光滑/有界性质。
- 适用域:归一化 role-frequency simplex 与有界 agent graph;没有直接覆盖 prompt string、context memory、tool inventory 和规则驱动 controller。
- 结论:作者声称到局部稳定高性能配置集合的期望 Lyapunov distance 按因子收缩到噪声邻域。
- 证明依赖:replicator mean-fitness ascent、topology graph-distance biased random walk、跨 topology fitness ceiling 的 Lipschitz bound。
- 对照是否可比:定理属于条件性分析,其适用性取决于理论变量与实现状态的映射;公开实现的文字改写、heuristic score 与规则触发图编辑均未满足已陈述更新式。
- 证据定位:Section 4 Theorem 1,PDF p. 8;Appendix B,PDF pp. 15–18。
- 支持的最窄结论:补充缺失的 potential/gradient 条件,并直接假设结构编辑对所定义图距离具有负 drift 后,可以得到一个标准的带噪收缩递推。
- 解读:论文当前假设只约束 fitness ceiling,没有保证 graph-edit distance 同步下降;频率依赖 fitness 的均值导数也遗漏额外项。定理现状不能作为 TacoMAS 实现收敛的有效保证。
主要启发
- 能力与结构应使用不同控制频率。 prompt/memory 的局部反馈可以高频吸收;role/edge 变化需要 dwell time、hysteresis 和 edit budget,避免每个噪声信号都触发组织重排。
- 动态 MAS 的核心信号是 credit assignment。 Agent-level score 同时控制 memory rewrite、death 和 edge selection;应增加 counterfactual removal、message-level attribution、judge ensemble 或人工抽样校准,防止同一 proxy 的误差贯穿两条循环。
- 结构收益需要 compute-matched 评测。 适合同时报告 total calls、input/output tokens、wall-clock、API cost、成功任务成本和等预算曲线,并对 capability-only、topology-only、joint update 做完全相同 controller/compute 的消融。
- 难度自适应需要区分有效延长与预算耗尽。 每多一次 slow update 应记录边际成功率、answer correction、wasted edits 和 stop calibration;运行更久本身只说明 controller 没有提前停止。
- 理论对象应贴近文字状态更新。 更可检验的路径是把 meta-LLM rewrite 视为随机 proposal,直接测量接受率、expected improvement 和 topology-level drift;replicator analogy 可以保留为解释层。
- 动态通信图会形成新的 serving workload。 图结构、代理数和调用 DAG 在运行中改变,runtime 需要支持可撤销任务、动态 fan-out、共享 evidence objects、预算传播和 provenance-preserving synthesis。
局限
- 主结果没有统一推理预算。 Table 1 只报 accuracy;调用数表留在 TeX 注释中,正式正文只在 Finance 上给 TacoMAS–SelfOrg 曲线。平均 13.3 个百分点同时包含更多轮次、额外 judge/meta calls 和结构适应。
- 统计报告不足。 主表和 schedule/backbone 消融没有 seed 数、置信区间、显著性检验或 judge repeat;公开 checklist 声称 appendix 报告 seed variation 与 wall-clock,实际 appendix 没有这些结果。
- Agent credit 缺少因果校准。 单个代理的高分可能来自复述上游证据,低分可能来自早期探索或不可见的中间贡献。系统没有用 leave-one-agent-out、message ablation 或 Shapley-style attribution 校准 death/rewire 决策。
- Judge feedback 存在闭环偏差。 相近的自动评分信号用于能力改写、结构决策、停止和最终 accuracy,proxy 偏差可能被多轮放大;论文没有人工评审子集、judge agreement 或 adversarial rubric audit。
- 快慢结论的直接消融只覆盖 Finance。 固定
在 retrieval-heavy finance 上有效,其它任务经常零次 slow update;任务自适应 、变化检测和稳定性–响应速度曲线仍未测试。 - 理论与实现对象不一致。 Prompt、memory 与 tools 被压成正标量;meta-LLM rewrite 被视为乘法更新;图编辑改善概率直接假设。证明还缺少 mean-fitness 梯度条件和 fitness-to-distance drift 桥接。
- 单中央 controller 是扩展瓶颈。 完整轨迹会随代理数、轮数和工具输出增长;论文没有给出 trajectory compression fidelity、controller context length、latency 或 failure rate。
- 角色和工具高度任务定制。 README 明确要求新 benchmark 注册 dataset、tool environment 与可选 role-aware prompt;当前结果覆盖金融检索、封闭语料检索、Minecraft planning 和 workplace tools,开放网页、coding、GUI、embodied 与跨域迁移尚未验证。
- 困难度解释有混杂。 更多 slow updates 与 expert time 同向,也与预算耗尽同向;hard Finance 的 median slow updates 在主图与 appendix 表中分别为 8 和 10。
- 公开 artifact 不能复现主表。 Baseline toolkit 链接仍为占位符;缺 raw outputs、evaluation runner、plots、tests、pinned environment 与有效 license;多份配置的轮数、
、初始代理数和 edge budget 不一致。 - 模型与数据污染边界未审计。 Gemini/GPT-4o 系列是闭源服务,论文没有记录精确 model snapshot、API date、benchmark contamination 或服务端更新影响。
- 跨实例经验被清空。 作者每个实例清除 scratch memory,降低内容泄漏风险,也让系统重复发现相似结构;跨实例结构记忆需要同时处理隐私、错误迁移与版本控制。
跨论文关系
- 与 Credit Assignment in Reasoning and Agentic LLMs:该综述把 multi-agent credit 分到 agent、role、message 和团队贡献,并指出 Shapley/counterfactual 方法的成本。TacoMAS 提供一个具体的 test-time 用例:LLM judge 的 agent-level score 同时驱动 memory rewrite、death 与 rewiring,也把综述中的 attribution 风险直接带入动态 workflow。
- 与 Towards Long-Horizon Agents:综述把 model optimization 与 harness engineering 的 co-evolution 用作领域组织框架;TacoMAS 把 co-evolution 收缩到单个 query 内的 node capability 与 communication graph,并给出可执行双循环。综述的 co-evolution 主要来自案例归纳,TacoMAS 的理论同样需要与真实文字更新保持更直接的映射。
- 与 LLM-as-a-Verifier:两者都在 test time 用 evaluator 引导多轮改进。LLM-as-a-Verifier 通过 progress tracking 与候选比较更新解答;TacoMAS 把 evaluator signal 分解到代理并进一步改变通信图。共同风险是 evaluator proxy 同时参与搜索与选择,适合增加独立 final judge 和校准集。
- 与 Parrot 和 ThunderAgent:这些系统把 agent DAG、变量依赖、工具等待和 KV 生命周期暴露给 serving runtime;TacoMAS 在执行中动态增删 DAG 节点与边。TacoMAS 可作为更强的动态 workload,要求 runtime 支持 graph mutation、取消、共享中间对象和预算传播。
- 与已有论文的作者重叠:当前本地归档没有直接作者重叠;新关系主要连接 multi-agent credit、test-time verifier、long-horizon co-evolution 与 agent workflow serving。