2602.15763-glm-5-agentic-engineering

GLM 5: from Vibe Coding to Agentic Engineering

GLM-5 是一篇面向“agentic engineering”的系统报告:模型侧把 GLM-4.5 扩到 744B total / 40B active MoE,使用 MLA、Muon Split、参数共享 MTP 和 DeepSeek Sparse Attention 支撑 200K 级长上下文;训练侧用 28.5T tokens、软件工程 mid-training、SFT、Reasoning RL、Agentic RL、General RL 和 on-policy cross-stage distillation 串成连续 pipeline;系统侧用 slime 异步 RL、TITO、直接双边 importance sampling、DP-aware routing、PD disaggregation 和多类可验证环境,把长轨迹 tool/agent 训练从“能跑”推进到可规模化优化。

Authors GLM 5 Team: Aohan Zeng and 184 other authors

已审阅 Archived 2026-02-25 14:10 Updated 2026-07-14 10:19 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Team-level author: Zhipu AI / Tsinghua University.
  • Tech Leads: Zhipu AI / Tsinghua University.
  • Advisors: Zhipu AI / Tsinghua University.
  • Core Contributors: Zhipu AI / Tsinghua University.
  • Contributors: Zhipu AI / Tsinghua University.

阅读目标与判断边界

本笔记关注:

  1. GLM-5 如何定义 “vibe coding -> agentic engineering”。
  2. DSA、MLA、Muon Split、MTP 和 200K mid-training 如何服务长上下文和 agent 工作流。
  3. 异步 agentic RL 如何处理 rollout 长尾、policy lag、token 对齐和 KV cache 复用。
  4. GLM-5 的评测证据在哪些维度较强,哪些结论需要谨慎。
  5. 它和本地已存档 DAPO、TIM/VeXact、HybridFlow、tool-use RL、DeepSeek-V4、MiniMax-M1、Parrot/Span Query 的关系。

判断边界:

  • 论文是技术报告,包含大量内部数据、内部 benchmark 和私有评测设置;不少结论依赖作者自建 harness。
  • GLM-5.1 已在项目 README 出现,本笔记只沉淀 arXiv v2 的 GLM-5。
  • agentic coding、terminal、search、slide generation 涉及可执行环境与 reward 设计,本笔记保留系统设计、风险和评测,不沉淀可直接滥用的细节。

论文脉络

1. 研究问题、背景和价值

论文把 “vibe coding” 定义为人类不断 prompt 模型写代码,把 “agentic engineering” 定义为 AI agent 自己规划、实现、运行工具、读反馈、迭代修改。这个迁移带来三类瓶颈:

  1. 长上下文成本:真实工程任务包含 repo、issue、PR、test output、多轮工具返回和历史推理。
  2. RL 训练低效:agent rollout 长度高度不均衡,同步 RL 会被最慢轨迹卡住。
  3. 真实环境适配:模型需要在 SWE、terminal、search、slide generation 和多硬件部署栈中稳定工作。

GLM-5 的主张是:agentic engineering 的能力来自模型规模、长上下文架构、软件工程数据、异步 RL、可验证环境和部署适配的组合。

2. 已有解决方案与不足

GLM-5 面对的已有方案可以拆成四条线:

  1. coding model / coding agent:SWE-bench、Terminal-Bench、BrowseComp 等任务已经能评估 agent 能力,但模型训练常依赖短交互、单轮代码补全或有限环境反馈,难以覆盖 repo exploration、长工具链和多轮修复。
  2. 长上下文架构:MLA、GQA、SWA、linear attention、token/block sparse attention 都在降低 KV cache 或 attention 成本;固定窗口和粗粒度稀疏模式在细粒度检索任务上容易丢信息,直接 dense 200K 又会把训练和推理成本推高。
  3. RLHF / RLVR 框架:GRPO、DAPO、CISPO、IcePop、VERL/HybridFlow 等提供长 CoT、tool-use 和 train/infer mismatch 的处理经验;同步 rollout 在 agent 任务里会被长尾环境执行和慢轨迹放大 wall-clock 成本。
  4. serving / rollout 系统:SGLang、vLLM、Megatron-LM、slime 等提供训练与推理控制面;多轮 agent 仍需要解决 token 对齐、KV 复用、异步权重滞后、环境失败过滤和故障恢复。

这些不足决定了 GLM-5 需要同时处理模型结构、训练 recipe、异步 RL 算法、agent environment 和部署栈。单独改 benchmark harness 或单独扩大上下文长度,都很难解释完整 agentic engineering 能力的提升。

3. 作者可能的思考路径

作者的思路可以还原为一条工程约束链:

  1. 真实工程 agent 需要读 repo、理解 issue、修改代码、运行测试、观察失败并继续迭代,因此上下文需要覆盖长前缀、多轮工具返回和中间 reasoning。
  2. 如果用 dense attention 和同步 RL 直接扩展,训练端会被 200K context、长 rollout、慢工具调用和环境 straggler 同时拖慢。
  3. 因此模型侧先用 MLA/DSA/MTP 降低长上下文和推理成本,训练侧用 issue-PR、repo、tool trajectory 和 mid-training 把输入分布推近 agent 工作流。
  4. post-training 阶段再把 Reasoning RL、Agentic RL 和 General RL 分开组织,并用 slime 异步 rollout、TITO、直接双边 IS、stale sample dropping 和 DP-aware routing 处理生产训练中的系统偏差。
  5. 最后用 ARC benchmark、CC-Bench-V2、BrowseComp context management、国产芯片部署和 DSA RL 稳定性案例,证明这套 recipe 可以在模型能力、训练效率和部署约束之间取得可用平衡。

4. 核心假设或切入点

GLM-5 的核心切入点是:agentic engineering 能力由长上下文建模、可验证环境交互、异步 rollout 系统和训练/推理一致性共同决定,不能只按单个 reasoning benchmark 的延伸来理解。报告的关键假设包括:

  1. 200K 级上下文对真实工程 agent 是基础条件,成本需要由 MLA + DSA + MTP 共同摊薄。
  2. agentic RL 的主要效率瓶颈来自 rollout long-tail,因此需要异步 generation/training 解耦,并接受可控的 off-policy bias。
  3. 训练端优化的 token 必须和 rollout 端真实采样 token 对齐,TITO 是稳定 agentic RL 的底层工程条件。
  4. 稀疏注意力进入 RL 后,top-k indexer 的确定性会影响可见 KV 集合,训练/推理一致性问题会从 logprob 差异扩展到信息检索路径差异。
  5. coding agent 的 reward、verifier 和 sandbox 可以规模化构造,但内部 benchmark 和 Agent-as-a-Judge 需要持续接受外部复验。

5. 模型规模与基础架构

GLM-5 继承 GLM-4.5 的 MoE 路线,并做几项结构调整:

Model Total params Active params Dense layers MoE layers Experts Hidden dim
GLM-4.5 355B 32B 3 89 160 5120
GLM-5 744B 40B 3 75 256 6144

作者减少层数到 80 左右,并增加 expert 数,目标是降低 expert parallelism 通信开销。GLM-5 使用 256 experts,每个 token route 到 8 个 routed experts,并保留 1 个 shared expert。

6. MLA + Muon Split:长上下文 KV 省内存,同时修复优化器适配问题

GLM-5 使用 Multi-latent Attention, MLA,借助低维 latent KV 降低长上下文 KV cache。作者发现直接把 Muon 用在 MLA 上时,576-dim latent KV-cache 的效果低于 GQA-8。为此提出 Muon Split:

  • 原始 Muon 对 WUQ,WUK,WUVW^{UQ}, W^{UK}, W^{UV} 等 up-projection 矩阵做整体 orthogonalization。
  • Muon Split 按 attention head 切成更小矩阵,对每个 head 独立做 orthogonalization。
  • 这样不同 head 的 projection update 可以有不同尺度,MLA 的 benchmark 表现接近 GQA-8。

MLA 另一个问题是 decoding 中 576 维 dot product 高于 GQA 的 128 维。GLM-5 把 head dim 从 192 增到 256,同时把 attention heads 减少三分之一,保持训练计算和参数量大致不变,降低 decoding 计算。

7. 参数共享 MTP:提高 speculative decoding 接受长度

Multi-token Prediction, MTP 可兼做 speculative decoding 的 draft module。常规多步 MTP 如果为每个未来 step 配一套独立 MTP module,权重参数会随 speculative steps 线性增加;当这些 MTP modules 作为 draft Transformer 增量运行时,每个 step 也会产生自己的 draft hidden states 与 key-value cache (KV cache)。GLM-5 共享 3 个 MTP layers 的参数,主要降低的是 weights memory 与 placement 压力:

  • 保持 draft model 权重内存成本接近 DeepSeek-V3 的单 MTP layer 方案。
  • 减少训练/推理不一致。
  • 在作者私有 prompt 集上,给定 4 个 speculative steps,GLM-5 accept length 为 2.76,高于 DeepSeek-V3.2 的 2.55。

这里需要把 parameter sharing 和 KV cache sharing 分开。Transformer block 的 KV 内容来自当前 hidden state 与共享投影矩阵:

K=hWK,V=hWV. K=hW_K,\qquad V=hW_V.

即使多个 MTP steps 共享 WKW_KWVW_V,只要各 step 输入 hidden state hh 不同,生成的 K/VK/V 内容就不同,KV cache 需要额外机制才能复用。GLM-5 的参数共享解决的是“多步 draft 是否要存多套 MTP weights”;后续 GLM-5.2 的 KVShare 才继续处理“多步 draft 是否要混入由 draft hidden state 生成的 KV”。

机制 共享对象 能直接省掉什么 仍需单独处理什么
GLM-5 parameter-sharing MTP MTP step/layer weights 权重参数、权重显存、部分 placement 压力 每个 step 的 draft hidden / KV state
GLM-5.2 KVShare 后续 MTP step 可复用 target-model KV 部分 draft KV 计算与路径偏移 不同任务、不同 context 下的 acceptance 稳定性

8. DSA:用 continued pre-training 把稀疏注意力接入大模型

GLM-5 采用 DeepSeek Sparse Attention, DSA。核心思想是用 indexer 做 token-level sparse selection,让模型按内容选择重要 KV,摆脱固定滑窗模式。

训练路线:

  1. 从 mid-training 结束后的 dense / MLA base model 出发。
  2. Warm-up: 1000 steps,每步 14 条 202,752-token sequences,最大学习率 5×1035\times10^{-3},主要训练 indexer。
  3. Sparse adaptation: 沿用 mid-training data 和超参,训练 20B tokens。

作者强调:GLM-5 的 DSA adaptation token budget 远低于 DeepSeek-V3.2 的 943.7B tokens,但足以让 DSA 接近原 MLA 模型。表 3 中,DSA 在 MQ-NIAH-128K 为 100.0,MV-NIAH-128K 为 97.0,SQuAD-128K 为 86.0,HotpotQA-128K 为 63.0;对应 MLA 为 100.0、95.5、79.7、66.3。

DSA 与其它 efficient attention 变体的对比:

  • 简单 interleaved sliding window 会在 RULER@128K 等任务上明显退化。
  • 搜索得到的 SWA pattern 可以缓解退化,但仍保留 fine-grained retrieval 损失。
  • GDN / SimpleGDN 在部分任务上效果更好,但需要额外结构或仍有检索损失。
  • 论文把 DSA 定位为 token-level sparsity 且不丢 long-range dependency 的路线。

9. 数据与 mid-training:把 repo、issue、PR、长文档和 synthetic agent trajectory 放进上下文

GLM-5 base model 总训练量为 28.5T tokens。训练包括 pre-training 和 mid-training。

Mid-training 分三段扩展上下文:

Stage Context Tokens
1 32K 1T
2 128K 500B
3 200K 50B

软件工程数据方面,作者延续 repo-level 文件、commit diff、GitHub issue、pull request 和 relevant files 拼接成统一训练序列的范式。GLM-5 放宽 repo-level 过滤、加强 issue-level 质量过滤,得到约 10M issue-PR pairs;过滤后 issue-PR 部分约 160B unique tokens。

长上下文数据包括自然文档和 synthetic data。作者借鉴 NextLong、EntropyLong 等思路构造 long-range dependencies,并在 200K stage 加入一部分 MRCR-like data,提高长多轮对话 recall。

10. 训练基础设施:为大 MoE、Muon 和长序列省内存/提吞吐

GLM-5 的 pre-training infra 包括:

  • flexible MTP placement:把 MTP output layer 和 main output layer 共置以共享参数,把 embedding/transformer 部分放到前一 pipeline stage,缓解 stage-level memory imbalance。
  • pipeline ZeRO2 gradient sharding:每个 stage 只保存 1/dp1/dp 梯度 shard,并用 double buffering 保留有限 full accumulation buffer。
  • Muon zero-redundant communication:只 all-gather 当前 rank 拥有的 parameter shards,避免 naive Muon 的 full parameter all-gather 峰值内存。
  • pipeline activation offloading:pipeline warmup 中把 forward activation offload 到 host,backward 前 reload,并尽量和计算重叠。
  • sequence-chunked output projection:分块做 output projection 与 cross entropy,降低 loss 计算峰值内存。
  • efficient long-sequence training:workload-aware sequence reordering、attention computation redistribution、可变 context-parallel group、hierarchical all-to-all。
  • INT4 QAT:SFT 阶段加入 INT4 quantization-aware training,并让训练量化 kernel 和离线量化行为 bitwise-identical。

11. Post-training pipeline:SFT -> Reasoning RL -> Agentic RL -> General RL -> Cross-stage distillation

GLM-5 post-training 目标是同时保留 reasoning、coding、agentic 和 general assistant 能力。流程包括:

  1. SFT:覆盖 General Chat、Reasoning、Coding & Agent;上下文到 202,752 tokens。
  2. Reasoning RL:数学、科学、代码、tool-integrated reasoning 四类混合训练。
  3. Agentic RL:coding agent 和 search agent 的异步 RL。
  4. General RL:基础正确性、情绪智能、任务特定质量三维优化。
  5. On-policy Cross-Stage Distillation:最终阶段从不同前序 checkpoint 取 teacher,缓解多阶段 RL 的能力遗忘。

SFT 中支持三类 thinking:

  • Interleaved Thinking:每次 response 和 tool call 前思考。
  • Preserved Thinking:coding agent 多轮会话中保留已有 thinking blocks,减少重复推理和上下文不一致。
  • Turn-level Thinking:每轮可单独控制 thinking 开关。

12. Reasoning RL:GRPO + IcePop 风格 train/infer mismatch correction

GLM-5 的 Reasoning RL 基于 GRPO,并加入 IcePop 技术处理 training policy 与 inference policy 的差异。论文显式区分:

  • πtrain\pi^{\text{train}}:trainer backend 用于 gradient update 的策略。
  • πinfer\pi^{\text{infer}}:rollout / inference engine 用于采样 trajectory 的策略。

训练/推理 mismatch ratio 定义为:

ρi,t=πθoldtrain(yi,tx,yi,<t)πθoldinfer(yi,tx,yi,<t). \rho_{i,t} = \frac{ \pi_{\theta_{\text{old}}}^{\text{train}}(y_{i,t} \mid x, y_{i,<t}) }{ \pi_{\theta_{\text{old}}}^{\text{infer}}(y_{i,t} \mid x, y_{i,<t}) }.

pop operator 只保留 ratio 在区间内的 token:

pop(ρi,t,1/β,β)={ρi,t,1/βρi,tβ,0,otherwise. \operatorname{pop}(\rho_{i,t}, 1/\beta, \beta) = \begin{cases} \rho_{i,t}, & 1/\beta \le \rho_{i,t} \le \beta, \\ 0, & \text{otherwise}. \end{cases}

PPO-style ratio 仍使用训练侧新旧策略:

ri,t=πθtrain(yi,tx,yi,<t)πθoldtrain(yi,tx,yi,<t). r_{i,t} = \frac{ \pi_\theta^{\text{train}}(y_{i,t}\mid x,y_{i,<t}) }{ \pi_{\theta_{\text{old}}}^{\text{train}}(y_{i,t}\mid x,y_{i,<t}) }.

作者设置 β=2\beta=2ϵlow=0.2\epsilon_{\text{low}}=0.2ϵhigh=0.28\epsilon_{\text{high}}=0.28,group size 为 32,batch size 为 32,并移除原 IcePop 的 KL regularization 以加速 RL 提升。

13. DSA RL insight:top-k indexer 的确定性会直接影响 RL 稳定性

DSA 在 RL 中多一个问题:indexer 会为每个 token 选择 top-k KV entries。MoE 可通过 routing replay 保留 expert top-k,但 DSA indexer 的 k=2048k=2048,逐 token 存 top-k indices 的存储和通信成本过高。

GLM-5 的工程选择是:

  • 在训练 engine 中使用 deterministic torch.topk 作为 DSA indexer top-k operator。
  • 避免 SGLang DSA indexer 中非确定性 CUDA top-k 带来的 train/infer mismatch。
  • RL 阶段默认 freeze indexer parameters,以加速训练并避免 indexer 学习不稳定。

论文报告非确定性 top-k 会在 RL 几步后带来严重性能退化和 entropy sharp drop。这个观察与 2605.142202025-09-10 的主张直接呼应:在 RL 闭环里,rollout 和 trainer 的微小路径差异会被 policy update 放大。

14. Agentic RL:异步、去同步瓶颈、接受有限 off-policy bias

同步 RL 在 agent tasks 上的主要问题是 rollout long-tail:有些轨迹很长、有些环境慢、有些工具调用卡住,训练端会等待最慢样本。GLM-5 采用 fully asynchronous training:

  1. training engine 和 inference engine 部署在不同 GPU。
  2. inference engine 持续生成 trajectories。
  3. 生成数量达到阈值后发给 training engine 更新模型。
  4. training engine 每 KK 次 gradient updates 将新权重同步到 inference engine。
  5. rollout engine 的权重更新后,作者 reset optimizer,以降低不同 rollout policy 造成的优化问题变化。

这提升 GPU 利用率,但引入 policy lag 和 off-policy 数据。GLM-5 用下面几项机制控制风险。

14.1 TITO:Token-in-Token-out

Text-in-text-out 会让 rollout engine 输出文本,trainer 重新 tokenize。这个过程可能因为 whitespace、normalization、special tokens、truncation 和 tool boundary 产生错位。

TITO 要求训练 pipeline 直接消费 inference engine 产生的 token IDs 和 metadata。GLM-5 的 TITO Gateway 拦截 generation requests,记录每条 trajectory 的 token IDs 和元信息,让 trainer 优化的 token 与 rollout 实际采样 token 一一对应。

14.2 直接双边 importance sampling

异步场景下,单条 trajectory 生成期间 rollout engine 可能已经经历多次权重更新。完整追踪 πθold(1),,πθold(N)\pi_{\theta_{\text{old}}^{(1)}}, \dots, \pi_{\theta_{\text{old}}^{(N)}} 不现实。GLM-5 直接使用 rollout 时记录的 log-probabilities 作为 behavior proxy:

rt(θ)=exp(logπθ(atst)logπrollout(atst)). r_t(\theta) = \exp\left( \log \pi_\theta(a_t|s_t) - \log \pi_{\text{rollout}}(a_t|s_t) \right).

再用双边 mask:

f(x;ϵ,ϵh)={x,1ϵ<x<1+ϵh0,otherwise f(x; \epsilon_\ell, \epsilon_h) = \begin{cases} x, & 1-\epsilon_\ell < x < 1+\epsilon_h \\ 0, & \text{otherwise} \end{cases}

目标写成:

L(θ)=Et[f(rt(θ),ϵl,ϵh)A^tlogπθ(atst)]. L(\theta) = \mathbb{E}_t \left[ f(r_t(\theta), \epsilon_l, \epsilon_h) \hat{A}_t \log \pi_{\theta}(a_t|s_t) \right].

这个做法放弃显式 old-policy inference,接受受控 off-policy bias,换取可实现性和训练稳定性。它和 2506.13585 的 CISPO 都属于 “clipped IS weight + logprob gradient” 方向,但 GLM-5 的比值是 current policy / rollout behavior policy,服务异步 agent RL;CISPO 主要讨论 current / old ratio 在 long-CoT RL 中的 token clipping 问题。

14.3 丢弃过旧和噪声样本

GLM-5 记录 rollout 期间涉及的模型版本序列 (w0,,wk)(w_0,\dots,w_k)。若当前版本 ww' 与最旧 rollout 版本差距超过阈值 τ\tau,则丢弃该样本。

对 coding sandbox,作者还记录失败原因,过滤环境崩溃导致的失败样本。对 group-based sampling,若过滤后有效样本超过 group size 一半,则重复有效样本补齐;否则丢弃整组。

14.4 DP-aware routing

多轮 agent workload 的后续请求共享前缀。GLM-5 让同一个 rollout ID 固定路由到同一 DP rank,以复用 KV cache。路由层用 consistent hashing 维护 rollout ID -> DP rank 映射,并通过轻量 hash-space rebalance 降低长期负载不均。

15. slime:把 rollout 变成可扩展服务

GLM-5 继续使用 slime 作为统一 post-training 基础设施。论文强调三点:

  • Scaling out:rollout 接口可自定义,支持多轮 interaction loops、tool invocation、environment feedback、verifier branching;task logic 可作为服务接入。
  • Scaling up:RL rollout 的瓶颈常是 end-to-end tail latency,slime 用多节点 inference、DP-attention、FP8 rollout、MTP、PD disaggregation 减少最慢样本卡住训练。
  • Robustness:rollout servers 用 heartbeat 监控,异常服务会被 termination 和 deregistration,retry 被路由到健康服务。

PD disaggregation 很关键:multi-turn RL 中长 prefix prefill 很频繁。若 prefill 与 decode 共享资源,重 prefill 会干扰 decode 进度,恶化 tail latency。分离 prefill/decode 资源后,长轨迹更容易持续推进。

16. Agent environment scaling:可验证 SWE、terminal、search、slide generation

GLM-5 构建了多类 agentic training environments:

  • SWE environments:从真实 issue-PR pairs 出发,用 RepoLaunch 类流程自动建可执行环境、生成 test commands、抽取 Fail-to-Pass / Pass-to-Pass tests;规模超过 10K verifiable environments,覆盖 Python、Java、Go、C/C++、JavaScript、TypeScript、PHP、Ruby 等。
  • Terminal environments:从 seed tasks 和 web corpus 合成 Harbor 格式任务,包含 structured description、Docker environment 和 test scripts;构建 agent 自检并迭代修正任务。
  • Search tasks:从早期 search agent 轨迹收集 URL,构建 Web Knowledge Graph,再生成多跳 QA;用 tool-free model、early-stage agent 和 verification agent 做三阶段过滤。
  • Slide generation:以 HTML slide 作为可执行环境,设计 static markup、runtime rendering、visual perceptual features 三层 reward,并用 distributed rendering service 提取布局属性。

这里和 reward hacking 主题也有连接:slide RL 中出现过 overlong content hard truncation、spacing manipulation 等 reward hacking,作者通过改 renderer 和 reward 规则降低 exploit。

17. Search agent 的上下文管理:keep-recent-k + discard-all

在 BrowseComp 类搜索任务中,工具历史会迅速超过长上下文预算。GLM-5 使用 keep-recent-k:

oiTool result is omitted to save tokens.i=1,,nk o_i \leftarrow \text{Tool result is omitted to save tokens.} \quad i=1,\ldots,n-k

其中 qq 是问题,rir_i 是第 ii 轮 reasoning,aia_i 是 action,oio_i 是 observation。实验中 k=5k=5 将 BrowseComp 从 55.3% 提升到 62.0%。

作者进一步把 keep-recent-k 与 discard-all 组合成 Hierarchical Context Management:当总上下文超过阈值 TT,丢弃全部 tool-call history 并重启新 context,同时继续使用 keep-recent。作者用参数搜索选 T=32KT=32K,最终 BrowseComp + context management 达到 75.9。

18. 国产芯片适配:W4A8、fusion kernels、vLLM/SGLang engine

GLM-5 从项目开始即适配 Huawei Ascend、Moore Threads、Hygon、Cambricon、Kunlunxin、MetaX、Enflame 等中国芯片平台。以 Ascend Atlas 为例:

  • Mixed-Precision W4A8:Attention 和 MLP 使用 W8A8,MoE experts 压到 W4A8。
  • fusion kernels:Lightning Indexer、Sparse Flash Attention、MLAPO,把 score/ReLU/TopK、KV selection、多个 small pre-processing ops 融合。
  • inference engine:vLLM-Ascend 和 SGLang,支持 D2H sampling overlap、RadixCache / Prefix Cache、Attention DP + MoE EP、FlashComm、MTP。

作者称在单个国产节点上达到接近双 GPU 国际集群的性能,并在长序列场景降低 50% deployment cost。该结论需要外部 benchmark 复验。

关键实验/定理

结果 1:ARC benchmark 上 GLM-5 接近闭源前沿并成为强开源模型

  • 设置:比较 GLM-5、GLM-4.7、DeepSeek-V3.2、Kimi-K2.5、Claude Opus 4.5、Gemini 3 Pro、GPT-5.2 (xhigh)。
  • Baseline:GLM-4.7 提供 GLM 系列内部前代对照;DeepSeek-V3.2、Kimi-K2.5 提供同期国产 open-weight / open-model agentic coding 对照;Claude Opus 4.5、Gemini 3 Pro、GPT-5.2 提供闭源前沿上界。比较强度较高,但仍依赖各模型对应 agent harness、prompt、timeout、上下文管理策略和 judge 设置。
  • 指标:HLE、SWE-bench Verified、Terminal-Bench 2.0、BrowseComp、MCP-Atlas、τ2\tau^2-Bench、Vending-Bench 2、GDPval-AA 等。
  • 结果:GLM-5 在多个 open benchmark 上超过 GLM-4.7;SWE-bench Verified 77.8,SWE-bench Multilingual 73.3,BrowseComp 62.0 / context management 75.9,MCP-Atlas 67.8,Vending-Bench 2 账户余额 $4,432
  • 解读:开放权重模型在 agentic/coding 任务上逼近部分闭源前沿,但不同 agent harness、timeout、prompt、judge 和 context management 会影响横向可比性。

结果 2:DSA 接近 MLA 长上下文表现,同时显著降低成本

  • 设置:GLM-5 先完成 dense/MLA mid-training,再用 DSA warmup + 20B token sparse adaptation。
  • Baseline:直接 baseline 是同一 GLM-5 dense/MLA 模型;辅助 baseline 包括 interleaved sliding window、搜索得到的 SWA pattern、GDN/SimpleGDN 等 efficient attention 方案,以及 GLM-4.7-Flash + DSA 在 RULER 长度扩展中的前后对照。这个 baseline 组合能说明 DSA adaptation 的相对效果,但 20B sparse adaptation 的训练预算和数据配比仍会影响最终结论。
  • 指标:MQ-NIAH-128K、MV-NIAH-128K、SQuAD-128K、HotpotQA-128K;另有 GLM-4.7-Flash + DSA 的 RULER 长度扩展实验。
  • 结果:DSA 在 NIAH/SQuAD 上接近或优于 MLA,HotpotQA 略低;GLM-4.7-Flash + DSA joint training 在 RULER 16K/32K/64K 超过 baseline,128K 只低 0.35。
  • 解读:continued pre-training 可把稀疏注意力接入已有 dense model,DSA 相比固定 SWA/linear attention 更适合 fine-grained retrieval。

结果 3:deterministic top-k 对 DSA RL 稳定性很关键

  • 设置:DSA indexer 的 top-k 选择在 RL 中使用 deterministic torch.topk,并和非确定性 CUDA / TileLang top-k 比较。
  • Baseline:非确定性 CUDA / TileLang top-k 是速度优先实现;deterministic torch.topk 是一致性优先实现。两者共享 DSA indexer 语义,差异集中在 top-k 集合是否可复现。
  • 指标:RL performance、entropy、训练稳定性。
  • 结果:非确定性 top-k 在几步后导致性能明显退化和 entropy sharp drop;torch.topk 稍慢但输出一致,并带来显著 RL gains。
  • 解读:这是 TIM / inference determinism 在 sparse attention indexer 场景中的强实证案例。这里的 mismatch 已从 logprob 小差异升级为检索集合差异。

结果 4:异步 agentic RL 的稳定化机制

  • 设置:fully asynchronous training,inference engine 连续 rollout,training engine 达到阈值后更新;Multi-Task Rollout Orchestrator 管理多任务服务。
  • Baseline:概念 baseline 是同步 on-policy rollout,以及不做 TITO / stale dropping / direct double-sided IS 的朴素异步 pipeline。报告描述了机制和必要性,但没有把每个 baseline 做成完整公开消融表。
  • 指标:吞吐、GPU 利用、训练稳定性、policy lag 控制。
  • 结果:论文给出机制设计,完整消融表仍待补充;关键机制包括 TITO、直接双边 IS、过旧样本丢弃、环境崩溃过滤、DP-aware routing。
  • 解读:这部分证据更多是工程报告式证据。方法本身很重要,但还需要公开实现或对比实验验证每个组件的独立收益。

结果 5:CC-Bench-V2 对真实工程能力的自动化评测

  • 设置:内部 benchmark,包含 frontend、backend、long-horizon,使用 unit tests、build checks 和 Agent-as-a-Judge。
  • Baseline:Claude Opus 4.5 是主要闭源强基线;报告也把 GLM-5 放在 ARC 模型族和其它前沿模型的背景中比较。由于 CC-Bench-V2 是内部 benchmark,baseline 强度取决于同一 harness、同一工具预算、同一 judge 校准和任务泄漏控制。
  • 指标:BSR、ISR、CSR、Pass@1。
  • 结果:Frontend 中 GLM-5 build success 很高,React/Vue CSR 可接近或超过 Claude Opus 4.5,但 ISR 仍有差距;Backend Pass@1 为 25.8,Claude Opus 4.5 为 26.9;Repo Exploration Pass@1 为 65.6,略高于 Claude Opus 4.5 的 64.5;Chained Tasks 为 52.3,低于 Claude Opus 4.5 的 61.6。
  • 解读:GLM-5 在单项要求和 repo exploration 上强,但完整端到端任务仍会受错误累积影响。

实验设置与 baseline 审计

维度 记录
模型设置 744B total / 40B active MoE;3 dense layers、75 MoE layers、256 experts、每 token 8 routed experts + 1 shared expert;目标上下文 200K
训练设置 pre-training + mid-training 合计 28.5T tokens;mid-training 分 32K / 128K / 200K 三段;软件工程数据包含 repo、commit diff、issue、pull request、relevant files 和 synthetic agent trajectory
架构设置 MLA 降 KV cache;Muon Split 适配 MLA up-projection;参数共享 MTP 服务 speculative decoding;DSA 通过 1000-step warm-up + 20B token sparse adaptation 接入长上下文稀疏注意力
RL 设置 SFT、Reasoning RL、Agentic RL、General RL、on-policy cross-stage distillation;Reasoning RL 使用 GRPO + IcePop 风格 mismatch correction;Agentic RL 使用 slime 异步 rollout、TITO、direct double-sided IS、stale sample dropping、environment failure filtering 和 DP-aware routing
系统设置 训练与 rollout 使用 Megatron-LM / SGLang / slime 组合;包含 PD disaggregation、DP attention、FP8 rollout、MTP、heartbeat fault tolerance、国产芯片 W4A8 / fusion kernels / vLLM-Ascend / SGLang 适配
技术报告训练配置 披露 28.5T token budget、32K/128K/200K mid-training、10M issue-PR pairs、160B issue-PR unique tokens、DSA 20B sparse adaptation 和多阶段 post-training pipeline
未披露项 训练 GPU 数、硬件型号、节点数、并行度、wall-clock、GPU hours、美元成本、完整 RL batch / rollout / reward weights、agentic 环境完整数据
baseline 强度 ARC benchmark 覆盖国产 open-weight/open-model 与闭源前沿模型,属于强横向 baseline;DSA 和 deterministic top-k 有同模型结构对照,机制因果更清楚;异步 RL 和国产芯片适配偏系统报告,公开消融不足;CC-Bench-V2 贴近真实工程,但内部 benchmark 和 Agent-as-a-Judge 需要外部复验
统计限制 报告主要给单点数值和工程观察,较少提供多 seed、置信区间、显著性检验、完整 ablation grid 和第三方复现配置

证据链强度评估

强证据

  • 技术报告公开了完整 source,能核对训练流程、公式、贡献表、评测设置和部分超参。
  • DSA adaptation、Muon Split、MTP accept length、BrowseComp context management、CC-Bench-V2 等有具体数值。
  • DSA deterministic top-k 与 RL stability 的观察与 TIM/VeXact、inference determinism、MoE routing replay 等已有材料形成独立一致性。

中等强度证据

  • ARC benchmark 横向比较覆盖广,但 prompt、agent harness、timeout、judge model 和 context management 对结果影响大。
  • CC-Bench-V2 更贴近真实工程,但为内部 benchmark;Agent-as-a-Judge 虽有 94% point-wise agreement 和 85.7% ranking Spearman 验证,仍需要外部复现。
  • 国产芯片适配结论重要,但缺少完整公开测评配置。

需要谨慎的推论

  • “agentic engineering” 是一个工程愿景,报告展示的是大系统 recipe,尚未隔离每个组件对最终能力的因果贡献。
  • 异步 RL 的直接双边 IS 接受 off-policy bias,当前报告没有给出系统性 bias/variance 消融。
  • DSA “lossless by construction” 的说法需要结合具体 indexer recall、任务类型和训练预算理解;极端精细检索或更长上下文仍需复验。

OpenReview / 审稿意见吸收

  • 公开状态:截至 2026-06-24,本轮检索未发现 GLM-5 技术报告对应的官方 OpenReview forum 或公开 reviewer 评分;OpenReview 搜索结果主要是其它论文引用 GLM-5 / arXiv:2602.15763。
  • Venue 判断:当前按 arXiv 技术报告处理,证据强度来自公开论文、TeX/HTML/PDF、开源仓库、项目页和后续 GLM-5.2 / slime 生态材料。
  • 可吸收的外部审稿式问题:ARC 与 CC-Bench-V2 的 harness 是否统一;Agent-as-a-Judge 是否存在偏差;异步 RL 的 TITO、direct double-sided IS、stale dropping、DP-aware routing 是否有独立消融;DSA deterministic top-k 的速度损失与质量收益如何权衡;国产芯片性能结论是否有公开配置和第三方复验。
  • 对本文档的影响:把 GLM-5 作为 production recipe 和系统节点引用时可信度较高;把单个组件当作严格因果结论时,需要依赖额外 ablation、第三方 benchmark 或后续开源实现。

本地讨论补充

1. 讨论收敛点

  • 本地初读后的判断:GLM-5 的价值主要在 agentic RL 系统化,单一 benchmark 分数只是其中一部分。它把长上下文架构、训练/推理一致性、异步 rollout、环境构建和真实工程评测打包成一条 pipeline。

2. 修正后的理解

  • GLM-5 的异步 RL 与常规 PPO/GRPO 的最大差异在于行为策略不再是单一 frozen old policy。rollout 轨迹可能来自多个 policy versions,因此它选择直接用 rollout logprob 作为 behavior proxy,并用双边 mask 控制极端 ratio。
  • DSA 在 RL 中的核心风险是 indexer top-k 集合不一致。这个风险比 dense model 的 logprob drift 更强,因为一旦 top-k 检索集合变化,attention 实际可见的信息集合也会变化。

3. MTP 参数共享与 KV cache 澄清

  • GLM-5 的 parameter-sharing MTP 共享的是 MTP step/layer weights。它主要降低多步 draft model 的权重内存和 pipeline placement 压力。
  • KV cache 缓存的是具体 hidden state 经过 key/value projection 后得到的张量。共享 WK/WVW_K/W_V 只说明投影函数相同;不同 MTP step 的 hidden state 不同,K/VK/V 内容仍不同。
  • 因此 GLM-5 的参数共享应解释成权重共享。KV cache sharing 需要额外机制;GLM-5.2 的 KVShare 是后续专门处理 activation/KV path 的机制,用 target-model KV 减少 draft hidden state 生成的 KV 混入。

4. 后续复验指标

  • TITO vs text-in-text-out 对 token alignment、reward alignment、tool-call boundary 的影响。
  • 直接双边 IS vs decoupled PPO / IcePop / CISPO 的稳定性、bias、effective token ratio 分布。
  • deterministic torch.topk 与高性能 deterministic top-k kernel 的速度/质量 tradeoff。
  • keep-recent-k / discard-all 在不同 search benchmarks、不同 tool budget、不同 judge prompt 下的鲁棒性。
  • CC-Bench-V2 或类似 benchmark 的外部复现。

主要启发

  • Agent RL 的系统瓶颈越来越集中在 rollout long-tail:工具调用、环境执行、长 prefix prefill、straggler trajectories 会直接决定训练 wall-clock。
  • 对 long-horizon agent,token 对齐是训练正确性的底层前提。TITO 的意义在于避免 re-tokenization 把 rollout action 和 trainer loss 对不上。
  • Sparse attention 进入 RL 后,determinism 问题会从 kernel 数值差异扩展到 token retrieval / routing 差异。
  • 异步 RL 不必完整保留所有 old policy checkpoints;可用 rollout logprob + 双边 mask + stale sample dropping 换取可实现性,但需要持续监控 off-policy bias。
  • Agentic engineering benchmark 需要评测“完整任务成功率”和“错误累积”,单步 coding benchmark 无法覆盖 repo exploration、multi-step chained changes 和长期状态维护。

局限

  1. 许多数据和评测来自内部 pipeline,外部可复现性有限。
  2. 异步 RL 关键组件缺少逐项消融,难以判断 TITO、双边 IS、stale dropping、DP-aware routing 各自贡献。
  3. benchmark 横向比较受 agent harness、prompt、context management、tool policy、timeout、judge model 明显影响。
  4. DSA 依赖 DeepSeek-V3.2 的外部技术路线;报告更多展示 GLM-5 采用与适配 DSA,完整 DSA 机制需要回到 DeepSeek-V3.2 论文理解。
  5. Agentic coding 和 terminal 环境的 reward/verifier 可能引入 proxy exploitation;论文展示部分 slide reward hacking 修复,但没有系统化评估所有环境的 reward hacking 风险。

跨论文关系

  • IndexCache:IndexCache 直接在 744B-A40B GLM-5 checkpoint 上验证 training-free layer search。Long Avg 上,原始 DSA 为 78.4,searched 1/4 为 78.0,明显高于 uniform 1/4 的 72.7;该实验只覆盖 training-free adaptation,744B training-aware 结果尚未披露。
  • 2026-04-24:两者都把长上下文 agent 能力做成系统工程。DeepSeek-V4 强调 1M context、CSA/HCA、mHC、OPD 和 deterministic kernels;GLM-5 强调 200K context、DSA adoption、slime 异步 RL、TITO、agent environments 和国产芯片适配。
  • 2605.142202025-09-10:GLM-5 的 IcePop ratio、deterministic DSA top-k 和 TITO 都是 train/inference mismatch 的生产级应对。
  • 2607.07508 SAO:GLM-5 已公开 current policy / rollout behavior policy 的直接 ratio、双侧越界置零和 f(r)A^logπf(r)\hat A\log\pi 目标;SAO 随后将该设计命名为 DIS,与 single-rollout critic、skip-observation GAE 组合,并在 Qwen3-30B-A3B 上做独立实验。该关系显示 DIS 从 GLM-5 的异步训练报告延展为 SAO 的完整算法组件。
  • 2409.19256:HybridFlow/VERL 提供 RLHF/RLVR dataflow 编排语言;GLM-5 的 slime 更强调 server-based rollout、HTTP APIs、多任务 orchestrator、PD disaggregation 和 fault tolerance。
  • 2606.00135:tool-calling RL 论文从 benchmark sensitivity 与训练效率角度分析 agentic tool use;GLM-5 给出大模型生产 pipeline 中的 TITO、stale sample dropping、DP-aware routing 和环境构建实践。
  • 2506.13585:MiniMax-M1 用 Lightning Attention 和 CISPO 服务 long-output reasoning RL;GLM-5 用 DSA 与直接双边 IS 服务 long-context agentic RL。二者都把 clipped IS weight + logprob gradient 当作降低 off-policy / clipping 问题的方向,但 ratio 定义和场景不同。
  • 2503.14476:GLM-5 的 slide generation RL 引用 token-level policy gradient loss,且动态采样和多阶段 RL 都与 DAPO/GRPO recipe 共享方法背景。
  • 2405.198882511.02749:GLM-5 的 DP-aware routing、PD disaggregation、context management 和 agent rollout 服务,与 application DAG、span-level cache locality 共同构成 agent serving 系统图谱。
  • 2403.031852510.20270:GLM-5 的 slide RL reward hacking 案例、SWE/terminal/verifier environments 和 Agent-as-a-Judge 都需要 proxy reward / test-case exploitation 视角审视。
  • 关系状态:本笔记的 跨论文关系 已把 GLM-5 / GLM-5.2 连接到 SAO、DeepSeek-V4、TIM/VeXact、HybridFlow/slime、tool-use RL、MiniMax-M1/CISPO、DAPO、Parrot/Span Query 和 reward hacking。

Reference Intake Brief

Target

  • Intended target system: 维护论文笔记 / agentic engineering 与异步 RL 系统专题。
  • Existing related assets: content/utility/papers-index.md;已存档论文链接使用 /papers/<slug>/
  • Proposed form: 维护独立 Markdown 文档,并同步 content/utility/papers-index.md

Reusable Elements

  1. GLM-5 的 ARC pipeline:pre-training / mid-training / SFT / Reasoning RL / Agentic RL / General RL / cross-stage distillation。
  2. 异步 RL 稳定化机制:TITO、直接双边 IS、stale sample dropping、environment failure filtering、DP-aware routing。
  3. DSA RL insight:deterministic top-k 对 sparse attention RL 稳定性至关重要。
  4. Agentic environment construction:SWE、terminal、search、slide generation。
  5. Real-world agentic engineering evaluation:CC-Bench-V2、Agent-as-a-Judge、repo exploration、chained tasks。

Risks

  • Copyright/over-copying: 已用摘要式重写,未长段复制论文正文。
  • Unsourced or unverifiable claims: 内部 benchmark、国产芯片性能、agent环境规模等按作者报告记录,已标注需外部复验。
  • Tone/brand mismatch: 保持技术分析语气,避免发布式宣传表达。
  • Safety/compliance issues: 涉及 coding agent、terminal task 和 reward hacking,只记录机制与风险,不提供可执行滥用流程。
  • Overlap with existing assets: 与 DeepSeek-V4、MiniMax-M1、TIM、HybridFlow、tool-use RL 有强重叠,但本文新增的是 Zhipu/Tsinghua GLM-5 的 agentic engineering 与 asynchronous RL system 节点。

Skipped

Material Reason
GLM-5.1 README 新增内容 超出 arXiv v2 GLM-5 技术报告范围,仅作为项目背景确认
完整 185 人作者列表 arXiv / source 已保留完整列表;笔记记录 team、tech leads、advisors 和 core contributors,避免索引过长
具体 terminal / SWE task 样例细节 可能涉及可执行环境和 benchmark exploit 风险,保留高层构造流程即可

Recommendation

Decision: merge

Why: GLM-5 把本地已经关注的长上下文、agentic tool-use RL、训练/推理一致性、异步 rollout、serving/cache locality、reward hacking 和真实工程评测放进同一个生产级技术报告,是连接 DeepSeek-V4、MiniMax-M1、DAPO、TIM/VeXact、HybridFlow 和 tool-use RL 的关键节点。