阅读笔记
GLM 5.2: Built for Long Horizon Tasks
GLM-5.2 是 GLM-5 系列从 200K 长上下文 agentic engineering 推进到 1M 长上下文 coding agent 的 release:它用 IndexShare 降低 DeepSeek Sparse Attention (DSA) indexer 成本,用 Multi-Token Prediction (MTP) IndexShare + KVShare + rejection sampling + total variation (TV) loss 提升 speculative decoding acceptance,用 slime 承载更复杂的 agentic RL / On-Policy Distillation (OPD),用 critic-based Proximal Policy Optimization (PPO) 适配 compaction 后的长轨迹训练,并把 anti-hack module 放入 coding RL 和 evaluation,目标是让 1M context 在真实长时工程任务中可用、可训、可服务。
所读版本 blog bundle last modified 2026 06 17;Hugging Face BF16 checkpoint commit b4734de4facf877f85769a911abafc5283eab3d9;Transformers v5.12.0 implementation commit e0e7504bca2bfd1b85bb0eedb148f7b250226f06;SGLang implementation commit ee1736f39ab62b15fcb276d3ff9090ff13c60fc6
Source
- Workflow version: v2.1
- Material type: blog
- Analysis modules: experiment, system, model-report, safety, docs
- Canonical source: https://z.ai/blog/glm-5.2
- Title: GLM-5.2: Built for Long-Horizon Tasks
- URL: https://z.ai/blog/glm-5.2
- Documentation: https://docs.z.ai/guides/llm/glm-5.2
- Code/Project: https://github.com/zai-org/GLM-5
- Model: https://huggingface.co/zai-org/GLM-5.2
- Config snapshot: https://huggingface.co/zai-org/GLM-5.2/blob/b4734de4facf877f85769a911abafc5283eab3d9/config.json
- Weight index snapshot: https://huggingface.co/zai-org/GLM-5.2/blob/b4734de4facf877f85769a911abafc5283eab3d9/model.safetensors.index.json
- Weight metadata: https://huggingface.co/api/models/zai-org/GLM-5.2/revision/b4734de4facf877f85769a911abafc5283eab3d9
- Transformers config implementation: https://github.com/huggingface/transformers/blob/e0e7504bca2bfd1b85bb0eedb148f7b250226f06/src/transformers/models/glm_moe_dsa/configuration_glm_moe_dsa.py
- Transformers implementation: https://github.com/huggingface/transformers/blob/e0e7504bca2bfd1b85bb0eedb148f7b250226f06/src/transformers/models/glm_moe_dsa/modeling_glm_moe_dsa.py
- SGLang GLM-DSA/MTP loader: https://github.com/sgl-project/sglang/blob/ee1736f39ab62b15fcb276d3ff9090ff13c60fc6/python/sglang/srt/models/glm4_moe.py
- SGLang MTP fusion module: https://github.com/sgl-project/sglang/blob/ee1736f39ab62b15fcb276d3ff9090ff13c60fc6/python/sglang/srt/models/glm4_moe_nextn.py
- ModelScope: https://modelscope.cn/models/ZhipuAI/GLM-5.2
- Authors: Z.ai / GLM-5 Team
- Published: 2026-06-16
- Current version read: blog bundle last modified 2026-06-17;Hugging Face BF16 checkpoint commit
b4734de4facf877f85769a911abafc5283eab3d9;Transformers v5.12.0 implementation commite0e7504bca2bfd1b85bb0eedb148f7b250226f06;SGLang implementation commitee1736f39ab62b15fcb276d3ff9090ff13c60fc6 - Accessed: 2026-07-27
- Key figure decision: omit
- Key figure rationale: 本次架构补充的直接证据来自机器可读配置、Safetensors 元数据和权重张量形状;分层参数表和数据流说明已经保留关键结构信息,无需引入发布图。
- Review status: page-type=not-found; match-confidence=high; observed-at=2026-07-27; venue-status=release blog and open-weight model card
- Related paper: 2602.15763
- Related method: IndexCache
- Subjects: long-horizon coding agents, 1M context, sparse attention, speculative decoding, agentic RL, anti-hack training
- Review / OpenReview: 截至 2026-07-27,未发现 GLM-5.2 release blog 对应的官方公开审稿 forum;OpenReview 检索主要返回其它论文或材料对 GLM-5.2 和 GLM-5 系列的引用。
作者与关系
- Z.ai / GLM-5 Team: Z.ai / GLM-5 Team.
- GLM-5 Team / Zhipu AI / Tsinghua University: 2602.15763 的作者结构已经在本地建档。GLM-5.2 延续同一开源仓库和同一 GLM-5 series citation。
- slime / THUDM: 博文明确说 GLM-5.2 的 agentic RL 和 parallel OPD 使用 slime,形成直接工程关系。
- IndexShare / IndexCache 相关作者线:博文链接 IndexCache。该论文作者包括 Yushi Bai、Qian Dong、Ting Jiang、Xin Lv、Zhengxiao Du、Aohan Zeng、Jie Tang、Juanzi Li,与 GLM-5 / GLM-5.2 团队存在明显人员重叠。
阅读目标与判断边界
本笔记关注:
- GLM-5.2 相对 GLM-5 / GLM-5.1 的关键变化是什么。
- 1M context 的瓶颈如何从 attention FLOPs 转向 indexer、KV cache、kernel、CPU scheduling 和 rollout infrastructure。
- IndexShare、MTP/KVShare、slime、critic-based PPO 和 anti-hack module 分别解决哪一层问题。
- 这篇 release blog 和本地已有 GLM-5、slime、Bebop、TIM/VeXact、Seer、DeepSeek-V4、reward hacking 论文之间的关系。
判断边界:
- 这是 release blog 与模型卡,信息粒度低于完整技术报告。许多训练数据、RL reward、anti-hack classifier、OPD 细节和 serving benchmark setup 没有完全展开。
- benchmark 表来自官方发布,跨模型比较依赖 harness、effort level、上下文长度、tool policy、judge 和运行预算。后续需要第三方复测。
- 文章包含 coding agent reward hacking 示例。本笔记只沉淀风险类别、防御机制和评测启发,不记录可执行滥用流程。
论文脉络
1. 研究问题、背景和价值
GLM-5.2 面向的问题是:coding agent 已经从短上下文 bug fix / unit test 任务,进入持续数小时甚至数十小时的 long-horizon engineering。模型需要读大仓库、维护长期计划、调用工具、运行实验、做性能优化、处理失败恢复,并在超长会话中保留有效上下文。
这类任务把“长上下文”从静态 benchmark 推到工程压力下:
- context 要能容纳仓库、日志、工具返回、历史决策和中间产物。
- 模型要能在长轨迹中持续推进任务,避免有效行动只集中在前几轮。
- serving engine 要能承受 1M prompt 下的 KV cache、prefill、decode 和调度压力。
- RL 训练要能处理长轨迹 compaction、工具反馈、子任务分解和奖励作弊。
GLM-5.2 的价值在于把这些问题放在同一条 release 中处理:模型架构处理 1M sparse attention,MTP 处理推理吞吐,slime 处理 agentic RL 基础设施,PPO/compaction 处理训练数据形态,anti-hack 处理可验证 coding reward 的信号污染。
2. 已有解决方案与不足
GLM-5 已经提供 744.0B total / 40.0B active MoE、DSA、slime 异步 RL 和 200K context。GLM-5.1 进一步增强 coding / agentic capability,但从 GLM-5.2 博文看,长时工程任务仍有四类不足:
- 200K context 对仓库级、长日志、长工具轨迹仍偏紧。
- DSA core attention 已被稀疏化,但 indexer 自身还会在每层做高成本 top-k 选择。
- MTP speculative decoding 有训练-推理差异,draft acceptance 仍可提升。
- coding RL 的 pass/fail reward 容易被 agent 通过环境或评测漏洞优化,导致 reward 上升但能力没有同步提升。
已有 Reinforcement Learning with Verifiable Rewards (RLVR) / Group Relative Policy Optimization (GRPO) 类 group-wise 方法也面临形态错配。长轨迹经过 compaction 后,一个 prompt 下的 rollout 会被切成数量不定、长度不同的 sub-traces,组内比较的结构变弱;这会推动系统从 group-wise optimization 转向 critic-based PPO。
3. 作者可能的思考路径
如果从 GLM-5 到 GLM-5.2 的演进看,作者可能先遇到的是 1M context 的经济性问题。DSA 已经把主 attention 从
第二条思路来自 speculative decoding。GLM-5 已有 parameter-sharing MTP,但多步 draft 在推理时会混入由 MTP 自己生成的 hidden state / KV,而训练时又希望行为和目标模型对齐。IndexShare 的“后续 token 只能 attend 到之前 token”的结构给了一个机会:复用第一步的 top-k indices 和 target model KV,让后续 MTP step 更接近训练态,并减少 draft model 成本。
第三条思路来自 agentic RL 训练数据。long-horizon task 会产生很长、很乱、被 compaction 切开的轨迹。组内 GRPO 适合固定 prompt group 的若干完整 responses;compacted sub-traces 的数量和长度都变了,critic-based PPO 可以把每条 rollout / sub-trace 作为独立训练对象,用 critic 估计 token-level advantage。
第四条思路来自 reward hacking。coding agent 有工具权限、仓库访问、测试反馈和网络/文件系统操作;pass/fail reward 会鼓励捷径。直接丢弃整条 trajectory 会造成训练不稳定,在线拦截单个非法 tool call 并返回 dummy observation,让 rollout 继续进行,是更平滑的防御入口。
4. 核心假设或切入点
GLM-5.2 的核心假设包括:
- 1M context 的真实价值体现在 long-horizon coding agent,同时覆盖长文本读取。
- DSA 的连续层 top-k indices 有足够相似性,可以跨层复用。
- MTP draft model 的 acceptance 同时取决于模型容量和训练-推理路径一致性。
- compaction 后的长轨迹训练更适合 critic-based PPO,对固定 group structure 的依赖更低。
- coding RL 的 anti-hack 需要在线化,防御模块要参与 rollout,并和离线清洗形成互补。
5. GLM-5.2 结构参数速览与阅读方法
面向读者的模型参数表优先展示五类信息:存储规模、激活规模、网络深度、残差流宽度,以及 MoE 和注意力的实际执行路径。分片数、张量数和逐矩阵求和主要用于核验,放在结果证据中即可。参数量统一保留一位小数并使用 M/B;层数、维度、头数、专家数和上下文长度继续保留精确整数。
5.1 模型规模
| 展示项 | GLM-5.2 | 阅读方式 |
|---|---|---|
| BF16 checkpoint 总参数 | 753.3B | 下载、存储和完整权重驻留的主要口径 |
| Target backbone | 743.4B | 78 个生成主干 block,包含输入词嵌入与输出头 |
| MTP 模块 | 10.0B | 独立保存的 layer 78,用于 speculative decoding |
| 报告口径激活参数 | 39.9B | 单个 token 经过所选专家时涉及的参数规模 |
| GLM-5 报告口径 | 744.0B total / 40.0B activated | 系列级报告数字,统计范围与当前 checkpoint 有差异 |
| 权重精度 | BF16;另有 FP8 release | 本节计数基于 BF16 checkpoint |
| 最大上下文 | 1,048,576 tokens | max_position_embeddings=2^{20} |
这张表应同时保留“总参数”和“激活参数”。GLM-5.2 的全部专家都需要存储;每个 token 只调用其中一部分专家,因此 39.9B 描述计算路径,753.3B 描述 checkpoint 规模。MTP 的 10.0B 参数也要单列,因为普通 target-model forward 与 speculative decoding 对它的使用方式不同。
Hugging Face commit b4734de4facf877f85769a911abafc5283eab3d9 的模型 API、权重索引和张量形状共同支持 753.3B、743.4B 与 10.0B 三个数字。GLM-5 技术报告 Appendix A Table 10 报告 744.0B/40.0B,并声明总参数计入 MTP、排除词嵌入与输出层;该脚注无法直接复现当前 GLM-5.2 checkpoint。部署容量使用 753.3B,引用论文架构时注明 744.0B/40.0B 的报告口径。
5.2 网络深度、宽度与专家
| 结构参数 | 值 | 对模型结构的影响 |
|---|---|---|
| Target backbone blocks | 78 | 自回归生成主干,对应 layers 0–77 |
| Dense blocks | 3 | layers 0–2 使用 dense SwiGLU FFN |
| MoE blocks | 75 | layers 3–77 使用稀疏 MoE |
| MTP blocks | 1 | layer 78,跨多个 draft steps 共享参数 |
hidden_size |
6,144 | 每个 token 的 hidden state 和残差流宽度 |
| Dense FFN intermediate size | 12,288 | 前 3 层 dense SwiGLU 的中间宽度 |
| Expert intermediate size | 2,048 | 路由专家与共享专家的中间宽度 |
| 路由专家数 | 256 / MoE block | 每层保存的候选专家 |
| 激活路由专家数 | 8 / token | router 为每个 token 选择的专家数 |
| 共享专家数 | 1 / token | 每个 token 固定经过的共享专家 |
| Vocabulary size | 154,880 | 输入词嵌入与输出头不共享,各约 951.6M 参数 |
一层 backbone 先让 6,144 维 hidden state 通过注意力,再进入 FFN。前三层使用完整 dense FFN;后 75 层由 router 从 256 个路由专家中选择 8 个,同时执行 1 个共享专家,最后把结果写回 6,144 维残差流。单个专家约 37.7M 参数,每个 MoE block 保存约 9.7B 路由专家参数;当前 token 的专家 FFN 路径约涉及 339.7M 参数。
这组数字解释了总参数与激活参数的差距。75 个 MoE blocks 保存全部专家,使 backbone 达到 743.4B;单个 token 在每层只走 8 个路由专家和 1 个共享专家,按报告口径汇总约为 39.9B active。MTP layer 78 复用相同宽度和完整 MoE 结构,额外保存约 10.0B 参数。
5.3 注意力、hidden state 与稀疏选择
| 注意力参数 | 值 | 数据流含义 |
|---|---|---|
hidden_size |
6,144 | 注意力和 FFN 共享的输入、输出及残差流宽度 |
| Query heads | 64 | 64 个 query heads |
| Logical K/V heads | 64 | MLA 展开后的逻辑头数,缓存仍使用低维 latent |
| Q/K head dimension | 256 | 192 维 no-PE 子空间加 64 维 RoPE 子空间 |
| Value head dimension | 256 | 每个 value head 的宽度 |
| Q LoRA rank | 2,048 | query 先压到低秩空间,再展开到多头空间 |
| Compressed KV width | 512 | MLA 缓存的低维 KV latent |
| MLA logical cache width | 576 | 512 维 KV latent 加 64 维 RoPE key |
| DSA indexer | 32 heads × 128 dims | 为历史位置计算轻量相关性分数 |
| Sparse attention top- |
2,048 | 每个 query 最多选择 2,048 个历史位置 |
| Backbone indexers | 21 Full + 57 Shared | Full 层重新选择位置,后续 Shared 层复用结果 |
| MLA 参数量 | 165.0M / block | 每个 target block 的 MLA 投影与归一化参数 |
| Full indexer 参数量 | 9.4M / Full layer | 参数规模较小,长序列候选扫描构成主要运行成本 |
hidden_state 是运行时张量,最后一维由 hidden_size=6,144 决定,表示 token 在层与层之间传递的残差流宽度。Q 投影会在层内展开为
参数表采用完整 Q/K head dimension 256,并标注为 192 维 no-PE 加 64 维 RoPE。原始 config.json 中的 head_dim=192 只对应 no-PE 子空间,单独展示会遗漏 RoPE 子空间。
GLM-5.2 使用 MLA 压缩 K/V。配置层展开为 64 个逻辑 K/V heads;典型 MLA 解码路径为每个 token、每层保存 512 维 compressed KV 和 64 维 RoPE key,共 576 维。这一区分对应注意力计算时的多头表示与解码时的缓存表示。DSA indexer 再从全部历史位置中选出 top-2,048,MLA 只对这些位置执行核心注意力。
IndexShare 进一步沿网络深度复用选择结果。骨干网络有 21 个 Full indexers 和 57 个 Shared layers,MTP layer 78 另带一个 Full indexer;常见四层组中第一层重新选择 top-
层数口径也需要简短保留:GLM-5 报告正文称 layer count 为 80,Table 10 与当前 checkpoint 都支持 78 个 target blocks 加 1 个 MTP block。当前公开材料没有解释这项表述差异。普通 Transformers forward 只构造 78 个 target blocks;SGLang 等 speculative decoding 路径会另行加载约 10.0B 参数的 MTP layer 78。
GLM-5.2 的产品接口包括 Z.ai chat、GLM Coding Plan、ZCode、Claude Code / OpenCode 等 coding agent 接入。对本地论文目录更重要的是:它把 open-weight 1M context、agentic coding、slime RL 和 production serving 放在同一发布面上。
6. IndexShare / IndexCache for DSA
DSA 的基本结构可以拆成 selector 与 sparse core attention:
该式描述 prefill 量级。对单个 decode token,indexer 扫描长度为
GLM-5.2 使用固定 FSSS IndexShare pattern:anchor layer 运行 indexer 并产生 top-
官方 config.json 给出 index_topk=2048、index_topk_freq=4、index_skip_topk_offset=3、index_topk_pattern=null 和 index_share_for_mtp_iteration=true;offset 之后的 indexer_types 呈周期性的 full, shared, shared, shared。博文声称这一配置在 1M context 下将 per-token FLOPs 降低 2.9 倍,并从 128K sequence length 的 mid-training 阶段开始引入。
这里需要把论文证据分成三层。IndexCache 在 30.0B 模型上验证 training-free search 与 training-aware multi-layer distillation;在 744.0B GLM-5 上只验证 training-free search。GLM-5.2 后续采用固定四层共享,并把机制命名为 IndexShare。固定 FSSS 与 IndexCache 的 training-aware 路线在结构上相容,因为论文中未经训练的 uniform 1/4 pattern 会明显降低 long-context 质量;GLM-5.2 官方材料没有披露 exact index loss,也没有确认完整采用 IndexCache 的 multi-layer KL distillation。
因此可以把 IndexCache 视为方法族,把 IndexShare 视为 GLM-5.2 的 production configuration 与发布名称。两者共享 Full / Shared layers 和跨层 top-
7. MTP with IndexShare and KVShare
GLM-5.2 的 MTP 目标有两个:
- 降低 MTP layer 作为 draft model 的成本。
- 提高 speculative decoding acceptance length。
做法包括:
- MTP 多步预测也使用 IndexShare:第一步运行 indexer,后续 steps 复用 top-k indices。
- KVShare:后续 MTP step 复用第一步的 target-model KV,减少由 draft hidden state 产生的 KV 混入。
- 参数仍沿用 GLM-5.1 的 MTP step parameter sharing。
- 引入 2606.12370 Bebop 式 rejection sampling,并用 end-to-end TV loss 训练。
这里要和 GLM-5 的 parameter-sharing MTP 分开读。参数共享只复用 MTP step/layer weights;KV cache 的内容还取决于每一步输入 hidden state。KVShare 处理的是另一层问题:后续 MTP step 如果继续用 draft hidden state 生成
博文给出的 ablation:
| Method | Acceptance Length |
|---|---|
| Baseline | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + Rejection Sampling | 5.29 |
| + End-to-end TV Loss | 5.47 (+20%) |
直观理解:MTP 的多步 draft 越像 target model 真正会走的推理路径,acceptance 越高;IndexShare/KVShare 减少了 MTP 推理时由 draft 自身 hidden states 引入的偏移,Bebop/TV loss 则从采样分布距离上进一步控制 mismatch。
MTP IndexShare 属于 GLM-5.2 的后续扩展。IndexCache 论文仓库快照 08d22d6 在公开 SGLang / vLLM patch 中通过 is_nextn 关闭 next-token-prediction 分支的 index reuse;官方 GLM-5.2 config 则明确设置 index_share_for_mtp_iteration=true。两份代码材料对应不同发布阶段,不能把论文 patch 当作最终 GLM-5.2 MTP 实现。
8. Efficient serving at 1M context
GLM-5.2 将最大 context 从 200K 扩到 1M 后,瓶颈发生迁移:
-
per-token compute 被 IndexShare / DSA 降低。
-
per-token KV cache size 没有同比下降。
-
长上下文 kernel、cache transfer、CPU-side scheduling 和 runtime path 变得更关键。
-
系统条件:公开材料给出的目标负载为最长 1M-token context,并描述 LayerSplit、cache transfer 与 CPU-side scheduling 路径;硬件型号、并行拓扑、batch、并发和软件版本没有完整披露。
-
指标定义:IndexShare 的 2.9 倍结果是官方报告的 1M context 下 per-token FLOPs 降幅,不能直接换算为端到端吞吐、首 token 延迟或单 token 解码延迟。
-
成本归因:架构侧收益来自减少 Full indexer 执行次数;serving 侧还叠加内存管理、kernel、缓存传输与 CPU 调度优化,公开材料没有提供逐项端到端消融。
官方描述的 inference engine 优化有三条:
- 基于 LayerSplit 做更细粒度 memory management 和 parallelization,增加可用 KV-cache 空间。
- 优化随 context length 增长的 kernels,并与 cache transfer pipeline 协调,降低 cache movement 对 prefill/decode 的影响。
- 优化 CPU-side cache management、request scheduling 和 runtime execution,减少 GPU execution pipeline bubbles。
这和 2026-04-24 的 million-token context 系统结论一致:1M context 的主要问题会从“模型能不能 attend”转向“KV cache、压缩、kernel、调度和 serving economics 是否可承受”。
9. slime for Agentic RL and OPD
GLM-5.2 的 agentic RL 覆盖更大规模、更多领域、更复杂 execution patterns。博文强调 slime 支持:
- white-box rollout。
- black-box rollout。
- compact trajectory。
- sub-agent workflow。
- 训练侧连接不同 inference services。
- 适配不同 parallelism、routing、PD disaggregation 和 deployment patterns。
- KV-cache FP8。
GLM-5.2 使用 slime 做 parallel OPD,将十多个 expert models 融合到最终模型中,整个 OPD 约两天完成。结合 slime 官方仓库 的公开资料,这说明 slime 的定位已经从“RL trainer”扩展成 GLM 系列模型训练、rollout、distillation、serving 配置复用的共同基础设施。
10. RL for long-horizon tasks with compaction
长任务会产生超长 execution traces。经过 compaction 后,一个原始 trajectory 会被切成多个 sub-traces,不同 rollouts 会产生不同数量、不同长度的 trainable traces。
GLM-5.2 因此从 group-wise optimization 转向 critic-based PPO:
- 每个 rollout / compacted sub-trace 都可以作为训练对象。
- critic 估计 token-level advantages。
- token-level loss 处理 sub-trace 长度不均衡。
- 不再要求同一 prompt 下 responses 数量和长度有整齐 group structure。
这个选择和 verl 官方仓库 中讨论的异步/partial rollout、slime 官方仓库 的 compact trajectory 数据结构、以及 2511.14617 的 synchronous group rollout 形成对照:当轨迹保持完整且 group structure 清晰时,group-relative 方法更自然;当轨迹被压缩、切分、异步化后,critic-based PPO 更容易接住复杂数据形态。
11. Anti-hack in coding agents
博文指出 GLM-5.2 在 coding RL 中展现出比 GLM-5.1 更多潜在 hacking behavior。原因是能力增强后,模型更会利用环境和评测信号中的捷径;pass/fail reward 越可验证,越容易被模型当作可优化目标。
官方 anti-hack module 由两阶段检测组成:
- rule-based filter:提高召回,先标记潜在 hack actions。
- LLM judge:判断被标记 action 的意图,提高精度。
- 威胁模型:coding RL agent 可调用工具、修改仓库并接收测试或判题反馈,优化目标是通过利用环境或评测漏洞提高可验证奖励;公开材料没有量化攻击知识、网络权限和沙箱边界。
- 披露边界:本笔记记录风险类别、两阶段检测和在线阻断机制,省略博文中的具体命令与可直接复用的绕过步骤。
系统采用 online guard:每一步 tool call 都被监控。若检测到 hack,系统阻断该调用并返回 dummy information,让 rollout 继续进行。这个设计的优点是把无效行为局部处理,避免直接终止整条 trajectory 导致训练不稳定或模型崩塌。
这和 2510.20270、2506.19248、2503.11926 形成直接关系:当测量信号进入优化闭环,模型会寻找 proxy 失效区域。GLM-5.2 的贡献是把防御从离线评测推进到在线 rollout guard。
12. 结论链条
GLM-5.2 的结论链可以概括为:
- long-horizon coding agent 需要 1M context,并且需要可服务、可训练的 1M context。
- DSA 解决主 attention 成本后,indexer 成为新的瓶颈;IndexShare 通过跨层复用 top-k indices 降低 indexer 成本。
- 1M context 下 KV cache 和 serving overhead 继续主导系统成本,需要 LayerSplit、cache transfer、kernel、CPU scheduling 协同优化。
- speculative decoding 的 MTP acceptance 可以通过 IndexShare/KVShare、rejection sampling 和 TV loss 提升。
- agentic RL 的轨迹变长、被 compaction 切分后,critic-based PPO 更适合 individual rollout / sub-trace 训练。
- coding RL 中 reward hacking 已经成为 production post-training 问题,需要在线 anti-hack guard 保护训练信号。
关键实验/定理
结果 1:GLM-5.2 在长时 coding agent benchmark 上接近闭源 frontier
- 设置:FrontierSWE、PostTrainBench、SWE-Marathon,使用 1M context、max effort、128K max output tokens;FrontierSWE dominance score 截止 2026-06-16。
- Baseline:主要闭源强基线是 Claude Opus 4.8 和 GPT-5.5;同类 open / open-weight 基线来自 GLM-5.1、DeepSeek-V4-Pro、Kimi K2.5 等官方表格对照。长时 coding agent 的 baseline 强度高度依赖统一 harness、工具权限、max output tokens、effort level、judge 和任务时间预算。
- 对照是否可比:同一官方表格内的模型使用相同任务集合,仍缺少逐模型 harness、工具权限、推理预算和重复试验记录,只支持发布级横向定位。
- 指标:官方 benchmark score / dominance。
- 结果:FrontierSWE 为 74.4,接近 Claude Opus 4.8 的 75.1,并高于 GPT-5.5 的 72.6;PostTrainBench 为 34.3,低于 Opus 4.8 的 37.2,高于 GPT-5.5 的 28.4;SWE-Marathon 为 13.0,低于 Opus 4.8 的 26.0,高于 GPT-5.5 的 12.0。
- 证据定位:GLM-5.2 官方发布博文的 long-horizon coding benchmark 表。
- 支持的最窄结论:在官方披露的 1M context、max effort 和 128K 最大输出设置下,GLM-5.2 的 FrontierSWE 与 PostTrainBench 分数接近 Claude Opus 4.8,SWE-Marathon 分数仍有明显差距。
- 解读:GLM-5.2 在 long-horizon coding 上已经进入闭源 frontier 附近,但 SWE-Marathon 显示超长工程交付还有明显差距。
结果 2:标准 coding benchmark 相对 GLM-5.1 大幅提升
- 设置:官方 full benchmark table。
- Baseline:GLM-5.1 是直接前代基线;Terminal Bench、SWE-bench Pro、DeepSWE、ProgramBench 同时提供跨模型表格对照。这个结果最能说明 GLM 系列内部迭代收益,但仍不能把收益完全归因到 IndexShare、MTP、slime 或 anti-hack 的某个单点。
- 对照是否可比:GLM-5.1 是最接近的系列内基线,但官方材料没有给出两个版本逐项一致的 checkpoint、reasoning effort、工具预算和运行方差。
- 指标与结果:Terminal Bench 2.1 (Terminus-2) 从 GLM-5.1 的 63.5 提升到 81.0;SWE-bench Pro 从 58.4 到 62.1;DeepSWE 从 18 到 46.2;ProgramBench 从 50.9 到 63.7。
- 证据定位:GLM-5.2 官方发布博文的 full benchmark table。
- 支持的最窄结论:官方表格显示 GLM-5.2 在所列四项 coding benchmark 上均高于 GLM-5.1,这一对照支持系列级能力提升,无法分离各架构与训练改动的独立贡献。
- 解读:提升集中在需要工具、终端、仓库级操作的 coding agent tasks,和“long-horizon coding agent”定位一致。
结果 3:MTP acceptance ablation
- 设置:使用 GLM-5.1 backbone 和训练数据,MTP steps 为 7。
- Baseline:baseline 4.56 是未加入 IndexShare/KVShare/rejection sampling/TV loss 的 MTP 路径;后续逐项叠加构成相对清晰的机制 ablation。局限是该 ablation 使用 GLM-5.1 backbone / data,和最终 GLM-5.2 release 仍有差异。
- 对照是否可比:四组设置沿同一 GLM-5.1 backbone、训练数据和七步 MTP 路径逐项叠加机制,适合判断累积收益;表格没有提供单因素全排列、方差或最终 GLM-5.2 checkpoint 复测。
- 指标:acceptance length。
- 结果:baseline 4.56;IndexShare + KVShare 5.10;加入 rejection sampling 5.29;加入 end-to-end TV loss 后 5.47,提升 20%。
- 证据定位:GLM-5.2 官方发布博文的 MTP acceptance ablation 表。
- 支持的最窄结论:在该 GLM-5.1 backbone 七步 MTP 消融中,依次加入 IndexShare/KVShare、rejection sampling 和端到端 TV loss 后,acceptance length 从 4.56 增至 5.47。
- 解读:MTP speculative decoding 的收益来自结构路径一致性和分布训练共同作用。IndexShare/KVShare 处理路径差异,rejection sampling / TV loss 处理采样分布差异。
结果 4:reasoning / agentic benchmark surface
- 设置:官方 full benchmark table。
- Baseline:reasoning / tool-use 表格包含 DeepSeek-V4-Pro、Claude Opus 4.8、GPT-5.5 等强模型;这些任务的可比性同样受 effort level、工具配置、prompt 和 judge 影响。Tool-Decathlon 上 GLM-5.2 低于多个强基线,提供了一个重要负向信号。
- 对照是否可比:同表结果适合描述发布时的能力范围;跨模型的 effort、工具链、prompt、judge 和采样预算未完全对齐,排名解释需要第三方统一复测。
- 代表性结果:HLE 40.5,HLE with tools 54.7,AIME 2026 99.2,GPQA-Diamond 91.2,MCP-Atlas public set 76.8,Tool-Decathlon 48.2。
- 证据定位:GLM-5.2 官方发布博文的 reasoning 与 agentic benchmark 表。
- 支持的最窄结论:官方表格显示 GLM-5.2 在所列 reasoning 与工具任务上覆盖面较广,同时 Tool-Decathlon 48.2 低于表中的多个强基线。
- 解读:GLM-5.2 同时在 coding 与 reasoning / tool-use 任务上取得较高分数。Tool-Decathlon 仍低于 DeepSeek-V4-Pro、Claude Opus 4.8、GPT-5.5,说明工具泛化仍有提升空间。
结果 5:公开权重参数量与层结构审计
- 设置:固定读取 Hugging Face BF16 checkpoint commit
b4734de4facf877f85769a911abafc5283eab3d9的模型 API、config.json、model.safetensors.index.json和 282 个 Safetensors 分片头部;用 Transformers v5.12.0 与 SGLang 对应实现核对模块语义。 - 对照是否可比:Hugging Face 元数据、配置、权重索引和张量头部来自同一 commit,可以直接交叉核验;GLM-5 报告的 744.0B 使用不同材料与统计口径,只作为系列级参照。
- 指标:参数总数、数据类型、分片数、张量数、骨干层数、MTP 层数、Full indexer 层数,以及按矩阵形状重算的组件参数量。
- 结果:完整 checkpoint 为 753.3B 参数,78 层骨干网络为 743.4B,MTP layer 78 为 10.0B;骨干网络包含 3 个 dense blocks、75 个 MoE blocks 和 21 个 Full indexers。权重主体为 BF16,MoE correction bias 保留少量 F32 元素。
- 证据定位:Hugging Face model API snapshot;
config.json;model.safetensors.index.json;Transformers v5.12.0 implementation。 - 支持的最窄结论:公开 BF16 checkpoint 的存储参数量按一位小数记为 753.3B;744.0B/40.0B(A40B)是 GLM-5 技术报告中的架构统计口径,报告对总参数的脚注无法直接复现当前 GLM-5.2 checkpoint。
- 适用版本:参数统计适用于 Hugging Face BF16 commit
b4734de4facf877f85769a911abafc5283eab3d9;运行路径解释对应 Transformers v5.12.0 commite0e7504bca2bfd1b85bb0eedb148f7b250226f06与 SGLang commitee1736f39ab62b15fcb276d3ff9090ff13c60fc6。 - 未披露项:官方材料尚未解释 GLM-5 Table 10 的 744.0B 如何映射到当前 GLM-5.2 checkpoint,也没有给出 BF16 与 FP8 release 是否逐张量同构的正式清单。
- 解读:部署容量、下载体积和完整权重驻留按 753.3B 估算;报告口径的单 token 计算路径约为 39.9B active。
实验设置与 baseline 审计
| 维度 | 记录 |
|---|---|
| 模型设置 | GLM-5 报告口径为 744.0B total / 40.0B activated;GLM-5.2 BF16 checkpoint 为 753.3B,其中 78 层 target backbone 为 743.4B、MTP 层为 10.0B;发布 BF16 / FP8 权重,支持 1,048,576-token context、SGLang / vLLM / Transformers / KTransformers 等 serving 路径,并提供 max / high reasoning effort 控制 |
| 架构 / 系统设置 | DSA IndexShare / IndexCache、MTP IndexShare + KVShare、Bebop 式 rejection sampling、end-to-end TV loss、LayerSplit memory management、cache transfer / CPU scheduling 优化、slime compact trajectory / sub-agent workflow / parallel OPD、online anti-hack guard |
| 训练设置 | release blog 没有公开完整 pretraining、post-training、critic training、reward、expert source 和 anti-hack classifier 细节;只能按 release 级信息记录机制与结果 |
| 技术报告训练配置 | 披露 parallel OPD 约两天完成、MTP acceptance ablation、critic-based PPO / compact trajectory / anti-hack guard 等机制;缺少完整训练资源和数据表 |
| 未披露项 | pretraining tokens、训练 GPU 数、硬件型号、并行方式、GPU hours、wall-clock、美元成本、critic training 数据、reward weights、anti-hack precision / recall |
| baseline 强度 | MTP acceptance ablation 是最清楚的机制证据;GLM-5.1 对照能说明系列迭代收益;闭源 frontier 对照能说明实用位置,但受 harness、effort、context、tool、judge、budget 影响较大 |
| 统计限制 | 官方表格主要给单点结果,缺少多 seed、置信区间、第三方复验、完整 ablation grid、online guard precision/recall 和统一 agent harness 配置 |
证据链强度评估
强证据
- 官方模型卡和 GitHub README 确认 GLM-5.2 权重公开、MIT license、BF16/FP8、1M context 和多框架部署支持;Hugging Face 模型 API、配置与权重索引进一步确认 753.3B checkpoint 及其层结构。
- GLM-5 技术报告给出 744.0B total / 40.0B activated 的系列口径;公开张量重算得到 39.9B 的报告口径激活量,并显示 744.0B 总量脚注与当前 GLM-5.2 checkpoint 之间存在未解释差异。
- MTP ablation 表直接支持 IndexShare/KVShare、rejection sampling、TV loss 对 acceptance length 的累积作用。
- blog 与 slime 文档互相印证 GLM-5.2 使用 slime 作为 agentic RL 基础设施。
中等强度证据
- FrontierSWE、PostTrainBench、SWE-Marathon 的结果支持 long-horizon coding 定位,但这些 benchmark 的 harness、budget 和 judge 复杂,第三方复验仍然关键。
- IndexShare 的 2.9x per-token FLOPs claim 和 1M serving scaling 结果来自官方图表和描述,缺少完整可复现实验脚本;固定 FSSS pattern 可由官方配置直接确认。
- anti-hack module 的必要性和机制说得清楚,但没有公开 precision/recall、误拦截率、对训练收益的 ablation。
需要谨慎的推论
- “最高开源模型”这类排名高度依赖 benchmark set、harness、effort level 和发布时间,需要持续复核。
- critic-based PPO 对 compaction 的适配性合理,但博客没有给出与 GRPO / group-wise objective 的直接 ablation。
- online anti-hack guard 能稳定训练的说法需要看 rollout continuation、dummy observation 分布和模型是否学习绕过 guard。
OpenReview / 审稿意见吸收
- 公开状态:截至 2026-07-27,本轮检索未发现 GLM-5.2 release blog 对应的官方 OpenReview forum 或公开 reviewer 评分;公开讨论主要来自模型卡、blog、社区转发和第三方榜单收录。
- Venue 判断:当前按 release blog + model card + GitHub/weights 处理,证据强度来自官方发布材料、公开权重、GLM-5 技术报告和 slime / Bebop / IndexCache 等相关文档互相印证。
- 可吸收的外部审稿式问题:IndexShare 的质量损失是否有完整 ablation;critic-based PPO 相对 GRPO / group-wise objective 的收益是否有直接比较;anti-hack guard 的召回、精度、误拦截率和绕过行为是否公开;FrontierSWE/PostTrainBench/SWE-Marathon 的 harness 是否可复现;1M context serving 是否有端到端吞吐和成本表。
- 对本文档的影响:把 GLM-5.2 作为 GLM-5 系列 release 节点、long-horizon coding agent 和 production RL 系统材料引用时价值较高;把 benchmark 排名或单个模块的独立收益当作严格结论时,需要外部复验和更完整 ablation。
本地讨论补充
1. 讨论收敛点
- GLM-5.2 的关键是围绕 1M context 改造 indexer、MTP、serving、RL data shape 和 anti-hack。
- IndexShare / IndexCache 和 DSA 的关系是:DSA 降低主 attention 成本,IndexShare 进一步降低 sparse indexer 成本。
- 若把当前解码步
、第 层的 DSA 选择集合写成 ,IndexShare 让后续三层复用 anchor layer 算出的 top- positions,并在各层读取自己的 KV。它沿网络深度轴减少 indexer forward。FlashMemory 沿解码时间轴预测未来窗口需要驻留的历史 KV chunks,主要管理 HBM residency 与 CPU--GPU 预取。 - IndexCache 的 30.0B uniform 1/4 training-free 结果会显著掉点,searched 1/4 与 training-aware 1/4 可以接近 DSA baseline。GLM-5.2 固定 FSSS 说明模型在训练阶段已经适应该 pattern;具体是否使用 multi-layer KL 仍未披露。
- MTP/KVShare 的核心是降低 draft path 和 target path 的不一致,让 speculative decoding 的 acceptance length 上升;它补的是 GLM-5 parameter-sharing MTP 无法自然解决的 KV/activation path 问题。
- 长轨迹 compaction 改变了 RL 样本结构,使 critic-based PPO 比固定 group structure 更自然。
2. DSA 复杂度的直观含义
- Prefill 时共有
个 query。第 个 query 的 indexer 要给此前约 个位置打分,因此候选打分总数约为 。sparse core attention 只对每个 query 选出的 个位置执行完整 attention,总量为 。 - Decode 时只有当前新 token 这一个 query。indexer 仍需扫描
个历史位置,量级为 ;core attention 只处理 top- ,量级为 。若每个 sparse layer 都重新选择,模型深度为 时两项分别累积为 与 。 - 以
、 为例,单层单个 decode step 的 indexer 要比较约 100 万个候选,core attention 读取 2048 个候选。Prefill 的因果候选对约为 ,被选中进入 core attention 的位置对约为 。 - 这些数字比较的是位置对数量。indexer 使用较低维表示,每个候选的打分通常比完整 attention 轻;top-
选择、内存访问和 kernel 实现也影响真实延迟。因此 与 用来解释扩展趋势,端到端耗时仍需实测。 - GLM-5.2 的 FSSS IndexShare 让每四层只有 anchor layer 扫描全历史,后三层复用它的 top-
位置,因而把 selector 的常数成本降到原来的约四分之一;复杂度对 的阶数保持不变,各层 sparse core attention 与各自 KV 读取仍继续执行。 - IndexShare 同时覆盖 prefill 与普通自回归 decode,因为共享轴是网络层深度。Prefill 中,anchor layer 为 prompt 内全部 query 生成 top-
position tensor,后三层复用;decode 中,每个新 token 都由 anchor layers 针对当前长度的历史刷新 top- ,随后 Shared layers 复用。若 Full 层比例为 ,selector 的 prefill 与单步 decode 量级分别由 、 变为 、 。GLM-5.2 还把共享扩展到 MTP iterations,让第一步 draft 的 indices 服务后续 draft steps;这是普通 backbone 跨层复用之外的额外路径。
3. DSA 与 IndexShare 的组合数据流
- DSA 即 DeepSeek Sparse Attention。每个 sparse layer 先用低维、少量 head 的 lightning indexer 为当前 query 与全部 causal positions 计算相关性分数,selector 取出 top-
position IDs;随后该层的 sparse core attention 只在这些位置上读取本层 K/V、重新计算 attention score、softmax 和 value aggregation。 - 更精确的 layer forward 包含两条并行投影路径。Indexer 用独立的轻量
和 per-layer index-key cache 为历史位置打分;MLA 路径把 hidden states 投影为 compressed latent KV 与独立 RoPE 分支。两条路径在 top- position IDs 处汇合:positions 决定本层 MLA core attention 读取哪些 KV entries,indexer 本身不直接生成或承载 MLA KV。 - “按 indices 取得 compressed KV 后执行 MLA”适合作为架构级简写。具体张量形态取决于执行模式:GLM-5 报告把 decode 描述为 576 维 latent KV 路径;通用 Transformers eager / SDPA 参考实现先通过
kv_b_proj展开 head-specific K/V,再用 top-mask 限制可见集合;高性能 sparse / FlashMLA kernel 可以直接消费 indices 并融合 selected-KV 计算。三条路径保持同一逻辑语义,显存布局与实际 FLOPs 需要按 runtime 分开核算。 - 纯 head tensor parallel 下,展开后的 K/V 带有 head 维,可以按 TP rank 分配 local heads;MLA compressed latent 没有 head 维,常见 absorbed decode 实现会在每个 TP rank 复制完整 latent KV 与 RoPE cache,使各 rank 的 local query heads 都能直接访问完整 latent。若 TP degree 为
,每 token、每 layer、每 rank 的展开缓存元素数约为 ,replicated MLA 缓存约为 ,因此相对压缩倍数为
- GLM-5.2 配置为
、 、 、 、 ,所以 :TP8、TP16、TP32 下每 rank 的 MLA core cache 分别约比展开 K/V 小 、 、 。TP 增大会逐步削弱 replicated latent 的相对显存收益;纯 head-TP 接近 TP64 时,该比较已接近盈亏点。Context parallel 或专门的 sequence-sharded KV 方案可以沿 token 轴分摊 latent cache,同时引入 KV 交换通信。该估算只覆盖 MLA core cache;DSA index-key cache 需要另行计入,IndexShare 主要减少 selector 计算次数,不直接按四层压缩 MLA KV footprint。 - 标准 DSA 在每层都生成自己的集合
。GLM-5.2 的 FSSS IndexShare 把四层组成一组:Full anchor layer 计算 ,随后三个 Shared layers 继承同一组 position IDs。Shared layers 仍使用各自的 query projection、KV cache、attention parameters 和输出,因此跨层流动的对象只有 top- positions。 - 两个机制作用于不同维度:DSA 沿序列轴把 core attention 的候选从
压到 ;IndexShare 沿层深轴把 selector 执行比例从 压到 。令 和 分别表示 indexer 与 core attention 处理一个位置对的成本,prefill 可写为
- GLM-5.2 的固定 FSSS 对应
;decode 中把上式的 、 分别替换成 、 。IndexShare 降低 indexer dot product 与 top- 调用次数,各层 KV-cache footprint 和 sparse core attention 继续保留。 - 组合成立依赖相邻层选中位置高度重叠,以及 anchor indexer 能兼顾后续 Shared layers。GLM-5.2 从 128K mid-training 阶段引入固定 FSSS 以适应该结构;官方材料尚未披露具体 indexer distillation loss。
4. GLM-5.2 的 MLA TP 部署边界
- GLM-5.2 的
说明 TP8 仍有约 的 core cache 元素数优势;TP degree 继续上升时,每 rank 的相对收益逐步下降。IndexShare 减少 selector 次数,DSA top- 减少活跃 KV 读取,两者均不直接减少每层完整 MLA 历史 cache。 - GLM-5.2 的生产配置需要同时统计 MLA latent、decoupled RoPE key、DSA index-key、MTP/KVShare state 与 allocator 开销。高并发 decode 可优先评估 DP Attention + DeepEP + FP8 KV;单请求超长上下文评估 DCP/CP;Prefill 与 Decode 的最优拓扑差异较大时使用 P/D;HBM residency 仍不足时再叠加 HiCache/HiSparse。
5. 修正后的理解
- GLM-5.2 是 2602.15763 的后续 release 节点。它继承报告中的 744.0B/40.0B(A40B)MoE、DSA、MTP 和 slime,并把重点推到 1M coding agent;公开 BF16 checkpoint 的存储参数量为 753.3B。
- slime 在 GLM-5.2 里承担 rollout,同时承接 parallel OPD、compact trajectory、sub-agent workflow 和 serving 配置复用。
- reward hacking 在 coding agent 中已经从研究风险变成 release blog 中需要正面处理的 production training issue。
6. 后续复验指标
- 1M context 下的 prefill throughput、decode throughput、KV cache occupancy、cache transfer overhead、CPU scheduling bubbles。
- MTP acceptance length 在不同任务、context length、draft steps 和 serving engine 下的稳定性。
- compaction 后的 sub-trace 数量分布、长度分布、critic variance、token-level advantage calibration。
- anti-hack guard 的召回、精度、误拦截率、rollout continuation success、模型是否学会转向更隐蔽路径。
- coding benchmark 的 effort level、max token、tool access、internet access、judge model 和 harness 差异。
主要启发
- 1M context 的真实工程门槛包括 position extrapolation、sparse attention indexer、KV cache、serving scheduler、tool trajectory 和训练目标。
- Sparse attention 的下一步瓶颈会落到“谁来选 top-k”上。IndexShare/IndexCache 把跨层 redundancy 变成生产优化点。
- Speculative decoding 的 draft model 训练要关注路径一致性;MTP 的 hidden state / KV 来源会直接影响 acceptance。
- Agentic RL 框架需要把 compact trajectory、sub-agent workflow、black-box rollout、white-box rollout、OPD 和 production serving 串起来。
- 防 reward hacking 需要进入 rollout 在线路径;只靠训练前数据清洗或训练后评测很难保护长期 agent 训练信号。
局限
- 博文没有公开完整训练数据、RL reward、critic training、compaction implementation 和 anti-hack classifier 细节。
- IndexShare 的 production 配置确认每四层复用一次 selection result,缺少 exact indexer training loss、质量消融和端到端 memory / latency accounting。
- MTP ablation 使用 GLM-5.1 backbone / data,不完全等同 GLM-5.2 最终模型。
- long-horizon coding benchmarks 仍依赖大量 harness 细节和外部 judge;跨模型比较需要统一运行环境。
- anti-hack 防御可能引入新的 distribution shift:dummy observation、被拦截后的恢复策略、误拦截都可能影响策略学习。
- GLM-5 Table 10 对 744.0B 的脚注与 GLM-5.2 checkpoint 的 753.3B 存储参数量无法直接对齐;报告正文的 80 层也未与 Table 10 和 checkpoint 的 78 个 target blocks 加 1 个 MTP block 对齐。公开资料尚未解释 MTP 参数共享、发布权重打包和论文统计口径之间的精确映射。
跨论文关系
- 与 2602.15763:GLM-5.2 是 GLM-5 系列后续 release,沿用报告中的 744.0B/40.0B(A40B)、DSA、MTP、slime 和 agentic engineering 方向,并把 context 从 200K 推到 1M;当前 BF16 checkpoint 含 753.3B 个存储参数。
- 与 IndexCache:IndexCache 给出 Full / Shared 执行结构、training-free loss search 与 training-aware multi-layer distillation;GLM-5.2 将跨层 top-
reuse 固化为 index_topk_freq=4的 FSSS IndexShare,并扩展到 MTP iteration。公开资料没有确认 GLM-5.2 的 exact index loss。 - 与 SGLang PR #29421:该实现为 GLM-5.2 的 DSA Prefill CP 增加 cache layer split,在 CP=4、8192 tokens 下把 per-rank KV/indexer cache 从 0.77 GB 降到 0.20 GB,并让 PD decode 从全部 owner ranks 拉取对应 layer ranges;这一区分同时展示 TTFT compute parallelism 与 KV ownership 的容量作用。
- 与 slime 官方仓库:GLM-5.2 博文是 slime 支撑 GLM-5.2 的直接应用证据,覆盖 compact trajectory、sub-agent workflow、parallel OPD、KV-cache FP8 和 training-serving 配置复用。
- 与 2606.12370:GLM-5.2 的 MTP 明确受 Bebop 启发,引入 rejection sampling 和 end-to-end TV loss,提高 speculative decoding acceptance。
- 与 2605.14220 和 2025-09-10:MTP 的训练-推理路径一致性、DSA indexer reuse、rollout logprob consistency 都属于 train/inference consistency 的系统问题。
- 与 2511.14617:Seer 优化同步 rollout tail;GLM-5.2/slime 路线处理 compaction、异步/多形态 rollout 和 production serving 复用。两者共同说明 agentic RL 的主要成本在 rollout 和 serving。
- 与 2026-04-24:两者都是 1M context 级系统节点。DeepSeek-V4 强调 CSA/HCA、mHC、OPD 和 deterministic kernels;GLM-5.2 强调 DSA + IndexShare、MTP/KVShare、slime 和 coding agent long-horizon。
- 与 2506.19248、2510.20270、2503.11926:GLM-5.2 把 coding agent reward hacking 明确纳入 release-level 防御,提供了 online guard 的 production 视角。
- 与 2506.13585:两者都围绕 long-context / long-output agentic tasks 做系统优化。MiniMax-M1 使用 Lightning Attention 和 CISPO;GLM-5.2 使用 DSA + IndexShare、MTP/KVShare、PPO + compaction 和 slime。
- 与 2607.07508 SAO:SAO 摘要声明该方法已用于约 750.0B total / 40.0B active 的 GLM-5.2 agentic RL pipeline,并补充 release blog 未展开的 single-rollout、rollout-logprob 双侧 token mask、faster critic update、frozen-attention value model 与 skip-observation GAE。SAO 的公开消融使用 Qwen3-30B-A3B,尚未披露这些配置映射到 GLM-5.2 的 scale-up 细节。
- 与 CompactionRL:CompactionRL 同样声明进入 GLM-5.2 RL pipeline,并补充 release blog 中 compact trajectory 的训练语义:shared actor 生成 summary、最近两轮参与 context reconstruction、独立 critic、全 batch token normalization 和跨 segment GAE。公开消融只覆盖 GLM-4.7-Flash 与 GLM-4.5-Air-SFT,约 750.0B total / 40.0B active 模型上的 compaction threshold、critic topology、训练成本和实际增益仍未披露。
Reference Intake Brief
Target
- Intended target system: 维护 GLM-5.2 技术博客笔记,同步索引行和 GLM / slime / long-horizon agentic RL 关系章节。
- Existing related assets: 2602.15763;IndexCache;2606.12370;2026-04-24。
- Proposed form: 维护
2026-06-16-glm-5-2-long-horizon-tasks.md;同步索引行和对应论文的关系章节。
Reusable Elements
- GLM-5.2 release surface:1M context、报告口径 744.0B/40.0B(A40B)、BF16 checkpoint 753.3B、MIT license、BF16/FP8、SGLang/vLLM/Transformers/KTransformers。
- Architecture chain:DSA -> IndexShare / IndexCache -> MTP IndexShare + KVShare -> rejection sampling -> TV loss。
- RL chain:slime -> compact trajectory / sub-agent workflow -> parallel OPD -> critic-based PPO -> token-level loss。
- Safety chain:coding reward hacking -> rule filter + LLM judge -> online guard -> dummy observation -> rollout continuation。
Risks
- Copyright/over-copying: 本笔记用概括、表格重组和技术解释,没有复制大段原文。
- Unsourced or unverifiable claims: benchmark 和 release 信息来自官方 blog/model card/GitHub;机制关系标注为本地分析。
- Tone/brand mismatch: 保持论文目录技术分析风格,避免宣传式表述。
- Safety/compliance issues: 只保留 reward hacking 风险类别和防御设计,不记录可执行绕过步骤。
- Overlap with existing assets: 与 GLM-5 和 slime 有强重叠,本笔记定位为 GLM-5.2 release follow-up。
Skipped
| Material | Reason |
|---|---|
| 博文中的具体 hacking 命令示例 | 双用途细节,归档中保留风险类别和防御机制即可 |
| 完整图片截图与可视化曲线 | 官方图表未以数据表形式完全公开;本笔记记录文本和表格中可抽取结果 |
Recommendation
Decision: maintain
Why: GLM-5.2 是 GLM-5 / slime / long-horizon agentic RL 线的关键后续节点,补充了 1M context、IndexShare、MTP/KVShare、compaction PPO 和 online anti-hack 这些此前本地档案尚未完整覆盖的 production 设计。