2506.13585-minimax-m1-cispo-lightning-attention
MiniMax M1: Scaling Test Time Compute Efficiently with Lightning Attention
MiniMax-M1 把 test-time compute scaling 的瓶颈拆成三层来处理:用 Lightning Attention + MoE (Mixture-of-Experts,混合专家模型) 降低长输出推理和 RL (Reinforcement Learning,强化学习) rollout 的计算成本,用 CISPO (Clipped IS-weight Policy Optimization,截断重要性采样权重的策略优化) 保留高 importance-ratio token 的梯度贡献并截断权重控制方差,再用 40K 到 80K 的 staged RL 和多样化 verifiable / model-based reward 数据把长思考能力推到现实软件工程、tool-use 和 long-context 场景;它的价值在于提供了一个长输出 reasoning model 的系统级 recipe,CISPO 结论需要在更多模型、更多 reward 设置和公开训练实现中复验。
Source
- Title: MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention
- arXiv: https://arxiv.org/abs/2506.13585
- HTML: https://arxiv.org/html/2506.13585v1
- PDF: https://arxiv.org/pdf/2506.13585
- TeX Source: https://arxiv.org/e-print/2506.13585
- Code/Project: https://github.com/MiniMax-AI/MiniMax-M1
- OpenReview/DBLP record: https://openreview.net/revisions?id=VQURGnAl8g
- Authors: MiniMax; arXiv title页显示 Aili Chen and 125 other authors,Appendix Contributors 按字母序列出完整贡献者。
- Submitted: 2025-06-16
- Current version read: v1, submitted 2025-06-16
- arXiv DOI: https://doi.org/10.48550/arXiv.2506.13585
- Subjects: Computation and Language (cs.CL); Machine Learning (cs.LG)
作者与关系
- MiniMax: MiniMax.
- Appendix Contributors: Aili Chen, Aonian Li, Bangwei Gong, Binyang Jiang, Bo Fei, Bo Yang, Boji Shan, Changqing Yu, Chao Wang, Cheng Zhu, Chengjun Xiao, Chengyu Du, Chi Zhang, Chu Qiao, Chunhao Zhang, Chunhui Du, Congchao Guo, Da Chen, Deming Ding, Dianjun Sun, Dong Li, Enwei Jiao, Haigang Zhou, Haimo Zhang, Han Ding, Haohai Sun, Haoyu Feng, Huaiguang Cai, Haichao Zhu, Jian Sun, Jiaqi Zhuang, Jiaren Cai, Jiayuan Song, Jin Zhu, Jingyang Li, Jinhao Tian, Jinli Liu, Junhao Xu, Junjie Yan, Junteng Liu, Junxian He, Kaiyi Feng, Ke Yang, Kecheng Xiao, Le Han, Leyang Wang, Lianfei Yu, Liheng Feng, Lin Li, Lin Zheng, Linge Du, Lingyu Yang, Lunbin Zeng, Minghui Yu, Mingliang Tao, Mingyuan Chi, Mozhi Zhang, Mujie Lin, Nan Hu, Nongyu Di, Peng Gao, Pengfei Li, Pengyu Zhao, Qibing Ren, Qidi Xu, Qile Li, Qin Wang, Rong Tian, Ruitao Leng, Shaoxiang Chen, Shaoyu Chen, Shengmin Shi, Shitong Weng, Shuchang Guan, Shuqi Yu, Sichen Li, Songquan Zhu, Tengfei Li, Tianchi Cai, Tianrun Liang, Weiyu Cheng, Weize Kong, Wenkai Li, Xiancai Chen, Xiangjun Song, Xiao Luo, Xiao Su, Xiaobo Li, Xiaodong Han, Xinzhu Hou, Xuan Lu, Xun Zou, Xuyang Shen, Yan Gong, Yan Ma, Yang Wang, Yiqi Shi, Yiran Zhong, Yonghong Duan, Yongxiang Fu, Yongyi Hu, Yu Gao, Yuanxiang Fan, Yufeng Yang, Yuhao Li, Yulin Hu, Yunan Huang, Yunji Li, Yunzhi Xu, Yuxin Mao, Yuxuan Shi, Yuze Wenren, Zehan Li, Zelin Li, Zhanxu Tian, Zhengmao Zhu, Zhenhua Fan, Zhenzhen Wu, Zhichao Xu, Zhihang Yu, Zhiheng Lyu, Zhuo Jiang, Zibo Gao, Zijia Wu, Zijian Song, Zijun Sun。
阅读目标与判断边界
本笔记关注:
- MiniMax-M1 的模型架构、上下文长度和 test-time compute scaling 主张。
- CISPO 如何改变 PPO/GRPO/DAPO 中 token clipping 的训练信号。
- 论文如何处理 Lightning Attention hybrid architecture 下的 RL training instability。
- 40K 到 80K long thinking RL 的数据、长度扩展和稳定性 recipe。
- 本文和 DAPO、DeepSeek-R1、TIM/VeXact、tool-use RL、reward hacking 论文的关系。
判断边界:
- 本文是 MiniMax 技术报告 v1,许多工程细节以高层描述为主,缺少完整训练代码、超参表和消融矩阵。
- CISPO 的核心对比实验在 Qwen2.5-32B-base + AIME 2024 + DAPO math dataset 上完成;完整 MiniMax-M1 训练中的算法贡献、架构贡献和数据贡献没有完全拆开。
- Benchmark 比较覆盖广,但不同模型的 prompt、scaffold、sampling、tool-use policy 和 eval infra 可能存在差异。特别是 SWE-bench 与 TAU-bench 的评测设置需要按实现细节理解。
- 论文明确报告了 GenRM 长度偏置和 precision mismatch 等工程问题,这些内容对本地 archive 很有价值,但许多修复策略仍依赖内部指标和未公开实现。
术语预备
- IS (Importance Sampling,重要性采样):用采样分布和目标分布的概率比值修正梯度估计。本文 CISPO 中的 token-level ratio 是 current policy 相对 old policy 的比值。
- PPO (Proximal Policy Optimization,近端策略优化):通过 clipped surrogate 控制 policy update 幅度的经典 RL 算法。
- GRPO (Group Relative Policy Optimization,组相对策略优化):DeepSeek-R1/R1-Zero 语境中常用的 critic-free 变体,用同一 prompt 下多条 rollout 的组内 reward 归一化构造 advantage。
- DAPO (Decoupled Clip and Dynamic sAmpling Policy Optimization,解耦裁剪与动态采样策略优化):在 GRPO 类训练中加入 Clip-Higher、Dynamic Sampling、token-level loss 和 overlong reward shaping 的开源 long-CoT RL recipe,已存档为 2503.14476。
sg(stop-gradient,停止梯度):前向计算保留数值,反向传播时把该项当作常数。CISPO 中的表示 clipped IS weight 只作为梯度系数使用,梯度流向后面的 ,不再通过 或内部的 ratio / clip branch 反传。 - GenRM (Generative Reward Model,生成式奖励模型):用模型判断 response 质量或比较候选答案的 reward model,在本文中用于 hard-to-verify 和 no-ground-truth 任务。
论文脉络
1. 研究问题、背景和价值
大推理模型的性能正在沿 test-time compute 维度扩展:生成更长的 CoT、搜索更长的解决路径、在 tool-use 或软件工程任务中执行更多轮交互。传统 Transformer 的 softmax attention 在长输出上有明显二次复杂度压力,RL 训练还要多次 rollout、打 reward、重算 logprob 和做 policy update,因此长输出 reasoning RL 的成本很快升高。
MiniMax-M1 的切入点是:如果模型架构天然支持长上下文和长生成,RL rollout 成本会下降;如果 RL objective 能避免把关键低概率 token 的梯度过早剪掉,long-CoT 行为更容易被强化;如果数据 curriculum 同时覆盖可验证任务和真实工具/软件环境,长思考能力可以转化到更现实的 agent 场景。
这个问题的价值在于,它把 reasoning scaling 从“模型能写更长”推进到“长输出是否能被经济地采样、训练、验证和部署”。MiniMax-M1 的报告同时给出架构效率、objective 设计、reward 数据和工程稳定性,因此适合作为 long-output reasoning RL 系统路线的一个综合节点。
2. 已有解决方案与不足
在 MiniMax-M1 之前,已有工作分别处理了这条链路中的部分问题:
- DeepSeek-R1 展示 GRPO 与 verifiable reward 能激发 long-CoT,但报告级细节有限,模型仍主要沿传统 attention 路线承受长输出成本。
- DAPO 把 GRPO 类训练开源化,加入 Dynamic Sampling、Token-level Policy Gradient Loss、Clip-Higher 和 Overlong Reward Shaping。它缓解 entropy collapse、无效 prompt group 和 overlong 噪声,但 token-level clipping 仍可能让高 ratio 的正向 reflection token 失去梯度。
- Lightning Attention 证明 linear / recurrent attention 路线可以降低长序列成本,但上游论文主要回答 attention kernel 与长上下文效率,尚未把它放进 40K/80K 输出预算的 reasoning RL 闭环。
- TIM/VeXact 指出 rollout/trainer logprob mismatch 会破坏 RL,但它们更关注分布和实现一致性本身;MiniMax-M1 提供了 hybrid attention + LM head precision mismatch 的具体系统案例。
因此,MiniMax-M1 的增量在于把这些局部路线合并到一个大模型训练报告里:架构上降低长输出 FLOPs,算法上把 clipping 从 token update 改到 IS weight,数据上混合 rule-based reward、execution reward 和 model-based feedback,工程上记录 precision mismatch、optimizer sensitivity、重复截断和 length curriculum。
3. 作者可能的思考路径
从作者视角看,问题可能按以下顺序收敛:
- Long-CoT 的收益依赖更长输出和更多 rollout,但 softmax attention 让 40K/80K 输出训练成本很高。MiniMax 已有 MiniMax-Text-01 / Lightning Attention / MoE 底座,因此先选择一条能支撑 1M input 和长输出的 hybrid architecture。
- 仅降低 rollout 成本仍不足够,RL objective 还会决定哪些 token 真正被强化。DAPO 的 Clip-Higher 已经说明 upper clip 对 low-prob reasoning token 很重要,进一步观察会发现
Wait、Recheck、However这类 reflection token 常位于高 ratio 区域。 - 如果继续沿 PPO/GRPO 的 clipped surrogate,advantage 有利方向越界的 token 会进入常数区间;这些 token 在长思考中可能承担路径切换、错误修正和重新规划功能。于是作者把 clip 的对象从 update surrogate 改到 detached IS weight,让 token 的 score-function 梯度继续存在。
- Hybrid architecture 进入 RL 后会暴露训练/推理概率不一致、optimizer 超参、长输出重复和窗口扩展不稳定等工程问题。作者把这些问题作为 recipe 的一部分记录,形成“架构效率 + CISPO + reward/data curriculum + stability fixes”的完整系统路径。
4. 核心假设或切入点
核心假设是:long-output reasoning RL 的瓶颈来自架构成本、objective 学习信号、reward/data 质量和训练稳定性四个耦合层。MiniMax-M1 的策略是用 hybrid Lightning Attention + MoE 降低长输出 rollout 成本,用 CISPO 保留高 ratio reflection / fork token 的梯度,用 staged length curriculum 和 reward 校准控制长输出副作用,再用 software engineering、tool-use 和 long-context 任务验证这条路线的系统收益。
这也是 MiniMax-M1 相对单纯 GRPO/DAPO recipe 的主要切入点:它把 long-CoT RL 的问题从 policy loss 扩展成可采样、可训练、可验证、可部署的整体闭环。
5. 模型与训练准备
MiniMax-M1 基于 MiniMax-Text-01。模型规模为 456B total parameters、45.9B active parameters per token、32 experts。架构采用 hybrid MoE + Lightning Attention:每 7 个 Lightning Attention / TransNormer blocks 后接 1 个 softmax attention block。作者称这种结构让模型能原生支持 1M input context,并把 MiniMax-M1-80k 的最大输出预算扩展到 80K tokens。
训练前置阶段包括:
| 阶段 | 配置 | 目标 / 边界 |
|---|---|---|
| Continual pretraining | 在 MiniMax-Text-01 上继续训练 7.5T tokens;STEM、code、book、reasoning-related data 占比提升到 70%;2.5T tokens constant LR 8e-5,随后 5T tokens decay 到 8e-6 | 提升 reasoning 和 long-context 能力 |
| Long context extension | 四阶段平滑扩展,把训练 context 从 32K 推到 1M | 避免过快扩展引发 gradient explosion |
| SFT | math、coding、STEM、writing、QA、multi-turn chat;math 和 coding 约占 60% | 注入 reflection-style CoT 行为 |
| 未披露项 | 训练 GPU 数、硬件型号、并行方式、wall-clock、GPU hours、美元成本 | 报告更关注 recipe 与 benchmark,不提供完整成本账本 |
6. CISPO 的核心方法
PPO / GRPO / DAPO 使用 old policy 采样,再用 current policy 做多步 mini-batch update。它们的 token-level importance ratio 是:
PPO / GRPO 的 clipped surrogate 会在某些 advantage 和 ratio 组合下让 token loss 进入常数区间,导致该 token 后续不再提供有效梯度。DAPO 通过 Clip-Higher 放宽 upper clip,但仍保留 clipped surrogate 的 token update 语义。作者发现,在 long-CoT reasoning 中,However、Recheck、Wait、Aha 这类 reflection / fork token 往往在 base model 下概率低,update 后 ratio 高,容易在第一轮 on-policy update 后被 clipping 排除。作者认为这些 token 对 entropy stabilization 和 long-CoT scaling 很关键,因此 token clipping 会削弱 RL 对反思路径的学习。
CISPO 使用 REINFORCE-style objective,并把 clipping 从 token update 转移到 IS weight 上。其目标函数为:
其中 group-relative advantage 沿用 GRPO:
clipped IS weight 为:
论文实验中没有实际设置下界,只调
如果去掉
作者还给出一个统一形式,引入 token mask
PPO trust region 可被视作一种隐式 token mask:当 positive-advantage token 的 ratio 太高,或 negative-advantage token 的 ratio 太低时,相关 token 梯度会被丢掉,相当于在这些越界方向上让
从实现路径看,CISPO 相对朴素 GRPO/DAPO 改了两个关键位置:
- 朴素 clipped surrogate 直接对
和 clipped branch 取较小项,边界外可能变成常数;CISPO 通过 把 detach 后作为权重,梯度仍来自 。 - 朴素 token clipping 的稳定性来自“越界后停掉有利方向更新”;CISPO 的稳定性来自“每个 token 都更新,但权重被截断”。这个选择让它更依赖 reward 质量、KL/ratio 监控、length bias 控制和训练步幅。
7. Lightning Attention 下的 RL 稳定性问题
作者报告了几个重要工程问题:
- Training/inference precision mismatch:rollout token 在 training-mode code 和 inference-mode code 下概率不一致,导致 RL reward 不增长。层级分析显示 LM head 的 high-magnitude activations 是主要误差源。将 LM output head 提升为 FP32 后,train/inference probability correlation 从约
0.9x提升到0.99x,并在训练中保持稳定。 - AdamW 超参敏感:使用 VeRL 默认 betas
(0.9, 0.999)和 eps1e-8可能 non-converge。MiniMax-M1 梯度跨度从1e-18到1e-5,大部分小于1e-14,相邻迭代梯度相关性弱。作者设定、 、 eps=1e-15。 - Repetition early truncation:复杂 prompt 可能诱导极长重复输出,带来大梯度和吞吐浪费。作者用 token probability heuristic:若连续 3000 个 token 的概率都高于 0.99,则提前停止生成。
这些细节让本文和 2605.14220 强相关。M1 的 precision mismatch 是一个具体的 rollout/trainer probability mismatch 案例;它发生在 hybrid attention / LM head precision 组合上,最终通过 FP32 LM head 对齐概率。
8. RL 数据和奖励设计
MiniMax-M1 的 RL 数据覆盖 verifiable tasks 和 general-domain tasks。
可规则验证部分:
- Math:从公开来源和竞赛题中清洗,去除 SFT overlap 和 benchmark contamination,过滤多子问题、证明题、二元题,将选择题改成 open-ended。用 strong reasoning model 的 pass@10 过滤,只保留 pass rate 在 0 到 0.9 之间的题,最终接近 50K math samples。
- Logic:使用 SynLogic 生成 41 类 logic tasks,包含 cipher、Sudoku 等。用强模型 pass@10 设置难度上界,用 MiniMax-Text-01 的 pass range 设置下界,约 53K samples。
- Competitive programming:从 online judge 和 coding websites 收集,缺少 tests 的问题由 MiniMax-Text-01 生成测试套件,最终 30K samples。
- Software engineering:基于 GitHub issue / PR 构建 containerized sandbox,执行 bug localization、code repair、test generation,pass/fail 作为 reward,最终 several thousand high-quality samples。
模型奖励部分:
- Ground-truth but hard-to-verify tasks:用 GenRM 判断 response 与 reference answer 的一致性,采用 five-grade reward scale,并用 human-annotated reward benchmark 与 BoN/pass@N gap 校准。
- No-ground-truth tasks:用 pairwise comparison,对候选答案给出
-1/0/1,并通过 multiple-blind consistent judgment、position-switched consistent judgment 和 Swiss Round selection 选择 reference answer。
作者明确发现 GenRM 对长 CoT 存在 length bias:reward model 会偏好更长输出,可能诱导 verbosity reward hacking。应对策略包括在线监控长度偏置、触发 GenRM recalibration、reward shaping、value clipping 和 normalization。
9. 40K 到 80K 的 long thinking 扩展
第一轮 RL 最大输出 40K tokens。之后作者用 40K 模型筛数据,移除容易样本,增加难 math/coding 数据,并下采样合成 reasoning 数据,因为它在长上下文 RL 中容易导致重复和同质化。
长度扩展采用 staged window expansion:
40K -> 48K -> 56K -> 64K -> 72K -> 80K
进入下一阶段的经验信号包括 generated sequence perplexity 收敛,以及 output length 的 p99 是否接近当前窗口上限。
后期训练不稳定的核心现象是 pattern collapse:生成后段变成不连贯文本,perplexity 升高。作者的解释是,扩展输出长度时,negative samples 比 positive samples 更快变长,常常先达到窗口上限,于是后段累积过大的 negative gradients。作者使用三类修复:
- 重复模式检测 + early stopping。
- combined sample-level loss 和 token-level normalization。
- 降低 gradient clipping threshold 和
。
10. 结论链条
论文的主张链条可以概括为:
- 长思考模型需要扩大 test-time compute,但 softmax attention 让长输出成本高。
- MiniMax-M1 用 hybrid Lightning Attention + softmax attention + MoE 支持 1M input 和 80K output,并降低长输出 FLOPs。
- 长输出 RL 中,PPO/GRPO token clipping 会过早移除低概率 reflection/fork token 的梯度贡献。
- CISPO 改为 clipping IS weight,保留所有 token 的 logprob gradient,并用 weight clipping 控制方差。
- Hybrid architecture 的 RL 需要处理 precision mismatch、optimizer sensitivity 和 repetition-induced instability。
- 多样化 RL 数据和 staged length expansion 让模型从 40K 扩展到 80K thinking budget。
- MiniMax-M1 在 long-context、software engineering 和 tool-use 上显示强优势,math/coding competition 上仍落后 DeepSeek-R1-0528、Gemini 2.5 Pro、OpenAI o3 等最强闭源或更新开源模型。
关键实验/定理
结果 1:CISPO 在 Qwen2.5-32B-base zero-RL 上优于 GRPO/DAPO
- 设置:Qwen2.5-32B-base,zero-RL setting,使用 DAPO 论文中的 mathematical reasoning dataset;每个 generation batch 进行 16 rounds off-policy updates。评测使用 AIME 2024。
- Baseline:GRPO 和 DAPO。GRPO 是 clipped surrogate + group-relative advantage 的基础 baseline;DAPO 是更强 baseline,已包含 Dynamic Sampling、Token-level Policy Gradient Loss、Clip-Higher 和 Overlong Reward Shaping。论文图 2 表示三者在同一模型和同一数据上比较,但没有公开完整超参、seed、rollout group size、batch size、max response length、learning rate 和 reward/length penalty 配置,因此 baseline 强度只能按报告文字判断为同数据同模型、但复现细节不足。
- 指标:AIME 2024 accuracy / training steps。
- 结果:CISPO 在相同 step 下优于 GRPO 和 DAPO,并用约 50% training steps 达到 DAPO 相近性能。
- 解读:这是本文最直接的算法消融,支持“token clipping 会浪费 low-prob reflection tokens 的学习信号”。可信边界也很清楚:实验只覆盖 Qwen2.5-32B-base + math data + AIME 2024,且没有跨 reward、跨模型、跨 off-policy update rounds 的表格。
结果 2:Precision mismatch 修复让 hybrid architecture 可以增长 reward
- 设置:MiniMax-M1 hybrid Lightning Attention 架构的 RL 训练。作者逐 token 比较 rollout token 在 training-mode code 与 inference-mode code 下的 probability,并做 layer-level 定位。
- Baseline:修复前的原始训练/推理 kernel 路径作为对照;修复后只将 LM output head 提升到 FP32。论文提到小 dense softmax model 未出现同类问题,但没有给出完整对照表。
- 指标:rolled-out tokens 的 probability correlation。
- 结果:未修复时相关性约
0.9x,reward growth 受阻;LM output head 使用 FP32 后相关性提升到0.99x并稳定。 - 解读:这与 TIM/VeXact 主题直接相连。实现路径中细小的 precision mismatch 会改变 rollout/trainer probability landscape,长输出 RL 对此高度敏感。
结果 3:40K 到 80K thinking budget 提升复杂任务表现
- 设置:先训练 MiniMax-M1-40k,再使用
40K -> 48K -> 56K -> 64K -> 72K -> 80Kstaged window expansion 训练 MiniMax-M1-80k。进入下一阶段参考 generated sequence perplexity 收敛和 output length p99 是否接近当前窗口上限。 - Baseline:MiniMax-M1-40k 是同一训练链路的中间 checkpoint。这个 baseline 对判断 length scaling 很有价值,但 80K 阶段同时改变窗口、数据过滤、难度组合和稳定性 recipe,因此它是系统对照,因果解释应同时纳入这些变量。
- 指标:core benchmark scores 和训练过程中的 response length / accuracy。
- 结果:MiniMax-M1-80k 在多数 benchmarks 上超过 40k;AIME 2024 86.0 vs 83.3,LiveCodeBench 65.0 vs 62.3,LongBench-v2 61.5 vs 61.0;TAU-bench retail 上 40k 为 67.8,高于 80k 的 63.5。
- 解读:更长 thinking budget 通常有收益,但在 tool-use / general tasks 上不保证单调提升。长输出训练也带来 pattern collapse 和 negative-gradient imbalance。
结果 4:MiniMax-M1 在 long-context、software engineering、tool-use 上表现突出
- 设置:temperature 1.0、top-p 0.95;AIME/GPQA 使用 32 samples,coding 使用 16 samples;SWE-bench 使用 Agentless scaffold。
- Baseline:闭源模型包括 OpenAI o3、Gemini 2.5 Pro、Claude 4;开源/开放权重模型包括 DeepSeek-R1-0528、Qwen3-235B 和 DeepSeek-R1 原版。baseline 很强,但评测 harness 存在差异:SWE-bench 使用 Agentless scaffold,TAU-bench 使用 GPT-4.1 user model、general system prompt、max 40 interaction steps;不同模型的系统提示、工具执行环境和采样细节可能不完全一致。
- 指标:AIME、MATH-500、LiveCodeBench、SWE-bench Verified、OpenAI-MRCR、LongBench-v2、TAU-bench、SimpleQA、MultiChallenge。
- 结果:MiniMax-M1-80k 在 SWE-bench Verified 为 56.0,接近 DeepSeek-R1-0528 的 57.6;OpenAI-MRCR 1M 为 56.2,LongBench-v2 为 61.5;TAU-bench airline 为 62.0,retail 为 63.5。AIME 2024 为 86.0,低于 DeepSeek-R1-0528 的 91.4、Gemini 2.5 Pro 的 92.0 和 o3 的 91.6。
- 解读:M1 的优势更集中在长上下文、agentic tool use、软件工程这类现实任务;纯数学/竞赛编程仍有差距。
结果 5:RL scaling 同时增加 accuracy 和 response length
- 设置:跟踪 AIME 2024、AIME 2025、LiveCodeBench v5 训练过程,记录 accuracy 和 average response length 随 RL steps 变化。
- Baseline:主要是训练过程内部曲线,没有独立方法 baseline。它适合说明 MiniMax-M1 训练中 length 与 accuracy 同步增长,不能单独证明“更长输出”是收益来源。
- 指标:accuracy 和 average response length。
- 结果:AIME 和 LiveCodeBench 的平均 response length 超过 20K tokens;AIME 2024 accuracy 从 68% 提升到 80%。
- 解读:本文把 response length growth 作为 test-time compute scaling 的表现之一。这个证据支持 extended thinking 与 accuracy gain 有相关性,但还需要控制 prompt difficulty、data mix、reward 和 length bias。
实验设置与 baseline 审计
| 维度 | 记录 |
|---|---|
| 模型与初始化 | MiniMax-M1 基于 MiniMax-Text-01;456B total / 45.9B active;32 experts;hybrid MoE + Lightning Attention;1M input context;MiniMax-M1-80k 最大输出 80K tokens |
| 数据与任务 | Continual pretraining 7.5T tokens;STEM/code/book/reasoning-related data 占比 70%;SFT 覆盖 math、coding、STEM、writing、QA、multi-turn chat;RL 数据含 ~50K math、~53K logic、30K competitive programming、several thousand software engineering samples |
| RL / 训练配置 | CISPO;第一轮 RL 最大输出 40K,随后 40K -> 48K -> 56K -> 64K -> 72K -> 80K staged window expansion;length penalty、GenRM recalibration、reward shaping、value clipping、normalization、early stopping、token-level normalization |
| 系统配置 | hybrid Lightning Attention + softmax attention;training/inference precision mismatch 通过 FP32 LM output head 修复;AdamW beta1 0.9、beta2 0.95、eps 1e-15;具体集群和并行方式未完整披露 |
| 技术报告训练配置 | 披露 7.5T continual pretraining、四阶段 context extension、40K/80K RL、reward 数据规模和部分 optimizer / stability recipe;缺少完整训练硬件和成本账本 |
| 未披露项 | 训练 GPU 数、硬件型号、并行方式、wall-clock、GPU hours、美元成本、CISPO 主训练完整 batch / rollout width / KL / reward weights |
| 评测协议 | 数学、代码、软件工程、long-context、tool-use;SWE-bench 使用 Agentless scaffold,TAU-bench 使用 GPT-4.1 user model、general system prompt、max 40 interaction steps |
| 统计报告 | 主表多为单点结果,缺少多 seed、置信区间和第三方复验 |
| Baseline 强度 | CISPO vs GRPO/DAPO 是同模型同数据下较强对照;M1 benchmark 覆盖强闭源和开放模型,但 harness / sampling / tool 配置不完全统一 |
| 结论边界 | M1 benchmark 表现来自架构、continued pretraining、SFT、CISPO、reward 数据、length curriculum 和系统稳定性共同作用,不能单独归因于 CISPO |
证据链强度评估
强证据
- 论文给出完整系统链条:continual pretraining、SFT、CISPO、precision mismatch 修复、reward data、40K 到 80K staged RL 和多任务评测。
- CISPO 的目标函数清楚,和 PPO/GRPO token clipping 的差异可以直接从公式看出。
- Precision mismatch 案例非常有价值,说明 long-output RL 中 train/inference probability consistency 是实证问题。
- 长上下文和 tool-use 评测覆盖了传统数学以外的现实 agent 场景,和 M1 架构优势相匹配。
中等强度证据
- CISPO vs DAPO/GRPO 的 controlled ablation 支持算法有效性,但只展示在 Qwen2.5-32B-base + math data + AIME 2024 上。
- 40K 到 80K 的效果显示更长 thinking budget 有收益,但完整训练同时改变 data filtering、length window、stability recipe 和 task mixture。
- GenRM 长度偏置与 online recalibration 很重要,但论文没有给出可复现的 reward-model benchmark 和触发阈值。
需要谨慎的推论
- MiniMax-M1 的 benchmark 表现不能完全归因于 CISPO。架构、continued pretraining、SFT、数据、reward model、sandbox、length curriculum 都同时贡献结果。
- CISPO 保留所有 token 梯度,这可能放大 reward noise 或 spurious reward signal;在 reward model 存在 length bias 时,需要配套监控和 reward shaping。
- Long response length 与 accuracy gain 的相关性不等于单纯让模型写更长就会更强。关键条件包括任务难度、可验证 reward、有效 exploration、repetition control 和 length-bias correction。
- Hybrid attention 的 precision mismatch 修复使用 FP32 LM head,能否覆盖其他 kernel mismatch、MoE routing mismatch、tensor parallel mismatch,需要单独测。
本地讨论补充
1. Lightning Attention 在 MiniMax-M1 中的作用
本地讨论后的收敛:MiniMax-M1 论文中的 Lightning Attention 是架构效率线,CISPO 是 RL objective 效率线。二者共同服务 long-output reasoning RL,但解决的问题不同:Lightning Attention 降低长上下文和长输出 rollout 的计算成本,CISPO 处理 PPO/GRPO token clipping 对 long-CoT 学习信号的影响。
传统 softmax attention 对长度
当 reasoning model 生成 40K、80K 甚至更长输出时,attention FLOPs、KV cache、rollout latency 都会变成 RL 训练瓶颈。RL 里每一步 policy update 前要生成大量 rollout,长输出 attention 成本会直接抬高训练时间。
Lightning Attention 属于 linear attention / TransNormer 系列。它的基本方向是用 kernel trick 改写 attention,让模型避免显式构造完整
这样推理时可以维护一个随时间更新的状态,单步计算不需要回看所有历史 token。理论优势是复杂度从 softmax attention 的 length-quadratic 趋向 length-linear,更适合超长上下文和长输出。
普通 linear attention 在 causal LM 训练里会遇到实际效率问题:为了保持因果性,需要做 prefix cumulative sum / scan;这个操作在 GPU 上未必能充分发挥理论优势。Lightning Attention 的关键工程思路是把 attention 计算拆成块内和块间两部分:块内使用常规 attention-like 计算保留局部精度与并行性,块间使用 linear attention kernel trick 处理长距离累积信息,并用 tiling / IO-aware kernel 降低 HBM 与 SRAM 之间的数据搬运。它的定位类似 FlashAttention 对 softmax attention 的作用:同时改公式并重排数据流,让硬件执行路径符合理论优势。
MiniMax-M1 没有把整个模型都改成 Lightning Attention。它采用 hybrid attention:每 7 个带 Lightning Attention 的 TransNormer blocks 后接 1 个 softmax attention transformer block。这个设计的直觉是:大部分层用 Lightning Attention 降低长序列成本,周期性插入 softmax attention 保留传统 attention 的精确全局交互能力。论文报告 M1 是 456B total parameters、45.9B activated parameters per token、32 experts,支持 1M input context 和 80K output budget。
在 MiniMax-M1 的训练链条里,Lightning Attention 带来三类收益和问题:
- 推理 / rollout 成本:论文称相较 DeepSeek-R1,MiniMax-M1 在 64K generation length 下 FLOPs 少于 50%,在 100K generation length 下约为 25%。这对 RL 很关键,因为 rollout generation 通常是长思考 RL 的主要瓶颈之一。
- 长上下文能力:M1 支持 1M input context,并在 OpenAI-MRCR 1M、LongBench-v2 等 long-context benchmark 上表现较强。
- 训练稳定性:hybrid-lightning architecture 在扩展 context 时更难优化。论文提到 aggressive context extension 会导致 gradient explosion,并将原因归因于早期层和后期层的 decay rate 不同,早期层更偏 local information。作者用四阶段平滑扩展把 training context 从 32K 推到 1M。
Lightning Attention 也引入了和 TIM 相关的系统风险。MiniMax-M1 在 RL 中观察到 training-mode code 与 inference-mode code 对 rollout token 给出的 probability 不一致,reward growth 被阻塞。作者最终定位到 LM head 高幅值激活和 precision mismatch,并通过 FP32 LM output head 把 train/inference probability correlation 从约 0.9x 提升到 0.99x。这说明:架构效率进入 RL 后,数值一致性也会成为一等变量。
因此,MiniMax-M1 的 long-output RL recipe 可以这样理解:
Lightning Attention / hybrid attention
-> lower long-output rollout cost
-> feasible 40K / 80K thinking budget
-> more long-CoT trajectories for RL
-> CISPO keeps high-ratio reflection-token gradients
-> stability recipe handles precision mismatch, repetition, length scaling
需要注意,MiniMax-M1 论文没有公开 Lightning Attention kernel 的全部实现细节,也没有把 pure softmax、pure Lightning、hybrid Lightning 的大规模 ablation 完整展开。因此当前笔记应把它视为系统报告中的架构组件;“Lightning Attention 本身带来全部能力提升”仍需要更直接的因果实验支持。
作者关系澄清:MiniMax-M1 引用的两篇 Lightning Attention 原始论文采用个人作者署名。2401.04658 Lightning Attention-2 和 2405.17381 的作者列表相同,均为 Zhen Qin、Weigao Sun、Dong Li、Xuyang Shen、Weixuan Sun、Yiran Zhong,arXiv 页面显示 Yiran Zhong 为 corresponding author / submitter。MiniMax-M1 是后续把 Lightning Attention 放进 MiniMax-M1 / MiniMax-Text-01 系统中的报告;部分同名作者与 MiniMax 系列报告存在交集线索。按当前题名页证据,这两篇原始 Lightning Attention 论文应记录为个人作者论文,MiniMax 关系应记录为后续系统采用和作者交集线索。
2. CISPO 与 TIS 的关系
CISPO 和 TIS 都涉及 importance ratio clipping,但目标不同。
- CISPO 处理的是 policy update objective 中的 current/old ratio:
。它认为 PPO/GRPO 的 token update clipping 会丢掉低概率 reflection/fork token 的梯度,因此改成 clipped IS weight 乘 REINFORCE-style logprob gradient。 - TIS 在 TIM/rollout correction 语境中通常处理 rollout behavior 与 trainer old policy 的 mismatch。
只是 raw correction ratio; Truncated发生在把它变成受限权重时,例如,或再配合 sequence-level rejection / clipping。目标是把训练解释校回真实采样分布,同时限制 rollout/trainer mismatch outlier。
因此,CISPO 更像是 RL objective design;TIS 更像是 distribution correction / variance control。二者都可能出现在同一系统里,但不能混为一个开关。
3. CISPO 的核心直觉
PPO/GRPO clipping 的副作用是:当一个正 advantage token 的 ratio 很高时,clipped surrogate 会进入常数区间,该 token 对继续提高
更形象地说,PPO/GRPO token clipping 是“这个 token 变化太大,后续少学它”;CISPO 是“这个 token 仍然要学,但这次它的权重最多算到上限”。这也是它在长 response 场景中更有吸引力的原因。
论文里的 CISPO importance ratio 是 token-level ratio:
它对每个 token 单独计算,没有采用 prefix product:
这和 PPO/GRPO 的 token-level surrogate 保持一致,也避免了长 response 中前缀乘积的方差随长度迅速放大。
4. 为什么 CISPO 不沿用 PPO 的 min 形式
PPO / GRPO 的 clipped surrogate 写成:
这个 min 形式的作用是 trust-region constraint:当正 advantage token 的
CISPO 的目标是:
其中:
这里
这正好对应作者对 long-CoT 的判断:低概率 reflection / fork token 很可能在更新后出现高 min 形式会让这些 token 过早失去梯度;CISPO 希望保留它们的学习信号,同时用 clipped IS weight 控制方差。代价是目标引入 bias,并且对 reward quality 更敏感。若 reward model 存在 length bias 或 spurious signal,保留更多 token 梯度也会更充分地强化这些偏差。
5. 为什么不把 PPO 的 min 系数再乘
一个自然变体是先保留 PPO 的 clipped surrogate 系数:
然后改写成 score-function loss:
这个变体看起来像是“原始 PPO clipping + 当前 logprob 梯度”,但它会改变 PPO clipping 的本意。更精确地说,PPO clip 是按 advantage 符号生效的单边 gate。在 maximization 形式下:
- 当
且 时,clipped branch 是常数,继续推高该 token 的梯度为 0;当 仍在上界以内时,未截断分支提供正梯度。 - 当
且 时,clipped branch 是常数,继续压低该 token 的梯度为 0;当 高于下界时,未截断分支提供负梯度,推动 bad token probability 降低。
因此,PPO clip 屏蔽的是“已经在 advantage 有利方向越界后继续扩大贡献”的梯度;对会降低 surrogate contribution、或修正 bad-side ratio 的方向仍然允许梯度通过。乘上
因此,这个变体既没有保留 PPO 在边界外停止更新的语义,也没有 CISPO 那种清晰的 truncated importance sampling 解释。它把 PPO 的 pessimistic branch selection 和 score-function estimator 混在一起,梯度方向由 advantage 符号、ratio 区间和 min 分支共同决定,调参和诊断会更复杂。
如果目标是“边界外仍保留 token 梯度,但控制权重幅度”,直接使用:
就得到 CISPO 的核心形式。它的取舍更明确:放弃 PPO 的 trust-region lower-bound surrogate,采用截断 IS weight 来控制方差,并保留所有 token 的 logprob 梯度。
本地讨论后的补充:CISPO 确实不会主动把 advantage 有利方向上越界的 min 产生的单边 trust-region gate,改用 clipped IS weight 控制所有 token 的梯度幅度。额外的回拉通常来自 KL penalty / KL early stopping、显式 ratio penalty、反向 advantage 样本、较小 learning rate、更少 off-policy update rounds、动态采样和长度/重复惩罚等机制。
因此 CISPO 的风险也很清楚:当 reward 信号可靠、越界 token 是有用 reflection / fork token 时,保留梯度有助于 long-CoT learning;当 reward 存在 length bias、format bias 或 spurious signal 时,CISPO 会更持续地强化这些 token。它用
因此,本地理解可以收敛为:CISPO 里的 clip 主要是限制每个 token 对梯度更新的最大权重范围;PPO 里的 clip 主要是实现一个单边 trust-region surrogate,阻止已经在 advantage 有利方向越界的 token 继续扩大贡献。CISPO 真正驱动更新的是后面的
6. 与 reward hacking 的关系
本文自己报告了 GenRM length bias:reward model 容易偏好更长 CoT,RL policy 会利用这种偏置输出更长但质量未必更高的内容。这和 2506.10947 的 spurious reward、2506.19248 的 inference-time reward hacking 以及 2403.03185 的 proxy reward 语言一致。CISPO 保留更多 token gradient 后,对 reward 质量更敏感,因此需要记录 length bias、reward-model calibration、response-length distribution、accuracy-length correlation 和 reward-length correlation。
7. 后续复验指标
- CISPO 下 clipped IS weight 的分布:p50 / p95 / p99 / max。
- reflection token bucket 的概率变化、clip rate 和 advantage contribution。
- CISPO、DAPO、GRPO 在相同 rollout samples、相同 update rounds、相同 length penalty 下的对比。
- reward-length correlation 与 accuracy-length correlation 的解耦。
- train/inference logprob mismatch、LM head precision、MoE routing flip、kernel backend 差异。
- 40K 到 80K staged RL 中 positive / negative samples 的长度分布和后段 gradient contribution。
OpenReview / 审稿意见吸收
- Venue status: CoRR 2025 / arXiv v1 technical report;OpenReview revision 页存在 DBLP 导入记录,观察日期为 2026-06-24。
- Public reviews: OpenReview API 对
forum=VQURGnAl8g返回replyCount: 0,未发现Official_Review、Author_Response、Meta_Review或Decision。 - Reviewer consensus: 无公开 reviewer 共识可吸收。
- Main criticisms: 无公开 reviewer 质疑可吸收;本地可信度判断主要来自论文自身实验设置、开源仓库、强 baseline 覆盖和缺失消融。
- Author response: 未发现公开 rebuttal。
- 对本文可信度的影响: MiniMax-M1/CISPO 只能按技术报告处理。它的实践参考价值来自 open-weight release、GitHub/project 信息、强 baseline 对照和具体工程经验;算法结论仍需要更多公开复现、跨模型消融、reward 设置消融和统一 harness 评测。
主要启发
- 长思考模型的系统效率来自多层耦合:attention architecture 降低 rollout 成本,RL objective 保留有效 token 梯度,data curriculum 提供可强化轨迹,stability recipe 控制长输出病态行为。
- CISPO 给 DAPO/GRPO 之后的 RLVR recipe 提供了一个重要方向:从“调大 PPO clip upper bound”推进到“保留所有 token 梯度,只截断 IS weight”。
- MiniMax-M1 强化了 TIM/VeXact 方向的重要性。训练和推理概率差异足以阻止 reward growth,尤其在 hybrid attention、MoE 和长输出 RL 中。
- Reward model 在 long-CoT 上的 length bias 是一等风险。长输出能力和长输出偏置很容易纠缠,训练报告需要同时给 response length、reward、accuracy 和 human/verified quality。
- Long-context reasoning model 的价值会更多体现在 software engineering、tool-use、multi-turn agent 和 long-context understanding,而纯数学分数只是其中一部分。
局限
- CISPO 公式和动机清楚,但公开报告中的算法消融范围有限,缺少跨模型、跨 reward、跨 update rounds 的系统表格。
- MiniMax-M1 完整训练包含架构、数据、SFT、RL objective、reward model、sandbox 和 length curriculum,难以从最终 benchmark 分数中单独识别 CISPO 贡献。
- 论文公开了大量工程经验,但没有完整训练代码、reward model、sandbox data 和 monitoring thresholds,复现难度高。
- GenRM length bias 的缓解依赖在线监控和 recalibration,报告中没有给出可移植的触发规则。
- Long-context 和 tool-use benchmark 的比较受 prompt、scaffold、tool policy、sampling 和模型专用系统提示影响,需要用统一 harness 复验。
- MiniMax-M1 在 SimpleQA、GPQA Diamond、AIME 2025、LiveCodeBench 等任务上仍落后最强闭源或 DeepSeek-R1-0528,说明 long-context architecture 和 CISPO 未覆盖全部能力差距。
跨论文关系
- 与 2503.14476 的关系最强。DAPO 提出 Dynamic Sampling、Token-level Policy Gradient Loss、Clip-Higher 和 Overlong Reward Shaping;MiniMax-M1 直接对比 DAPO/GRPO,并沿用 dynamic sampling 与 length penalty,同时提出 CISPO 替代 token clipping。
- 与 2605.14220 主题关系很强。TIM/VeXact 把 rollout/trainer logprob mismatch 定义为 RL stability 风险;MiniMax-M1 报告 hybrid architecture 中 training-mode 和 inference-mode probability mismatch 会阻止 reward growth,并通过 FP32 LM head 修复。
- 与 2501.12948 是 reasoning model 训练路线对照。DeepSeek-R1 展示 GRPO / verifiable reward 激发 long-CoT;MiniMax-M1 在此基础上强调 long-context architecture、CISPO、software engineering sandbox 和 80K output budget。
- 与 2510.01180 和 2505.24864 属于 RL scaling 方向。ProRL/BroRL 讨论延长训练和 broadened exploration;MiniMax-M1 讨论架构效率和 40K 到 80K output-length scaling。
- 与 2606.00135 连接在 agentic tool-use RL。MiniMax-M1 报告 TAU-bench 和 software engineering sandbox;tool-calling RL 论文提醒 harness、schema、history、rollout down-sampling 和 policy-update 成本会影响结论。
- 与 2506.10947 共享 RLVR 训练信号诊断。Spurious Rewards 指出 GRPO clipping 和 model prior 会制造表面提升;MiniMax-M1 认为 PPO/GRPO token clipping 丢失 low-prob reflection token 梯度,并报告 GenRM length bias 的 reward hacking 风险。
- 与 2506.19248 和 2403.03185 共享 reward bias 语言。MiniMax-M1 的 GenRM length bias 是 long-CoT reward model 的具体失真案例。
- 与 2511.02749 和 2405.19888 连接在 long-context / agent serving。MiniMax-M1 让长上下文模型成为 agent foundation;这些 serving 论文讨论 cache locality 与 application-level DAG 如何降低真实部署成本。
- 与 2607.07508 SAO:CISPO 与 SAO 都把 importance ratio 作为 REINFORCE-style logprob gradient 的 token weight。CISPO 对 detached ratio 做 clipping 并保留越界 token 梯度;SAO 将上下界外 token 直接置零,以更强过滤换取异步稳定性。SAO 公式未标记 stop-gradient,公开实现也未提供,因此两者的代码级梯度语义仍需复核。
- 关系状态:本笔记的
跨论文关系已把 MiniMax-M1 连接到 Long-CoT RL Recipe、Training-Inference Mismatch、Agentic Tool-use RL、Reward Hacking 和 Long-context Serving。
Reference Intake Brief
Target
- Intended target system:
content/papers/2506.13585-minimax-m1-cispo-lightning-attention.md论文存档。 - Existing related assets:
content/utility/papers-index.md;2503.14476、2605.14220、2501.12948、2606.00135、2506.10947。 - Proposed form: 维护独立 Markdown 文档,同步索引行和对应论文的关系章节。
Reusable Elements
- CISPO 公式:clipped IS weight + REINFORCE-style logprob gradient + GRPO group-relative advantage。
- CISPO vs PPO/GRPO/DAPO:保留所有 token 梯度,截断权重幅度,避免 low-prob reflection tokens 被 token clipping 排除。
- Long-output RL recipe:40K 到 80K staged expansion、p99 length / generated perplexity 作为扩展信号、pattern collapse 修复。
- TIM case:training/inference probability mismatch 通过 FP32 LM head 对齐。
- Reward hacking case:GenRM length bias 和在线 recalibration。
Risks
- Copyright/over-copying: 本笔记使用转述和公式重写,避免复制长段原文。
- Unsourced or unverifiable claims: 模型规模、训练成本、benchmark 分数来自 arXiv v1 和 GitHub README;CISPO 外推结论标注为本地判断。
- Tone/brand mismatch: 保持本目录技术笔记风格,区分作者主张和本地证据评估。
- Safety/compliance issues: 涉及 software engineering sandbox 和 reward hacking,只保留机制和评测,不沉淀可滥用流程。
- Overlap with existing assets: 与 DAPO、TIM/VeXact、DeepSeek-R1、tool-use RL、reward hacking 论文有强重叠;本文新增价值是 MiniMax-M1 系统级 long-output RL recipe 和 CISPO。
Skipped
| Material | Reason |
|---|---|
| MiniMax-M1 权重和推理代码实现细读 | 当前任务是论文分析;后续可单独阅读 GitHub implementation。 |
| Figure 数值曲线逐点复原 | arXiv 源中图表为 PDF 图片,本文保留 caption 和正文结论。 |
| 所有 126 位 contributor 的机构验证 | 论文未给逐作者 affiliation;当前只记录 MiniMax 组织和完整 contributor list。 |
| 公开 reviewer comments | 已检索标题、arXiv id 和 OpenReview revision/DBLP 记录;OpenReview API 返回 replyCount: 0,未发现 official review / rebuttal / decision。 |
Recommendation
Decision: merge
Why: 这篇论文补齐本地 archive 中 CISPO、Lightning Attention long-output reasoning model、hybrid architecture RL stability、GenRM length-bias reward hacking 和 software-engineering RL sandbox 的关键节点。