2501.12599-kimi-k1-5-scaling-rl-llms
Kimi k1.5: Scaling Reinforcement Learning with LLMs
Kimi k1.5 把 128K 长上下文、long-CoT、verifiable reward、多模态 reasoning、partial rollout、length-aware sampling、long2short 和 Megatron/vLLM/Mooncake 工程栈组合成一套 RL scaling recipe;它的价值在于把 reasoning RL 从单一数学训练扩展到长上下文、多模态、代码与系统协同,证据主要来自团队技术报告和多 benchmark 对比,正式 peer review 与完整训练数据可复验性有限。
Source
- Title: Kimi k1.5: Scaling Reinforcement Learning with LLMs
- arXiv: https://arxiv.org/abs/2501.12599
- HTML: https://arxiv.org/html/2501.12599v4
- PDF: https://arxiv.org/pdf/2501.12599
- TeX Source: https://arxiv.org/e-print/2501.12599
- Code/Project: https://github.com/MoonshotAI/Kimi-k1.5
- OpenReview / Review page: OpenReview revision metadata;记录为 CoRR revision/API metadata,未发现 official public review。
- Authors: Kimi Team and 95 other authors;arXiv submitter: Flood Sung。
- Organization: Kimi Team / Moonshot AI;arXiv lists Kimi Team and 95 named authors.
- Submitted: 2025-01-22
- Current version read: v4, last revised 2025-06-03
- arXiv DOI: https://doi.org/10.48550/arXiv.2501.12599
- Subjects: Artificial Intelligence (cs.AI); Machine Learning (cs.LG)
作者与关系
- Kimi Team / Moonshot AI: 组织级技术报告;appendix 将 Research & Development 与 Data Annotation 分组,并按 first name 字母序排列。
- Flood Sung: XVI Robotics.
- 作者列表:Kimi Team and 95 named authors;报告更接近团队工程复盘,未给逐作者 affiliation。
阅读目标与判断边界
归档关注:
- Kimi k1.5 如何把 RL 作为 LLM post-training 的 scaling axis。
- long-CoT、128K context、partial rollout、long2short 之间的关系。
- k1.5 和 DeepSeek-R1、DAPO、MiniMax-M1、Kimi K2/K2.5、Seer 的位置。
- 实验设置、baseline 强度、奖励统计和系统瓶颈。
判断边界:
- 报告以团队技术复盘为主,缺少公开训练数据、完整超参、seed 和置信区间。
- 闭源 o1 / Gemini / Claude 等 baseline 的 sampling budget、prompt 和版本难以完全对齐。
- long2short、partial rollout、Mooncake 等系统细节足以形成研究线索,外部复现仍需要工程环境和私有数据。
术语预备
RL (Reinforcement Learning,强化学习): 通过 reward signal 更新策略模型。CoT (Chain of Thought,思维链): 模型显式生成中间推理过程。long-CoT: 允许模型生成更长推理轨迹,用 test-time compute 换取复杂任务表现。OMD (Online Mirror Descent,在线镜像下降): 一类在策略分布空间中做局部更新的方法;每轮以当前 policy 为 reference,在 KL geometry 下选择 reward 更高且分布距离受限的新 policy。k1.5 用它表述无 value network 的 policy optimization。GRPO (Group Relative Policy Optimization,组相对策略优化): DeepSeek-R1 使用的 critic-free RL 方法,用同一 prompt 下的 group rewards 标准化 advantage。KL (Kullback-Leibler divergence,KL 散度): 衡量当前策略相对 reference policy 的偏移,用于限制 RL 更新幅度。RM (Reward Model,奖励模型): 对输出或过程给出 reward 的模型。DPO (Direct Preference Optimization,直接偏好优化): 用偏好对直接优化策略的后训练方法。MCTS (Monte Carlo Tree Search,蒙特卡洛树搜索): 显式搜索方法,k1.5 将 long-CoT 视作更轻量的隐式搜索路线。partial rollout: 利用已有 prefix / trajectory 继续展开,减少长序列 RL 中重复生成成本。long2short: 将长 CoT 模型能力压缩到短输出模型的训练流程。
论文脉络
1. 研究问题、背景和价值
DeepSeek-R1 之前,开放社区已经看到 verifiable reward 可以推动数学和代码 reasoning,但长上下文、多模态、代码执行和训练系统成本仍是主要瓶颈。k1.5 关注的问题是:在大模型已经具备一定 base capability 后,RL 是否可以像预训练 scaling 一样,通过更长 context、更高质量 prompt、更稳定 reward 和更强系统栈继续提升 reasoning 能力。
2. 已有解决方案与不足
传统 RLHF 偏短对话偏好优化;PRM/ORM 路线需要过程标签或 outcome verifier;MCTS 类显式搜索成本高;单纯 SFT 很难持续提升复杂推理;短上下文模型无法完整容纳长推理、工具输出或多模态上下文。已有公开 recipe 通常在数据、系统和长上下文上拆开讨论,k1.5 试图把这些因素组合成一条可训练 pipeline。
3. 作者可能的思考路径
站在 k1.5 公开前的背景,作者面对的首要矛盾是:base model 已经有一部分数学、代码和多模态先验,但困难任务的正确轨迹很稀疏;短回答模型很难靠 outcome reward 自己摸到长推理路径;显式搜索又会把计算成本推到不可训练。于是问题会先从“选哪种 RL 算法”转向“怎样让 RL 真的有可奖励轨迹可以采样”。
第一层判断会落在任务和 reward 上。数学、代码、视觉推理和开放问答都可以进入 RL,但它们只有在 verifier 足够可靠时才会变成可训练信号。若 prompt 太容易,RL 只会强化已有能力;若 prompt 太难或 reward 太噪,采样会长期拿不到正反馈。因此高难 prompt、可验证答案、sandbox、multimodal checker 和 reward model 先成为入口条件。
第二层压力来自上下文长度。长上下文让模型能写更长推理、保留工具输出和视觉证据,也会放大两个副作用:输出越长,rollout 成本越高;reward 越依赖最终答案,模型越容易把“写得更多”当成提高成功率的捷径。因此 k1.5 的自然方向会变成同时控制探索空间和长度偏置:先给模型一个 long-CoT 初始行为分布,再让 RL 在 curriculum、采样分布和 length penalty 的约束下放大真正有效的长轨迹。
第三层压力来自系统闭环。128K context 下,如果每次更新都从 prompt 重新生成完整轨迹,训练时间会被重复前缀消耗;如果 rollout、KV/cache 和训练引擎之间的数据搬运跟不上,算法收益会被 wall-clock 吃掉。这会把作者推向 partial rollout、vLLM rollout、Megatron trainer 和 Mooncake/RDMA 这类系统设计。
最后一层压力来自部署。长 CoT 是训练和高难任务上的搜索工具,线上使用时仍要面对延迟和 token 成本。于是 long2short 承担必要的收束作用:把长推理模型从“能解题”推进到“能服务”,保留长轨迹中有效的策略,同时把输出预算降到可接受范围。
4. 核心假设或切入点
高质量 prompt、强 verifier 和长上下文会把 RL 的有效搜索空间扩大;long-CoT 是一种隐式 search,可以在不显式维护树结构的情况下提升复杂推理;当输出长度成为主要成本时,需要同时优化策略目标、采样分布、rollout 系统和短模型蒸馏,单纯扩大训练步数难以处理成本问题。
5. 方法 / 系统 / 理论框架
k1.5 的方法从 prompt 集开始。RL prompt 需要满足三件事:难度足够高,模型还没有稳定掌握;reward source 可靠,能区分正确和错误;任务分布覆盖数学、代码、视觉推理和通用 reasoning。数学题主要依赖可验证答案,代码题依赖测试用例和 sandbox,开放域任务依赖 reward model 或 self-consistency,视觉任务还要接入 multimodal answer checking。这个设计和 DeepSeek-R1 的 verifiable reward 路线相通,但 k1.5 把上下文长度、多模态和系统 rollout 成本一起放进 recipe。
进入 RL 前,模型先经过 long-CoT warmup。warmup 的作用是让模型学会长推理格式、反思、修正和中间计划,给后续 RL 一个可探索的初始行为分布。若直接从短回答模型开始做 outcome reward,正确轨迹太稀疏,采样会大量落在无效区域;long-CoT SFT 把可奖励轨迹的概率先抬高,使 RL 有足够正样本可以放大。
Policy optimization 使用 online mirror descent 风格更新。长 CoT RL 的困难在于 reward 只在整条回答结束后出现,训练又要避免模型为了少数高分样本一次偏离当前可用策略太远。OMD 给出的思路是把一次 RL update 写成一个局部策略选择问题:在当前 policy 附近,找一个 expected reward 更高的新 policy;“附近”的距离用 KL 衡量。这样更新的主要对象是 response distribution,参数更新承担实现这个分布目标的角色。
放到 k1.5 里,OMD 可以按三步理解。第一,当前模型
因此,OMD 在 k1.5 中承担的是“无 critic 的稳定策略改写器”:它省去 value network 和 PRM (Process Reward Model,过程奖励模型),也不依赖 MCTS 式显式树搜索;和 GRPO 相似,它依赖同一 prompt 下多条采样的 reward baseline 降低方差。差别在于 k1.5 把 long context、采样策略和 length penalty 视为同一个 policy optimization recipe 的组成部分。
更细地看,OMD 和 GRPO 都有 reference / KL 约束,差异的重点在 advantage 尺度和更新边界。KL 控制的是 policy update 距离,reward 标准化控制的是 advantage 尺度。k1.5 的 OMD 推导从 relative-entropy regularized objective 出发:
这个目标的闭式解是把当前策略按 reward 指数重加权:
实际更新时,k1.5 用 sampled reward mean 近似 baseline,梯度里保留
GRPO 选择另一条路线。它用同一 prompt 的 group rewards 计算
再用 PPO-style clipped ratio 和 reference KL 更新策略。这个选择强化“同题内相对好坏”,对 hard verifiable math/code 很有效,因为少数正确轨迹会获得更大的正 advantage。k1.5 的任务混合更宽,包含多模态、代码、开放问答、length penalty 和 partial rollout;保留 reward scale 可以让采样策略、curriculum 和 length penalty 共同决定哪些 prompt 更该贡献梯度。
一个二值 reward 的例子能说明差别:同一题采样 16 条,只有 1 条答对时,mean baseline 下正确样本 advantage 约为
长度控制是 k1.5 的关键工程点。长上下文会给模型更多搜索步数,但 outcome reward 很容易把“写得更长”误当成“更可能正确”。k1.5 在训练中加入 length penalty、sampling schedule 和 curriculum:低难任务不鼓励无意义拉长,高难任务允许更长 reasoning;随着训练推进,采样和长度预算逐步调整。这样 reward 优化会推动更有效的探索,减少无效 token 增长。
partial rollout 处理的是长轨迹训练成本。完整 rollout 每次都从 prompt 重新生成到答案,128K context 下会把大量算力花在已经稳定的前缀上。partial rollout 复用上一轮轨迹的大段 prefix,只从某个中间位置重新采样 suffix,从而保留 long-CoT 搜索空间,同时减少重复生成。这个思想后来也出现在 slime 官方仓库 等 RL scaling 系统里。k1.5 的系统栈用 Megatron 做训练、vLLM 做 rollout,Mooncake/RDMA 处理长上下文存储、KV/cache 和数据搬运,使 partial rollout 真正变成训练吞吐收益。
long2short 解决部署成本。长 CoT 模型在高难任务上强,但线上推理不总能承受数千到数万 token。k1.5 把长模型能力迁移到短输出模式,组合了 model merging、shortest rejection sampling、DPO 和第二阶段 RL。shortest rejection sampling 从多个正确候选中选更短答案;DPO 用偏好对比把短且正确的回答相对长回答推高;long2short RL 继续使用 length penalty,并显著降低 maximum rollout length,使模型在有限 token budget 内保留尽量多的 reasoning 能力。
训练公开信息需要按 recipe 与成本边界分开读:
| 维度 | 公开信息 |
|---|---|
| 模型与上下文 | Kimi 系列 long-CoT model;128K context;完整参数规模未披露 |
| 数据 / 任务 | math、code、visual reasoning、多模态 QA、通用 reasoning;代码 reward 依赖 sandbox 和生成测试 |
| RL recipe | long-CoT warmup;OMD-style RL;sampled reward mean baseline;reference / KL 约束;log-ratio regularization;length penalty;curriculum;partial rollout |
| 系统栈 | Megatron trainer;vLLM rollout;Mooncake / RDMA 处理长上下文存储、KV/cache 和数据搬运 |
| 成本边界 | 具体 GPU 数、硬件型号、并行方式、GPU hours、wall-clock、美元成本未完整披露 |
6. 结论链条
k1.5 的核心链条是:长上下文扩大可生成轨迹长度,高质量 verifier 让 outcome reward 可用,long-CoT warmup 提供初始行为,OMD-style RL 把正确长轨迹概率推高,partial rollout 和系统栈降低训练时间,long2short 将长推理能力迁移到低延迟输出。
关键实验/定理
结果 1:long-CoT reasoning benchmark
- 设置:Kimi k1.5 long-CoT 模型;任务覆盖数学、代码、文本推理和多模态 reasoning。
- Baseline:historical o1、Claude/Gemini/GPT 系列、开源 reasoning/chat 模型;不同任务 baseline 依论文表格而变化。
- 指标:MATH-500、AIME 2024、Codeforces percentile、LiveCodeBench、MathVista、MMMU、MathVision。
- 解读:k1.5 展示了 long-CoT RL 在数学、代码和多模态推理上的整体竞争力;跨闭源 baseline 比较需要结合日期、采样预算和评测 harness 理解。
结果:
| 指标 | Kimi k1.5 long-CoT |
|---|---|
| MATH-500 | 96.2 |
| AIME 2024 | 77.5 |
| Codeforces percentile | 94 |
| LiveCodeBench | 62.5 |
| MathVista | 74.9 |
| MMMU | 70.0 |
| MathVision | 38.6 |
结果 2:short-CoT / long2short
- 设置:从 long-CoT 能力出发,通过 model merge、shortest rejection sampling、DPO 和 RL 得到短输出模型。
- Baseline:long-CoT 模型、未压缩模型、同类 chat/reasoning 模型。
- 指标:MATH-500、AIME、LiveCodeBench、MathVista、MMMU、MathVision、平均输出长度。
- 解读:long2short 牺牲一部分高难推理分数,换取更短输出和更低推理成本,是 reasoning 模型部署时的关键 tradeoff。
结果:
| 指标 | Kimi k1.5 short-CoT |
|---|---|
| MATH-500 | 94.6 |
| AIME | 60.8 |
| LiveCodeBench | 47.3 |
| MathVista | 70.1 |
| MMMU | 68.0 |
| MathVision | 31.0 |
| AIME 2024 平均输出 | ~3272 tokens |
结果 3:code reward 数据建设
- 设置:在线竞赛题、测试用例生成、sandbox 验证。
- Baseline:直接使用原始题目和已有测试。
- 指标:可生成有效测试的题目数量、加入训练的数据量。
- 结果:从 1000 个 online contest problems 中筛选,614 个无 special judge,463 个能生成不少于 40 个 valid tests,最终 323 个加入训练。
- 解读:代码 RL 的有效 reward 依赖测试质量;这个 pipeline 说明 reward construction 本身是主要工程成本。
结果 4:系统加速与 partial rollout
- 设置:长上下文 RL rollout 结合 Megatron、vLLM、Mooncake/RDMA 与 partial rollout。
- Baseline:完整重采样长轨迹、常规 rollout 存储和通信路径。
- 指标:训练闭环吞吐、长尾延迟、重复生成比例、GPU 利用率。
- 结果:报告给出系统设计与收益方向,具体可复验数字依内部环境而定。
- 解读:长序列 RL 的瓶颈并不只在 policy loss,rollout、KV/cache、数据搬运和 prefix 重用共同决定训练效率。
实验设置与 baseline 审计
| 维度 | 记录 |
|---|---|
| 模型与初始化 | Kimi 系列 base / instruction 模型;报告未完整公开参数规模和训练数据组成 |
| 数据与任务 | math、code、visual reasoning、多模态 QA、通用 reasoning;代码 reward 依赖 sandbox 和生成测试 |
| RL / 训练配置 | long-CoT warmup + OMD-style RL;current model / reference;sampled reward baseline;length penalty;curriculum;partial rollout;完整 batch、KL、clip、temperature、rollout width 披露有限 |
| 系统配置 | Megatron + vLLM + Mooncake / RDMA;具体集群规模和 GPU hours 未完整披露 |
| 技术报告训练配置 | 披露 long-CoT warmup、OMD-style update、partial rollout、long2short、代码 reward 数据构建;缺少完整可成本复查训练账本 |
| 未披露项 | 模型参数规模、训练硬件、并行方式、训练时间、GPU hours、美元成本、完整数据 mixture、完整 RL 超参 |
| 评测协议 | 公开 benchmark + 内部评测;闭源 baseline 受模型版本和采样预算影响 |
| 统计报告 | 主表多为单点结果,缺少多 seed 和置信区间 |
| Baseline 强度 | 覆盖强闭源和强开源模型,强度高;compute matching 和 prompt matching 难以确认 |
| 结论边界 | k1.5 可作为 Moonshot long-CoT RL recipe 的主来源,不能单独证明每个组件的独立贡献 |
证据链强度评估
强证据
- 技术报告、GitHub 项目和主要 benchmark 数值公开。
- long-CoT、long2short、代码 reward 和系统栈的设计逻辑完整。
- 多任务结果覆盖 math/code/multimodal,能说明 recipe 的横向适用性。
中等强度证据
- 组件消融、partial rollout 和系统收益方向可信,但公开细节不足以独立复现。
- long2short 的收益清楚,具体最优组合依赖私有数据和训练预算。
需要谨慎的推论
- 闭源 baseline 对比具有时间敏感性。
- reward 数据、prompt 过滤和 multimodal verifier 对最终能力影响很大。
- long-CoT 提升可能混合了 base capability、test-time compute、verifier selection 和 RL 更新四类因素。
OpenReview / 审稿意见吸收
- Venue status: CoRR / arXiv technical report;OpenReview revision/API metadata 存在。
- Public reviews: 未发现 official public reviews;API replyCount 为 0。
- Ratings / confidence: 未发现。
- Reviewer consensus: 未发现。
- Main criticisms: 无公开 reviewer comments;本地审计重点放在训练数据透明度、闭源 baseline 可比性、系统消融和多 seed 统计。
- Author response: 未发现。
- 可信度影响: 适合作为 Moonshot long-CoT RL 技术路线来源;peer-review 背书和复现实验仍缺。
本地讨论补充
1. 讨论收敛点
k1.5 是 Moonshot 后续 K2/K2.5 agentic RL 的上游节点。它先把长上下文和 long-CoT RL 打通,再由 K2 将能力转向工具、软件工程和 agentic intelligence,由 K2.5 推向视觉 agent。
2. 修正后的理解
k1.5 的重点是 RL scaling pipeline。long-CoT、reward construction、partial rollout、long2short 和系统栈彼此耦合;如果只看 benchmark 分数,会漏掉它对后续 Kimi agentic 系统的基础作用。
3. OMD 与 GRPO 的本地辨析
k1.5 的 OMD 和 DeepSeek-R1 的 GRPO 都是 critic-free long-CoT RL 路线,共同点是省去 value model,用同一 prompt 下多条采样的 reward 信号更新策略,并用 reference policy 控制漂移。核心差别在 advantage 与更新边界:OMD 使用 sampled reward mean baseline,保留 reward scale,并通过 mirror-descent / log-ratio regularization 控制步长;GRPO 使用 group mean/std normalization,再通过 PPO clip 和 KL 控制更新。
这个差别会影响训练语义。std(r) normalization 让不同 prompt 的梯度尺度更接近,适合把“同题中相对更好”的样本强行推出来;OMD 保留不同 prompt 的 reward spread,让难度、reward 可靠性、length penalty 和 curriculum sampling 继续影响梯度权重。看到 k1.5 的 OMD-style RL 时,不能只问它有没有 KL,还要问 reward scale 是否被保留、length reward 如何混入、reference 何时更新,以及 partial rollout 是否改变了 on-policy 语义。
4. 后续复验指标
- rollout width、temperature、output length 与 pass@k 曲线。
- reward construction 的 false positive / false negative。
- partial rollout 对 on-policy 语义和 logprob consistency 的影响。
- long2short 在不同任务上的 latency / accuracy frontier。
主要启发
- long-CoT RL 的训练对象是模型、reward 和 rollout 系统组成的闭环。
- 代码与工具任务的 reward 数据建设成本很高,需要把测试生成质量写入实验设置。
- OMD 与 GRPO 的比较要分开看 policy drift control 和 advantage scale control;KL 负责策略距离,
std(r)normalization 负责组内梯度尺度。 - short-CoT 模型可以看成 long-CoT 能力的部署压缩版本,评测时要同时记录 token budget。
局限
- 训练数据、模型规模、超参、集群规模和 GPU hours 披露不完整。
- 多数组件缺少公开可复现消融。
- 闭源 baseline 版本、采样和 prompt 不完全可控。
- 代码 reward 的测试生成可能引入覆盖偏差。
- long-CoT 和 long2short 的能力来源仍需要 pass@k、reward artifact 和 base prior 诊断。
跨论文关系
- 与 2501.12948 DeepSeek-R1:两者都展示 verifiable reward + long-CoT 的 reasoning scaling;R1 更强调 pure RL emergence、GRPO 的 group mean/std advantage 和 distillation,k1.5 更强调 OMD-style update、reward scale 保留、长上下文、多模态、系统和 long2short。
- 与 2503.14476 DAPO:DAPO 给出开源 GRPO recipe、Clip-Higher、Dynamic Sampling 和 overlong reward shaping;k1.5 是更早的团队级 long-CoT RL scaling 报告。
- 与 2506.13585 MiniMax-M1:MiniMax-M1 从 Lightning Attention 和 CISPO 降低 long-output RL 成本;k1.5 从 partial rollout、Mooncake/vLLM/Megatron 和 long2short 处理成本。
- 与 2511.14617 Seer:Seer 系统化优化 synchronous group rollout 的 tail latency;k1.5 提供 Moonshot long-CoT RL workload 背景。
- 与 2507.20534 Kimi K2 和 2602.02276 Kimi K2.5:K2/K2.5 延续 k1.5 RL framework,并分别扩展到 agentic tool-use / software engineering 和 visual agentic intelligence。
- 与 2605.14220 TIM/VeXact:k1.5 的 partial rollout、vLLM rollout 和 Megatron training 组合需要审计 rollout/trainer logprob consistency。
Reference Intake Brief
Target
- Intended target system: 新增 Kimi k1.5 独立论文笔记。
- Existing related assets: 2501.12948 DeepSeek-R1, 2503.14476 DAPO, 2511.14617 Seer, 2602.02276 Kimi K2.5,
content/utility/papers-index.md。 - Proposed form: 新建独立 Markdown 文档。
Reusable Elements
- long-CoT RL scaling recipe。
- partial rollout / long sequence RL systems audit。
- long2short deployment compression。
Risks
- Copyright/over-copying: 只沉淀关键指标和机制。
- Unsourced or unverifiable claims: 内部数据和系统收益按技术报告处理。
- Tone/brand mismatch: 技术归档语气。
- Safety/compliance issues: 不记录可直接滥用的工具/代码任务细节。
- Overlap with existing assets: 与 DeepSeek-R1、DAPO、Kimi K2/K2.5 强重叠,本条定位为 Moonshot long-CoT RL scaling 节点。
Skipped
| Material | Reason |
|---|---|
| 公开 reviewer comments | 未发现 official public reviews。 |
Recommendation
Decision: merge
Why: Kimi k1.5 是 Moonshot long-context RL、long-CoT、partial rollout 和 long2short 的关键历史节点,能连接 Kimi K2/K2.5 与本地 RL scaling 系统图谱。