2501.12599-kimi-k1-5-scaling-rl-llms

Kimi k1.5: Scaling Reinforcement Learning with LLMs

Kimi k1.5 把 128K 长上下文、long-CoT、verifiable reward、多模态 reasoning、partial rollout、length-aware sampling、long2short 和 Megatron/vLLM/Mooncake 工程栈组合成一套 RL scaling recipe;它的价值在于把 reasoning RL 从单一数学训练扩展到长上下文、多模态、代码与系统协同,证据主要来自团队技术报告和多 benchmark 对比,正式 peer review 与完整训练数据可复验性有限。

Authors Kimi Team and 95 other authors;arXiv submitter: Flood Sung。

已审阅 Archived 2026-06-23 18:30 Updated 2026-07-16 19:17 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Kimi Team / Moonshot AI: 组织级技术报告;appendix 将 Research & Development 与 Data Annotation 分组,并按 first name 字母序排列。
  • Flood Sung: XVI Robotics.
  • 作者列表:Kimi Team and 95 named authors;报告更接近团队工程复盘,未给逐作者 affiliation。

阅读目标与判断边界

归档关注:

  1. Kimi k1.5 如何把 RL 作为 LLM post-training 的 scaling axis。
  2. long-CoT、128K context、partial rollout、long2short 之间的关系。
  3. k1.5 和 DeepSeek-R1、DAPO、MiniMax-M1、Kimi K2/K2.5、Seer 的位置。
  4. 实验设置、baseline 强度、奖励统计和系统瓶颈。

判断边界:

  • 报告以团队技术复盘为主,缺少公开训练数据、完整超参、seed 和置信区间。
  • 闭源 o1 / Gemini / Claude 等 baseline 的 sampling budget、prompt 和版本难以完全对齐。
  • long2short、partial rollout、Mooncake 等系统细节足以形成研究线索,外部复现仍需要工程环境和私有数据。

术语预备

  • RL (Reinforcement Learning,强化学习): 通过 reward signal 更新策略模型。
  • CoT (Chain of Thought,思维链): 模型显式生成中间推理过程。
  • long-CoT: 允许模型生成更长推理轨迹,用 test-time compute 换取复杂任务表现。
  • OMD (Online Mirror Descent,在线镜像下降): 一类在策略分布空间中做局部更新的方法;每轮以当前 policy 为 reference,在 KL geometry 下选择 reward 更高且分布距离受限的新 policy。k1.5 用它表述无 value network 的 policy optimization。
  • GRPO (Group Relative Policy Optimization,组相对策略优化): DeepSeek-R1 使用的 critic-free RL 方法,用同一 prompt 下的 group rewards 标准化 advantage。
  • KL (Kullback-Leibler divergence,KL 散度): 衡量当前策略相对 reference policy 的偏移,用于限制 RL 更新幅度。
  • RM (Reward Model,奖励模型): 对输出或过程给出 reward 的模型。
  • DPO (Direct Preference Optimization,直接偏好优化): 用偏好对直接优化策略的后训练方法。
  • MCTS (Monte Carlo Tree Search,蒙特卡洛树搜索): 显式搜索方法,k1.5 将 long-CoT 视作更轻量的隐式搜索路线。
  • partial rollout: 利用已有 prefix / trajectory 继续展开,减少长序列 RL 中重复生成成本。
  • long2short: 将长 CoT 模型能力压缩到短输出模型的训练流程。

论文脉络

1. 研究问题、背景和价值

DeepSeek-R1 之前,开放社区已经看到 verifiable reward 可以推动数学和代码 reasoning,但长上下文、多模态、代码执行和训练系统成本仍是主要瓶颈。k1.5 关注的问题是:在大模型已经具备一定 base capability 后,RL 是否可以像预训练 scaling 一样,通过更长 context、更高质量 prompt、更稳定 reward 和更强系统栈继续提升 reasoning 能力。

2. 已有解决方案与不足

传统 RLHF 偏短对话偏好优化;PRM/ORM 路线需要过程标签或 outcome verifier;MCTS 类显式搜索成本高;单纯 SFT 很难持续提升复杂推理;短上下文模型无法完整容纳长推理、工具输出或多模态上下文。已有公开 recipe 通常在数据、系统和长上下文上拆开讨论,k1.5 试图把这些因素组合成一条可训练 pipeline。

3. 作者可能的思考路径

站在 k1.5 公开前的背景,作者面对的首要矛盾是:base model 已经有一部分数学、代码和多模态先验,但困难任务的正确轨迹很稀疏;短回答模型很难靠 outcome reward 自己摸到长推理路径;显式搜索又会把计算成本推到不可训练。于是问题会先从“选哪种 RL 算法”转向“怎样让 RL 真的有可奖励轨迹可以采样”。

第一层判断会落在任务和 reward 上。数学、代码、视觉推理和开放问答都可以进入 RL,但它们只有在 verifier 足够可靠时才会变成可训练信号。若 prompt 太容易,RL 只会强化已有能力;若 prompt 太难或 reward 太噪,采样会长期拿不到正反馈。因此高难 prompt、可验证答案、sandbox、multimodal checker 和 reward model 先成为入口条件。

第二层压力来自上下文长度。长上下文让模型能写更长推理、保留工具输出和视觉证据,也会放大两个副作用:输出越长,rollout 成本越高;reward 越依赖最终答案,模型越容易把“写得更多”当成提高成功率的捷径。因此 k1.5 的自然方向会变成同时控制探索空间和长度偏置:先给模型一个 long-CoT 初始行为分布,再让 RL 在 curriculum、采样分布和 length penalty 的约束下放大真正有效的长轨迹。

第三层压力来自系统闭环。128K context 下,如果每次更新都从 prompt 重新生成完整轨迹,训练时间会被重复前缀消耗;如果 rollout、KV/cache 和训练引擎之间的数据搬运跟不上,算法收益会被 wall-clock 吃掉。这会把作者推向 partial rollout、vLLM rollout、Megatron trainer 和 Mooncake/RDMA 这类系统设计。

最后一层压力来自部署。长 CoT 是训练和高难任务上的搜索工具,线上使用时仍要面对延迟和 token 成本。于是 long2short 承担必要的收束作用:把长推理模型从“能解题”推进到“能服务”,保留长轨迹中有效的策略,同时把输出预算降到可接受范围。

4. 核心假设或切入点

高质量 prompt、强 verifier 和长上下文会把 RL 的有效搜索空间扩大;long-CoT 是一种隐式 search,可以在不显式维护树结构的情况下提升复杂推理;当输出长度成为主要成本时,需要同时优化策略目标、采样分布、rollout 系统和短模型蒸馏,单纯扩大训练步数难以处理成本问题。

5. 方法 / 系统 / 理论框架

k1.5 的方法从 prompt 集开始。RL prompt 需要满足三件事:难度足够高,模型还没有稳定掌握;reward source 可靠,能区分正确和错误;任务分布覆盖数学、代码、视觉推理和通用 reasoning。数学题主要依赖可验证答案,代码题依赖测试用例和 sandbox,开放域任务依赖 reward model 或 self-consistency,视觉任务还要接入 multimodal answer checking。这个设计和 DeepSeek-R1 的 verifiable reward 路线相通,但 k1.5 把上下文长度、多模态和系统 rollout 成本一起放进 recipe。

进入 RL 前,模型先经过 long-CoT warmup。warmup 的作用是让模型学会长推理格式、反思、修正和中间计划,给后续 RL 一个可探索的初始行为分布。若直接从短回答模型开始做 outcome reward,正确轨迹太稀疏,采样会大量落在无效区域;long-CoT SFT 把可奖励轨迹的概率先抬高,使 RL 有足够正样本可以放大。

Policy optimization 使用 online mirror descent 风格更新。长 CoT RL 的困难在于 reward 只在整条回答结束后出现,训练又要避免模型为了少数高分样本一次偏离当前可用策略太远。OMD 给出的思路是把一次 RL update 写成一个局部策略选择问题:在当前 policy 附近,找一个 expected reward 更高的新 policy;“附近”的距离用 KL 衡量。这样更新的主要对象是 response distribution,参数更新承担实现这个分布目标的角色。

放到 k1.5 里,OMD 可以按三步理解。第一,当前模型 πθi\pi_{\theta_i} 先作为 reference policy,采样多条完整 response。第二,高 reward response 的概率应该上升,低 reward response 的概率应该下降,但新 policy 需要继续靠近 reference。第三,模型用 sampled reward mean 当 baseline,并用 log-ratio regularization 约束 πθ/πθi\pi_\theta/\pi_{\theta_i},把这个分布层面的目标落到参数更新上。

因此,OMD 在 k1.5 中承担的是“无 critic 的稳定策略改写器”:它省去 value network 和 PRM (Process Reward Model,过程奖励模型),也不依赖 MCTS 式显式树搜索;和 GRPO 相似,它依赖同一 prompt 下多条采样的 reward baseline 降低方差。差别在于 k1.5 把 long context、采样策略和 length penalty 视为同一个 policy optimization recipe 的组成部分。

更细地看,OMD 和 GRPO 都有 reference / KL 约束,差异的重点在 advantage 尺度和更新边界。KL 控制的是 policy update 距离,reward 标准化控制的是 advantage 尺度。k1.5 的 OMD 推导从 relative-entropy regularized objective 出发:

maxθEπθ[r]τKL(πθπθi) \max_\theta \mathbb{E}_{\pi_\theta}[r] - \tau \mathrm{KL}(\pi_\theta \Vert \pi_{\theta_i})

这个目标的闭式解是把当前策略按 reward 指数重加权:

π(ox)πθi(ox)exp(r(o)/τ). \pi^*(o \mid x) \propto \pi_{\theta_i}(o \mid x)\exp(r(o)/\tau).

实际更新时,k1.5 用 sampled reward mean 近似 baseline,梯度里保留 rirˉr_i-\bar r,并用 log-ratio squared penalty 限制 πθ\pi_\theta 相对 πθi\pi_{\theta_i} 的变化。若再除以 group reward standard deviation,相当于每个 prompt 都有不同的有效温度 τeffective=τstd(r)\tau_{\mathrm{effective}}=\tau\cdot \mathrm{std}(r)。这样可以统一不同 group 的梯度尺度,也会改变 prompt 权重:低方差但噪声较大的 group 可能被放大,reward 差异很明确的 group 反而被压到单位尺度。

GRPO 选择另一条路线。它用同一 prompt 的 group rewards 计算

Ai=rimean({rj})std({rj}), A_i = \frac{r_i-\mathrm{mean}(\{r_j\})}{\mathrm{std}(\{r_j\})},

再用 PPO-style clipped ratio 和 reference KL 更新策略。这个选择强化“同题内相对好坏”,对 hard verifiable math/code 很有效,因为少数正确轨迹会获得更大的正 advantage。k1.5 的任务混合更宽,包含多模态、代码、开放问答、length penalty 和 partial rollout;保留 reward scale 可以让采样策略、curriculum 和 length penalty 共同决定哪些 prompt 更该贡献梯度。

一个二值 reward 的例子能说明差别:同一题采样 16 条,只有 1 条答对时,mean baseline 下正确样本 advantage 约为 0.93750.9375,错误样本约为 0.0625-0.0625;除以 std 后,正确样本约为 3.873.87,错误样本约为 0.26-0.26。GRPO 会更强地推高稀有正确轨迹;k1.5 的 OMD-style update 更保守,尤其在 verifier false positive、测试覆盖不足或 length reward 混入时,保守性可以减少偶然高分样本被过度放大。

长度控制是 k1.5 的关键工程点。长上下文会给模型更多搜索步数,但 outcome reward 很容易把“写得更长”误当成“更可能正确”。k1.5 在训练中加入 length penalty、sampling schedule 和 curriculum:低难任务不鼓励无意义拉长,高难任务允许更长 reasoning;随着训练推进,采样和长度预算逐步调整。这样 reward 优化会推动更有效的探索,减少无效 token 增长。

partial rollout 处理的是长轨迹训练成本。完整 rollout 每次都从 prompt 重新生成到答案,128K context 下会把大量算力花在已经稳定的前缀上。partial rollout 复用上一轮轨迹的大段 prefix,只从某个中间位置重新采样 suffix,从而保留 long-CoT 搜索空间,同时减少重复生成。这个思想后来也出现在 slime 官方仓库 等 RL scaling 系统里。k1.5 的系统栈用 Megatron 做训练、vLLM 做 rollout,Mooncake/RDMA 处理长上下文存储、KV/cache 和数据搬运,使 partial rollout 真正变成训练吞吐收益。

long2short 解决部署成本。长 CoT 模型在高难任务上强,但线上推理不总能承受数千到数万 token。k1.5 把长模型能力迁移到短输出模式,组合了 model merging、shortest rejection sampling、DPO 和第二阶段 RL。shortest rejection sampling 从多个正确候选中选更短答案;DPO 用偏好对比把短且正确的回答相对长回答推高;long2short RL 继续使用 length penalty,并显著降低 maximum rollout length,使模型在有限 token budget 内保留尽量多的 reasoning 能力。

训练公开信息需要按 recipe 与成本边界分开读:

维度 公开信息
模型与上下文 Kimi 系列 long-CoT model;128K context;完整参数规模未披露
数据 / 任务 math、code、visual reasoning、多模态 QA、通用 reasoning;代码 reward 依赖 sandbox 和生成测试
RL recipe long-CoT warmup;OMD-style RL;sampled reward mean baseline;reference / KL 约束;log-ratio regularization;length penalty;curriculum;partial rollout
系统栈 Megatron trainer;vLLM rollout;Mooncake / RDMA 处理长上下文存储、KV/cache 和数据搬运
成本边界 具体 GPU 数、硬件型号、并行方式、GPU hours、wall-clock、美元成本未完整披露

6. 结论链条

k1.5 的核心链条是:长上下文扩大可生成轨迹长度,高质量 verifier 让 outcome reward 可用,long-CoT warmup 提供初始行为,OMD-style RL 把正确长轨迹概率推高,partial rollout 和系统栈降低训练时间,long2short 将长推理能力迁移到低延迟输出。

关键实验/定理

结果 1:long-CoT reasoning benchmark

  • 设置:Kimi k1.5 long-CoT 模型;任务覆盖数学、代码、文本推理和多模态 reasoning。
  • Baseline:historical o1、Claude/Gemini/GPT 系列、开源 reasoning/chat 模型;不同任务 baseline 依论文表格而变化。
  • 指标:MATH-500、AIME 2024、Codeforces percentile、LiveCodeBench、MathVista、MMMU、MathVision。
  • 解读:k1.5 展示了 long-CoT RL 在数学、代码和多模态推理上的整体竞争力;跨闭源 baseline 比较需要结合日期、采样预算和评测 harness 理解。

结果:

指标 Kimi k1.5 long-CoT
MATH-500 96.2
AIME 2024 77.5
Codeforces percentile 94
LiveCodeBench 62.5
MathVista 74.9
MMMU 70.0
MathVision 38.6

结果 2:short-CoT / long2short

  • 设置:从 long-CoT 能力出发,通过 model merge、shortest rejection sampling、DPO 和 RL 得到短输出模型。
  • Baseline:long-CoT 模型、未压缩模型、同类 chat/reasoning 模型。
  • 指标:MATH-500、AIME、LiveCodeBench、MathVista、MMMU、MathVision、平均输出长度。
  • 解读:long2short 牺牲一部分高难推理分数,换取更短输出和更低推理成本,是 reasoning 模型部署时的关键 tradeoff。

结果:

指标 Kimi k1.5 short-CoT
MATH-500 94.6
AIME 60.8
LiveCodeBench 47.3
MathVista 70.1
MMMU 68.0
MathVision 31.0
AIME 2024 平均输出 ~3272 tokens

结果 3:code reward 数据建设

  • 设置:在线竞赛题、测试用例生成、sandbox 验证。
  • Baseline:直接使用原始题目和已有测试。
  • 指标:可生成有效测试的题目数量、加入训练的数据量。
  • 结果:从 1000 个 online contest problems 中筛选,614 个无 special judge,463 个能生成不少于 40 个 valid tests,最终 323 个加入训练。
  • 解读:代码 RL 的有效 reward 依赖测试质量;这个 pipeline 说明 reward construction 本身是主要工程成本。

结果 4:系统加速与 partial rollout

  • 设置:长上下文 RL rollout 结合 Megatron、vLLM、Mooncake/RDMA 与 partial rollout。
  • Baseline:完整重采样长轨迹、常规 rollout 存储和通信路径。
  • 指标:训练闭环吞吐、长尾延迟、重复生成比例、GPU 利用率。
  • 结果:报告给出系统设计与收益方向,具体可复验数字依内部环境而定。
  • 解读:长序列 RL 的瓶颈并不只在 policy loss,rollout、KV/cache、数据搬运和 prefix 重用共同决定训练效率。

实验设置与 baseline 审计

维度 记录
模型与初始化 Kimi 系列 base / instruction 模型;报告未完整公开参数规模和训练数据组成
数据与任务 math、code、visual reasoning、多模态 QA、通用 reasoning;代码 reward 依赖 sandbox 和生成测试
RL / 训练配置 long-CoT warmup + OMD-style RL;current model / reference;sampled reward baseline;length penalty;curriculum;partial rollout;完整 batch、KL、clip、temperature、rollout width 披露有限
系统配置 Megatron + vLLM + Mooncake / RDMA;具体集群规模和 GPU hours 未完整披露
技术报告训练配置 披露 long-CoT warmup、OMD-style update、partial rollout、long2short、代码 reward 数据构建;缺少完整可成本复查训练账本
未披露项 模型参数规模、训练硬件、并行方式、训练时间、GPU hours、美元成本、完整数据 mixture、完整 RL 超参
评测协议 公开 benchmark + 内部评测;闭源 baseline 受模型版本和采样预算影响
统计报告 主表多为单点结果,缺少多 seed 和置信区间
Baseline 强度 覆盖强闭源和强开源模型,强度高;compute matching 和 prompt matching 难以确认
结论边界 k1.5 可作为 Moonshot long-CoT RL recipe 的主来源,不能单独证明每个组件的独立贡献

证据链强度评估

强证据

  • 技术报告、GitHub 项目和主要 benchmark 数值公开。
  • long-CoT、long2short、代码 reward 和系统栈的设计逻辑完整。
  • 多任务结果覆盖 math/code/multimodal,能说明 recipe 的横向适用性。

中等强度证据

  • 组件消融、partial rollout 和系统收益方向可信,但公开细节不足以独立复现。
  • long2short 的收益清楚,具体最优组合依赖私有数据和训练预算。

需要谨慎的推论

  • 闭源 baseline 对比具有时间敏感性。
  • reward 数据、prompt 过滤和 multimodal verifier 对最终能力影响很大。
  • long-CoT 提升可能混合了 base capability、test-time compute、verifier selection 和 RL 更新四类因素。

OpenReview / 审稿意见吸收

  • Venue status: CoRR / arXiv technical report;OpenReview revision/API metadata 存在。
  • Public reviews: 未发现 official public reviews;API replyCount 为 0。
  • Ratings / confidence: 未发现。
  • Reviewer consensus: 未发现。
  • Main criticisms: 无公开 reviewer comments;本地审计重点放在训练数据透明度、闭源 baseline 可比性、系统消融和多 seed 统计。
  • Author response: 未发现。
  • 可信度影响: 适合作为 Moonshot long-CoT RL 技术路线来源;peer-review 背书和复现实验仍缺。

本地讨论补充

1. 讨论收敛点

k1.5 是 Moonshot 后续 K2/K2.5 agentic RL 的上游节点。它先把长上下文和 long-CoT RL 打通,再由 K2 将能力转向工具、软件工程和 agentic intelligence,由 K2.5 推向视觉 agent。

2. 修正后的理解

k1.5 的重点是 RL scaling pipeline。long-CoT、reward construction、partial rollout、long2short 和系统栈彼此耦合;如果只看 benchmark 分数,会漏掉它对后续 Kimi agentic 系统的基础作用。

3. OMD 与 GRPO 的本地辨析

k1.5 的 OMD 和 DeepSeek-R1 的 GRPO 都是 critic-free long-CoT RL 路线,共同点是省去 value model,用同一 prompt 下多条采样的 reward 信号更新策略,并用 reference policy 控制漂移。核心差别在 advantage 与更新边界:OMD 使用 sampled reward mean baseline,保留 reward scale,并通过 mirror-descent / log-ratio regularization 控制步长;GRPO 使用 group mean/std normalization,再通过 PPO clip 和 KL 控制更新。

这个差别会影响训练语义。std(r) normalization 让不同 prompt 的梯度尺度更接近,适合把“同题中相对更好”的样本强行推出来;OMD 保留不同 prompt 的 reward spread,让难度、reward 可靠性、length penalty 和 curriculum sampling 继续影响梯度权重。看到 k1.5 的 OMD-style RL 时,不能只问它有没有 KL,还要问 reward scale 是否被保留、length reward 如何混入、reference 何时更新,以及 partial rollout 是否改变了 on-policy 语义。

4. 后续复验指标

  • rollout width、temperature、output length 与 pass@k 曲线。
  • reward construction 的 false positive / false negative。
  • partial rollout 对 on-policy 语义和 logprob consistency 的影响。
  • long2short 在不同任务上的 latency / accuracy frontier。

主要启发

  • long-CoT RL 的训练对象是模型、reward 和 rollout 系统组成的闭环。
  • 代码与工具任务的 reward 数据建设成本很高,需要把测试生成质量写入实验设置。
  • OMD 与 GRPO 的比较要分开看 policy drift control 和 advantage scale control;KL 负责策略距离,std(r) normalization 负责组内梯度尺度。
  • short-CoT 模型可以看成 long-CoT 能力的部署压缩版本,评测时要同时记录 token budget。

局限

  1. 训练数据、模型规模、超参、集群规模和 GPU hours 披露不完整。
  2. 多数组件缺少公开可复现消融。
  3. 闭源 baseline 版本、采样和 prompt 不完全可控。
  4. 代码 reward 的测试生成可能引入覆盖偏差。
  5. long-CoT 和 long2short 的能力来源仍需要 pass@k、reward artifact 和 base prior 诊断。

跨论文关系

  • 2501.12948 DeepSeek-R1:两者都展示 verifiable reward + long-CoT 的 reasoning scaling;R1 更强调 pure RL emergence、GRPO 的 group mean/std advantage 和 distillation,k1.5 更强调 OMD-style update、reward scale 保留、长上下文、多模态、系统和 long2short。
  • 2503.14476 DAPO:DAPO 给出开源 GRPO recipe、Clip-Higher、Dynamic Sampling 和 overlong reward shaping;k1.5 是更早的团队级 long-CoT RL scaling 报告。
  • 2506.13585 MiniMax-M1:MiniMax-M1 从 Lightning Attention 和 CISPO 降低 long-output RL 成本;k1.5 从 partial rollout、Mooncake/vLLM/Megatron 和 long2short 处理成本。
  • 2511.14617 Seer:Seer 系统化优化 synchronous group rollout 的 tail latency;k1.5 提供 Moonshot long-CoT RL workload 背景。
  • 2507.20534 Kimi K22602.02276 Kimi K2.5:K2/K2.5 延续 k1.5 RL framework,并分别扩展到 agentic tool-use / software engineering 和 visual agentic intelligence。
  • 2605.14220 TIM/VeXact:k1.5 的 partial rollout、vLLM rollout 和 Megatron training 组合需要审计 rollout/trainer logprob consistency。

Reference Intake Brief

Target

Reusable Elements

  1. long-CoT RL scaling recipe。
  2. partial rollout / long sequence RL systems audit。
  3. long2short deployment compression。

Risks

  • Copyright/over-copying: 只沉淀关键指标和机制。
  • Unsourced or unverifiable claims: 内部数据和系统收益按技术报告处理。
  • Tone/brand mismatch: 技术归档语气。
  • Safety/compliance issues: 不记录可直接滥用的工具/代码任务细节。
  • Overlap with existing assets: 与 DeepSeek-R1、DAPO、Kimi K2/K2.5 强重叠,本条定位为 Moonshot long-CoT RL scaling 节点。

Skipped

Material Reason
公开 reviewer comments 未发现 official public reviews。

Recommendation

Decision: merge

Why: Kimi k1.5 是 Moonshot long-context RL、long-CoT、partial rollout 和 long2short 的关键历史节点,能连接 Kimi K2/K2.5 与本地 RL scaling 系统图谱。