2001.08361-scaling-laws-neural-language-models

Scaling Laws for Neural Language Models

这篇论文把语言模型训练从“单次大模型实验”推进到可拟合的经验规律:cross-entropy loss 随模型参数量、训练数据量和训练计算量呈稳定 power-law;在当时的实验范围内,模型 shape 和许多超参数影响较弱,更大的模型具有更高 sample efficiency;论文据此推出 compute-efficient training 应优先扩大模型、减少训练步数,并在远未完全收敛时停止。现代阅读时要把它作为 pretraining scaling laws 的历史基准,同时和后续 data-optimal scaling 结论对照使用。

Authors Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B. Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, Dario Amodei

已审阅 Archived 2026-01-06 09:20 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Jared Kaplan: Johns Hopkins University and OpenAI.
  • Sam McCandlish: OpenAI;与 Jared Kaplan 共同 led the research。
  • Tom Henighan: OpenAI.
  • Tom B. Brown: OpenAI.
  • Benjamin Chess: OpenAI.
  • Rewon Child: OpenAI.
  • Scott Gray: OpenAI.
  • Alec Radford: OpenAI.
  • Jeffrey Wu: OpenAI.
  • Dario Amodei: OpenAI.

阅读目标与判断边界

本笔记关注:

  1. 论文如何定义语言模型 scaling law 的三个核心变量:model size、dataset size、compute。
  2. 它如何从单变量 power-law 推到 joint scaling 与 compute-efficient frontier。
  3. 它的结论如何影响后续大模型预训练、post-training、RLVR scaling 和训练系统设计。
  4. 它在今天的解读边界,尤其是数据规模、训练 token 预算、模型架构和 2203.15556 带来的 Chinchilla-style 校正。

判断边界:

  • 本文实验集中在 decoder-only Transformer、WebText2、context length 1024 和 2020 年前后的训练配方上。
  • 论文中的 NN 是 non-embedding parameters,意图去掉词表 embedding 和 position embedding 对小模型 scaling 的干扰。
  • 论文的 compute-efficient prescription 来自当时可观测范围内的经验拟合,后续更大数据、更长训练和不同数据配方会改变最优 model/data allocation。
  • 本文目标是预测 next-token cross-entropy loss;reasoning、instruction following、tool use、safety behavior 和 RLVR gain 需要通过后续论文补充分析。

论文脉络

1. 问题背景:把大模型训练变成可预测工程问题

论文要回答的问题很直接:如果我们有更多参数、更多 token 或更多 compute,语言模型 loss 会如何下降?

在这篇论文之前,研究者已经观察到“大模型通常更好”,但很难把未来模型训练变成可计算的资源分配问题。本文用大量 Transformer 训练 run 说明,在相当宽的范围内,loss 与资源之间可以用简单 power-law 描述。这个判断给后续大模型训练带来一个很实用的视角:先估计 compute budget,再根据 scaling law 推 model size、batch size、training steps 和数据需求。

论文的核心变量是:

N=non-embedding parameters,D=training tokens,C=training FLOPs. N = \text{non-embedding parameters}, \qquad D = \text{training tokens}, \qquad C = \text{training FLOPs}.

训练 compute 的近似形式为:

C6NBS, C \approx 6NBS,

其中 BB 是每次参数更新的 token batch size,SS 是 optimizer steps,BSBS 是训练实际处理过的 token 数。论文符号中 DD 首先定义为 dataset size;只有在单 epoch、没有数据复用的 compute-efficient 讨论里,才近似写成 D=BSD=BS。系数 6 来自一次 forward 大约 2N2N FLOPs/token,训练时 forward + backward 约为三倍。

这套记号后来成为讨论 pretraining compute 的常用语言。当前归档里的 2512.07783 也用类似 token-equivalent compute 方式比较 pre-training、mid-training 和 RL 成本。

2. 实验对象:WebText2 与 decoder-only Transformer

数据集是 WebText2:它扩展了 GPT-2 使用的 WebText,从 Reddit outbound links 中收集网页文本,包含约 20.3M documents、96GB text、约 1.62×10101.62\times10^{10} words、约 2.29×10102.29\times10^{10} BPE tokens,并保留约 6.6×1086.6\times10^8 test tokens。tokenizer vocabulary size 为 50,257,context window 为 1024。

模型主要是 decoder-only Transformer,non-embedding 参数规模从 768 到 1.5B。作者还训练 LSTM 和 recurrent / Universal Transformer 作为对照,用来判断 scaling law 是否只来自某个特定架构细节。

训练配方大体固定:Adam optimizer,固定 2.5×1052.5\times10^5 steps,batch 为 512 sequences,每个 sequence 长度 1024 tokens;大于 1B 参数的模型使用 Adafactor;学习率使用 warmup + cosine decay。论文的设计重点是控制变量,让不同 NNDDCC 的趋势可以被比较。

3. 单变量 scaling laws:NNDDCC 都呈 power-law

论文最有影响力的结果是三个单变量 power-law。

固定足够多数据和训练时,loss 随模型参数量下降:

L(N)=(NcN)αN,αN0.076,Nc8.8×1013. L(N)=\left(\frac{N_c}{N}\right)^{\alpha_N}, \qquad \alpha_N \approx 0.076, \qquad N_c \approx 8.8\times10^{13}.

固定模型足够大和训练足够充分时,loss 随数据量下降:

L(D)=(DcD)αD,αD0.095,Dc5.4×1013. L(D)=\left(\frac{D_c}{D}\right)^{\alpha_D}, \qquad \alpha_D \approx 0.095, \qquad D_c \approx 5.4\times10^{13}.

固定 compute budget,并选择最省 compute 的训练方式时,loss 随 compute 下降:

L(Cmin)=(CcminCmin)αCmin,αCmin0.050,Ccmin3.1×108 PF-days. L(C_{\min})= \left(\frac{C_c^{\min}}{C_{\min}}\right)^{\alpha_C^{\min}}, \qquad \alpha_C^{\min}\approx0.050, \qquad C_c^{\min}\approx3.1\times10^8\ \mathrm{PF\text{-}days}.

这些指数都很小,含义是 loss 下降很稳定,但边际收益递减强。比如 compute 增加很多倍,loss 只会按很慢的幂率下降。这也是大模型训练极度依赖资源规模的根源之一。

4. 模型 shape 影响较弱,non-embedding 参数量是更清晰的尺度

论文系统改变 depth、width、attention heads、feed-forward dimension 和 aspect ratio,发现只要总 non-embedding 参数量相同,模型 shape 对最终 loss 的影响相对小。作者甚至比较了非常不同的 shape,例如浅而宽与深而窄的模型,结果仍落在近似同一 scaling curve 附近。

这给出一个重要结论:在研究跨数量级 scaling 时,NN 比具体 shape 更像一阶变量。shape 和优化细节仍然重要,但在论文观测范围内,它们更多影响局部效率与可训练性,主趋势由参数量控制。

论文还强调要排除 embedding 参数。对小模型而言,vocabulary embedding 和 positional embedding 会在总参数量中占很大比例,但它们对模型有效容量的贡献不同。使用 non-embedding parameters 后,loss curve 更平滑。

5. 大模型更 sample-efficient,joint L(N,D)L(N,D) 描述过拟合边界

论文的另一个关键发现是:大模型在相同 token 数下通常能学得更快,因此更 sample-efficient。换句话说,增加 NN 并不会简单地带来更强过拟合风险;在相当范围内,更大模型可以用更少 token 达到同样 loss。

论文用一个 joint scaling formula 描述模型大小和数据量共同决定 loss:

L(N,D)=[(NcN)αN/αD+DcD]αD. L(N,D)= \left[ \left(\frac{N_c}{N}\right)^{\alpha_N/\alpha_D} + \frac{D_c}{D} \right]^{\alpha_D}.

这个式子表达了两个瓶颈的叠加:参数不足会带来 model-limited loss,数据不足会带来 data-limited loss。若想把过拟合维持在相近水平,数据量需要随模型规模增长:

DNαN/αDN0.74. D \propto N^{\alpha_N/\alpha_D}\approx N^{0.74}.

这个 exponent 小于 1,构成本文后续 compute-efficient 结论的重要前提:模型规模增长很快,数据增长相对慢。2203.15556 会重新审视这个比例,因此本文的 data allocation 结论在现代实践中需要谨慎使用。

6. Batch size:临界 batch 由 loss 主导

论文还研究 batch size。核心概念是 critical batch size:当 batch size 小于某个临界值时,增加 batch 通常能提高并行效率;超过临界值后,继续增大 batch 的收益迅速下降。

论文给出经验式:

Bcrit(L)=BL1/αB,B2×108,αB0.21. B_{\rm crit}(L) = \frac{B_\ast}{L^{1/\alpha_B}}, \qquad B_\ast \approx 2\times10^8, \qquad \alpha_B \approx 0.21.

重要点在于 BcritB_{\rm crit} 主要由当前 loss 决定,而与模型大小没有强独立关系。随着训练推进、loss 降低,critical batch size 变大,模型可以有效使用更大的 batch。这和 later-stage training 可以用更大并行度的经验相吻合。

7. Compute-efficient frontier:更大的模型、更少的 steps、更早停止

论文把 learning curve 拟合为:

L(N,S)=(NcN)αN+(ScS)αS,αS0.76. L(N,S)= \left(\frac{N_c}{N}\right)^{\alpha_N} + \left(\frac{S_c}{S}\right)^{\alpha_S}, \qquad \alpha_S \approx 0.76.

在固定 compute 下,代入 C6NBSC\approx6NBS 并使用 critical batch size 后,可以推导 compute-efficient frontier。最优 loss 对 compute 的指数为:

αC=11/αS+1/αB+1/αN0.052. \alpha_C = \frac{1}{1/\alpha_S + 1/\alpha_B + 1/\alpha_N} \approx 0.052.

对应的资源分配趋势是:

NCmin0.73,BCmin0.24,SCmin0.03,DCmin0.27. N \propto C_{\min}^{0.73}, \qquad B \propto C_{\min}^{0.24}, \qquad S \propto C_{\min}^{0.03}, \qquad D \propto C_{\min}^{0.27}.

这组式子的直观含义很强:当 compute 增加时,本文的最优策略会把大部分新增 compute 用来扩大模型,训练步数几乎不增加,数据 token 数只缓慢增加。

论文还推导出 compute-efficient training 应在距离该模型完全收敛 loss 约固定比例处停止:

L(Neff(C),C)=(1+αNαS)L(Neff,). L(N_{\rm eff}(C), C) = \left(1+\frac{\alpha_N}{\alpha_S}\right) L(N_{\rm eff}, \infty).

由于 αN/αS10%\alpha_N/\alpha_S\approx10\%,所以 compute-efficient run 会在“比完全收敛差约 10% loss”的位置停止。作者还和更传统的接近收敛训练比较:若传统做法训练到只比收敛 loss 高 2%,那么 compute-efficient prescription 会使用约 2.7x 更多参数、7.7x 更少参数更新、约 65% 更少 compute 达到同样 loss。

这就是本文最著名、也最容易被后续修正的结论:在给定 compute 下,优先训练更大的模型,并让它更早停。

8. Transfer:不同数据分布上的 loss 保持近似平移关系

论文还检查从 WebText2 training distribution 到其他文本分布的 transfer,包括 Books、Common Crawl、Wikipedia、Internet Books 等。结果显示,模型在目标分布上的 loss 会随 WebText2 loss 平滑改善,很多分布之间呈近似 constant offset。

这个结果支持一个实用判断:在相近语言建模任务上,训练分布 loss 可以作为跨分布能力提升的代理指标。它也解释了为什么 pretraining loss 曾长期被用作 foundation model 能力的核心信号。

不过,这个结论主要覆盖 next-token prediction 的平均 loss。对 instruction following、reasoning、tool use、安全约束或长链条 agent behavior,loss 和目标能力之间的关系会变复杂。当前归档里的 RLVR 和 safety 论文基本都在处理这个 gap。

9. 和后续论文的关系:pretraining scaling 是上游坐标系

本文建立的是 pretraining 阶段的 scaling 坐标系。它回答“在 next-token prediction 上,参数、数据和 compute 怎样换 loss”。当前归档中的许多论文则回答另一个层面的问题:给定一个 base model 之后,RL、verifier、reward、serving backend 和 optimizer 如何改变能力表现。

2512.07783 的关系最直接:后者讨论 pre-training exposure、mid-training 和 RL 如何共同决定 reasoning 能力边界;本文提供 pre-training compute 和 loss scaling 的历史语言。Interplay 论文中的 edge-of-competence、primitive seed 和 token-equivalent compute,可以看作对本文“pretraining loss”视角的能力层扩展。

2501.12948 的关系是上游与下游:DeepSeek-R1 依赖强 base model 的 latent capability,再用 GRPO / verifiable reward 激发 long-CoT reasoning;本文解释强 base model 在预训练阶段为什么会随 N,D,CN,D,C 平滑改善。

2503.144762505.248642510.01180 的关系是 scaling axis 的迁移:本文的 scaling axis 是 pretraining N,D,CN,D,C;这些论文的 scaling axis 是 RL steps、rollout length、rollout width、effective gradients 和 reward design。两类 scaling 最终都会落到 compute allocation 问题上。

2606.04662 的关系是宏观规律与优化器机制:本文在宏观上观察 loss scaling,Muon 论文从 update geometry 和 curvature penalty 解释 optimizer 为什么可能提高 pretraining efficiency。

2409.192562606.001352605.14220 的关系是 compute accounting 的系统化:本文用 C6NBSC\approx6NBS 给 pretraining 建模;RLHF/RLVR 和 tool-use training 需要额外计入 rollout engine、reference / reward / verifier model、工具返回、长上下文、policy update 和 sampler-trainer consistency。

关键实验/定理

本文主要是经验 scaling law,没有形式定理。关键实验与结论如下:

  1. Power-law fits across scales:在超过 7 个数量级的资源变化中,loss 与 NNDDCC 的关系可以用简单 power-law 拟合。
  2. Model size scaling:固定其他因素时,L(N)=(Nc/N)αNL(N)=(N_c/N)^{\alpha_N}αN0.076\alpha_N\approx0.076
  3. Dataset size scaling:固定其他因素时,L(D)=(Dc/D)αDL(D)=(D_c/D)^{\alpha_D}αD0.095\alpha_D\approx0.095
  4. Compute scaling:compute-efficient frontier 上,L(Cmin)=(Ccmin/Cmin)αCminL(C_{\min})=(C_c^{\min}/C_{\min})^{\alpha_C^{\min}}αCmin0.050\alpha_C^{\min}\approx0.050
  5. Shape weak dependence:depth、width、attention heads、feed-forward dimension 和 aspect ratio 的影响弱于 non-embedding 参数量的主趋势。
  6. Larger models are more sample-efficient:更大模型在相同 token budget 下能达到更低 loss,joint L(N,D)L(N,D) 支持 DN0.74D\propto N^{0.74} 的过拟合控制关系。
  7. Critical batch scaling:BcritB_{\rm crit} 主要随 loss 变化,Bcrit(L)=B/L1/αBB_{\rm crit}(L)=B_\ast/L^{1/\alpha_B}
  8. Compute-efficient training:最优配置倾向 NC0.73N\propto C^{0.73}BC0.24B\propto C^{0.24}SC0.03S\propto C^{0.03};若要求单 epoch 且不复用数据,实际需要的新数据量约随 Done-epochC0.27D_{\rm one\text{-}epoch}\propto C^{0.27} 增长,并在约 10% above converged loss 处停止。
  9. Architecture comparison:LSTM 在早期 token prediction 上可接近 Transformer,但随 context position 增加劣化更明显;recurrent Transformer 按参数量略有优势,按 compute 评估优势减弱。
  10. Transfer across distributions:多种文本分布上的 loss 与 WebText2 loss 呈平滑关系,常表现为近似 constant offset。

证据链强度评估

强证据

  • 同一实验框架中同时扫描模型参数量、训练数据量和训练计算量,并用统一 loss 口径拟合 power-law。
  • 论文给出 NNDDCC 三个维度的独立和联合 scaling 关系,支撑“规模变量可预测 loss”的主结论。
  • sample efficiency、critical batch size 和 transfer across distributions 都和主 scaling 观察相互印证。

中等强度证据

  • shape weak dependence 支撑“参数量主导”的经验判断,但覆盖的是当时的 dense Transformer / recurrent Transformer 设计空间。
  • compute-efficient training 建议在当时数据、模型和优化条件下成立,后续 Chinchilla-style data-optimal scaling 对数据配比给出了不同校准。

需要谨慎的推论

  • 将这些指数直接外推到 frontier MoE、多模态、长上下文和 RL post-training,会混入架构、数据质量、目标函数和服务约束变化。
  • loss scaling 可以指导预训练预算规划,但不能直接推出 reasoning、agentic tool use 或 safety behavior 的 scaling 规律。

主要启发

  • Scaling law 是预算规划工具,需要同时记录拟合区间、数据口径、模型族和训练目标。
  • Kaplan-style 与 Chinchilla-style 结论应作为不同阶段的经验基线一起保留,避免把单一历史公式当成永久 compute-optimal recipe。
  • 后续模型报告若只给 benchmark 而缺少 NNDDCC、batch、token budget 和 loss 曲线,难以进入同一类可复查 scaling 分析。

局限

  • 理论解释不足:论文明确承认尚无稳固理论解释这些 scaling laws,尤其是 model size 与 compute scaling 的来源。
  • 数据配方单一:主要基于 WebText2,结果可能受 2020 年前后的网页文本采样、去重、质量过滤和 tokenizer 影响。
  • 模型架构边界:实验以 decoder-only Transformer 和 context length 1024 为主;长上下文、MoE、多模态、retrieval-augmented training 或现代 normalization / optimizer recipe 会改变细节。
  • compute 估算简化:C6NBSC\approx6NBS 忽略与 context length 相关的 attention compute;当 nctxn_{\rm ctx} 很大时,这个近似会低估长上下文成本。
  • small-data regime 研究不足:论文承认对小数据区域拟合较差,也没有系统探索 regularization 和 data augmentation。
  • 超参数调优有限:学习率、初始化、momentum、短训高学习率等因素可能影响 scaling curve。
  • 历史 prescription 需要校正:本文的 compute-efficient conclusion 倾向更大模型和更少 token;后续 data-optimal scaling 工作会强调更多训练 token 和更均衡的 model/data allocation。
  • 指标局限:cross-entropy loss 是 next-token prediction 指标,不能直接替代 reasoning robustness、tool-use success、安全性、instruction following 或 reward hacking 风险。

跨论文关系

  • Chinchilla:Chinchilla 直接重估 compute-optimal frontier,将 Kaplan 偏向扩大参数量的资源分配修正为参数量和训练 token 近似等比例增长。
  • Interplay:Kaplan 描述 pretraining loss 随参数、数据和计算的变化;Interplay 继续拆解 pre-training exposure、mid-training bridge、edge-of-competence data 和 process reward 对 reasoning 的共同作用。
  • DeepSeek-R1DAPOProRLBroRL:本文提供 pretraining 的 N,D,CN,D,C scaling axis,后续论文分别扩展 RL recipe、训练步数、rollout length 和 rollout width 等 post-training scaling axis。
  • Muon curvature:本文给出宏观 loss scaling law,Muon 论文从 update direction 与 curvature 解释优化器改变训练效率的局部机制。
  • HybridFlowtool-calling RLTIM / VeXact:Kaplan 的 C6NBSC\approx6NBS 只覆盖简化 pretraining compute;RLHF/RLVR 还需计入 rollout、verifier、工具等待、长轨迹和 sampler-trainer consistency。

Reference Intake Brief

可引用用途:

  • 作为 neural language model scaling laws 的基础引用。
  • 引用 pretraining compute 近似:C6NBSC\approx6NBS
  • 引用 loss 随 model size、dataset size、compute 的 power-law 关系。
  • 引用 non-embedding parameters 作为更稳定 model size 指标。
  • 引用 larger models are more sample-efficient 的早期系统证据。
  • 引用 compute-efficient frontier:更大模型、更少 steps、更早停止。

引用时需要加边界:

  • 如果讨论现代 compute-optimal training,需要说明本文是 2020 OpenAI/Kaplan scaling law 基线,2203.15556 等后续 data-optimal scaling 对 model/data allocation 做了重要修正。
  • 如果讨论 reasoning model、RLVR 或 post-training,应把本文限定在 pretraining next-token loss,不直接外推到 pass@kk、tool use、agentic tasks 或 safety behavior。
  • 如果讨论长上下文系统成本,需要额外引入 attention compute、KV cache、prefill/decode split 和 serving / training backend 细节。

OpenReview / 审稿意见吸收

  • Venue status: 当前档案未记录公开 peer-review 状态。
  • Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
  • Ratings / confidence: 无公开评分可用于校准。
  • Reviewer consensus: 暂无。
  • Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
  • Author response: 暂无公开 rebuttal 记录。
  • 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。

本地讨论补充

  • 本文在当前论文目录中应作为 pretraining scaling 基线保存。后续讨论 RLVR、tool-use RL、optimizer、MoE training 或 serving systems 时,可以用它提供的 N,D,CN,D,C 语言明确“能力从哪里来、compute 花在哪里”。
  • 对今天的实践而言,本文最值得保留的是方法论:用跨数量级实验拟合简单 law,并把训练选择写成资源分配问题。具体 prescription 需要和后续数据最优训练、现代 tokenizer/data mixture、long context、MoE 和 post-training pipeline 一起复核。
  • 与用户此前关注的 RLVR gain 来源问题相连:本文解释 pretraining loss 和 base capability 如何随资源扩大;后续 RL 论文讨论的是在这个 base capability 上,reward、rollout 和训练系统怎样改变可采样轨迹的概率与覆盖。
  • 关于 DDBSBSC6NBSC\approx6NBS 的符号澄清:论文 notation 中 DD 是 dataset size in tokens,BSBS 是 processed tokens / data examples processed。若同一数据集训练多轮,实际 processed tokens 可以远大于 dataset size;若单 epoch 且无数据复用,二者才相等。论文在 compute-efficient allocation 里写 D=BSD=B\cdot S,隐含的是“单 epoch、没有数据复用时需要准备的新数据量”,并在 contradiction section 里明确说这种单 epoch 数据用量只按 Cmin0.26C_{\min}^{0.26} 左右增长,慢于控制过拟合所需的 DN0.74Cmin0.54D\propto N^{0.74}\propto C_{\min}^{0.54}。这说明作者自己也意识到:仅靠重复处理 token 可以增加 compute,但不能等价替代更大的独立数据集;一旦进入 data-limited / overfitting 区域,重复 token 的收益会受 L(D)L(D) 下界约束。
  • 关于负幂律和取对数的澄清:L(C)=ACαL(C)=A C^{-\alpha}CC 本身取半对数图不会变成直线,因为 logL=logAαlogC\log L=\log A-\alpha\log C 仍然依赖 logC\log C。它在 log-log plot 中是直线,横轴用 logC\log C、纵轴用 logL\log L,斜率为 α-\alpha。指数律 L(C)=AekCL(C)=A e^{-kC} 才会在 semi-log plot 中给出 logL=logAkC\log L=\log A-kC 的直线。若存在 irreducible loss floor,更合适的形式会是 L(C)=L+ACαL(C)=L_\infty+A C^{-\alpha},此时应看 log(LL)\log(L-L_\infty)logC\log C,Kaplan 论文是在观测范围内先用无 floor 的 power-law 近似。