2001.08361-scaling-laws-neural-language-models
Scaling Laws for Neural Language Models
这篇论文把语言模型训练从“单次大模型实验”推进到可拟合的经验规律:cross-entropy loss 随模型参数量、训练数据量和训练计算量呈稳定 power-law;在当时的实验范围内,模型 shape 和许多超参数影响较弱,更大的模型具有更高 sample efficiency;论文据此推出 compute-efficient training 应优先扩大模型、减少训练步数,并在远未完全收敛时停止。现代阅读时要把它作为 pretraining scaling laws 的历史基准,同时和后续 data-optimal scaling 结论对照使用。
Source
- Title: Scaling Laws for Neural Language Models
- arXiv: https://arxiv.org/abs/2001.08361
- HTML v1: https://ar5iv.labs.arxiv.org/html/2001.08361
- PDF v1: https://arxiv.org/pdf/2001.08361
- TeX Source v1: https://arxiv.org/e-print/2001.08361
- DOI: https://doi.org/10.48550/arXiv.2001.08361
- Code/Project: 未在 arXiv metadata 或论文源码中发现官方代码链接。
- Authors: Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B. Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, Dario Amodei
- Submitted: 2020-01-23
- Current version read: v1, submitted Thu, 23 Jan 2020 03:59:20 UTC
- Subjects: Machine Learning (
cs.LG); Machine Learning (stat.ML) - Core artifacts: WebText2 dataset, decoder-only Transformer scaling runs, LSTM / recurrent Transformer comparison, compute-efficient training frontier.
作者与关系
- Jared Kaplan: Johns Hopkins University and OpenAI.
- Sam McCandlish: OpenAI;与 Jared Kaplan 共同 led the research。
- Tom Henighan: OpenAI.
- Tom B. Brown: OpenAI.
- Benjamin Chess: OpenAI.
- Rewon Child: OpenAI.
- Scott Gray: OpenAI.
- Alec Radford: OpenAI.
- Jeffrey Wu: OpenAI.
- Dario Amodei: OpenAI.
阅读目标与判断边界
本笔记关注:
- 论文如何定义语言模型 scaling law 的三个核心变量:model size、dataset size、compute。
- 它如何从单变量 power-law 推到 joint scaling 与 compute-efficient frontier。
- 它的结论如何影响后续大模型预训练、post-training、RLVR scaling 和训练系统设计。
- 它在今天的解读边界,尤其是数据规模、训练 token 预算、模型架构和 2203.15556 带来的 Chinchilla-style 校正。
判断边界:
- 本文实验集中在 decoder-only Transformer、WebText2、context length 1024 和 2020 年前后的训练配方上。
- 论文中的
是 non-embedding parameters,意图去掉词表 embedding 和 position embedding 对小模型 scaling 的干扰。 - 论文的 compute-efficient prescription 来自当时可观测范围内的经验拟合,后续更大数据、更长训练和不同数据配方会改变最优 model/data allocation。
- 本文目标是预测 next-token cross-entropy loss;reasoning、instruction following、tool use、safety behavior 和 RLVR gain 需要通过后续论文补充分析。
论文脉络
1. 问题背景:把大模型训练变成可预测工程问题
论文要回答的问题很直接:如果我们有更多参数、更多 token 或更多 compute,语言模型 loss 会如何下降?
在这篇论文之前,研究者已经观察到“大模型通常更好”,但很难把未来模型训练变成可计算的资源分配问题。本文用大量 Transformer 训练 run 说明,在相当宽的范围内,loss 与资源之间可以用简单 power-law 描述。这个判断给后续大模型训练带来一个很实用的视角:先估计 compute budget,再根据 scaling law 推 model size、batch size、training steps 和数据需求。
论文的核心变量是:
训练 compute 的近似形式为:
其中
这套记号后来成为讨论 pretraining compute 的常用语言。当前归档里的 2512.07783 也用类似 token-equivalent compute 方式比较 pre-training、mid-training 和 RL 成本。
2. 实验对象:WebText2 与 decoder-only Transformer
数据集是 WebText2:它扩展了 GPT-2 使用的 WebText,从 Reddit outbound links 中收集网页文本,包含约 20.3M documents、96GB text、约
模型主要是 decoder-only Transformer,non-embedding 参数规模从 768 到 1.5B。作者还训练 LSTM 和 recurrent / Universal Transformer 作为对照,用来判断 scaling law 是否只来自某个特定架构细节。
训练配方大体固定:Adam optimizer,固定
3. 单变量 scaling laws: 、 、 都呈 power-law
论文最有影响力的结果是三个单变量 power-law。
固定足够多数据和训练时,loss 随模型参数量下降:
固定模型足够大和训练足够充分时,loss 随数据量下降:
固定 compute budget,并选择最省 compute 的训练方式时,loss 随 compute 下降:
这些指数都很小,含义是 loss 下降很稳定,但边际收益递减强。比如 compute 增加很多倍,loss 只会按很慢的幂率下降。这也是大模型训练极度依赖资源规模的根源之一。
4. 模型 shape 影响较弱,non-embedding 参数量是更清晰的尺度
论文系统改变 depth、width、attention heads、feed-forward dimension 和 aspect ratio,发现只要总 non-embedding 参数量相同,模型 shape 对最终 loss 的影响相对小。作者甚至比较了非常不同的 shape,例如浅而宽与深而窄的模型,结果仍落在近似同一 scaling curve 附近。
这给出一个重要结论:在研究跨数量级 scaling 时,
论文还强调要排除 embedding 参数。对小模型而言,vocabulary embedding 和 positional embedding 会在总参数量中占很大比例,但它们对模型有效容量的贡献不同。使用 non-embedding parameters 后,loss curve 更平滑。
5. 大模型更 sample-efficient,joint 描述过拟合边界
论文的另一个关键发现是:大模型在相同 token 数下通常能学得更快,因此更 sample-efficient。换句话说,增加
论文用一个 joint scaling formula 描述模型大小和数据量共同决定 loss:
这个式子表达了两个瓶颈的叠加:参数不足会带来 model-limited loss,数据不足会带来 data-limited loss。若想把过拟合维持在相近水平,数据量需要随模型规模增长:
这个 exponent 小于 1,构成本文后续 compute-efficient 结论的重要前提:模型规模增长很快,数据增长相对慢。2203.15556 会重新审视这个比例,因此本文的 data allocation 结论在现代实践中需要谨慎使用。
6. Batch size:临界 batch 由 loss 主导
论文还研究 batch size。核心概念是 critical batch size:当 batch size 小于某个临界值时,增加 batch 通常能提高并行效率;超过临界值后,继续增大 batch 的收益迅速下降。
论文给出经验式:
重要点在于
7. Compute-efficient frontier:更大的模型、更少的 steps、更早停止
论文把 learning curve 拟合为:
在固定 compute 下,代入
对应的资源分配趋势是:
这组式子的直观含义很强:当 compute 增加时,本文的最优策略会把大部分新增 compute 用来扩大模型,训练步数几乎不增加,数据 token 数只缓慢增加。
论文还推导出 compute-efficient training 应在距离该模型完全收敛 loss 约固定比例处停止:
由于
这就是本文最著名、也最容易被后续修正的结论:在给定 compute 下,优先训练更大的模型,并让它更早停。
8. Transfer:不同数据分布上的 loss 保持近似平移关系
论文还检查从 WebText2 training distribution 到其他文本分布的 transfer,包括 Books、Common Crawl、Wikipedia、Internet Books 等。结果显示,模型在目标分布上的 loss 会随 WebText2 loss 平滑改善,很多分布之间呈近似 constant offset。
这个结果支持一个实用判断:在相近语言建模任务上,训练分布 loss 可以作为跨分布能力提升的代理指标。它也解释了为什么 pretraining loss 曾长期被用作 foundation model 能力的核心信号。
不过,这个结论主要覆盖 next-token prediction 的平均 loss。对 instruction following、reasoning、tool use、安全约束或长链条 agent behavior,loss 和目标能力之间的关系会变复杂。当前归档里的 RLVR 和 safety 论文基本都在处理这个 gap。
9. 和后续论文的关系:pretraining scaling 是上游坐标系
本文建立的是 pretraining 阶段的 scaling 坐标系。它回答“在 next-token prediction 上,参数、数据和 compute 怎样换 loss”。当前归档中的许多论文则回答另一个层面的问题:给定一个 base model 之后,RL、verifier、reward、serving backend 和 optimizer 如何改变能力表现。
和 2512.07783 的关系最直接:后者讨论 pre-training exposure、mid-training 和 RL 如何共同决定 reasoning 能力边界;本文提供 pre-training compute 和 loss scaling 的历史语言。Interplay 论文中的 edge-of-competence、primitive seed 和 token-equivalent compute,可以看作对本文“pretraining loss”视角的能力层扩展。
和 2501.12948 的关系是上游与下游:DeepSeek-R1 依赖强 base model 的 latent capability,再用 GRPO / verifiable reward 激发 long-CoT reasoning;本文解释强 base model 在预训练阶段为什么会随
和 2503.14476、2505.24864 与 2510.01180 的关系是 scaling axis 的迁移:本文的 scaling axis 是 pretraining
和 2606.04662 的关系是宏观规律与优化器机制:本文在宏观上观察 loss scaling,Muon 论文从 update geometry 和 curvature penalty 解释 optimizer 为什么可能提高 pretraining efficiency。
和 2409.19256、2606.00135、2605.14220 的关系是 compute accounting 的系统化:本文用
关键实验/定理
本文主要是经验 scaling law,没有形式定理。关键实验与结论如下:
- Power-law fits across scales:在超过 7 个数量级的资源变化中,loss 与
、 、 的关系可以用简单 power-law 拟合。 - Model size scaling:固定其他因素时,
, 。 - Dataset size scaling:固定其他因素时,
, 。 - Compute scaling:compute-efficient frontier 上,
, 。 - Shape weak dependence:depth、width、attention heads、feed-forward dimension 和 aspect ratio 的影响弱于 non-embedding 参数量的主趋势。
- Larger models are more sample-efficient:更大模型在相同 token budget 下能达到更低 loss,joint
支持 的过拟合控制关系。 - Critical batch scaling:
主要随 loss 变化, 。 - Compute-efficient training:最优配置倾向
、 、 ;若要求单 epoch 且不复用数据,实际需要的新数据量约随 增长,并在约 10% above converged loss 处停止。 - Architecture comparison:LSTM 在早期 token prediction 上可接近 Transformer,但随 context position 增加劣化更明显;recurrent Transformer 按参数量略有优势,按 compute 评估优势减弱。
- Transfer across distributions:多种文本分布上的 loss 与 WebText2 loss 呈平滑关系,常表现为近似 constant offset。
证据链强度评估
强证据
- 同一实验框架中同时扫描模型参数量、训练数据量和训练计算量,并用统一 loss 口径拟合 power-law。
- 论文给出
、 、 三个维度的独立和联合 scaling 关系,支撑“规模变量可预测 loss”的主结论。 - sample efficiency、critical batch size 和 transfer across distributions 都和主 scaling 观察相互印证。
中等强度证据
- shape weak dependence 支撑“参数量主导”的经验判断,但覆盖的是当时的 dense Transformer / recurrent Transformer 设计空间。
- compute-efficient training 建议在当时数据、模型和优化条件下成立,后续 Chinchilla-style data-optimal scaling 对数据配比给出了不同校准。
需要谨慎的推论
- 将这些指数直接外推到 frontier MoE、多模态、长上下文和 RL post-training,会混入架构、数据质量、目标函数和服务约束变化。
- loss scaling 可以指导预训练预算规划,但不能直接推出 reasoning、agentic tool use 或 safety behavior 的 scaling 规律。
主要启发
- Scaling law 是预算规划工具,需要同时记录拟合区间、数据口径、模型族和训练目标。
- Kaplan-style 与 Chinchilla-style 结论应作为不同阶段的经验基线一起保留,避免把单一历史公式当成永久 compute-optimal recipe。
- 后续模型报告若只给 benchmark 而缺少
、 、 、batch、token budget 和 loss 曲线,难以进入同一类可复查 scaling 分析。
局限
- 理论解释不足:论文明确承认尚无稳固理论解释这些 scaling laws,尤其是 model size 与 compute scaling 的来源。
- 数据配方单一:主要基于 WebText2,结果可能受 2020 年前后的网页文本采样、去重、质量过滤和 tokenizer 影响。
- 模型架构边界:实验以 decoder-only Transformer 和 context length 1024 为主;长上下文、MoE、多模态、retrieval-augmented training 或现代 normalization / optimizer recipe 会改变细节。
- compute 估算简化:
忽略与 context length 相关的 attention compute;当 很大时,这个近似会低估长上下文成本。 - small-data regime 研究不足:论文承认对小数据区域拟合较差,也没有系统探索 regularization 和 data augmentation。
- 超参数调优有限:学习率、初始化、momentum、短训高学习率等因素可能影响 scaling curve。
- 历史 prescription 需要校正:本文的 compute-efficient conclusion 倾向更大模型和更少 token;后续 data-optimal scaling 工作会强调更多训练 token 和更均衡的 model/data allocation。
- 指标局限:cross-entropy loss 是 next-token prediction 指标,不能直接替代 reasoning robustness、tool-use success、安全性、instruction following 或 reward hacking 风险。
跨论文关系
- 与 Chinchilla:Chinchilla 直接重估 compute-optimal frontier,将 Kaplan 偏向扩大参数量的资源分配修正为参数量和训练 token 近似等比例增长。
- 与 Interplay:Kaplan 描述 pretraining loss 随参数、数据和计算的变化;Interplay 继续拆解 pre-training exposure、mid-training bridge、edge-of-competence data 和 process reward 对 reasoning 的共同作用。
- 与 DeepSeek-R1、DAPO、ProRL 和 BroRL:本文提供 pretraining 的
scaling axis,后续论文分别扩展 RL recipe、训练步数、rollout length 和 rollout width 等 post-training scaling axis。 - 与 Muon curvature:本文给出宏观 loss scaling law,Muon 论文从 update direction 与 curvature 解释优化器改变训练效率的局部机制。
- 与 HybridFlow、tool-calling RL 和 TIM / VeXact:Kaplan 的
只覆盖简化 pretraining compute;RLHF/RLVR 还需计入 rollout、verifier、工具等待、长轨迹和 sampler-trainer consistency。
Reference Intake Brief
可引用用途:
- 作为 neural language model scaling laws 的基础引用。
- 引用 pretraining compute 近似:
。 - 引用 loss 随 model size、dataset size、compute 的 power-law 关系。
- 引用 non-embedding parameters 作为更稳定 model size 指标。
- 引用 larger models are more sample-efficient 的早期系统证据。
- 引用 compute-efficient frontier:更大模型、更少 steps、更早停止。
引用时需要加边界:
- 如果讨论现代 compute-optimal training,需要说明本文是 2020 OpenAI/Kaplan scaling law 基线,2203.15556 等后续 data-optimal scaling 对 model/data allocation 做了重要修正。
- 如果讨论 reasoning model、RLVR 或 post-training,应把本文限定在 pretraining next-token loss,不直接外推到 pass@
、tool use、agentic tasks 或 safety behavior。 - 如果讨论长上下文系统成本,需要额外引入 attention compute、KV cache、prefill/decode split 和 serving / training backend 细节。
OpenReview / 审稿意见吸收
- Venue status: 当前档案未记录公开 peer-review 状态。
- Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
- Ratings / confidence: 无公开评分可用于校准。
- Reviewer consensus: 暂无。
- Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
- Author response: 暂无公开 rebuttal 记录。
- 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。
本地讨论补充
- 本文在当前论文目录中应作为 pretraining scaling 基线保存。后续讨论 RLVR、tool-use RL、optimizer、MoE training 或 serving systems 时,可以用它提供的
语言明确“能力从哪里来、compute 花在哪里”。 - 对今天的实践而言,本文最值得保留的是方法论:用跨数量级实验拟合简单 law,并把训练选择写成资源分配问题。具体 prescription 需要和后续数据最优训练、现代 tokenizer/data mixture、long context、MoE 和 post-training pipeline 一起复核。
- 与用户此前关注的 RLVR gain 来源问题相连:本文解释 pretraining loss 和 base capability 如何随资源扩大;后续 RL 论文讨论的是在这个 base capability 上,reward、rollout 和训练系统怎样改变可采样轨迹的概率与覆盖。
- 关于
、 和 的符号澄清:论文 notation 中 是 dataset size in tokens, 是 processed tokens / data examples processed。若同一数据集训练多轮,实际 processed tokens 可以远大于 dataset size;若单 epoch 且无数据复用,二者才相等。论文在 compute-efficient allocation 里写 ,隐含的是“单 epoch、没有数据复用时需要准备的新数据量”,并在 contradiction section 里明确说这种单 epoch 数据用量只按 左右增长,慢于控制过拟合所需的 。这说明作者自己也意识到:仅靠重复处理 token 可以增加 compute,但不能等价替代更大的独立数据集;一旦进入 data-limited / overfitting 区域,重复 token 的收益会受 下界约束。 - 关于负幂律和取对数的澄清:
对 本身取半对数图不会变成直线,因为 仍然依赖 。它在 log-log plot 中是直线,横轴用 、纵轴用 ,斜率为 。指数律 才会在 semi-log plot 中给出 的直线。若存在 irreducible loss floor,更合适的形式会是 ,此时应看 对 ,Kaplan 论文是在观测范围内先用无 floor 的 power-law 近似。