2203.15556-training-compute-optimal-large-language-models
Training Compute Optimal Large Language Models
这篇论文用 400 多个不同规模和 token 预算的 Transformer 训练 run 重新估计 compute-optimal pretraining frontier,结论直接修正 Kaplan scaling laws:在固定训练 FLOPs 下,最优 dense LM 应让模型参数量和训练 token 数近似等比例增长,两者都随计算预算的平方根扩展。作者据此训练 70B Chinchilla,用与 280B Gopher 近似相同的训练 compute、约 4 倍 token,显著超过 Gopher、GPT-3、Jurassic-1 和 MT-NLG,核心信息是:很多早期大模型按当时 compute budget 看过大且训练 token 不足,数据规模和数据质量是继续 scaling 的一等约束。
Source
- Title: Training Compute-Optimal Large Language Models
- arXiv: https://arxiv.org/abs/2203.15556
- HTML v1: https://ar5iv.labs.arxiv.org/html/2203.15556
- PDF v1: https://arxiv.org/pdf/2203.15556
- TeX Source v1: https://arxiv.org/e-print/2203.15556
- DOI: https://doi.org/10.48550/arXiv.2203.15556
- Code/Project: 未在 arXiv metadata 或论文源码中发现官方代码链接;model card 明确 Chinchilla 不公开。
- Authors: Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch, Elena Buchatskaya, Trevor Cai, Eliza Rutherford, Diego de Las Casas, Lisa Anne Hendricks, Johannes Welbl, Aidan Clark, Tom Hennigan, Eric Noland, Katie Millican, George van den Driessche, Bogdan Damoc, Aurelia Guy, Simon Osindero, Karen Simonyan, Erich Elsen, Jack W. Rae, Oriol Vinyals, Laurent Sifre
- Submitted: 2022-03-29
- Current version read: v1, submitted Tue, 29 Mar 2022 13:38:03 UTC
- Subjects: Computation and Language (
cs.CL); Machine Learning (cs.LG) - Core artifacts: Chinchilla 70B, Gopher 280B comparison, MassiveText, three compute-optimal scaling estimators, MMLU / BIG-bench / The Pile / QA / bias / toxicity evaluations.
作者与关系
- Jordan Hoffmann: DeepMind.
- Sebastian Borgeaud: DeepMind.
- Arthur Mensch: DeepMind.
- Elena Buchatskaya: DeepMind。
- Trevor Cai: DeepMind。
- Eliza Rutherford: DeepMind。
- Diego de Las Casas: DeepMind。
- Lisa Anne Hendricks: DeepMind。
- Johannes Welbl: DeepMind。
- Aidan Clark: DeepMind。
- Tom Hennigan: DeepMind。
- Eric Noland: DeepMind。
- Katie Millican: DeepMind。
- George van den Driessche: DeepMind。
- Bogdan Damoc: DeepMind。
- Aurelia Guy: DeepMind。
- Simon Osindero: DeepMind。
- Karen Simonyan: DeepMind。
- Erich Elsen: DeepMind。
- Jack W. Rae: DeepMind;Gopher 相关研究线核心作者之一。
- Oriol Vinyals: DeepMind。
- Laurent Sifre: DeepMind.
阅读目标与判断边界
本笔记关注:
- 论文如何从 Kaplan 的
语言推进到 data-optimal / Chinchilla scaling。 - 三种 compute-optimal frontier 估计方法各自控制了什么变量。
- Chinchilla 对 Gopher 的验证是否足以支持“更小模型 + 更多 token”的结论。
- 它如何影响当前目录中 pretraining、RLVR、optimizer 和 training systems 论文的关系图谱。
判断边界:
- 本文研究的是 dense autoregressive Transformer 的 pretraining loss 与 downstream evaluation;MoE、retrieval、instruction tuning、RLHF/RLVR、agentic tool use 需要单独分析。
- 论文把
明确用作 seen training tokens,需要和 unique dataset size 区分;appendix 中说明 scaling runs 处在少于一个 epoch 的 regime,Chinchilla 的 MassiveText 子集则有少量重复,尤其 Wikipedia 约 3.40 epochs。 - Chinchilla 与 Gopher 的对比非常强,但二者除了参数和 token 数之外,还存在 AdamW、tokenizer、batch size、数据 sampling distribution、optimizer state precision 等差异;论文用小规模 ablation 缓解这个 confound,仍需谨慎。
- 模型 card 明确 Chinchilla 不公开,因此后续研究主要复用 scaling law 和实验结论,难以直接复现实物模型。
论文脉络
1. 问题背景:大模型竞赛中的 token undertraining
Kaplan scaling laws 建立了一个强影响力结论:随着 compute 增加,compute-efficient frontier 更偏向扩大模型,训练 token 数增长较慢。按 Kaplan 的指数,compute 增加
Chinchilla 论文认为这一结论来自实验设计和外推方式的偏差。当时许多大模型都围绕约 300B training tokens 训练:GPT-3 175B 用 300B tokens,Jurassic-1 178B 用 300B tokens,Gopher 280B 用 300B tokens,MT-NLG 530B 用 270B tokens。模型继续变大,token budget 基本停在同一数量级,导致 large dense models 在给定 compute 下处于 undertrained 状态。
本文的问题定义是:
其中
差别很小,不影响 scaling 分析。
2. 和 Kaplan 的核心差异
论文指出与 Kaplan 的方法差异主要有三点。
第一,Kaplan 的许多 run 使用固定 training token 数和固定 learning-rate schedule。这会让中途截取的较短训练点处在 learning-rate schedule 不匹配状态,低估短 token 训练的效果。Chinchilla 论文发现 cosine cycle length 应该大致匹配目标训练 token 数,若 schedule 长度超过目标步数太多,final loss 会变差。
第二,本文训练了更多中大规模模型,参数范围从约 70M 到 16B,训练 token 从 5B 到 500B,并且 majority runs 大于 500M 参数。作者认为 Kaplan 的许多 run 小于 100M 参数,低 compute 区域对高 compute frontier 的外推会产生偏差。
第三,本文直接把
3. 三种估计 compute-optimal frontier 的方法
Approach 1: 固定模型大小,改变训练 token 数
作者对一组模型大小训练多个 cosine schedule horizon。对每条训练曲线进行 smoothing 和 interpolation,得到任意 FLOP 下的 training loss。然后在 1500 个 logarithmically spaced FLOP values 上,寻找所有 run 中 loss 最低的点,记录对应的模型大小
最后拟合:
Approach 1 得到:
直觉上,它直接从训练曲线 envelope 上读取“同一 FLOP 下哪组
Approach 2: IsoFLOP profiles
作者固定若干 FLOP budgets,从
Approach 2 得到:
这比 Approach 1 更像显式控制实验:固定总 compute,扫描模型大小,直接找最优
Approach 3: 拟合参数化 loss surface
作者提出:
其中
拟合结果约为:
在
其中:
Approach 3 得到:
这个方法在高 compute 处预测更小的 optimal model,因为作者观察到 FLOP-loss frontier 在大规模处有轻微 concavity。
4. 统一结论:模型和 token 近似等比例增长
三种方法给出的结论非常接近:
| 方法 | ||
|---|---|---|
| Training curve envelope | ||
| IsoFLOP profiles | ||
| Parametric loss model | ||
| Kaplan 2020 |
这意味着 compute 增加时,模型参数和训练 token 都应该近似按平方根增长。例如 compute 增加
这也是 “Chinchilla scaling” 的核心:在 dense LM pretraining 中,很多 2020-2022 年的大模型 token budget 偏低,继续扩大 dense 参数量之前,需要先同步扩大高质量训练 token。
5. Chinchilla: 对 Gopher compute budget 的直接验证
论文估计,在 Gopher 训练 compute budget 下,optimal dense model 大约应落在 40B 到 70B 参数之间。作者选择训练 70B Chinchilla,使用与 Gopher 近似相同训练 compute,但参数量为 70B,训练 token 数为 1.4T。对照 Gopher:280B 参数,约 300B tokens。
简化地看:
架构和训练设置:
- Chinchilla: 70B, 80 layers, 64 heads, key/value size 128,
。 - Gopher: 280B, 80 layers, 128 heads,
。 - Chinchilla max LR
,Gopher max LR 。 - Chinchilla batch size 1.5M tokens 到 3M tokens,Gopher 3M 到 6M。
- Chinchilla 使用 MassiveText,与 Gopher 同源,但 sampling distribution 略有调整。
- Chinchilla 使用 AdamW,Gopher 使用 Adam。
- Chinchilla 使用略改的 SentencePiece tokenizer,不做 NFKC normalization;作者认为这改善数学和化学表示。
- forward/backward 使用
bfloat16,optimizer state 保存float32权重副本。
数据构成中,MassiveWeb、Books、C4、News、GitHub、Wikipedia 按不同比例采样;在 1.4T tokens 中,MassiveWeb 约 1.24 epochs,Wikipedia 约 3.40 epochs,其余主要少于一个 epoch。这一点说明 Chinchilla 实物训练已接触少量 multi-epoch / data reuse,而 scaling runs 的结论主要来自少于一个 epoch 的 setting。
6. 评测结果:更小模型显著超过更大模型
Chinchilla 在大量下游任务上超过 Gopher,并常超过更大的 GPT-3、Jurassic-1 和 MT-NLG。
关键结果:
- MMLU 5-shot: Chinchilla 67.6%,Gopher 60.0%,GPT-3 43.9%;比 Gopher 高 7.6 个百分点。
- BIG-bench: Chinchilla 平均 65.1%,Gopher 54.4%,提升 10.7 个百分点;62 个任务中仅 4 个低于 Gopher。
- The Pile: Chinchilla 在所有 Pile subsets 上超过 Gopher;对 Jurassic-1 只在
dm_mathematics和ubuntu_irc两个 subset 落后。 - Wikitext103: Chinchilla perplexity 7.16,Gopher 7.75。
- RACE-m / RACE-h: Chinchilla 比 Gopher 提升超过 10 个百分点。
- LAMBADA: Chinchilla 77.4%,Gopher 74.5%,MT-NLG 76.6%。
- TruthfulQA: Chinchilla 0-shot 43.6%、5-shot 58.5%、10-shot 66.7%;Gopher 0-shot 29.5%、10-shot 43.7%。
- Natural Questions closed-book: Chinchilla 5-shot 31.5%、64-shot 35.5%,超过 Gopher 的 24.5%、28.2%。
这组结果的意义在于:Chinchilla 的优势同时体现在 pretraining loss、知识、阅读理解、问答、常识和 BIG-bench 任务上。
7. Bias / toxicity: 能力提升未自动解决安全问题
论文包含 Winogender 和 toxicity 评测。
Winogender 中,Chinchilla 总体 coreference resolution 优于 Gopher:overall 78.3% vs 71.4%。但不同 pronoun group 的提升幅度不同,男性 pronoun 提升较小,女性和 neutral pronoun 提升较大。作者据此认为 Chinchilla 仍然存在 bias。
Toxicity 方面,作者用 25,000 个 unprompted samples 和 Perspective API 比较。Gopher mean / median toxicity score 为 0.081 / 0.064,Chinchilla 为 0.087 / 0.066;95th percentile 分别为 0.230 和 0.238。差异很小,说明更低 language modeling loss 没有自动降低 unconditional generation toxicity。
model card 中也写明:Chinchilla 主要用于 DeepMind 内部 research,不公开;harmful or deceitful generation 属于 out-of-scope uses;模型不应用于下游应用,除非先做进一步 safety 和 fairness mitigation。
关键实验/定理
结果 1: 三种估计方法都支持 equal scaling
- 设置:训练 400 多个模型,参数从约 70M 到 16B,tokens 从 5B 到 500B;分别用 training curve envelope、IsoFLOP profiles、parametric loss model 估计
和 。 - 指标:pretraining loss under fixed FLOPs。
- 结果:三种方法分别得到
、 、 。 - 解读:dense LM 的 compute-optimal frontier 更接近参数和 token 同步扩大。
结果 2: Chinchilla 验证 Gopher budget 下的预测
- 设置:Gopher 280B / 300B tokens vs Chinchilla 70B / 1.4T tokens;训练 compute 近似相同。
- 指标:language modeling、MMLU、BIG-bench、reading comprehension、QA、common sense、TruthfulQA。
- 结果:Chinchilla 在绝大多数任务上超过 Gopher,并在 MMLU 达到 67.6%。
- 解读:同 compute 下,更多 token 的较小模型可以超过更大但 token 不足的模型。
结果 3: learning-rate schedule 需要匹配 token budget
- 设置:改变 cosine cycle length,比较 target training steps 与 schedule length 不匹配时的 final loss。
- 指标:pretraining loss。
- 结果:cosine cycle length 超过目标步数 25% 以上会明显损害性能。
- 解读:估计 compute-optimal frontier 时不能简单截取长 schedule 的中间点;schedule mismatch 会低估短 token training 的效果。
结果 4: 跨数据集重复 IsoFLOP 分析
- 设置:在 C4 和 GitHub code 数据上进行 IsoFLOP profiles。
- 指标:
、 。 - 结果:C4 得到
;GitHub 得到 。 - 解读:在不超过一个 epoch 的条件下,equal-ish scaling 不只出现在 MassiveText。
证据链强度评估
强证据
- 三种不同估计方法给出接近一致的 model/token scaling exponent,且和 Kaplan 0.73/0.27 明显不同。
- Chinchilla vs Gopher 是大规模直接验证:同 compute、较小模型、更多 token,结果显著更好。
- 对 Kaplan 的小规模 head-to-head comparison 在
FLOPs 下支持本文预测。
中等强度证据
- C4 / GitHub 的 IsoFLOP 复验支持跨数据集一致性,但规模和数据处理仍有限。
- AdamW / optimizer state precision ablation 说明 Chinchilla 与 Gopher 的 recipe 差异有影响,但主要结论仍由 token/parameter allocation 支撑。
- Bias / toxicity 评测说明能力提升与 safety 指标之间的关系复杂,但评测覆盖有限。
需要谨慎的推论
- 向 1T、10T 参数或
FLOPs 以上外推存在较大不确定性;作者观察到 high-compute frontier 有 concavity。 - 多 epoch 训练、重复数据、数据去重、数据质量、synthetic data 和 curriculum 会改变
的含义。 - Chinchilla 优于 Gopher不能单独归因于 token 数;optimizer、tokenizer、batch、data mixture 都是 confound。
- 对 RLVR、tool use 或 instruction following 的 downstream capability 不能只用 pretraining loss scaling 推断。
OpenReview / 审稿意见吸收
- Venue status: 当前档案未记录公开 peer-review 状态。
- Public reviews: 当前档案未记录可可靠匹配的 OpenReview / ARR / 会议 reviewer comments。
- Ratings / confidence: 无公开评分可用于校准。
- Reviewer consensus: 暂无。
- Main criticisms: 暂无公开 reviewer 质疑可引用;可信度主要由论文、技术报告、项目证据和本地一致性检查决定。
- Author response: 暂无公开 rebuttal 记录。
- 对本文可信度的影响: 按未完成公开审稿吸收处理,结论需要依赖实验设置、baseline 强度、复现证据和跨论文一致性校准。
本地讨论补充
- 本文是对 2001.08361 的核心修正:Kaplan 给出
、 ;Chinchilla 给出接近 、 。这也是后续讨论“base model 是否 undertrained”的标准坐标。 - 结合我们对 Kaplan 中
和 的讨论,Chinchilla 论文更明确地把 用作 seen training tokens,并且在 single-epoch / infinite-data regime 下建模。实践中若存在重复采样, 与 仍需分开记录。 - 对 RLVR 论文而言,Chinchilla 的意义在于:post-training gain 的上游底座受 pretraining token exposure 强烈影响。若 base model 的 token budget 偏低,RLVR 观察到的“能力边界”可能混合了 pretraining underexposure 与 reward optimization 效应。
- 对 serving / deployment 而言,Chinchilla 的重要启发是:同 compute 训练出的更小模型不仅 pretraining loss 更好,inference memory 和 fine-tuning cost 也更低。这让 compute-optimal training 同时影响训练经济性和部署经济性。
主要启发
- Pretraining compute allocation 中,参数规模和 token 规模都要作为一等变量;固定 token 数扩参数会快速进入 undertrained regime。
- Learning-rate schedule 是 scaling law 实验的一部分;schedule 与目标训练长度不匹配会污染 frontier 估计。
- 数据规模已经成为继续 scaling 的核心瓶颈,但论文也提醒数据质量、train-test overlap、隐私和偏见会同步放大。
- 更低 LM loss 会改善大量能力指标,但不会自动解决 toxicity、bias 和 harmful use 风险。
- 与 RL/post-training 论文结合时,应先判断 base model 是否 data-optimal,再解释 RL 是否真正扩展能力边界。
局限
- 大规模验证点数量有限:真正同级别的 comparable run 主要是 Chinchilla 与 Gopher,缺少多个 intermediate-scale validation runs。
- Power-law frontier 假设可能过强:appendix 观察到 high-compute frontier 有 concavity,外推到更大规模可能继续偏向更小模型。
- Scaling runs 少于一个 epoch;实际 Chinchilla 数据子集有不同程度复用,multi-epoch regime 仍需研究。
- Chinchilla 和 Gopher 的 recipe 差异带来 confound,包括 AdamW、tokenizer、batch size、data mixture 和 optimizer precision。
- 评测可能受数据污染影响;论文对 language modeling benchmarks 特别提醒 Chinchilla 训练了 4 倍数据,train/test leakage 可能抬高部分结果。
- 论文主要覆盖 English-heavy MassiveText 和 dense autoregressive Transformer,跨语言、多模态、MoE、retrieval、instruction tuning 和 RLHF/RLVR 需要额外校准。
- 更大数据集引入更多隐私、偏见和毒性内容总量,数据治理成本与 scaling 同步增长。
跨论文关系
- 与 2001.08361:直接修正关系。Kaplan 建立
scaling law 基线,Chinchilla 重新估计 compute-optimal model/token allocation,将最优增长从 改为约 。 - 与 2512.07783:Interplay 使用 Chinchilla-style token-equivalent compute 讨论 pre-training、mid-training 和 RL 分配;本文提供该 compute scaling 语境的经典基础。
- 与 2501.12948:DeepSeek-R1 的 reasoning RL 建立在强 base model 上;Chinchilla 解释 base pretraining 阶段 token exposure 如何影响 base capability。
- 与 2503.14476、2505.24864、2510.01180:这些论文研究 post-training / RLVR scaling axis;Chinchilla 给出 pretraining axis 的 data-optimal 校准。
- 与 2606.04662:Chinchilla 属于 macro allocation;Muon 属于 optimizer update geometry。两者都影响同一 pretraining efficiency 问题。
- 与 2409.19256 和 2606.00135:Chinchilla 的
适合 dense pretraining;RLHF/RLVR 与 tool-use training 需要额外记录 rollout、reference/reward/verifier、工具返回和长轨迹 compute。
Reference Intake Brief
Target
- Intended target system: 论文阅读目录中的 pretraining scaling / compute-optimal training 主题。
- Existing related assets: 2001.08361;2512.07783;2606.04662;
content/utility/papers-index.md。 - Proposed form: 新建独立 Markdown 文档;更新当前收录和 pretraining scaling laws 跨论文关系。
Reusable Elements
- Compute-optimal dense LM scaling rule:
、 。 - Parametric loss model:
。 - Chinchilla vs Gopher empirical validation: 70B / 1.4T vs 280B / 300B under similar compute.
- Data governance warning: scaling tokens also scales privacy, bias, train-test overlap and toxic content risks.
Risks
- Copyright/over-copying: 本笔记只保留短公式、关键数值和本地分析,不复制长段论文原文。
- Tone/brand mismatch: 以科学分析为主,避免宣传式描述 Chinchilla。
- Safety/compliance issues: 论文属于非攻击性安全材料;bias/toxicity 讨论保留评测和限制,不沉淀滥用流程。
- Overlap with existing assets: 与 2001.08361 高度相关,需要同步更新跨论文关系与旧笔记中的 Chinchilla 引用。
Skipped
| Material | Reason |
|---|---|
| 完整 MMLU/BIG-bench 明细表 | 数值太长,保留汇总和关键例外即可。 |
| 完整 FLOPs per architecture 逐项公式 | 保留 |
| model card 全文 | 只提取 availability、intended use、风险和限制。 |
Recommendation
Decision: merge
Why: 本文是 pretraining scaling law 讨论中的关键节点,直接修正 Kaplan 2020 并影响后续所有关于 base model、RLVR gain 来源、optimizer efficiency 和 training compute accounting 的讨论。