本材料说明:所有数字均复述自论文原文,未做外部验证,出处以 §小节号 / 表号标注。【论文声称】=作者观点;【实验支持】=文中数据支撑;【解读者推断】=精读者推理。
给定固定 FLOPs 预算,模型参数量 N 与训练 token 数 D 应当等比例放大(Nopt∝Ca、Dopt∝Cb,三套方法测得 a≈0.46–0.50、b≈0.51–0.54,Table 2)——即大约每 20 个 token 配 1 个参数。照此,Gopher 的算力预算下最优模型约 40–70B、训 ~1.4T token。作者据此训练了 70B/1.4T 的 Chinchilla,以与 Gopher 280B 相同的算力全面击败 Gopher、GPT-3、Jurassic-1 与 MT-NLG 530B(§Abstract)。
| 摘要短语 | 对应论文章节 | 本精读章 |
|---|---|---|
| "current large models are significantly undertrained" | §1、Table 1(各模型均只训 ~300B token) | 第二章 |
| "over 400 models, 70M–16B params, 5B–500B tokens" | §3(三种估计方法) | 第三章 |
| "model size and tokens should be scaled equally" | §3.1–§3.4、Table 2/3 | 第三章 |
| "Chinchilla 70B, 4× more data, outperforms Gopher" | §4(模型细节与评测) | 第四章 |
| "less compute for fine-tuning and inference" | §1、§5 讨论 | 第五章 |
必读主线:§1 → §3.3(含式2–4 的推导)→ Table 2/3 → §4.2。这条线覆盖"结论如何得出→如何验证"。可跳读支线:附录 A/B/C/D/E/F/G 中除 D.2 外的部分。跳过 §3.1/§3.2 的代价不大,但会看不懂 Table 2 三行数字为何不同。
Table 1 列出当时的巨无霸们:LaMDA 137B/168B token、GPT-3 175B/300B、Jurassic 178B/300B、Gopher 280B/300B、MT-NLG 530B/270B——几乎清一色 ~300B token。原因可直接追溯到 Kaplan et al. (2020) 的建议:预算 ×10 时模型应 ×5.5 而数据仅 ×1.8(§1 引述)。Chinchilla 全文要回答的问题由此定型:min L(N,D) s.t. FLOPs(N,D)=C(式1),其中 FLOPs≈6ND。
学完本章你应能:①写出式1并解释为什么它是个约束优化;②复述 Kaplan 建议(×10 预算→×5.5 模型/×1.8 数据)与本文结论(等比放大)的差别;③说出两个导致旧结论偏差的方法论因素。
70M–10B 参数共 4 组 cosine 周期长度(跨度 16×),从训练曲线包络中提取"每个 FLOP 数下最低损失对应的 (N,D)",在 1500 个对数均匀 FLOP 点上取最小后拟合幂律,得 a=0.50, b=0.50(bootstrap 90% 区间分别为 [0.488,0.502]、[0.501,0.512],Table 2)。附带发现:所有被选中的点都落在各自训练的最后 15% 内——支持"cosine 周期应匹配训练步数"的假设(附录B:超出目标 25% 以上性能明显变差)。
固定 9 档 FLOPs(6×10¹⁸ 到 3×10²¹),每档扫多个模型尺寸(至多 16B),最终损失呈清晰 U 形谷,抛物线拟合定谷底位置,再拟合得 a=0.49, b=0.51。此法直接回答"给定预算该训多大",是三者中最直观的一路【解读者评注】。
| 符号 | 它是什么 | 直觉 |
|---|---|---|
| E | 自然文本熵(Bayes 风险项) | 损失的地板 |
| A/Nα | 函数逼近罚项(容量不足) | 模型太小的代价 |
| B/Dβ | 随机逼近罚项(优化不足) | 单 epoch + 有限步数的代价 |
| G | 由 (α,β,A,B) 决定的尺度常数 | 决定"20 token/参数"的具体倍率 |
推导骨架(附录D.2):风险分解 L(f̄)=L(f*)+(L(f_N)−L(f*))+(L(f̄_N,D)−L(f_N)),三项分别对应熵、容量、优化;理论预期两项 ∝1/N^{1/2} 与 1/D^{1/2} 下界,实测指数 0.34/0.28 都低于 1/2——作者点评"远未达到已知下界,未来模型应努力提高这些系数"。
手算验证:a=β/(α+β)=0.28/0.62≈0.452,b=0.34/0.62≈0.548,与 Table 2 报告的 0.46/0.54 在舍入内一致 ✓。注意:方法三用 Huber(δ=10⁻³) 自动把低预算点的较大残差当离群值压权,这是它给出更小 Nopt 的机制之一(§3.4 作者自己说明)。
Table 3(方法一口径):67B ↔ 1.5T token;175B ↔ 3.7T;280B ↔ 5.9T;520B ↔ 11T;1T ↔ 21.2T。逐行算比值:1.5T/67B≈22.4;3.7T/175B≈21.1;5.9T/280B≈21.1;11T/520B≈21.2;21.2T/1T=21.2——高度稳定的 ~21 token/参数,社区通称"每参数 20 token"即源于此 ✓。交叉核对:Gopher 预算 5.76×10²³ FLOPs(Fig.2 配文);67B 行给 5.76e23 FLOPs ✓ 自洽。另验 FLOPs 公式:6ND=6×67e9×1.5e12≈6.0×10²³ ≈ 5.76e23(差 4%,来自非嵌入参数口径)✓。
常见误读:①"20:1 是铁律"——它是 MassiveText 分布 + 该 FLOPs 定义下的经验中心值,附录 C 显示 C4/GitHub 上指数略有出入(0.53/0.47 vs 0.50/0.50);②"Chinchilla 说明大模型没用"——错,它说的是固定预算下的分配,若数据无限且预算充足大模型仍优;③忽略方法间差异——方法三在大预算端系统性预测更小的模型,作者坦承前沿曲率意味着"我们可能仍高估了最优模型大小"(§5)。
一句话记住本节:三把不同的尺子量出同一个答案——参数与 token 手拉手等比放大,比率约 1:20。
| 项 | Gopher 280B | Chinchilla 70B |
|---|---|---|
| 层数 / 头数 | 80 / 128 | 80 / 64 |
| d_model | 16,384 | 8,192 |
| 最大学习率 | 4×10⁻⁵ | 1×10⁻⁴ |
| batch(token) | 3M→6M | 1.5M→3M(中途加倍) |
| 优化器 / token | Adam / 300B | AdamW / 1.4T |
其他改动:去 NFKC 规范化的 SentencePiece(94.15% 词表与 Gopher 相同,利于数学/化学文本);bf16 计算 + fp32 权重存于分布式优化器状态——注意此处引用了 Rajbhandari et al. (2020),正是第13篇 ZeRO(§4.1)。
| 任务 | Chinchilla | Gopher | 其他参照 |
|---|---|---|---|
| MMLU 5-shot | 67.6% | 60.0% | GPT-3 43.9%;人类专家 89.8%;2023年6月预测 63.4% |
| BIG-bench 均值 | 65.1% | 54.4% | 62 任务中仅 4 项落后 |
| RACE-m / RACE-h | 86.8% / 82.3% | 75.1% / 71.6% | 提升 >10 个百分点 |
| LAMBADA zero-shot | 77.4% | 74.5% | MT-NLG 76.6% |
| Natural Questions 5-shot | 31.5%(新SOTA) | 24.5% | GPT-3 64-shot 仅 29.9% |
| TriviaQA unfiltered 0-shot | 67.0% | 52.8% | GPT-3 64.3% |
| Wikitext103 困惑度 | 7.16 | 7.75 | 作者自警:4×数据可能有泄漏红利 |
MMLU 明细:57 任务中 51 升、2 平、4 降(college_mathematics、econometrics、moral_scenarios、formal_logic);4 个任务上超过 90%(high_school_gov_and_politics 等)。TruthfulQA 0-shot 从 Gopher 29.5% 升至 43.6%(+14.1%)——作者借此反驳"更大模型必然更不真实"的早期结论。公平性脚注(论文自己标注):RACE 上 GPT-3/MT-NLG 使用不同 prompt 格式不可直接比较;语言建模类基准因数据重叠需谨慎解读——这类自我设限在同类论文中并不多见。
一句话记住本节:同样的算力,少 4 倍参数、多 4 倍数据,几乎所有指标全面反超——包括比自家大 7.6 倍的 MT-NLG 530B。
标度分析用的是平滑后的训练损失(作者声明其为测试损失的无偏估计,前提是无重复 epoch——Table A1 却显示 MassiveWeb 1.24 epochs、Wikipedia 3.40 epochs,严格说"无限数据域"假设已被轻微突破【解读者指出】)。下游评测覆盖 150 项任务(Table 5),但全部为 DeepMind 内部按 Gopher 论文协议执行的自建评测管线——属"作者内部评测",无第三方复现于文中。
本文的隐藏卖点恰是被多数报道忽略的第二轴:70B 相比 280B,推理显存与延迟、微调成本大幅下降(§1、§4 开篇)——计算最优不只是"分数更高",更是"全生命周期更便宜"。毒性检查(25,000 条无条件生成,PerspectiveAPI 均值 0.087 vs Gopher 0.081)则说明更好的 LM ≠ 更毒,但作者强调评测不全面。