← 总目录 / 板块二 · Infra与数据的变迁
板块二 · Infra与数据的变迁

第15篇 · Chinchilla

每个参数约喂 20 个 token:一场对"越大越好"教条的精确纠正
Training Compute-Optimal Large Language Models · Hoffmann, Borgeaud, Mensch et al.(DeepMind)· 2022 · arXiv:2203.15556

本材料说明:所有数字均复述自论文原文,未做外部验证,出处以 §小节号 / 表号标注。【论文声称】=作者观点;【实验支持】=文中数据支撑;【解读者推断】=精读者推理。

一、全局大图

1.1 一句话读懂本文

给定固定 FLOPs 预算,模型参数量 N 与训练 token 数 D 应当等比例放大(Nopt∝Ca、Dopt∝Cb,三套方法测得 a≈0.46–0.50、b≈0.51–0.54,Table 2)——即大约每 20 个 token 配 1 个参数。照此,Gopher 的算力预算下最优模型约 40–70B、训 ~1.4T token。作者据此训练了 70B/1.4T 的 Chinchilla,以与 Gopher 280B 相同的算力全面击败 Gopher、GPT-3、Jurassic-1 与 MT-NLG 530B(§Abstract)。

1.2 摘要—章节对照导航表

摘要短语对应论文章节本精读章
"current large models are significantly undertrained"§1、Table 1(各模型均只训 ~300B token)第二章
"over 400 models, 70M–16B params, 5B–500B tokens"§3(三种估计方法)第三章
"model size and tokens should be scaled equally"§3.1–§3.4、Table 2/3第三章
"Chinchilla 70B, 4× more data, outperforms Gopher"§4(模型细节与评测)第四章
"less compute for fine-tuning and inference"§1、§5 讨论第五章

1.3 主要贡献与证据强度预评

1.4 推荐阅读路线

必读主线:§1 → §3.3(含式2–4 的推导)→ Table 2/3 → §4.2。这条线覆盖"结论如何得出→如何验证"。可跳读支线:附录 A/B/C/D/E/F/G 中除 D.2 外的部分。跳过 §3.1/§3.2 的代价不大,但会看不懂 Table 2 三行数字为何不同。

二、逐章精读 · 问题设定与靶子(对应论文§1–§2)

2.1 失效模式先行:300B token 的集体惯性

Table 1 列出当时的巨无霸们:LaMDA 137B/168B token、GPT-3 175B/300B、Jurassic 178B/300B、Gopher 280B/300B、MT-NLG 530B/270B——几乎清一色 ~300B token。原因可直接追溯到 Kaplan et al. (2020) 的建议:预算 ×10 时模型应 ×5.5 而数据仅 ×1.8(§1 引述)。Chinchilla 全文要回答的问题由此定型:min L(N,D) s.t. FLOPs(N,D)=C(式1),其中 FLOPs≈6ND。

本文对 Kaplan 偏差的两点归因(§2,【解读者推断】认为这是全文最锋利的部分):①Kaplan 对所有模型用固定 token 数和固定学习率调度,中途快照的损失被高估,从而低估了"少数据训练"的效果;②Kaplan 大部分 run <100M 参数,而 Chinchilla 用到 16B 并观察到 FLOP-loss 前沿存在负曲率(附录E),小模型外推因此高估了最优模型尺寸。

2.2 学习目标

学完本章你应能:①写出式1并解释为什么它是个约束优化;②复述 Kaplan 建议(×10 预算→×5.5 模型/×1.8 数据)与本文结论(等比放大)的差别;③说出两个导致旧结论偏差的方法论因素。

三、逐章精读 · 三种估计方法(对应论文§3)

3.1 方法一:固定模型、扫训练长度

70M–10B 参数共 4 组 cosine 周期长度(跨度 16×),从训练曲线包络中提取"每个 FLOP 数下最低损失对应的 (N,D)",在 1500 个对数均匀 FLOP 点上取最小后拟合幂律,得 a=0.50, b=0.50(bootstrap 90% 区间分别为 [0.488,0.502]、[0.501,0.512],Table 2)。附带发现:所有被选中的点都落在各自训练的最后 15% 内——支持"cosine 周期应匹配训练步数"的假设(附录B:超出目标 25% 以上性能明显变差)。

3.2 方法二:IsoFLOP 曲线

固定 9 档 FLOPs(6×10¹⁸ 到 3×10²¹),每档扫多个模型尺寸(至多 16B),最终损失呈清晰 U 形谷,抛物线拟合定谷底位置,再拟合得 a=0.49, b=0.51。此法直接回答"给定预算该训多大",是三者中最直观的一路【解读者评注】。

3.3 方法三:参数化损失函数(公式手术)

L̂(N,D) = E + A/Nα + B/Dβ(式2)
拟合结果:L = E + A/N0.34 + B/D0.28,E=1.69,A=406.4,B=410.7(附录D.2 式10)
闭式最优:Nopt=G(C/6)a,Dopt=G−1(C/6)b,G=(αA/βB)^{1/(α+β)},a=β/(α+β),b=α/(α+β)(式4)⇒ a=0.46, b=0.54
符号它是什么直觉
E自然文本熵(Bayes 风险项)损失的地板
A/Nα函数逼近罚项(容量不足)模型太小的代价
B/Dβ随机逼近罚项(优化不足)单 epoch + 有限步数的代价
G由 (α,β,A,B) 决定的尺度常数决定"20 token/参数"的具体倍率

推导骨架(附录D.2):风险分解 L(f̄)=L(f*)+(L(f_N)−L(f*))+(L(f̄_N,D)−L(f_N)),三项分别对应熵、容量、优化;理论预期两项 ∝1/N^{1/2} 与 1/D^{1/2} 下界,实测指数 0.34/0.28 都低于 1/2——作者点评"远未达到已知下界,未来模型应努力提高这些系数"。
手算验证:a=β/(α+β)=0.28/0.62≈0.452,b=0.34/0.62≈0.548,与 Table 2 报告的 0.46/0.54 在舍入内一致 ✓。注意:方法三用 Huber(δ=10⁻³) 自动把低预算点的较大残差当离群值压权,这是它给出更小 Nopt 的机制之一(§3.4 作者自己说明)。

3.4 数字对账:Table 3 与"20 token/参数"

Table 3(方法一口径):67B ↔ 1.5T token;175B ↔ 3.7T;280B ↔ 5.9T;520B ↔ 11T;1T ↔ 21.2T。逐行算比值:1.5T/67B≈22.4;3.7T/175B≈21.1;5.9T/280B≈21.1;11T/520B≈21.2;21.2T/1T=21.2——高度稳定的 ~21 token/参数,社区通称"每参数 20 token"即源于此 ✓。交叉核对:Gopher 预算 5.76×10²³ FLOPs(Fig.2 配文);67B 行给 5.76e23 FLOPs ✓ 自洽。另验 FLOPs 公式:6ND=6×67e9×1.5e12≈6.0×10²³ ≈ 5.76e23(差 4%,来自非嵌入参数口径)✓。

常见误读:①"20:1 是铁律"——它是 MassiveText 分布 + 该 FLOPs 定义下的经验中心值,附录 C 显示 C4/GitHub 上指数略有出入(0.53/0.47 vs 0.50/0.50);②"Chinchilla 说明大模型没用"——错,它说的是固定预算下的分配,若数据无限且预算充足大模型仍优;③忽略方法间差异——方法三在大预算端系统性预测更小的模型,作者坦承前沿曲率意味着"我们可能仍高估了最优模型大小"(§5)。

一句话记住本节:三把不同的尺子量出同一个答案——参数与 token 手拉手等比放大,比率约 1:20。

分级自测题(本章)

  1. L1按 Table 3 口径,一个 400M 参数的计算最优模型该训多少 token?FLOPs 预算折合多少个"Gopher 单位"?
    显示答案8.0B token;1.92e19 FLOPs = Gopher 的 1/29968。
  2. L2迁移:某团队预算翻 8 倍。分别按 Kaplan 建议与 Chinchilla 结论,模型和数据各放大多少?
    显示答案Kaplan(×10 预算→×5.5 模型/×1.8 数据,换算到 ×8:8^{log5.5/log10}=8^{0.74}≈4.4× 模型、8^{log1.8/log10}=8^{0.26}≈1.8× 数据);Chinchilla(a=b=0.5):模型与数据均 ×√8≈2.83×。开放部分:可进一步指出两者差异随预算增长持续扩大。
  3. L3识别错误:有人用式2宣称"E=1.69 就是自然语言的真实熵"。指出两个问题。
    评分要点①E 是特定分词器(SentencePiece 变体)与 MassiveText 分布下的拟合常数,换词表/语料即变——类比 Kaplan 论文中 N_c/D_c 无基本含义的逻辑;②拟合区间外推时 E 的置信度未给出,且 Huber 权重方案会影响其取值;③0.34/0.28 指数低于理论上界的事实提示函数形式本身可能只是局部有效的近似。
  4. L4综合:结合方法一"选中点都在最后15%"与方法三的 α=0.34<1/2,推演"cosine 周期匹配"假设在整个方法论中的地位。
    参考答案要点链:①若周期远长于实际步数,学习率停在高位,终损失偏高→损失-FLOP 包络整体变形;②方法一/二直接依赖终损失,故该假设是两种方法的前提;③方法三虽用同一批数据,但其 β=0.28 度量的正是"有限优化"罚项——若调度不当,β 会吸收调度次优性,使 D 的边际收益被低估;④因此附录B 的网格实验(超25%即劣化)不是花絮而是全部分析的地基。四点中答满三点且逻辑闭合即可满分。

四、逐章精读 · Chinchilla 本尊与评测(对应论文§4)

4.1 配置对照(Table 4)

Gopher 280BChinchilla 70B
层数 / 头数80 / 12880 / 64
d_model16,3848,192
最大学习率4×10⁻⁵1×10⁻⁴
batch(token)3M→6M1.5M→3M(中途加倍)
优化器 / tokenAdam / 300BAdamW / 1.4T

其他改动:去 NFKC 规范化的 SentencePiece(94.15% 词表与 Gopher 相同,利于数学/化学文本);bf16 计算 + fp32 权重存于分布式优化器状态——注意此处引用了 Rajbhandari et al. (2020),正是第13篇 ZeRO(§4.1)。

4.2 结果账本(数字对账)

任务ChinchillaGopher其他参照
MMLU 5-shot67.6%60.0%GPT-3 43.9%;人类专家 89.8%;2023年6月预测 63.4%
BIG-bench 均值65.1%54.4%62 任务中仅 4 项落后
RACE-m / RACE-h86.8% / 82.3%75.1% / 71.6%提升 >10 个百分点
LAMBADA zero-shot77.4%74.5%MT-NLG 76.6%
Natural Questions 5-shot31.5%(新SOTA)24.5%GPT-3 64-shot 仅 29.9%
TriviaQA unfiltered 0-shot67.0%52.8%GPT-3 64.3%
Wikitext103 困惑度7.167.75作者自警:4×数据可能有泄漏红利

MMLU 明细:57 任务中 51 升、2 平、4 降(college_mathematics、econometrics、moral_scenarios、formal_logic);4 个任务上超过 90%(high_school_gov_and_politics 等)。TruthfulQA 0-shot 从 Gopher 29.5% 升至 43.6%(+14.1%)——作者借此反驳"更大模型必然更不真实"的早期结论。公平性脚注(论文自己标注):RACE 上 GPT-3/MT-NLG 使用不同 prompt 格式不可直接比较;语言建模类基准因数据重叠需谨慎解读——这类自我设限在同类论文中并不多见。

一句话记住本节:同样的算力,少 4 倍参数、多 4 倍数据,几乎所有指标全面反超——包括比自家大 7.6 倍的 MT-NLG 530B。

五、批判性阅读

5.1 benchmark 到底测什么 & 证据分级

标度分析用的是平滑后的训练损失(作者声明其为测试损失的无偏估计,前提是无重复 epoch——Table A1 却显示 MassiveWeb 1.24 epochs、Wikipedia 3.40 epochs,严格说"无限数据域"假设已被轻微突破【解读者指出】)。下游评测覆盖 150 项任务(Table 5),但全部为 DeepMind 内部按 Gopher 论文协议执行的自建评测管线——属"作者内部评测",无第三方复现于文中。

5.2 比较是否公平

5.3 第二坐标轴

本文的隐藏卖点恰是被多数报道忽略的第二轴:70B 相比 280B,推理显存与延迟、微调成本大幅下降(§1、§4 开篇)——计算最优不只是"分数更高",更是"全生命周期更便宜"。毒性检查(25,000 条无条件生成,PerspectiveAPI 均值 0.087 vs Gopher 0.081)则说明更好的 LM ≠ 更毒,但作者强调评测不全面。

5.4 论文没有告诉你什么

  1. 没有中间尺度的验证:40B–70B 区间的"预测 vs 实测"空缺(只在 10²¹ FLOPs 小尺度做过一次 head-to-head,D.4)。
  2. 多 epoch regime 未覆盖:所有分析 run 均 <1 epoch(§5 局限性),而 Table A1 已显示部分子集超 1 epoch,两处张力未被讨论。
  3. FLOPs≈6ND 忽略注意力项:长上下文下 2·n_layer·n_ctx·d_attn 项不可忽略,本文上下文固定 2048 尚可,外推到长文档场景需修正。
  4. 数据获取成本缺席:1.4T 高质量 token 的采集/清洗成本未计价——"数据更便宜"这一隐含假设后来催生了 RefinedWeb 等工作(第17篇)。
  5. 方法三与其他方法的分歧未给出裁决实验:到底哪个才是真的前沿,论文只能并列呈现。

六、综合考核(毕业关)

  1. 重建因果链仅从 Table 1(五个模型全是 ~300B token)出发,推演本文必须做哪三类实验才能推翻旧共识。
    参考答案①必须证明"300B 不是巧合而是历史惯性"——引 Kaplan 分配建议作因;②必须在多种(N,D)组合上重测分配律以排除 Kaplan 的固定调度偏差——于是有方法一(扫周期)与方法二(isoFLOP 扫尺寸);③必须有独立于训练曲线形状的第三证据防循环论证——于是有参数化拟合法三;④最后必须有一次"预言→兑现"的大规模验证——于是有 Chinchilla。四环缺一说服力即塌。
  2. 数字总对账核对以下链条:(i) 0.28/0.62≈0.46;(ii) Table 3 五行的 token/参数比;(iii) 6×70e9×1.4e12 vs 5.76e23;(iv) MMLU 差距 67.6−60.0。
    显示答案(i) 0.452≈0.46 ✓;(ii) 22.4/21.1/21.1/21.2/21.2,稳定 ~21 ✓;(iii) 6×70e9×1.4e12=5.88e23 ≈ 5.76e23(差 2%,非嵌入口径)✓;(iv) 7.6个百分点,摘要称 "greater than a 7% improvement over Gopher" ✓。唯一张力:Table A1 的 Wikipedia 3.40 epochs 与"无限数据"声明的矛盾。
  3. 设计决策答辩①为什么选 70B 而不是预测区间下沿的 40B?②为什么换 AdamW 还敢声称同算力对比?③为什么把分析建立在训练损失而非留出集损失上?
    评分要点①原文理由是"数据集与计算效率考虑"(§4),40B 需更长训练时间墙钟更久——答"工程可行性"给基础分,补充"区间本身横跨方法一/二的预测"加分;②难点确实存在,但 AdamW 影响的是绝对水平、方向对新模型有利,属于"保守偏置"(对比反而偏严),且附录G量化了影响;③因为 run 太多(400+)逐个评估留出集代价高,平滑训练损失在单 epoch 下无偏——但如 5.4 所述多 epoch 子集破坏了该前提。三点各按"决策+理由+漏洞识别"给分。
  4. 证据审计重评 1.3 节预评。
    参考答案贡献1 维持★★★并升级:三方法+双数据集(附录C)+bootstrap 区间,是标度文献中最密的证据网;贡献2 维持★★★(推导闭式+残差诊断齐全);贡献3 从★★降半星:n=2 且优化器混杂,但 MMLU/BIG-bench 幅度(+7.6/+10.7pp)大到难以全归于混杂;贡献4 从★★升:连作者都列出对自己不利的前沿曲率(§5),诚实度高;贡献5 维持★:样本量小、自认不全面。