← 总目录 / 板块五 · 2022年以来最重要的10篇
板块五 · 模型的范式变迁

第38篇 · LLaMA

用公开数据把"小模型+多喂token"推到极致——13B 打平 GPT-3,开源权重改写了整个行业的游戏规则。
LLaMA: Open and Efficient Foundation Language Models · Meta AI(Touvron, Lavril, Izacard 等)· 2023 · 原文 arXiv:2302.13971

〇、阅读进度与声明

本页所有数字均复述自论文原文(标注对应小节),未做任何外部独立验证。【论文声称】=作者叙事;【实验支持】=文中有数据支撑;【解读者推断】=本站精读者推理,论文未明说。

一、全局大图

1.1 摘要拆解对照表(兼导航)

摘要短语论文章节本页位置
"7B 到 65B 的基础模型家族"§2 Approach(Table 2)第二章
"只用公开数据集训练"§2.1 Pre-training Data(Table 1)第二章
"LLaMA-13B 在多数基准上超 GPT-3 (175B)"§3 Main results(Tables 3–9)第三章
"LLaMA-65B 与 Chinchilla-70B、PaLM-540B 有竞争力"§3 各表 + §3.6 MMLU第三章
"向研究社区发布模型"脚注1 / §8 结论第五章

1.2 贡献与证据强度预评

#贡献声称预评证据强度依据
1纯公开数据可训练出 SOTA 级基础模型强实验支撑§2.1 数据来源全部公开可查,§3 全套评测对照闭源模型
213B 以 1/13 参数超 GPT-3主实验支撑,但对手欠训练GPT-3 只训 300B token,比较存在"代际红利"混杂
3"小模型练更久在推理预算上更优"——对 Chinchilla 准则的重新解读主张为主,辅以训练曲线§1 论证 + Figure 1 训练损失曲线,无系统性的推理成本-质量前沿实验
4少量指令微调即大幅提升 MMLU(63.4→68.9)单次实验支撑§4 明说只做了一次实验、非本文重点

1.3 推荐阅读路线

必读主线:§1 的推理预算论证 → §2 数据与架构 → §3.2 闭卷问答 → §3.6 MMLU。可跳读支线:§5 偏见毒性(数字简单但结论重要,时间紧可只看 Table 11/14);附录生成样例。跳读代价:跳过 §3.7 会错过"哪些基准不可靠"的元评测观察;跳过 §6 会漏掉碳排对账的好练习素材。

二、方法精读(论文 §2)

来源:论文 §2.1–2.4。

学完本章你应能:①默写四档模型规格并解释 FFN 维度为何取 ⅔·4d;②复述 1.4T token 的七大来源配比与各自清洗方式;③手算 65B 在 2048 张 A100 上的训练时长。

2.1 失效模式先行:Chinchilla 准则答错了问题

Hoffmann et al. (2022) 说:给定训练算力预算,最优策略不是堆最大模型而是"小模型+更多数据"。但这个优化目标里只有训练成本。LLaMA 开篇指出:模型部署时真正的持续开销是推理成本——一个 280B 的模型即使训练便宜,每次调用都贵得离谱。所以正确的目标是:给定目标质量,选推理最快的模型,哪怕它训练时要多花算力。由此推出本文纲领:比 Chinchilla 推荐量(10B 模型配 200B token)多训一个数量级——事实上他们发现 7B 模型在 1T token 之后仍在提升。【论文声称;其成立前提是"推理次数足够多使训练成本可摊销",这一点论文未量化,属隐含假设。解读者补充】

2.2 数据:全公开配方(§2.1 Table 1)

来源采样占比epoch 数(1.4T token 时)磁盘占用
English CommonCrawl(CCNet 管线,5 个 dump 2017–2020)67%1.103.3 TB
C4(启发式质检:标点/词数/句数)15%1.06783 GB
GitHub(Apache/BSD/MIT 许可)4.5%0.64328 GB
Wikipedia(20 种拉丁/西里尔语言,2022年6–8月dump)4.5%2.4583 GB
Books(Gutenberg + Books3)4.5%2.2385 GB
ArXiv(LaTeX 清洗去注释)2.5%1.0692 GB
StackExchange(28 个最大站点按得分排序)2%1.0378 GB

要点:CommonCrawl 用了两套互补的质检(CCNet n-gram 语言模型 + "维基引用 vs 随机页面"线性分类器),且刻意混入 C4 因为"多种 CC 预处理管线混合能提性能"。除 Wikipedia 与 Books 约 2 epoch 外,其余数据基本只见一次。分词:SentencePiece BPE,数字拆成单个数位、未知字符回退字节级。

数字对账:67+15+4.5×3+2.5+2 = 100%,占比自洽 ✓。Books+ArXiv 合计 177GB——这正是 §3.6 解释 MMLU 落后于 Chinchilla/PaLM 的伏笔(对手用了最多 2TB 书籍学术文本)。前文的配比数字在后文被再次调用,跨章对账通过。

2.3 架构:三项借来的改进(§2.2)

改动出处内容与理由
Pre-normalization(RMSNorm)[GPT3] 归一化位置 + Zhang & Sennrich 2019 归一化函数对每个子层的输入归一化而非输出,提升训练稳定性;RMSNorm 去均值项,比 LayerNorm 更省
SwiGLU 激活[PaLM],Shazeer 2020替换 ReLU 提升质量;FFN 维度取 ⅔·4d 而非 PaLM 的 4d,保持参数量与算力对齐(三次矩阵乘 vs 两次,故缩维度补偿)【后半句为解读者补充动机,论文只给了公式】
RoPE 旋转位置编码[GPTNeo],Su et al. 2021去掉绝对位置嵌入,每层加旋转编码

2.4 规格与优化器(§2.2–2.3 Table 2)

参数维度 d头数层数学习率batchtoken 数
6.7B409632323.0e-44M1.0T
13.0B512040403.0e-44M1.0T
32.5B665652601.5e-44M1.4T
65.2B819264801.5e-44M1.4T

2.5 高效实现(§2.4)

一句话记住本章:LLaMA 的方法章是一份"没有秘密的秘方"——所有组件都来自公开文献,创新在于配比(1.4T token)与目标函数的重定义(推理最优而非训练最优)。

三、主结果精读(论文 §3)

来源:论文 §3.1–3.7,Tables 3–9。

学完本章你应能:①复述"13B 超 GPT-3"在各任务族上的具体证据与例外;②解释 MMLU 上 65B 为何输给 Chinchilla 及作者的自归因;③说出 maj1@k 对数学题的作用机制。

3.1 常识推理八连测(zero-shot,Table 3)

LLaMA-65B 除 BoolQ 外全面超过 Chinchilla-70B(如 HellaSwag 84.2 vs 80.8,ARC-e 78.9 vs 缺);除 BoolQ/WinoGrande 外超 PaLM-540B(ARC-c 56.0 vs 53.0)。最锋利的一行:LLaMA-13B 多数指标压过 GPT-3 175B(HellaSwag 79.2 vs 78.9,WinoGrande 73.0 vs 70.2,ARC-c 52.7 vs 51.4),而它小 13 倍、可在单张 V100 上推理。

3.2 闭卷问答(Tables 4–5)

NaturalQuestions(EM):65B zero-shot 23.8 / 64-shot 39.9,后者追平 PaLM-540B 的 39.6。TriviaQA(filtered dev 集):65B 64-shot 达 73.0,超过 Chinchilla 的 64.6;13B 的 64.0 也已接近 Chinchilla——注意 TriviaQA 用的是 dev 集而非 GPT-3/PaLM 用的 unfiltered test 集(原在线评测服务器已下线),口径差异作者在附录 A 里做了说明。

3.3 数学与代码:小模型的越级表现(Tables 7–8)

3.4 MMLU:诚实的短板(Table 9)

65B 五-shot 平均 63.4,落后 Chinchilla-70B(67.6)与 PaLM-540B(69.3)数个百分点。作者的归因很具体:书籍+ArXiv 只有 177GB,而 Gopher/Chinchilla/PaLM 用了至多 2TB 书籍类文本——MMLU 恰是知识密集型考试,知识主要泡在书里。旁证:Gopher 在 MMLU 上超 GPT-3 而其他基准打平,也与书籍量差一致。【论文声称的归因,方向合理但未做控制变量实验验证】

3.5 训练中的元观察(§3.7)

多数基准随训练稳步提升且与训练困惑度相关;例外是 SIQA(方差巨大→疑似基准本身不可靠)和 WinoGrande(33B 与 65B 训练中成绩几乎相同,与困惑度脱钩)。这一小节是少见的"模型作者质疑自家评测尺子"的内容。

一句话记住本章:LLaMA 的成绩单结构是"推理/知识双强、书本知识偏科、顶级数学不碰",每一项强弱都能追溯到 1.4T token 的配比表——这是全篇内部一致性最好的部分。

四、指令微调、偏见毒性与碳排(论文 §4–6)

来源:论文 §4、§5.1–5.4、§6。

学完本章你应能:①说出一次指令微调给 MMLU 带来多少分及该实验的地位;②解释 RealToxicityPrompts 分数随规模的变化及其与 Chinchilla 结果的张力;③复算 LLaMA-65B 的碳排估算。

4.1 指令微调:一锤子买卖的大回报(§4)

沿用 Chung et al. (Flan) 的协议与指令数据做单次实验:LLaMA-I 65B 的 MMLU 从 63.4 升到 68.9,超过 Flan-PaLM-cont 62B 的 66.1 与 OPT-IML-Max 30B 的 43.2,但仍远低于 GPT code-davinci-002 的 77.4。论文明确声明这并非本文重点、只此一例。

4.2 毒性与偏见四件套(§5)

4.3 碳排核算(§6 Table 15)

统一口径(同数据中心、A100 400W TDP、PUE 1.1、美国电网均值 0.385 kg CO₂eq/kWh):OPT-175B 137 tCO₂eq、BLOOM 175B 183、LLaMA-7B 14、13B 23、33B 90、65B 173。开发全程约 2048 张 A100 用 5 个月,合计估 2,638 MWh / 1015 tCO₂eq。公式:Wh = GPU-h × 功率 × PUEtCO₂eq = MWh × 0.385手算复核 65B:1,022,362 GPU-h × 400W = 408,944 kWh × 1.1 ≈ 449.8 MWh ✓(表中 449);449 × 0.385 ≈ 172.9 ≈ 173 tCO₂eq ✓。对账通过。值得玩味:65B 单模型碳排已与 BLOOM 相当,"开源摊薄碳排"的论证依赖多人复用这一前提。

一句话记住本章:偏见不会因为数据全是公开的就消失(宗教类反而恶化),毒性随规模爬升,碳排账单第一次被摆到和 benchmark 同一张桌上。

五、批判性阅读

5.1 比较公平性审计

5.2 第二坐标轴:这份工作的真正杀手锏不在表里

单卡可跑的 13B、权重可得(研究许可)——这两点让 LLaMA 成为后续 Alpaca/Vicuna 等整个开源生态的基座。论文对此只有一句"democratize the access",但其历史影响远超任何一行 benchmark 数字。【解读者观点】

5.3 论文没有告诉你什么

六、综合考核

6.1 重建因果链(L4)

题目:从"7B~65B 四档 / 1.4T token / 公开数据 / 单卡可跑 13B"四个约束出发,推演论文必须做出哪些技术与工程选择。

参考答案与评分要点 ① 目标改为推理最优 → 选中小模型档位 → 必须远超 Chinchilla 的 token 配比(7B/13B 吃满 1T,65B 吃 1.4T)→ 数据管线要能支撑近单 epoch 的大规模清洗(CCNet+分类器+C4 混配)。② 公开数据约束 → 无法用专有大书库 → 必须预判 MMLU 类知识基准吃亏并提前准备归因。③ 1.4T token 的算力压力 → 必须抠效率:xformers 注意力 + 选择性 checkpointing + 手写反向 + 序列并行 + 通信重叠,否则 21 天变几个月。④ 13B 单卡约束 → 架构不能带额外推理负担 → 三项改动(RMSNorm/SwiGLU/RoPE)都是零推理代价或负代价的成熟件,且 multi-query attention 这类省解码显存的选项反而没被采用(可能因当时质量中性证据不足)【最后半句为解读者推断】。评分:每约束对应一类选择 3 分,指出④的反常加分 2 分。

6.2 数字总对账(L1–L3)

  1. L165.2B 模型的层数、维度、学习率各是多少?
    答案80 层、d=8192、lr 1.5e-4(Table 2);64 头、batch 4M token、训练 1.4T token。
  2. L2指令微调前后 MMLU 变化多少?这个涨幅在对比表里能越过谁?
    答案63.4→68.9,+5.5 分;超过 Flan-PaLM-cont 62B(66.1)、Chinchilla(67.6),但仍低于 code-davinci-002 的 77.4(§4 Table 10)。
  3. L3"LLaMA-65B 在 MBPP 上超过 PaLM-540B"这句话错在哪?
    答案37.7 vs 36.8 的对手是 PaLM 540B 没错,但这只是 pass@1 一个指标、一个数据集;HumanEval 上 65B 是 23.7 远低于 540B 的 26.2。挑单一格子下结论是以偏概全;且两者代码 token 配比"相近但不相同"。
  4. L2用论文公式复算 LLaMA-13B 的碳排,允许 ±2 tCO₂eq 容差。
    答案135,168 GPU-h × 0.4 kW = 54,067 kWh × 1.1 ≈ 59.5 MWh;×0.385 ≈ 22.9 ≈ 23 tCO₂eq ✓(Table 15)。

6.3 设计决策答辩(开放题,配评分标准)

  1. L4答辩题1:"训练最优 vs 推理最优"的目标切换在什么前提下不成立?
    评分标准前提:模型会被大量调用、训练成本可摊销(3 分);失效场景——一次性任务/快速原型(训练成本占主导)、存储受限只能留一个 checkpoint 的场景、以及推理硬件与训练不同构导致的成本错配(3 分);能引入"总拥有成本 TCO"框架者加分(2 分)。
  2. L4答辩题2:为什么 FFN 维度取 ⅔·4d?如果照抄 PaLM 的 4d 会发生什么?
    评分标准SwiGLU 有三个权重矩阵(门控两个投影+下行投影),若中间维度仍取 4d 则参数与 FLOPs 超出标准 FFN;取 ⅔·4d 使总参数近似回到 4 矩阵乘时代的水平,保证与其他架构的算力可比(4 分);照抄 4d 的后果:同等层数下模型变大变贵,与"小模型多喂 token"的路线冲突(3 分);注明论文原文只给结论未展开推导、此处含解读者补充(1 分)。
  3. L4答辩题3:评审视角——要求作者补什么实验才能坐实"MMLU 差是因为书少"?
    评分标准受控实验:固定其他配比,将 Books 占比提升数倍重训 65B 或至少 33B,观察 MMLU 变化同时监控常识推理是否回退(知识/推理权衡)(5 分);替代方案如检索增强对照、per-domain 相关性分析可给部分分(3 分)。

6.4 证据审计

预评贡献预评读后修正理由
纯公开数据可达 SOTA★★★★★★ 维持数据来源逐项披露且与结果自洽(MMLU 短板也能被配比解释)
13B 超 GPT-3★★★★ 维持但限定语境数字真实,但对手是欠训练旧配方,传播时应附"300B token"注脚
推理最优目标★ 维持仍是主张,缺推理成本-质量前沿的系统实验
指令微涨 5.5 分★★★★ 维持n=1,作者自己声明非重点