← 总目录 / 板块五 · 2022年以来最重要的10篇
板块五 · 模型的范式变迁
第38篇 · LLaMA
用公开数据把"小模型+多喂token"推到极致——13B 打平 GPT-3,开源权重改写了整个行业的游戏规则。
〇、阅读进度与声明
本页所有数字均复述自论文原文(标注对应小节),未做任何外部独立验证。【论文声称】=作者叙事;【实验支持】=文中有数据支撑;【解读者推断】=本站精读者推理,论文未明说。
一、全局大图
1.1 摘要拆解对照表(兼导航)
| 摘要短语 | 论文章节 | 本页位置 |
| "7B 到 65B 的基础模型家族" | §2 Approach(Table 2) | 第二章 |
| "只用公开数据集训练" | §2.1 Pre-training Data(Table 1) | 第二章 |
| "LLaMA-13B 在多数基准上超 GPT-3 (175B)" | §3 Main results(Tables 3–9) | 第三章 |
| "LLaMA-65B 与 Chinchilla-70B、PaLM-540B 有竞争力" | §3 各表 + §3.6 MMLU | 第三章 |
| "向研究社区发布模型" | 脚注1 / §8 结论 | 第五章 |
1.2 贡献与证据强度预评
| # | 贡献声称 | 预评证据强度 | 依据 |
| 1 | 纯公开数据可训练出 SOTA 级基础模型 | 强实验支撑 | §2.1 数据来源全部公开可查,§3 全套评测对照闭源模型 |
| 2 | 13B 以 1/13 参数超 GPT-3 | 主实验支撑,但对手欠训练 | GPT-3 只训 300B token,比较存在"代际红利"混杂 |
| 3 | "小模型练更久在推理预算上更优"——对 Chinchilla 准则的重新解读 | 主张为主,辅以训练曲线 | §1 论证 + Figure 1 训练损失曲线,无系统性的推理成本-质量前沿实验 |
| 4 | 少量指令微调即大幅提升 MMLU(63.4→68.9) | 单次实验支撑 | §4 明说只做了一次实验、非本文重点 |
1.3 推荐阅读路线
必读主线:§1 的推理预算论证 → §2 数据与架构 → §3.2 闭卷问答 → §3.6 MMLU。可跳读支线:§5 偏见毒性(数字简单但结论重要,时间紧可只看 Table 11/14);附录生成样例。跳读代价:跳过 §3.7 会错过"哪些基准不可靠"的元评测观察;跳过 §6 会漏掉碳排对账的好练习素材。
二、方法精读(论文 §2)
来源:论文 §2.1–2.4。
学完本章你应能:①默写四档模型规格并解释 FFN 维度为何取 ⅔·4d;②复述 1.4T token 的七大来源配比与各自清洗方式;③手算 65B 在 2048 张 A100 上的训练时长。
2.1 失效模式先行:Chinchilla 准则答错了问题
Hoffmann et al. (2022) 说:给定训练算力预算,最优策略不是堆最大模型而是"小模型+更多数据"。但这个优化目标里只有训练成本。LLaMA 开篇指出:模型部署时真正的持续开销是推理成本——一个 280B 的模型即使训练便宜,每次调用都贵得离谱。所以正确的目标是:给定目标质量,选推理最快的模型,哪怕它训练时要多花算力。由此推出本文纲领:比 Chinchilla 推荐量(10B 模型配 200B token)多训一个数量级——事实上他们发现 7B 模型在 1T token 之后仍在提升。【论文声称;其成立前提是"推理次数足够多使训练成本可摊销",这一点论文未量化,属隐含假设。解读者补充】
2.2 数据:全公开配方(§2.1 Table 1)
| 来源 | 采样占比 | epoch 数(1.4T token 时) | 磁盘占用 |
| English CommonCrawl(CCNet 管线,5 个 dump 2017–2020) | 67% | 1.10 | 3.3 TB |
| C4(启发式质检:标点/词数/句数) | 15% | 1.06 | 783 GB |
| GitHub(Apache/BSD/MIT 许可) | 4.5% | 0.64 | 328 GB |
| Wikipedia(20 种拉丁/西里尔语言,2022年6–8月dump) | 4.5% | 2.45 | 83 GB |
| Books(Gutenberg + Books3) | 4.5% | 2.23 | 85 GB |
| ArXiv(LaTeX 清洗去注释) | 2.5% | 1.06 | 92 GB |
| StackExchange(28 个最大站点按得分排序) | 2% | 1.03 | 78 GB |
要点:CommonCrawl 用了两套互补的质检(CCNet n-gram 语言模型 + "维基引用 vs 随机页面"线性分类器),且刻意混入 C4 因为"多种 CC 预处理管线混合能提性能"。除 Wikipedia 与 Books 约 2 epoch 外,其余数据基本只见一次。分词:SentencePiece BPE,数字拆成单个数位、未知字符回退字节级。
数字对账:67+15+4.5×3+2.5+2 = 100%,占比自洽 ✓。Books+ArXiv 合计 177GB——这正是 §3.6 解释 MMLU 落后于 Chinchilla/PaLM 的伏笔(对手用了最多 2TB 书籍学术文本)。前文的配比数字在后文被再次调用,跨章对账通过。
2.3 架构:三项借来的改进(§2.2)
| 改动 | 出处 | 内容与理由 |
| Pre-normalization(RMSNorm) | [GPT3] 归一化位置 + Zhang & Sennrich 2019 归一化函数 | 对每个子层的输入归一化而非输出,提升训练稳定性;RMSNorm 去均值项,比 LayerNorm 更省 |
| SwiGLU 激活 | [PaLM],Shazeer 2020 | 替换 ReLU 提升质量;FFN 维度取 ⅔·4d 而非 PaLM 的 4d,保持参数量与算力对齐(三次矩阵乘 vs 两次,故缩维度补偿)【后半句为解读者补充动机,论文只给了公式】 |
| RoPE 旋转位置编码 | [GPTNeo],Su et al. 2021 | 去掉绝对位置嵌入,每层加旋转编码 |
2.4 规格与优化器(§2.2–2.3 Table 2)
| 参数 | 维度 d | 头数 | 层数 | 学习率 | batch | token 数 |
| 6.7B | 4096 | 32 | 32 | 3.0e-4 | 4M | 1.0T |
| 13.0B | 5120 | 40 | 40 | 3.0e-4 | 4M | 1.0T |
| 32.5B | 6656 | 52 | 60 | 1.5e-4 | 4M | 1.4T |
| 65.2B | 8192 | 64 | 80 | 1.5e-4 | 4M | 1.4T |
- AdamW:β₁=0.9,β₂=0.95;cosine 学习率衰减到峰值的 10%;weight decay 0.1;梯度裁剪 1.0;2000 步 warmup。
- 手算验证:65B 训练时长。论文给出吞吐约 380 tokens/sec/GPU(2048 张 A100-80GB)。总吞吐 = 380 × 2048 ≈ 77.8 万 tokens/s。1.4T ÷ 77.8万 ≈ 180 万秒 ≈ 20.8 天 ≈ 21 天,与论文"approximately 21 days"吻合 ✓。
- FLOPs 对账【解读者补充】:A100 峰值 BF16 约 312 TFLOPs,若 MFU≈45%(PaLM 口径),2048 卡理论吞吐可达 ~10⁶ tokens/s 量级,LLaMA 的 78 万 tokens/s 隐含 MFU 约 35%±——低于 PaLM 的 46.2%,合理(Meta 未做 TPU 级深度调优),但论文未报自己的 MFU,这是可追问点。
2.5 高效实现(§2.4)
- xformers 的因果注意力高效实现(思想出自 Rabe & Staats 2021 的 O(n) 显存注意力,反向用 FlashAttention):不存注意力权重、不算被 causal mask 掉的 key/query 分数。
- 手工实现 transformer 层的反向函数,只重计算便宜的部分:保存线性层输出等昂贵激活,其余靠 checkpoint 重算——减少反向重算量。
- 配合 model + sequence parallelism 降低显存,并把 GPU 间 all_reduce 通信与激活计算尽量重叠。
一句话记住本章:LLaMA 的方法章是一份"没有秘密的秘方"——所有组件都来自公开文献,创新在于配比(1.4T token)与目标函数的重定义(推理最优而非训练最优)。
三、主结果精读(论文 §3)
来源:论文 §3.1–3.7,Tables 3–9。
学完本章你应能:①复述"13B 超 GPT-3"在各任务族上的具体证据与例外;②解释 MMLU 上 65B 为何输给 Chinchilla 及作者的自归因;③说出 maj1@k 对数学题的作用机制。
3.1 常识推理八连测(zero-shot,Table 3)
LLaMA-65B 除 BoolQ 外全面超过 Chinchilla-70B(如 HellaSwag 84.2 vs 80.8,ARC-e 78.9 vs 缺);除 BoolQ/WinoGrande 外超 PaLM-540B(ARC-c 56.0 vs 53.0)。最锋利的一行:LLaMA-13B 多数指标压过 GPT-3 175B(HellaSwag 79.2 vs 78.9,WinoGrande 73.0 vs 70.2,ARC-c 52.7 vs 51.4),而它小 13 倍、可在单张 V100 上推理。
3.2 闭卷问答(Tables 4–5)
NaturalQuestions(EM):65B zero-shot 23.8 / 64-shot 39.9,后者追平 PaLM-540B 的 39.6。TriviaQA(filtered dev 集):65B 64-shot 达 73.0,超过 Chinchilla 的 64.6;13B 的 64.0 也已接近 Chinchilla——注意 TriviaQA 用的是 dev 集而非 GPT-3/PaLM 用的 unfiltered test 集(原在线评测服务器已下线),口径差异作者在附录 A 里做了说明。
3.3 数学与代码:小模型的越级表现(Tables 7–8)
- GSM8K(8-shot):LLaMA-65B 50.9,超过未做数学微调的 PaLM-62B(33.0),也超过 Minerva-62B 的直接作答(52.4 边缘)——注意 Minerva 是用 38.5B 数学 token 微调过的 PaLM 系列,LLaMA 无任何数学专项微调。maj1@k 投票后 65B 达 69.7,逼近 Minerva-62B 的 68.5。
- MATH:差距仍大——65B 仅 10.6 vs Minerva-540B 的 33.6,竞赛级数学仍是专有巨兽的地盘。
- HumanEval pass@1:13B 达 15.8,超过 LaMDA-137B 的 14.0;65B 达 23.7 追平 PaLM-62B 并达到 PaLM-cont 62B(更长训练版)的同一水平。MBPP 上 65B 37.7 甚至高于 PaLM-540B 的 36.8。代码 token 配比相近是公平性关键(论文特意点明)。
3.4 MMLU:诚实的短板(Table 9)
65B 五-shot 平均 63.4,落后 Chinchilla-70B(67.6)与 PaLM-540B(69.3)数个百分点。作者的归因很具体:书籍+ArXiv 只有 177GB,而 Gopher/Chinchilla/PaLM 用了至多 2TB 书籍类文本——MMLU 恰是知识密集型考试,知识主要泡在书里。旁证:Gopher 在 MMLU 上超 GPT-3 而其他基准打平,也与书籍量差一致。【论文声称的归因,方向合理但未做控制变量实验验证】
3.5 训练中的元观察(§3.7)
多数基准随训练稳步提升且与训练困惑度相关;例外是 SIQA(方差巨大→疑似基准本身不可靠)和 WinoGrande(33B 与 65B 训练中成绩几乎相同,与困惑度脱钩)。这一小节是少见的"模型作者质疑自家评测尺子"的内容。
一句话记住本章:LLaMA 的成绩单结构是"推理/知识双强、书本知识偏科、顶级数学不碰",每一项强弱都能追溯到 1.4T token 的配比表——这是全篇内部一致性最好的部分。
四、指令微调、偏见毒性与碳排(论文 §4–6)
来源:论文 §4、§5.1–5.4、§6。
学完本章你应能:①说出一次指令微调给 MMLU 带来多少分及该实验的地位;②解释 RealToxicityPrompts 分数随规模的变化及其与 Chinchilla 结果的张力;③复算 LLaMA-65B 的碳排估算。
4.1 指令微调:一锤子买卖的大回报(§4)
沿用 Chung et al. (Flan) 的协议与指令数据做单次实验:LLaMA-I 65B 的 MMLU 从 63.4 升到 68.9,超过 Flan-PaLM-cont 62B 的 66.1 与 OPT-IML-Max 30B 的 43.2,但仍远低于 GPT code-davinci-002 的 77.4。论文明确声明这并非本文重点、只此一例。
4.2 毒性与偏见四件套(§5)
- RealToxicityPrompts(10 万 prompt 贪心解码,PerspectiveAPI 打分):Basic 分数 7B→65B 为 0.106→0.128,Respectful 版本 65B 反而最高(0.141)——毒性随规模上升,尤其礼貌提示下。作者对比文献:Chinchilla 报 0.087 但方法学不同(采样策略/prompt 数/API 时间均不同),并引 OPT 观察"同家族内越大越毒";Gopher 反例(更大却毒性不更高)被解释为 Gopher 本身弱于 Chinchilla,暗示"规模→毒性"关系可能只在同家族内成立。
- CrowS-Pairs(9 类刻板印象,越高越偏):平均 66.6,略优于 GPT-3 的 67.2 与 OPT-175B 的 69.5;但宗教类 79.0 比 OPT 高出 10 个百分点,性别 70.6、年龄 70.1 也偏高——归因指向 CommonCrawl 尽管多道过滤。
- WinoGender:65B 总体共指正确率 77.5%,其中 their/them/someone 中性代词达 81.7%,而 her/she 78.8%、his/he 72.1%;gotcha(反刻板)子集明显更差(his 组仅 63.3)——模型在用职业的多数性别统计捷径而非句内证据。
- TruthfulQA:65B truthful 0.57 / truthful∧informative 0.53,全面高于 GPT-3 175B 的 0.28/0.25——但绝对值意味着仍有近半回答不可靠,幻觉风险显著。
4.3 碳排核算(§6 Table 15)
统一口径(同数据中心、A100 400W TDP、PUE 1.1、美国电网均值 0.385 kg CO₂eq/kWh):OPT-175B 137 tCO₂eq、BLOOM 175B 183、LLaMA-7B 14、13B 23、33B 90、65B 173。开发全程约 2048 张 A100 用 5 个月,合计估 2,638 MWh / 1015 tCO₂eq。公式:Wh = GPU-h × 功率 × PUE,tCO₂eq = MWh × 0.385。手算复核 65B:1,022,362 GPU-h × 400W = 408,944 kWh × 1.1 ≈ 449.8 MWh ✓(表中 449);449 × 0.385 ≈ 172.9 ≈ 173 tCO₂eq ✓。对账通过。值得玩味:65B 单模型碳排已与 BLOOM 相当,"开源摊薄碳排"的论证依赖多人复用这一前提。
一句话记住本章:偏见不会因为数据全是公开的就消失(宗教类反而恶化),毒性随规模爬升,碳排账单第一次被摆到和 benchmark 同一张桌上。
五、批判性阅读
5.1 比较公平性审计
- "13B 超 GPT-3"是最成功的传播点,但 GPT-3 只训了 300B token 且是 2020 年的数据配方——这是"三代技术打一代"的比较。公平的问法是:同样 token 预算下谁赢?论文没做,也无法做(拿不到 GPT-3 权重)。
- TriviaQA 换了评测集(filtered dev vs unfiltered test),虽然附录 A 给了理由(服务器下线),但与历史表格直接并排呈现时有误导风险。
- MMLU 落后的自归因(177GB 书籍)方向可信但无消融:没有任何"加书籍重训"的控制实验,属于最合理的假说而非证明。
- maj1@k 的算力不对称:数学榜上 LLaMA 用 k=256/100 采样投票,Minerva-540B 只用 k=64/40——推理算力其实向 LLaMA 倾斜,正文一笔带过。
5.2 第二坐标轴:这份工作的真正杀手锏不在表里
单卡可跑的 13B、权重可得(研究许可)——这两点让 LLaMA 成为后续 Alpaca/Vicuna 等整个开源生态的基座。论文对此只有一句"democratize the access",但其历史影响远超任何一行 benchmark 数字。【解读者观点】
5.3 论文没有告诉你什么
- 权重以"研究用途"名义非商用发布,许可细节与合规边界论文完全不谈(后来成为持续争议)。
- Books3 是版权敏感语料,论文只写"Gutenberg + Books3 [4.5%]",无任何授权讨论。
- 训练事故、loss spike、重试次数等工程叙事为零(对比 PaLM 的坦诚形成反差)。
- 没有推理延迟/吞吐实测;"13B 可跑在单 V100"是配置陈述而非性能报告。
- 指令微调只报告 MMLU 一个维度,通用能力是否受损(alignment tax)未测。
六、综合考核
6.1 重建因果链(L4)
题目:从"7B~65B 四档 / 1.4T token / 公开数据 / 单卡可跑 13B"四个约束出发,推演论文必须做出哪些技术与工程选择。
参考答案与评分要点
① 目标改为推理最优 → 选中小模型档位 → 必须远超 Chinchilla 的 token 配比(7B/13B 吃满 1T,65B 吃 1.4T)→ 数据管线要能支撑近单 epoch 的大规模清洗(CCNet+分类器+C4 混配)。② 公开数据约束 → 无法用专有大书库 → 必须预判 MMLU 类知识基准吃亏并提前准备归因。③ 1.4T token 的算力压力 → 必须抠效率:xformers 注意力 + 选择性 checkpointing + 手写反向 + 序列并行 + 通信重叠,否则 21 天变几个月。④ 13B 单卡约束 → 架构不能带额外推理负担 → 三项改动(RMSNorm/SwiGLU/RoPE)都是零推理代价或负代价的成熟件,且 multi-query attention 这类省解码显存的选项反而没被采用(可能因当时质量中性证据不足)【最后半句为解读者推断】。评分:每约束对应一类选择 3 分,指出④的反常加分 2 分。
6.2 数字总对账(L1–L3)
- L165.2B 模型的层数、维度、学习率各是多少?
答案
80 层、d=8192、lr 1.5e-4(Table 2);64 头、batch 4M token、训练 1.4T token。
- L2指令微调前后 MMLU 变化多少?这个涨幅在对比表里能越过谁?
答案
63.4→68.9,+5.5 分;超过 Flan-PaLM-cont 62B(66.1)、Chinchilla(67.6),但仍低于 code-davinci-002 的 77.4(§4 Table 10)。
- L3"LLaMA-65B 在 MBPP 上超过 PaLM-540B"这句话错在哪?
答案
37.7 vs 36.8 的对手是 PaLM 540B 没错,但这只是 pass@1 一个指标、一个数据集;HumanEval 上 65B 是 23.7 远低于 540B 的 26.2。挑单一格子下结论是以偏概全;且两者代码 token 配比"相近但不相同"。
- L2用论文公式复算 LLaMA-13B 的碳排,允许 ±2 tCO₂eq 容差。
答案
135,168 GPU-h × 0.4 kW = 54,067 kWh × 1.1 ≈ 59.5 MWh;×0.385 ≈ 22.9 ≈ 23 tCO₂eq ✓(Table 15)。
6.3 设计决策答辩(开放题,配评分标准)
- L4答辩题1:"训练最优 vs 推理最优"的目标切换在什么前提下不成立?
评分标准
前提:模型会被大量调用、训练成本可摊销(3 分);失效场景——一次性任务/快速原型(训练成本占主导)、存储受限只能留一个 checkpoint 的场景、以及推理硬件与训练不同构导致的成本错配(3 分);能引入"总拥有成本 TCO"框架者加分(2 分)。
- L4答辩题2:为什么 FFN 维度取 ⅔·4d?如果照抄 PaLM 的 4d 会发生什么?
评分标准
SwiGLU 有三个权重矩阵(门控两个投影+下行投影),若中间维度仍取 4d 则参数与 FLOPs 超出标准 FFN;取 ⅔·4d 使总参数近似回到 4 矩阵乘时代的水平,保证与其他架构的算力可比(4 分);照抄 4d 的后果:同等层数下模型变大变贵,与"小模型多喂 token"的路线冲突(3 分);注明论文原文只给结论未展开推导、此处含解读者补充(1 分)。
- L4答辩题3:评审视角——要求作者补什么实验才能坐实"MMLU 差是因为书少"?
评分标准
受控实验:固定其他配比,将 Books 占比提升数倍重训 65B 或至少 33B,观察 MMLU 变化同时监控常识推理是否回退(知识/推理权衡)(5 分);替代方案如检索增强对照、per-domain 相关性分析可给部分分(3 分)。
6.4 证据审计
| 预评贡献 | 预评 | 读后修正 | 理由 |
| 纯公开数据可达 SOTA | ★★★ | ★★★ 维持 | 数据来源逐项披露且与结果自洽(MMLU 短板也能被配比解释) |
| 13B 超 GPT-3 | ★★ | ★★ 维持但限定语境 | 数字真实,但对手是欠训练旧配方,传播时应附"300B token"注脚 |
| 推理最优目标 | ★ | ★ 维持 | 仍是主张,缺推理成本-质量前沿的系统实验 |
| 指令微涨 5.5 分 | ★★ | ★★ 维持 | n=1,作者自己声明非重点 |