阅读约定【解读者补充/推断】内容不来自论文;【论文声称】为作者叙事,【实验支持】表示消融或主实验有对应数据。证据强度:★★★ 主实验+消融 ★★ 单一证据 ★ 只是主张
| 摘要要点 | 论文位置 | 本页章节 |
|---|---|---|
| "generative pre-training of a language model on … unlabeled text" | §3.1 Unsupervised pre-training | 第二章 预训练手术 |
| "discriminative fine-tuning on each specific task" | §3.2 Supervised fine-tuning | 第三章 微调目标 |
| "task-aware input transformations … minimal changes to model architecture" | §3.3 Task-specific input transformations | 第四章 输入变换 |
| "12 tasks … state-of-the-art on 9";Story Cloze +8.9%、RACE +5.7%、MultiNLI +1.5%、GLUE +5.5% | §4.2 Experiments | 第五章 成绩单全表 |
| "analyze zero-shot behaviors of the pre-trained model" | §4 分析小节 | 第六章 消融与分析 |
注:摘要中 GLUE 提升幅度记为 +5.5%(72.8 vs 此前 68.9,Wikipedia 口径);另有二手资料称多任务微调版 GLUE 均值 75.1——两个口径并存,见第五章对账。
| # | 论文声称的贡献 | 预评证据强度 | 依据 |
|---|---|---|---|
| C1 | 生成式预训练大幅提升判别任务表现(半监督范式可行) | ★★★ | 12 任务主表 + 去预训练消融(均值 −14.8%,Table 5) |
| C2 | Transformer 比 LSTM 更适合迁移 | ★★ | LSTM 替换消融 −5.6 分(Table 5),单组对照 |
| C3 | 微调时加辅助 LM 损失有益(λ 加权) | ★★→弱 | 去掉后均值仅 −0.3 左右且部分任务反而更好(Table 5),效应很小 |
| C4 | 遍历式输入变换可让单一架构覆盖四类结构化任务 | ★→★★ | 设计主张 + 12 任务整体成功作间接证据,无逐变换消融 |
| C5 | 预训练过程自发习得执行类任务的能力(zero-shot 随训练步数上升) | ★★ | Figure 2 折线图(归一化相对分),无绝对分数表 |
NLP 标注数据稀缺、监督学习任务定制化严重 → 词嵌入只迁移词级信息,不够 → 选 Transformer 解码器做语言模型(长程依赖 > LSTM) → BooksCorpus 上最大化似然 L₁ → 末层激活接线性层做微调 L₂ = L₃ + λ·L₁ → 遍历式输入变换统一四类任务格式 → 12 项任务 9 项 SOTA → 消融证明预训练是主要功劳 → BERT 四个月后用双向性反超(历史注脚)
枢纽节点:"L₂ 的最后一层激活 h_l^m 接线性输出层"——整个方法的关键是不改动主干,一切任务差异都被推到输入格式和一个小线性层上。推荐阅读路线:必读主线 §2→§3→§5→§6;支线 §4(输入变换细节简单但值得速读,跳过不影响后续)。
来源:论文 §3.1(经中文译本与多份精读资料转录)。超参数部分同时得到 Wikipedia 与 papernotes 两源印证,标注见行内。
学完本章你应能:①默写语言建模似然 L₁ 并解释窗口 k 的含义;②背出 GPT-1 的六个核心规格并互相换算验证;③手算 117M 参数的构成账;④说出 BooksCorpus 相对 1B Word Benchmark 的关键差别。
2018 年前的困境(论文 §1):判别式监督模型在各自任务上各造一套架构,泛化差、标注贵;词嵌入虽普及但只能搬词级语义。前作 ELMo 用 BiLSTM 特征拼接已证明上下文表征的价值,但其 LSTM 的预测能力受限于短程记忆;Dai 等与 ULMFiT 尝试 LM 预训练+微调,也仍困于循环网络(论文 §2 相关工作叙述)。要回答的问题是:什么样的架构 + 什么样的语料能让预训练学到可大范围迁移的知识?
预训练目标(标准语言建模似然,论文式(1)):
| 符号 | 它是什么 | 直觉 |
|---|---|---|
| U = {u₁,…,u_n} | 无标注 token 语料 | 全部教材 |
| k | 上下文窗口(此处即 512 个 token 的感受野上限) | 每道题能看多少上文 |
| Θ | Transformer 解码器全部参数 | 被训练的大脑 |
条件概率由多层 Transformer 解码器给出(论文式(2)的文字形式):对输入上下文做多头 masked 自注意力,再过逐位置前馈层,堆 n 层后投影到目标 token 分布:
其中 W_e 是 token 嵌入矩阵、W_p 是可学习位置嵌入矩阵【论文声称:采用学习式而非原版正弦位置编码】。输出层与嵌入矩阵共享权重(tied embedding,papernotes 架构图注明,单源信息——未核验)。
| 项目 | 数值 | 来源可信度 |
|---|---|---|
| 层数 / 隐藏维 / 注意力头 | 12 层 decoder-only,768 维状态,12 头 × 64 维 | Wikipedia ✓ + 教学幻灯 ✓ 双源一致 |
| 前馈内部维度 | 3072(=4×768) | 中文译本转录 ✓ |
| 激活函数 | GELU | 双源一致 ✓ |
| 优化器 | Adam,峰值 lr 2.5e-4;前 2000 步从 0 线性 warmup,余弦退火至 0 | Wikipedia 原文引用级 ✓ |
| batch / epochs | 64 条随机连续序列 × 512 token;预训练 100 epochs | 两源一致 ✓ |
| 正则 | residual/embedding/attention dropout 均 0.1;非 bias/gain 权重 L2 w=0.01;权重初始化 N(0, 0.02) | 译本+papernots 一致 ✓ |
| 词表 | BPE,40000 merges(约 4 万 token) | 双源一致 ✓ |
| 参数量 | 117M | Wikipedia ✓(Jay Alammar 对同规格 GPT-2 small 实数出 124M 并自问差额原因——口径差异见下) |
| 预训练语料 | BooksCorpus,7000+ 本未出版书籍(约 800M 词,二手常引值——词数未核验) | 书名数有译本佐证 ✓ |
| 困惑度 | 该语料上 token 级困惑度 18.4 | 译本转录,单源——未核验 |
类比:预训练像让一个人先通读数千本书成为"读书破万卷"的人,微调像考前刷几套真题——通读者刷题事半功倍,白丁刷题事倍功半(后面 −14.8% 的消融就是白丁对照组)。
类比在哪里失效:人类通读是理解式的,GPT-1 的"通读"只是左到右猜下一个词;它能迁移是因为猜词这个任务被迫隐式学会句法、共指、语义关联,但从未见过右语境——这层缺陷类比掩盖了,直到 BERT 出现才被量化暴露。
一句话记住本节:一个 12 层、768 维、117M 参数的标准 Transformer 解码器,在 7000 本书上把"猜下一个词"练到困惑度 18.4——这就是全部的魔法原料。
不看材料,你能:①默写 L₁ 并说明 k 是多少?②报出六项核心规格?③把 117M 拆成三块算出来?④说出 BooksCorpus 击败 1B Benchmark 的理由?
来源:论文 §3.2(译本转录)。
学完本章你应能:①默写微调目标 L₂ 并解释 λ 的作用机制;②列出微调阶段的全部新增参数;③背出微调超参数并与预训练对比。
设标注集 C 中每个样本为 token 序列 x¹,…,x^m 与标签 y。取最后一级 Transformer 激活 h_l^m 接线性层 W_y 预测 y:
| 符号 | 它是什么 | 直觉 |
|---|---|---|
| h_l^m | 最后一个位置的末层激活 | 整句话被压缩成的一个向量 |
| W_y | 任务输出头(唯一新增的大参数) | 每个任务一张新"答题卡" |
| λ | 辅助 LM 损失权重(二手资料普遍记为 λ=0.5——原文数值未核验) | 微调时不忘"继续读书",防遗忘兼加速收敛 |
论文给的两点动机:(a) 提升监督模型泛化、(b) 加速收敛,并引 Rei [50] 等前作佐证。【解读者推断】λ 项本质是把预训练分布钉在参数附近的一种正则。
一句话记住本节:微调 = 冻结思路、只加一个线性头,再用 λ 份语言建模损失拴住预训练知识不放跑。
不看材料,你能:①写出 L₃?②数出微调阶段的新增参数种类?③对比预训练与微调的 lr/batch/epoch?
来源:论文 §3.3 及 Figure 1(译本转录)。
学完本章你应能:①画出四类任务的序列拼装格式;②解释相似度任务为何要双向各跑一遍;③指出这套方案对哪些任务最别扭。
| 任务类型 | 序列构造 | 读出方式 |
|---|---|---|
| 分类(如 CoLA/SST-2) | 〈s〉 文本 〈e〉 | 末位激活 → 线性层 |
| 蕴含/NLI(SNLI/MNLI/RTE/QNLI 等) | 〈s〉 前提 $ 假设 〈e〉 | 末位激活 → 三分类 |
| 相似度(MSRP/STS-B/QQP) | 〈s〉 句A $ 句B 〈e〉 与 〈s〉 句B $ 句A 〈e〉 各跑一遍 | 两个末位激活逐元素相加后再进线性层 |
| 问答/多项选择(RACE 等) | 对每个候选 k:〈s〉 文档 z 问题 q $ 答案 a_k 〈e〉 | 各候选独立打分 → softmax 归一化 |
$ 为分隔符 token,〈s〉〈e〉 为随机初始化的首尾标记。除分隔符嵌入外零架构改动。
误读1:"分隔符让模型学会了推理两段关系。"分隔符只是位置标记,关系建模完全靠自注意力自己发现——这也是为什么相似度任务要把两种顺序都喂进去:单向注意力天然不对称,交换顺序是唯一的对称化手段。
误读2:"QA 任务改了模型。"没改——文档+问题+每个候选拼成独立序列分别打分,K 选 1 就跑 K 次,纯输入侧把戏。
【解读者推断】这套变换是全文最被低估的部分:它是 prompt engineering 的雏形——用统一的序列接口替代任务专用架构。
一句话记住本节:所有 NLU 任务都被翻译成同一句话——"一段带分隔符的连续 token",剩下的交给注意力。
来源:论文 Table 1–4(教学幻灯复现原表数字 + aktagon/papernotes 交叉印证)。指标口径:CoLA 为 McNemar 相关(mc)、MRPC/QQP 为 F1、STS-B 为 Pearson 相关(pc)、其余为 accuracy。
学完本章你应能:①按四大类复述 12 个任务及 GPT-1 分数 vs 此前最佳;②指出哪三个任务失守及共同特征;③完成 GLUE 分数的多口径对账。
| 类别 | 任务 | 此前最佳 | GPT-1(单模型) |
|---|---|---|---|
| 自然语言推理 | MNLI-matched | 80.6 | 82.1 |
| MNLI-mismatched | 80.1 | 81.4 | |
| SNLI | 89.3(CAFE 5x ensemble) | 89.9 | |
| SciTail | 83.3 | 88.3 | |
| QNLI | 82.3 | 88.1 | |
| RTE | 61.7(多任务 BiLSTM) | 56.0 ✗ | |
| 问答与常识推理 | Story Cloze | 77.6 | 86.5(+8.9) |
| RACE-m / RACE-h | 58.7 / 49.4 | 62.9 / 57.4 | |
| RACE 整体 | 53.3 | 59.0(+5.7) | |
| GLUE 组成项 | CoLA (mc) | 35.0 | 45.4 |
| SST-2 | 93.2 | 91.3 ✗ | |
| MRPC (F1) | —(幻灯未列基线未核验) | 82.3 | |
| STS-B (pc) / QQP (F1) | —(同上未核验) | 82.0 / 70.3 | |
| 汇总 | GLUE 平均 | 68.9(Wikipedia 口径) | 72.8;Table 5 口径均值 74.7 |
论文宣称 12 项中 9 项显著超越专为任务定制的判别模型;单模型击败了多个 3×–5× ensemble 对手(MNLI/SNLI 上)。
RTE(56.0 vs 61.7)训练集仅 2490 例——小数据上大模型微调反而吃亏;SST-2(91.3 vs 93.2)差距微小;加上 QQP 等接近持平的任务,共同画出了"预训练红利随标注量减少而反转"的边界【解读者推断】。这一边界正是后来 few-shot 路线(GPT-2/3)的出发点。
一句话记住本节:9/12 SOTA、Story Cloze 一口气 +8.9,但在 RTE 这种两千例的小任务上,通用巨兽第一次输给了专用小模型。
不看材料,你能:①背出三大涨幅(8.9/5.7/1.5)对应的任务?②说出 GPT-1 失守的任务与共同特征?③解释 74.7 与 72.8 为什么可以同时成立?
来源:论文 Table 5(教学幻灯逐格转录)与 Figure 2/3 描述。
| 配置 | Avg | CoLA(mc) | SST2(acc) | MRPC(F1) | STSB(pc) | QQP(F1) | MNLI(acc) | QNLI(acc) | RTE(acc) |
|---|---|---|---|---|---|---|---|---|---|
| 完整模型(aux LM) | 74.7 | 45.4 | 91.3 | 82.3 | 82.0 | 70.3 | 81.8 | 88.1 | 56.0 |
| 去掉预训练 | 59.9 | 18.9 | 84.0 | 79.4 | 30.9 | 65.5 | 75.7 | 71.2 | 53.8 |
| 去掉 aux LM(λ=0) | 75.0 | 47.9 | 92.0 | 84.9 | 83.2 | 69.8 | 81.1 | 86.9 | 54.4 |
| 换 2048 单元单层 BiLSTM(保留 aux LM) | 69.1 | 30.3 | 90.5 | 83.2 | 71.8 | 68.1 | 73.7 | 81.1 | 54.6 |
Figure 2(描述级,无绝对分数表):从只迁移嵌入到逐步叠加 12 层,MultiNLI 与 RACE 分数单调上升直至满 12 层——每一层都装着可迁移的知识。zero-shot 实验(Figure 2 右):随预训练步数增加,四个探测任务(情感分析、Winograd、指代、问答类)的归一化性能稳定爬升,Transformer 全面优于同设置 LSTM 且方差更小——语言建模副产品里天然长出了任务能力,这是 GPT 系列路线图的第一次预告。
一句话记住本节:−14.8 的预训练、−5.6 的架构、±0.3 的辅助损失——功劳簿的排序和你想的不一样。
不看材料,你能:①背出三个消融的平均降幅?②指出哪个任务对预训练最敏感(STS-B)?③复述 aux LM 消融与正文主张的矛盾?
NLI 五件套测前提—假设三元关系,但 SNLI 源于图像标注启发式,存在标注偏置;CoLA 测语法可接受性判断(McNemar 相关,对分布极敏感);Story Cloze 与 RACE 是考试式多选,测长程常识与阅读。GPT-1 在"长上下文+常识"型任务涨幅最大(Story Cloze +8.9、RACE +5.7),与"书本语料培养长程依赖"的设计动机自洽——这种任务画像与设计的一致性本身就是一种证据质量信号【解读者推断】。
对手多为各任务定制模型甚至 3×–5× ensemble,而 GPT-1 以单模型参战并在 MNLI/SNLI 上取胜——这是加分项。减分项:①RTE 等小数据任务上对手(多任务 BiLSTM 61.7)用了跨任务联合训练,比较前提并不等同;②GLUE 各任务的超参搜索预算是否对齐各基线,原文未报告;③所有基线数字来自论文引用的已发表结果,时代不同、调参强度不同。
论文未报告预训练的计算成本(GPU 型号/卡时均缺)——这是本文最大的披露缺口之一【解读者推断】。以 117M×100 epochs×800M 词粗估,这是一笔不小的开销,而当时社区默认"预训练无用论",成本透明度直接影响范式说服力。
①方差与显著性:未见多 seed 方差报告(二手资料亦未提及,未核验);②RTE 失败的分析缺席:只在表格中出现,正文未讨论;③单向性的代价未被正视:"The bank by the river was steep" 这类右侧消歧案例完全不在讨论范围,四个月后 BERT 用双向性在 GLUE 上拉开 6.8 分(79.6 vs 72.8)才算补上这笔账;④BooksCorpus 清洗细节有限:ftfy 清理 + spaCy 分词之外的数据质量控制未详述;⑤GLUE 口径混乱(见 5.3 对账1)。
本页所有结果数字均转录自上述二手资料对原文表格的复制,未与 OpenAI 原始 PDF 逐一核对;GLUE 提升幅度、λ=0.5、困惑度 18.4、RACE 子表一致性等处均已标注存疑或未核验。引用请以原文 PDF 为最终依据。
综合只给三个事实:"BooksCorpus 长篇书籍"、"decoder-only 单向注意力"、"12 任务中 Story Cloze 涨幅最大"。推出:作者为什么这样选,以及这条路线的必然短板是什么。
参考答案要点
长篇书籍 → 需要长程连贯建模 → 选 Transformer(自注意力直达任意距离,胜过 LSTM 的顺序压缩);单向 decoder → 训练目标只能是"看左猜右"的生成式 LM → 迁移时所有任务被迫适配单向读取(输入变换、相似度跑两遍);书本叙事 → 常识与故事理解最强 → Story Cloze +8.9 最大涨幅。必然短板:右侧语境永久缺失 → 需要对称/双向理解的任务(蕴含细粒度、相似度)效率低下;小数据微调吃力(RTE)。(开放题:按"选择—机制—短板"三层给分。)
综合核查五组数字:A) 12 头×64 维 vs 768;B) 手算参数账 vs 117M;C) Table 5 均值 74.7 vs GLUE 72.8;D) 摘要 GLUE "+5.5%" vs 72.8−68.9=3.9;E) 去预训练后 STS-B 30.9 vs 完整 82.0。
参考答案
A ✓;B ✓(≈116M,tied output 假设下吻合);C ✓(任务池不同的两个口径);D ✗ 对不上——可能涉及多任务版分数或基线口径差异,原文无法核验,必须存疑引用;E ✓ 但含义重大:Pearson 82.0→30.9 说明预训练几乎是语义相关能力的唯一来源。(A–C 各 1 分,D 辨析 2 分。)
综合四连答辩:①为何选 decoder-only 而非 encoder-decoder;②为何用学习式位置嵌入替换正弦编码;③为何保留 aux LM 损失(在 Table 5 显示近零收益的情况下如何辩护);④为何相似度任务要双向各跑一遍而不是共享一次前向。
参考答案要点
①目标任务是"为下游提供初始化"的语言模型,decoder-only 天然匹配生成式 LM 目标,且省掉交叉注意力复杂度;②短序列+固定 512 窗口下可学习的绝对位置足够,且实现简单(论文未给对比实验,论据薄弱——诚实说"够用即可");③辩护只能诉诸任务级异质性:NLI/QNLI 上有效(防遗忘),均值近零因 SST/MRPC 反向抵消;若答辩者引 Table 5 说"其实没用"也应得分——这正是本题想考的证据意识;④masked 单向注意力下"句A$句B"与"句B$句A"的信息流不对称,两次前向取和是对称化的最低成本方案。(每项 2 分,③按证据意识单独计分。)
综合回看 1.2 预评分:
参考答案(解读者示范)
C1 ★★★ 维持:主表+消融双证齐全,−14.8 是全文最硬数字。C2 ★★→★★+:LSTM 消融虽单薄,但 zero-shot 曲线上 Transformer 的稳定性提供了旁证。C3 ★★→★ 下调:Table 5 显示均值为负收益,"有益"主张仅在部分任务成立,正文叙事与自家表格存在张力。C4 ★→★★ 上调:12 任务全面成功本身就是输入变换可用性的大规模间接验证,尽管无逐变换消融。C5 ★★ 维持:折线趋势清楚,但归一化相对分掩盖绝对水平,说服力中等。
①把单向改为双向会怎样?(BERT 给出了答案,但生成能力是否受损是开放题)②zero-shot 能力随规模增长曲线的形状——GPT-2 用 15 亿参数续写了这一章。③aux LM 损失在现代大模型微调(instruction tuning)中的对应物是什么?