← 总目录 / 板块三 · 语言模型的发展
板块三 · 语言模型的发展

第21篇 · GPT-1

先当作家再当考生:生成式预训练 + 判别式微调,一个模型通吃十二项语言理解任务。
Improving Language Understanding by Generative Pre-Training · Alec Radford, Karthik Narasimhan, Tim Salimans, Ilya Sutskever(OpenAI)· 2018 · 原文 PDF(OpenAI)
⚠ 资料来源声明:本篇原文仅有 OpenAI PDF,无 arXiv 版。制作时未直接抓取 PDF 全文,正文框架与数字由以下二手资料交叉补齐:①Wikipedia「GPT-1」条目(确认架构、优化器与 GLUE/CoLA 等关键分数);②复现论文原表的教学幻灯(jishnujayakumar.github.io,含 Table 5 消融全表数字);③多篇论文精读博客(ai-papers.aktagon.com、awesome.papernotes.org、cnblogs 论文阅读笔记,含中文译文段落)。凡未能从至少两个独立二手来源相互印证的细节,均已在文中显式标注"未核验";所有数字视为"转述自论文的二手转录",未经原文逐字核对。

阅读约定【解读者补充/推断】内容不来自论文;【论文声称】为作者叙事,【实验支持】表示消融或主实验有对应数据。证据强度:★★★ 主实验+消融 ★★ 单一证据 ★ 只是主张

一、全局大图

1.1 摘要拆解:摘要 → 论文章节 → 本页导航

摘要要点论文位置本页章节
"generative pre-training of a language model on … unlabeled text"§3.1 Unsupervised pre-training第二章 预训练手术
"discriminative fine-tuning on each specific task"§3.2 Supervised fine-tuning第三章 微调目标
"task-aware input transformations … minimal changes to model architecture"§3.3 Task-specific input transformations第四章 输入变换
"12 tasks … state-of-the-art on 9";Story Cloze +8.9%、RACE +5.7%、MultiNLI +1.5%、GLUE +5.5%§4.2 Experiments第五章 成绩单全表
"analyze zero-shot behaviors of the pre-trained model"§4 分析小节第六章 消融与分析

注:摘要中 GLUE 提升幅度记为 +5.5%(72.8 vs 此前 68.9,Wikipedia 口径);另有二手资料称多任务微调版 GLUE 均值 75.1——两个口径并存,见第五章对账。

1.2 主要贡献与证据强度预评

#论文声称的贡献预评证据强度依据
C1生成式预训练大幅提升判别任务表现(半监督范式可行)★★★12 任务主表 + 去预训练消融(均值 −14.8%,Table 5)
C2Transformer 比 LSTM 更适合迁移★★LSTM 替换消融 −5.6 分(Table 5),单组对照
C3微调时加辅助 LM 损失有益(λ 加权)★★→弱去掉后均值仅 −0.3 左右且部分任务反而更好(Table 5),效应很小
C4遍历式输入变换可让单一架构覆盖四类结构化任务★→★★设计主张 + 12 任务整体成功作间接证据,无逐变换消融
C5预训练过程自发习得执行类任务的能力(zero-shot 随训练步数上升)★★Figure 2 折线图(归一化相对分),无绝对分数表

1.3 知识依赖图(主干线)

NLP 标注数据稀缺、监督学习任务定制化严重词嵌入只迁移词级信息,不够选 Transformer 解码器做语言模型(长程依赖 > LSTM)BooksCorpus 上最大化似然 L₁末层激活接线性层做微调 L₂ = L₃ + λ·L₁遍历式输入变换统一四类任务格式12 项任务 9 项 SOTA消融证明预训练是主要功劳BERT 四个月后用双向性反超(历史注脚)

枢纽节点:"L₂ 的最后一层激活 h_l^m 接线性输出层"——整个方法的关键是不改动主干,一切任务差异都被推到输入格式和一个小线性层上。推荐阅读路线:必读主线 §2→§3→§5→§6;支线 §4(输入变换细节简单但值得速读,跳过不影响后续)。

二、逐章精读 · 无监督预训练(论文 §3.1)

来源:论文 §3.1(经中文译本与多份精读资料转录)。超参数部分同时得到 Wikipedia 与 papernotes 两源印证,标注见行内。

2.1 学习目标

学完本章你应能:①默写语言建模似然 L₁ 并解释窗口 k 的含义;②背出 GPT-1 的六个核心规格并互相换算验证;③手算 117M 参数的构成账;④说出 BooksCorpus 相对 1B Word Benchmark 的关键差别。

2.2 失效模式先行

2018 年前的困境(论文 §1):判别式监督模型在各自任务上各造一套架构,泛化差、标注贵;词嵌入虽普及但只能搬词级语义。前作 ELMo 用 BiLSTM 特征拼接已证明上下文表征的价值,但其 LSTM 的预测能力受限于短程记忆;Dai 等与 ULMFiT 尝试 LM 预训练+微调,也仍困于循环网络(论文 §2 相关工作叙述)。要回答的问题是:什么样的架构 + 什么样的语料能让预训练学到可大范围迁移的知识?

2.3 公式手术

预训练目标(标准语言建模似然,论文式(1)):

L₁(U) = Σi log P(ui | ui−k, …, ui−1; Θ)
符号它是什么直觉
U = {u₁,…,u_n}无标注 token 语料全部教材
k上下文窗口(此处即 512 个 token 的感受野上限)每道题能看多少上文
ΘTransformer 解码器全部参数被训练的大脑

条件概率由多层 Transformer 解码器给出(论文式(2)的文字形式):对输入上下文做多头 masked 自注意力,再过逐位置前馈层,堆 n 层后投影到目标 token 分布:

h₀ = U·W_e + W_p; h_l = transformer_block(h_{l−1}); P(u) = softmax(h_n·W_e^T)

其中 W_e 是 token 嵌入矩阵、W_p 是可学习位置嵌入矩阵【论文声称:采用学习式而非原版正弦位置编码】。输出层与嵌入矩阵共享权重(tied embedding,papernotes 架构图注明,单源信息——未核验)。

2.4 规格清单与手算验证

项目数值来源可信度
层数 / 隐藏维 / 注意力头12 层 decoder-only,768 维状态,12 头 × 64 维Wikipedia ✓ + 教学幻灯 ✓ 双源一致
前馈内部维度3072(=4×768)中文译本转录 ✓
激活函数GELU双源一致 ✓
优化器Adam,峰值 lr 2.5e-4;前 2000 步从 0 线性 warmup,余弦退火至 0Wikipedia 原文引用级 ✓
batch / epochs64 条随机连续序列 × 512 token;预训练 100 epochs两源一致 ✓
正则residual/embedding/attention dropout 均 0.1;非 bias/gain 权重 L2 w=0.01;权重初始化 N(0, 0.02)译本+papernots 一致 ✓
词表BPE,40000 merges(约 4 万 token)双源一致 ✓
参数量117MWikipedia ✓(Jay Alammar 对同规格 GPT-2 small 实数出 124M 并自问差额原因——口径差异见下)
预训练语料BooksCorpus,7000+ 本未出版书籍(约 800M 词,二手常引值——词数未核验书名数有译本佐证 ✓
困惑度该语料上 token 级困惑度 18.4译本转录,单源——未核验
手算参数账【解读者补充】:嵌入 40000×768≈30.7M;位置嵌入 512×768≈0.39M;每层:自注意力的 Q/K/V/O 四个 768×768 ≈ 4×0.59M=2.36M,FFN 为 768×3072 + 3072×768 ≈ 4.72M,LayerNorm 可忽略 → 约 7.08M/层 × 12 层 ≈ 85M;输出层与嵌入绑定不计。合计 ≈ 116.1M ≈ 117M ✓。若输出层不绑权重则应再加 30.7M 得 ~147M——所以 117M 这个数字本身就暗示了 tied embedding(这也反过来提高了上面那条"未核验"的可信度)。Jay Alammar 在 GPT-2 上数出的 124M 差额来自词表实为 50257 而非 40000 的版本差异,属 GPT-2 口径,勿混淆。

2.5 直觉类比与失效点

类比:预训练像让一个人先通读数千本书成为"读书破万卷"的人,微调像考前刷几套真题——通读者刷题事半功倍,白丁刷题事倍功半(后面 −14.8% 的消融就是白丁对照组)。
类比在哪里失效:人类通读是理解式的,GPT-1 的"通读"只是左到右猜下一个词;它能迁移是因为猜词这个任务被迫隐式学会句法、共指、语义关联,但从未见过右语境——这层缺陷类比掩盖了,直到 BERT 出现才被量化暴露。

2.6 数字对账与常见误读

对账:12 头×64 维=768 ✓;FFN 3072=4×768 ✓(沿用原 Transformer 的 4 倍惯例);batch 64×512=32768 token/步,2000 步 warmup 即约 65.5M token 见完 warmup ✓ 数量级合理。
误读1:"GPT-1 用的是完整 Transformer。"只用解码器栈,且去掉了编码器交叉注意力子层,每个 block 只剩 masked 自注意力 + FFN。
误读2:"BooksCorpus 是随便找的网络文本。"论文特意强调其长连续篇章特性,并点名对比 ELMo 用的 1B Word Benchmark——后者句子级打乱、破坏长程结构,这正是选书的理由。
误读3:"100 epochs 会过拟合到死。"预训练目标是亿级 token 上的生成任务本身,多轮遍历是常见做法(此为解读者对该设计的阐释,论文未讨论)。

2.7 一句话蒸馏

一句话记住本节:一个 12 层、768 维、117M 参数的标准 Transformer 解码器,在 7000 本书上把"猜下一个词"练到困惑度 18.4——这就是全部的魔法原料。

2.8 闭卷自检清单

不看材料,你能:①默写 L₁ 并说明 k 是多少?②报出六项核心规格?③把 117M 拆成三块算出来?④说出 BooksCorpus 击败 1B Benchmark 的理由?

三、逐章精读 · 有监督微调(论文 §3.2)

来源:论文 §3.2(译本转录)。

3.1 学习目标

学完本章你应能:①默写微调目标 L₂ 并解释 λ 的作用机制;②列出微调阶段的全部新增参数;③背出微调超参数并与预训练对比。

3.2 公式手术

设标注集 C 中每个样本为 token 序列 x¹,…,x^m 与标签 y。取最后一级 Transformer 激活 h_l^m 接线性层 W_y 预测 y:

P(y | x¹,…,x^m) = softmax(h_l^m · W_y)
L₂(C) = Σ log P(y|x); L₃(C) = L₂(C) + λ·L₁(C)
符号它是什么直觉
h_l^m最后一个位置的末层激活整句话被压缩成的一个向量
W_y任务输出头(唯一新增的大参数)每个任务一张新"答题卡"
λ辅助 LM 损失权重(二手资料普遍记为 λ=0.5——原文数值未核验微调时不忘"继续读书",防遗忘兼加速收敛

论文给的两点动机:(a) 提升监督模型泛化、(b) 加速收敛,并引 Rei [50] 等前作佐证。【解读者推断】λ 项本质是把预训练分布钉在参数附近的一种正则。

3.3 微调配置(全部为二手转录数字)

工程账单:"最小改动"策略缓解了每任务一架构的研发成本压力;新增压力是所有任务共享同一个单向读取方式,结构化输入必须硬塞进一条序列(下一章);埋下的债是相似度等对称任务要做两遍前向再相加,计算翻倍——这笔债后来由双向模型偿还。

3.4 一句话蒸馏

一句话记住本节:微调 = 冻结思路、只加一个线性头,再用 λ 份语言建模损失拴住预训练知识不放跑。

3.5 闭卷自检清单

不看材料,你能:①写出 L₃?②数出微调阶段的新增参数种类?③对比预训练与微调的 lr/batch/epoch?

四、逐章精读 · 任务无关的输入变换(论文 §3.3)

来源:论文 §3.3 及 Figure 1(译本转录)。

4.1 学习目标

学完本章你应能:①画出四类任务的序列拼装格式;②解释相似度任务为何要双向各跑一遍;③指出这套方案对哪些任务最别扭。

4.2 格式手册(traversal-style [52])

任务类型序列构造读出方式
分类(如 CoLA/SST-2)〈s〉 文本 〈e〉末位激活 → 线性层
蕴含/NLI(SNLI/MNLI/RTE/QNLI 等)〈s〉 前提 $ 假设 〈e〉末位激活 → 三分类
相似度(MSRP/STS-B/QQP)〈s〉 句A $ 句B 〈e〉 与 〈s〉 句B $ 句A 〈e〉 各跑一遍两个末位激活逐元素相加后再进线性层
问答/多项选择(RACE 等)对每个候选 k:〈s〉 文档 z 问题 q $ 答案 a_k 〈e〉各候选独立打分 → softmax 归一化

$ 为分隔符 token,〈s〉〈e〉 为随机初始化的首尾标记。除分隔符嵌入外零架构改动

4.3 常见误读

误读1:"分隔符让模型学会了推理两段关系。"分隔符只是位置标记,关系建模完全靠自注意力自己发现——这也是为什么相似度任务要把两种顺序都喂进去:单向注意力天然不对称,交换顺序是唯一的对称化手段。
误读2:"QA 任务改了模型。"没改——文档+问题+每个候选拼成独立序列分别打分,K 选 1 就跑 K 次,纯输入侧把戏。
【解读者推断】这套变换是全文最被低估的部分:它是 prompt engineering 的雏形——用统一的序列接口替代任务专用架构。

4.4 一句话蒸馏

一句话记住本节:所有 NLU 任务都被翻译成同一句话——"一段带分隔符的连续 token",剩下的交给注意力。

五、逐章精读 · 十二项任务成绩单(论文 §4)

来源:论文 Table 1–4(教学幻灯复现原表数字 + aktagon/papernotes 交叉印证)。指标口径:CoLA 为 McNemar 相关(mc)、MRPC/QQP 为 F1、STS-B 为 Pearson 相关(pc)、其余为 accuracy。

5.1 学习目标

学完本章你应能:①按四大类复述 12 个任务及 GPT-1 分数 vs 此前最佳;②指出哪三个任务失守及共同特征;③完成 GLUE 分数的多口径对账。

5.2 成绩全景

类别任务此前最佳GPT-1(单模型)
自然语言推理MNLI-matched80.682.1
MNLI-mismatched80.181.4
SNLI89.3(CAFE 5x ensemble)89.9
SciTail83.388.3
QNLI82.388.1
RTE61.7(多任务 BiLSTM)56.0 ✗
问答与常识推理Story Cloze77.686.5(+8.9)
RACE-m / RACE-h58.7 / 49.462.9 / 57.4
RACE 整体53.359.0(+5.7)
GLUE 组成项CoLA (mc)35.045.4
SST-293.291.3 ✗
MRPC (F1)—(幻灯未列基线未核验82.3
STS-B (pc) / QQP (F1)—(同上未核验82.0 / 70.3
汇总GLUE 平均68.9(Wikipedia 口径)72.8;Table 5 口径均值 74.7

论文宣称 12 项中 9 项显著超越专为任务定制的判别模型;单模型击败了多个 3×–5× ensemble 对手(MNLI/SNLI 上)。

5.3 数字对账

对账1:摘要"+5.5% GLUE" vs Wikipedia "72.8 vs 68.9" ✓(72.8−68.9=3.9,与 5.5 不符!)。这里确实对不上:5.5 应为多任务微调版或其他口径(二手 papernotes 称多任务版均值 75.1,75.1−68.9=6.2 也对不上 5.5)。三种可能:基线口径不同(68.9 可能不含全部 8 项)、多任务版分数不同、或摘要统计的是另一组合。结论:GLUE 提升幅度的精确口径无法在本页核实,如实存疑。
对账2:Table 5 全模型均值 74.7 vs GLUE 72.8——前者是"9 个有基线任务的 unweighted 平均"(幻灯注明 Avg 为 unweighted average of all results),后者是 GLUE 官方 8 项平均,任务池不同,两者不矛盾但不可互换引用。
对账3:RACE-m 62.9 与 RACE-h 57.4 的均值 ≈60.15,与 RACE 整体 59.0 不完全相等——整体分并非两分表简单平均(题数加权或评测协议不同),原文未解释,标注存疑。

5.4 失守的三项说明了什么

RTE(56.0 vs 61.7)训练集仅 2490 例——小数据上大模型微调反而吃亏;SST-2(91.3 vs 93.2)差距微小;加上 QQP 等接近持平的任务,共同画出了"预训练红利随标注量减少而反转"的边界【解读者推断】。这一边界正是后来 few-shot 路线(GPT-2/3)的出发点。

5.5 一句话蒸馏

一句话记住本节:9/12 SOTA、Story Cloze 一口气 +8.9,但在 RTE 这种两千例的小任务上,通用巨兽第一次输给了专用小模型。

5.6 闭卷自检清单

不看材料,你能:①背出三大涨幅(8.9/5.7/1.5)对应的任务?②说出 GPT-1 失守的任务与共同特征?③解释 74.7 与 72.8 为什么可以同时成立?

六、逐章精读 · 消融与分析(论文 §4 分析小节,Table 5)

来源:论文 Table 5(教学幻灯逐格转录)与 Figure 2/3 描述。

6.1 消融总表(Avg 为无权平均)

配置AvgCoLA(mc)SST2(acc)MRPC(F1)STSB(pc)QQP(F1)MNLI(acc)QNLI(acc)RTE(acc)
完整模型(aux LM)74.745.491.382.382.070.381.888.156.0
去掉预训练59.918.984.079.430.965.575.771.253.8
去掉 aux LM(λ=0)75.047.992.084.983.269.881.186.954.4
换 2048 单元单层 BiLSTM(保留 aux LM)69.130.390.583.271.868.173.781.154.6
读表三连:①去预训练 −14.8 → 预训练是第一功臣,且 STS-B 从 82.0 崩到 30.9(几乎失去相关性能力)最触目;②换 LSTM −5.6 → 架构贡献真实存在,但只有 MRPC 一个任务上 LSTM 反超;③去 aux LM 后均值反而 +0.3(75.0 vs 74.7)——多数任务变好,RTE/QNLI/MNLI 变差。这与正文"辅助目标有益"的叙述方向相反,是全文最值得追问的矛盾:论文的解释是该目标主要在大数据任务上防过拟合,平均而言效应接近噪声。引用任何"GPT-1 证明了 aux LM 重要"的说法都应回看这张表。

6.2 层级迁移与 zero-shot 曲线

Figure 2(描述级,无绝对分数表):从只迁移嵌入到逐步叠加 12 层,MultiNLI 与 RACE 分数单调上升直至满 12 层——每一层都装着可迁移的知识。zero-shot 实验(Figure 2 右):随预训练步数增加,四个探测任务(情感分析、Winograd、指代、问答类)的归一化性能稳定爬升,Transformer 全面优于同设置 LSTM 且方差更小——语言建模副产品里天然长出了任务能力,这是 GPT 系列路线图的第一次预告。

6.3 一句话蒸馏

一句话记住本节:−14.8 的预训练、−5.6 的架构、±0.3 的辅助损失——功劳簿的排序和你想的不一样。

6.4 闭卷自检清单

不看材料,你能:①背出三个消融的平均降幅?②指出哪个任务对预训练最敏感(STS-B)?③复述 aux LM 消融与正文主张的矛盾?

七、批判性阅读:如何不被这些数字带节奏

7.1 每个 benchmark 到底测什么

NLI 五件套测前提—假设三元关系,但 SNLI 源于图像标注启发式,存在标注偏置;CoLA 测语法可接受性判断(McNemar 相关,对分布极敏感);Story Cloze 与 RACE 是考试式多选,测长程常识与阅读。GPT-1 在"长上下文+常识"型任务涨幅最大(Story Cloze +8.9、RACE +5.7),与"书本语料培养长程依赖"的设计动机自洽——这种任务画像与设计的一致性本身就是一种证据质量信号【解读者推断】。

7.2 比较公平性审计

对手多为各任务定制模型甚至 3×–5× ensemble,而 GPT-1 以单模型参战并在 MNLI/SNLI 上取胜——这是加分项。减分项:①RTE 等小数据任务上对手(多任务 BiLSTM 61.7)用了跨任务联合训练,比较前提并不等同;②GLUE 各任务的超参搜索预算是否对齐各基线,原文未报告;③所有基线数字来自论文引用的已发表结果,时代不同、调参强度不同。

7.3 第二坐标轴:成本

论文未报告预训练的计算成本(GPU 型号/卡时均缺)——这是本文最大的披露缺口之一【解读者推断】。以 117M×100 epochs×800M 词粗估,这是一笔不小的开销,而当时社区默认"预训练无用论",成本透明度直接影响范式说服力。

7.4 论文没有告诉你什么

方差与显著性:未见多 seed 方差报告(二手资料亦未提及,未核验);②RTE 失败的分析缺席:只在表格中出现,正文未讨论;③单向性的代价未被正视:"The bank by the river was steep" 这类右侧消歧案例完全不在讨论范围,四个月后 BERT 用双向性在 GLUE 上拉开 6.8 分(79.6 vs 72.8)才算补上这笔账;④BooksCorpus 清洗细节有限:ftfy 清理 + spaCy 分词之外的数据质量控制未详述;⑤GLUE 口径混乱(见 5.3 对账1)。

7.5 数字引用纪律声明

本页所有结果数字均转录自上述二手资料对原文表格的复制,未与 OpenAI 原始 PDF 逐一核对;GLUE 提升幅度、λ=0.5、困惑度 18.4、RACE 子表一致性等处均已标注存疑或未核验。引用请以原文 PDF 为最终依据。

八、综合考核(毕业关)

8.1 重建因果链

综合只给三个事实:"BooksCorpus 长篇书籍"、"decoder-only 单向注意力"、"12 任务中 Story Cloze 涨幅最大"。推出:作者为什么这样选,以及这条路线的必然短板是什么。

参考答案要点长篇书籍 → 需要长程连贯建模 → 选 Transformer(自注意力直达任意距离,胜过 LSTM 的顺序压缩);单向 decoder → 训练目标只能是"看左猜右"的生成式 LM → 迁移时所有任务被迫适配单向读取(输入变换、相似度跑两遍);书本叙事 → 常识与故事理解最强 → Story Cloze +8.9 最大涨幅。必然短板:右侧语境永久缺失 → 需要对称/双向理解的任务(蕴含细粒度、相似度)效率低下;小数据微调吃力(RTE)。(开放题:按"选择—机制—短板"三层给分。)

8.2 数字总对账

综合核查五组数字:A) 12 头×64 维 vs 768;B) 手算参数账 vs 117M;C) Table 5 均值 74.7 vs GLUE 72.8;D) 摘要 GLUE "+5.5%" vs 72.8−68.9=3.9;E) 去预训练后 STS-B 30.9 vs 完整 82.0。

参考答案A ✓;B ✓(≈116M,tied output 假设下吻合);C ✓(任务池不同的两个口径);D ✗ 对不上——可能涉及多任务版分数或基线口径差异,原文无法核验,必须存疑引用;E ✓ 但含义重大:Pearson 82.0→30.9 说明预训练几乎是语义相关能力的唯一来源。(A–C 各 1 分,D 辨析 2 分。)

8.3 设计决策答辩

综合四连答辩:①为何选 decoder-only 而非 encoder-decoder;②为何用学习式位置嵌入替换正弦编码;③为何保留 aux LM 损失(在 Table 5 显示近零收益的情况下如何辩护);④为何相似度任务要双向各跑一遍而不是共享一次前向。

参考答案要点①目标任务是"为下游提供初始化"的语言模型,decoder-only 天然匹配生成式 LM 目标,且省掉交叉注意力复杂度;②短序列+固定 512 窗口下可学习的绝对位置足够,且实现简单(论文未给对比实验,论据薄弱——诚实说"够用即可");③辩护只能诉诸任务级异质性:NLI/QNLI 上有效(防遗忘),均值近零因 SST/MRPC 反向抵消;若答辩者引 Table 5 说"其实没用"也应得分——这正是本题想考的证据意识;④masked 单向注意力下"句A$句B"与"句B$句A"的信息流不对称,两次前向取和是对称化的最低成本方案。(每项 2 分,③按证据意识单独计分。)

8.4 证据审计

综合回看 1.2 预评分:

参考答案(解读者示范)C1 ★★★ 维持:主表+消融双证齐全,−14.8 是全文最硬数字。C2 ★★→★★+:LSTM 消融虽单薄,但 zero-shot 曲线上 Transformer 的稳定性提供了旁证。C3 ★★→★ 下调:Table 5 显示均值为负收益,"有益"主张仅在部分任务成立,正文叙事与自家表格存在张力。C4 ★→★★ 上调:12 任务全面成功本身就是输入变换可用性的大规模间接验证,尽管无逐变换消融。C5 ★★ 维持:折线趋势清楚,但归一化相对分掩盖绝对水平,说服力中等。

8.5 开放研究问题(可选延伸)

①把单向改为双向会怎样?(BERT 给出了答案,但生成能力是否受损是开放题)②zero-shot 能力随规模增长曲线的形状——GPT-2 用 15 亿参数续写了这一章。③aux LM 损失在现代大模型微调(instruction tuning)中的对应物是什么?