← 总目录 / 板块一 · 模型的范式变迁
板块一 · 模型的范式变迁

第6篇 · Transformer

注意力就是你所需的一切——删掉循环与卷积,用八个并行"头"和一条 O(1) 的信息通路重写序列建模。
Attention Is All You Need · Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin(Google Brain / Google Research / Univ. of Toronto)· 2017 · arXiv:1706.03762(NeurIPS 2017)

本材料说明:【论文声称】=作者观点或叙事框架;【实验支持】=论文中有数据支撑;【解读者推断】=精读者推理,论文未明说。所有数字均复述自 arXiv 版原文,未做外部验证。

一、全局大图

1.1 摘要拆解对照表

摘要短语对应论文章节对应精读章节
"主流序列转换模型基于复杂 RNN/CNN……最优模型还要加注意力"§1、§2 Background第二章 §2.3 失效模式
"完全基于注意力、彻底抛弃循环与卷积"§3 Model Architecture第三、四章
"更平行、训练时间显著更短"§4 Why Self-Attention、§5 Training第五章
"WMT14 英德 28.4 BLEU,超最佳结果(含集成)逾 2 BLEU"§6.1 Table 2第六章 §6.1
"英法 41.8 BLEU 单模型 SOTA,8 GPU 训 3.5 天"§6.1第六章 §6.1–6.2
"成功应用于英文成分句法分析,泛化性好"§6.3 Table 4第六章 §6.3(略读)

1.2 主要贡献与证据强度预评

#声称的贡献证据强度预评
1首个完全依赖自注意力的序列转换模型,翻译质量 SOTA 且训练成本低一个量级强实验支撑 Table 2 质量与 FLOPs 双坐标
2缩放点积注意力+多头机制是有效设计消融支撑 Table 3 行 (A)(B),但"为什么多头好"无机理解释
3正弦位置编码可用,且可能利于外推更长序列主张为主 与学习式编码"几乎相同"(行E),外推性未实测
4自注意力在复杂度/并行度/路径长度三方面优于 RNN/CNN理论对比表 Table 1 是复杂度分析而非端到端实验
5注意力头呈现可解释的句法/语义行为个例展示 附录仅数张可视化,无系统量化

1.3 推荐阅读路线

必读主线:§3.2 注意力公式 → §4 Why Self-Attention(Table 1)→ §6.1 主结果。这条线覆盖机制、动机、证据三层。

可跳读支线:§5.3 优化器细节、§6.3 句法分析。跳过的代价:综合考核中"warmup 学习率"答辩题与"泛化到非翻译任务"的讨论将失去支撑;主线上不受影响。

依赖提示:枢纽概念是缩放因子 1/√dk——它连接 softmax 梯度、点积方差论证与消融行 (B) 三处内容,值得慢读。

二、逐章精读:架构总览与注意力机制(对应论文 §3)

2.1 来源标注

来源:论文 §3 Model Architecture(§3.1–§3.5)。"解读者补充"处已标注。

2.2 可验证的学习目标

2.3 失效模式先行

RNN 把计算绑定在序列位置上:ht 依赖 ht−1,训练样本内天然不可并行,长句下显存限制跨样本 batch,顺序计算的约束无法靠工程技巧根除【论文声称,§1】。ByteNet/ConvS2S 用卷积换来了并行,但两个远距离位置的信号交互需要 O(n) 或 O(logkn) 层运算,长程依赖难学【§2】。已有的注意力机制又都寄生于 RNN 之上。失效模式总结:要么不能并行(RNN),要么路径太长(CNN),注意力从未被允许独立挑大梁

2.4 直觉与类比

类比:多头注意力像一个翻译小组:每个成员(头)带着自己的"关注滤镜"通读全句(各自的 WQ,WK,WV 投影),各写一份摘要(64 维 headi),最后拼接成稿再统一润色(Concat 后乘 WO)。

类比在哪里失效:小组成员有分工沟通,而八个头之间零通信,只在拼接后线性混合;且"头=语法角色"的拟人化解读缺乏因果证据——附录的可视化只是个例展示。【解读者观点】

2.5 公式手术

公式 (1):缩放点积注意力

Attention(Q,K,V) = softmax(QKᵀ ⁄ √dk) V
符号它是什么直觉
Q ∈ ℝn×d_k查询矩阵(n 个位置 × dk 维)"我在找什么"
K ∈ ℝm×d_k键矩阵(m 个位置)"我有什么标签可被检索"
V ∈ ℝm×d_v值矩阵"命中后被取走的实际内容"
QKᵀ ∈ ℝn×m全部查询-键点积相似度打分表
√dk缩放因子防大点积把 softmax 推进梯度极小的饱和区
softmax(·)沿 m 维(键方向)归一化每个查询对 m 个位置的权重和为 1

维度流【解读者补充】:输出 ∈ ℝn×d_v——行数由查询决定、列数由值决定,与键数 m 无关;这就是解码器可以"每步查全部编码器位置"的形状基础。选择点积而非加性注意力的理由:可走高度优化的矩阵乘法,实践上更快更省空间【论文声称,§3.2.1】。

缩放的方差论证(脚注1):设 q、k 各分量为均值 0、方差 1 的独立随机变量,则 q·k=Σqiki 均值 0、方差 dk——dk=64 时点积标准差约 ±8,输入 softmax 后极易落入饱和区、梯度极小;除以 √dk 使方差回到 1。前提提醒:"分量独立同分布且单位方差"是理想化假设,真实网络中不严格成立,此论证只定标不定界。【解读者推断】

多头公式

MultiHead(Q,K,V) = Concat(head₁,…,headh) WO,headi = Attention(QWiQ, KWiK, VWiV)
符号它是什么直觉
WiQ/K/V ∈ ℝd_model×d_k/d_v每个头自己的投影给每个头独立的子空间视角
WO ∈ ℝh·d_v×d_model输出投影把 8×64=512 维拼接压回 512

关键数量关系(巧合但基石,解读者强调):h·dk=8×64=512=dmodel,所以多头的总计算量与"单头全维注意力"相当——多头不是靠堆算力买来的,而是同一笔预算换了花法(论文 §3.2.2 原话 "similar to that of single-head attention with full dimensionality")。

FFN(公式2)与位置编码

FFN(x) = max(0, xW₁+b₁)W₂+b₂ (512→2048→512,逐位置相同)
PE(pos,2i)=sin(pos/10000^(2i/d_model));PE(pos,2i+1)=cos(pos/10000^(2i/d_model))

波长从 2π 到 10000·2π 几何级数展开;作者假设任意固定偏移 k 的 PEpos+k 可表示为 PEpos 的线性函数,便于学相对位置【论文声称】。嵌入层与 pre-softmax 变换共享同一权重矩阵,嵌入需乘 √dmodel(§3.4)。每个子层套 LayerNorm(x + Sublayer(x));解码器自注意力加掩码(非法位置置 −∞)保证自回归性质。

2.6 手算验证:base 模型参数量对账

费米估算(解读者补充,目标 ≈65M)

① 共享词表嵌入:37000×512≈18.9M;② 每层四个投影 WQ/K/V/O 各 512×512≈0.26M,共 1.05M;③ FFN:512×2048×2≈2.10M;④ 编码器层 ≈3.15M×6=18.9M;⑤ 解码器层多一组交叉注意力投影 ≈(3.15+0.79)M×6≈23.6M;⑥ 输出偏置等忽略。

合计 ≈18.9+18.9+23.6 ≈ 61.4M,与论文 Table 3 的 65M 同量级(差值来自未计入的 LayerNorm 参数、偏置与舍入)——对账通过。顺带发现:词表嵌入占了近三分之一参数,这是共享嵌入(§3.4)的动机之一。

2.7 数字对账

2.8 工程账单

2.9 常见误读

误读一:"Attention is all you need" 意思是不需要 FFN 和嵌入。 每层还有 position-wise FFN(参数量的大头之一)、残差、LayerNorm、两种嵌入。标题的修辞对象是"循环与卷积",不是其他组件。

误读二:"多头注意力比单头计算量大得多。" 因为 dk=dmodel/h,总 FLOPs 基本持平(见 2.5 节);多头的收益是表示子空间多样性,不是容量增加。

误读三:"自注意力在任何序列长度下都比 RNN 快。" Table 1 注明条件:仅当 n<d 时自注意力每层复杂度更低;机器翻译句级任务满足,长文档不满足——论文为此提出 restricted self-attention(邻域 r)作为未来方案。

2.10 主张 vs 事实 · 一句话 · 自检

【实验支持】base 模型 BLEU 27.3 已超所有已发表模型与集成(Table 2);【论文声称】正弦编码"可能让模型外推到训练时未见过的长度"——未做任何外推实验,属纯假设;【解读者推断】缩放因子的方差论证是事后合理化,真正起作用的可能是稳定训练初期的 softmax 饱和。

一句话记住本节:把"按时间步递推"换成"一次矩阵乘法里所有位置互相检索"——QKᵀ 打分、softmax 归一、V 加权求和,八个小头平分 512 维预算,训练从数周缩到 3.5 天。

闭卷自检:我能写出注意力公式的每个张量形状吗?为什么除 √dk?三种注意力用法中 Q/K/V 各来自哪里?解码器如何防止偷看未来?

2.11 分级自测题

  1. L1 直接套用base 配置下一个编码器层的 FFN 参数量(不含偏置)是多少?六层共多少?
    答案512×2048×2=2,097,152≈2.1M;六层 ≈12.6M。
  2. L2 变情境迁移若把 n 从 50 提到 500(d 不变),自注意力与 RNN 的每层复杂度之比如何变化?这对部署意味着什么?
    答案自注意力 O(n²d)/RNN O(nd²)=n/d,从 50/512≈0.1 升至 500/512≈1——越过 n=d 分界后自注意力开始更贵;意味着长序列场景必须换稀疏/线性注意力或受限窗口(Table 1 第四行),这正是后来长上下文研究的起点。
  3. L3 构造反例构造一种 q、k 分布形态,使"除以 √dk 就能避免 softmax 饱和"失效。
    参考答案+评分要点要点①:若 q 的某方向幅度极大(如某维方差 100),点积方差由该主导方向决定,整体除 √dk 无法拉平个别巨大的 logit;要点②:若 q、k 强相关(非独立),点积方差可超过 dk 的独立假设值;要点③:此时需要的是对 logit 本身的归一化(如后来的 QK-norm 类技巧)。答出"论证前提(独立、单位方差)被破坏"即可得分。
  4. L4 综合仅从"O(1) 顺序操作"与"O(1) 最大路径长度"两个性质出发,预测该架构在训练与推理两个阶段的表现差异,并说明哪条性质帮哪个阶段。
    参考答案O(1) 顺序操作 ⇒ 训练可全序列并行(教师强制下所有位置同时算)——帮训练墙钟时间;O(1) 路径长度 ⇒ 梯度直达任意位置、长程依赖易学——帮最终质量;但推理仍是逐 token 自回归,两条性质都救不了生成的顺序性(结论章承认"Making generation less sequential"是未来目标)。

三、逐章精读:为什么是自注意力(对应论文 §4)

3.1 来源标注:Table 1 精讲

来源:论文 §4 Why Self-Attention。三个考量:每层计算复杂度、可并行的最小顺序操作数、长程依赖的最大路径长度。

层类型每层复杂度最小顺序操作最大路径长度
自注意力O(n²·d)O(1)O(1)
循环(RNN)O(n·d²)O(n)O(n)
卷积O(k·n·d²)O(1)O(logk(n))
受限自注意力O(r·n·d)O(1)O(n/r)

3.2 手算验证与解读

验证复杂度比:自注意力/循环 = n/d。WMT 任务用 word-piece/BPE 子词,句子级 n 通常几十、d=512 ⇒ n≪d,自注意力便宜一个量级【实验支持的适用域陈述】。卷积比 RNN 贵约 k 倍;可分离卷积降到 O(k·n·d + n·d²)——即便 k=n 也恰好等于"自注意力+逐位置前馈"的组合成本,而这正是本模型的构成【论文声称,§4 末段原话逻辑】。

顺带的好处:注意力分布可检查,附录展示了跟随长距离依存("making…more difficult")与指代消解("its"的第 5、6 头)的个例【个例证据,勿过度推广】。

3.3 常见误读与一句话

误读:"Table 1 是实验结果。" 它是大 O 复杂度分析表,不含任何实测数字;"更快"的实证来自 §5 的训练时间与 §6.1 的成本列。

误读:"平均化注意力是无代价的。" §2 明确承认:注意力对加权位置取平均会降低有效分辨率(reduced effective resolution),多头正是为补偿这一缺陷设计的——收益与代价在同一篇论文里成对出现。

一句话记住本节:自注意力用 O(n²·d) 的算力,同时买到 O(1) 的串行深度和 O(1) 的信息通路——只要 n<d,这笔交易全面优于 RNN/CNN。

3.4 分级自测题

  1. L1核宽 k=3 的卷积层,连接相距 n=81 个位置的两点最少需要多少层?膨胀卷积呢?
    答案连续核需 O(n/k)=27 层;膨胀卷积需 O(log₃81)=4 层。
  2. L2d=1024 时,n 到多大之前自注意力每层比 RNN 便宜?超过之后差多少?
    答案临界点 n=d=1024;超过后比值为 n/d,如 n=4096 时贵 4 倍。
  3. L3"既然受限自注意力复杂度 O(r·n·d) 更低,为什么不直接用它?"指出该说法忽略的代价。
    参考答案+评分要点要点①:路径长度退化为 O(n/r),长程依赖优势部分丧失;要点②:论文只在 §4 提出设想("plan to investigate further"),本文实验全部用全局注意力,无效果数据;要点③:r 成为新的超参需调优。
  4. L4综合 §2 Background 与 §4:ConvS2S 的"线性复杂度"与 Transformer 的"常数路径"是一对交换项,请画出这个 trade-off 并说明本文为何选择后者。
    参考答案ConvS2S:复杂度低但路径 O(n),远距离信号要层层接力;Transformer:路径 O(1) 但复杂度 O(n²)。选择依据:句子级任务 n≪d,O(n²·d) 实际小于 O(n·d²),即在该工作点上"常数路径"几乎是免费的——trade-off 只在长序列处才变成真权衡。答出"工作点依赖"即可得满分。

四、逐章精读:训练配置与主结果(对应论文 §5–§6.1)

4.1 来源标注与配置清单

来源:论文 §5 Training、§6.1 Machine Translation。数据:英德 WMT14 约 450 万句对,BPE 共享词表约 37000 token;英法 3600 万句,32000 word-piece 词表。批处理按近似长度组句,每批约 25000 源 token+25000 目标 token。硬件:单机 8×P100;base 每步 0.4 秒训 100K 步(12 小时);big 每步 1.0 秒训 300K 步(3.5 天)。优化器:Adam β₁=0.9、β₂=0.98、ε=10⁻⁹;lr 公式:

lrate = dmodel^(−0.5) · min(step_num^(−0.5), step_num · warmup_steps^(−1.5)),warmup_steps=4000

正则:残差 dropout Pdrop=0.1(big 英法亦为 0.1,Table 3 底行 big 用 0.3——注意两处口径:正文 §6.1 说英法 big 用 0.1 而非 0.3,Table 3 的 big 行标注 Pdrop=0.3 为其默认变体设置);label smoothing εls=0.1,论文明言它伤害困惑度但提升准确率与 BLEU。推理:base 平均最后 5 个 checkpoint、big 平均最后 20 个(间隔 10 分钟);beam size 4、长度惩罚 α=0.6;最大输出长 = 输入长 +50。

4.2 手算验证:峰值学习率

在 step=warmup=4000 处两支相等:lrate = 512^(−0.5) × 4000^(−0.5) = (1/22.63)×(1/63.25) ≈ 6.98×10⁻⁴。前 4000 步线性升温到此峰值,此后按 step^(−0.5) 衰减——例如 step=100000 时 lr≈6.98e-4×√(4000/100000)≈1.4×10⁻⁴。warmup 存在的原因论文未解释【解读者观点】:一般归因于初期 Adam 二阶矩估计不稳、大 lr 会摧毁尚未成形的注意力模式。

4.3 主结果 Table 2 全景与数字对账

模型EN-DE BLEUEN-FR BLEUEN-DE 训练 FLOPsEN-FR 训练 FLOPs
ByteNet23.75
Deep-Att + PosUnk39.21.0×10²⁰
GNMT + RL24.639.922.3×10¹⁹1.4×10²⁰
ConvS2S25.1640.469.6×10¹⁸1.5×10²⁰
MoE26.0340.562.0×10¹⁹1.2×10²⁰
GNMT + RL Ensemble26.3041.161.8×10²⁰1.1×10²¹
ConvS2S Ensemble26.3641.297.7×10¹⁹1.2×10²¹
Transformer (base)27.338.13.3×10¹⁸
Transformer (big)28.441.82.3×10¹⁹

对账成功:28.4 − 26.36(最佳集成)= 2.04 ≥ "over 2 BLEU" ✓。成本优势:base 3.3×10¹⁸ 是 ConvS2S 单模型 9.6×10¹⁸ 的 34%、GNMT 集成的 1.8%。一处文内不一致:摘要与 Table 2 均记 EN-FR big 为 41.8,但 §6.1 正文写作 "achieves a BLEU score of 41.0"——arXiv 各版本间的已知出入,正文数字疑为笔误,引用时应以表格为准并注明此冲突。【解读者核对发现】

4.4 常见误读

误读一:"base 模型 38.1 BLEU 说明它不行。" 相反,27.3(EN-DE)已超过此前一切单模型与集成;38.1 只是 EN-FR 上 big 才能刷新 SOTA——两个语向的竞争烈度不同,不能跨列比较。

误读二:"FLOPs 列是精确计量。" 是"时间 × 卡数 × 标称算力"的三连乘估算(脚注2 给了 K80~P100 四档系数),不同论文的估法未必一致,跨表比较只有量级意义。

误读三:"label smoothing 是免费午餐。" 论文明说它使 perplexity 变差——BLEU 提升是以概率校准为代价换取的,做生成式语言建模评估时不能照搬该设置。

4.5 一句话蒸馏 · 自检 · 分级自测题

一句话记住本节:4000 步 warmup 到约 7×10⁻⁴ 再平方根衰减,8 张 P100 上 3.5 天——big 模型 EN-DE 28.4、EN-FR 41.8,双双刷新 SOTA 且训练成本比对手低几倍到一个量级。

闭卷自检:我能默写 lr 调度公式并算出峰值吗?base 与 big 各训多少步?"label smoothing 伤什么、利什么"?checkpoint 平均用几个?

  1. L1EN-DE 与 EN-FR 各用什么词表技术、多大词表?
    答案英德:BPE 共享词表约 37000;英法:word-piece 词表 32000(§5.1)。
  2. L2把 warmup_steps 从 4000 改成 40000,峰值 lr 变为多少?训练动态可能受何影响?
    答案峰值 = 512^(−0.5)·40000^(−0.5) ≈ 1.39×10⁻⁴,降为原来的约 1/√10;升温期拉长 10 倍,前期收敛显著变慢,总步数固定时可能欠训。(后半为解读者推演。)
  3. L3有人宣称"Transformer 的胜利证明注意力结构本身比 RNN 有更强的归纳偏置"。找出此论断的证据缺口。
    参考答案+评分要点要点①:Table 2 同时改变了多个变量(容量 213M vs 更小、训练预算、正则、checkpoint 平均),非控制变量对照;要点②:训练成本列表明至少部分增益可由"同时间内见了更多数据"解释;要点③:无"RNN 加满调参预算"的对等基线。归纳偏置优劣需同预算消融,本文未提供。
  4. L4综合 §5 与 §6.2:dropout 0.0 时 dev BLEU 掉到 24.6、label smoothing 0.0 时掉到 25.3,两者都低于 base 的 25.8;但去掉 label smoothing 反而让 PPL 变最好(4.67)。请完整解释这组数字告诉了我们什么。
    参考答案PPL 与 BLEU 在此脱钩:ε_ls=0.1 让模型学会"更不确定",PPL 变差(4.92 vs 4.67)却换来更准的 argmax 与更高 BLEU——因为平滑后的分布在 beam search 中排序更稳健。启示:评价指标决定正则的去留,追求概率质量(校准/PPL)与追求决策质量(BLEU)是两个不同目标。

五、逐章精读:模型变体消融与泛化(对应论文 §6.2–§6.3)

5.1 来源标注:Table 3 消融(newstest2013 开发集)

变体配置dev PPLdev BLEUparams ×10⁶
baseN=6, d_model=512, d_ff=2048, h=8, dk=dv=64, drop .1, ε_ls .14.9225.865
(A) h=1dk=dv=5125.2924.9
(A) h=4dk=dv=1285.0025.5
(A) h=16324.9125.8
(A) h=32165.0125.4
(B) 小 keydk=16 / 325.16 / 5.0125.1 / 25.4
(C) 模型大小d_model=1024 等 / 缩小版4.66 / ~5.1926.0 / 25.3168 / 53~90 系列
(D) 正则开关drop 0.0 / 0.2;ε_ls 0.0 / 0.25.77 / 4.95;4.67 / 5.4724.6 / 25.5;25.3 / 25.7
(E) 学习式位置编码替代正弦4.9225.7
bigd_model=1024, h=16, drop 0.34.3326.4213

5.2 解读与常见误读

头数的倒 U 形【实验支持】:单头比最佳设置差 0.9 BLEU(24.9 vs 25.8),头太多(32)也回落(25.4)——"多头有用"与"多多益善"是两个命题,本文支持前者。

key 太小受伤【实验支持】:dk=16 时 BLEU 25.1。作者由此推测"判断兼容性并不容易,比点积更复杂的兼容函数可能有益"【论文声称,属猜想】。

误读一:"行(E)证明正弦编码更好。" 数字几乎相同(25.7 vs 25.8),只能证明不可区分;"外推更长序列"的优势纯属假设,全文无测试。

误读二:"dev 集 BLEU 26.4 与测试集 28.4 可以混引。" Table 3 是 newstest2013 开发集、无 checkpoint 平均;Table 2 是 newstest2014 测试集、含平均与调好的 beam 参数——坐标系不同。

5.3 句法分析泛化(§6.3,简读)

4 层、d_model=1024 的 Transformer:WSJ-only 成分句法 F1=91.3(胜过 BerkeleyParser 的 90.4,仅次于 RNNG 91.7);半监督(1700 万句)92.7。推理配置:beam 21、α=0.3、最大输出长=输入+300。意义:架构不做任何任务特化即可在结构化预测上接近专用系统【实验支持】。

5.4 一句话蒸馏 · 自检 · 分级自测题

一句话记住本节:8 个头、64 维 key 是甜点位;更大更好、dropout 必需;正弦与学习式位置编码打成平手——而这套"没调过参"的架构顺手就能做句法分析,通用性初现。

闭卷自检:单头损失多少 BLEU?哪个变体证明"兼容函数不易学"?big 与 base 的参数量各是多少?

  1. L1big 模型的 h、Pdrop、参数量分别是多少?
    答案h=16、P_drop=0.3(Table 3 big 行)、213M。
  2. L2从 (A)(B) 两组消融推断:若保持计算量不变,把 dk 从 64 降到 32 但把 h 从 8 加到 16,预期效果如何?依据?
    答案接近 base 或略差:(A) 显示 h=16(32 维) 时 25.8 持平,但 (B) 显示 key 变小有害(dk=32 → 25.4);两个效应反向抵消,净效应取决于哪边占优——此题为外推设计,论文未直接报告该组合。
  3. L3构造一个场景,使"正弦位置编码可外推"的假设失效。
    参考答案+评分要点要点①:外推要求 PE_{pos+k} 的线性关系在训练未见区间仍成立,但注意力参数(W^Q,W^K)是在训练长度内拟合的,超出后点积分布漂移;要点②:若训练时最长句 100、推理给 500,即使 PE 数学好,LayerNorm/FFN 见过的激活统计也错位;要点③:论文自己只做了"两种编码几乎相同"的比较,从未测过长度外推。三点各一分。
  4. L4综合 Table 2 与 Table 3:base 在 dev 上 25.8、测试 EN-DE 27.3;big 在 dev 26.4、测试 28.4。dev-to-test 增益分别 +1.5、+2.0。据此能否断言"big 泛化更好"?
    参考答案不能简单断言。要点①:dev(newstest2013) 与 test(newstest2014) 是不同年份不同数据,增益含数据集难度差异;要点②:Table 3 无 checkpoint 平均、Table 2 有,推理配置不同;要点③:两点样本量太小谈不了"泛化趋势"。正确做法是同协议评测——本文没有提供。

六、批判性阅读:如何不被数字带节奏

6.1 Benchmark 与比较公平性

6.2 第二坐标轴

论文最强的牌恰在第二坐标轴:训练成本 3.3×10¹⁸ FLOPs(base)比所有对手低 3–60 倍,12 小时/8 GPU 的墙钟时间是可复现性的巨大红利【实验支持,估算口径】。缺失的轴:推理延迟与吞吐(自回归解码的每步开销未报);显存占用;长序列下的表现退化。

6.3 论文没有告诉你什么

七、综合考核(毕业关)

7.1 重建因果链

  1. L4只给三个短语:"顺序计算瓶颈""有效分辨率损失""12 小时训练",重建论文各组件的必要性,并指出每个短语逼出了哪个设计。
    参考答案+评分要点①"顺序计算瓶颈"逼出:抛弃递推、全并行自注意力+O(1) 顺序操作(§1、§4);②"有效分辨率损失"逼出:多头机制补偿平均化的信息损失(§2 承认代价、§3.2.2 给出补偿);③"12 小时训练"逼出:整套工程配套——按长度分桶 batching、warmup 调度、checkpoint 平均、共享嵌入省参数。(每个短语对应至少一个组件与一个章节,各一分。)

7.2 数字总对账

  1. L2核验六组数字:①8×64=512;②0.4s×100K≈12h;③1.0s×300K≈3.5天;④28.4−26.36>2;⑤61M 费米估算 vs 65M;⑥41.8(摘要/Table 2)vs 41.0(§6.1 正文)。
    答案①✓ 多头不增算力的基石;②39999s≈11.1h,论文四舍五入为 12h ✓;③83.3h≈3.47 天 ✓;④2.04 ✓;⑤同量级通过(差值来自 LayerNorm/偏置/舍入);⑥不一致——正文疑为笔误,引用以表格为准。第六项是本次精读抓到的唯一硬伤。

7.3 设计决策答辩

  1. L3答辩「缩放因子」:为什么是 1/√dk 而不是别的函数?论文论据够吗?
    答案依据脚注1的方差论证:独立单位方差分量下点积方差=dk,除 √dk 归一到方差 1,正好落在 softmax 敏感区。缺口:独立性假设不真、无扫描其他缩放值的消融;但消融行(B)间接显示 dk 太小时(logit 方差小)也变差,暗示"匹配方差"确是要害。【后半为解读者推断】
  2. L3答辩「多头」:不这样做会怎样?论文给的论据够不够?
    答案不这样:单头差 0.9 BLEU(24.9 vs 25.8),实证充分。但"为什么多头有效"只有一句"不同子空间联合注意",无机理实验;且 32 头回落说明存在甜点位,论文未探索头数×容量的交互。
  3. L3答辩「正弦位置编码」:为什么不干脆用学习式 embedding?
    答案因为两者效果"几乎相同"(行E:4.92/25.7 vs 4.92/25.8),选正弦的理由只剩两个假设:可表达相对位置的线性关系、可能外推更长序列——均为未经检验的主张。诚实评级:这是一个"平手配置上的偏好选择",不是被证明的优势。
  4. L3答辩「label smoothing」:明知伤 PPL 为什么还用?
    答案因为目标是 BLEU 不是 PPL:ε_ls=0.1 时 dev PPL 4.92→(去掉后 4.67)变差了 BLEU 却 25.8→25.3。论文明确报告了这个 trade-off——罕见地把自己方案的副作用写清楚,值得表扬;但未研究对下游概率应用(校准、重排序)的影响。

7.4 证据审计(回看 1.2 预评)

贡献预评读后修正理由
SOTA 质量+低成本训练强实验支撑维持 ★★★质量与 FLOPs 双轴同时改善,且 base 单模型即超旧集成
多头+缩放点积有效消融支撑维持 ★★有效果消融无机理解释,头数甜点位未探明
正弦编码可外推只是主张维持 ★与学习式打平(行E),外推零实验
三考量优于 RNN/CNN理论对比维持 ★★Table 1 是复杂度分析;"更快"的实测仅在 n<d 工作点成立
注意力可解释性个例展示维持 ★★数张可视化,无量化协议