← 总目录 / 板块一 · 模型的范式变迁
板块一 · 模型的范式变迁

第4篇 · 知识蒸馏

把一个集成模型的"暗知识",压进一只可以部署的单模型里——软目标是比硬标签更丰富的老师。
Distilling the Knowledge in a Neural Network · Geoffrey Hinton, Oriol Vinyals, Jeff Dean(Google Brain / Google Research)· 2015 · arXiv:1503.02531(NIPS 2014 Deep Learning Workshop 版本扩展)

本材料说明:【论文声称】=作者观点或叙事框架;【实验支持】=论文中有数据支撑;【解读者推断】=精读者推理,论文未明说。所有数字均复述自论文原文,未做外部验证。

一、全局大图

1.1 摘要拆解对照表

摘要短语对应论文章节对应精读章节
"训练许多模型再平均预测……部署笨重且昂贵"§1 Introduction第二章 §2.1 失效模式
"Caruana 等人已证明可压缩集成知识,我们用不同技术进一步发展"§1、§2 Distillation第二章 §2.2–2.4
"在 MNIST 上取得惊人结果"§3 Preliminary experiments on MNIST第三章
"显著改进重度使用的商用系统的声学模型"§4 Experiments on speech recognition第四章
"新集成方式:全模型+多个 specialist 模型,可快速并行训练"§5 Training ensembles of specialists第五章

1.2 主要贡献与证据强度预评

#声称的贡献证据强度预评
1高温软化 softmax + 软目标迁移,能把教师知识压进小模型强实验支撑 MNIST + 语音双实验
2匹配 logits 是蒸馏在高温极限下的特例(理论联系)推导+定性论证 公式(2)(3)(4),无独立实验
3specialist 集成可在超大数据集上快速并行提升单模型强实验支撑 JFT 上 +1.1% 绝对 top-1
4软目标本身是强正则化器仅一组对照 3% 数据实验,Table 5
5【论文声称】specialist 的知识未来也能再蒸馏回单个大网络只是主张 明确留作未来工作

1.3 推荐阅读路线

必读主线:§2 蒸馏公式(尤其 T² 缩放)→ §3 MNIST → §4 语音 → §6 软目标正则化。这条线覆盖了"为什么软目标携带信息"与"效果有多大"两个核心问题。

可跳读支线:§5 specialist 工程(JFT 实验)。跳过的代价:第五章综合考核的"专家覆盖数 vs 提升"对账题与第七节批判性阅读的一半内容将无法理解;若你关心大规模训练工程则不应跳。

依赖提示:枢纽概念是带温度的 softmax——§2 的公式、§4 的温度搜索、§5 的 dustbin 设计全部挂在它上面,值得慢读。

二、逐章精读:蒸馏方法(对应论文 §1–§2)

2.1 来源标注

来源:论文 §1 Introduction、§2 Distillation、§2.1 Matching logits is a special case of distillation(全文约 9 页)。标注"解读者补充"处为精读者补写的推演。

2.2 可验证的学习目标

学完本章你应能:

2.3 失效模式先行

问题从部署端疼起【论文声称,§1】:集成(ensemble)几乎总能提升性能,但要在数百万用户身上跑几十个大网络的预测,算力开销难以承受。更早的工作(Caruana 等)已证明可以把集成的函数行为压缩进单个模型,但那类方法只用硬标签做拟合。失效模式是:硬标签丢掉了教师对"错误选项"的概率分配——比如一张"2"的图片,教师可能给出"像 3 的概率 10⁻⁶、像 7 的概率 10⁻⁹",这个 1000 倍的比值编码了"2 和 3 相似度高于 2 和 7"的结构性知识;但对 one-hot 硬标签和普通交叉熵而言,这些极小概率对损失的贡献近乎为零,学不到。

2.4 直觉与类比

类比:硬标签像只告诉你标准答案的题库;软目标像老师批卷时顺手写下的"你错成 B 比错成 D 更接近正确思路"。后者传递的是答案之间的相似性结构,学生(小模型)因此能用少得多的数据学到同样的判别边界。

类比在哪里失效:老师写批注是有意为之的教学行为;而教师的软概率只是其自身参数化的副产品,其中也混着噪声——论文自己在 §2.1 承认,那些比均值负得多的 logits 几乎不受教师训练目标的约束、"可能噪声很大"。所以软目标不是纯净的知识,而是"信号+噪声",温度就是调节两者配比的旋钮(见 2.6 的低温讨论)。

2.5 公式手术

公式 (1):带温度的 softmax

qi = exp(zi/T) ⁄ Σj exp(zj/T)
符号它是什么直觉
zi第 i 类的 logit(softmax 前的得分)模型给每类的原始打分
T温度,通常设 1;蒸馏时用高温调"分布软硬度"的旋钮:T↑ 分布变平,T↓ 变尖
qi软化后的概率T 很大时趋近均匀分布,各类差异被放大到可见尺度

张量形状【解读者补充】:z ∈ ℝᴺ(N 为类别数),T 为标量,输出 q ∈ ℝᴺ 且 Σqi=1。T 只改变分布形状,不改变 argmax。

公式 (2):transfer 样本上蒸馏模型的梯度

∂C/∂zi = (1/T)(qi − pi),其中 pi 为教师在同温 T 下的软概率
符号它是什么直觉
C学生 logits 与教师软目标的交叉熵让学生分布在 T 温度下贴近教师分布
pi教师(cumbersome model)logit vi 过公式(1)的结果学习目标
1/T 因子梯度的整体缩放温度越高,每个样本的梯度假越小 → 引出 T² 补偿

公式 (3)(4):高温近似。当 T 远大于 logit 量级时,exp(x/T)≈1+x/T,再做 per-case 零均值化假设(Σjzjjvj=0),得:

∂C/∂zi ≈ (zi − vi) ⁄ (N T²)

这正是最小化 ½(zi−vi)² 的梯度(差常数因子)——即最小二乘拟合教师 logits。结论:高温极限下,蒸馏退化为 Caruana 式的 logits 回归;蒸馏是它的严格推广。【论文声称,§2.1】

2.6 手算验证:T² 缩放从哪来

任务:验证"软目标梯度按 1/T² 缩放,故需把软目标损失的权重乘 T²"这一论断(论文 §2)。

步骤:由公式(4),单个样本对 logit 的梯度量级 ∝ 1/(NT²)。若把温度从 T₁=2 换到 T₂=20,同一批 transfer 数据产生的总梯度缩小 (20/2)²=100 倍。若硬目标项(温度恒为 1)权重固定,软/硬两路的相对贡献就随蒸馏温度剧烈漂移。补偿办法:软目标损失权重 ×T²,使有效梯度回到与温度无关的量级。

验证:论文语音实验(§4.1)固定 hard-target 权重 0.5、在 T∈{1,2,5,10} 中搜出最优 T=2——正因为做了 T² 缩放,改温度时两路贡献才大致不变,这个搜索才有意义。【实验支持】

低温的另一面:论文指出,低温蒸馏会较少关注匹配"远低于均值的负 logits",而这些 logits 几乎不受教师训练代价约束——可能纯噪声,也可能含独有信息。当学生网络太小装不下全部知识时,中间温度最好(MNIST 极端压缩到每层 30 单元时 T∈[2.5,4] 显著最优,§3);这说明"忽略部分大负 logits"可能反而有益。【论文声称+实验支持混合,注意区分】

2.7 数字对账

§1 说软概率 10⁻⁶ vs 10⁻⁹ 差三个数量级,用于说明"极小概率的比值"承载相似性结构——与 §2 用高温放大这些差异的动机完全自洽。§2.1 的近似条件(per-case 零均值化)在论文中是明说的假设而非普适事实,引用该结论时应带上此前提。【解读者推断】

2.8 工程账单

2.9 常见误读

误读一:"蒸馏 = 模型压缩算法"。 论文框架里蒸馏的对象是"知识"而非参数:教师甚至可以是不可微的任意系统(§1 提及只需其在 transfer set 上产生软目标)。压缩只是最常见的效果,不是定义。

误读二:"温度只在训练时高,推理也要用同一个 T"。 正相反:训练完推理时温度恢复为 1(§2 明说)。T 只是训练期的"显微镜",把微小概率差异放大给学生看。

误读三:"匹配 logits(公式4)就是蒸馏的全部"。 那只是高温极限的特例。中间温度的行为不同:它会相对忽略大的负 logits——这恰是小容量学生场景下的优势来源。

2.10 主张 vs 事实

【论文声称】"软目标携带的相似性结构是有用知识"——叙事框架;【实验支持】MNIST 学生仅凭软目标正则化从 146 错降到 74 错(§3);【解读者推断】软目标同时转移了教师从数据增强(平移抖动)中获得的泛化能力,论文以"尽管 transfer set 无平移样本仍受益"间接支持此解读。

2.11 一句话蒸馏

一句话记住本节:高温 softmax 把教师概率里"错误选项之间的比值"放大到可学的尺度,蒸馏就是把这套软目标(必要时混入少量硬标签、按 T² 配平)教给一个小模型。

2.12 闭卷自检清单

2.13 分级自测题

  1. L1 直接套用设某 3 类问题教师 logits 为 z=(4, 1, −1),取 T=10,计算 q₁ 的近似值(用 exp(x/T)≈1+x/T)。
    查看答案分子 ≈ 1+0.4=1.4;分母 ≈ (1.4)+(1.1)+(0.9)=3.4;q₁≈1.4/3.4≈0.41。验证方向:T 很大时分布被拉平但最大类仍最大。
  2. L2 变情境迁移把蒸馏温度从 5 改为 10,其他不变。若不做 T² 补偿,软目标项相对硬目标项的有效梯度变为原来的多少?这对超参搜索意味着什么?
    查看答案(5/10)²=1/4,即缩为 25%。意味着换温度后软/硬平衡被破坏,观察到的"某温度更好"可能只是两目标权重漂移的伪影——所以必须乘 T² 使比较公平(论文 §2)。
  3. L3 构造反例构造一种情况说明"直接最小二乘拟合教师 logits(公式4)"会伤害学生:提示——考虑某个幅度很大、方差很大的负 logit。
    参考答案+评分要点要点①:大负 logit 几乎不受教师训练目标约束(论文 §2.1 原话),可能是噪声;要点②:最小二乘对所有 logit 一视同仁,学生会花大量容量去拟合这个噪声维度;要点③:带温度的交叉熵在小 T 时天然降权这类维度,故极端压缩场景(30 单元)中 T∈[2.5,4] 最优而非 T→∞。(三点各占一分。)
  4. L4 综合仅从"集成比单模型好"与"部署只能负担一次前向"这两个事实出发,推断一个完整的蒸馏方案必须回答哪四个设计问题?
    参考答案①教师输出用什么形式传递(软目标/logits)?②用什么温度让小概率差异可学?③有无正确标签时如何与硬目标加权组合?④transfer set 选什么数据?(对应论文 §2 的四个设计决策。)

三、逐章精读:MNIST 初步实验(对应论文 §3)

3.1 来源标注与学习目标

来源:论文 §3。学完后你应能:复述教师/学生的结构与错误数;解释缺失类别实验为何惊人;说出温度随学生容量的变化规律。

3.2 失效模式先行

要验证"软目标真的在传知识",必须排除平凡解释:"学生只是多了一个正则项碰巧好用"。所以实验设计的关键是制造信息不对称:transfer set 里干脆删掉某个数字的所有样本——如果学生仍能在该数字上达到高准确率,唯一的信息通道只剩软目标。

3.3 实验与手算验证

模型(论文 §3)测试错误数(万张)
教师:2 隐层 ×1200 ReLU,dropout+输入随机平移 ≤2 像素67
学生:2 隐层 ×800 ReLU,无正则,直接训练146
同一学生,仅加"匹配 T=20 软目标"作正则74

手算验证(参数量,解读者补充):教师约 784×1200+1200×1200+1200×10 ≈ 239 万权重;学生约 784×800+800×800+800×10 ≈ 128 万权重——学生约为教师一半规模,却借软目标逼近教师水平(74 vs 67),这就是"压缩中保留了大部分知识"的直接量化。

缺失类别实验(§3):从 transfer set 删除所有"3"。蒸馏学生共 206 错,其中 133 个落在测试集 1010 张"3"上;把"3"类偏置 +3.5 后总数降至 109、"3"上仅 14 错——从未见过一个"3"样本,正确率仍达 98.6%(14/1010 错误 ⇒ 约 98.6%)。只含 7、8 的极端版:错误率 47.3%,偏置校正 −7.6 后降至 13.2%。【实验支持】

3.4 直觉与类比(及其失效点)

类比:学生虽没见过"3"的照片,但从教师对其他数字的软概率中反复看到"这张图与 3 有 0.0001 的亲缘度",等于隔着一层毛玻璃学会了认 3。失效点:这依赖教师本身把"3"建模得好;若教师在"3"上系统性偏差,学生会忠实继承偏差且无真实样本纠偏——偏置 +3.5 这个手工修正步骤本身就是对此缺陷的承认【解读者推断】。

3.5 常见误读

误读:"74 比 67 差,说明蒸馏失败了。" 不。对比的正确基线是同样结构的无正则学生(146):软目标把错误砍掉近半(146→74),逼近更大教师的 67。"恢复了多少差距"才是蒸馏效果的度量。

误读:"最优温度是普适常数。" 论文明确给出容量依赖:每层 ≥300 单元时 T>8 都差不多;压到每层 30 单元时最优区间缩至 [2.5,4]。温度是"学生容量的函数"。

3.6 主张 vs 事实 · 一句话 · 自检

【实验支持】软目标正则有效(146→74);【论文声称】软目标转移了平移不变性等泛化能力(transfer set 无平移样本仍受益——这是设计出来的证据,可信度较高);【解读者推断】缺失类别实验的成功暗示软目标编码的是类间关系流形,而非逐类独立规则。

一句话记住本节:学生只有教师一半大小,靠 T=20 软目标把 146 错压到 74 错,甚至在从未见过"3"时仍有 98.6% 的"3"识别率——知识确实在软目标里流动。

闭卷自检:我能报出 67/146/74 三个数字分别属于哪个模型吗?缺失"3"实验里偏置修正前后各错了多少?"只教 7 和 8"的错误率是多少?

3.7 分级自测题

  1. L1测试集共多少张?学生在"3"上错 14 张,"3"识别率约多少?
    答案1010 张"3",14/1010≈1.39% 错误率 ⇒ 约 98.6% 正确率(论文 §3 原文口径)。
  2. L2若把学生压得更小(如每层 100 单元),你预期最优蒸馏温度升高、降低还是不变?依据是什么?
    答案降低。论文规律:容量越小越要用较低温度(30 单元时 [2.5,4] 最优),因为小容量学生必须放弃拟合部分低置信维度,中等温度恰好抑制大负 logits 的干扰。
  3. L3有人断言:"缺'3'实验的成功说明蒸馏可以完全替代真实标注数据。"构造反驳。
    参考答案+评分要点要点①:偏置需手工 +3.5 才达最佳,说明先验不平衡仍需真实信息修正;要点②:"只教 7 和 8"时初始错误率高达 47.3%,类别过少时软目标不足以重建完整分类面;要点③:transfer set 本身仍是 60000 训练样本(除"3"),并非零数据。三点各一分。
  4. L4把 MNIST 结果与 §6 的 3% 数据实验放在一起:两者分别在论证软目标的哪个性质?合起来支持什么更强的结论?
    参考答案MNIST 论证软目标传递教师独有的结构性知识(未见类别的判别能力);§6 论证软目标传递教师从大数据中学到的统计信息(3% 数据即可恢复几乎全部精度,57.0% vs 44.5%)。合起来:软目标是一种高保真、高压缩比的知识载体,既抗类别缺失又抗数据稀缺。

四、逐章精读:语音识别实验(对应论文 §4)

4.1 来源标注与设置

来源:论文 §4 及 §4.1 Results。架构:8 隐层 ×2560 ReLU,softmax 输出 14000 个 HMM 状态标签;输入 26 帧 ×40 维 Mel 滤波器组系数(帧移 10ms,预测第 21 帧);总参数约 85M;训练数据约 2000 小时英语、约 700M 帧;该模型是 Android 语音搜索声学模型的稍旧版本。

4.2 手算验证:85M 参数对账(解读者补充的费米估算)

输入维度 26×40=1040。第一层 1040×2560≈2.66M;中间 7 层各 2560×2560≈6.55M,共 45.9M;末层 2560×14000≈35.8M。合计 ≈84.3M——与论文"约 85M"吻合。这是本文最干净的一次数字对账。

4.3 结果与数字对账

系统(Table 1)帧准确率WER(23K 词测试集)
基线单模型58.9%10.9%
10 模型集成(10 个随机初始化)61.1%10.7%
蒸馏后的单模型(T=2,硬目标权重 0.5)60.8%10.7%

对账:论文称"集成带来的帧准确率提升中超过 80% 被转移到蒸馏模型"。验算:(60.8−58.9)/(61.1−58.9)=1.9/2.2≈86.4% ≥80%,一致。WER 上 10.9→10.7 的改进也被完整继承。温度搜索范围 {1,2,5,10},最优 T=2。

对照系(论文 §4.1 引相关工作[8]):在温度 1、用大规模无标注数据蒸馏的先前方法,最多消除大小模型误差差距的 28%;本方法的 T=2 蒸馏消除了约 86%。两组百分比口径不同(前者是"误差差距消除比例",后者是"集成增益转移比例"),不能直接互减,引用时要小心。【解读者提醒】

4.4 常见误读

误读一:"蒸馏模型超过了集成。" 没有。帧准确率 60.8% < 61.1%,蒸馏是把集成增益的绝大部分(86%)搬回单模型,不是超越集成。

误读二:"帧准确率涨 1.9% 所以识别效果好 1.9%。" 帧级分类指标与端到端 WER 是两套坐标:WER 只降 0.2%(10.9→10.7)。论文如实并列了两列数字,但摘要只说"significantly improve the acoustic model"——商业系统语境里 WER 才是用户可感的坐标。【解读者观点】

4.5 一句话蒸馏与闭卷自检

一句话记住本节:85M 参数的生产级声学模型上,T=2 蒸馏把 10 模型集成 86% 的帧准确率增益塞回同等大小的单模型——这是蒸馏"可用于工业界"的首个有力证据。

闭卷自检:我能画出 Table 1 三行数字吗?"超过 80%"我是怎么验算的?为什么说帧准确率和 WER 必须分开报告?

4.6 分级自测题

  1. L1语音实验的最优温度与硬目标权重分别是多少?
    答案T=2(搜索范围 {1,2,5,10}),hard targets 交叉熵权重 0.5(§4.1)。
  2. L2如果把集成规模从 10 降到 3,你预期"增益转移比例"如何变化?说明理由。
    参考答案教师集成增益本身变小(3 模型平均化收益弱于 10 模型),分母变小;转移比例未必下降,甚至可能更高(小集成的软目标更"容易被单模型模仿")。但论文未做该消融——此题为解读者设计的开放推演,答案要点:区分"绝对增益"与"转移比例"两个量。
  3. L3找出下述论证的错误:"蒸馏模型 WER 与集成同为 10.7%,说明蒸馏已完全提取了集成的全部知识。"
    参考答案+评分要点要点①:WER 只有两位有效数字且测试集仅 23K 词,10.7% 的相等可能在误差范围内,不能推出"完全提取";要点②:帧准确率 60.8%≠61.1%,已有约 14% 增益未被转移的证据;要点③:WER 相同也可能源于解码器对声学分差的饱和效应。三点各一分。
  4. L4结合 §6:同样是这个 85M 模型,为什么 3% 数据+软目标能到 57.0%,而 3% 数据+硬标签只有 44.5%?请用"软目标=每样本传递的信息量"来解释,并指出这与蒸馏实验共享哪个机制。
    参考答案硬标签每帧只提供 1 bit 级别的 one-hot 信息,20M 帧撑不起 85M 参数;软目标每帧提供 14000 维的完整分布,等效信息密度高几个数量级,且来自教师已在 700M 帧上学到的统计,相当于"把大数据的知识预压缩进标签"。共享机制:都是高温/软化的教师分布作为学习信号——蒸馏是"教师换学生",这里是"大数据换小数据"。

五、逐章精读:Specialist 大规模集成(对应论文 §5)

5.1 来源标注与失效模式

来源:论文 §5.1–§5.5。失效模式:JFT 数据集(1 亿张图、15000 标签)上的基线 CNN 已异步 SGD 训练约 6 个月;训练一个 10 模型集成需要第三种并行的算力,按当时的核预算要等数年——集成路线在大数据集上经济性破产。specialist 方案的目标:用"可快速并行训练的小专家"替代"完整重训的大集成"。

5.2 方案拆解

5.3 数字对账(Table 3 / Table 4)

系统条件测试准确率总体测试准确率(top-1)
基线 generalist43.1%25.0%
基线+61 specialists45.9%26.1%

总体准确率相对提升 (26.1−25.0)/25.0 = 4.4%,与论文口径一致。Table 4 的关键趋势:正确类被越多专家覆盖,提升越大——覆盖 1 个专家 +3.4%,覆盖 9 个 +16.6%,≥10 个 +14.1%(此处非单调,9 个专家那一行是峰值,论文未解释回落原因——一处原文未解释的波动)。注意 350037 个测试样本完全没有专属专家覆盖、增益为 0——总体 1.1% 的绝对提升是被"覆盖率"稀释后的结果。【实验支持+解读者推断】

5.4 直觉、类比与失效点

类比:全科医生(generalist)初诊后,把疑难病人转给专科门诊(specialist);专科只精通本科室(300 类),其余一律归入"非本科"(dustbin)。失效点:转诊依赖初诊正确——n=1 意味着 generalist top-1 错了且正确类不在任何被激活专家内时,专家完全帮不上忙;Table 4 里 35 万个零覆盖样本正是"没挂上号"的人群。

5.5 常见误读

误读一:"这是 Mixture of Experts。" 论文 §7 专门切割:MoE 的门控网络要看各专家在同一样本上的表现,训练难并行;specialist 先训好 generalist 再静态划分子集,61 个专家完全独立并行训练,测试时只运行少数相关专家。

误读二:"+1.1% 很小,不值 61 个模型。" 成本坐标:专家们只训练"几天而非数周"(对比基线的 6 个月),且互相并行——墙钟时间几乎不变。第二坐标轴上这笔账是划算的,但论文没有给出专家训练的总 FLOPs,无法精确核算。【解读者观点】

5.6 一句话蒸馏 · 闭卷自检

一句话记住本节:generalist 定混淆族 → 61 个带 dustbin 的专家并行富集训练 → 测试时按 top-1 激活并用 KL 融合,JFT 总体 top-1 从 25.0% 到 26.1%。

闭卷自检:dustbin 的作用是什么?为什么要做 log(过采样比例) 的偏置校正?聚类为什么用预测协方差而不是真实标签混淆矩阵?

5.7 分级自测题

  1. L1JFT 实验中 generalist top-1 总体准确率、加入专家后的总体准确率、相对提升各是多少?
    答案25.0%、26.1%、4.4%(相对),Table 3。
  2. L2若把 n(激活专家用的 generalist top 类数)从 1 提高到 3,预期条件准确率与推理成本各怎么变?
    参考答案更多正确类会被至少一个专家覆盖(Table 4 显示覆盖数越多提升越大),条件准确率应升;但每张图需融合更多专家的 KL 优化,推理成本上升。论文只用了 n=1,未报告 n 的消融——这是可检验的外推。
  3. L3构造一个 specialist 方案失效的场景,并说明 dustbin 设计为何救不了它。
    参考答案+评分要点要点①:细粒度错误发生在 generalist top-1 已错的图上,且正确类所属专家未被激活——转诊链条断裂;要点②:dustbin 只解决"专家内部视角"的类别坍缩,不解决"路由失败";要点③:Table 4 中 350037 个零覆盖样本增益为 0 即为此失效模式的实证。三点各一分。
  4. L4综合 §2 与 §5:specialist 方案里蒸馏思想出现在哪几处?(至少找三处)
    参考答案①specialist 从 generalist 权重热启动(参数层面的知识传递);②§6.1 提出 specialist 可用 generalist 的软目标维持对非专属类的记忆(防过拟合);③整个"大模型教小模型/全模型教局部模型"的层级结构与蒸馏同构。论文标题里的 distill 在 §5 更多体现为初始化与软目标正则的组合。

六、批判性阅读:如何不被数字带节奏

6.1 每个 benchmark 到底测什么

6.2 比较是否公平

语音实验的对手是"自己的旧版本基线",属作者内部评测(自己出题自己批改):没有第三方系统、没有外部复现。JFT 基线同样如此。与相关工作[8]的对比(28% vs 86%)口径不同(见 4.3 节提醒),严格说不是同轴比较。【解读者观点】

6.3 第二坐标轴

论文给出的效率账:specialist "几天而非数周"、推理时只运行少数专家——但没有给出 61 个专家的总训练 FLOPs、存储开销(61×300 类的参数副本)、以及逐图求解公式(5)的推理延迟。蒸馏主线的成本账较清楚(一次前向 vs N 次前向),但 transfer set 制备成本未计。

6.4 论文没有告诉你什么

七、综合考核(毕业关)

7.1 重建因果链

  1. L4只给你三个短语:"集成太贵""软目标有暗知识""生产系统不能等六个月以上",推演这篇论文的章节为什么按 §2→§3/§4→§5 的顺序展开,每一步分别回应哪个短语。
    参考答案+评分要点要点①:"集成太贵"逼出压缩需求 → §2 给出机制(软目标+温度);要点②:机制是否真传知识?→ §3(受控小实验:删类、控温度)与 §4(生产级验证:85M 模型)两级证据递进;要点③:"不能等六个月"逼出 §5——不再重训集成,而是在已有大模型上并联便宜专家。顺序是"机制→受控证据→生产证据→规模化变体"的经典论证链。(三步各一分,指出递进关系再一分。)

7.2 数字总对账

  1. L2核对下列五组数字的自洽性:①语音模型 85M 参数;②集成增益转移"超过80%";③JFT 相对提升 4.4%;④"3"识别率 98.6%;⑤学生参数约为教师一半。
    答案①费米估算 84.3M≈85M ✓;②1.9/2.2≈86.4% ✓;③(26.1−25.0)/25.0=4.4% ✓;④(1010−14)/1010≈98.6% ✓;⑤128 万/239 万≈54% ✓。五组全部对得上——本文数字纪律良好,主要风险在"未报告方差"而非"算术不一致"。

7.3 设计决策答辩

  1. L3答辩三连之「温度 T」:为什么需要温度?不引入 T 直接用 T=1 软目标会怎样?论文给的论据够吗?
    参考答案为什么:T=1 时正确类概率≈1,错误类概率呈 10⁻⁶/10⁻⁹ 量级,梯度上不可分辨,相似性结构丢失。不引入:相关工作[8]在 T=1 下只消除 28% 误差差距,是反事实证据。论据充分性:有跨容量(30~1200 单元)与跨域(MNIST/语音)的温度证据,够;但只有 4 个搜索点,精细不足。
  2. L3答辩三连之「dustbin」:为什么不保留完整 15000 类 softmax?代价是什么?
    参考答案为什么:300+1 维 softmax 让专家训练快、可几天收敛、可大规模并行(核心动机)。代价:专家丢失对非专属类的精细知识,只能靠"一半随机采样+dustbin logit 校正"补救,且 §6.1 承认这导致专家易过拟合,更好的方案(用 generalist 软目标补全)当时尚未完成。
  3. L3答辩三连之「T² 缩放」:不加会怎样?有没有更优雅的替代?
    参考答案不加:软/硬目标相对贡献随温度漂移(见 2.13 题 L2),温度实验失去可比性。替代:可直接把两路损失各自归一化,或对 logits 层用公式(4)的最小二乘形式——论文实际证明了高温极限下二者等价,所以 T² 缩放是保持"广义形式"的最自然选择。【后半句为解读者推断】

7.4 证据审计(回看 1.2 预评)

贡献预评读后修正理由
软目标蒸馏有效强实验支撑维持 ★★★三个数量级不同的场景(MNIST/85M 语音/JFT)方向一致
匹配 logits 是特例推导+定性维持 ★★数学推导干净,但无实验直接检验近似误差随 T 的衰减
specialist 快速并行强实验支撑下调至 ★★+1.1% 绝对值小、无总成本核算、知识未能回收进单模型
软目标=正则化器仅一组对照维持 ★★Table 5 对照干净(65.4 vs 67.3 训练准确率还更低),但只有一个任务一个比例(3%)

八、附录:术语速查

术语含义(出处)
cumbersome model笨重模型/教师,被蒸馏的对象(§1–2)
soft targets教师在高温 softmax 下输出的完整概率分布(§2)
transfer set用于训练学生的新数据集,可用原训练集(§2)
dustbin classspecialist 把所有非专属类折叠成的单一垃圾箱类(§5.2)
specialist / generalist混淆类子集专家 / 全类通用模型(§5)