← 总目录 / 板块五 · 2022年以来最重要的10篇
板块五 · 模型的范式变迁

第36篇 · PaLM

把"堆参数"推到工程极限的5400亿参数巨兽——它证明了规模的威力,也亲手暴露了规模的盲区。
PaLM: Scaling Language Modeling with Pathways · Google Research(Chowdhery, Narang, Devlin 等)· 2022 · 原文 arXiv:2204.02311

〇、阅读进度与声明

本页所有数字均复述自论文原文(标注对应小节),未做任何外部独立验证。个别章节因全文获取截断,未能直接核验原文细节的,已用 未核验 标出。【论文声称】=作者叙事;【实验支持】=文中有数据支撑;【解读者推断】=本站精读者的推理,论文未明说。

一、全局大图

1.1 摘要拆解:一句话 → 章节 → 精读导航

摘要短语论文章节本页精读位置
"540B 参数、稠密激活的 Transformer"§1–2 模型架构第二章
"6144 块 TPU v4 芯片、Pathways 系统"§4 训练基础设施第三章
"数百项语言理解/生成基准上的 SOTA few-shot 结果"§6.1 英文 NLP / §6.1.1 MMLU第四章
"BIG-bench 上超越人类平均、大量任务呈不连续跃升"§6.2 BIG-bench第五章
"多步推理任务上超越微调 SOTA"§6.3 Reasoning第五章附
"偏见、毒性综合分析与记忆化研究"§7 Memorization / §10 偏见分析第六章
"伦理考量与缓解策略讨论"§11 Ethical Considerations第六章末

1.2 主要贡献与证据强度预评

#贡献声称预评证据强度依据
1首次大规模使用 Pathways,无流水线并行跨两个 TPU v4 Pod 训练 540B 模型,MFU 达 46.2%强实验支撑§4 给出吞吐量数字与对比表(Table 3)
2规模收益尚未饱和:29 项英文基准中 few-shot 28 项超先前 SOTA强实验支撑§6.1 Table 4/5,但对手为各自最优单点结果而非同配置复现
3约 25% 的 BIG-bench 任务出现不连续跃升(涌现能力)有消融但定义依赖指标归一化方式§6.2 给出明确的不连续性定义与计算示例
4CoT + 规模即可超越推理任务上"微调+验证器"的 SOTA强实验支撑§6.3 Table 10:GSM8K 58% vs 此前 55%
5记忆化随规模上升(1.6%→2.4%)强实验支撑§7 抽样实验,样本量有限但方法清晰
6"并行层在 540B 规模质量中性"只是主张(外推)仅在 8B 见小幅退化、62B 无退化后外推到 540B(§2)

1.3 推荐阅读路线

必读主线:§2 架构 → §4 训练效率(MFU)→ §6.2 BIG-bench → §6.3 推理 → §7 记忆化。可跳读支线:§6.5–6.7 多语言三连(若只关心英文能力);§9 Exploring Explanations 是定性案例展示。跳读代价:跳过 §6.5 会错过"非英语数据仅占约22%仍能逼近翻译 SOTA"这一反直觉结论;跳过 §7 会错过全篇最有安全价值的一组数字。

二、模型架构精读(论文 §2)

2.0 来源与学习目标

来源:论文 §2(Model Architecture)与 §2.1(Model Scale Hyperparameters)。除特别标注外均为原文内容。

学完本章你应能:①默写 PaLM 相对标准 Transformer 的 6 处修改及各自的动机;②根据层数/维度/头数手算任意一档模型的近似参数量;③说出 multi-query attention 为什么省的是解码期成本而不是训练期成本。

2.1 失效模式先行:没有这些改动会怎样

GPT-3 式的标准 decoder-only Transformer 在 500B+ 规模会遇到三重压力:训练太慢(串行的 attention→MLP 两段结构让每层要过两遍大矩阵乘)、解码太贵(自回归逐 token 解码时每个头的 K/V cache 都不能共享,显存带宽被吃光)、训练不稳(大规模下 loss 尖峰频发)。PaLM 的每一处改动都对着其中至少一条压力。

2.2 六处修改逐条手术

改动内容动机与代价证据等级【论文声称/实验支持】
SwiGLU 激活MLP 用 Swish(xW)·xV等算力对比下质量优于 ReLU/GeLU;代价是 MLP 从 2 次矩阵乘变 3 次引用 Shazeer (2020) 的等算力实验
并行层(parallel layers)y = x + MLP(LN(x)) + Attn(LN(x)) 取代串行嵌套输入矩阵乘可融合,大规模下提速约15%;8B 消融有小幅质量损失、62B 无损失62B 有消融,540B 是外推主张
Multi-Query AttentionK/V 各头共享(投影成 [1,h]),Q 保持 [k,h]质量与训练速度中性,但解码期显著省成本——因为逐 token 解码时 K/V 不随 batch 共享引用 Shazeer (2019),称"中性"
RoPE 位置编码旋转位置编码替代绝对/相对位置编码长序列表现更好引用 Su et al. (2021)
输入输出嵌入共享embedding 矩阵一份两用;输出 logits 预 softmax 除以 √n省参数量(256k 词表 × d_model 不是小数目)工程惯例陈述
全部去 biasdense kernel 与 LayerNorm 均无偏置项声称提高大模型训练稳定性经验陈述,无消融表
类比及其失效点:并行层像"两条流水线同时开工再合流",省掉了先 attention 再 MLP 的串行等待。但类比在数学上失效的地方是:并行式里 MLP 和 Attention 看到的是同一个 LN(x),而串行式里 MLP 看到的是 LN(x+Attn(LN(x)))——信息通路不同,所以它不是免费的等价变换,8B 的小幅质量下降就是证据。作者赌的是"规模越大越无所谓"。

2.3 三档规格与公式手术

模型层数头数d_model参数(B)batch size 调度
PaLM 8B321640968.63256→512
PaLM 62B6432819262.50512→1024
PaLM 540B1184818432540.35512→1024→2048

来源:§2.1 Table 1。d_ff 恒为 4×d_model,attention head size 恒为 256。

公式手术:decoder-only Transformer 的参数量估算

每层参数 ≈ 12·d²model(attention 4d² + MLP 8d²,忽略 SwiGLU 多出的一个投影的精细修正与 LayerNorm)
符号它是什么直觉
d_model隐藏维度每个 token 向量的宽度,决定"通道数"
d_ff = 4·d_modelFFN 中间维度MLP 先升维 4 倍再压回
L层数块的重复次数

对 540B:L=118,d=18432,则 118 × 12 × 18432² ≈ 118 × 12 × 3.397×10⁸ ≈ 4.81×10¹¹ ≈ 481B。加上 embedding(256k × 18432 ≈ 4.7B,共享后计一次)等项,与官方 540.35B 存在约 55B 的差距。注意这个差距主要来自 SwiGLU 把 MLP 从 8d² 变为约 12d²(三个矩阵乘,其中两个升维矩阵按 8/3·d 配置)以及本文粗略忽略的修正项——这正说明"每层 12d²"是 GPT-2 时代的近似,对 SwiGLU 架构会系统性低估。【解读者推断】

手算验证:FLOPs per token ≈ 参数量

论文 §2.1 说"每 token 的 FLOPs 数约等于参数量"。验证:前向每参数做 2 FLOPs(乘加各一),前向+反向合计约 3×前向 = 6 FLOPs/参数/token?不对——论文指的是单次前向意义下的量级对比(dense Transformer 前向 FLOPs ≈ 2×参数量,与参数量同数量级),所以"≈"是量级陈述不是精确等式。读这类表述时要问一句:作者用的是哪个口径。【解读者推断】

2.4 常见误读

误读1:"multi-query attention 提高了模型质量"。错。论文原话是 quality 与 training speed 均 neutral,它的收益只在自回归解码时的成本(K/V cache 缩小为 1/k)。
误读2:"并行层是严格等价改写"。错。它是近似替换,8B 消融有可见的质量损失。
误读3:"词表 256k 很大所以能处理一切语言"。部分对。词表确实无损可逆、保留空白、OOV 字符回退 UTF-8 字节,但数字被强制拆成单个数字 token("123.5"→"1 2 3 . 5"),这是为了让算术更规整,也意味着数字永远占更多序列长度。

一句话记住本章:PaLM 的架构没有发明新东西,它是一张"已知有效改动的采购清单",真正的创新在下一章——怎么把这些改动塞进 6144 块芯片。

三、训练基础设施:MFU 与 Pathways(论文 §4–5)

来源:论文 §4、§4.1、§5、§5.1。

学完本章你应能:①给出 MFU 的定义并解释为什么它比 HFU 更公平;②复现 PaLM 540B 吞吐量的对账过程;③描述 loss 尖峰的"回退+跳批"补救法及其局限。

3.1 失效模式先行:为什么不用流水线并行

此前同量级训练要么困在单个 TPU 系统内(LaMDA、GLaM),要么用 DCN 连接多个 Pod 加流水线并行(Gopher:4 个 TPU v3 Pod)。流水线的代价:①填充/排空产生的气泡让大量芯片闲置;②每个 micro-batch 都要从显存重载权重,抬高带宽需求。PaLM 的选择:每个 TPU v4 Pod 内 3072 芯片 = 12 路模型并行 × 256 路全分片数据并行,两个 Pod 之间只用最简单的"Pod 级两路数据并行"——每步结束时交换一次梯度,其余时间互不打扰。

手算验证:跨 Pod 梯度交换有多猛

论文给出:每对主机每步交换约 1.3 GB 梯度,两 Pod 共 1536 台主机(768×2),即 768 对主机同时爆发传输。聚合突发流量 = 768 × 1.3 GB / 步长时长。论文给出的总量级是 81 Tbps。反推:81 Tbps ÷ 768 对 ≈ 105.5 Gbps/对 ÷ 8 ≈ 13.2 GB/s/对 → 每步传输 1.3 GB 需要 ≈ 0.099 秒,即步长约 100ms 量级——这与 238.3K tokens/sec ÷ 4M tokens/batch ≈ 59ms/步的数字不完全吻合(差异源于梯度传输与反向计算的重叠程度不足,论文承认"未能完全重叠"是 1.95x 而非 2x 的原因)。此处存在轻微张力,属于对账发现:【解读者推断】两个数字来自不同测量口径(稳态平均 vs 峰值突发),不必视为矛盾,但要意识到"97% 完美弱扩展"这句话背后藏着不可忽略的通信尾巴。

3.2 MFU:这篇论文留下的最持久的工程遗产之一

MFU = 观测吞吐(tokens/s) × 每 token 所需理论 FLOPs ÷ (芯片数 × 峰值 FLOPs)

MFU 分母不含重计算(rematerialization)的 FLOPs,因此与实现无关、可跨系统比较;HFU 则把重算的浪费也算成"利用率",虚高且不可比。对比表(Table 3):GPT-3 175B 为 21.3%,Gopher 280B 为 32.5%,Megatron-Turing NLG 530B 为 30.2%,PaLM 540B 为 46.2%(含 self-attention;不含为 45.7%),HFU 为 57.8%。平均训练吞吐 238.3K tokens/sec(batch 2048)。

数字对账:238.3K tokens/s ÷ 2048 batch ≈ 116 tokens/样本/秒;batch 内序列长 2048,意味着每步约 59ms。结合上一节的通信反推(≈99ms),两者相差约 1.7 倍——说明跨 Pod 梯度传输并未完全藏在计算后面,与论文自述的"backward 与跨 Pod reduce 缺乏重叠"一致。对账通过(解释自洽)。

3.3 训练配置速查(§5)

3.4 训练不稳定:诚实得可贵的一小节

最大模型训练中出现了约 20 次 loss 尖峰(开了梯度裁剪也没拦住),且小模型上从未观察到。作者的补救:从尖峰前约 100 步的 checkpoint 重启,跳过 200–500 个数据批次。关键消融:把尖峰附近的数据批次换到一个更早的 checkpoint 继续训,不会再触发尖峰——说明尖峰不是"坏数据"本身造成,而是特定数据批次 × 特定参数状态的组合产物。论文坦承:由于训练太贵,无法找到有原理的缓解策略。【论文声称,且作者明示证据不足】

一句话记住本章:PaLM 最值得抄走的不是 540B 这个数,而是 MFU 这把尺子和"loss 尖峰=数据×状态组合"这个诊断结论。

3.5 闭卷自检清单

不看材料,我能说出:MFU 和 HFU 差在哪一项?PaLM 为什么不需要流水线并行?z-loss 防的是什么?β₂ 动态化的理由?尖峰消融排除了哪个假说?

四、英文基准与 MMLU(论文 §6.1)

来源:论文 §6.1、Table 4/5/6。

学完本章你应能:①指出 Table 4 比较协议的两个隐含不公平点;②复述 MMLU 上"62B→540B 仅涨 15.6 分而 8B→62B 涨 28.4 分"的阶梯现象。

4.1 主结果

29 项英文基准(与 GLaM/GPT-3 同一套题):few-shot 设定下 PaLM 540B 在 28/29 项超过此前各模型的最优单项结果;1-shot 下为 24/29。代表性数字:TriviaQA few-shot EM 81.4(64-shot);Natural Questions few-shot EM 39.6(64-shot);SQuADv2 F1 83.3;ANLI R1 56.9(此前 SOTA 44.3,涨幅超 12 分)。1-shot 平均:NLG 63.9 / NLU 74.7(GPT-3 175B 分别为 52.9 / 65.4;GLaM 64B/64E 为 58.4 / 68.7)。MMLU 5-shot:PaLM 540B 69.3,超过 Chinchilla 70B 的 67.6(Table 6 写 67.5,正文引 67.5/67.6 两处,属四舍五入口径差);但注意 PaLM 8B 只有 25.3——接近随机水平,说明 MMLU 的能力高度集中在最大档。

4.2 批判性阅读:这张表怎么读才不被带节奏

一句话记住本章:28/29 是真赢,但赢的是"拼装出来的历史最优集",不是任何一个统一受控的对手。

五、BIG-bench 与涌现:本篇的高潮章节(论文 §6.2–6.3)

来源:论文 §6.2、§6.3、Figure 3–10。§9 Exploring Explanations 为定性展示,此处不展开。

学完本章你应能:①复述论文对"不连续改进"的操作性定义并手算 logical_sequence 的例子;②说出 BIG-bench 上"超越人类平均"与"35% 单项仍输人类"这对并存事实;③给出 GSM8K 四行对照表的完整数字链。

5.1 失效模式先行:power-law 之外的反常

多数任务的得分随规模大致 log-linear 提升(符合 Kaplan 幂律直觉)。但 PaLM 团队注意到一类反常:62B→540B 的涨幅远大于 8B→62B。这不是噪声吗?他们给了一个可操作的定义来量化它。

5.2 "不连续"的定义与手算验证

预测值 = 62B 得分 + (62B 得分 − 8B 得分);不连续量 = 540B 实际得分 − 预测值

以 logical_sequence 为例:8B=13%,62B=25%,log-linear 外推预测 540B≈37%(25+13),实际 87%,不连续量 = +50%。全 150 个文本任务中:25% 的任务不连续量 > +10%,15% 的任务 > +20%。english_proverbs 从 62B 的 25% 跳到 540B 的 87%。【实验支持,但定义本身依赖"normalized preferred metric"的归一化选择——见批判章】

5.3 人类对照的两面性

5-shot 的 PaLM 540B 在 58 个共同任务上击败此前 SOTA 中的 44 个,且总分超过众包工人的平均人类成绩(工人可用搜索引擎和计算器)。但在 35% 的单项任务上平均人类仍然更高;BIG-bench Lite 24 任务中只有 3 个超过最好人类成绩。"超过人类平均"是个精心构造的措辞——它不是"超过人类"。

防记忆化三件套(§6.2):BIG-bench 文件含 canary 字符串且确认不在训练集中;训练数据收集时该数据集尚未公开;对强表现任务人工抽查解码过程无标签泄露。这是评测严谨性的加分动作。

5.4 CoT 推理:一张值得背下来的表(§6.3 Table 10)

模型 + 技术GSM8K 准确率(8-shot)
PaLM 540B + CoT + 外部计算器58%
PaLM 540B + CoT54%
PaLM 540B 无 CoT17%
PaLM 62B + CoT33%
GPT-3 + 微调 + CoT + 计算器34%
GPT-3 + 微调 + CoT + 计算器 + 验证器55%(此前 SOTA)

三个变量各自的效果都能从表中拆出来:CoT 本身(17%→54%,+37 分)、规模(62B+CoT 33%→540B+CoT 54%,+21 分)、计算器(54%→58%,+4 分)。错误分析(150 个随机 GSM8K 样本):62B 错 45 题,错误分为语义理解/缺一步/其他三类,扩到 540B 后三类错误都被大幅修复。7 个推理数据集中 540B+CoT 在 GSM8K、MAWPS、SVAMP、StrategyQA 上拿新 SOTA;论文还通过 n-gram 重叠分析排除了与推理评测集的数据污染。

一句话记住本章:"涌现"在这里是一个算术定义(外推落差>阈值),不是玄学;而 CoT×规模的乘积效应是本篇最扎实的突破性结论。

六、负责任 AI 三章:记忆化、污染、偏见与毒性(论文 §7–§11)

来源:论文 §7 Memorization、§8 Dataset Contamination、§10 Representational Bias Analysis、§11 Ethical Considerations。注:§7/§10 数字经二手镜像核对,与 arXiv HTML 版一致;§8 的完整检查表格未能从原文直接核验,细节标 未核验;§6.5 翻译章的具体 BLEU 表同样 未核验(仅有引言定性结论:非英语数据约 22%,翻译超此前 SOTA、非英语摘要追平微调 SOTA)。

6.1 记忆化:单 epoch 也能背书(§7)

方法:从训练集随机取 100-token 序列,用前 50 token 做 prompt、贪心解码,统计后 50 token 完全匹配的比例(方法沿 Carlini et al. 2022)。结果链

常见误读:"留出集记忆率>0 说明实验做错了"。不对——留出样本里有大量与训练集近乎相同的模板文本(如只改年份的开源许可证),它们本来就该被"精确续写"。真正要盯的是训练集记忆率显著高于留出集这一差额,那才是真实记忆。

6.2 数据污染(§8)

论文做了训练集与评测集的重叠分析。据精读核验到的二手转述:29 项英文任务中有 10 项存在部分重叠,但去除重叠样本后的"干净子集"成绩与全集差异不大,作者据此主张污染影响有限。【该节完整表格 未核验——建议读者自行查阅原文 Table 26 一带复核。】

6.3 偏见与毒性(§10)

Winogender 共指消解:准确率随规模上升,PaLM 540B 创 1-shot 与 few-shot 新 SOTA——1-shot 多选评分 79.4%(GLaM 1-shot 71.7%)、更严格的生成评分 69.7%;4-shot 生成评分升至 84.7%。但仍低于任务适配模型与人类 95.9%。分桶揭示真相:stereotypical(符合职业性别刻板印象)子集准确率高于 gotcha(反转)子集,女性代词的 gotcha 子集最低;刻板/反刻板差距随 shot 数收窄(1-shot 从 14.1 收到 10.1 个百分点,4-shot 从 18.3 收到 9.2)。训练语料代词频率:中性 770M、男性 620M、女性 381M——数据层面的不平衡摆在那里。

共现分析:用"{term} was very…"类 prompt、top-k(k=40) 采样 800 条续写,统计形容词/副词。发现模型会把 Muslims 与 terrorism/extremism/violence 类词汇关联,且该行为在各规模上一致存在——规模不会自动洗掉数据里的刻板印象。

毒性:62B 与 540B 的整体毒性略高于 8B;更关键的发现是模型续写的毒性与 prompt 毒性高度相关,而人类续写没有这种强相关——模型比人更容易被 prompt 的风格牵着走。这意味着"毒性注入"是一种低成本攻击面。

§11 伦理考量:论文讨论了训练数据的许可、隐私与环境成本等问题及缓解方向(定性章节,未给新数字)。

一句话记住本章:规模让 Winogender 变好、让记忆化变糟、让刻板印象原样保留——"scale 解决一切"在这三章面前站不住。

七、批判性阅读总账

7.1 benchmark 到底测什么

7.2 成本第二坐标轴

PaLM 540B 的训练是一次性的巨额沉没成本(附录 B 有能耗核算,具体数值本次获取 未核验),而 62B 已能在多数英文任务上压过 GPT-3 175B——如果只报 540B 的分数,读者容易高估"必须这么大"的程度。推理侧 multi-query attention 是明确的降本设计,但论文未报告任何推理延迟/费用数字。

7.3 论文没有告诉你什么

八、综合考核

8.1 重建因果链

题目(L4):仅从"540B 参数 / 6144 芯片 / 单 epoch 780B token / 序列长 2048"四个数字出发,推演系统团队必须依次解决哪几类工程问题,并指出每个数字逼出了哪一类。

参考答案与评分要点

① 540B 参数 → 显存装不下 → 必须分片:逼出 12 路模型并行 × 256 路 FSDP + 激活重计算(重计算又压 MFU 口径,催生 MFU 指标)。② 6144 芯片超出单 Pod(3072)→ 必须 DCN 跨 Pod → 通信昂贵 → 逼出"Pod 级数据并行"这一最小通信方案与网络栈优化(1.3GB/对/步、81 Tbps 突发)。③ 780B token 单 epoch → 无法靠多轮平均噪声 → 数据管线必须确定性、batch size 要随训练阶段放大(512→1024→2048)以兼顾早期样本效率与后期梯度质量。④ 序列长 2048 × batch 2048 → 注意力激活巨大 → 并行层融合 + 重计算的取舍。评分:每个数字对应一类问题 4 分;指出连锁关系(如①→MFU)额外 2 分。

8.2 数字总对账(L2–L3 混合)

  1. L1PaLM 540B 的 batch size 调度是多少?最终 batch 含多少 token?
    答案512→1024→2048(分别在 50k、115k 步翻倍),最终 2048 序列 × 2048 长度 = 约 4M token/步(§5)。
  2. L2logical_sequence 的 8B=13%、62B=25%,某同学声称"540B 的 87% 只是正常幂律延续"。用论文的定义反驳他。
    答案log-linear 外推预测 25+(25−13)=37%,实际 87%,不连续量 +50%,远超 +10% 阈值;且全集合上此类任务占 25%,不能用个别噪声解释(§6.2)。
  3. L2从 Table 10 拆出"规模"这一个变量的净贡献。
    答案控制 CoT 相同:540B+CoT 54% − 62B+CoT 33% = +21 个百分点(若再加计算器则 58−33=+25,但计算器是另一变量,需分开计)。
  4. L3"被看 500+ 次的片段记忆率超 40%"能否推出"PaLM 记住了 40% 的训练数据"?
    答案不能。条件概率 P(记忆|重复>500)≠P(记忆)。总体记忆率仅 2.4%(540B);40% 是极小子群(高重复片段)内的比率。混淆条件方向是该实验最常见的读法错误。

8.3 设计决策答辩(开放题,配评分标准)

  1. L4答辩题1:为什么选"Pod 级数据并行"而不是跨 Pod 流水线?请给出论文论据 + 你认为论文没说的代价。
    参考答案与评分标准论据:气泡开销(空闲芯片)、micro-batch 权重重载带宽、软件复杂度(§4)。实测双 Pod 达单 Pod 的 1.95 倍(97% 完美弱扩展)。未说的代价:要求 batch 至少翻倍才能喂饱两个 Pod,可能影响小 batch 场景的收敛动态;对 DCN 拓扑有强依赖,离开谷歌机房难以复现。评分:论据 3 分、数字 2 分、代价洞察 3 分。
  2. L4答辩题2:把"涌现/不连续"的判定换成未归一化的原始指标,结论还稳吗?写一段 200 字的评审意见。
    参考答案与评分标准要点:不连续量定义在 normalized preferred metric 上,归一化(随机=0)对不同题型的影响不同;多选题的 chance correction 会放大高基数选项任务的视觉跳跃;应补充原始指标的敏感性分析或换用连续型指标复核。评分:指出归一化依赖 3 分、给出可操作的复核方案 3 分、语言克制不否定现象本身 2 分。
  3. L4答辩题3:如果你是审稿人,会要求作者补哪个实验来支撑"no biases 提高稳定性"?
    参考答案与评分标准同规模、同数据、同调度下有/无 bias 的对照 run(至少 8B 或 62B 档),报告尖峰频率与最终 loss;理想情况再加梯度范数轨迹。评分:提出受控对照 4 分、指定观测量 2 分。

8.4 证据审计:读完之后重新打分

预评贡献预评读后修正理由
Pathways 大规模训练效率★★★★★★ 维持吞吐、扩展比、对比表齐全,且给出了失败面(通信尾巴)
28/29 超 SOTA★★★★★ 降级比较对象是拼装的各家最优,口径不完全统一;62B>175B 的现象反而说明变量混杂
涌现不连续★★★★ 维持但加脚注定义清楚、可复算,但绑定在归一化指标上
CoT+规模破推理 SOTA★★★★★★ 升格为本篇最硬结论Table 10 可完整拆变量,另有错误类型消融
并行层 540B 质量中性★ 维持确系外推,无目标规模消融