← 总目录 / 板块三 · 语言模型的发展
板块三 · 语言模型的发展

第24篇 · GPT-3

Language Models are Few-Shot Learners——175B 参数证明:上下文本身就是学习,提示词就是接口
Language Models are Few-Shot Learners · Tom B. Brown 等 31 人(OpenAI)· 2020 · 原文 arXiv:2005.14165(NeurIPS 2020)

本页数字均复述自论文原文并注明小节。注:本次精读通过 HTML 版全文获取了 §1–§3.9 的完整内容;§4 之后(数据污染专章细节、Limitations 全文、能耗等附录)抓取被截断未能直接核验,相关处已显式标注。

一、全局大图

摘要拆解对照表

摘要短语对应论文章节本页解读章节
"预训练+微调"范式仍需每个任务数千至数万标注样本;人类只需几个例子或一句指令§1 引言第1章
训练 GPT-3:175B 参数自回归 LM,比此前任何非稀疏模型大 10×§2.1 架构表第2章
所有任务零梯度更新,任务与示例纯靠文本交互给出§2 四种设定定义、§2.4 评测协议第3章
翻译/问答/完形及即时推理任务(拆词、算术、新词造句)表现强劲§3.1–3.9 结果第4–5章
同时指出少数任务上 few-shot 仍挣扎、部分数据集有网络语料的方法学问题§3.7–3.8、§4 污染研究第6章
GPT-3 生成的新闻人类难以分辨;讨论社会影响§3.9.4、§6 Broader Impacts第6章(部分未核验)

主要贡献与证据强度预评

推荐阅读路线

必读主线:§1 引言(三种设定的定义)→ §2.1 架构与 8 尺度 → §2.2 数据混合 → §3.2 闭卷问答 → §3.9 合成任务。可跳读支线:§3.6 阅读理解、§3.8 NLI(结论都是"弱",看小结即可)。跳过 §2.2 的代价最大:不懂数据混合权重,就无法批判性看待后面所有分数——你不知道每个基准在训练里被"预习"了几遍。

二、逐章精读

第1章 三种设定:把"学习"重新定义

来源:论文 §1 引言、§2 开头、脚注 1。

学习目标:学完本章你应能精确复述 zero/one/few-shot 的定义并指出它们与传统 few-shot learning 的区别;解释作者为何引入 "meta-learning / in-context learning" 术语替代 "zero-shot transfer"。

四种设定按"所需任务特定数据量"排成光谱(图2.1):Fine-Tuning——数千到数十万标注样本做梯度更新;Few-Shot (FS)——推理时给 K 个示范(K 通常 10–100,受限于上下文窗口 n_ctx=2048 装得下的数量),零梯度更新One-Shot (1S)——仅 1 个示范+自然语言描述;Zero-Shot (0S)——只有自然语言指令。关键澄清(脚注1):zero-shot 并非"从零个样本学习"——它常包含推理时示范之外的信息(指令本身),作者用"meta-learning 内环=in-context learning"来避免术语歧义,并声明这些术语刻意不回答"模型是在现场学新任务还是识别训练时见过的模式"。

直觉类比:fine-tuning 像让学生上一学期专业课再考试;few-shot 像考场上发三道例题让你照葫芦画瓢;zero-shot 像只念一遍题目要求。类比在哪里失效:考场学生真的在做"新学习",而 LM 的前向传播没有任何权重变化——它的"适应"完全发生在激活值的条件化里。类比会诱导你高估模型的元学习能力,这正是论文脚注1反复警惕的误读。

动机三连(§1):①实用——很多任务收不到大规模标注集;②泛化——微调让模型过拟合窄分布,"名义达到人类水平的 benchmark 分数可能夸大了真实任务能力";③对齐人类——人靠一句指令就能切换任务。GPT-2 的 in-context 成绩被引作反例基线:Natural Questions 仅 4%、CoQA 55 F1(落后 SOTA 35 分以上)——"meta-learning 显然需要大幅改进才能实用"。这就是 GPT-3 立项时的起点。

一句话蒸馏:一句话记住本节——GPT-3 的真正发明不是模型,而是评测框架:把"给几个例子"变成了一种标准化的、可跨任务比较的能力度量

闭卷自检:few-shot 与传统 meta-learning 的异同?为什么说 zero-shot 这个词其实名不副实?

第2章 架构:8 个尺度的一盘大棋

来源:论文 §2.1 表2.1、§2.3。

模型n_paramsn_layersd_modeln_headsd_headbatch(tokens)lr
Small125M1276812640.5M6.0×10⁻⁴
Medium350M24102416640.5M3.0×10⁻⁴
Large760M24153616960.5M2.5×10⁻⁴
XL1.3B242048241281M2.0×10⁻⁴
2.7B2.7B32256032801M1.6×10⁻⁴
6.7B6.7B324096321282M1.2×10⁻⁴
13B13.0B405140401282M1.0×10⁻⁴
175B(GPT-3)175.0B9612288961283.2M0.6×10⁻⁴

架构沿用 GPT-2(含其改进的初始化、pre-normalization、可逆 tokenization),唯一改动是交替使用稠密注意力与局部带状稀疏注意力(类似 Sparse Transformer)。全部 8 个模型各训练 3000 亿 token;上下文窗口统一 n_ctx=2048;FFN 维恒为 4×d_model。各档超参的选择依据是 GPU 布局的计算效率与负载均衡,而非理论最优——论文引用 Scaling Laws 说明验证损失对这些选择不敏感。

公式手术 · 训练计算量

C ≈ 2 · N_nonembed · D (N=非嵌入参数数,D=token 数)

【解读者补充推导】每 token 前向约 2N FLOPs(矩阵乘法主导),反向约为前向 2 倍,合计 ~6N?——注意论文图2.2 采用的是 2ND 近似口径(不含反向系数差异与注意力项),这是 Scaling Laws 论文的约定。代入 GPT-3:C ≈ 2 × 175×10⁹ × 300×10⁹ ≈ 1.05×10²³ FLOPs ≈ 1216 petaflop/s-days。【未核验】论文附录 D 给出的精确总计算量数值本次未能核验,以上为按论文口径的复算。

手算验证 · 参数量

用 12·L·H² 近似:175B 档 = 12×96×12288² ≈ 1.73×10¹¹ ✓ 与声称的 175B 吻合(嵌入层:2048×12288≈25M 可忽略)。13B 档:12×40×5140² ≈ 1.27×10¹⁰ ✓。8 个规格横跨三个数量级(125M→175B,1400 倍),这就是"scaling 曲线"的数据基础。

常见误读1:"GPT-3 在 3000 亿 token 上只训了一遍所以没背题"。错——表2.2 明确显示 Wikipedia 被采样 3.4 遍、WebText2 2.9 遍,只有 CommonCrawl 和 Books2 不足一遍。高质量数据故意重复采样,"接受少量过拟合换取质量"。
常见误读2:"175B 是当时最大的语言模型"。论文措辞是"比任何先前非稀疏(non-sparse)语言模型大 10×"——稀疏 MoE 模型不在此列,这个限定词常被转述时丢掉。

工程账单:为装下 175B,训练采用矩阵乘内部+层间两种模型并行混合,跑在微软提供的高带宽 V100 集群上(§2.3)。缓解显存压力的同时新增通信复杂度——这为后续 ZeRO/MegaScale 等系统工程论文埋下了整个研究方向。

一句话蒸馏:一句话记住本节——GPT-3 不是"一个模型",是 8 个精心配对的缩放点,专为验证幂律与 in-context scaling 而生

第3章 数据:45TB 进、570GB 出的质量漏斗

来源:论文 §2.2 表2.2 及正文。

数据集tokens训练混合占比300B tokens 训练中的 epoch 数
Common Crawl(过滤后)4100 亿60%0.44
WebText2190 亿22%2.9
Books1120 亿8%1.9
Books2550 亿8%0.43
Wikipedia(英文)30 亿3%3.4

处理流水线三步:①下载 2016–2019 年共 41 个 CommonCrawl 月度分片,压缩明文 45TB,按与高质量参考语料的相似度过滤后剩 570GB ≈ 4000 亿 BPE token;②文档级模糊去重(跨数据集);③掺入策展语料提升多样性。核心设计:采样占比 ≠ 数据体量占比——小而精的 Wikipedia 占比 3%(体量的 0.6% 都不到),被读了 3.4 遍。

数字对账(解读者补充)

① 体量核对:4100+19+120+550+30 ≈ 4829 亿 token 总库容;训练只用 3000 亿 ⇒ 平均每 token 见 0.62 遍,与表中 epoch 列的加权均值相符 ✓。② 过滤率核对:45TB→570GB,保留率约 1.27%——CommonCrawl 的噪声程度可见一斑,这解释了为什么"轻过滤 CC 质量低于策展数据"(原文表述)。③ 一个值得指出的张力:Wikipedia 只占训练分布 3%,却是多数 NLP 基准的来源域——下游成绩与训练分布的错位正是后文 NQ/RACE 弱势的结构性原因【解读者推断】。

常见误读:"GPT-3 的数据就是 CommonCrawl"。按 token 混合占比看确实 60% 来自 CC,但按信息质量权重看,策展数据被放大了近 5 倍采样。引用"GPT-3 用了什么数据"时应同时报出这两个口径,否则会严重误导。

一句话蒸馏:一句话记住本节——数据工程的精髓不是收集更多,而是决定"谁被多读几遍"

第4章 主战场(一):闭卷问答与知识容量假说

来源:论文 §3.2 表3.3。

设定NaturalQSWebQSTriviaQA
RAG(微调+开放域检索,15.3B)44.545.568.0
T5-11B+SSM(微调,闭卷)36.644.760.5
GPT-3 Zero-Shot14.614.464.3
GPT-3 One-Shot23.025.368.0
GPT-3 Few-Shot29.941.571.2

三条读法:① TriviaQA 上 zero-shot 已超 T5-11B 微调版 14.2 个百分点,one-shot 追平带检索的 RAG,few-shot 71.2% 成为闭卷设定的新 SOTA——这是全文最响亮的单项证据;② WebQS/NQ 上 zero-shot 惨不忍睹(14% 级)但 few-shot 大幅回升(41.5%/29.9%)——作者解读为答案风格分布外移,few-shot 提供了"格式校准";③ 三个数据集上性能随模型尺寸平滑上升(图3.3),支持"参数容量≈知识存储"假说。

常见误读:"GPT-3 会答题所以有知识"。更准确的说法:GPT-3 把知识以参数形式压缩存储,闭卷成绩证明了存储的存在;但 NQ 上与 T5 的差距同样证明这种存储是有偏的——偏向高频通俗知识(TriviaQA),弱于维基细粒度知识(NQ)。"知道很多冷笑话但不熟悉教科书"是当时的真实画像。

一句话蒸馏:一句话记住本节——few-shot 的第一重价值不是学新任务,而是教老模型"这道题要什么格式的答案"

第5章 主战场(二):合成任务与能力的边界

来源:论文 §3.9,表3.9/3.10 及正文。

算术(few-shot,GPT-3 175B vs 各档)

任务2D+2D−3D+3D−4D+/−5D+/−2D×复合1DC
Few-shot100.098.980.494.225.5/26.89.3/9.929.221.3
Zero-shot76.958.034.248.34.0/7.50.7/0.819.89.8

两个关键观察:① 13B 模型两位数加减只能对一半,175B 几乎全对——能力在最后一级规模上跳变;② 错误分析显示模型常忘进位(而非背错答案),且测试题在训练数据中的匹配率仅 0.8%(加法)/0.1%(减法)——基本排除查表记忆。这是论文中少有的"机制侧写",弥足珍贵。

字符操作(few-shot,K=100)

随机插入字母还原(RI)67.2%、循环字母(CL)37.9%、易字谜(A2)39.7%、难字谜(A1)15.1%、倒序拼写(RW)≈0.4%——全军覆没于倒序。论文的解释很精彩:BPE 词元平均约 0.7 词/token,模型看到的是"词块"而非字母;做这些任务要先在内部把 BPE 结构拆开,而 RW 需要完全对称的重排,最难分解。zero-shot 下五个任务几乎全为零——证明这些确实是"现场学会"的。

LAMBADA 的方法学亮点

LAMBADA 要求预测段落末尾的最后一个词,但标准 LM 不知道"只要一个词"——它会继续往下写。旧方案用停用词过滤器打补丁;GPT-3 用 few-shot 填空格式(Alice … her friend ___. → Bob)让模型从例子里自行推断输出约定,few-shot 达 86.4%(SOTA 68.0%,+18%),困惑度 1.92。这是"in-context 格式学习"的教科书案例:同一个模型、同一份权重,仅仅改变示范格式就解锁了一个基准。

常见误读:"GPT-3 展现了涌现的推理能力"。谨慎——算术成绩随位数单调衰减(100%→80%→25%→9%),更像"逐位计算的统计近似"而非离散算法掌握;"涌现"叙事来自 13B→175B 的跳变,但跳变也可能是度量伪影(连续能力+非线性指标)。论文本身用词克制("proficiency at moderately complex arithmetic"),夸张的是二手传播。

一句话蒸馏:一句话记住本节——合成任务是照妖镜:它照出了"格式适应强、符号操作弱、规模门槛高"的三重底色

闭卷自检:GPT-3 为什么做不了倒序拼写?算术错误的主要形态是什么?LAMBADA few-shot 格式解决了什么问题?

第6章 失守的阵地与自我审查

来源:论文 §3.7 SuperGLUE、§3.8 NLI、§2.2 污染声明;§4 细节未核验。

SuperGLUE few-shot(K=32,测试集)总分 71.0:超过微调 BERT-Large 的 8 项中的 4 项,COPA 92.0 接近 T5-11B 保持的 SOTA(93.9),ReCoRD F1 91.1 近 SOTA;但 WiC 仅 49.4%=随机水平。规律:凡是"比较两个句子片段"的任务(WiC 词义比对、CB、RTE),GPT-3 都系统性偏弱。ANLI 对抗推理上,小于 175B 的模型全部停留在随机水平(~33%),175B 也只走完了从随机到 SOTA 差距的一半(图3.9)。阅读理解 RACE-h 46.8 vs SOTA 90.0——差距近半。结论:NLI 类两段比较任务是当时 in-context learning 的清晰边界。

数据污染的自我披露(§2.2,原文坦白):为防泄漏曾尝试删除与所有基准 dev/test 集的重叠,但"过滤代码中的一个 bug 导致部分重叠被忽略,因训练成本无法重训"。补救措施是 §4 的系统量化分析:多数数据集影响极小;PIQA、Winograd 等被标星号存疑;个别严重者干脆不报告。LAMBADA 有"显著少数"内容在训练集中但分析认为影响可忽略(§3.1.2)。【未核验】§4 中具体的重叠比例数字本次抓取截断,未能引用。

常见误读:"标了星号的结果等于没污染"。星号只是"作者自查后认为可控"的标记,判断依据是作者自己的分析方法——属于"自出题自批改"级别的证据。审慎读者应把 PIQA 82.8% 这类带星数字当作区间下限看待。

主张 vs 事实:【论文声称】few-shot 有时能与微调 SOTA 竞争;【实验支持】TriviaQA/LAMBADA/COPA/ReCoRD 等单项;【同样来自实验的反面】WiC/NLI/RACE/QuAC 的系统性失败——论文难得地把正反面都摆在了明面上,这在 2020 年的大模型论文中是罕见的诚实。

一句话蒸馏:一句话记住本节——GPT-3 的强弱分界线不在"难不难",而在"任务形态是否匹配自回归续写的先验"

第7章 分级自测题

  1. L1 按 2ND 口径估算 GPT-3 175B 训练 300B tokens 的总算力是多少 FLOPs?折合多少 petaflop/s-days?
    显示答案C ≈ 2×175×10⁹×3×10¹¹ = 1.05×10²³ FLOPs。1 petaflop/s-day = 10¹⁵×86400 ≈ 8.64×10¹⁹ FLOPs,故 C ≈ 1216 petaflop/s-days。(允许 ±20% 容差;论文图2.2 的口径一致。)
  2. L2 若把 Wikipedia 在训练混合中的占比从 3% 提到 30%(相应压缩 CommonCrawl),预计哪些结果会变好、哪些会变坏、哪个指标可能恶化?
    显示答案变好:NQ(维基细粒度问答,当前 29.9 vs T5 的 36.6)、RACE 类学术文体、SQuAD 系;变坏:口语/网络文体生成质量、TriviaQA 的通俗知识面(CC 是其主要来源);恶化指标:过拟合风险——Wikipedia 将从 3.4 epoch 升至约 34 epoch,记忆效应和数据污染都会加剧。(评分要点:三个方向+epoch 推算。)变式:反过来把 CC 占比拉满呢?——平均质量下降,Scaling Laws 论文的结论是小质量语料会拖慢损失下降斜率。
  3. L3 同学说:"SuperGLUE 上 GPT-3 超过了微调 BERT-Large,说明 few-shot 已经取代微调。"请用论文中的至少两组数字反驳或限定这个结论。
    显示答案反驳要点:① WiC 49.4%=随机水平,few-shot 在双句比较类任务上彻底失效——"取代"无从谈起;② GPT-3 总分 69.0(测试集)vs 微调 SOTA 92.5,差距仍巨大;③ 论文明示 K<8 例/任务才能追平 BERT-Large,说明优势来自规模碾压同一弱对手而非范式优越;④ 对手 BERT-Large 只有 340M 且未做多任务微调,比较对象偏弱(T5-11B 才是当时一线)。评分标准:每组数字+正确解读得一分。
  4. L4 仅凭摘要中的三个数字(175B 参数、10× 于先前的非稀疏模型、n_ctx=2048),推演这篇论文必须解决哪三类问题,并说明每个数字逼出了哪一类。
    显示答案175B ⇒ 显存墙:单卡放不下,必须设计模型并行方案(§2.3 的两种并行混合)+ 小学习率稳定训练(0.6×10⁻⁴);"10×于非稀疏SOTA" ⇒ 评测合法性危机:如此大的容量极易记住全网测试集,必须建立数据污染检测体系(§2.2 声明+§4 分析)并在结果中标星号;n_ctx=2048 ⇒ few-shot 的天花板:示范数量被窗口硬约束(典型 10–100 个),迫使作者设计 per-token 归一化、无条件概率归一化等多选评分协议(§2.4),也解释了为何 K 不能无限加大。(评分要点:三组对应关系各1分,逻辑链完整1分。)

三、批判性阅读

8.1 benchmark 到底测什么 & 比较公平吗

8.2 证据等级区分

证据等级备注
TriviaQA/LAMBADA/SuperGLUE 测试服务器提交较强仅限能提交的少数任务;其余多为 dev 集
8 尺度 scaling 曲线(图1.2/1.3/3.8)较强多尺度系统对照,本文方法论上最独特的资产
算术/合成任务自制基准+自评,但有训练集匹配率交叉检查
带星号结果(PIQA 82.8、Winograd 系列)中偏弱存在已确认的训练重叠,影响评估依赖作者自查
"few-shot=新兴学习方式"的机制解释主张论文脚注1明确悬置了"学习vs识别"之争

8.3 第二坐标轴:成本、效率与部署现实

论文图2.2 给出了一个惊人的效率事实:GPT-3 2.7B 与 355M 的 RoBERTa-Large 预训练算力同为约 50 petaflop/s-days——按 Scaling Laws 故意"大模型少喂 token"。这意味着 GPT-3 家族的单位算力换到的下游能力极不均匀:175B 的每一 FLOP 换到的 LAMBADA 分数远低于 2.7B。另一面:few-shot 推理每次都要在 2048 窗口内重读全部示范,无 KV-cache 复用的时代延迟成本高昂【解读者补充】。§6.3 承诺了能耗分析,但具体 MWh/CO₂ 数字位于本次抓取被截断的部分,未能核验,不作引用

8.4 论文没有告诉你什么

四、综合考核

任务一 · 重建因果链

从"单一自回归目标 + 300B tokens + 8 个尺度 + 2048 窗口"四个事实出发,推演出本文的评测设计为什么长成现在的样子(三种设定、多选似然评分、归一化变体、污染星号)。

显示参考答案与评分标准链条:单一自回归目标⇒无法像 BERT 那样输出分类 logits,一切任务必须改写成"续写/选哪个候选概率高"⇒于是有多选似然评分与长度归一化;ARC/OpenBookQA/RACE 上发现长度归一化不够还要除以无条件概率(§2.4)——这是评测设计被目标形态倒逼的直接证据。8 个尺度⇒必须控制每档训练预算一致才能画 scaling 曲线⇒300B tokens 统一定额+按尺寸配 batch/lr。2048 窗口⇒few-shot 示范数受限⇒K 成为需要在 dev 上扫描的超参。300B tokens 混入全网语料⇒测试集必然混入训练分布⇒污染检测+星号制度。评分要点:四条推演各1分,指出"评测协议是被架构与数据共同决定的"这层元认知得1分。

任务二 · 数字总对账

  1. ① 4829 亿 token 库容 vs 300B 训练量与表2.2 epoch 列;② 12·L·H² 估算 vs 175B/13B 声称值;③ 图2.2 "2.7B≈RoBERTa-Large≈50 pf-days" 与 2ND 公式复算;④ TriviaQA zero-shot 64.3 与"超出 T5-11B 14.2"的声称(T5 为 50.1);⑤ WiC 49.4% 与二分类随机水平 50%。
显示答案① 加权平均 epoch ≈ 0.60×0.44+0.22×2.9+0.08×1.9+0.08×0.43+0.03×3.4 ≈ 1.15?——注意应按各自占比独立核对:每列"占比×tokens"之和应等于 300B:0.60×4100+0.22×190+…= 2460+41.8+96+44+90 ≈ 2732 亿 ≈ 300B(±9%,因占比为抽样比例的取整)✓ 合理。② 173M 亿级吻合 ✓(见第2章手算)。③ 2×2.7×10⁹×3×10¹¹=1.62×10²¹≈19 pf-days,与"约50"不符 ✗——对不上!可能原因:论文图2.2 的 RoBERTa 训练 token 数远多于 300B(原始 RoBERTa 训练至约 2.2 万亿 token 级别的 BPE 计数口径不同),且 2.7B 模型实际训练 token 数并非 300B(图2.2 展示的是各模型达到最优计算分配时的实际用量,小模型本应训练更多步)。此处的教训:表2.1 说"所有模型都训练 300B",而图2.2 的算术暗示各模型实际计算量不同——两处叙述存在张力,引用时应注明。【解读者推断】④ 64.3−50.1=14.2 ✓。⑤ 49.4≈50% ✓,"随机水平"的定性成立。

任务三 · 设计决策答辩

  1. 不做微调评测:为什么?代价是什么?
    参考答案为什么:聚焦任务无关性能+避免"窄分布过拟合夸大能力"的问题(§2 FT 段落列出的缺点);成本上也省去了 8 个尺度的微调开销。代价:留下"few-shot 是否只是劣化版微调"的根本质疑无人回答;且使部分比较(如 SuperGLUE)先天不对称。论据强度:立场声明充分、实验论证缺位——★ 级。
  2. 交替稠密/局部稀疏注意力:解决什么、新增什么、有没有消融?
    参考答案缓解 2048 长度下 O(n²) 注意力的计算压力;新增实现复杂度与"哪些层用哪种"的设计自由度;论文未给消融,理由是引用 Scaling Laws 的"结构不敏感"结论——把消融责任外包给了前置工作,严格说不满足自证闭环。
  3. 高质量数据过采样(Wikipedia 读 3.4 遍):为什么不干脆扩大 CC 清洗力度?
    参考答案清洗 CC 到 Wikipedia 质量的边际成本极高(45TB→570GB 已是 98.7% 的丢弃率);过采样是"接受可控过拟合换质量"的廉价替代。债:重复暴露加剧了对评测集的记忆(尤其维基系基准),这正是污染问题的放大器之一——§2.2 的 bug 只是显性原因,过采样策略是结构性原因【解读者推断】。
  4. 污染结果用星号而非剔除:这个披露方式的得失?
    参考答案得:保留了信息量,读者可以自行折价;开创了大模型论文的透明度惯例。失:星号的判定权在作者手中,"影响可忽略"缺乏外部审计路径;个别数据集"干脆不报告"则造成幸存者偏差——读者永远不知道还有哪些没报。理想做法(事后学界共识):报告去污子集与全集的双份分数。

任务四 · 证据审计

显示读后修正贡献1(in-context 随规模增长):维持 ★★★——8 尺度多任务的一致趋势是全文最接近"定律"的证据。贡献2(TriviaQA 超 RAG):维持 ★★★,测试服务器评分+设定差异已被论文如实标注。贡献3(LAMBADA +18%):维持 ★★★,且方法学创新(格式即指令)值得单独记账。贡献4(few-shot 范式主张):从 ★★ 修正为 ★★☆——正反两面证据都充分呈现(WiC/ANLI 失败反而增强了可信度),但机制问题依旧悬置。贡献5(污染自律):降为 ★☆——bug+无法重训+自查自证三重折扣。贡献6(涌现叙事源头):维持 ★★,但审计提醒:13B→175B 跳变出现在"逐位运算"类任务上,与其说是涌现不如说是"近似算法的误差率跨过阈值"【解读者观点】。总评:这是一篇把"正面成绩单"和"负面试卷"一起交上来的罕见论文——它最大的可信度恰恰来自那些没做出来的分数。