← 总目录 / 板块五 · 2022年以来最重要的10篇
板块五 · 模型的范式变迁

第39篇 · GPT-4 Technical Report

一份以"没说什么"闻名的技术报告——以及它唯一说透的那件事:可预测扩展
GPT-4 Technical Report · OpenAI · 2023 · arXiv:2303.08774

本页标注约定:【论文声称】=作者叙事,未必有独立证据;【实验支持】=文中有数据支撑;【解读者推断/补充】=精读者的话,不来自论文。所有数字均复述自报告原文(arXiv HTML v6),未做外部验证;凡原文只在图中给出而正文无数值处,均已明确标注。

一、全局大图

1.1 这份报告是什么、不是什么

先纠正一个定位错误:GPT-4 Technical Report 不是一篇研究论文。研究论文的标准动作是"提出方法—给消融—让社区复现",这份报告一个都没做。只是主张 它更像一份"产品发布 + 安全评估声明 + 一篇被塞进去的真正有技术含量的短论文(§3 可预测扩展)"的混合体。

报告自己在 §2 "Scope and Limitations of this Technical Report" 中正式声明:鉴于竞争格局和安全影响,"本报告不包含关于架构(包括模型大小)、硬件、训练计算量、数据集构建、训练方法的更多细节"。这句话是理解全文的钥匙——你要按"审一份信息披露文件"的方式读它,而不是按"学一个新方法"的方式读它。

1.2 摘要拆解 → 章节导航对照表

摘要中的短语对应原文章节对应本页精读章节
"大规模多模态模型,接受图像和文本输入"§1 引言、§4.1 Visual Inputs、附录G第四章 · 能力章
"在专业与学术基准上达到人类水平(模拟律师考试约前10%)"§4 Capabilities 表1、附录A 考试方法学第三章 · 成绩表精读
"基于 Transformer,预训练目标是预测下一个 token"§2 范围与限制(唯一披露的架构信息)第二章 · 报告的范围声明
"后训练对齐提升事实性与行为遵从"§5 局限、附录B RLHF对能力的影响、§6 风险与缓解第五、六章
"基于计算量不超过 GPT-4 的 1/1000 的模型即可预测其部分表现"§3 Predictable Scaling(全文核心)第二章 · 重点精读

1.3 主要贡献与证据强度预评

#声称的贡献证据预评理由
1GPT-4 在多项专业/学术考试达到人类水平强实验支撑(但属自评)表1给了几十场考试的分数与百分位;但考题选择、prompt配置均为OpenAI内部设定,属"作者自出题自批改"性质
2可预测扩展:小模型可预测 GPT-4 的损失与部分能力仅有图示,无数值细节§3是全文最硬的技术内容,但关键预测精度只有曲线图(图1、图2),正文未给误差数字
3多模态能力与纯文本相当只是主张+示例§4.1仅给定性描述和示例(表3),没有系统性的图文对比评测
4安全性改进(违禁内容响应降82%等)内部评估支撑§6数字来自OpenAI内部对抗性评测与RealToxicityPrompts;红队流程描述了但不可复核
5幻觉比GPT-3.5降低19个百分点九项内部评估§5,评估集为内部对抗性设计的事实性评测,外部无法验证

1.4 推荐阅读路线

必读主线(约40分钟):§2 范围声明(1页,逐字读)→ §3 可预测扩展(全文精华)→ §4 表1表2(配合本页数字对账)→ §5 局限。

可跳读支线:§4.1 视觉输入(定性示例);附录A 考试方法学(写代码复现评测时才需要)。跳读代价:不看附录C/D的污染分析,你会误把表2的分数当成"干净"的成绩——GSM-8K 的训练集其实部分混入了预训练数据(附录E),BIG-bench 因污染被整体剔除(附录D)。

不建议跳过:§6 风险与缓解里的 RBRM 设计——它是后来"规则奖励 vs 神经奖励模型"路线之争的先声(见第40篇 DeepSeek-R1 的对照)。

二、逐章精读(上):范围声明与可预测扩展

2.1 §1–§2 引言与范围声明:一次精心设计的"少说"
来源:论文 §1–§2(第1–2页);本节解读为解读者补充

失效模式先行:这一章要解决的"问题"不是技术问题,而是披露义务问题——既要发布足够的信息维持学术公信力和安全讨论,又不能给竞争对手提供可复现的配方。报告的处理方式是把限制本身写成一章。

学完本节你应能: 说出报告正式披露的全部架构信息(一句话:Transformer 风格 + 下一 token 预测 + RLHF 后训练,仅此而已); 解释为什么"接受独立审计"的承诺和"不披露细节"的决定可以并存; 指出"竞争格局"和"安全影响"这两个理由各自的合理性与漏洞。

类比在哪里失效:把这份报告类比为"论文的预告片"并不准确——预告片会剧透情节,而这份报告刻意隐藏主角(参数量)和剧本(数据配比)。更准确的类比是一份上市公司的合规披露文件:披露的是结果与风险,不是工艺。

常见误读:很多人说"GPT-4 是 MoE",参数量 1.76T 等——这些全部不在报告里,属于后来的媒体报道与分析推测,报告原文从未提及。本页只承认报告原文披露的内容。

闭卷自检:不看材料,我能列出报告中关于 GPT-4 架构的全部信息吗?我能复述 §2 拒绝披露的完整清单吗?

2.2 §3 Predictable Scaling:全文唯一"像论文"的一章(重点精读)
来源:论文 §3.1–§3.2(第2–4页);类比与手算为解读者补充

失效模式先行:训练一个前沿大模型是一次性投入数月算力的豪赌——你不可能训完再发现不行重来。如果超参、数据配比或基础设施有任何问题,发现时已经烧掉了几千万美元。GPT-3 时代的做法是小模型试错后直接放大,风险在于"小模型上的规律在大尺度上是否保持"无人担保。GPT-4 项目给出的答案是:把"预测最终模型的性能"本身做成一项工程纪律。

学习目标:学完本节你应能——①写出两个预测公式并说明各自的自变量;②解释为什么用"内部代码库的损失"而不是公开 benchmark 做预测指标;③复述 HumanEval 外推实验的难度桶设计与最容易桶的反常结果;④说清哪些预测在训练开始前注册、哪些没有。

公式手术一:损失预测

L(C) = a·Cb + c
符号它是什么直觉
L(C)训练计算量为 C 时模型在某固定数据集上的最终损失"花多少钱能买到多少损失"
C训练计算量(非参数量)横轴,跨数量级扫描
a, b幂律拟合参数(b<0)b 是"每翻一倍算力损失下降多少"的斜率
c不可约损失项(irreducible loss)数据的固有熵——语言本身的不确定性,再多的算力也压不掉

张量形状/维度:标量对标量的拟合,无维度流;关键是 C 跨越的数量级——拟合用的模型计算量最多比 GPT-4 小 10,000 倍。

三个容易被忽略的实验设计细节(都来自 §3.1 原文):① 拟合所用的小模型"使用相同的方法论训练"——保证外推的是规模而非配方变化;② 验证集选了 OpenAI 内部代码库的一个大型代码 token 数据集,理由是方便、量大、且确定不属于训练集——这是防污染的自觉动作;③ 选 loss 而非其他指标,因为 loss 在不同训练计算量下噪声最小。④ 报告称预测在训练开始后不久做出、未使用任何部分训练结果。

数字强迫(此处诚实交白卷):"accurately predicts GPT-4's final loss with high accuracy"——报告正文没有给出预测误差的具体数值(只有图1的对数坐标曲线,图上数值未能从HTML版核验)。"高精度"是一个定性词。这是本节最大的信息缺口:我们无法从文本判断预测误差是 0.5% 还是 5%。解读者推断:对一个跨越四个数量级的外推而言,哪怕 5% 也足以证明幂律在该区间成立;但"足以证明"与"论文证明了"是两回事。

公式手术二:HumanEval 能力外推

−EP[log(pass_rate(C))] = α·C−k
符号它是什么直觉
pass_rate(C)计算量为 C 的模型在某题子集上的通过率注意是对每道题分别建模,不是总通过率
PHumanEval 题目的一个子集按小模型表现分成 6 个难度桶之一
α, k正常数k 控制能力随算力增长的速度
−log(·)对通过率取负对数再取均值把 (0,1) 区间压缩到正实数轴,使幂律关系成立;pass_rate→0 时 −log→∞

手算验证(费米估算,解读者补充):设某难度桶中一道题,小模型(C/1000)通过率 p₁=1%,则 −log(0.01)≈4.61。若外推幂律使 −log(p₂) 缩小到约 1.11,则 p₂=e−1.11≈33%——也就是说,算力 ×1000 大致对应这道题的通过率从"百次对一"升到"三次对一"。这正是图2展示的第3容易桶的行为模式:GPT-4 对它的预测"非常准确"。

实验设计中最值得学的两笔:① 把 HumanEval 除 15 道最难题外的题目按小模型表现分为 6 个难度桶,分桶外推而非全体外推——因为混合难度的聚合通过率不服从单一幂律;② 只统计"每个小模型在大样本预算下至少解出一次"的题目,避免对极低通过率做不可靠估计。反常结果必须点名:其余五桶几乎同样好,唯一的例外是最容易的桶——GPT-4 的实际表现低于预测值。作者未深究原因。【解读者推断】可能机制包括:简单题上模型"想多了"(过度生成)、或简单题的失败模式(粗心)不随规模单调改善——但这只是推断,论文未验证。

注册预测(pre-registration):报告强调 HumanEval 预测在训练完成前注册、只用训练前可得信息;并引用 Hindsight Neglect 任务作为反面教材——该任务上小模型随规模变大反而变差(inverse scaling),GPT-4 扭转了趋势(对比 ada/babbage/curie 等 API 模型,图3)。这说明不是所有能力都可正向外推,可预测性本身是有边界的——报告对此相当坦诚。

常见误读:① "可预测扩展=Scaling Laws 的重复"——错。Kaplan/Chinchilla 预测的是训练损失(代理指标),这里更进一步预测 pass rate 这类离散能力指标,工程难点完全不同(低概率事件的方差问题);② "既然可预测就不用再训大模型了"——方向反了,预测的目的恰是敢于押注大模型;③ "1000×–10000×"是同一个数——不是,§3.1 用 10000× 以内的模型拟损失,§3.2 用 1000× 以内的模型外推 HumanEval,两个口径不同,引用时要分开。

一句话记住本节:GPT-4 项目最重要的技术创新不是模型本身(未披露),而是"用千分之一算力的模型族提前预测旗舰模型的表现"这套可审计的工程纪律。

三、逐章精读(中):成绩表的证据学
来源:论文 §4 Capabilities、附录A/C/D/E(第5–7页及附录);批判视角为解读者补充

学习目标:学完本节你应能——①凭记忆报出 GPT-4 与 GPT-3.5 在 bar exam、MMLU、HumanEval、GSM-8K 上的四组关键数字;②指出考试评测的两条公平性规则(去除污染变体取较低分、无针对性备考);③解释 GSM-8K 星号背后的污染问题。

失效模式先行:评测一个新模型最疼的问题不是"跑分低",而是"分数不可信"。两个经典坑:考题混进训练集(污染),以及 prompt 配置不对称(自己模型精心调优、基线裸跑)。报告在这两点上有超出同期水平的自觉,值得逐条看它怎么处理。

3.1 表1精选:考试类成绩

考试GPT-4GPT-3.5人类百分位(GPT-4)
Uniform Bar Exam(律师资格)298/400213/400≈90%
LSAT163149≈88%
SAT 数学700/800590/800≈89%
GRE Quantitative163/170147/170≈80%
USABO 半决赛(生物奥赛)87/15043/15099–100%
AP 微积分 BC4 分1 分43–59%
AMC 12 202260/15030/15045–66%(外推,不确定性大)
Codeforces Rating392260低于5%

数字对账:298/400 = 74.5% 的原始正确率对应约90百分位——bar exam 通过线通常在 ~65%(约260/400)附近,GPT-3.5 的 213/400(53.3%)落在不及格区。两者相差 85 分,即约21个百分点的原始分差,却对应80个百分位的人群差距——考试分数在中段密集、尾部稀疏,这正是"百分位"比"原始分"更能传达差距的原因。最扎眼的一项是 Codeforces:竞赛编程 rating 仅392、低于5%考生——与同表中"律师考试前10%"形成刺眼对比。附录A补了一个细节:模拟赛约50%的场次解题数为0导致均衡ELO为0,单场最高均衡ELO约1300;平均392是悲观口径。

3.2 表2精选:传统NLP基准

基准(few-shot设置)GPT-4GPT-3.5此前LM最佳含任务特定调优的SOTA
MMLU(5-shot)86.4%70.0%70.7%(U-PaLM)75.2%(Flan-PaLM)
HellaSwag(10-shot)95.3%85.5%84.2%(LLaMA)85.6(ALUM)
Arc-Challenge(25-shot)96.3%85.2%85.2%(PaLM)86.5%(ST-MoE)
HumanEval(0-shot)67.0%48.1%26.2%(PaLM)65.8%(CodeT+GPT-3.5)
Drop(3-shot F1)80.964.170.8(PaLM)88.4(QDGAT)——唯一未超越项
Gsm-8K(5-shot CoT)92.0%*57.1%58.8%(Minerva)87.3%(Chinchilla+微调)

数字对账二则:① MMLU 上 GPT-4 相对 GPT-3.5 提升 16.4 个百分点(86.4−70.0),相对提升约23%;而 GPT-3.5 与此前 LM 最佳(70.7%)几乎持平——这说明 GPT-4 的跳跃主要来自模型代际差,不是 few-shot 设置技巧。② GSM-8K 带星号:附录E 承认预训练数据混合中含有部分 GSM-8K 训练集——这个星号是全文少见的自我污点标记,读到表2却不读附录E的人会把 92% 当成干净数字。

两条公平性规则(§4 正文):考试用后训练(RLHF)模型、未做任何针对考试的备考训练;少数考题在训练中被见过,因此对每场考试同时跑"去除污染题"的变体,两个分数取较低者上报。传统基准做了污染检查,BIG-bench 因部分混入训练集被整体剔除。【实验支持】这两条规则在当时的工业界报告中罕见地严格。

多语言能力(引言与附录F):将 MMLU 用 Azure Translate 机翻成26种语言测试,GPT-4 在 24 种语言上超过英文SOTA,包括拉脱维亚语、威尔士语、斯瓦希里语等低资源语言。注意方法学弱点:机翻质量本身是混杂变量,报告未报告翻译错误率。

指令遵循:在 5,214 条来自 ChatGPT/OpenAI API 的提示上,标注者在 70.2% 的提示上偏好 GPT-4 而非 GPT-3.5。证据等级:内部偏好评测,标注者构成与一致性指标(如 agreement rate)报告未给出。

一句话记住本节:表1表2的数字本身可信度尚可(取污染变体较低分的规则加分),但它们全部出自 OpenAI 自己设定的评测框架——"考得像人类"与"能当人类用"之间仍有距离。

四、逐章精读(下):视觉输入、局限与风险
来源:论文 §4.1、§5、§6、附录B/H;评述为解读者补充

4.1 §4.1 视觉输入:最薄的一章

全文对多模态的技术性陈述到此为止:接受图像与文本交织输入、输出文本;"在文档、图表、截图等领域表现出与纯文本相当的能力";标准测试时技术同样适用。示例只有一个著名的幽默案例——识别"Lightning 线缆包装盒上印着 VGA 接头插手机"的三格漫画笑点。只是主张 没有任何图文联合 benchmark、没有任何消融。"与纯文本相当"这六个字承载了整个多模态故事,是全文证据密度最低的主张。

4.2 §5 局限:诚实的自我批评

幻觉:在九项内部对抗性事实性评估上,GPT-4 比最新版 GPT-3.5 高 19 个百分点(图6)——但报告没有给出绝对水平(GPT-4 到底错多少),只给了相对改进。TruthfulQA:base 模型仅略优于 GPT-3.5,RLHF 后大幅改进,超过 GPT-3.5 和 Anthropic-LM;报告同时如实交代了两件事——RLHF 后训练数据未做 TruthfulQA 污染检查,以及模型仍会漏掉细节错误(Elvis Presley 例:正确答案应为 Perkins 之子,模型答成演员之子)。校准:这是全章技术上最有意思的一条——预训练模型校准度很高(置信度≈正确率),但后训练显著损害了校准度(图8,MMLU 子集校准曲线)。【解读者推断】这意味着 RLHF 让模型"说话更笃定"的同时失去了"知道自己不知道"的能力——安全收益与认知谦逊存在内在张力。知识截止:普遍缺乏2021年9月之后的事件知识,且不从经验中学习。

4.3 §6 风险与缓解:RBRM 值得一读

三层结构:①专家红队——超过50名覆盖AI对齐、网络安全、生物风险、国际安全的领域专家做对抗测试,结论回流到训练数据(如强化拒绝"如何在家合成危险化学品"类请求)。②RLHF+规则奖励模型(RBRM)——基础仍是RLHF,但额外加入一组零样本 GPT-4 分类器充当评分器:输入提示、策略模型输出、人工撰写的评分规则,输出四分类(期望的拒答/不当拒答/违禁内容/安全的非拒答回复),从而"有害请求上奖励拒绝、安全请求上奖励不拒绝"——专治RLHF的过度谨慎。③部署期措施——滥用监控与快速迭代,并坦承模型级干预不能杜绝越狱。

安全指标数字(均为内部评估):相比 GPT-3.5,对违禁内容请求的响应倾向降低 82%;按政策响应敏感请求的比例提高 29%;RealToxicityPrompts 上有毒输出比例 0.73%(GPT-3.5 为 6.48%)。【解读者观点】RBRM 与两年后 DeepSeek-R1"拒绝神经奖励模型、坚持规则奖励"的选择遥相呼应(见第40篇)——两边从相反的动机出发摸到了同一块石头:神经奖励模型会被 hack,规则不会。

一句话记住本节:§5–§6 是这份报告的第二重价值——它把"局限"与"缓解"写成正式章节的做法,为此后的前沿模型报告(含系统卡文化)立了模板。

五、批判性阅读

5.1 每个 benchmark 到底测什么

基准名字暗示实际测的是什么误导风险
MMLU"大学水平知识"57学科选择题的正确选项匹配可被知识记忆+排除法刷高;不测推理链
Uniform Bar Exam"律师资格考试"MBE选择题+MEE论述+MPT文书三部分合成美国各州通过线差异大,"top 10%"依赖百分位换算假设
HumanEval"编程能力"164→实际164题中除15题外的Python函数合成的单元测试通过率题量小(164题),单题权重≈0.6%,置信区间宽
GSM-8K"数学推理"小学应用题最终答案正确率(带CoT提示)本题库已确认部分进入训练集(附录E)

5.2 比较是否公平

三条加分:污染变体取较低分;BIG-bench 主动剔除;基线(GPT-3.5)同为自家模型、设置对称。三条存疑:① "人类百分位"是换算出来的二手统计,不同考试的考生分布差异巨大,跨考试横向比较百分位没有意义;② Codeforces 的悲观口径(平均392)与考试的中性口径(直接报分)并列在同一张表里,读者未必注意到口径不一致;③ 多语言MMLU用机翻,翻译质量未控制。

5.3 第二坐标轴:成本与延迟

全文零成本数据:无参数量、无训练FLOPs、无推理价格、无吞吐延迟。"达到人类水平"的所有表述都不携带任何成本限定词。对比第38篇 LLaMA(明确以"7B~65B、单卡可跑"为卖点)可以看到两种截然相反的报告哲学:LLaMA 把效率当地位,GPT-4 把保密当地位。读者应养成习惯:不带第二坐标轴的能力声明,默认应打折扣

5.4 论文没有告诉你什么(本页核心章节)

以上清单本身就是这篇报告的"负空间画像":它的信息量分布极不均匀——§3 有真东西,其余大部分是结果公告。

六、综合考核

6.1 重建因果链

仅从摘要两个短语出发——"计算量 1/1000 即可预测部分表现"+"专业考试达人类水平"——推演该项目必须在开工前解决哪三类问题。(参考要点见答案折叠块。)

参考要点

评测基建先行:要在训练完成前就"知道"旗舰模型多强,必须有干净的、不被训练集污染的验证集(所以 §3.1 选了内部代码库)和可分难度桶的能力指标协议(所以 §3.2 发明难度桶+注册预测)。②跨尺度的训练稳定性:小模型族的规律要能外推,前提是从 1/10000 到 1x 用同一套方法论训练(否则拟合的是"配方差异"而非"规模规律")——这就是摘要里"跨尺度行为可预测的基础设施与优化方法"的含义。③对齐与安全的流水线前置:目标包含"行为遵从",意味着 RLHF/RBRM 数据管线必须与大模型预训练并行准备,且要有红队机制在发布前兜底(§6 的50人专家红队)。

6.2 数字总对账

  1. 298/400 ≈ 74.5%,213/400 = 53.25%,分差 85 分——与"约90百分位 vs 约10百分位"的叙述是否自洽?(见 §3.1 的对账。)
  2. HumanEval 67.0% 对 GPT-3.5 的 48.1%,相对提升 (67−48.1)/48.1 ≈ 39%;而 MMLU 相对提升约23%——两榜增幅不同,能否据此说"编程能力的代际跃迁大于通识"?需要注意 HumanEval 只有164题、0-shot,方差更大。
  3. 有毒输出 0.73% vs 6.48%:比值约为 1/8.9,即下降约 88.7%——报告口径却说"82%"的是另一项指标(违禁内容响应倾向),两个"下降百分比"指代不同,引用时极易混淆。

6.3 设计决策答辩(挑3个)

  1. 为什么不披露参数量?答辩要求:分别站在"竞争防御""安全治理""科学透明"三方立场评估该决定,并指出报告承诺的替代机制(独立审计)为何不足以补偿透明度的损失。
  2. 为什么损失预测用内部代码库而不用公开 held-out 集?(提示:污染可控性 vs 社区可比性。)
  3. 为什么考试评测选择"去污染变体取较低分"而不是只报干净子集分数?(提示:两种口径对外部读者的含义有何不同?)
参考答案(要点)

1) 竞争立场:防止对手直接复现配方,同时保留"能力领先"的市场信号——理性。安全立场:外部无法评估风险,只能信任厂商自查——弱。透明立场:与学术规范冲突,但报告用 §3 的方法论披露+承诺审计做了部分补偿。评分要点:能区分三种立场的利益冲突(60%)、能指出审计不可替代复现(40%)。

2) 内部代码库三大优点:确定不在训练集、体量大(低方差)、代码 token 的损失与能力相关性较好;代价是不可与外部论文横向比较。评分要点:三点优点各占一档,能主动说出"牺牲可比性"这一代价为佳。

3) 取较低分是对"污染不可完全识别"的保守修正,向读者传递的是性能下界;只报干净子集会让样本量变小、代表性变差,还可能被质疑选择性报告。评分要点:说出"下界语义"(50%)+"子集代表性问题"(50%)。

6.4 证据审计(回看 §1.3 预评)

贡献预评读后修正理由
考试成绩强实验支撑(自评)维持,但加注"取较低分"规则后可信度上调附录A方法学比预期严格
可预测扩展仅有图示维持★★读完仍无量化误差;但其难度桶设计与注册纪律的方法论价值高于数字本身
多模态只是主张下调至"示例级"全章仅一例漫画,连定性评测表都没有
安全指标内部评估维持,加注 RBRM 设计合理性RBRM 思路在后续工作中被反复验证有效

七、分级自测题

参考答案与评分标准

L1-1:67.0% / 86.4%;48.1% / 70.0%(§4 表2)。全对满分,错任一扣半。
L1-2:10000倍(损失拟合,§3.1);1000倍(HumanEval 外推,§3.2)。两数不可互换。
L2-1:−log(0.001)≈6.91;若外推使其降到 2.3 左右,则 p≈e−2.3≈10%,即通过率大约升一到两个数量级(10%量级)。误差源:幂律在小样本桶上的拟合方差、"至少解出一次"筛选带来的幸存者偏差、164题总量太小导致的抽样误差。给分:数量级判断50%,误差源各点累计50%。
L2-2:因为 loss 连续、噪声小、不受 prompt 格式与判分规则影响(§3.1)。迁移:应选连续型代理指标(如该领域的困惑度或连续评分),而非离散通过率;若必须用通过率,需加大采样预算并分难度分层。给分:说出"低噪声/连续性"(60%),迁移方案合理(40%)。
L3-1:评分标准(开放题,建议交LLM裁判,按要点给分):①n-gram级污染检测漏掉改写过的真题(召回不足)→ 干净子集仍含变相泄漏;②"取较低分"只在两套已知变体内取min,若两套都漏检同一批污染题,min仍是虚高;③考题年份与训练截止的重叠窗口。构造出"检测召回率<100% ⇒ 下界并不下界"的论证链条为核心给分点。
L3-2:机制A"过度思考":简单题上长CoT引入多余分支反而出错——证伪实验:强制短回答(限制生成长度)看简单桶是否回升。机制B"粗心型错误不随规模改善":错误集中于格式/抄写失误而非推理——证伪实验:人工分类错误类型,检验两类错误随规模的变化斜率是否不同。给分:每种机制需含"机制+可操作证伪实验"两要素。
L4:评分要点:①指出两者的共同对象都是"无法一次性验证的超大规模决策"(30%);②可预测扩展把"要不要花大钱"拆成小模型上的可注册验证,安全流水线把"能不能发布"拆成红队/RBRM的可迭代验证(40%);③能进一步指出边界差异:前者处理的是统计规律(可用幂律压缩),后者面对的是对抗性行为(无幂律可依,只能靠过程纪律)(30%)。