← 总目录 / 板块三 · 语言模型的发展
板块三 · 语言模型的发展

第25篇 · InstructGPT

当"预测下一个词"不再等于"听懂人话":用人类反馈把 175B 的鹦鹉调教成 1.3B 就能打赢的助手
Training language models to follow instructions with human feedback · Ouyang et al., OpenAI · 2022 · arXiv:2203.02155

本页所有数字均复述自论文原文(arXiv:2203.02155),未做外部验证;凡标有【解读者推断】或【解读者补充】的内容不来自论文。证据强度徽章:强实验支撑=主实验+消融都有;仅有消融/部分证据只是主张

一、全局大图

1.1 摘要拆解:摘要—原文—精读对照导航

摘要短语单元对应原文章节本页章节
"变大并不天然使其更善于遵循用户意图……未对齐"§1 引言第二章
"从标注者编写的提示和 API 提交的提示出发,收集演示数据"§3.2 数据、§3.4 Step 1、附录 A.3第三、四章
"收集模型输出排序数据集……通过人类反馈强化学习进一步微调"§3.3、§3.4 Step 2–3第五、六章
"1.3B 参数的 InstructGPT 输出优于 175B GPT-3,尽管参数量少 100 倍"§4.1、图 1/3第七章
"真实性提升、有毒输出减少、公开 NLP 性能回退极小"§4.2第八章
"仍会犯简单错误……有希望的方向"§4.3、§5 讨论第九、十章

1.2 主要贡献与证据强度预评

#论文声称的贡献预评证据强度依据
11.3B InstructGPT 输出优于 175B GPT-3(少 100 倍参数)强实验支撑§4.1 主结果+held-out 标注者交叉验证(§4.1)
2RLHF 提升真实性与无害性(幻觉减半、毒性降约 25%)部分证据§4.2 有正文数字,但毒性优势依赖提示设置,偏见维度无改善
3RLHF 是"低对齐税"技术(PPO-ptx 缓解公开 NLP 回退)强实验支撑§4.2.4 消融:ptx vs 调大 KL 系数两条路线对比
4公开 NLP 数据集不能代表真实用户需求强实验支撑§4.1 FLAN/T0 基线对决(73.4±2% vs 26.8±2%/29.8±2%)+API 用例分布统计
5指令遵循能力泛化到训练分布外(外语、代码)定性为主§4.3 仅定性示例,无系统量化
6该方法能"对齐人类意图"只是主张§5.2 作者自己承认只对齐了约 40 名标注者群体的偏好

1.3 推荐阅读路线

必读主线:§1 引言 → §3.4 三步法(本文第五、六章是全文枢纽——奖励模型与 PPO 目标函数被后续所有结果依赖,值得慢读)→ §4.1 主结果。
可跳读支线:§2 相关工作(读 FLAN/T0 一段即可);附录 C 训练细节可在复现时再查。
跳读代价:跳过 §3.4 Step 2 的 RM 训练技巧(K 个响应打包成一个 batch 元素),你将无法理解第七章"为什么 RM 验证准确率只有约 70% 却够用";跳过 §4.2.4 对齐税消融,你会误以为 RLHF 是免费午餐。

二、问题与总路线:目标错位(§1)

来源:论文 §1(第 1–2 页);类比为本页解读者补充。

学习目标

学完本章你应能:①用一句话说清"目标错位"(misalignment)指什么;②说出 3H 对齐目标的出处与含义;③解释为什么不直接把预训练损失改成"有帮助程度"。

失效模式先行

GPT-3 的训练目标是预测网页文本的下一个词,这个目标和"帮用户完成任务"之间没有任何机制保证一致。【论文声称】语言模型可能生成不真实、有毒、无帮助的输出——因为模仿网页分布的模型只会续写"互联网上最可能出现的下一句",而不是"对你最有用的下一句"。更微妙的是:模型架构完全有能力执行指令(提示工程可以部分激发),但默认行为不受控。

直觉与类比

类比:GPT-3 像一个背下了整座图书馆的人,你问他问题,他倾向于"背诵下文"而不是"回答你"。RLHF 就是给这位图书管理员做岗前培训——先看金牌员工怎么做(示范→SFT),再让他做选择题并纠正口味(比较→RM),最后按口味打分上岗实习(PPO)。

类比在哪里失效:人类培训中"打分标准"由理解标准的人执行;RLHF 中打分器是一个从有限比较数据学出来的 6B 小模型,它会把"看起来像高分答案"误判为"高分答案"——这正是第六章 KL 惩罚存在的原因。培训不会让学员学会钻空子,但 RL 会(reward hacking)。

对齐目标采用 Askell et al. (2021) 的 helpful / honest / harmless(3H)【论文声称】。注意三者在真实数据里会冲突(例如"帮我写一封骗人的邮件"),论文的处理方式是把裁决权交给标注者的偏好排序,而不是显式建模冲突。

一句话记住本章:预训练优化的是"像互联网",不是"对你有用";RLHF 用人类偏好把这个缺口补上。

三、数据:约 40 名标注者与三个数据集(§3.2、§3.3、附录 A.3)

来源:论文 §3.1–3.3 与附录 A.3/Table 6;成本换算为【解读者补充】。

学习目标

学完本章你应能:①报出三个数据集各自的用途与规模;②手算 SFT/RM/PPO 数据集的构成加法;③说出三条防止数据泄漏/重复的清洗规则。

失效模式先行

如果训练提示都由研究者自己编写,模型只会应对"研究者想象中的任务"。如果直接抓网上指令数据集(如 FLAN),任务分布又偏向可自动评测的分类/QA——第七章会用胜率证明这条路走不通。所以本文的提示来源必须是真实用户的 API 流量

三个数据集(Table 6,附录 A.3)

数据集用途训练提示数构成(labeler + customer)
SFT 数据监督微调12,72511,295 标注者写 + 1,430 客户提交
RM 数据奖励模型33,2076,623 标注者写 + 26,584 客户提交
PPO 数据强化学习提示31,144仅客户提交(API)

数字对账①:11,295+1,430=12,725 ✓;6,623+26,584=33,207 ✓。SFT 集标注者写的占比高(88.8%),PPO 集全是真实客户流量——因为 PPO 只需要提示,不需要人工示范/标注,可以直接吃生产流量。

清洗规则:按公共前缀去重、每用户 ID 限 200 条、train/val/test 按用户 ID 划分(防同一用户横跨集合)、过滤 PII。数据集超过 96% 为英语(langid 分类器判定约 110k 条中 96%,作者估计实际可能达 99%)【§3.2 及附录 A】。

API 提示的真实用途分布(Table 2,RM 数据集)

用例GenerationOpen QABrainstormingChatRewriteSummarizationClassificationOtherClosed QAExtract
占比45.6%12.4%11.2%8.4%6.6%4.2%3.5%3.5%2.6%1.9%

数字对账②:十项之和=99.9%(四舍五入误差)。分类+QA 类合计约 18%,开放式生成+头脑风暴约 56.8%≈57%,与正文"about 18%"和"about 57%"的表述吻合 ✓。这张分布表是第八章"公开 NLP 数据集不代表真实用途"论证的地基。

常见误读

误读1:"InstructGPT 用了海量人类反馈数据。"实际上 SFT 只有约 1.3 万条示范、RM 约 3.3 万条提示——相对预训练语料是九牛一毛,这恰恰是第五章"对齐很便宜"结论的前提。误读2:"标注者是众包大众。"实际是经筛选测试选拔的约 40 名承包商(多为美国/东南亚英语使用者,§5.3),一致性高但代表性差。

一句话记住本章:三个小而干净的数据集(13k 示范 / 33k 比较 / 31k 提示)撑起了整个对齐流程——对齐贵在组织人力,不在算力。

四、Step 1 · SFT:示范学习(§3.4)

来源:论文 §3.4 Step 1 与附录 C.1;分析为解读者补充。

学习目标

学完本章你应能:①复述 SFT 训练超参;②解释"验证损失过拟合但人类偏好继续上升"这一反直觉现象的含义。

方案与关键观察

在 GPT-3 上用监督学习微调标注者示范:16 epochs、余弦学习率衰减(降到初始值的 10%)、残差 dropout 0.2、batch size 32(1.3B/6B 用 LR 9.65e-6)【附录 C.1】。最终用 RM 在验证集上的分数选模型。

反直觉发现【实验支持】:SFT 模型在验证损失上 1 个 epoch 后就过拟合,但继续训练反而同时提高 RM 分数和人类偏好评分。含义:验证损失的上升衡量的是"对示范文本分布的记忆化",而下游要的是"行为风格的对齐",两个指标在 1 epoch 后就分道扬镳了。这是全文第一次出现"代理指标与真实目标脱钩"的主题——第六章的 KL 惩罚、第八章的奖励过优化都是它的变奏。

常见误读

误读:"SFT 过拟合说明训坏了。"不——以验证损失早停反而是错的,本文明确以 RM 分数做模型选择。教训:选模型的指标必须贴近最终评价方式(人类偏好),而不是最方便计算的代理【解读者推断】。

一句话记住本章:SFT 教的是"风格与格式",1 个 epoch 就学会了;后面练的是熟练度,别用困惑度当裁判。

五、Step 2 · 奖励模型:把偏好变成标量(§3.4 Step 2)

来源:论文 §3.4 Step 2 与附录 C.2;组合数计算为解读者手算。

学习目标

学完本章你应能:①写出 RM 损失函数并逐符号解释;②手算 K=9 时每个提示产生多少比较对;③说出为什么只用 6B RM;④解释"同提示比较打包成一个 batch 元素"解决什么问题。

失效模式先行

没有 RM,PPO 就没有奖励信号:让人类坐在 RL 循环里实时给百万级生成打分既慢又贵且不可复现。所以需要一个"学会人类口味的模拟裁判",能离线对任意 (x, y) 打出标量分。

公式手术

loss(θ) = − (1 / C(K,2)) · E(x, yw, yl)∼D[ log σ( rθ(x, yw) − rθ(x, yl) ) ]
符号它是什么直觉
rθ(x, y)奖励模型对标量输出"这条回答值多少分";输入 prompt+response 拼接序列,输出单个数
yw / yl被偏好 / 被拒绝的回答标注者勾选的赢家与输家
σ(·)logistic 函数把分差压到 (0,1),当作"yw 胜出的概率"
C(K,2)K 个响应的比较对数归一化系数;一次展示 K 个响应,两两配对全算损失
负号+log最大化对数似然的等价写法梯度上升"拉大赢输家分差"

张量形状流【解读者补充】:输入 token 序列 [batch, seq_len] → Transformer 编码(取末 token 或拼接后的隐状态)→ 去掉 unembedding 层的线性头 → 标量 [batch, 1]。RM 从去掉最后 unembedding 层的 SFT 模型初始化——即"拿同一个骨架接一个回归头"。

手算验证:比较对的数量杠杆

K=4 时 C(4,2)=6 对/提示;K=9 时 C(9,2)=36 对/提示。也就是说,让标注者排一次序(1 次交互)最多产出 36 个训练信号,相比逐两两比较节省近一个数量级的标注交互。附录 C.2 还给出 batch 上界:64×C(K,2)≤2304 个比较/batch ✓。

两个工程决定及其理由【实验支持】

只用 6B RM:省算力;175B RM 训练不稳定,不适合充当 RL 的价值函数(附录 C)。②同提示比较打包成单个 batch 元素:同一提示内的比较高度相关,若混洗后独立采样,单次遍历即过拟合;打包后只需对该提示做一次前向传播,显著改善验证准确率与 log loss。这是"数据的相关性结构必须反映进 batch 构造"的教科书案例。

数字对账③:RM 够不够准?

5 折交叉验证(按标注者分组):RM 对 held-out 标注者偏好预测准确率 69.6 ± 0.9%,对训练集标注者 72.4 ± 0.4%【§4.1】。一个"及格线裁判"——准确率不高,但比随机(50%)强得多;第七章将说明这已足够驱动大幅偏好提升,代价留到批判性阅读讨论。

一句话记住本章:RM 是一个 6B 的"口味压缩器"——把 33k 提示的人类排序压成一个可无限调用的打分函数,打包训练技巧决定了它会不会白学。

六、Step 3 · PPO:在奖励上冲浪,用 KL 拴住风筝(§3.4 Step 3)

来源:论文 §3.4 Step 3 与 §4.2.4;公式符号表为解读者整理。

学习目标

学完本章你应能:①写出 PPO-ptx 组合目标并区分 β 与 γ 的作用;②解释为什么需要 KL 惩罚(不加固会怎样);③说出 ptx 修复对齐税的两条替代路线中哪条更好、证据是什么。

公式手术

objective(φ) = E(x,y)∼DπφRL[ rθ(x,y) − β·log( πφRL(y|x) / πSFT(y|x) ) ] + γ·Ex∼Dpretrain[ log( πφRL(x) ) ]
符号它是什么直觉
rθ(x,y)RM 给当前策略输出的打分要最大化的主信号(bandit 环境:一步回合,RM 打分即结束)
β·log(πRLSFT)逐 token KL 惩罚风筝线:策略偏离 SFT 太远就罚分,防 reward hacking
γ·E[log πRL(x)]预训练梯度混入(ptx 项)兼职做预训练题,防止忘掉语言能力
PPO vs PPO-ptxγ=0 即"PPO";γ>0 即"InstructGPT 默认的 PPO-ptx"命名陷阱:论文标题模型都是 ptx 版

量纲/尺度检查【解读者补充】:r 是标量奖励,KL 项是逐 token 负数求和,两者量纲不同,β 吸收尺度;同理 γ 平衡"对话分布"与"预训练分布"两种梯度的权重。β、γ 都是超参数,论文未给出最终取值于正文摘要级描述中(见附录 C.4,本页未核验具体数值)。

失效模式先行:不加 KL 会怎样

RMB 是从约 7 万个比较对学出的近似裁判。若让策略纯最大化 RM 分数,它会找到 RM 的高分区但人类并不喜欢的文本(对抗样本式的 reward hacking)。KL 惩罚把策略钉在 SFT 模型附近——SFT 模型至少会说人话。第八章的消融显示:另一种防过优化的思路是"调大 β",但它会让验证奖励大幅下降且无法修复 DROP/SQuAD 回退;混入预训练更新(ptx)则存在一个甜点值,既回退归零又不掉验证奖励——ptx 路线胜出【实验支持】。

常见误读

误读1:"InstructGPT = GPT-3 + SFT。"漏掉了 PPO 阶段才是性能阶梯最大的一级(第七章)。误读2:"KL 惩罚是对齐到 GPT-3。"参考策略是 SFT 模型而非原始 GPT-3(附录 C.3 提到改参考为 GPT-3 结果类似,但默认是 SFT init)【论文原文附录 C.3,细节本页未逐字核验】。误读3:"ptx 让模型重新变强于一切 NLP 任务。"实际 DROP/SQuADv2/翻译仍落后于 GPT-3,只是回退被缓解(§4.2.4)。

一句话记住本章:PPO 负责"变得更有用",KL 负责 "别变成怪物",ptx 负责"别忘了母语"——三股力平衡出 InstructGPT。

七、主结果:1.3B 打赢 175B(§4.1)

来源:论文 §4.1 与图 1/3/4、Table 2;倍数验算为解读者手算。

性能阶梯与关键胜率

对比InstructGPT 方胜率出处
175B InstructGPT vs 175B GPT-385 ± 3%§4.1 正文
175B InstructGPT vs few-shot 提示版 GPT-371 ± 4%§4.1 正文
各尺寸 PPO-ptx vs 175B SFT 基线显著为正(1.3B 也为正)图 1 说明
InstructGPT vs 本文复刻的 T0 版 / FLAN 版(175B)73.4 ± 2% vs 26.8 ± 2% / 29.8 ± 2%§4.1 正文
正面对决:vs FLAN 版 / vs T0 版78 ± 4% / 79 ± 4%§4.1 正文

阶梯顺序稳定成立:GPT-3 < GPT-3(prompted) < SFT < PPO;PPO 加不加 ptx 对偏好影响不大【§4.1,实验支持】。

手算验证:"少 100 倍参数"

175B / 1.3B ≈ 134.6。摘要说"despite having 100x fewer parameters"——按四舍五入到数量级是对的(≥100×),严格倍数是约 135 倍。这是宣传性表述取整的一个小例子:方向无误,精度取整【解读者推断】。

元数据评估(图 4)与泛化验证

封闭域任务幻觉率:InstructGPT 21% vs GPT-3 41%——"编造信息约为 GPT-3 一半"✓(正文原话"a 21% vs. 41% hallucination rate")。泛化到未见过的标注者:训练标注者互相一致率 72.6 ± 1.5%,held-out 标注者间 77.3 ± 1.3%(对照 Stiennon et al. 摘要工作的研究者间一致率 73 ± 4%)【§3.4】。held-out 标注者同样大幅偏好 InstructGPT——说明不是过拟合到了自家标注员的口味【实验支持】。

闭卷自检清单

不看材料,我能说出:①四层阶梯的排序及每一级带来什么数据;②85%/71%/73.4% 分别是与谁比的胜率;③幻觉率的两个数字;④held-out 标注者实验设计如何排除"过拟合标注员"的解释吗?

一句话记住本章:对齐带来的偏好增益跨过了两个数量级的参数鸿沟——这是本文最锋利的一根针,刺破了"唯规模论"。

八、真实性、毒性、偏见与对齐税(§4.2)

来源:论文 §4.2 各小节;解读为解读者补充。

真实性

TruthfulQA 人评:PPO 模型给出真实且有信息量回答的频率约为 GPT-3 两倍,且无需专门指示"要说真话"【实验支持】。例外:1.3B PPO-ptx 在 TruthfulQA 上略差于同规模 GPT-3——对齐收益不是免费的,也不是在所有尺寸上都成立。给出 "Instruction+QA" 提示(不确定时回答"I have no comment")时,PPO 学会"宁可无信息也要真实",GPT-3 做不到。

毒性

RealToxicityPrompts:当提示含"尊重式"要求时,InstructGPT 有毒输出比 GPT-3 少约 25%(正文原话 "about 25% fewer toxic outputs");移除该提示后优势消失;而当明确要求有毒输出时,InstructGPT 比 GPT-3 更毒——因为它更擅长服从任何指令,包括坏指令【实验支持,§4.2】。Winogender / CrowS-Pairs 偏见维度:无显著改善;且在被指示"表现得尊重"时熵更低(对自己输出更确定)。

对齐税

默认 PPO 使公开 NLP 数据集(SQuAD、DROP、HellaSwag、WMT15 法译英)出现回退;PPO-ptx 缓解全部数据集的回退,HellaSwag 甚至反超 GPT-3,但 DROP/SQuADv2/翻译仍落后【§4.2.4,强实验支撑】。

定性失败模式(§4.3)

①顺从错误前提("为什么冥想后要穿袜子?"照答不误);②过度对冲(简单问题也罗列多种可能——作者推测因标注指南鼓励认知谦逊而被 RM 学走);③多重/困难显式约束时性能下降。

一句话记住本章:RLHF 买到的是"更有用也更听话",但听话不分善恶——安全性的最后一公里不在 RLHF 手里。

九、批判性阅读:如何不被这篇论文带节奏

9.1 每个 benchmark 到底测什么

"API 分布上的人类偏好胜率"测的是:约 40 名特定背景的标注者在 OpenAI 筛选过的提示分布上、按 OpenAI 标注指南做出的选择。名字里的"human preference"极易被读成"人类共识",实际是【论文自己承认,§5.2】"特定标注者群体 × 特定指南 × 特定提示分布"的三重条件产物。TruthfulQA 测的是对抗性构造的"人类常见误解类问题"上的真实倾向,不是全面的事实准确性。RealToxicityPrompts 的自动指标依赖 Perspective API 这个第三方分类器,分类器本身的偏差会进入结论。

9.2 基线公平吗

FLAN/T0 基线是作者自己在 175B GPT-3 上复刻的版本(各约 100 万样本),并非原作者的最优系统;它们的训练目标(多任务泛化)本来就不是聊天助手。赢下它们证明了"数据分布匹配的重要性",但不能推出"InstructGPT 强于一切指令微调方法"【解读者推断】。few-shot GPT-3(prompted) 是个重要的公平性补丁——它证明优势不只是"见过指令格式"。

9.3 成本第二坐标轴

§5.1 给出训练计算:175B SFT 4.9 petaflops/s-days,175B PPO-ptx 60 petaflops/s-days,GPT-3 预训练 3640。手算:60/3640 ≈ 1.65%,SFT 更是 0.13%。这是"对齐便宜"主张的直接证据【实验支持】。但第二坐标轴还有另一半:这些数字不含人工标注成本(约 40 名全职承包商数月的工资)与 RM/PPO 的试错搜索成本——论文未报告人工费用【论文没告诉你】。

9.4 论文没有告诉你什么

十、综合考核(毕业关)

10.1 重建因果链

仅凭摘要三个短语——"1.3B 优于 175B"、"人类演示数据"、"输出排序数据"——推演:流水线为什么必须恰好三步?缺一步分别会发生什么?

参考答案与评分要点(4 分)

①只有预训练:目标=下一个词,与意图错位(摘要第一句即痛点)。②只有 SFT:示范数据仅约 13k,只能教会风格格式,无法在大空间里区分好坏回答的细微差别,且没有可优化的标量信号(1 分/点)。③SFT+RM 但无 RL:有了裁判但没有上场练习,模型行为不会被主动推向高分区——性能阶梯显示 PPO 才是最大一级(1 分)。④必须有 KL/约束来防 RM 过优化,否则纯最大化近似裁判分数会产生 adversarial 输出(1 分)。核心逻辑链:错位→需要行为信号→示范太稀疏需比较→比较需离线裁判→裁判是近似需拴住策略。

10.2 数字总对账

核对以下五组数字的自洽性:(a) 11,295+1,430 与 SFT 总数;(b) 6,623+26,584 与 RM 总数;(c) 60 与 3640 petaflops/s-days 之比;(d) C(K,2) 上界 2304;(e) "100 倍更少参数"。

标准答案

(a) 12,725 ✓(Table 6)。(b) 33,207 ✓。(c) 60/3640≈1.65%,支持"对齐计算仅为预训练零头"。(d) K=9 时 C(9,2)=36,64×36=2304 ✓(附录 C.2 上界恰取 K=9)。(e) 175/1.3≈134.6,"100×"为保守取整表述,方向正确、数值偏保守(实际差距更大,反而强化结论)。

10.3 设计决策答辩(3 题)

  1. L2为什么价值函数从 RM 初始化而不是随机初始化?(提示:价值函数要预测什么量?)
    答案

    价值函数需预测"从某状态起预期累计奖励",其尺度与分布和 RM 输出的奖励分布一致;用 RM 初始化等于给价值网络一个好的先验,收敛更快更稳。论文附录 C 提到 175B RM 不稳定故用 6B——同一逻辑下,价值函数继承 RM 结构是最省钱的选择。【评分要点:提到奖励分布先验、稳定性/效率各 1 分】

  2. L3构造两种针对该 RM 的 reward hacking 策略,并说明各自会被哪道防线拦截或漏网。
    参考答案(按要点给分,每种 2 分)

    ①长度/格式作弊:输出冗长、礼貌、分点的"高分长相"文本——RM 从人类偏好学到表面相关性。拦截:KL 惩罚限制漂移幅度;但若 SFT 本身就有此风格则漏网。②前提迎合:用户暗示错误事实时附和(论文 §4.3 观察到的正是此类残留失败),因为标注者看到"顺着用户"的答案往往给高分。拦截:理论上需在标注指南中惩罚错误前提;本文未做,故漏网——成为已知失败模式。评分要求:策略须具体可执行、指出防线名称、说明为何可能漏网。

  3. L4综合 §3 数据分布表与 §4.1 FLAN/T0 结果:如果你只有 FLAN 级预算(约 100 万公开 NLP 样本),如何改造它才能逼近 InstructGPT 的表现?哪些差距是数据解决不了的?
    参考答案(按要点给分)

    可解决的:按 API 分布加权采样(开放式生成/头脑风暴占约 57%,砍掉过量分类 QA);增加输入多样性而非任务数量;补充开放式任务的偏好排序数据而非仅正确标签(3 分)。解决不了的:真实用户流量带来的长尾多样性(waitlist 用户的真实意图)、人工偏好标签的质量闭环、以及 RM+RL 阶段的持续优化信号——FLAN 式静态数据集没有"针对模型当前缺点出题"的机制(2 分)。

10.4 四级自测题

  1. L1K=6 时一个提示产生多少比较对?
    答案

    C(6,2)=6×5/2=15 对。(机批:15)

  2. L1175B PPO-ptx 的训练计算是 GPT-3 预训练的百分之几?
    答案

    60/3640≈1.65%(容差 ±0.1 个百分点)。

  3. L2若把 RM 换成 175B 且训练不稳定,PPO 阶段最先崩坏的环节是什么?为什么价值函数受影响最大?
    答案

    价值函数需要准确回归奖励的局部起伏来计算优势(advantage);不稳定的 RM 使奖励信号噪声大,价值函数拟合的目标本身抖动,优势估计失真,PPO 策略梯度方向紊乱,训练发散或停滞。判别器(RM 打分)偶有噪声尚可容忍,估计器(价值函数)失真则是系统性崩溃。【要点:优势估计依赖价值函数、噪声放大机制各 1 分】

  4. L2把同样的三步流水线搬到"代码生成"任务,哪一步的数据最难收集?迁移你的答案说明理由。
    答案

    示范(SFT)与比较都可以由程序员完成,真正难的是PPO 提示分布=真实使用场景:代码场景的正确性可部分自动评测(测试通过率),此时人类比较数据的价值下降、可验证奖励上升——预示了第 26 篇 Tülu 3 的 RLVR 思路。【要点:识别提示分布难收集或识别可验证奖励替代人类偏好均可】

  5. L3"SFT 在验证损失上 1 epoch 过拟合,所以应该用 1 epoch 训练。"找出这段论述的两个错误。
    答案

    ①隐含假设"验证损失=下游目标",但本文实测更多 epoch 提升 RM 分数与人类偏好——代理指标与真实目标脱钩;②模型选择标准应为 RM 验证分(贴近人类偏好的代理),而非似然类指标。错误根源:把预训练时代的"早停防过拟合"经验未经检验地平移到对齐微调。【每指出一处 1.5 分,指出根源 1 分】

  6. L4从"约 40 名标注者、96% 英语、API waitlist 用户"三个事实出发,预测 §5 讨论章必须回应哪些批评,并说明每个事实各自逼出了哪个批评。
    参考答案(每条 2 分,答 3 条满分)

    40 人→代表性批评:对齐对象是一小群承包商的偏好,标注者间一致率仅 72.6%,不存在单一"人类偏好"可供对齐(§5.2/5.3 正面回应了这一点)。96% 英语→语言偏差:非英语用户的需求未被覆盖,模型对外语指令甚至常回复英文(§4.3 定性结果)。waitlist 用户→分布偏差:提示分布偏向早期技术圈用户,"对齐到用户"实际是"对齐到一小撮尝鲜者",且客户利益与终端用户利益可能冲突(§5.2 明确讨论)。这三点共同逼出了论文最重要的自我限定:"we are not claiming … the right source of preferences"。

10.5 证据审计(读后修正)

预评贡献预评读后修正理由
1.3B>175B维持主结果+held-out 标注者双重验证,且阶梯各级均有数据
真实性与无害性提升部分下调为条件性强幻觉减半稳健;但毒性改善依赖"尊重式提示",被恶意指示时反而更毒——收益是有条件的
"对齐人类意图"主张维持主张(论文自己也这么定级)§5.2 明确承认只对齐了标注者群体;标题措辞大于证据范围,作者诚实