← 总目录 / 板块三 · 语言模型的发展
板块三 · 语言模型的发展

第26篇 · Tülu 3

把闭源厂商秘而不宣的后训练配方完整摊开:SFT → DPO → RLVR 三级火箭,外加一份"哪些路走不通"的诚实清单
Tülu 3: Pushing Frontiers in Open Language Model Post-Training · Lambert et al., Allen Institute for AI / Univ. of Washington · 2024 · arXiv:2411.15124(本页数字以最新 arXiv 版为准)

本页所有数字均复述自论文原文(arXiv:2411.15124,最新版),未做外部验证;凡标有【解读者推断】或【解读者补充】的内容不来自论文。证据强度徽章:强实验支撑仅有消融/部分证据只是主张

一、全局大图

1.1 摘要拆解:摘要—原文—精读对照导航

摘要短语单元对应原文章节本页章节
"开放的后训练配方落后于专有方案……透明度最低"§1 引言、§2 概览第二章
"完全开放……公开数据、代码和训练配方"§2.4 发布物清单(Table 1)第二章
"多任务评测体系+大规模去污染"§3.2、§7 评测框架第三、八章
"SFT → DPO → RLVR 三阶段训练算法"§4、§5、§6第四、五、六章
"超越 Llama 3.1/Qwen 2.5/Mistral instruct 版乃至 GPT-4o-mini、Claude 3.5-Haiku"§2.4 主结果表、§8.1 405B第七章
"讨论未能可靠提升性能的训练方法"§8.2 负面结果第九章

1.2 主要贡献与证据强度预评

#论文声称的贡献预评证据强度依据
1RLVR(可验证奖励强化学习)作为新的后训练终段强实验支撑§6 多组消融(价值函数初始化/RM分数混入/起始点/KL 扫描)+最终主表
2三阶段配方整体超越同级开源 instruct 模型并追平部分闭源模型强实验支撑§2.4 主结果表逐项对比+各阶段检查点分解
3Persona 驱动合成数据可精准提升目标技能强实验支撑§4.2 移除消融:去 Persona 后 IFEval 72.8→53.6
4on-policy 偏好数据优于 off-policy仅有消融§5.3 图 11,无主表级验证
5"超越 GPT-4o-mini 与 Claude 3.5-Haiku"(70B 级)需谨慎依赖自家评测套件的聚合平均分,且部分闭源分数为 MICE 插值估计【见第九章】
6负面结果清单本身作为社区贡献只是主张§8.2 仅初步实验,作者自陈未深挖

1.3 推荐阅读路线

必读主线:§2.3 配方总览 → §6 RLVR(本文最大算法创新,枢纽章节)→ §2.4 主结果。
可跳读支线:§3 数据来源明细可在复现时查表;§5.3 的九条偏好数据消融可只记四条标题结论。
跳读代价:跳过 §3.2 去污染方法,你将无法理解 §7.4"模型普遍过拟合 IFEval"为什么是可控风险而非丑闻;跳过 §5.4.1 的 PPO-vs-DPO 对比,你会误以为第六章用 PPO 是"回到了落后方案"。

二、问题与定位:开放阵营缺的不是模型,是配方(§1–2)

来源:论文 §1–2;背景解读为解读者补充。

学习目标

学完本章你应能:①说出截至 2024 年 11 月 ChatBotArena top-50 中发布了后训练数据的模型数量及含义;②解释 Tülu 3 四阶段配方的分工;③指出它与 InstructGPT 流水线的两个本质差异。

失效模式先行

开源社区能拿到 Llama 3.1 这样的强基座,却造不出同等水平的对话模型——Tülu 2、Zephyr-β 在 MATH、GSM8K、IFEval 上持续落后。瓶颈被锁定:后训练的数据与配方是拼图中最重要又最不透明的部分。论文给出硬证据:ChatBotArena 前 50 名中没有任何一个模型公开了其后训练数据(截至 2024-11-20)【论文声称】。

四阶段配方(§2.3)

阶段输入产出关键决定
1 数据策展(§3)公开数据+合成提示约 2333 万条提示池许可合规+对评测套件去污染
2 SFT(§4)939,344 条 prompt-completionTülu 3 SFT多轮配比实验定混合比
3 DPO(§5)354,192 条偏好实例Tülu 3 DPOlength-normalized DPO+on-policy 数据
4 RLVR(§6)29,946 条可验证提示最终模型用验证函数替代奖励模型

与 InstructGPT(第 25 篇)的两个本质差异【解读者推断】:①第三阶段不再用 RM 打分的 PPO,而用免 RM 的 DPO(RM 被推迟到第四阶段只当价值函数初始化);②终点从"人类偏好裁判"换成"程序化验证器"——凡是答案可机检的任务,人类彻底退出打分回路。

一句话记住本章:Tülu 3 卖的不是模型权重,而是"如何把任意强基座变成现代助手"的完整操作手册。

三、数据策展与去污染(§3)

来源:论文 §3 及 Table 6/Table 7;漏斗计算为解读者手算。

学习目标

学完本章你应能:①复述提示池三级漏斗的数字;②说明 8-gram 去污染的判定规则与阈值;③解释为什么排除 ShareGPT 连带弃用 Helpsteer2。

数据漏斗

23,327,961 条提示池 → 939,344 进 SFT(≈4.0%)→ 425,145 进 DPO 阶段 → 最终偏好实例 354,192

手算:939,344/23,327,961≈4.03%——策展比生成重要:两千万级的池子只为选出九十万条最合适的。【解读者补充】这个比例本身就是一条工程经验:合成数据便宜到可以海量生产,真正的稀缺资源是"挑选它们的评测纪律"。

三条来源原则

Persona 驱动合成(§3.1.2)

用 Persona Hub 约 250K 个 persona(如"专注神经网络的机器学习研究者")条件化 GPT-4o 生成技能专项提示,避免合成数据的模式坍缩。精确指令遵循:覆盖 IFEval 定义的 25 种约束类型,人工写 33 条种子指令扩增出 29,980 对可验证指令-回答(If-Persona-Sft);数学约 22 万条、代码约 3.5 万条实例(数学解答由 GPT-4o 写、Python 解答由 claude-3-5-sonnet 写)。

去污染(§3.2)

比较全串/n-gram/嵌入三种匹配后选定 8-gram 匹配:测试实例中超过 50% 的 token 与同一训练实例共享 8-gram 即判显著重叠;任一训练集与任一评测集重叠超过 2% 实例即判污染并整体清洗。已重新发布的清洗结果:Evol CodeAlpaca→HumanEval 移除 3.5%;WildChat GPT-4 安全子集 5.4%;WildJailbreak 0.7%;WildGuardMix 1.1%;NuminaMath-TIR→MATH 高达 11.3%

常见误读:"嵌入匹配更高级所以更好。"实测相反——嵌入法难以区分"分布相似"与"真正改写",而 8-gram 已能抓出"只改数字的数学题"这类换皮污染【论文原话转述】。数字对账①:11.3% 的污染率意味着若不去污,MATH 成绩里至少有一成题目模型可能背过——这直接威胁第五章所有 MATH 数字的可信度,也反衬去污染流程的价值。

一句话记住本章:两千万选九万的漏斗+8-gram 去污染,是这份配方里最不性感但最不可省的两道工序。

四、Stage 1 · SFT:939K 条数据的配比科学(§4)

来源:论文 §4 各小节;成本换算为解读者手算。

学习目标

学完本章你应能:①复述 SFT 超参并解释 sum loss bug 的机理;②背出四组移除消融的关键数字;③解释"最优单次运行≈最优 model soup"这一发现的实用意义。

失效模式先行

naive 做法是把网上能找到的指令数据全倒进锅里。后果:安全数据会压制有用性、弱模型的回答风格会被模仿、某单项技能(如数学)挤占其他能力。SFT 配比的目标是在不伤害其他技能的前提下补齐目标短板——为此作者先训"单项技能专用模型"测出该项上限,再向通用模型逼近它。

移除消融(Table 9,基于 8B SFT,基线均分 60.1)

移除项均分变化最受伤的指标结论
w/o WildChat60.1→58.9(−1.2)AlpacaEval 2:12.4→7.5真实用户聊天数据撑起通用对话
w/o 安全数据60.1→58.0(−2.1)Safety:93.1→74.7安全与其他技能正交,加了几乎不伤通用分
w/o Persona 数据60.1→58.6(−1.5)IFEval:72.8→53.6(暴跌 19.2 点)合成数据精准命中目标技能
w/o 数学数据60.1→58.2(−1.9)MATH:31.5→23.5;GSM8K:76.2→64.1高质量专项数据大幅提升对应项

数字对账②:Table 9 报告 Tülu 3 8B SFT 均分为 60.1,而各阶段进度表报 60.6——两处相差 0.5,论文未解释,可能源于不同运行或聚合口径,本页如实标注此差异未能核验。【解读者推断】量级不影响任何定性结论。

工程账单:sum loss bug(§4.3.2)

发现 Transformers 库损失聚合缺陷:批内按 token 平均 vs 梯度累积时按样本平均,导致改变梯度累积设置会隐式改变每个 token 的权重——长回答与短回答的相对影响力随硬件配置漂移。修复:改用求和损失(sum loss)使所有 token 权重相等,并相应调低学习率(5e-6 最优);训 2 epoch 后继续训练无收益。这张"债单"提醒我们:多卡训练框架里的每一行聚合代码都在悄悄定义你的目标函数【解读者推断】。

种子与 Soup(§4.3.1)

8B 五个随机种子的均分在 59.8–60.1 间波动,最佳双种子 soup 仅 60.2——seed 差异真实存在,但 soup 不比挑最好的单次运行更强。实用结论:与其做模型平均,不如多跑几次挑最好【实验支持】。

成本

最新版报告:8B DPO 训练 10 小时/8 张 H100;70B DPO 19 小时/64 卡。SFT 成本同量级(数十 GPU·时)。手算:70B DPO=19×64=1216 GPU·h——后训练确实比预训练(万卡·月)便宜几个数量级,延续了 InstructGPT"对齐很便宜"的结论。

一句话记住本章:SFT 阶段的胜负手不是算力而是配比实验纪律:安全正交、Persona 精准、真实聊天保底线。

五、Stage 2 · DPO:on-policy 偏好数据流水线(§5)

来源:论文 §5;公式符号表为解读者整理。

学习目标

学完本章你应能:①写出 length-normalized DPO 目标并与标准 DPO 对照指出差异;②描述偏好数据三阶段管线的每一步;③用数字回答"PPO 还是 DPO";④复述 DPO 最终超参。

公式手术

标准 DPO:maxπθ E[ log σ( β·log(πθ(yc|x)/πref(yc|x)) − β·log(πθ(yr|x)/πref(yr|x)) ) ]
length-normalized DPO:log 概率各项除以序列长度 |yc|、|yr|
符号它是什么直觉
yc/yrchosen/rejected 回答偏好对中的赢家与输家
βKL 强度系数(最终取 5)隐式 RM 与参考策略之间的缰绳松紧
πθref训练策略/参考策略DPO 同时训练隐式奖励模型与策略,无需显式 RM 与在线采样
÷|y|长度归一化抵消"人类与模型都偏爱长回答"的长度偏置——否则模型学会啰嗦取胜

算法选型实验(Table 17,UltraFeedback 上、早期 SFT 底座):SimPO 最高 52.9、标准 DPO 55.2、PPO 55.5、length-normalized DPO 最高 57.3(LR 5e-7、β=5、1 epoch、batch 32)——只有它超过了 55.7 的底座分【实验支持】。最终超参(Table 19):8B 用 LR 5e-7/batch 32,70B 用 LR 2e-7/batch 128,β=5,线性调度,1 epoch,max len 2048。

偏好数据三阶段管线(§5.2.1)

①选提示(SFT 用过的+同源未用的);②每条提示从模型池随机抽 4 个模型各生成一答(池中包含 Tülu 3 SFT 自身——这就是 on-policy 成分);③GPT-4o-2024-08-06 当裁判,按 helpfulness/instruction-following/honesty/truthfulness 四维各打 1–5 分,取均值最高者为 chosen、低者中随机抽 rejected(Argilla 式二值化)。最终混合:8B 用 271,409 条、70B 用 334,302 条。

数字对账③(本页发现的疑点):把 Table 14 全部组件条数相加=334,302,恰等于 70B 总数 ✓;但按表中可见的勾选标记推算 8B 子集得到 251,519,与声明的 271,409 不符,差额恰为 19,890=Persona IF 条数。疑似 HTML 表格勾选标记在排版转换中的歧义——此处本页如实标注未能核验,不影响总量级判断。

PPO vs DPO 的 controlled 对比(§5.4.1)

同一批提示、同一 RM 设置下:PPO 能达到与 DPO 相近(略低)的分数,但 PPO 约 28 小时/两个节点 vs DPO 约 4 小时/单节点——7 倍墙钟时间差。决策:偏好微调全程用 DPO,把 PPO 留给第六章 RLVR【实验支持】。另有两个降显存技巧:预计算并缓存参考模型的 log-probs(免驻留参考模型)、chosen/rejected 分开前向(免拼接翻倍 batch)。

关键消融结论(§5.3)

常见误读:"DPO 是穷版 PPO,效果一定差。"受控实验显示两者接近,且 DPO 的迭代速度快 7 倍——在需要大量配比实验的研发场景里,迭代速度就是实验吞吐量,这是方法论层面的优势而非妥协【解读者推断】。

一句话记住本章:DPO 阶段赢在数据管线(on-policy+unique prompts+好裁判),算法上 length 归一化是唯一必要的修正。

六、Stage 3 · RLVR:把裁判换成验证器(§6)

来源:论文 §6 及附录 B.4/E;手算为解读者完成。

学习目标

学完本章你应能:①写出 RLVR 目标函数并说出 α 的取值;②背出三个验证数据集的规模;④复述五条 Key Findings;⑤解释异步 RL 架构为什么必须"用次新数据训练"。

失效模式先行:RLHF 裁判的三宗罪

RMB 式奖励在数学/格式类任务上有三个毛病:人类标注员未必会做题(判不了对错只能凭观感)、贵(每个新提示都要人标)、可被 hack(长得像对的就得高分)。而这些任务的答案明明可以程序化验证——那就别雇裁判了,写个 checker。

公式手术

maxπθ Ey∼πθ(x)[ RRLVR(x,y) ] = v(x,y) − β·KL[ πθ(y|x) ‖ πref(y|x) ],其中 v(x,y) = α(若验证正确)否则 0
符号它是什么直觉
v(x,y)确定性验证函数GSM/MATH 抽取末尾答案做精确匹配;IF 用约束模板逐条核验
α正确时的常数奖励试点实验取 α=10,未再调参
β·KL 项与 InstructGPT 同源的缰绳防过优化的机制不变,变的是奖励来源

与 RLHF 的结构对照【解读者补充】:目标形式与第 25 篇的 KL-constrained RLHF 完全同构,唯一的替换是 rθ(学习出来的近似裁判)→ v(零误差但覆盖面窄的真裁判)。代价:v 只存在于有标准答案的域——这正是它只能当"终段专项训练"而非主力算法的原因。

数据与训练规模

提示集数量验证方式
GSM8K Train7,473抽取答案精确匹配(附标准 8-shot CoT 提示)
MATH Train7,500抽取答案按 flex 规则匹配(附 3-shot CoT)
IF 可验证约束14,973每种约束模板一个专用验证器
合计29,946

手算:7,473+7,500+14,973=29,946 ✓(Table 21)。消融实验训约 100,000/7,473≈13.4 个 epoch(论文写"roughly 13")✓。实现细节沿用 Huang et al. (2024a) 最佳实践:价值模型从通用 RM 初始化、RM/RL 阶段关闭 dropout(保证两阶段 log-prob 一致,否则首个 PPO epoch 概率比全被 clip、梯度为零)、不产生 EOS 则罚 −10 分、优势白噪化。

Key Findings(§6.2.1)

  1. 定向有效:三种设置下测试集成绩都超过起点,训练集可验证奖励一致上升;但更多 KL 预算并不必然换来更高奖励。
  2. 价值函数从通用 RM 初始化最好:GSM8K 测试分与均分都最高。
  3. 别把 RM 分数掺进奖励:可验证奖励+RM 分数的组合更嘈杂、均分更差。
  4. 弱起点也能收敛到同样奖励(SFT 起点 vs DPO 起点),但弱起点 KL 更大、测试表现通常更差——所以仍从 DPO 出发。
  5. 过优化存在:β 调低→KL 增大→均分通常下降;附录 B.4 记录了 IFEval 约束上的过优化案例。

最终结果与基础设施

8B:GSM8K 84.3→87.6、IFEval 81.1→82.4、MATH 42.0→43.7(个别 run 冲到 GSM8K 89.4、IFEval 84.8 但拖累其他指标被弃用);70B:MATH 62.3→63.0、IFEval 82.6→83.2、GSM8K 持平 93.5(已近饱和)。70B run 全程 KL 远低于 1,归功于更低的学习率。成本(最新版):8B RM 训练 9h/8 卡,8B RLVR 65h/8 卡,70B 60h/48 卡,405B 46h/256 卡。架构:Ray 分配专用推理 GPU 跑 vLLM(PagedAttention),learner 并行做梯度更新(ZeRO-3);异步训练可能吃到过期数据,故固定使用次新(second-latest)推理数据换取可复现性。

一句话记住本章:RLVR=RLHF 的骨架+确定性的心脏:在答案可机检的域里,用一个 if 语句取代六 billion 参数的裁判。

七、评测框架与主结果(§2.4、§7)

来源:论文 Table 2–5、§7;解读为解读者补充。

开发集/未见集双层设计

核心技能 × 两套评测:知识(MMLU/PopQA/TruthfulQA ↔ 未见 MMLU-Pro/GPQA)、推理(BBH/DROP ↔ AGIEval)、数学(MATH/GSM8K ↔ Deepmind Mathematics)、编程(HumanEval(+)/(↔BigCodeBench)、指令遵循(IFEval/AlpacaEval 2 ↔ 自建的 IFEval-OOD/HREF)、安全(6 任务均值)。开发期间从不查看未见集分数——这是对"在自己设计的评测上调参"这一根本性质疑的制度性防御。未见集五大发现:总体泛化良好;MATH 训练迁移不到 Deepmind Mathematics;各家模型普遍过拟合 IFEval;知识回忆泛化依赖配方;指令遵循在不同约束类别间差异大。

主结果速览(Table 2/4/5)

模型均分GSM8KMATHIFEval(prompt loose)AlpacaEval 2 LC
Tülu 3 8B(SFT 60.6→DPO 64.7→RLVR 65.1)65.187.643.782.434.5
Llama 3.1 8B Instruct62.983.442.580.624.2
Qwen 2.5 7B Instruct66.583.869.974.729.0
Tülu 3 70B(SFT 72.6→DPO 76.2)76.293.563.083.249.8
Llama 3.1 70B Instruct / Qwen 2.5 72B Instruct74.1 / 72.893.7 / 89.556.4 / 75.988.0 / 87.633.4 / 47.7

405B(§8.1,最新版 Table):RLVR 后不含安全均分 80.0、含安全 80.7,对比 Llama 3.1 405B Instruct 79.0/78.1、DeepSeek V3 79.0/75.9、GPT-4o(11-24) 80.5/81.6——配方扩展到旗舰规模依然成立。

一句话记住本章:均分赢了一半对手、单项输给专业选手(Qwen 数学、Llama IFEval)——"均衡的多面手"是这份配方的真实画像。

八、批判性阅读:如何不被这篇论文带节奏

8.1 每个 benchmark 到底测什么、"超越闭源模型"成色几何

"超越 GPT-4o-mini 与 Claude 3.5-Haiku"建立在自家评测套件的等权均分之上。三点折扣【解读者推断】:①闭源模型的部分格子(TruthfulQA 等)是 MICE 插值估计而非实测(表中 ♢ 标记);②均分把 PopQA 这类检索型任务与 MATH 这类推理型任务等权相加,权重选择本身就利于配比全面的 Tülu 3;③闭源模型的系统提示/采样配置是否公平对齐,论文未逐一披露。结论应读作"在这套评测协议下追平",而非产品意义上的全面超越。

8.2 公平性与证据等级

对比对象分层清晰:同基座(Llama 3.1 Instruct、Hermes 3)、异基座同尺寸(Qwen 2.5、Ministral、Gemma 2)、在 instruct 版上再微调的(Nemotron)——论文明确标注了这一点,是同类报告里少见的诚实。但要警惕:所有开发期决策(配比、超参、checkpoint 选择)都是在开发集上做出的,开发集分数存在选择性乐观;未见集虽未偷看,但它是同一批人选的,无法排除"选题品味过拟合"。RLVR 的 GSM8K 提示直接取自 GSM8K Train 集——训练/评测同源,虽然用的是 train split 不算泄题,但分布匹配度天然占优【解读者推断】。

8.3 成本第二坐标轴

正面:后训练成本极低(70B DPO 约 1216 GPU·h 手算)。背面:这条配方背后是大量失败的探索性实验(配比扫描、九组偏好消融、β 扫描),这些实验成本未计入;且配方强依赖 GPT-4o 当数据引擎与裁判——"开放"的是配方,不是对前沿模型的独立性。

8.4 论文没有告诉你什么

九、负面结果的诚实清单(§8.2)

来源:论文 §8.2;评述为解读者补充。

Online DPO:没带来可靠提升

做法:当前策略采两条回答→RM 判偏好→标准 DPO 更新。用 Skywork 82K 偏好数据训 RM,再在数学方向续训;从 Tülu 3 DPO checkpoint 出发跑 200K episodes:GSM8K 无/几乎无提升,MATH 反而退化(扫过多种采样温度与 KL 系数)。作者坦承初试不利后未深挖。

Rejection Sampling:性价比不足

对每条 SFT 提示采 n 个回答、用 RM/LLM 裁判留最优再做偏好优化。发现:相对所需算力收益微小;强裁判是命门——公开模型难以从候选中挑出真最优;把原始回答也放进候选池远好于只在新采样中挑。这两条负面结果与第六章形成互证:想要"在线、自我改进"式的闭环,要么用真验证器(RLVR),要么暂时死心。

一句话记住本章:发表失败尝试是稀缺美德——这两段让读者少烧几千 GPU 时。

十、综合考核(毕业关)

10.1 重建因果链

仅从摘要三个事实出发——"基座是 Llama 3.1"、"三阶段 SFT/DPO/RLVR"、"大规模去污染"——推演:为什么 DPO 不能像 InstructGPT 的 PPO 那样放在最后?为什么 RLVR 必须最后?为什么去污染必须发生在一切训练之前?

参考答案与评分要点(6 分)

①DPO 是离线方法,偏好对由固定管线预先制好;若放最后,则无法利用 RLVR 阶段之后模型的新行为——在线自我改进已被证明不可靠(§8.2),所以离线偏好阶段必须在 RL 之前吃掉(2 分)。②RLVR 用 PPO 在线采样,能针对当前模型残余弱点定向拔高(GSM8K/MATH/IFEval 的最后一跳),且其奖励不依赖人类,适合当收官微调;但它只覆盖可验证域,不能承担全面对齐(2 分)。③一旦训练数据与评测重叠,后续所有阶段的所有决策都被污染且不可逆——去污染必须在任何"看着评测调模型"的动作之前完成(2 分)。

10.2 数字总对账

核对:(a) RLVR 数据三项之和;(b) RLVR 消融 epoch 数;(c) SFT 漏斗百分比;(d) 70B DPO 的 GPU·时;(e) Persona IF 消融前后 IFEval 差值。

标准答案

(a) 7,473+7,500+14,973=29,946 ✓。(b) 100,000/7,473≈13.38,论文称 roughly 13 ✓。(c) 939,344/23,327,961≈4.03%。(d) 19h×64=1,216 GPU·h(8B DPO 为 10×8=80 GPU·h,比值≈15.2×)。(e) 72.8−53.6=19.2 个百分点——四组消融中单项跌幅最大,支撑"合成数据精准命中目标技能"。

10.3 设计决策答辩(3 题)

  1. L2为什么 α=10 且"不做调参"?如果 α 设为 1 会发生什么?
    答案

    奖励只需保持"正确≫错误"的序关系,PPO 的优势白噪化会把尺度归一,绝对值不重要,故不值得花算力调(2 分)。α=1 时若与 KL 项的相对尺度失衡(β 固定),等效于加大 KL 权重、策略更保守、可验证奖励爬升更慢——相当于隐式收紧缰绳(2 分)。要点:识别出"尺度不变性+白噪化"才给满分。

  2. L3有人提议"把 RLVR 的验证器接到 InstructGPT 式流程的最前端替掉 SFT"。构造这个方案至少失败的两个原因。
    参考答案(每点 2 分)

    ①冷启动问题:基座模型答对率太低,稀疏的二值奖励几乎没有正样本梯度信号——RLVR 有效的前提是起点已经"够得着"正确(这正是它放在 SFT/DPO 之后的原因,§6.2 发现弱起点都要更大 KL)。②覆盖面问题:验证器只存在于数学/格式域,替掉 SFT 意味着对话、写作、安全等绝大多数行为完全没有训练信号,模型不会获得助手的基本形态。

  3. L4综合 §3 去污染、§7 未见集与 §8 批判视角:设计一套实验证明"Tülu 3 的 IFEval 82.4 不是过拟合假象",并预测结果。
    参考答案(按要点给分)

    实验设计:①在未见集 IFEval-OOD(Pass@1)上评估同一 checkpoint,看约束类型外推后的保持率(2 分);②按约束类别分解 IFEval-OOD 成绩,检查训练集中 Persona IF 覆盖的 25 类约束是否系统性高于未覆盖类别(2 分);③用去污染工具反向审计 Persona IF/IF-augmented 与 IFEval 的 8-gram 重叠率并汇报(2 分)。预测:论文自己的未见集发现已表明"模型普遍对 IFEval 过拟合",故预期 OOD 保持率显著低于开发集分数,但绝对水平仍优于基座 instruct 版——即"部分真实、部分评测红利"。(开放题,交给 LLM 裁判按要点给分。)

10.4 四级自测题

  1. L1RLVR 中答案正确时的奖励值 α 是多少?由谁确定?
    答案

    α=10,来自试点实验,未做进一步调参。(机批:10)

  2. L1length-normalized DPO 与标准 DPO 的公式差异用一句话说清。
    答案

    把 chosen/rejected 各自的 log 概率比除以各自的序列长度 |y|,其余不变。

  3. L2若把 NuminaMath-TIR 不做去污染直接进 SFT,主表的哪个数字最受威胁?为什么其余数字受威胁较小?
    答案

    MATH(31.5→若污染则虚高):11.3% 的 NuminaMath-TIR 与 MATH 评测集 8-gram 显着重叠,等于把考卷喂进了训练集。其余指标(如 HumanEval)对应的污染源不同(Evol CodeAlpaca→HumanEval 仅 3.5%),且各评测集有自己的去污审计。【要点:指认 MATH、引用 11.3% 各 1 分】

  4. L2把"缓存参考模型 log-probs"的技巧搬到 RLVR/PPO 行得通吗?
    答案

    不行。PPO 的参考策略 KL 逐 token 惩罚作用在策略实时生成的 rollout 上,生成内容随训练动态变化,无法预先枚举并缓存;DPO 的 chosen/rejected 序列是固定数据集,才能离线预算。技巧的有效性取决于"待评分文本是否静态"。【要点:区分动态 rollout 与静态数据对各 1 分】

  5. L3"Persona Math 偏好数据没用,所以 Persona 方法失败了。"找出这段论述的两个错误。
    答案

    ①以偏概全:Persona IF 使 IFEval 大涨(消融中去掉它跌 19.2 点),Persona 方法在指令遵循方向被证实有效;②混淆了"数据类型"与"生成方法":失败的可能原因是数学偏好的裁判(LLM 打分)难以可靠判定数学解答优劣,而非 persona 合成提示本身无效——数学的正确性本应交给验证器(RLVR 正是这么做的)。【每点 2 分】

  6. L4综合三阶段数字:SFT 把 8B 从基座带到 60.6,DPO 到 64.7,RLVR 到 65.1。由此推断"哪类能力在哪一阶段形成",并用 IFEval/GSM8K 的阶段轨迹验证你的推断。
    参考答案(按要点给分)

    推断:SFT 形成能力基底与格式(最大跳跃 +60.6),DPO 完成行为对齐与偏好打磨(+4.1,主要落在 AlpacaEval 12.4→33.5、Safety 下降换取均衡),RLVR 做可验证域的最后拔高(+0.4 均分但 GSM8K +3.3、IFEval +1.3)(3 分)。验证:IFEval 轨迹 72.8→81.1→82.4,大头在 DPO(对齐"听指令"的行为)+RLVR 收尾(可验证约束精修);GSM8K 76.2→84.3→87.6,DPO 与 RLVR 各贡献一半,因为数学既需要偏好对齐(过程呈现)也需要答案级强化(2 分)。注意均分增量递减不代表边际价值递减——RLVR 的 +0.4 全部集中在最难提分的硬骨头上。

10.5 证据审计(读后修正)

预评贡献预评读后修正理由
RLVR 新方法维持,但限定范围消融充分;然仅验证了数学+IF 两域,泛化边界未知
超越闭源模型(70B)谨慎维持谨慎自家套件等权均分+MICE 插值的对手分,协议依赖性强
on-policy 偏好数据仅消融维持仅消融图 11 支持方向性结论,但无受控的主表级对照
负面结果清单的贡献价值主张上调至部分实证Online DPO 有具体数字(200K episodes、GSM8K 平/MATH 退),非纯叙事