本页所有数字均复述自论文原文(arXiv:2411.15124,最新版),未做外部验证;凡标有【解读者推断】或【解读者补充】的内容不来自论文。证据强度徽章:强实验支撑/仅有消融/部分证据/只是主张。
| 摘要短语单元 | 对应原文章节 | 本页章节 |
|---|---|---|
| "开放的后训练配方落后于专有方案……透明度最低" | §1 引言、§2 概览 | 第二章 |
| "完全开放……公开数据、代码和训练配方" | §2.4 发布物清单(Table 1) | 第二章 |
| "多任务评测体系+大规模去污染" | §3.2、§7 评测框架 | 第三、八章 |
| "SFT → DPO → RLVR 三阶段训练算法" | §4、§5、§6 | 第四、五、六章 |
| "超越 Llama 3.1/Qwen 2.5/Mistral instruct 版乃至 GPT-4o-mini、Claude 3.5-Haiku" | §2.4 主结果表、§8.1 405B | 第七章 |
| "讨论未能可靠提升性能的训练方法" | §8.2 负面结果 | 第九章 |
| # | 论文声称的贡献 | 预评证据强度 | 依据 |
|---|---|---|---|
| 1 | RLVR(可验证奖励强化学习)作为新的后训练终段 | 强实验支撑 | §6 多组消融(价值函数初始化/RM分数混入/起始点/KL 扫描)+最终主表 |
| 2 | 三阶段配方整体超越同级开源 instruct 模型并追平部分闭源模型 | 强实验支撑 | §2.4 主结果表逐项对比+各阶段检查点分解 |
| 3 | Persona 驱动合成数据可精准提升目标技能 | 强实验支撑 | §4.2 移除消融:去 Persona 后 IFEval 72.8→53.6 |
| 4 | on-policy 偏好数据优于 off-policy | 仅有消融 | §5.3 图 11,无主表级验证 |
| 5 | "超越 GPT-4o-mini 与 Claude 3.5-Haiku"(70B 级) | 需谨慎 | 依赖自家评测套件的聚合平均分,且部分闭源分数为 MICE 插值估计【见第九章】 |
| 6 | 负面结果清单本身作为社区贡献 | 只是主张 | §8.2 仅初步实验,作者自陈未深挖 |
来源:论文 §1–2;背景解读为解读者补充。
学完本章你应能:①说出截至 2024 年 11 月 ChatBotArena top-50 中发布了后训练数据的模型数量及含义;②解释 Tülu 3 四阶段配方的分工;③指出它与 InstructGPT 流水线的两个本质差异。
开源社区能拿到 Llama 3.1 这样的强基座,却造不出同等水平的对话模型——Tülu 2、Zephyr-β 在 MATH、GSM8K、IFEval 上持续落后。瓶颈被锁定:后训练的数据与配方是拼图中最重要又最不透明的部分。论文给出硬证据:ChatBotArena 前 50 名中没有任何一个模型公开了其后训练数据(截至 2024-11-20)【论文声称】。
| 阶段 | 输入 | 产出 | 关键决定 |
|---|---|---|---|
| 1 数据策展(§3) | 公开数据+合成提示 | 约 2333 万条提示池 | 许可合规+对评测套件去污染 |
| 2 SFT(§4) | 939,344 条 prompt-completion | Tülu 3 SFT | 多轮配比实验定混合比 |
| 3 DPO(§5) | 354,192 条偏好实例 | Tülu 3 DPO | length-normalized DPO+on-policy 数据 |
| 4 RLVR(§6) | 29,946 条可验证提示 | 最终模型 | 用验证函数替代奖励模型 |
与 InstructGPT(第 25 篇)的两个本质差异【解读者推断】:①第三阶段不再用 RM 打分的 PPO,而用免 RM 的 DPO(RM 被推迟到第四阶段只当价值函数初始化);②终点从"人类偏好裁判"换成"程序化验证器"——凡是答案可机检的任务,人类彻底退出打分回路。
一句话记住本章:Tülu 3 卖的不是模型权重,而是"如何把任意强基座变成现代助手"的完整操作手册。
来源:论文 §3 及 Table 6/Table 7;漏斗计算为解读者手算。
学完本章你应能:①复述提示池三级漏斗的数字;②说明 8-gram 去污染的判定规则与阈值;③解释为什么排除 ShareGPT 连带弃用 Helpsteer2。
手算:939,344/23,327,961≈4.03%——策展比生成重要:两千万级的池子只为选出九十万条最合适的。【解读者补充】这个比例本身就是一条工程经验:合成数据便宜到可以海量生产,真正的稀缺资源是"挑选它们的评测纪律"。
用 Persona Hub 约 250K 个 persona(如"专注神经网络的机器学习研究者")条件化 GPT-4o 生成技能专项提示,避免合成数据的模式坍缩。精确指令遵循:覆盖 IFEval 定义的 25 种约束类型,人工写 33 条种子指令扩增出 29,980 对可验证指令-回答(If-Persona-Sft);数学约 22 万条、代码约 3.5 万条实例(数学解答由 GPT-4o 写、Python 解答由 claude-3-5-sonnet 写)。
比较全串/n-gram/嵌入三种匹配后选定 8-gram 匹配:测试实例中超过 50% 的 token 与同一训练实例共享 8-gram 即判显著重叠;任一训练集与任一评测集重叠超过 2% 实例即判污染并整体清洗。已重新发布的清洗结果:Evol CodeAlpaca→HumanEval 移除 3.5%;WildChat GPT-4 安全子集 5.4%;WildJailbreak 0.7%;WildGuardMix 1.1%;NuminaMath-TIR→MATH 高达 11.3%。
常见误读:"嵌入匹配更高级所以更好。"实测相反——嵌入法难以区分"分布相似"与"真正改写",而 8-gram 已能抓出"只改数字的数学题"这类换皮污染【论文原话转述】。数字对账①:11.3% 的污染率意味着若不去污,MATH 成绩里至少有一成题目模型可能背过——这直接威胁第五章所有 MATH 数字的可信度,也反衬去污染流程的价值。
一句话记住本章:两千万选九万的漏斗+8-gram 去污染,是这份配方里最不性感但最不可省的两道工序。
来源:论文 §4 各小节;成本换算为解读者手算。
学完本章你应能:①复述 SFT 超参并解释 sum loss bug 的机理;②背出四组移除消融的关键数字;③解释"最优单次运行≈最优 model soup"这一发现的实用意义。
naive 做法是把网上能找到的指令数据全倒进锅里。后果:安全数据会压制有用性、弱模型的回答风格会被模仿、某单项技能(如数学)挤占其他能力。SFT 配比的目标是在不伤害其他技能的前提下补齐目标短板——为此作者先训"单项技能专用模型"测出该项上限,再向通用模型逼近它。
| 移除项 | 均分变化 | 最受伤的指标 | 结论 |
|---|---|---|---|
| w/o WildChat | 60.1→58.9(−1.2) | AlpacaEval 2:12.4→7.5 | 真实用户聊天数据撑起通用对话 |
| w/o 安全数据 | 60.1→58.0(−2.1) | Safety:93.1→74.7 | 安全与其他技能正交,加了几乎不伤通用分 |
| w/o Persona 数据 | 60.1→58.6(−1.5) | IFEval:72.8→53.6(暴跌 19.2 点) | 合成数据精准命中目标技能 |
| w/o 数学数据 | 60.1→58.2(−1.9) | MATH:31.5→23.5;GSM8K:76.2→64.1 | 高质量专项数据大幅提升对应项 |
数字对账②:Table 9 报告 Tülu 3 8B SFT 均分为 60.1,而各阶段进度表报 60.6——两处相差 0.5,论文未解释,可能源于不同运行或聚合口径,本页如实标注此差异未能核验。【解读者推断】量级不影响任何定性结论。
发现 Transformers 库损失聚合缺陷:批内按 token 平均 vs 梯度累积时按样本平均,导致改变梯度累积设置会隐式改变每个 token 的权重——长回答与短回答的相对影响力随硬件配置漂移。修复:改用求和损失(sum loss)使所有 token 权重相等,并相应调低学习率(5e-6 最优);训 2 epoch 后继续训练无收益。这张"债单"提醒我们:多卡训练框架里的每一行聚合代码都在悄悄定义你的目标函数【解读者推断】。
8B 五个随机种子的均分在 59.8–60.1 间波动,最佳双种子 soup 仅 60.2——seed 差异真实存在,但 soup 不比挑最好的单次运行更强。实用结论:与其做模型平均,不如多跑几次挑最好【实验支持】。
最新版报告:8B DPO 训练 10 小时/8 张 H100;70B DPO 19 小时/64 卡。SFT 成本同量级(数十 GPU·时)。手算:70B DPO=19×64=1216 GPU·h——后训练确实比预训练(万卡·月)便宜几个数量级,延续了 InstructGPT"对齐很便宜"的结论。
一句话记住本章:SFT 阶段的胜负手不是算力而是配比实验纪律:安全正交、Persona 精准、真实聊天保底线。
来源:论文 §5;公式符号表为解读者整理。
学完本章你应能:①写出 length-normalized DPO 目标并与标准 DPO 对照指出差异;②描述偏好数据三阶段管线的每一步;③用数字回答"PPO 还是 DPO";④复述 DPO 最终超参。
| 符号 | 它是什么 | 直觉 |
|---|---|---|
| yc/yr | chosen/rejected 回答 | 偏好对中的赢家与输家 |
| β | KL 强度系数(最终取 5) | 隐式 RM 与参考策略之间的缰绳松紧 |
| πθ/πref | 训练策略/参考策略 | DPO 同时训练隐式奖励模型与策略,无需显式 RM 与在线采样 |
| ÷|y| | 长度归一化 | 抵消"人类与模型都偏爱长回答"的长度偏置——否则模型学会啰嗦取胜 |
算法选型实验(Table 17,UltraFeedback 上、早期 SFT 底座):SimPO 最高 52.9、标准 DPO 55.2、PPO 55.5、length-normalized DPO 最高 57.3(LR 5e-7、β=5、1 epoch、batch 32)——只有它超过了 55.7 的底座分【实验支持】。最终超参(Table 19):8B 用 LR 5e-7/batch 32,70B 用 LR 2e-7/batch 128,β=5,线性调度,1 epoch,max len 2048。
①选提示(SFT 用过的+同源未用的);②每条提示从模型池随机抽 4 个模型各生成一答(池中包含 Tülu 3 SFT 自身——这就是 on-policy 成分);③GPT-4o-2024-08-06 当裁判,按 helpfulness/instruction-following/honesty/truthfulness 四维各打 1–5 分,取均值最高者为 chosen、低者中随机抽 rejected(Argilla 式二值化)。最终混合:8B 用 271,409 条、70B 用 334,302 条。
同一批提示、同一 RM 设置下:PPO 能达到与 DPO 相近(略低)的分数,但 PPO 约 28 小时/两个节点 vs DPO 约 4 小时/单节点——7 倍墙钟时间差。决策:偏好微调全程用 DPO,把 PPO 留给第六章 RLVR【实验支持】。另有两个降显存技巧:预计算并缓存参考模型的 log-probs(免驻留参考模型)、chosen/rejected 分开前向(免拼接翻倍 batch)。
常见误读:"DPO 是穷版 PPO,效果一定差。"受控实验显示两者接近,且 DPO 的迭代速度快 7 倍——在需要大量配比实验的研发场景里,迭代速度就是实验吞吐量,这是方法论层面的优势而非妥协【解读者推断】。
一句话记住本章:DPO 阶段赢在数据管线(on-policy+unique prompts+好裁判),算法上 length 归一化是唯一必要的修正。
来源:论文 §6 及附录 B.4/E;手算为解读者完成。
学完本章你应能:①写出 RLVR 目标函数并说出 α 的取值;②背出三个验证数据集的规模;④复述五条 Key Findings;⑤解释异步 RL 架构为什么必须"用次新数据训练"。
RMB 式奖励在数学/格式类任务上有三个毛病:人类标注员未必会做题(判不了对错只能凭观感)、贵(每个新提示都要人标)、可被 hack(长得像对的就得高分)。而这些任务的答案明明可以程序化验证——那就别雇裁判了,写个 checker。
| 符号 | 它是什么 | 直觉 |
|---|---|---|
| v(x,y) | 确定性验证函数 | GSM/MATH 抽取末尾答案做精确匹配;IF 用约束模板逐条核验 |
| α | 正确时的常数奖励 | 试点实验取 α=10,未再调参 |
| β·KL 项 | 与 InstructGPT 同源的缰绳 | 防过优化的机制不变,变的是奖励来源 |
与 RLHF 的结构对照【解读者补充】:目标形式与第 25 篇的 KL-constrained RLHF 完全同构,唯一的替换是 rθ(学习出来的近似裁判)→ v(零误差但覆盖面窄的真裁判)。代价:v 只存在于有标准答案的域——这正是它只能当"终段专项训练"而非主力算法的原因。
| 提示集 | 数量 | 验证方式 |
|---|---|---|
| GSM8K Train | 7,473 | 抽取答案精确匹配(附标准 8-shot CoT 提示) |
| MATH Train | 7,500 | 抽取答案按 flex 规则匹配(附 3-shot CoT) |
| IF 可验证约束 | 14,973 | 每种约束模板一个专用验证器 |
| 合计 | 29,946 | — |
手算:7,473+7,500+14,973=29,946 ✓(Table 21)。消融实验训约 100,000/7,473≈13.4 个 epoch(论文写"roughly 13")✓。实现细节沿用 Huang et al. (2024a) 最佳实践:价值模型从通用 RM 初始化、RM/RL 阶段关闭 dropout(保证两阶段 log-prob 一致,否则首个 PPO epoch 概率比全被 clip、梯度为零)、不产生 EOS 则罚 −10 分、优势白噪化。
8B:GSM8K 84.3→87.6、IFEval 81.1→82.4、MATH 42.0→43.7(个别 run 冲到 GSM8K 89.4、IFEval 84.8 但拖累其他指标被弃用);70B:MATH 62.3→63.0、IFEval 82.6→83.2、GSM8K 持平 93.5(已近饱和)。70B run 全程 KL 远低于 1,归功于更低的学习率。成本(最新版):8B RM 训练 9h/8 卡,8B RLVR 65h/8 卡,70B 60h/48 卡,405B 46h/256 卡。架构:Ray 分配专用推理 GPU 跑 vLLM(PagedAttention),learner 并行做梯度更新(ZeRO-3);异步训练可能吃到过期数据,故固定使用次新(second-latest)推理数据换取可复现性。
一句话记住本章:RLVR=RLHF 的骨架+确定性的心脏:在答案可机检的域里,用一个 if 语句取代六 billion 参数的裁判。
来源:论文 Table 2–5、§7;解读为解读者补充。
核心技能 × 两套评测:知识(MMLU/PopQA/TruthfulQA ↔ 未见 MMLU-Pro/GPQA)、推理(BBH/DROP ↔ AGIEval)、数学(MATH/GSM8K ↔ Deepmind Mathematics)、编程(HumanEval(+)/(↔BigCodeBench)、指令遵循(IFEval/AlpacaEval 2 ↔ 自建的 IFEval-OOD/HREF)、安全(6 任务均值)。开发期间从不查看未见集分数——这是对"在自己设计的评测上调参"这一根本性质疑的制度性防御。未见集五大发现:总体泛化良好;MATH 训练迁移不到 Deepmind Mathematics;各家模型普遍过拟合 IFEval;知识回忆泛化依赖配方;指令遵循在不同约束类别间差异大。
| 模型 | 均分 | GSM8K | MATH | IFEval(prompt loose) | AlpacaEval 2 LC |
|---|---|---|---|---|---|
| Tülu 3 8B(SFT 60.6→DPO 64.7→RLVR 65.1) | 65.1 | 87.6 | 43.7 | 82.4 | 34.5 |
| Llama 3.1 8B Instruct | 62.9 | 83.4 | 42.5 | 80.6 | 24.2 |
| Qwen 2.5 7B Instruct | 66.5 | 83.8 | 69.9 | 74.7 | 29.0 |
| Tülu 3 70B(SFT 72.6→DPO 76.2) | 76.2 | 93.5 | 63.0 | 83.2 | 49.8 |
| Llama 3.1 70B Instruct / Qwen 2.5 72B Instruct | 74.1 / 72.8 | 93.7 / 89.5 | 56.4 / 75.9 | 88.0 / 87.6 | 33.4 / 47.7 |
405B(§8.1,最新版 Table):RLVR 后不含安全均分 80.0、含安全 80.7,对比 Llama 3.1 405B Instruct 79.0/78.1、DeepSeek V3 79.0/75.9、GPT-4o(11-24) 80.5/81.6——配方扩展到旗舰规模依然成立。
一句话记住本章:均分赢了一半对手、单项输给专业选手(Qwen 数学、Llama IFEval)——"均衡的多面手"是这份配方的真实画像。
"超越 GPT-4o-mini 与 Claude 3.5-Haiku"建立在自家评测套件的等权均分之上。三点折扣【解读者推断】:①闭源模型的部分格子(TruthfulQA 等)是 MICE 插值估计而非实测(表中 ♢ 标记);②均分把 PopQA 这类检索型任务与 MATH 这类推理型任务等权相加,权重选择本身就利于配比全面的 Tülu 3;③闭源模型的系统提示/采样配置是否公平对齐,论文未逐一披露。结论应读作"在这套评测协议下追平",而非产品意义上的全面超越。
对比对象分层清晰:同基座(Llama 3.1 Instruct、Hermes 3)、异基座同尺寸(Qwen 2.5、Ministral、Gemma 2)、在 instruct 版上再微调的(Nemotron)——论文明确标注了这一点,是同类报告里少见的诚实。但要警惕:所有开发期决策(配比、超参、checkpoint 选择)都是在开发集上做出的,开发集分数存在选择性乐观;未见集虽未偷看,但它是同一批人选的,无法排除"选题品味过拟合"。RLVR 的 GSM8K 提示直接取自 GSM8K Train 集——训练/评测同源,虽然用的是 train split 不算泄题,但分布匹配度天然占优【解读者推断】。
正面:后训练成本极低(70B DPO 约 1216 GPU·h 手算)。背面:这条配方背后是大量失败的探索性实验(配比扫描、九组偏好消融、β 扫描),这些实验成本未计入;且配方强依赖 GPT-4o 当数据引擎与裁判——"开放"的是配方,不是对前沿模型的独立性。
来源:论文 §8.2;评述为解读者补充。
做法:当前策略采两条回答→RM 判偏好→标准 DPO 更新。用 Skywork 82K 偏好数据训 RM,再在数学方向续训;从 Tülu 3 DPO checkpoint 出发跑 200K episodes:GSM8K 无/几乎无提升,MATH 反而退化(扫过多种采样温度与 KL 系数)。作者坦承初试不利后未深挖。
对每条 SFT 提示采 n 个回答、用 RM/LLM 裁判留最优再做偏好优化。发现:相对所需算力收益微小;强裁判是命门——公开模型难以从候选中挑出真最优;把原始回答也放进候选池远好于只在新采样中挑。这两条负面结果与第六章形成互证:想要"在线、自我改进"式的闭环,要么用真验证器(RLVR),要么暂时死心。
一句话记住本章:发表失败尝试是稀缺美德——这两段让读者少烧几千 GPU 时。
仅从摘要三个事实出发——"基座是 Llama 3.1"、"三阶段 SFT/DPO/RLVR"、"大规模去污染"——推演:为什么 DPO 不能像 InstructGPT 的 PPO 那样放在最后?为什么 RLVR 必须最后?为什么去污染必须发生在一切训练之前?
①DPO 是离线方法,偏好对由固定管线预先制好;若放最后,则无法利用 RLVR 阶段之后模型的新行为——在线自我改进已被证明不可靠(§8.2),所以离线偏好阶段必须在 RL 之前吃掉(2 分)。②RLVR 用 PPO 在线采样,能针对当前模型残余弱点定向拔高(GSM8K/MATH/IFEval 的最后一跳),且其奖励不依赖人类,适合当收官微调;但它只覆盖可验证域,不能承担全面对齐(2 分)。③一旦训练数据与评测重叠,后续所有阶段的所有决策都被污染且不可逆——去污染必须在任何"看着评测调模型"的动作之前完成(2 分)。
核对:(a) RLVR 数据三项之和;(b) RLVR 消融 epoch 数;(c) SFT 漏斗百分比;(d) 70B DPO 的 GPU·时;(e) Persona IF 消融前后 IFEval 差值。
(a) 7,473+7,500+14,973=29,946 ✓。(b) 100,000/7,473≈13.38,论文称 roughly 13 ✓。(c) 939,344/23,327,961≈4.03%。(d) 19h×64=1,216 GPU·h(8B DPO 为 10×8=80 GPU·h,比值≈15.2×)。(e) 72.8−53.6=19.2 个百分点——四组消融中单项跌幅最大,支撑"合成数据精准命中目标技能"。
奖励只需保持"正确≫错误"的序关系,PPO 的优势白噪化会把尺度归一,绝对值不重要,故不值得花算力调(2 分)。α=1 时若与 KL 项的相对尺度失衡(β 固定),等效于加大 KL 权重、策略更保守、可验证奖励爬升更慢——相当于隐式收紧缰绳(2 分)。要点:识别出"尺度不变性+白噪化"才给满分。
①冷启动问题:基座模型答对率太低,稀疏的二值奖励几乎没有正样本梯度信号——RLVR 有效的前提是起点已经"够得着"正确(这正是它放在 SFT/DPO 之后的原因,§6.2 发现弱起点都要更大 KL)。②覆盖面问题:验证器只存在于数学/格式域,替掉 SFT 意味着对话、写作、安全等绝大多数行为完全没有训练信号,模型不会获得助手的基本形态。
实验设计:①在未见集 IFEval-OOD(Pass@1)上评估同一 checkpoint,看约束类型外推后的保持率(2 分);②按约束类别分解 IFEval-OOD 成绩,检查训练集中 Persona IF 覆盖的 25 类约束是否系统性高于未覆盖类别(2 分);③用去污染工具反向审计 Persona IF/IF-augmented 与 IFEval 的 8-gram 重叠率并汇报(2 分)。预测:论文自己的未见集发现已表明"模型普遍对 IFEval 过拟合",故预期 OOD 保持率显著低于开发集分数,但绝对水平仍优于基座 instruct 版——即"部分真实、部分评测红利"。(开放题,交给 LLM 裁判按要点给分。)
α=10,来自试点实验,未做进一步调参。(机批:10)
把 chosen/rejected 各自的 log 概率比除以各自的序列长度 |y|,其余不变。
MATH(31.5→若污染则虚高):11.3% 的 NuminaMath-TIR 与 MATH 评测集 8-gram 显着重叠,等于把考卷喂进了训练集。其余指标(如 HumanEval)对应的污染源不同(Evol CodeAlpaca→HumanEval 仅 3.5%),且各评测集有自己的去污审计。【要点:指认 MATH、引用 11.3% 各 1 分】
不行。PPO 的参考策略 KL 逐 token 惩罚作用在策略实时生成的 rollout 上,生成内容随训练动态变化,无法预先枚举并缓存;DPO 的 chosen/rejected 序列是固定数据集,才能离线预算。技巧的有效性取决于"待评分文本是否静态"。【要点:区分动态 rollout 与静态数据对各 1 分】
①以偏概全:Persona IF 使 IFEval 大涨(消融中去掉它跌 19.2 点),Persona 方法在指令遵循方向被证实有效;②混淆了"数据类型"与"生成方法":失败的可能原因是数学偏好的裁判(LLM 打分)难以可靠判定数学解答优劣,而非 persona 合成提示本身无效——数学的正确性本应交给验证器(RLVR 正是这么做的)。【每点 2 分】
推断:SFT 形成能力基底与格式(最大跳跃 +60.6),DPO 完成行为对齐与偏好打磨(+4.1,主要落在 AlpacaEval 12.4→33.5、Safety 下降换取均衡),RLVR 做可验证域的最后拔高(+0.4 均分但 GSM8K +3.3、IFEval +1.3)(3 分)。验证:IFEval 轨迹 72.8→81.1→82.4,大头在 DPO(对齐"听指令"的行为)+RLVR 收尾(可验证约束精修);GSM8K 76.2→84.3→87.6,DPO 与 RLVR 各贡献一半,因为数学既需要偏好对齐(过程呈现)也需要答案级强化(2 分)。注意均分增量递减不代表边际价值递减——RLVR 的 +0.4 全部集中在最难提分的硬骨头上。
| 预评贡献 | 预评 | 读后修正 | 理由 |
|---|---|---|---|
| RLVR 新方法 | 强 | 维持强,但限定范围 | 消融充分;然仅验证了数学+IF 两域,泛化边界未知 |
| 超越闭源模型(70B) | 谨慎 | 维持谨慎 | 自家套件等权均分+MICE 插值的对手分,协议依赖性强 |
| on-policy 偏好数据 | 仅消融 | 维持仅消融 | 图 11 支持方向性结论,但无受控的主表级对照 |
| 负面结果清单的贡献价值 | 主张 | 上调至部分实证 | Online DPO 有具体数字(200K episodes、GSM8K 平/MATH 退),非纯叙事 |