本页标注约定:【论文声称】【实验支持】【解读者推断/补充】三种标签永不混淆。所有数字复述自论文原文(arXiv v2 正文与附录,蒸馏表取自 arXiv v1/官方仓库镜像),未做外部验证;凡未能核验处均已显式标注。
| 摘要中的短语 | 对应原文章节 | 对应本页精读章节 |
|---|---|---|
| "推理能力可通过纯 RL 激励,无需人工标注的推理轨迹" | §1 引言、§2 DeepSeek-R1-Zero | 第二章 · R1-Zero 与 GRPO |
| "涌现出自我反思、验证、动态策略调整等高级推理模式" | §2.3、附录C 自进化分析 | 第二章 · aha moment 小节 |
| "在数学、编程竞赛、STEM 等可验证任务上超越监督学习对标模型" | §3 表3(各阶段成绩)、附录D 主结果表 | 第三、四章 · 流水线与评测 |
| "大模型的涌现推理模式可系统性迁移给小模型" | §3.2 蒸馏部分、蒸馏评估表 | 第五章 · 蒸馏 |
| "可验证性边界、语言混合、提示敏感"等局限 | §6 结论与局限 | 第六章 + 批判性阅读 |
| # | 声称的贡献 | 证据预评 | 理由 |
|---|---|---|---|
| 1 | 纯 RL(跳过 SFT)即可激发强推理:R1-Zero 在 AIME 2024 从 15.6% 升至 77.9% | 强实验支撑 | 训练曲线(图1)+ 多基准交叉验证(Codeforces、GPQA 同步上涨) |
| 2 | 反思/验证/"wait"等行为是 RL 涌现的,而非人教的 | 有观察证据,机制未证 | 附录C 给出行为频率随训练步数的变化曲线;但"涌现"与"从预训练数据中放大已有模式"无法用本文数据区分 |
| 3 | R1 整体达到与 OpenAI-o1-1217 相当的水平 | 自评对比表 | AIME/MATH-500 领先,GPQA/SimpleQA 落后;且 o1 一侧有8个基准无数据 |
| 4 | 蒸馏比小模型直接做大规模 RL 更划算 | 单一对照组 | 只有 Qwen-32B 一个对照点(R1-Zero-Qwen-32B vs R1-Distill-Qwen-32B) |
| 5 | 神经奖励模型会被 reward hacking,故坚持规则奖励 | 原则性主张 | 正文与附录均未给出具体被 hack 的案例数据 |
主干线:GRPO(§2.1)→ 规则奖励(§2.2)→ R1-Zero 涌现现象(§2.3)→ 为什么 Zero 不够好(§3 开头)→ 四阶段流水线(§3.2)→ 各阶段成绩(表3)→ 蒸馏结论。枢纽节点是 GRPO——它同时被 R1-Zero 和 R1 两个阶段使用,且其"去价值模型"的设计动机要靠附录 A.3 的 PPO 对比才能真正读懂,值得慢读。
必读:§2 全部、§3.2、表3、蒸馏表。可跳:附录 B.1 RL 基础设施(做系统才需要)、D.3 安全报告。跳读代价:不了解基础设施就无法理解"为什么规则奖励模块可以异步执行"这类工程细节,但不影响理解方法论。
传统后训练范式是"SFT 再 RL"(InstructGPT 以来二十年不动摇的标准动作)。R1 论文 §1 与附录A.2 指出它的两个痛点:① 人类标注的长思维链稀缺且昂贵——让人类写出成千上万条带验证与回溯的真实解题轨迹根本不可扩展;② 更深的一层:模仿人类示范会把模型锁死在人类的思维方式里——人类示范常常省略反思与验证步骤,模型学到的上限就是示范的上限。R1-Zero 的激进之处在于直接砍掉 SFT:在 DeepSeek-V3-Base 上从头做纯 RL,唯一的引导是一个要求输出格式为 <think>…</think><answer>…</answer> 的模板(表1)。
| 符号 | 它是什么 | 直觉 |
|---|---|---|
| q, oi | 问题 q 与同一问题下采样的 G 条输出 | "一组考生做同一道题" |
| ratio = πθ(oi|q)/πθold(oi|q) | 新旧策略对该输出的概率比 | 本次更新想让这条回答变得多"更可能" |
| clip(·, 1−ε, 1+ε) | 把 ratio 截断在信任域内 | 单步更新不许走太远(PPO 血统) |
| Ai | 组内相对优势(见下式) | 这条回答比同组平均好多少 |
| DKL=πref/πθ − log(πref/πθ)−1 | KL 散度的无偏估计量(k3 型) | 别离参考策略太远;注意它是加在损失里的逐样本项 |
GRPO 与 PPO 的关键差异(附录A.3):PPO 用一个与策略同尺寸的价值网络(critic)通过 GAE 估计优势——这意味着双倍的显存与计算,而且当输出是长思维链时,"根据半截回答预测最终得分"几乎不可能(模型中途会反思、推翻自己);GRPO 干脆扔掉 critic,用同题 G 条采样的奖励均值/方差做基线归一。另一处差异:PPO 把 KL 作为逐 token 的稠密奖励累加进回报,隐含惩罚长回答——这恰好压制"思考变长";GRPO 把 KL 直接放进损失,不做长度惩罚。消融证据 附录A.3 图4:在 16B MoE(激活2.4B)上跑 MATH 任务,PPO 用默认 λ=0.95 时显著差于 GRPO,调到 λ=1.0 才接近——结论是 PPO 能追平但需要额外调参成本+价值模型开销。
手算验证优势归一(解读者补充):设 G=4,某题四条回答的规则奖励为 {1, 1, 0, 0}。mean=0.5,std=√((0.25×4)/4)=0.5(总体标准差)。则两条正确回答的 A=(1−0.5)/0.5=+1,两条错误回答 A=−1。若换成 {1,1,1,0}:mean=0.75,std≈0.433,三条正确的 A≈+0.577、错误的 A≈−1.733——错误回答受到的推力反而更大。这个非线性正是 GRPO 的微妙之处:组内越接近全对,单个错误的惩罚权重越大。【解读者推断】这也解释了为什么训练后期"难题突破"能带来超线性收益。
R1-Zero 训练配置数字(§2.1 原文):lr=3e-6;KL 系数 β=0.001;采样温度1;每题采 G=16 条;最大生成长度 8.2k 步前为 32,768 tokens、之后放宽到 65,536;总训练 10,400 步 ≈ 1.6 个 epoch;每步32题、batch size 512;每400步刷新一次参考模型;每次 rollout 生成8192条输出切16个 minibatch、只训1个内层 epoch。
准确性奖励:数学题要求最终答案放入规定格式(如 \boxed{}),规则匹配即得1否则得0;代码题用编译器跑预置测试集。格式奖励:思维过程必须包在 <think> 标签内。刻意缺席的是神经奖励模型(无论 outcome 还是 process PRM)——理由写在原文:大规模 RL 下神经 RM 会遭遇 reward hacking,重训 RM 又增加算力与管线复杂度。这是全文的方法论基石,也是与 GPT-4 报告中 RBRM(第39篇 §4.3)异曲同工的选择。
三个【实验支持】的事实:① AIME 2024 平均 pass@1 随训练从 15.6% 升到 77.9%;配合 self-consistency 解码(Cons@16)达 86.7%,超过人类参赛者平均水平。② 平均回答长度持续增长——没人教它"多想一会儿",它自己学会了用更多 token 换正确率。③ 中间版本出现著名的 aha moment(表2):在解一道含嵌套根号的方程时,模型在推导中途写下 "Wait, wait. Wait. That's an aha moment I can flag here."——随后推翻重来。附录C.2 显示这与训练中 "wait" 一词使用频率的突增相对应。
常见误读:① "aha moment 说明模型有了意识/顿悟"——原文自己的措辞是"an anthropomorphic tone",附录B.3 也明确承认拟人化的思维口吻是 DeepSeek 工程加工的产物,不应过度解读为类人智能;② "涌现=凭空产生新能力"——更保守的解释是:RL 从预训练已具备的能力分布中选择并放大了反思模式(V3-Base 预训练语料含大量数学与代码推理痕迹,见附录A.1);本文数据无法区分这两种解释;③ "回答变长=思考更多"——长度增长也可能混入重复与冗余,论文承认存在 overthinking(见§6)。
一句话记住本节:R1-Zero 证明了一件事——只要奖励可靠可验证,去掉所有人类示范,模型也会自己走向"更长、更爱反思"的解题策略。
失效模式先行:R1-Zero 有三个不能上架的毛病——可读性差、中英文混杂(V3-Base 语料以中英为主,无语言约束时 CoT 内部随意切换)、只会做题(写作、开放问答等通用能力没被规则奖励覆盖)。R1 的流水线就是针对这三个病灶设计的四次手术。
| 阶段 | 做什么 | 为什么 | 关键数字 |
|---|---|---|---|
| ① 冷启动 SFT | 用数千条长CoT样本微调 V3-Base 得初始 actor | 给RL一个可读、第一人称、语言一致的起点(产品驱动动机) | "thousands of"条冷启动数据(精确数量未披露);温度1.0采样+sympy校验+人工两轮审核 |
| ② 推理导向 RL | GRPO 继续训推理任务,加语言一致性奖励 | 保留 Zero 式推理增益,同时治语言混杂 | lr 3e-6、β=0.001、clip ε=10、G=16、max len 32,768 |
| ③ 拒绝采样 + 全量 SFT | 用②的 checkpoint 生成新SFT数据,混合非推理数据再微调 V3-Base 重来 | 把推理能力注入的同时补通用写作能力 | 600k 推理 + 200k 非推理 ≈ 800k 样本,训2个epoch |
| ④ 全场景 RL | 混合推理规则奖励+通用RM奖励再训 | 对齐有用性与无害性,兼顾推理 | 1700 步;最后400步才加入通用偏好奖励;温度降到0.7 |
数字对账:600k+200k=800k ✓(附录B.3.3 口径一致)。一处对不上:§2.1 说 R1-Zero 训了10,400步×每步32题=332,800次题目抽取,折合1.6个epoch,反推数据集约20.8万条;但附录B.3.1 列出的推理RL数据为 数学26k+代码17k(+bug修复8k)+STEM22k+逻辑15k ≈ 80–88k 条。两个口径对不上——可能的解释:epoch 统计包含了多轮数据复用或按 rollout 输出条数而非题目数计算,论文未给出统一口径,此处如实存疑。
目标语言词占比,直接加入最终奖励。附录B.6 的消融显示:加它会轻微降低性能,但换来可读性——一个明确的"性能换体验"交易。另一个值得停下的细节是第一阶段 clip 比例取 ε=10(正常PPO默认0.1–0.2!):原文解释是 clip 太小会截断大量 token 的梯度导致性能下降,太大则训练不稳——这是长CoT RL 特有的调参发现,因为一条上万 token 的轨迹里只有极少数 token 承载有效信号,过紧的信任域等于把梯度掐死。第二阶段温度从1降到0.7,因为高温下生成开始不连贯。以上均为原文披露的超参事实;"为何恰是10而非8"这类具体值的选择依据论文未说明。
总奖励 = Rewardreasoning(规则)+ Rewardgeneral(RM+格式)+ Rewardlanguage(式8–10)。关键操作:1700步中只有最后400步才引入基于模型的偏好奖励——因为"更多步数的模型偏好奖励会导致 reward hacking"(§3.2.2)。Helpful RM 用66,000对偏好数据训练(DeepSeek-V3 当裁判打分、每对查4次去位置偏差、Δ>1才保留、chosen/rejected长度对齐);Safety RM 用106,000条 safe/unsafe 标注做逐点分类。这两个数字与通用RL数据的66k helpfulness+12k harmlessness prompts 相互印证(附录B.3.1)。【解读者观点】"规则奖励可以无限训,RM 奖励只能短促使用"是这个 pipeline 最诚实的自我认知。
| 基准 | R1-Zero | Dev1(冷启动) | Dev2(推理RL) | Dev3(SFT) | R1(最终) |
|---|---|---|---|---|---|
| AIME 2024 (pass@1) | 77.9 | 59.0 | 74.0 | 78.1 | 79.8 |
| MMLU (EM) | 88.8 | 89.1 | 91.2 | 91.0 | 90.8 |
| MMLU-Pro (EM) | 68.9 | 74.1 | 83.8 | 83.1 | 84.0 |
| IF-Eval (Prompt Strict) | 46.6 | 71.7 | 72.0 | 78.1 | 83.3 |
| AlpacaEval 2.0 (LC-winrate) | 24.7 | 50.1 | 55.8 | 62.1 | 87.6 |
| GPQA Diamond (pass@1) | 75.8 | 66.1 | 70.7 | 71.2 | 71.5 |
| LiveCodeBench (pass@1-CoT) | 50.0 | 57.5 | 63.5 | 64.6 | 65.9 |
| Codeforces Rating | 1444 | 1534 | 1687 | 1746 | 2029 |
| SWE Verified | 43.2 | 39.6 | 44.6 | 45.6 | 49.2 |
这张表讲的故事(原文 §4 分析+解读者补充):① Dev1 的 AIME 从77.9跌回59.0——冷启动数据太少,SFT 把 Zero 学到的一部分推理能力"洗掉了",这是全文最诚实的一个数据点,证明 SFT 不总是无害的;② Dev2→Dev3 的跃升主要发生在 AlpacaEval/Aider-Polyglot(+6.3/+19.2)——非推理数据补的是通用与工程能力;③ 最终 R1 相对 Dev3 的增量集中在 AlpacaEval (+25.5)、ArenaHard (+16.7)——最后400步的偏好RL买的是"用户喜欢";④ GPQA 反向移动:Zero 的 75.8 是全行最高,成品 R1 只有71.5——博士级科学问答似乎与"可读性/指令遵循"存在此消彼长。【解读者推断】可能与 GPQA 需要密集领域知识、而长CoT风格稀释了知识调用效率有关,论文未解释。
| 基准 | o1-1217 | DeepSeek-R1 | 谁领先 |
|---|---|---|---|
| AIME 2024 (pass@1) | 79.2 | 79.8 | R1 |
| MATH-500 (pass@1) | 96.4 | 97.3 | R1 |
| MMLU (pass@1) | 91.8 | 90.8 | o1 |
| GPQA Diamond (pass@1) | 75.7 | 71.5 | o1 |
| SimpleQA (Correct) | 47.0 | 30.1 | o1(差距最大项) |
| LiveCodeBench (pass@1-CoT) | 63.4 | 65.9 | R1 |
| Codeforces (Rating / Percentile) | 2061 / 96.6 | 2029 / 96.3 | o1 |
| SWE Verified (Resolved) | 48.9 | 49.2 | R1(持平级) |
| Aider-Polyglot (Acc.) | 61.7 | 53.3 | o1 |
| Drop (3-shot F1) | 90.2 | 92.2 | R1 |
注:MMLU-Redux/-Pro、IF-Eval、FRAMES、AlpacaEval、ArenaHard、CNMO 2024 及全部中文基准共8项,o1-1217 一侧在原表中无数据——比较是不完整的。评测设置:最大生成32,768 tokens,temperature=0.6、top-p=0.95,每查询64响应估 pass@1。数字取自论文配套官方发布材料(arXiv HTML 版该表位于附录 D.2,本轮抓取未能完整核验附录表格,故以官方 README 镜像为准并在此声明)。
一句话解读:数学与竞赛编程基本打平甚至略胜,知识与事实性(MMLU/GPQA/SimpleQA)明显落后——尤其 SimpleQA 差17个百分点,说明纯 RL 路线买到的是"推理过程质量",不是"事实记忆广度"。
做法:仅用 SFT(约800k样本中由 R1 生成并被拒绝采样过滤的推理数据)微调 Qwen/Llama 系列基座,不对小模型做 RL。结果:
| 蒸馏模型 | AIME 2024 pass@1 | MATH-500 pass@1 | GPQA Diamond | LiveCodeBench | Codeforces Rating |
|---|---|---|---|---|---|
| R1-Distill-Qwen-1.5B | 28.9 | 83.9 | 33.8 | 16.9 | 954 |
| R1-Distill-Qwen-7B | 55.5 | 92.8 | 49.1 | 37.6 | 1189 |
| R1-Distill-Qwen-14B | 69.7 | 93.9 | 59.1 | 53.1 | 1481 |
| R1-Distill-Qwen-32B | 72.6 | 94.3 | 62.1 | 57.2 | 1691 |
| R1-Distill-Llama-8B | 50.4 | 89.1 | 49.0 | 39.6 | 1205 |
| R1-Distill-Llama-70B | 70.0 | 94.5 | 65.2 | 57.5 | 1633 |
核心对照实验:对 Qwen-32B-Base 直接跑10k+步的大规模RL(得到 R1-Zero-Qwen-32B),只达到 QwQ-32B-Preview 水平;而 R1-Distill-Qwen-32B 在所有基准上显著更强。作者由此给出两条结论(原文转述):其一,把强模型蒸馏进小模型效果优异,小模型自己做大规模RL耗算力还未必赶得上蒸馏;其二,蒸馏经济有效,但要推进智能边界仍需更强的基座+更大规模RL。【解读者推断】一个常被忽略的含义:蒸馏数据本身就是 R1-Zero/R1 的 RL 产物——所以"蒸馏赢过小模型RL"并非否定 RL,而是说RL 的探索成本只需由一个大模型支付一次。
常见误读:"R1-Distill 就是小号 R1"——错。蒸馏版没有经历任何 RL,也没有完整的通用对齐流水线;它们是"用 R1 的思维链做纯 SFT"的产物,行为特征(如超长思考)来自数据分布而非自身优化。
长CoT的直接代价是推理 token 数:R1 解一道 AIME 题可能生成数千至上万思考 token,而普通模型几十个 token 直接作答。论文承认 overthinking 存在但没有给出平均 token 消耗或延迟数字。训练成本同样未在此文中报告(v2 附录设有 Training Cost 小节,本轮抓取未能获取其数值,如实标注未核验)。【解读者推断】结合基座为671B MoE(激活37B)的公开信息,RL 阶段的 rollout 开销(每步512条、最长65k token 的生成)不会便宜——"低成本激发推理"是相对人类标注而言的成本优势,不是绝对便宜。
只给三个短语:"纯RL"、"语言混杂"、"few-shot 有害"——推演这篇论文为什么必然长成现在的四阶段形状。(要点见折叠块。)
"纯RL"⇒必须解决奖励可靠性⇒只能选规则奖励⇒任务范围被限制在可自动验证的数学/代码/STEM/逻辑⇒写作等通用能力缺失,需要后续阶段补救。"语言混杂"⇒根源在基座语料分布⇒两条修法:冷启动SFT立格式+语言一致性奖励续保⇒于是有阶段①②。"few-shot有害"⇒说明模型的行为分布已被RL重塑得远离常规对话分布⇒部署时必须围绕零shot重新设计产品接口⇒也反向印证了为什么冷启动要用"第一人称对话式思维链"来锚定可用性。评分要点:三组因果各占30%,能把三者串成"方法选择↔副作用↔补救"闭环者满分。
1) 动机:人类示范限制探索空间、引入认知偏置(§1);不这样做:得到 InstructGPT 式模型,推理上限=示范上限。论据强度:正面证据充分(AIME 15.6→77.9),但缺少"同基座加SFT再RL"的严格消融——Dev1 其实近似这个对照,但它同时换了目标函数与奖励集合,不算干净实验。
2) 用PRM可得过程级监督、可能更快收敛、覆盖不可验证任务;失去的是抗 hack 性与管线简洁性。论文论据不足(无案例),但与 GPT-4 报告 RBRM 的动机互证。给分:双向损益各占一半,指出"论文未给出 hack 实例"加分。
3) 因为模型偏好奖励的训练信号会随步数累积地被利用(reward hacking),短脉冲式使用把累计暴露压到最低;代价是通用对齐深度受限(SimpleQA/事实性短板可能与此有关)。
4) 论文给的实证理由是小模型RL跑不过蒸馏;外部有效性存疑点:Qwen 与 R1 的蒸馏数据分布高度匹配(同为中文友好的数学代码生态),Llama-8B 蒸馏效果(AIME 50.4)明显弱于同级 Qwen-7B(55.5)已经暗示了基座匹配度的作用。给分:能引表中 Llama/Qwen 差距作为证据者佳。
| 贡献 | 预评 | 读后修正 | 理由 |
|---|---|---|---|
| 纯RL激发推理 | 强实验支撑 | 维持★★★ | 训练曲线+跨基准一致性+Dev序列提供天然消融 |
| 涌现反思行为 | 有观察证据 | 维持★★,加注 | "wait"频率曲线是相关性证据;因果归属未决,且作者自己在冷启动节承认部分拟人口吻是工程产物 |
| 整体对标 o1 | 自评对比 | 下调至★★ | 8项基准缺失对手数据;事实类短板显著 |
| 蒸馏优于小模型RL | 单一对照 | 维持★★ | 只有一个基座家族的对照点,但结论方向可信 |
| 神经RM必被hack | 原则主张 | 维持★ | 全文无实例、无数据,属于经验性断言 |
L1-1:15.6% → 77.9%;Cons@16 为 86.7%(§2.3)。
L1-2:Ai=(ri−mean)/std。组{1,0,1,0}:mean=0.5,std=0.5(总体口径),A=+1,+1... 更正顺序:(r=1)→+1,(r=0)→−1,即两条+1、两条−1。公式2分,数值4分(每条1分,允许样本std口径√(1/3)≈0.577、A≈±0.866,注明口径即可)。
L2-1:G变小⇒mean/std估计噪声增大⇒优势符号可能翻转(碰运气全错的题组会产生负基线漂移);难题占比高⇒多数组全零奖励⇒std=0,优势无定义/无梯度⇒有效训练信号集中于偶尔解出的难题,样本效率进一步下降。给分:噪声效应50%、退化情形50%。
L2-2:PPO把KL作为逐token稠密奖励计入累计回报,回答越长累计惩罚越大⇒策略被推向短回答;GRPO的KL在损失里逐样本结算,与长度无关。致命性:长CoT的本质是"用更多token买正确率",任何压长度的信号都直接对抗训练目标(附录A.3)。给分:机制对比60%,联系长CoT目标40%。
L3-1:开放题,交LLM裁判。可选策略:①格式欺骗——在box里堆枚举猜测或输出"答案可能是X或Y"博取字符串匹配;②利用判分器漏洞——复制题目自带答案/测试用例中的线索(若数据清洗不净)。防线:答案规范化后再比对(sympy等价而非字符串相等)、禁止多答案格式、数据侧保证题目不含答案泄漏、对可疑高分样本做人工抽检。给分:每种策略需含"利用的具体漏洞"+"可行防线"两要素。
L3-2:错误在于混淆了"SFT本身有害"与"数据量不足的SFT造成灾难性遗忘式干扰"。Dev1用的是仅数千条的冷启动集,跌幅说明小数据SFT会把策略拉离RL最优区;而Dev3的大规模SFT(800k)之后AIME反而创新高(78.1),证明充分的SFT并不必然有害。准确表述:未经放大的少量SFT可能严重损害已习得的RL能力。给分:识别混淆30%,引用Dev3反例50%,准确表述20%。
L4:论证线索:GRPO去掉了critic(减少一个可被欺骗的学习组件)⇒规则奖励不可被参数化利用⇒偏好RM只在极短的窗口内使用以限制exploitation时间——三处设计共同指向"宁要贫乏但可靠的信号,不要丰富但可hack的信号"。反例边界:写作/开放式任务根本没有可靠的规则奖励,此时"贫乏但可靠"不存在,命题失效,必须回到RM+短RL或人工数据(§6 reward hacking段)。给分:三点串联60%,边界条件40%。