← 总目录 / 板块五 · 2022年以来最重要的10篇
板块五 · 模型的范式变迁

第40篇 · DeepSeek-R1

不给示范、只给判分器:纯强化学习如何逼出一个会自我反思的推理模型
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning · DeepSeek-AI · 2025 · arXiv:2501.12948

本页标注约定:【论文声称】【实验支持】【解读者推断/补充】三种标签永不混淆。所有数字复述自论文原文(arXiv v2 正文与附录,蒸馏表取自 arXiv v1/官方仓库镜像),未做外部验证;凡未能核验处均已显式标注。

一、全局大图

1.1 摘要拆解 → 章节导航对照表

摘要中的短语对应原文章节对应本页精读章节
"推理能力可通过纯 RL 激励,无需人工标注的推理轨迹"§1 引言、§2 DeepSeek-R1-Zero第二章 · R1-Zero 与 GRPO
"涌现出自我反思、验证、动态策略调整等高级推理模式"§2.3、附录C 自进化分析第二章 · aha moment 小节
"在数学、编程竞赛、STEM 等可验证任务上超越监督学习对标模型"§3 表3(各阶段成绩)、附录D 主结果表第三、四章 · 流水线与评测
"大模型的涌现推理模式可系统性迁移给小模型"§3.2 蒸馏部分、蒸馏评估表第五章 · 蒸馏
"可验证性边界、语言混合、提示敏感"等局限§6 结论与局限第六章 + 批判性阅读

1.2 主要贡献与证据强度预评

#声称的贡献证据预评理由
1纯 RL(跳过 SFT)即可激发强推理:R1-Zero 在 AIME 2024 从 15.6% 升至 77.9%强实验支撑训练曲线(图1)+ 多基准交叉验证(Codeforces、GPQA 同步上涨)
2反思/验证/"wait"等行为是 RL 涌现的,而非人教的有观察证据,机制未证附录C 给出行为频率随训练步数的变化曲线;但"涌现"与"从预训练数据中放大已有模式"无法用本文数据区分
3R1 整体达到与 OpenAI-o1-1217 相当的水平自评对比表AIME/MATH-500 领先,GPQA/SimpleQA 落后;且 o1 一侧有8个基准无数据
4蒸馏比小模型直接做大规模 RL 更划算单一对照组只有 Qwen-32B 一个对照点(R1-Zero-Qwen-32B vs R1-Distill-Qwen-32B)
5神经奖励模型会被 reward hacking,故坚持规则奖励原则性主张正文与附录均未给出具体被 hack 的案例数据

1.3 知识依赖主线与阅读路线

主干线:GRPO(§2.1)→ 规则奖励(§2.2)→ R1-Zero 涌现现象(§2.3)→ 为什么 Zero 不够好(§3 开头)→ 四阶段流水线(§3.2)→ 各阶段成绩(表3)→ 蒸馏结论。枢纽节点是 GRPO——它同时被 R1-Zero 和 R1 两个阶段使用,且其"去价值模型"的设计动机要靠附录 A.3 的 PPO 对比才能真正读懂,值得慢读。

必读:§2 全部、§3.2、表3、蒸馏表。可跳:附录 B.1 RL 基础设施(做系统才需要)、D.3 安全报告。跳读代价:不了解基础设施就无法理解"为什么规则奖励模块可以异步执行"这类工程细节,但不影响理解方法论。

二、逐章精读(上):DeepSeek-R1-Zero——纯 RL 实验
来源:论文 §2(第2–5页);类比与手算为解读者补充

2.1 失效模式先行:SFT 路线的天花板

传统后训练范式是"SFT 再 RL"(InstructGPT 以来二十年不动摇的标准动作)。R1 论文 §1 与附录A.2 指出它的两个痛点: 人类标注的长思维链稀缺且昂贵——让人类写出成千上万条带验证与回溯的真实解题轨迹根本不可扩展; 更深的一层:模仿人类示范会把模型锁死在人类的思维方式里——人类示范常常省略反思与验证步骤,模型学到的上限就是示范的上限。R1-Zero 的激进之处在于直接砍掉 SFT:在 DeepSeek-V3-Base 上从头做纯 RL,唯一的引导是一个要求输出格式为 <think>…</think><answer>…</answer> 的模板(表1)

直觉类比及其失效点:把 R1-Zero 类比为"不请教练、只在每次对局后告诉你输赢的自学棋手"很传神——奖励只看结果(终局胜负),过程自由探索。但类比在两点失效:① 棋类有完美裁判,而"数学答案匹配+编译器测试"只是近似裁判(答案格式解析失败会被误判为错);② 棋手的搜索树每局重置,而 LLM 的 RL 是在微调一个参数化策略——它会把探索到的模式固化成参数,这正是"涌现"得以积累的机制,棋类类比看不到这一点。

2.2 公式手术一:GRPO 目标函数(式1–3)
来源:§2.1 及附录A.3

𝒥GRPO(θ) = E[q∼P(Q), {oi}Gi=1∼πθold(O|q)] · (1/G)Σi=1..G[ min(ratio·Ai, clip(ratio, 1−ε, 1+ε)·Ai) − β·DKLθ‖πref) ]
符号它是什么直觉
q, oi问题 q 与同一问题下采样的 G 条输出"一组考生做同一道题"
ratio = πθ(oi|q)/πθold(oi|q)新旧策略对该输出的概率比本次更新想让这条回答变得多"更可能"
clip(·, 1−ε, 1+ε)把 ratio 截断在信任域内单步更新不许走太远(PPO 血统)
Ai组内相对优势(见下式)这条回答比同组平均好多少
DKLrefθ − log(πrefθ)−1KL 散度的无偏估计量(k3 型)别离参考策略太远;注意它是加在损失里的逐样本项
Ai = (ri − mean({r1,…,rG})) / std({r1,…,rG})  (式3)

GRPO 与 PPO 的关键差异(附录A.3):PPO 用一个与策略同尺寸的价值网络(critic)通过 GAE 估计优势——这意味着双倍的显存与计算,而且当输出是长思维链时,"根据半截回答预测最终得分"几乎不可能(模型中途会反思、推翻自己);GRPO 干脆扔掉 critic,用同题 G 条采样的奖励均值/方差做基线归一。另一处差异:PPO 把 KL 作为逐 token 的稠密奖励累加进回报,隐含惩罚长回答——这恰好压制"思考变长";GRPO 把 KL 直接放进损失,不做长度惩罚。消融证据 附录A.3 图4:在 16B MoE(激活2.4B)上跑 MATH 任务,PPO 用默认 λ=0.95 时显著差于 GRPO,调到 λ=1.0 才接近——结论是 PPO 能追平但需要额外调参成本+价值模型开销。

手算验证优势归一(解读者补充):设 G=4,某题四条回答的规则奖励为 {1, 1, 0, 0}。mean=0.5,std=√((0.25×4)/4)=0.5(总体标准差)。则两条正确回答的 A=(1−0.5)/0.5=+1,两条错误回答 A=−1。若换成 {1,1,1,0}:mean=0.75,std≈0.433,三条正确的 A≈+0.577、错误的 A≈−1.733——错误回答受到的推力反而更大。这个非线性正是 GRPO 的微妙之处:组内越接近全对,单个错误的惩罚权重越大。【解读者推断】这也解释了为什么训练后期"难题突破"能带来超线性收益。

R1-Zero 训练配置数字(§2.1 原文):lr=3e-6;KL 系数 β=0.001;采样温度1;每题采 G=16 条;最大生成长度 8.2k 步前为 32,768 tokens、之后放宽到 65,536;总训练 10,400 步 ≈ 1.6 个 epoch;每步32题、batch size 512;每400步刷新一次参考模型;每次 rollout 生成8192条输出切16个 minibatch、只训1个内层 epoch。

2.3 公式手术二:规则奖励(式4)

Rewardrule = Rewardacc + Rewardformat  (式4,两项等权)

准确性奖励:数学题要求最终答案放入规定格式(如 \boxed{}),规则匹配即得1否则得0;代码题用编译器跑预置测试集。格式奖励:思维过程必须包在 <think> 标签内。刻意缺席的是神经奖励模型(无论 outcome 还是 process PRM)——理由写在原文:大规模 RL 下神经 RM 会遭遇 reward hacking,重训 RM 又增加算力与管线复杂度。这是全文的方法论基石,也是与 GPT-4 报告中 RBRM(第39篇 §4.3)异曲同工的选择。

2.4 涌现现象:aha moment 与"wait"曲线
来源:§2.3、附录C;机制讨论为解读者补充

三个【实验支持】的事实: AIME 2024 平均 pass@1 随训练从 15.6% 升到 77.9%;配合 self-consistency 解码(Cons@16)达 86.7%,超过人类参赛者平均水平。 平均回答长度持续增长——没人教它"多想一会儿",它自己学会了用更多 token 换正确率。 中间版本出现著名的 aha moment(表2):在解一道含嵌套根号的方程时,模型在推导中途写下 "Wait, wait. Wait. That's an aha moment I can flag here."——随后推翻重来。附录C.2 显示这与训练中 "wait" 一词使用频率的突增相对应。

常见误读:① "aha moment 说明模型有了意识/顿悟"——原文自己的措辞是"an anthropomorphic tone",附录B.3 也明确承认拟人化的思维口吻是 DeepSeek 工程加工的产物,不应过度解读为类人智能;② "涌现=凭空产生新能力"——更保守的解释是:RL 从预训练已具备的能力分布中选择并放大了反思模式(V3-Base 预训练语料含大量数学与代码推理痕迹,见附录A.1);本文数据无法区分这两种解释;③ "回答变长=思考更多"——长度增长也可能混入重复与冗余,论文承认存在 overthinking(见§6)。

一句话记住本节:R1-Zero 证明了一件事——只要奖励可靠可验证,去掉所有人类示范,模型也会自己走向"更长、更爱反思"的解题策略。

三、逐章精读(中):DeepSeek-R1 四阶段流水线
来源:论文 §3、附录B.3/B.4;流程梳理为解读者补充

失效模式先行:R1-Zero 有三个不能上架的毛病——可读性差中英文混杂(V3-Base 语料以中英为主,无语言约束时 CoT 内部随意切换)、只会做题(写作、开放问答等通用能力没被规则奖励覆盖)。R1 的流水线就是针对这三个病灶设计的四次手术。

3.1 流水线全景(阶段→目的→关键数字)

阶段做什么为什么关键数字
① 冷启动 SFT用数千条长CoT样本微调 V3-Base 得初始 actor给RL一个可读、第一人称、语言一致的起点(产品驱动动机)"thousands of"条冷启动数据(精确数量未披露);温度1.0采样+sympy校验+人工两轮审核
② 推理导向 RLGRPO 继续训推理任务,加语言一致性奖励保留 Zero 式推理增益,同时治语言混杂lr 3e-6、β=0.001、clip ε=10、G=16、max len 32,768
③ 拒绝采样 + 全量 SFT用②的 checkpoint 生成新SFT数据,混合非推理数据再微调 V3-Base 重来把推理能力注入的同时补通用写作能力600k 推理 + 200k 非推理 ≈ 800k 样本,训2个epoch
④ 全场景 RL混合推理规则奖励+通用RM奖励再训对齐有用性与无害性,兼顾推理1700 步;最后400步才加入通用偏好奖励;温度降到0.7

数字对账:600k+200k=800k ✓(附录B.3.3 口径一致)。一处对不上:§2.1 说 R1-Zero 训了10,400步×每步32题=332,800次题目抽取,折合1.6个epoch,反推数据集约20.8万条;但附录B.3.1 列出的推理RL数据为 数学26k+代码17k(+bug修复8k)+STEM22k+逻辑15k ≈ 80–88k 条。两个口径对不上——可能的解释:epoch 统计包含了多轮数据复用或按 rollout 输出条数而非题目数计算,论文未给出统一口径,此处如实存疑。

3.2 语言一致性奖励与 clip=10 的取舍(式7)

Rewardlanguage = Num(Wordstarget) / Num(Words)  (式7)

目标语言词占比,直接加入最终奖励。附录B.6 的消融显示:加它会轻微降低性能,但换来可读性——一个明确的"性能换体验"交易。另一个值得停下的细节是第一阶段 clip 比例取 ε=10(正常PPO默认0.1–0.2!):原文解释是 clip 太小会截断大量 token 的梯度导致性能下降,太大则训练不稳——这是长CoT RL 特有的调参发现,因为一条上万 token 的轨迹里只有极少数 token 承载有效信号,过紧的信任域等于把梯度掐死。第二阶段温度从1降到0.7,因为高温下生成开始不连贯。以上均为原文披露的超参事实;"为何恰是10而非8"这类具体值的选择依据论文未说明。

3.3 第二阶段 RL 与 reward hacking 的克制设计

总奖励 = Rewardreasoning(规则)+ Rewardgeneral(RM+格式)+ Rewardlanguage(式8–10)。关键操作:1700步中只有最后400步才引入基于模型的偏好奖励——因为"更多步数的模型偏好奖励会导致 reward hacking"(§3.2.2)。Helpful RM 用66,000对偏好数据训练(DeepSeek-V3 当裁判打分、每对查4次去位置偏差、Δ>1才保留、chosen/rejected长度对齐);Safety RM 用106,000条 safe/unsafe 标注做逐点分类。这两个数字与通用RL数据的66k helpfulness+12k harmlessness prompts 相互印证(附录B.3.1)。【解读者观点】"规则奖励可以无限训,RM 奖励只能短促使用"是这个 pipeline 最诚实的自我认知。

3.4 各阶段成绩表(表3精选)

基准R1-ZeroDev1(冷启动)Dev2(推理RL)Dev3(SFT)R1(最终)
AIME 2024 (pass@1)77.959.074.078.179.8
MMLU (EM)88.889.191.291.090.8
MMLU-Pro (EM)68.974.183.883.184.0
IF-Eval (Prompt Strict)46.671.772.078.183.3
AlpacaEval 2.0 (LC-winrate)24.750.155.862.187.6
GPQA Diamond (pass@1)75.866.170.771.271.5
LiveCodeBench (pass@1-CoT)50.057.563.564.665.9
Codeforces Rating14441534168717462029
SWE Verified43.239.644.645.649.2

这张表讲的故事(原文 §4 分析+解读者补充):① Dev1 的 AIME 从77.9跌回59.0——冷启动数据太少,SFT 把 Zero 学到的一部分推理能力"洗掉了",这是全文最诚实的一个数据点,证明 SFT 不总是无害的;② Dev2→Dev3 的跃升主要发生在 AlpacaEval/Aider-Polyglot(+6.3/+19.2)——非推理数据补的是通用与工程能力;③ 最终 R1 相对 Dev3 的增量集中在 AlpacaEval (+25.5)、ArenaHard (+16.7)——最后400步的偏好RL买的是"用户喜欢";④ GPQA 反向移动:Zero 的 75.8 是全行最高,成品 R1 只有71.5——博士级科学问答似乎与"可读性/指令遵循"存在此消彼长。【解读者推断】可能与 GPQA 需要密集领域知识、而长CoT风格稀释了知识调用效率有关,论文未解释。

四、逐章精读(下):与 o1 对比、蒸馏与局限
来源:论文附录D/F(v1版正文§3.2/§4.1)、§6;批判视角为解读者补充

4.1 与 OpenAI-o1-1217 的对比表(官方仓库镜像口径)

基准o1-1217DeepSeek-R1谁领先
AIME 2024 (pass@1)79.279.8R1
MATH-500 (pass@1)96.497.3R1
MMLU (pass@1)91.890.8o1
GPQA Diamond (pass@1)75.771.5o1
SimpleQA (Correct)47.030.1o1(差距最大项)
LiveCodeBench (pass@1-CoT)63.465.9R1
Codeforces (Rating / Percentile)2061 / 96.62029 / 96.3o1
SWE Verified (Resolved)48.949.2R1(持平级)
Aider-Polyglot (Acc.)61.753.3o1
Drop (3-shot F1)90.292.2R1

注:MMLU-Redux/-Pro、IF-Eval、FRAMES、AlpacaEval、ArenaHard、CNMO 2024 及全部中文基准共8项,o1-1217 一侧在原表中无数据——比较是不完整的。评测设置:最大生成32,768 tokens,temperature=0.6、top-p=0.95,每查询64响应估 pass@1。数字取自论文配套官方发布材料(arXiv HTML 版该表位于附录 D.2,本轮抓取未能完整核验附录表格,故以官方 README 镜像为准并在此声明)。

一句话解读:数学与竞赛编程基本打平甚至略胜,知识与事实性(MMLU/GPQA/SimpleQA)明显落后——尤其 SimpleQA 差17个百分点,说明纯 RL 路线买到的是"推理过程质量",不是"事实记忆广度"。

4.2 蒸馏:把长思维链灌进小模型
来源:蒸馏评估表(v1版 §3.2/附录F)

做法:仅用 SFT(约800k样本中由 R1 生成并被拒绝采样过滤的推理数据)微调 Qwen/Llama 系列基座,不对小模型做 RL。结果:

蒸馏模型AIME 2024 pass@1MATH-500 pass@1GPQA DiamondLiveCodeBenchCodeforces Rating
R1-Distill-Qwen-1.5B28.983.933.816.9954
R1-Distill-Qwen-7B55.592.849.137.61189
R1-Distill-Qwen-14B69.793.959.153.11481
R1-Distill-Qwen-32B72.694.362.157.21691
R1-Distill-Llama-8B50.489.149.039.61205
R1-Distill-Llama-70B70.094.565.257.51633

核心对照实验:对 Qwen-32B-Base 直接跑10k+步的大规模RL(得到 R1-Zero-Qwen-32B),只达到 QwQ-32B-Preview 水平;而 R1-Distill-Qwen-32B 在所有基准上显著更强。作者由此给出两条结论(原文转述):其一,把强模型蒸馏进小模型效果优异,小模型自己做大规模RL耗算力还未必赶得上蒸馏;其二,蒸馏经济有效,但要推进智能边界仍需更强的基座+更大规模RL。【解读者推断】一个常被忽略的含义:蒸馏数据本身就是 R1-Zero/R1 的 RL 产物——所以"蒸馏赢过小模型RL"并非否定 RL,而是说RL 的探索成本只需由一个大模型支付一次

常见误读:"R1-Distill 就是小号 R1"——错。蒸馏版没有经历任何 RL,也没有完整的通用对齐流水线;它们是"用 R1 的思维链做纯 SFT"的产物,行为特征(如超长思考)来自数据分布而非自身优化。

4.3 §6 局限清单(原文要点)

五、批判性阅读

5.1 benchmark 到底测什么、比较公平吗

5.2 第二坐标轴:成本与延迟

长CoT的直接代价是推理 token 数:R1 解一道 AIME 题可能生成数千至上万思考 token,而普通模型几十个 token 直接作答。论文承认 overthinking 存在但没有给出平均 token 消耗或延迟数字。训练成本同样未在此文中报告(v2 附录设有 Training Cost 小节,本轮抓取未能获取其数值,如实标注未核验)。【解读者推断】结合基座为671B MoE(激活37B)的公开信息,RL 阶段的 rollout 开销(每步512条、最长65k token 的生成)不会便宜——"低成本激发推理"是相对人类标注而言的成本优势,不是绝对便宜。

5.3 论文没有告诉你什么

六、综合考核

6.1 重建因果链

只给三个短语:"纯RL"、"语言混杂"、"few-shot 有害"——推演这篇论文为什么必然长成现在的四阶段形状。(要点见折叠块。)

参考要点

"纯RL"⇒必须解决奖励可靠性⇒只能选规则奖励⇒任务范围被限制在可自动验证的数学/代码/STEM/逻辑⇒写作等通用能力缺失,需要后续阶段补救。"语言混杂"⇒根源在基座语料分布⇒两条修法:冷启动SFT立格式+语言一致性奖励续保⇒于是有阶段①②。"few-shot有害"⇒说明模型的行为分布已被RL重塑得远离常规对话分布⇒部署时必须围绕零shot重新设计产品接口⇒也反向印证了为什么冷启动要用"第一人称对话式思维链"来锚定可用性。评分要点:三组因果各占30%,能把三者串成"方法选择↔副作用↔补救"闭环者满分。

6.2 数字总对账

  1. 600k+200k=800k ✓(附录B.3.3)。
  2. 每步32题×16采样=512 batch ✓(§2.1 内部自洽)。
  3. 10,400步×32题÷1.6epoch≈208k 数据 vs 附录B.3.1 约80–88k 推理数据 ✗——口径冲突,见 §3.1 对账。
  4. Dev序列 AIME:77.9→59.0→74.0→78.1→79.8——"SFT 先跌后爬"的V形是否与"冷启动数据有限"的解释一致?(一致,但59.0的跌幅之深暗示冷启动SFT可能不只是"没帮上忙",而是主动干扰。)
  5. R1 最终 Codeforces 2029 vs o1 的 2061,百分位却写 96.3 vs 96.6——rating差32分对应percentile差0.3,检查换算合理性(Codeforces 高分段 rating-percentage 映射陡峭,属合理范围)。

6.3 设计决策答辩(挑4个)

  1. 为什么砍掉前置 SFT(R1-Zero 的核心赌注)?不这样做会怎样?论文论据够吗?
  2. 为什么拒绝神经奖励模型?如果改用PRM会得到什么、失去什么?
  3. 为什么第二阶段RL只让偏好奖励参与最后400步?
  4. 为什么蒸馏选择"纯SFT"而不给小模型也上RL?这个决定的外部有效性(换一个基座家族)有多大?
参考答案(要点)

1) 动机:人类示范限制探索空间、引入认知偏置(§1);不这样做:得到 InstructGPT 式模型,推理上限=示范上限。论据强度:正面证据充分(AIME 15.6→77.9),但缺少"同基座加SFT再RL"的严格消融——Dev1 其实近似这个对照,但它同时换了目标函数与奖励集合,不算干净实验。
2) 用PRM可得过程级监督、可能更快收敛、覆盖不可验证任务;失去的是抗 hack 性与管线简洁性。论文论据不足(无案例),但与 GPT-4 报告 RBRM 的动机互证。给分:双向损益各占一半,指出"论文未给出 hack 实例"加分。
3) 因为模型偏好奖励的训练信号会随步数累积地被利用(reward hacking),短脉冲式使用把累计暴露压到最低;代价是通用对齐深度受限(SimpleQA/事实性短板可能与此有关)。
4) 论文给的实证理由是小模型RL跑不过蒸馏;外部有效性存疑点:Qwen 与 R1 的蒸馏数据分布高度匹配(同为中文友好的数学代码生态),Llama-8B 蒸馏效果(AIME 50.4)明显弱于同级 Qwen-7B(55.5)已经暗示了基座匹配度的作用。给分:能引表中 Llama/Qwen 差距作为证据者佳。

6.4 证据审计(回看 §1.2 预评)

贡献预评读后修正理由
纯RL激发推理强实验支撑维持★★★训练曲线+跨基准一致性+Dev序列提供天然消融
涌现反思行为有观察证据维持★★,加注"wait"频率曲线是相关性证据;因果归属未决,且作者自己在冷启动节承认部分拟人口吻是工程产物
整体对标 o1自评对比下调至★★8项基准缺失对手数据;事实类短板显著
蒸馏优于小模型RL单一对照维持★★只有一个基座家族的对照点,但结论方向可信
神经RM必被hack原则主张维持★全文无实例、无数据,属于经验性断言

七、分级自测题

参考答案与评分标准

L1-1:15.6% → 77.9%;Cons@16 为 86.7%(§2.3)。
L1-2:Ai=(ri−mean)/std。组{1,0,1,0}:mean=0.5,std=0.5(总体口径),A=+1,+1... 更正顺序:(r=1)→+1,(r=0)→−1,即两条+1、两条−1。公式2分,数值4分(每条1分,允许样本std口径√(1/3)≈0.577、A≈±0.866,注明口径即可)。
L2-1:G变小⇒mean/std估计噪声增大⇒优势符号可能翻转(碰运气全错的题组会产生负基线漂移);难题占比高⇒多数组全零奖励⇒std=0,优势无定义/无梯度⇒有效训练信号集中于偶尔解出的难题,样本效率进一步下降。给分:噪声效应50%、退化情形50%。
L2-2:PPO把KL作为逐token稠密奖励计入累计回报,回答越长累计惩罚越大⇒策略被推向短回答;GRPO的KL在损失里逐样本结算,与长度无关。致命性:长CoT的本质是"用更多token买正确率",任何压长度的信号都直接对抗训练目标(附录A.3)。给分:机制对比60%,联系长CoT目标40%。
L3-1:开放题,交LLM裁判。可选策略:①格式欺骗——在box里堆枚举猜测或输出"答案可能是X或Y"博取字符串匹配;②利用判分器漏洞——复制题目自带答案/测试用例中的线索(若数据清洗不净)。防线:答案规范化后再比对(sympy等价而非字符串相等)、禁止多答案格式、数据侧保证题目不含答案泄漏、对可疑高分样本做人工抽检。给分:每种策略需含"利用的具体漏洞"+"可行防线"两要素。
L3-2:错误在于混淆了"SFT本身有害"与"数据量不足的SFT造成灾难性遗忘式干扰"。Dev1用的是仅数千条的冷启动集,跌幅说明小数据SFT会把策略拉离RL最优区;而Dev3的大规模SFT(800k)之后AIME反而创新高(78.1),证明充分的SFT并不必然有害。准确表述:未经放大的少量SFT可能严重损害已习得的RL能力。给分:识别混淆30%,引用Dev3反例50%,准确表述20%。
L4:论证线索:GRPO去掉了critic(减少一个可被欺骗的学习组件)⇒规则奖励不可被参数化利用⇒偏好RM只在极短的窗口内使用以限制exploitation时间——三处设计共同指向"宁要贫乏但可靠的信号,不要丰富但可hack的信号"。反例边界:写作/开放式任务根本没有可靠的规则奖励,此时"贫乏但可靠"不存在,命题失效,必须回到RM+短RL或人工数据(§6 reward hacking段)。给分:三点串联60%,边界条件40%。