下表把论文叙事拆成短语级单元,映射到论文章节与本页章节(论文章节划分依据公开转述的 Nature 版结构:正文无编号小节+Methods+图1–7;此划分为【解读者整理】)。
| 摘要/叙事短语 | 对应论文部分 | 本页章节 |
|---|---|---|
| "一个新强化学习算法,AlphaGo Zero 成为自己的老师" | 引言 + Methods·自博弈训练循环 | 二.3、二.4 |
| "仅从黑白棋子输入开始,纯自我对弈" | Methods·神经网络输入特征 | 二.2 |
| "单一神经网络取代策略网络+价值网络,不用 rollout" | Methods·架构与搜索整合 | 二.2、二.3 |
| "3 天训练后 100:0 击败击败李世石的 AlphaGo Lee" | 结果·与旧版本对弈评估 | 二.5 |
| "与人类棋谱版本对比:人类数据初期加速、后期拖累" | 结果·消融对照 | 二.6 |
| "重新发现并超越千年人类围棋知识(定式等)" | 结果·知识发现分析 | 二.5 |
| "能耗远低于前代(4 TPU vs 176 GPU / 48 TPU)" | 讨论 + 博客硬件对比图 | 三.3 |
围棋规则(唯一先验)→ 棋盘张量表示 s (17×19×19)
↓
残差网络 f_θ:双头输出 (p, v) ←—— 枢纽节点,被后续一切依赖
↓ ↘
MCTS 用 (p,v) 做导向搜索 → 输出改进策略 π 与胜负 z
↓
损失 ℓ = (z−v)² − πᵀlog p + c‖θ‖² → 更新 θ → 更强的 (p,v) → 循环
↓
Elo 曲线 / 100:0 / 89:11 → 结论:人类数据非必需
主干线:双头网络 → MCTS 导向 → 自博弈生成训练数据 → 迭代提升。枢纽节点是"策略与价值合一的单网络":没有它,MCTS 的两个输入源就要分别训练,整个自博弈闭环的成本会翻倍。
| # | 声称的贡献 | 预评证据强度 | 理由 |
|---|---|---|---|
| 1 | 纯自博弈可达到超人类围棋水平,无需人类数据 | 强实验支撑 | 100:0 胜 AlphaGo Lee、89:11 胜 Master(两处独立对局证据) |
| 2 | 单一双头网络 + 无 rollout 的 MCTS 优于前代"双网络+快速走子" | 仅有对照 | 与前代对比是跨系统比较(架构、训练量都变了),未做严格同预算消融 |
| 3 | 人类棋谱数据长期反而有害(用于初始化时) | 仅有消融 | 只有一个对照运行(人类数据初始化版),且该结论依赖 Elo 标度假设 |
| 4 | "发现超越人类的定式与新知识" | 定性证据 | 靠定式演变可视化与个别局面展示,属定性论证而非量化指标 |
| 5 | 该方法可推广到其他领域 | 只是主张 | 本文未验证;后来由 AlphaZero(2017-12)补上 |
必读主线:二.2(网络)→ 二.3(MCTS)→ 二.4(训练循环)→ 二.5(结果)。跳过二.2 会看不懂二.3 中 (p, v) 从哪来;跳过二.3 会误以为"神经网络自己下棋"。
可跳读支线:二.1(动机背景)、二.6(人类数据消融)——但二.6 是本文最具哲学冲击力的结论,建议别跳。三.2(Elo 标度批判)是精读者的"解毒剂",强烈推荐。
来源:论文引言(据博客与二手转述);本节叙述框架为【解读者整理】
失效模式先行。前代 AlphaGo 的训练管线是:先用 KGS 公开的人类职业棋谱做监督学习,得到一个"像人"的策略先验,再用强化学习自我对弈去超越它。这条管线的疼处有三:
① 天花板继承问题——监督阶段的先验来自有限人类样本,强化学习要在其附近找局部最优;
② 数据成本问题——绝大多数领域根本没有"数千万局专家示范"可用(维基百科转述的原话:专家数据"往往昂贵、不可靠或根本不存在");
③ 风格偏置问题——模型学到的开局与定式被锁定在人类经验范围内。
AlphaGo Zero 把这三处一次砍掉:唯一的先验输入只有围棋规则本身,从完全随机落子起步,让"昨天的自己"当"今天的自己"的老师。【论文声称】这一循环之所以能收敛而不是自嗨,靠的是下一章的两个部件互相纠错:搜索利用网络、网络蒸馏搜索。
来源:论文 Methods·神经网络架构【据维基百科对论文附录的转述】
学习目标:学完本节你应能——画出输入张量的 17 个通道各是什么;说出两个头的输出形状;解释为什么历史平面有用而手工特征被全部删掉。
输入表示:19×19 棋盘编码为 17×19×19 张量:8 个通道记录当前执子方最近 8 步的落子位置,8 个通道记录对手最近 8 步的落子位置,最后 1 个通道是指示当前执子方颜色的常量平面(黑走则全 1)。对比前代:AlphaGo Lee 的输入包含大量手工特征(气、征子是否成立等),Zero 全部删除,只留最原始的石子位置。
主干:残差网络(ResNet),20 或 40 个残差块,每块 256 个通道、两个 3×3 卷积加批归一化与 ReLU。【解读者补充】这是 2015 年 ResNet 论文(本站第 5 篇)的直接应用——DeepMind 没有发明新算子,它把"深度"这个通用杠杆拧到了当时棋类程序没用过的程度。
两个头:策略头输出 19×19+1 = 362 维 logits(361 个交叉点 + 停一手),softmax 后得先验落子概率 p;价值头输出 (−1, +1) 区间的标量 v,表示当前执子方的预期胜负。
公式手术:训练目标是同时拟合搜索给出的两个监督信号:
| 符号 | 它是什么 | 直觉 |
|---|---|---|
| θ | 网络参数 | 被优化的对象 |
| z | 该局最终胜负(±1,当前执子方视角) | 环境裁判给的"真值" |
| v | 价值头预测 | 网络的"盘面直觉" |
| π | MCTS 搜索后的访问次数归一化分布 | 搜索深思熟虑后的"更强走法" |
| p | 策略头输出的先验概率 | 网络的"第一反应" |
| c‖θ‖² | L2 正则项 | 防止权重无限膨胀 |
维度流检查【解读者补充】:输入 17×19×19 → 卷积塔保持空间分辨率不变 → 策略头经 1×1 卷积压成 19×19 再展平为 362 维 → 价值头压成单标量。整条流水线没有全连接大层,参数集中在卷积塔。手算验证:单个残差块约含两个 3×3×256×256 卷积 ≈ 2×589,824 ≈ 118 万参数;40 块 ≈ 4700 万,加上首尾卷积与双头,量级在 5000 万上下——这是解读者估算,论文未给总参数量,无法核对,请勿引用为论文数字。
来源:论文 Methods·搜索【公式为公开广泛转述的论文形式,未能逐字核验原文,标注】;每步 1600 次模拟等超参数亦属【据二手转述】
失效模式先行。如果只用价值头 v 来下棋,等于只凭"第一感觉";如果只用传统蒙特卡洛 rollout 随机走到底来估胜负,噪声大到需要海量模拟。前代 AlphaGo 两样都用(策略网络缩搜索宽度、rollout 给叶子估值),代价是维护两套网络和一套快速走子策略。Zero 的方案:用同一个网络的 (p, v) 同时充当搜索的先验和叶节点估值器,彻底删除 rollout。
每次落子执行固定次数(1600 次)模拟。每次模拟从根走到叶,沿途按 PUCT 规则选边:
| 符号 | 它是什么 | 直觉 |
|---|---|---|
| Q(s,a) | 该边的平均行动价值 | "这条路历史上赚了多少"—— exploitation |
| P(s,a) | 策略头给的先验概率 | "网络觉得这条路值得一看"—— 先验引导 |
| N(s,a) | 该边被访问次数 | "已经看过多少次"—— exploration 惩罚 |
| cpuct | 探索系数 | 调"多看冷门路"的旋钮 |
到达叶节点时用 v 回传更新 Q;根节点的最终落子取访问次数最多的着法(前 30 步按温度 τ=1 按比例采样以增加多样性——【据二手转述】)。根先验混入 Dirichlet 噪声(参数 0.03、权重 ε=0.25,同样属转述),保证搜索不会因先验为零而永远不看某些着法。
工程账单:删 rollout 缓解了算力压力(少一套快速走子网络的推理),新增了对价值头精度的压力——v 一旦系统性偏差,整个搜索跟着歪;这笔债由 2.4 的迭代训练来还。另外 1600 次模拟×每步,意味着每步棋要做 1600 次网络前向(批量并行摊薄),这就是推理仍需 4 块 TPU 的原因(见三.3)。
一句话记住本节:MCTS 把网络输出当作待改进的草图,搜索结果又反过来当网络的教材——"策略改进算子"与"策略蒸馏算子"首尾相接。
来源:论文 Methods·自博弈训练循环【据二手转述】
流程四拍:① 当前最优网络自博弈生成对局,每步保存 (s, π, z) 三元组;② 从近期对局缓冲均匀采样小批次训练网络若干步;③ 新网络与当前最优对弈评估;④ 只有胜率显著超过 55% 门槛才换主(防止性能回退的"守门员"机制)。此外为防"优势明显就认输"造成误判,保留一小比例对局强制下完以校准认输阈值(【据二手转述】:认输阈值 v=0.95、抽 5% 对局不认输)。
手算验证(训练规模):博客与转述给出——3 天版自博弈 490 万局后 100:0 胜 Lee;40 天版达到 Elo 5185。3 天 ≈ 259,200 秒,490 万局 ÷ 259,200 秒 ≈ 平均每秒 19 局。这只有在"自博弈高度并行 + 对局提前终止 + 认输机制"三者齐备时才可能,也解释了为什么认输阈值不只是省算力,还是训练吞吐的关键部件。【解读者推断】
闭卷自检:不看材料,我能说出——为什么换主要设 55% 门槛而不是 50%?为什么必须保留一部分不认输的对局?
55% 门槛提供安全边际:评估局数有限,50% 门槛下统计涨落会把偶然变强的新网络扶正,导致"学生退化"污染教师;不认输的对局用于估计认输判据的假阳性率——若阈值过低,必败局会被提前放弃,训练数据里全是"半局棋",且评估战绩失真。
来源:DeepMind 官方博客(直接核验)+ 维基百科引述论文 Table/Elo 数字【据二手转述】
| 版本 | 对弈硬件 | Elo(论文标度) | 关键战绩 |
|---|---|---|---|
| AlphaGo Fan | 176 GPU(分布式) | 3144 | 5:0 胜樊麾 |
| AlphaGo Lee | 48 TPU | 3739 | 4:1 胜李世石 |
| AlphaGo Master | 4 TPU(单机) | 4858 | 60:0 横扫职业顶尖;胜柯洁 |
| AlphaGo Zero(40 天) | 4 TPU(单机) | 5185 | 100:0 胜 Lee;89:11 胜 Master |
注:博客图表中 Lee 约 3500–3700、Master 约 4750–4850、Zero 高于 5000,与上表(引论文精确值)一致;博客另给出 21 天版追平 Master 水平。
数字对账:Elo 差 100 分约对应 64% 胜率。Lee 与 Master 差 1119 分,理论胜率应为 Φ(1119×√2/… )——粗略地按标准 Elo 公式 1/(1+10^(−Δ/400)),Δ=1119 时 Lee 胜率约为 1/(1+10^2.7975) ≈ 0.16%。而实际战绩是 Zero 89:11 胜 Master,对应约 89% 胜率、隐含分差仅约 Δ≈260。此处对不上:说明图中各版本的 Elo 是各自训练曲线上的自评标度值,而非同一标度下的实测对局换算。这正是三.2 要展开的问题——论文自己也承认不同曲线的 Elo 不可直接横比。【解读者推断】
知识发现:论文展示了开局定式随训练的演变:早期学到人类常见定式,随后偏好改变,最终重新采纳了人类定式中确实合理的一部分,并出现人类从未采用的新着法(如早期频繁的肩冲)。博客的表述是"发展出非常规策略与创造性新手筋,呼应并超越了它与李世石、柯洁对局中的新颖手段"。注意:博客页面本身未出现 joseki(定式)一词,定式演变的图示出自论文正文图——此处细节属【据二手转述】,未能逐图核验。
常见误读:
① "Zero 证明人类知识没用" ——错。它证明的是在规则完全明确、裁判免费、可以无限快速自博弈的封闭领域里人类数据非必需。规则不明确的领域(驾驶、开放对话)连 z 都拿不到。
② "40 天=训练只要 40 天" ——40 天是这一次运行的训练时长,背后是 64 个 GPU worker 加 19 个 CPU 参数服务器在做训练侧计算(推理只用 4 TPU)【据二手转述】。宣传口径常略去这组数字。
③ "100:0 说明棋力差距是无穷大" ——见上面的数字对账,100:0 的隐含分差其实小于两条曲线 Elo 读数之差,因为对局用的评估配置与曲线标度并不一致。
主张 vs 事实:"无需人类知识即可超越人类"实验支持;"人类知识反而有害"仅一组消融;"方法可推广"当时只是主张。
来源:论文结果·消融【据二手转述】
研究者额外训练了一个用人类棋谱初始化的版本:前期学习速度更快(站在人类肩膀上),但后期收敛到的水平更低、曲线更平。这与"监督先验造成锚定效应"的解释一致:先验越强,自博弈探索越难跳出人类经验的吸引域。【解读者观点】该消融只做了一个种子、一个数据配置,作为"人类知识有害"这种强结论的证据略显单薄,宜读作"存在反例"而非"普遍规律"。
核心指标是内部 Elo:通过新旧版本互弈测得。它测的是"家族内部的相对棋力",不是跨论文可比的绝对棋力。与 Lee/Master 的实战对局(100 局、100 局规模)才是外部锚点,但对手也是自家旧版本——全文没有任何对第三方顶级引擎(如 Zen、Crazy Stone 当代版本)的正式评测,博客柱状图里的 Crazy Stone 数值出处未在可核验文本中说明。
① 不同训练曲线各自归一化,跨曲线读数差不能换算胜率(见 2.5 的对账);② 评估时的模拟次数、采样温度等配置若与自博弈时不同,分数含义随之改变——论文的评估配置细节在付费墙内,本页未能核验;③ "40 天 5185"常被媒体当作绝对纪录传播,实为自家尺子的读数。
博客硬件表(直接核验):Fan 176 GPU、TDP 合计超过 40,000W 量级;Lee 48 TPU;Master 与 Zero 都只用 4 TPU 单机。即从 Fan 到 Zero,对弈硬件能耗降了四个数量级左右,其中既有算法贡献(删 rollout、单网络),也有 TPU 硬件代际红利——把全部功劳记给算法是不公平的。训练侧的 64 GPU worker 通常不出现在宣传图里。【解读者观点】Epoch AI 事后估算本次训练约 3×10²³ FLOPs(【据二手转述】,非论文数字)。
给定三个事实:"输入只有石子位置"、"每步 1600 次模拟"、"3 天 490 万局",推演这套系统必须在哪三个环节各解决什么问题,否则闭环断裂。(L4)
① 输入极简逼出表征学习问题:没有手工特征,网络必须从原始棋盘中自学出气、征子、死活等概念——靠足够深的残差塔+海量对局解决;② 1600 次模拟逼出搜索效率问题:模拟预算有限,必须用先验 p 把搜索集中到少数候选——PUCT 的 P 项解决;③ 每秒约 19 局的吞吐逼出训练信号质量问题:快棋+认输会产生错误标签,必须有评估守门(55% 门槛)和不认输校准对局兜底。评分:每个环节 3 分,指出断裂后果再得 1 分。
用本页出现的数字完成:(a) 3 天版平均每秒自博弈多少局?(b) Lee 与 Master 的 Elo 读数差是多少?该差值按标准 Elo 公式对应的 Lee 胜率是多少?与 100:0 战绩矛盾吗?(c) Fan→Zero 对弈硬件能耗大约降了多少个数量级?(L2)
(a) 4,900,000 ÷ (3×86400) ≈ 18.9 局/秒。(b) 4858 − 3739 = 1119 分;胜率 = 1/(1+10^(1119/400)) = 1/(1+10^2.7975) ≈ 0.16%,即 Lee 应几乎必败——与"100:0"方向一致但幅度不符:89:11 对 Master 才对应 ~260 分差,说明曲线读数与实战评估不在同一标度。(c) 从 176 GPU/40000+ W 到 4 TPU(百瓦级),约降两个数量级以上(按 TDP 口径约 40,000→数百瓦,≈100 倍;若计入 48 TPU 版则介于其间)。
答辩三题:① 为什么把策略和价值合并成一个双头网络?② 为什么删 rollout?③ 为什么换主门槛是 55% 而不是 99%?每题答"为什么这样做 + 不这样做会怎样"。(L3/L4)
① 合并后一次前向同时产出搜索所需的先验与估值,推理成本近乎减半,且两个任务共享表征互相正则;分开则推理要跑两个网络,自博弈吞吐腰斩,且价值网络失去策略表征的红利。② 删 rollout 是因为价值头经过训练后方差远低于随机模拟,同等算力下搜索质量更高;保留 rollout 则要把一半算力花在高噪声估计上,还会迫使维护第二套快速策略。③ 99% 门槛会让网络几乎永不更新,自博弈教师停滞、训练退化为单代网络的数据增广;55% 在"防止退化"与"允许迭代"间折中。评分:每题"这样做"2 分、"不这样做会怎样"2 分。
回看 1.3 的五条预评分。读完本页后,哪些维持、哪些调整?(L4)
贡献1 维持强支撑(两组独立对局战绩)。贡献2 应下调解读信心:跨系统比较混杂了架构、训练时长、硬件多个变量,只能支持"整体管线更优",不支持"某个部件单独更优"。贡献3 维持"仅消融"并追加:单运行、无方差。贡献4 维持定性。贡献5 维持主张,但注明 AlphaZero 已事后补证——审计的价值在于区分"论文当时给了什么证据"与"社区后来补了什么证据"。评分:每条判断+理由 2 分。
不看材料,我能——说出 17 通道的具体构成?写出损失函数三项?解释 PUCT 各项的作用方向?复述 100:0 与 89:11 两组战绩及其标度问题?指出"左脚踩右脚"类比的失效点?