AI演义 · 论文精读

重读塑造了AI历史的40篇关键论文 —— 每一篇都拆到「数字对得上、公式看得懂、结论可检验」为止。
基于《AI演义:36篇论文开启你的探索之旅》论文清单 | 追加收录《2022年以来最重要的10篇AI论文》(其中5篇与原板块重合,复用已有页面)| 精读方法论:可验证理解(手算验证 · 数字对账 · 分级自测)
40篇精读
5大板块
2004–2025二十年跨度
L1–L4四级自测

板块一 · 模型的范式变迁

从GPU通用计算到Agent框架——11篇奠定深度学习研究范式的里程碑

012004
Brook
用GPU进行通用计算——流计算把显卡变成超级计算机的起点
022012
AlexNet
深度学习的"iPhone时刻",ImageNet错误率一夜暴跌
032014
Seq2Seq & Attention
序列建模的两次飞跃:编码器-解码器与注意力机制
042015
Distilling
知识蒸馏——大模型的"知识传承术"
052015
ResNet
残差学习让网络突破152层深度极限
062017
Transformer
Attention Is All You Need——一个时代的序幕
072017
AlphaGo Zero
当AI不再需要人类老师,自我博弈39天超越人类三千年
082017
MoE
稀疏门控混合专家层——大脑启发的条件计算
092022
CoT 思维链
教会AI"展示解题过程",一句提示词唤醒推理能力
102021
LoRA
低秩适应——让大模型微调变得平民化
112022
ReAct
推理+行动协同——Agent时代的理论基石

板块二 · Infra与数据的变迁

算力与数据是AI的"水电煤"——7篇决定规模游戏规则的文献

122019
The Bitter Lesson
70年AI研究的苦涩教训:通用方法+算力终将胜出
132019
ZeRO
显存优化三重奏,让万亿参数训练成为可能
142020
Scaling Law
AI世界的"摩尔定律":损失随规模的幂律
152022
Chinchilla
计算最优训练:模型和数据要一起放大
162022
LAION-5B
58.5亿图文对的开源数据集——开源社区的英雄主义
172023
RefinedWeb
从互联网垃圾中提炼黄金:Falcon的纯网页数据配方
182024
MegaScale
万卡集群训练LLM的工程艺术,MFU 55.2%

板块三 · 语言模型的发展

从词向量到开源后训练——8篇串起NLP到大模型的完整脉络

192013
Word2Vec
国王−男人+女人=女王,词向量的魔法时刻
202016
GNMT 谷歌翻译
神经机器翻译首次大规模落地生产系统
212018
GPT-1
生成式预训练的开端:"先读书,再做题"
222018
BERT
双向预训练横扫11项NLP任务,曾经的王者
232019
GPT-2
零样本多任务学习,"是时候告别微调了"
242020
GPT-3
1750亿参数的少样本学习,ChatGPT来临前夜
252022
InstructGPT
RLHF人类反馈强化学习——给AI以"文明"
262024
Tülu 3
开源后训练的全套配方与里程碑

板块四 · 多模态模型的发展

从视频识别到扩散Transformer——9篇看懂AI如何学会看与画

272014
DeepVideo
深度学习第一次大规模进入视频领域
282014
双流网络
空间流+时间流:视频动作识别的经典架构
292014
GAN
生成对抗网络——伪造者与鉴别者的博弈革命
302015
Diffusion 奠基作
非平衡热力学启发的生成模型,在GAN阴影下悄然成长
312020
DDPM
去噪扩散概率模型——扩散模型的"文艺复兴"
322020
ViT
一张图就是16×16个词——图像遇上Transformer
332021
CLIP
4亿图文对的对比学习,连接语言与视觉的桥梁
342021
Stable Diffusion (LDM)
潜空间扩散——让AI绘画走进千家万户
352022
DiT
Diffusion + Transformer,走向统一的未来

板块五 · 2022年以来最重要的10篇

思维链 · RLHF · 开源生态 · Agent · 推理模型——2026年8月追加,其中5篇与原板块重合、直接复用已有精读页

012022.01
Chain-of-Thought Prompting
教会大模型"一步步思考"(复用第9篇)
022022.03
InstructGPT (RLHF)
ChatGPT的直接技术前身(复用第25篇)
032022.03
Chinchilla Scaling Laws
重写大模型训练的成本公式(复用第15篇)
042022.04
PaLM
5400亿参数的系统级实证:涌现能力的首次系统记录
052021.12/2022
Latent Diffusion (Stable Diffusion)
文生图民主化的技术引擎(复用第34篇)
062022.09
Whisper
68万小时弱监督,开源语音识别新标杆
072022.10
ReAct
AI Agent范式的奠基之作(复用第11篇)
082023.02
LLaMA
开源大模型生态的引爆点
092023.03
GPT-4 Technical Report
通用AI能力的天花板首秀,以及报告没说什么
102025.01
DeepSeek-R1
纯强化学习激发推理的开源里程碑