← 总目录 / 板块二 · Infra与数据的变迁
板块二 · Infra与数据的变迁

第16篇 · LAION-5B

把"只有大厂才配拥有的58亿图文对",变成任何人都能下载的公共数据集
LAION-5B: An open large-scale dataset for training next generation image-text models · Schuhmann, Beaumont, Vencu, Gordon, Wightman 等(LAION 社区 / UC Berkeley / TU Darmstadt / 华盛顿大学等)· NeurIPS 2022 Datasets & Benchmarks · OpenReview(镜像 arXiv:2210.08402

来源声明:本页数字均复述自论文原文(arXiv:2210.08402v1)与 LAION 官方博客(laion.ai,2022-03-31),未做外部验证;凡属解读者补充或推断的内容均有行内标注。OpenReview 原始评审页面因浏览器验证未能抓取,评审意见部分未核验。

一、全局大图

1.1 这篇论文解决什么问题

CLIP(4亿对)之后,ALIGN(18亿对)、BASIC(66亿对)等模型证明:图文对数据越多,零样本迁移越强。但论文§1明确指出一个尴尬事实——这些数据集没有一个公开。OpenAI 至少放出了 CLIP 模型权重,后续工作连数据带模型全部封闭,多模态研究被压缩进少数工业实验室。LAION-5B 的答案:从 Common Crawl 出发,用现成的 CLIP 模型做过滤器,构建并公开 58.5 亿图文对——比此前最大的公开英文图文数据集大20倍以上(论文 Table 3)。

1.2 摘要—章节对照导航表

摘要短语对应论文章节对应本页精读章
"CLIP与DALL-E证明了在大量含噪图文数据上训练的价值"§1 引言、§2 相关工作本节 1.1
"5.85 billion CLIP-filtered image-text pairs,其中2.32B为英语"§3 收集方法、§4 数据组成第二章 §2.2–2.3
"成功复制并微调 CLIP、GLIDE 与 Stable Diffusion"§5 验证实验第三章 §3.3–3.4
"提供近邻索引、探索界面、水印/NSFW/毒性检测分数"§3.2、附录 C/D第三章 §3.5
"讨论伦理影响与大规模收集的缺陷"§6 局限、§7 安全与伦理第四章批判性阅读

1.3 知识依赖图(文本版)

Common Crawl WAT 文件IMG alt-text 提取CLD3 语言检测分布式下载 img2datasetCLIP ViT-B/32 余弦相似度过滤LAION-5B 三子集NSFW/水印打分 + kNN索引下游验证(CLIP复现 / GLIDE / Stable Diffusion)

枢纽节点是"CLIP 相似度过滤":它同时决定了数据质量上限、规模下限和引入偏差的方式(见第四章)。理解了它,全文其余内容都是它的参数与后果。

1.4 主要贡献与证据强度预评

声称的贡献证据强度预评依据
构建并公开58.5亿对的超大规模图文数据集及全套软件栈强实验支撑数据集本身即证据;流水线代码开源(§3.1脚注5)
在LAION-400M上训练的CLIP能匹配OpenAI原版CLIP表现强实验支撑§5.2 Table 4 多基准对比,ViT-B/32至ViT-L/14全系列
数据规模增大带来零样本性能提升(400M→2B-en)强实验支撑同算力对照:34B images seen 下 ViT-L/14 从73.9%升至75.4%(§5.2)
可微调生成模型(GLIDE/Stable Diffusion)产出合格样本仅有演示级实验§5.3 只有定性样例与网页demo,无系统指标对比
NSFW/水印标签足以支撑"安全子集"构建只是主张+初步验证官方博客给出分类器精度0.960/0.961,但论文§3.2自认"远不完美"

1.5 推荐阅读路线

必读主线:§3 流水线 → §4 子集组成 → §5.2 CLIP复现结果表。可跳读:§2 相关工作(熟悉CLIP谱系者);附录A数据表(用到时再查)。跳读代价:跳过§7会漏掉作者对"开放vs封闭数据集治理"的核心立场——这是后来围绕LAION争议(如2023年LAION-5B下架事件)的伏笔,但该争议本身不在论文内,属解读者补充背景。

二、逐章精读

2.1 动机:私有数据的护城河(对应论文§1–§2)

来源标注:本小节对应论文§1(第1–2页),解读者类比为本节末段。

失效模式先行:没有公开大数据集时的具体困境不是抽象的"不利于社区",而是:想训练一个CLIP级别的模型,你只能在"用小数据集做出明显更差的模型"和"自费爬一个50亿级的原始网页语料再自建过滤流水线"之间选。前者让开源研究永远慢半拍,后者的成本对绝大多数实验室不可承受。

学习目标:学完本节能说出:(1) 论文引用的两个关键精度数字(ImageNet零样本从11.5%到76.2%)分别属于谁;(2) 公开数据集与私有数据集的规模断层有多大;(3) "民主化研究"这个口号对应的可操作承诺是什么。

数字落点:论文 Figure 2/Table 3 列出:公开阵营 MS-COCO 330K、CC3M 3M、WIT 5.5M、CC12M 12M、YFCC100M 100M(经CLIP论文筛选仅剩15M)、LAION-5B 2.3B(英语);私有阵营 CLIP WIT 400M、ALIGN 1.8B、BASIC 6.6B。LAION-5B 是其他公开英文数据集的20倍以上

类比:私有数据集像各家秘而不宣的菜谱,LAION做的事是把食材采购清单(URL+alt-text元数据)连同采购方法(流水线代码)一起公开。注意类比在哪里失效:LAION只发布元数据和链接,图像本体仍受各自版权约束(博客License节),且链接会随时间失效——所以它是"会腐烂的菜谱",这是静态数据集论文共有的盲点。

一句话蒸馏:一句话记住本节:CLIP之后的竞赛是数据竞赛,而LAION-5B之前所有十亿级参赛数据都在私人口袋里。

2.2 构建流水线手术台(对应论文§3.1)

来源标注:本小节对应论文§3.1(第2–3页)及官方博客"Acquisition pipeline"节;成本细节以博客为准。

学习目标:学完本节能按顺序复述流水线五个阶段,并手算"50B候选→5.85B成品"的过滤比例;能解释为什么阈值取0.28/0.26而不是别的数。

流水线五阶段:

阶段做法(原文依据)关键数字
① 解析解析 Common Crawl 的 WAT 元数据文件中的 HTML IMG 标签,取带 alt-text 的图(论文§3.1)Crawl 自2008年起运行,单快照约300 TiB、约30亿网页(§3开头)
② 语言检测CLD3 检测,输出三分类:英语 / 其他语言 / 无法判定语言(nolang)(§3.1)nolang 多为产品名、地名等短文本(人工抽查结论)
③ 下载Trio/Asks 异步请求;PostgreSQL 用 TABLESAMPLE 均衡取样避免打爆单一网站(博客)每worker约2 vCPU/1GB RAM/10Mbps,处理1万链条约10–15分钟,并行约300个worker(论文§3.1+博客)
④ 粗滤删 alt-text 少于5字符、图片小于5KB、疑似DOS炸弹的超大分辨率图;URL布隆过滤器去重(§3.1后处理+博客)
⑤ CLIP 过滤计算图像-文本嵌入余弦相似度:英语用 OpenAI ViT-B/32,阈值0.28;非英语用 mCLIP,阈值0.26(§3.1)从500多亿候选中移除约90%,剩不到60亿(§3.1原文:"removed around 90% of the original 50 billion images")

公式手术(唯一需要算的量):过滤保留率

保留率 = Nafter / Ncandidates = 5.85B / 50B ≈ 0.117 ≈ 11.7%
符号它是什么直觉
N_candidates解析Common Crawl得到的图文对候选总量论文说"50 billion images",即500亿量级
N_after通过CLIP相似度阈值后的样本量"just short of 6 billion",即不足60亿
≈90%论文口径的移除比例1 − 11.7% ≈ 88.3%,与"约90%"吻合(四舍五入口径)

手算验证:三个子集之和应等于总数:2.32B (en) + 2.26B (multi) + 1.27B (nolang) = 5.85B ✓ 与摘要一致。数字对账发现一处小出入:论文正文写"just short of 6 billion"(不足60亿),摘要写5.85B,两者相容;但官方博客写"trimming the 50+ billion of candidates to just below 6 billion",候选量写为"50+"亿级——候选基数到底是恰好50B还是更多,论文未给精确值,此处的90%只能当量级看,不能当精确比例用。【解读者推断】

常见误读:(1) "CLIP过滤=人工质检替代品"——错,0.28/0.26这两个阈值是"基于人工抽检测试结果"选出来的经验值(博客原话"selected based on human inspection"),本质是用一个小模型的审美当裁判;(2) "LAION发布了58亿张图片"——错,公开分发的是元数据(URL/文本/尺寸/相似度/安全分数的Parquet文件,CC-BY 4.0),图片需用户自行下载且版权归原主;(3) "去重很彻底"——错,论文§6承认主要去重手段是基于URL的布隆过滤器,并明确把"进一步去重"列为未来工作,测试集重叠风险因此存在。

主张 vs 事实:【论文声称】"足够大的开放数据集使社区第一次有机会审计这一量级的数据";【实验支持】CLIP复现在多个基准上匹配原版(Table 4);【解读者推断】"审计"的实际门槛仍然很高——下载全量图片仍需PB级带宽和时间,开放的是可能性而非便利性。

一句话蒸馏:一句话记住本节:一条"解析→检测→下载→粗滤→CLIP打分砍掉九成"的流水线,把公共网络变成了可用的监督信号。

闭卷自检清单:不看材料,我能说出——(1) 英语与非英语的相似度阈值各是多少?(2) 用的是哪个规模的CLIP模型做过滤?为什么没用更大的?(3) 90%这个数是怎么来的?(4) nolang子集大概装的是什么内容?

2.3 数据集组成:三个子集与安全分数(对应论文§4、附录C/D)

来源标注:本小节对应论文§4(第4页)及官方博客统计节。

子集规模要点(原文数字)
LAION-2B-en23.2亿对宽高>1024px 仅76M;不安全占比2.9%;水印占比6.1%;平均文本长度67字符(博客统计)
LAION-2B-multi22.6亿对,100+语言Top-5语言:俄语10.6%、法语7.4%、德语6.6%、西语6.6%、中文6.3%(§4);不安全占比3.3%
LAION-1B-nolang12.7亿对语言置信度不足阈值的样本,多为产品/地名短文本(§4)

每个样本的元数据字段(§4):64位ID、URL、文本、高宽、图文嵌入余弦相似度、NSFW分数、水印分数。约3%的图像被判为NSFW——注意措辞:是"打标"而非"删除",是否过滤由使用者决定(§3.2 明确拒绝预先删除,理由是保留研究透明度)。

衍生子集(§5.1,解读者提示其重要性):LAION-High-Resolution(170M,供超分辨率模型)与 LAION-Aesthetics(120M,由CLIP之上的线性美学估计器选出)。Stable Diffusion 正是用这三个子集训练的——这条因果链意味着:美学过滤器这个小发明间接塑造了此后两年文生图模型的审美取向。

常见误读:"multi子集=均衡的多语言数据"——错,俄语占10.6%而全球使用人数更多的印地语等语言占比极低,分布反映的是Common Crawl的爬取偏差而非世界语言结构。这一点论文虽未直接讨论multi的语言公平性,但同类问题在NLP侧(RefinedWeb等)有明确记录,属解读者横向对照。

一句话蒸馏:一句话记住本节:2.32+2.26+1.27=5.85,三个子集按语言置信度切分,安全信息靠分数携带而非预先清洗。

闭卷自检:(1) 三个子集各自的规模?(2) NSFW比例是多少?是删除还是打标?(3) Stable Diffusion用了哪几个子集?

2.4 验证实验:CLIP复现的数字账本(对应论文§5.2)

来源标注:本小节对应论文§5.2及Table 4(第5–6页)。

学习目标:学完本节能背出至少三组"LAION vs OpenAI WIT"的同架构零样本top-1对比,并能解释为什么ViT-L/14上400M子集输给原版而2B-en几乎追平这件事反而证明了数据集的价值。

核心结果(Table 4,零样本 top-1 %):

模型/数据INetINet-v2INet-RINet-SObjNetVTAB+
B/32 CLIP WIT63.356.069.442.344.245.4
B/32 LAION-400M62.955.173.449.443.945.6
B/32 LAION-2B-en65.757.475.952.948.747.9
L/14 CLIP WIT75.669.887.959.669.055.7
L/14 LAION-400M72.865.484.759.659.951.8
L/14 LAION-2B-en75.267.787.463.365.554.6

数字对账:(1) B/32 上 400M 子集在 INet-R (+4.0)、INet-S (+7.1) 反超原版,说明分布偏移鲁棒性并不必然依赖私有数据的精挑细选——这与CLIP原论文"自然分布偏移上优势大"的叙事互相印证。(2) L/14 上 400M 全面落后(最大差 ObjNet −9.1),但 2B-en 把差距缩到 −0.3~−3.6——同一模型、只换数据,性能随数据规模单调改善,这是论文最有说服力的一组对照。算一遍:L/14 在 ObjNet 上 75.2−72.8=2.4 个百分点来自数据从400M扩到2.3B(5.8×),平均每翻一番约贡献0.85个百分点(log₂5.8≈2.54,2.4/2.54≈0.94 pp/倍)——【解读者推算,仅示意数量级,论文未做此归因】。

工程账单:训练在 JUWELS Booster 超算上进行,用128–400块 A100(§5.2);ViT-L/14 推理速度仅312样本/s/GPU(ViT-B/32 为1800,博客附录C.2)——这解释了为何全库嵌入计算要花一周、32块A100:过滤一次的成本本身就是一笔不小的GPU账,这笔债后来催生了各种"用更强过滤器重制LAION"的项目。

类比与失效:"CLIP复现像照着公开配方烤出和米其林一样好的面包"。失效处:面包配方完全决定成品,而这里400M子集只是与WIT"同量级"而非"同内容",L/14上的残余差距提醒我们数据的具体构成仍有影响。

主张 vs 事实:【实验支持】同算力下(34B images seen),ViT-L/14 在 2B-en 达75.4%、400M达73.9%(§5.2);【论文声称】"用更大CLIP(如ViT-L/14)重过滤会得到更干净的数据集";【解读者推断】这句话实际上承认了当前版本的天花板——过滤器本身就是瓶颈。

一句话蒸馏:一句话记住本节:小模型追平(B/32)、大模型逼近(L/14)、扩数据全面受益——三条证据线合起来支撑"LAION可替代私有WIT"的主张。

闭卷自检:(1) ViT-B/32 在 ImageNet 上两组数字各是多少?(2) 哪个分布偏移基准上原版CLIP优势最大?(3) 34B images seen 对照说明了什么?

2.5 分级自测题

三、批判性阅读:如何不被这篇论文带节奏

3.1 benchmark到底测什么

Table 4 的六列各有侧重:INet 测通用零样本分类;INet-v2/R/S/ObjNet 测四种自然分布偏移(渲染/剪贴画/素描/真实物体新视角);VTAB+ 是35个小任务的平均值,偏向迁移广度而非单点高度。没有任何一个基准测"图文对齐质量"本身——即没有直接度量"数据集中图文是否真的匹配",这一点完全靠CLIP下游表现间接反推。另外注意:GLIDE/Stable Diffusion 验证(§5.3、附录F)主要是定性样例,没有FID之类的系统性生成质量对比,证据等级明显低于CLIP部分。

3.2 比较是否公平

LAION-400M vs WIT-400M 的对比控制了数据量和架构,但无法控制数据构成:WIT的筛选细节至今未完全公开(这正是本文的存在理由),所以"匹配"只能说明"量级相当的数据即可达成相当效果",不能说明"LAION数据=WIT数据"。此外,训练用的是 OpenCLIP 复现实现而非OpenAI原始代码,超参"遵循原CLIP的选择"(§5.2)——实现差异的影响未被单独剥离。【解读者观点】

3.3 成本第二坐标轴

论文几乎不讲成本,博客补了一角:全量下载用约300个廉价worker跑数周、嵌入计算32块A100跑一周、kNN索引800GB(PQ128,autofaiss)加上元数据同样800GB。复现这份"免费"数据集的真实开销是:PB级存储+数百GPU天+一套分布式工程。免费的是许可,不是获取。

3.4 论文没有告诉你什么

四、综合考核

任务一 · 重建因果链

只给你三个事实:"ALIGN/BASIC封闭"、"Common Crawl每月快照约300TiB"、"OpenAI已公开CLIP权重"。请推导:为什么LAION选择"元数据+链接"而非"图片本体"作为分发形态?为什么选择用CLIP而非人工规则做核心过滤?(提示:分别对应法律约束与规模化约束。)

参考答案图片受版权约束,元数据(事实性URL/文本记录)可CC-BY分发——法律约束决定了只能发"指针";50B候选的量级使人审不可能,而已公开的CLIP权重提供了唯一一个"免费、可并行、可规模化"的质量信号源——规模化约束决定了过滤器选型。两问各2分,能点出"已有CLIP权重"这个时间窗口因素加1分。

任务二 · 数字总对账

检查以下五组数字的自洽性:(1) 2.32+2.26+1.27 vs 5.85;(2) 移除率90% vs 5.85/50;(3) multi子集Top-5语言占比之和 vs 100%;(4) 博客"en子集不安全2.9%" vs 论文"约3% NSFW";(5) 训练GPU数128–400 vs ViT-L/14推理312样本/s。

参考答案(1) 5.85 ✓;(2) 1−11.7%=88.3%,与"约90%"相容(四舍五入)✓;(3) 10.6+7.4+6.6+6.6+6.3=37.5%,本就只是Top-5,无需等于100% ✓;(4) 2.9%(en子集)与"约3%"(全集口径)相容,全集还含multi 3.3%与nolang 3% ✓;(5) 两者无矛盾关系,一个是训练资源、一个是单卡吞吐,不能互推——此题考的是识别"伪对账"。每组1分,第(5)组需说明理由才得分。

任务三 · 设计决策答辩

对以下三个决策各答三连(为什么这样做/不这样做会怎样/论文论据够不够):① 过滤器用ViT-B/32而非更大的CLIP;② NSFW只打标不删除;③ 分发元数据而非图片。

参考答案要点① 当时更大CLIP尚未可得(§6原文),一致性优先;不用大模型会导致数据质量天花板受限——论文自己也承认并列为未来工作,论据诚实但不充分(缺阈值消融)。② 保审计透明度、防误删;不这样做会让数据集变成黑箱清洗产物、丧失"可被社区改进"的定位;论据充分但依赖使用者自律这一隐含前提。③ 版权合规+分发成本低;不这样做会有法律风险且存储分发成本爆炸;论据充分。每个决策3分:理由、反事实、论据评价各1分。

任务四 · 证据审计(回看1.4预评)

读完全文后重新评分并说明变化:

参考答案"CLIP复现匹配"维持强支撑(Table 4覆盖6基准×6模型);"规模收益"升级确认为强支撑(同算力对照排除了算力混淆);"生成模型验证"确认降级为演示级(无系统指标);"安全标签足够"维持弱主张——且注意到分类器精度0.96是在"平衡的人工标注3000样本测试集"上报的(博客),真实分布极不平衡时精度会虚高。能主动指出测试集分布问题的额外加1分。

任务五 · 开放研究问题(可选)

论文留下的方向:① 用更大CLIP(ViT-L/14)重新过滤并量化收益(作者明说的未来工作);② LAION与主流CV基准的重叠度测量(§6);③ 多语言子集的训练价值验证(论文从未做过)。任选其一写出实验设计草稿。