来源声明:本页所有数字均复述自论文原文(arXiv:2306.01116v1),未做外部验证;【解读者补充/推断】均有标注。论文附录D多语言部分与附录E部分小节在抓取中被截断,涉及该处的分析已注明未核验。
2023年之前的共识是:LLM预训练数据 = 过滤后的网页 + 精选"高质量"语料(书、论文、社交对话)。The Pile、GPT-3的训练集都是这个配方,社区普遍相信没有精选语料就训不出强模型。但精选有个致命缺陷:不可规模化。Chinchilla(2022)算出最优训练175B模型需要约3500B token,而当时最大的公开英文数据集只有其十分之一量级。RefinedWeb的立场极其鲜明:标题里连写两遍——"with Web Data, and Web Data Only"。
| 摘要短语 | 对应论文章节 | 对应本页精读章 |
|---|---|---|
| "properly filtered and deduplicated web data alone can lead to powerful models" | §4.2 全规模实验 | 第二章 §2.4 |
| "five trillion tokens from CommonCrawl" | §3 MDR流水线 | 第二章 §2.2–2.3 |
| "publicly release a 600 billion tokens extract" | §6 结论、附录A | 第三章 §3.4 |
| "1.3/7.5B parameters language models trained on it" | §4.1 设置 | 第二章 §2.4 |
| "outperforming models trained on The Pile" | §4.2 小规模+全规模对比 | 第二章 §2.4 |
Chinchilla缩放律(数据需求暴涨) → MDR设计三原则(规模优先/严格去重/中立过滤) → 文档准备(WARC→URL过滤→trafilatura→fastText) → 过滤(文档级MassiveWeb启发式+行级修正) → 去重(MinHash模糊+后缀数组精确+跨dump URL) → RW-Raw→RW-Filtered→RefinedWeb三级消融 → 1B/3B小规模研究 → 1B/7B@350GT对标GPT-3
枢纽节点是"去重":它是唯一在小规模消融中对所有数据集都稳定涨分的操作(Table 5),也是全文最反直觉主张("去重要比前人激进得多")的载体。
| 声称的贡献 | 证据强度预评 | 依据 |
|---|---|---|
| 构建5000亿token纯网页英语数据集RefinedWeb | 强实验支撑 | §3流水线+Figure 2各阶段移除率完整可查 |
| 纯网页数据可匹敌甚至超越精选语料训练的模型 | 强实验支撑 | 内部同设置对比(Table 4)+跨代码库基准对比(Figure 3)双重验证 |
| 公开600B token子集及1.3B/7.5B模型作为新基线 | 强实验支撑 | HuggingFace发布,ODC-By 1.0许可(附录A datasheet) |
| MDR流水线可迁移改善其他现有数据集 | 仅有部分支撑 | Table 5显示过滤增益不系统(OSCAR-22.01反而−0.4),仅去重普适 |
| 避免ML质量过滤以保持中立性 | 设计主张 | 引用偏差文献论证动机,无直接实验对比"有/无ML过滤器"的偏见差异 |
必读主线:§3.3去重细节 → Table 4小规模结果 → §4.2 Finding段。可跳读:§2相关工作(熟悉C4/Pile谱系者);附录F评测细节(复现时再查)。跳读代价:不看§4.3会误以为"过滤越狠越好",而该节恰恰展示了过滤收益的不确定性——这是全文最容易被断章取义的部分。
来源标注:本小节对应论文Table 1(第1页);解读为解读者补充。
| 数据集 | 规模 | 可得性 | 网页占比 | 处理方式 | 去重 |
|---|---|---|---|---|---|
| C4 | ~360GT | 公开 | 100% | 规则+NSFW词黑名单 | 精确:3句跨度 |
| OSCAR-21.09 / 22.01 | ~370 / ~283GT | 公开 | 100% | 行级构建/行级规则 | 逐行精确(21.09移除~55%) |
| GPT-3(私有) | 300GT | 私有 | 60% | 基于已知优质源训练的内容过滤 | MinHash(~10%移除) |
| The Pile | ~340GT | 公开 | 18% | jusText抽取+内容过滤 | MinHash(~26%移除) |
| PaLM(私有) | 780GT | 私有 | 27% | 高质量源训练的过滤器 | 未知 |
| RefinedWeb | ~5,000GT | 公开(600GT) | 100% | trafilatura+文档/行级规则+NSFW URL黑名单 | 精确子串+MinHash(~50%移除) |
手算验证:RefinedWeb规模 ≈ C4的13.9倍(5000/360)、Pile的14.7倍、PaLM的6.4倍;公开子集600GT也已超过Pile总量。引言说"优化训练GPT-3尺寸模型需要不少于3500B token"(引自Hoffmann et al. 2022)——5000GT恰好覆盖这一需求还有余,这就是"规模优先"原则的具体含义。
来源标注:本小节对应论文§3.1–3.2(第2–3页)。
失效模式先行:为什么不能像C4那样直接用Common Crawl的WET文件?因为WET预处理过的纯文本里混着导航菜单、广告等无关文字——这是The Pile和Gopher团队都踩过的坑(§3.1原文引用)。为什么不能用ML质量分类器大规模打分?因为训练它的"金标准"来自人工精选源,会把精选源的口味偏置烙进数据(§3设计原则,援引Dodge et al. 2021关于过滤伤害少数群体的发现)。
学习目标:学完本节能按序复述六个处理步骤及其关键参数;能解释"为什么URL过滤要屏蔽Wikipedia和arXiv"这个看似荒谬的设计。
| 步骤 | 做法 | 关键参数/数字 |
|---|---|---|
| ① 读数据 | 从原始WARC文件出发(warcio读取),不用WET | — |
| ② URL过滤 | 460万域名聚合黑名单 + 基于词表的URL评分(按严重度加权) | 常见黑名单误伤博客平台等假阳性,故自建规则;主动屏蔽Wikipedia/arXiv等高质量源(因RefinedWeb定位为聚合数据集中的网页成分,这些源由其他组件提供)(§G.1.3) |
| ③ 正文抽取 | trafilatura(非商业库中文本抽取最佳,据Lopukhin 2019评测);正则清理:连续换行限两个、删除所有URL | — |
| ④ 语言识别 | CCNet的fastText字符n-gram分类器(176语言),文档级 | top语言分数<0.65即删(多为无自然语言页面) |
| ⑤ 文档级过滤 | Gopher(MassiveWeb)启发式:行/段落/n-gram重复过多即删;长度离群、符号-词比异常等 | 启发式须按语言调参,英语规则直接套用他语言会过滤过度 |
| ⑥ 行级修正 | 删除"3 likes"、导航按钮、社媒计数器等坏行;若修正删掉超文档5%则整篇丢弃 | 论文自创步骤(区别于既有流水线之处) |
数字对账(漏斗账):论文Figure 2给出:文档准备后剩48%(约一半被语言检测砍掉);过滤后再剩23%(RW-Raw中约一半被质量过滤移除,正文表述为"24% of remaining discarded for insufficient quality"口径略有出入,见下);最终成品约100亿文档/5万亿token。此处有一处需指出的小瑕疵:Figure 2图注说过滤移除的是"24% of the remaining",而正文§3.2说"around 50% of the documents of RW-Raw removed by the filtering"且"only 23% of the documents of CommonCrawl are left"。验算:若RW-Raw占48%,再砍一半得24%而非23%——23%与24%之间的1个百分点差可能来自四舍五入或统计口径(文档vs token)差异,论文未解释。【解读者核对发现,供批判性阅读参考】
类比:这条流水线像食品加工:"先扔掉烂原料(URL黑名单)、削皮去核(正文抽取)、只留本国食材(语言识别)、剔除变质部位(文档级启发式)、最后摘掉每块肉上的筋膜(行级修正)"。类比在哪里失效:食品检验有客观标准,而这台机器的"变质判定"全是经验阈值——比如行级修正的5%上限,改一个数整个数据集面貌就变,论文没有对这些阈值的敏感性做消融。
一句话蒸馏:一句话记住本节:不用WET不用ML打分,靠"WARC+规则+行级手术"把Common Crawl砍到只剩23%,换来的是可控的中立性。
闭卷自检:(1) 为什么弃用WET文件?(2) fastText的置信度阈值是多少?(3) 行级修正的整篇丢弃门槛是多少?(4) 为什么屏蔽Wikipedia?
来源标注:本小节对应论文§3.3(第3–4页)。
学习目标:学完本节能说出MinHash配置的具体数字并解释为何远比The Pile激进;能区分模糊去重与精确子串去重的打击对象。
| 层次 | 方法 | 配置 | 打击对象 |
|---|---|---|---|
| 模糊(文档级) | MinHash近似匹配 | 每文档9000个哈希,基于5-gram,分成20桶×450哈希 | 模板化文档:只有实体不同的许可证、跨站复制的SEO占位文(对照:The Pile仅10个哈希) |
| 精确(序列级) | 后缀数组找完全相同子串 | 删除>50个连续token的重复串(Lee et al. 2022实现) | 免责声明、通知等跨文档复用的片段 |
| 跨dump(URL级) | 记录每个已处理分片中保留样本的URL,后续分片遇同URL即删 | Common Crawl切成100份并行处理(算力所限) | 不同月度dump间反复爬到的同一页面 |
公式手术(MinHash直觉版):MinHash用哈希函数族估计两文档的Jaccard相似度。
| 符号 | 它是什么 | 直觉 |
|---|---|---|
| J(A,B) | |A∩B| / |A∪B|,两文档5-gram集合的Jaccard相似度 | 1=完全相同,0=毫无重叠 |
| 9000哈希/20桶×450 | b-banding技巧:450行×20带 | 任一带内全部450个哈希相等才判为候选重复对;带越多漏检越少、桶内碰撞越准 |
| 5-gram | 以连续5词为单位建shingle集合 | 粒度太细则标点差异就破坏匹配,太粗则短模板漏网 |
工程账单:激进去重缓解了"模型背题"压力(援引Hernandez et al. 2022:1B模型上百次重复才有害,175B模型几次重复就有害),代价是砍掉约一半数据——按Chinchilla口径这相当于烧掉近一半算力预算换质量,这笔账是否划算取决于下游实验,而论文用Table 4/Table 5回答了它。另外注意:精确子串去重会改变文档结构(切走片段),作者试过整篇丢弃和loss-masking两种替代方案,零样本性能无显著差异(§G.3.2)——这个稳健性检查常被忽视,值得记住。
常见误读:(1) "MinHash能找出语义相似的文档"——错,它是纯词汇层面的近似匹配,换个说法的抄袭抓不到(语义去重要靠SemDeDup类嵌入方法,论文相关工作提过但没用);(2) "去重总是有益的"——错,Pythia团队同期发现去重The Pile对零样本影响有限(§2末尾原文承认),本文结论应限定在"网页型数据集+激进设置"场景;(3) "50个token阈值很宽松"——错,50 token已是相当长的片段,且实测该设置下总移除率约50%,远高于任何前人数据集。
一句话蒸馏:一句话记住本节:9000哈希、20桶×450、50-token阈值——三个数字定义了当时最激进的大规模去重,砍掉一半数据换来了全文最重要的性能增益。
闭卷自检:(1) MinHash三个配置数字?(2) The Pile用了几个哈希?(3) 三层去重分别对付什么?(4) 参数量越大重复数据的危害如何变化?
来源标注:本小节对应论文§4.1–4.3(第4–6页)。
学习目标:学完本节能复述Table 4的关键数值并解释三级证据分层(内部对比/基准级对比†/外部对比*)的设计意图;能用Table 5判断"过滤"和"去重"哪个更可靠。
评测设计(§4.1)值得先看:18个任务组成四个聚合——small(6任务,内部消融用)、core、main(GPT-3/PaLM报告的任务)、ext(BigScience任务)。全部零样本、统一用EleutherAI评测框架。作者明确拒绝用验证损失当指标,理由是perplexity与端到端表现可能背离(引Tay et al. 2021)。对比对象分三级标注:内部(自己训自己评)、基准级*(他人模型用同一Harness重测)、外部†(直接抄原论文数字,评测设置不同)——这个标注纪律本身就是批判性阅读的好范本。
小规模研究(Table 4,small-agg零样本平均准确率):
| 数据集 | OSCAR-21.09 | OSCAR-22.01 | C4 | The Pile | RW-Raw | RW-Filtered | RefinedWeb |
|---|---|---|---|---|---|---|---|
| 1B@27GT | 55.0% | 52.7% | 55.7% | 53.4% | 52.7% | 54.3% | 56.2% |
| 3B@60GT | 59.1% | 55.9% | 59.6% | 57.9% | 57.4% | 58.2% | 59.8% |
数字对账:(1) RW-Raw(几乎不过滤)与OSCAR-22.01并列垫底52.7%——说明过滤确实必要,"原始网页也挺好"是错的;(2) RW-Raw→Filtered +1.6pp,Filtered→Final +1.9pp——去重贡献略大于过滤;(3) 同为网页数据,C4(55.7%)明显强于OSCAR-22.01(52.7%),作者归因于后者主版本未去重——这与Table 5中OSCAR-22.01去重后大涨+2.9pp互相印证 ✓;(4) 训练token数符合Chinchilla最优配比吗?1B@27GT:20 token/参数 ✓;3B@60GT:20 token/参数 ✓——严格按Hoffmann et al. 2022执行,消融可比性有保障。
全规模实验(§4.2):1B和7B模型各训350GT(刻意超出Chinchilla最优点,对齐GPT-3/GPT-J等公开模型的实际训练量以便比较),另训一个1B@350GT on The Pile作内部控制。核心Finding(原文):经过充分过滤与去重的纯网页数据训练的模型,在main-agg上能追平GPT-3系列的表现——尽管Wikipedia、arXiv等"The Pile引以为傲的高质量源"已被从RefinedWeb中屏蔽。同时,开源模型(GPT-NeoX、OPT、BLOOM、Pythia、Cerebras-GPT等)普遍追不上GPT-3,而RefinedWeb模型做到了——作者由此推断:开源阵营与闭源的性能差距,主要不在架构而在数据。
MDR可迁移性实验(Table 5,§4.3):把MDR的过滤和去重分别施加于四个现有数据集(small-agg,1B@27GT):
主张 vs 事实:【实验支持】"去重在所有测试数据集上稳定有益";【实验支持】"过滤启发式需要按源调参";【论文声称】"web data alone可以挑战数据质量的传统观念"——注意这个claim的外部有效性边界:仅在zero-shot评测、≤7B模型、350GT训练量的范围内被验证,7B以上的外推是作者的信心而非证据。
一句话蒸馏:一句话记住本节:56.2% vs 53.4%(1B小规模)、7B追平GPT-3(全规模)——两组数字合起来宣判了"没有精选语料不行"的死刑,但判决书上盖着一个"仅限zero-shot、≤7B"的骑缝章。
闭卷自检:(1) Table 4中RW三级版本的分数梯度?(2) 哪个数据集去重收益最大、为什么?(3) 作者为什么不和LLaMA比?(4) 三级对比标记*和†各代表什么?
四个聚合(small/core/main/ext)共18个任务,覆盖句子补全(HellaSwag/LAMBADA)、指代(Winogrande)、常识问答(PIQA/OpenBookQA/ARC/BoolQ/COPA)、NLI(CB/RTE/ANLI)等。它们共同测量的是零样本平均准确率——一个对提示格式敏感、对任务构成敏感的复合指标。"追平GPT-3"特指main-agg上这些任务的zero-shot均值,不代表few-shot能力、上下文学习、推理能力或安全性上的对等。论文自己在§4.2承认:与GPT-3的比较属于†级(评测设置不同的外部对比),可信度低于内部对比。
论文没有报告MDR流水线的计算成本(CPU核时、存储、耗时)——对一个以"可扩展性"为核心卖点的数据集来说,这是个显眼的缺席。去重的算力昂贵程度只在§3.3侧面流露("由于计算约束,无法直接对RW-Filtered整体去重,必须切成100份")。此外,激进去重砍掉的~50%数据意味着:达到同样token量需要爬取和处理两倍规模的原始数据——质量的钱是用采集算力付的。
只给三个数字:"3500B token(GPT-3尺寸的最优训练需求)"、"~340GT(最大公开数据集Pile)"、"175B模型几次重复即有害(Hernandez)"。推演:这三个数字如何逼出了MDR的三条设计原则?参考答案
3500÷340≈10倍的缺口逼出"规模优先"——只有Common Crawl能供给万亿token,故放弃人工策展;"重复有害且随参数量加剧"逼出"严格去重"——万亿token若含高重复率等于慢性中毒;而要在万 亿尺度上避免人工策展的主观性、又不能让ML过滤器的偏见污染数据,只剩规则化手段可选,逼出"中立过滤"(仅语言识别用ML,成人内容只做URL过滤)。三组对应关系各2分;能指出三条原则其实是同一个约束(万亿尺度)的三个投影再加1分。
检查:(1) Chinchilla配比:1B@27GT、3B@60GT是否符合20 token/param?(2) OSCAR-21.09去重移除率10.8%与其Table 1标注"exact per-line (~55% removed)"是否矛盾?(3) 公开600GT占5000GT的比例,与datasheet"a tenth"的说法是否一致?(4) Figure 2的"23%剩余"与"过滤移除RW-Raw的50%"是否自洽?参考答案
(1) 27/1=27、60/3=20——1B那组其实是27 token/param,略高于20;论文原文写"on 27B and 60B tokens respectively",严格说是接近而非恰好等于Chinchilla比例,出题陷阱在此。(2) 不矛盾:Table 1说的是OSCAR官方构建时的逐行去重(已做过一轮),Table 5的10.8%是MDR在此基础上再做模糊+精确去重的额外移除率——两次去重叠加并不冲突,但10.8%之小说明其确实已较干净。(3) 600/5000=12%≈"约十分之一" ✓。(4) 48%×(1−50%)≈24%,与"23%"相差1个百分点,属四舍五入或口径差(文档vs token),正文未解释——应在精读笔记中标为存疑。每组判定+理由各1分,第(1)(4)组须指出瑕疵才得满分。
对以下决策各答三连:① 从WARC而非WET出发;② 屏蔽Wikipedia/arXiv等高质量源;③ 用9000哈希而非The Pile式的10哈希做MinHash。参考答案要点
① WET含菜单广告等噪声且前人(Pile/Gopher)已踩坑;不用WARC则正文抽取质量失控,后续一切过滤都在脏数据上进行——论据充分(引前人教训+自身消融RW-Raw表现差佐证)。② 因为RefinedWeb定位是聚合数据集中的"网页成分",混入维基会导致下游使用者重复计入这些源;不屏蔽则数据集角色混乱——但这也造成"单独使用RefinedWeb的模型缺百科知识"的隐忧,论文未讨论此点,论据半充分。③ 论文实证:弱设置(如10哈希)导致更低去重率和更差模型性能(§3.3原文);9000哈希的代价是计算开销,但换来约50%移除率——论据充分且有对照实验支撑。每项3分。
论文留下的方向:① 去重能否支撑数据受限下的多epoch训练(§E.3);② 精选语料的去重价值重估(Pythia结论与本文的调和);③ 中立规则过滤与ML过滤在下游偏见上的系统性对比(本文只有立场没有数据)。任选其一写出实验设计草稿。