← 总目录 / 板块二 · Infra与数据的变迁
板块二 · Infra与数据的变迁

第17篇 · RefinedWeb

只用网页数据、不加任何"精选语料",就能训出追平GPT-3的模型——数据策展信仰的正面爆破
The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only(arXiv:2306.01116)· Penedo, Malartic, Hesslow 等(LightOn / Technology Innovation Institute)· 2023 · 原文

来源声明:本页所有数字均复述自论文原文(arXiv:2306.01116v1),未做外部验证;【解读者补充/推断】均有标注。论文附录D多语言部分与附录E部分小节在抓取中被截断,涉及该处的分析已注明未核验。

一、全局大图

1.1 这篇论文在反驳什么

2023年之前的共识是:LLM预训练数据 = 过滤后的网页 + 精选"高质量"语料(书、论文、社交对话)。The Pile、GPT-3的训练集都是这个配方,社区普遍相信没有精选语料就训不出强模型。但精选有个致命缺陷:不可规模化。Chinchilla(2022)算出最优训练175B模型需要约3500B token,而当时最大的公开英文数据集只有其十分之一量级。RefinedWeb的立场极其鲜明:标题里连写两遍——"with Web Data, and Web Data Only"。

1.2 摘要—章节对照导航表

摘要短语对应论文章节对应本页精读章
"properly filtered and deduplicated web data alone can lead to powerful models"§4.2 全规模实验第二章 §2.4
"five trillion tokens from CommonCrawl"§3 MDR流水线第二章 §2.2–2.3
"publicly release a 600 billion tokens extract"§6 结论、附录A第三章 §3.4
"1.3/7.5B parameters language models trained on it"§4.1 设置第二章 §2.4
"outperforming models trained on The Pile"§4.2 小规模+全规模对比第二章 §2.4

1.3 知识依赖图(文本版)

Chinchilla缩放律(数据需求暴涨)MDR设计三原则(规模优先/严格去重/中立过滤)文档准备(WARC→URL过滤→trafilatura→fastText)过滤(文档级MassiveWeb启发式+行级修正)去重(MinHash模糊+后缀数组精确+跨dump URL)RW-Raw→RW-Filtered→RefinedWeb三级消融1B/3B小规模研究1B/7B@350GT对标GPT-3

枢纽节点是"去重":它是唯一在小规模消融中对所有数据集都稳定涨分的操作(Table 5),也是全文最反直觉主张("去重要比前人激进得多")的载体。

1.4 主要贡献与证据强度预评

声称的贡献证据强度预评依据
构建5000亿token纯网页英语数据集RefinedWeb强实验支撑§3流水线+Figure 2各阶段移除率完整可查
纯网页数据可匹敌甚至超越精选语料训练的模型强实验支撑内部同设置对比(Table 4)+跨代码库基准对比(Figure 3)双重验证
公开600B token子集及1.3B/7.5B模型作为新基线强实验支撑HuggingFace发布,ODC-By 1.0许可(附录A datasheet)
MDR流水线可迁移改善其他现有数据集仅有部分支撑Table 5显示过滤增益不系统(OSCAR-22.01反而−0.4),仅去重普适
避免ML质量过滤以保持中立性设计主张引用偏差文献论证动机,无直接实验对比"有/无ML过滤器"的偏见差异

1.5 推荐阅读路线

必读主线:§3.3去重细节 → Table 4小规模结果 → §4.2 Finding段。可跳读:§2相关工作(熟悉C4/Pile谱系者);附录F评测细节(复现时再查)。跳读代价:不看§4.3会误以为"过滤越狠越好",而该节恰恰展示了过滤收益的不确定性——这是全文最容易被断章取义的部分。

二、逐章精读

2.1 数据版图:一张表看清竞争格局(对应论文Table 1)

来源标注:本小节对应论文Table 1(第1页);解读为解读者补充。

数据集规模可得性网页占比处理方式去重
C4~360GT公开100%规则+NSFW词黑名单精确:3句跨度
OSCAR-21.09 / 22.01~370 / ~283GT公开100%行级构建/行级规则逐行精确(21.09移除~55%)
GPT-3(私有)300GT私有60%基于已知优质源训练的内容过滤MinHash(~10%移除)
The Pile~340GT公开18%jusText抽取+内容过滤MinHash(~26%移除)
PaLM(私有)780GT私有27%高质量源训练的过滤器未知
RefinedWeb~5,000GT公开(600GT)100%trafilatura+文档/行级规则+NSFW URL黑名单精确子串+MinHash(~50%移除)

手算验证:RefinedWeb规模 ≈ C4的13.9倍(5000/360)、Pile的14.7倍、PaLM的6.4倍;公开子集600GT也已超过Pile总量。引言说"优化训练GPT-3尺寸模型需要不少于3500B token"(引自Hoffmann et al. 2022)——5000GT恰好覆盖这一需求还有余,这就是"规模优先"原则的具体含义

2.2 MDR流水线上半场:从原始HTML到RW-Filtered(对应论文§3.1–3.2)

来源标注:本小节对应论文§3.1–3.2(第2–3页)。

失效模式先行:为什么不能像C4那样直接用Common Crawl的WET文件?因为WET预处理过的纯文本里混着导航菜单、广告等无关文字——这是The Pile和Gopher团队都踩过的坑(§3.1原文引用)。为什么不能用ML质量分类器大规模打分?因为训练它的"金标准"来自人工精选源,会把精选源的口味偏置烙进数据(§3设计原则,援引Dodge et al. 2021关于过滤伤害少数群体的发现)。

学习目标:学完本节能按序复述六个处理步骤及其关键参数;能解释"为什么URL过滤要屏蔽Wikipedia和arXiv"这个看似荒谬的设计。

步骤做法关键参数/数字
① 读数据从原始WARC文件出发(warcio读取),不用WET
② URL过滤460万域名聚合黑名单 + 基于词表的URL评分(按严重度加权)常见黑名单误伤博客平台等假阳性,故自建规则;主动屏蔽Wikipedia/arXiv等高质量源(因RefinedWeb定位为聚合数据集中的网页成分,这些源由其他组件提供)(§G.1.3)
③ 正文抽取trafilatura(非商业库中文本抽取最佳,据Lopukhin 2019评测);正则清理:连续换行限两个、删除所有URL
④ 语言识别CCNet的fastText字符n-gram分类器(176语言),文档级top语言分数<0.65即删(多为无自然语言页面)
⑤ 文档级过滤Gopher(MassiveWeb)启发式:行/段落/n-gram重复过多即删;长度离群、符号-词比异常等启发式须按语言调参,英语规则直接套用他语言会过滤过度
⑥ 行级修正删除"3 likes"、导航按钮、社媒计数器等坏行;若修正删掉超文档5%则整篇丢弃论文自创步骤(区别于既有流水线之处)

数字对账(漏斗账):论文Figure 2给出:文档准备后剩48%(约一半被语言检测砍掉);过滤后再剩23%(RW-Raw中约一半被质量过滤移除,正文表述为"24% of remaining discarded for insufficient quality"口径略有出入,见下);最终成品约100亿文档/5万亿token。此处有一处需指出的小瑕疵:Figure 2图注说过滤移除的是"24% of the remaining",而正文§3.2说"around 50% of the documents of RW-Raw removed by the filtering"且"only 23% of the documents of CommonCrawl are left"。验算:若RW-Raw占48%,再砍一半得24%而非23%——23%与24%之间的1个百分点差可能来自四舍五入或统计口径(文档vs token)差异,论文未解释。【解读者核对发现,供批判性阅读参考】

类比:这条流水线像食品加工:"先扔掉烂原料(URL黑名单)、削皮去核(正文抽取)、只留本国食材(语言识别)、剔除变质部位(文档级启发式)、最后摘掉每块肉上的筋膜(行级修正)"。类比在哪里失效:食品检验有客观标准,而这台机器的"变质判定"全是经验阈值——比如行级修正的5%上限,改一个数整个数据集面貌就变,论文没有对这些阈值的敏感性做消融。

一句话蒸馏:一句话记住本节:不用WET不用ML打分,靠"WARC+规则+行级手术"把Common Crawl砍到只剩23%,换来的是可控的中立性。

闭卷自检:(1) 为什么弃用WET文件?(2) fastText的置信度阈值是多少?(3) 行级修正的整篇丢弃门槛是多少?(4) 为什么屏蔽Wikipedia?

2.3 MDR下半场:三层去重手术(对应论文§3.3)

来源标注:本小节对应论文§3.3(第3–4页)。

学习目标:学完本节能说出MinHash配置的具体数字并解释为何远比The Pile激进;能区分模糊去重与精确子串去重的打击对象。

层次方法配置打击对象
模糊(文档级)MinHash近似匹配每文档9000个哈希,基于5-gram,分成20桶×450哈希模板化文档:只有实体不同的许可证、跨站复制的SEO占位文(对照:The Pile仅10个哈希)
精确(序列级)后缀数组找完全相同子串删除>50个连续token的重复串(Lee et al. 2022实现)免责声明、通知等跨文档复用的片段
跨dump(URL级)记录每个已处理分片中保留样本的URL,后续分片遇同URL即删Common Crawl切成100份并行处理(算力所限)不同月度dump间反复爬到的同一页面

公式手术(MinHash直觉版):MinHash用哈希函数族估计两文档的Jaccard相似度。

P[minhashA = minhashB] = J(A,B)(最小哈希相等的概率=Jaccard相似度)
符号它是什么直觉
J(A,B)|A∩B| / |A∪B|,两文档5-gram集合的Jaccard相似度1=完全相同,0=毫无重叠
9000哈希/20桶×450b-banding技巧:450行×20带任一带内全部450个哈希相等才判为候选重复对;带越多漏检越少、桶内碰撞越准
5-gram以连续5词为单位建shingle集合粒度太细则标点差异就破坏匹配,太粗则短模板漏网

工程账单:激进去重缓解了"模型背题"压力(援引Hernandez et al. 2022:1B模型上百次重复才有害,175B模型几次重复就有害),代价是砍掉约一半数据——按Chinchilla口径这相当于烧掉近一半算力预算换质量,这笔账是否划算取决于下游实验,而论文用Table 4/Table 5回答了它。另外注意:精确子串去重会改变文档结构(切走片段),作者试过整篇丢弃和loss-masking两种替代方案,零样本性能无显著差异(§G.3.2)——这个稳健性检查常被忽视,值得记住。

常见误读:(1) "MinHash能找出语义相似的文档"——错,它是纯词汇层面的近似匹配,换个说法的抄袭抓不到(语义去重要靠SemDeDup类嵌入方法,论文相关工作提过但没用);(2) "去重总是有益的"——错,Pythia团队同期发现去重The Pile对零样本影响有限(§2末尾原文承认),本文结论应限定在"网页型数据集+激进设置"场景;(3) "50个token阈值很宽松"——错,50 token已是相当长的片段,且实测该设置下总移除率约50%,远高于任何前人数据集。

一句话蒸馏:一句话记住本节:9000哈希、20桶×450、50-token阈值——三个数字定义了当时最激进的大规模去重,砍掉一半数据换来了全文最重要的性能增益。

闭卷自检:(1) MinHash三个配置数字?(2) The Pile用了几个哈希?(3) 三层去重分别对付什么?(4) 参数量越大重复数据的危害如何变化?

2.4 实验证据链:从小规模消融到对标GPT-3(对应论文§4)

来源标注:本小节对应论文§4.1–4.3(第4–6页)。

学习目标:学完本节能复述Table 4的关键数值并解释三级证据分层(内部对比/基准级对比†/外部对比*)的设计意图;能用Table 5判断"过滤"和"去重"哪个更可靠。

评测设计(§4.1)值得先看:18个任务组成四个聚合——small(6任务,内部消融用)、core、main(GPT-3/PaLM报告的任务)、ext(BigScience任务)。全部零样本、统一用EleutherAI评测框架。作者明确拒绝用验证损失当指标,理由是perplexity与端到端表现可能背离(引Tay et al. 2021)。对比对象分三级标注:内部(自己训自己评)、基准级*(他人模型用同一Harness重测)、外部†(直接抄原论文数字,评测设置不同)——这个标注纪律本身就是批判性阅读的好范本。

小规模研究(Table 4,small-agg零样本平均准确率):

数据集OSCAR-21.09OSCAR-22.01C4The PileRW-RawRW-FilteredRefinedWeb
1B@27GT55.0%52.7%55.7%53.4%52.7%54.3%56.2%
3B@60GT59.1%55.9%59.6%57.9%57.4%58.2%59.8%

数字对账:(1) RW-Raw(几乎不过滤)与OSCAR-22.01并列垫底52.7%——说明过滤确实必要,"原始网页也挺好"是错的;(2) RW-Raw→Filtered +1.6pp,Filtered→Final +1.9pp——去重贡献略大于过滤;(3) 同为网页数据,C4(55.7%)明显强于OSCAR-22.01(52.7%),作者归因于后者主版本未去重——这与Table 5中OSCAR-22.01去重后大涨+2.9pp互相印证 ✓;(4) 训练token数符合Chinchilla最优配比吗?1B@27GT:20 token/参数 ✓;3B@60GT:20 token/参数 ✓——严格按Hoffmann et al. 2022执行,消融可比性有保障。

全规模实验(§4.2):1B和7B模型各训350GT(刻意超出Chinchilla最优点,对齐GPT-3/GPT-J等公开模型的实际训练量以便比较),另训一个1B@350GT on The Pile作内部控制。核心Finding(原文):经过充分过滤与去重的纯网页数据训练的模型,在main-agg上能追平GPT-3系列的表现——尽管Wikipedia、arXiv等"The Pile引以为傲的高质量源"已被从RefinedWeb中屏蔽。同时,开源模型(GPT-NeoX、OPT、BLOOM、Pythia、Cerebras-GPT等)普遍追不上GPT-3,而RefinedWeb模型做到了——作者由此推断:开源阵营与闭源的性能差距,主要不在架构而在数据。

MDR可迁移性实验(Table 5,§4.3):把MDR的过滤和去重分别施加于四个现有数据集(small-agg,1B@27GT):

主张 vs 事实:【实验支持】"去重在所有测试数据集上稳定有益";【实验支持】"过滤启发式需要按源调参";【论文声称】"web data alone可以挑战数据质量的传统观念"——注意这个claim的外部有效性边界:仅在zero-shot评测、≤7B模型、350GT训练量的范围内被验证,7B以上的外推是作者的信心而非证据。

一句话蒸馏:一句话记住本节:56.2% vs 53.4%(1B小规模)、7B追平GPT-3(全规模)——两组数字合起来宣判了"没有精选语料不行"的死刑,但判决书上盖着一个"仅限zero-shot、≤7B"的骑缝章。

闭卷自检:(1) Table 4中RW三级版本的分数梯度?(2) 哪个数据集去重收益最大、为什么?(3) 作者为什么不和LLaMA比?(4) 三级对比标记*和†各代表什么?

2.5 分级自测题

三、批判性阅读:如何不被这篇论文带节奏

3.1 benchmark到底测什么

四个聚合(small/core/main/ext)共18个任务,覆盖句子补全(HellaSwag/LAMBADA)、指代(Winogrande)、常识问答(PIQA/OpenBookQA/ARC/BoolQ/COPA)、NLI(CB/RTE/ANLI)等。它们共同测量的是零样本平均准确率——一个对提示格式敏感、对任务构成敏感的复合指标。"追平GPT-3"特指main-agg上这些任务的zero-shot均值,不代表few-shot能力、上下文学习、推理能力或安全性上的对等。论文自己在§4.2承认:与GPT-3的比较属于†级(评测设置不同的外部对比),可信度低于内部对比。

3.2 比较的前提条件审计

3.3 成本第二坐标轴

论文没有报告MDR流水线的计算成本(CPU核时、存储、耗时)——对一个以"可扩展性"为核心卖点的数据集来说,这是个显眼的缺席。去重的算力昂贵程度只在§3.3侧面流露("由于计算约束,无法直接对RW-Filtered整体去重,必须切成100份")。此外,激进去重砍掉的~50%数据意味着:达到同样token量需要爬取和处理两倍规模的原始数据——质量的钱是用采集算力付的

3.4 论文没有告诉你什么

四、综合考核

任务一 · 重建因果链

只给三个数字:"3500B token(GPT-3尺寸的最优训练需求)"、"~340GT(最大公开数据集Pile)"、"175B模型几次重复即有害(Hernandez)"。推演:这三个数字如何逼出了MDR的三条设计原则?

参考答案3500÷340≈10倍的缺口逼出"规模优先"——只有Common Crawl能供给万亿token,故放弃人工策展;"重复有害且随参数量加剧"逼出"严格去重"——万亿token若含高重复率等于慢性中毒;而要在万 亿尺度上避免人工策展的主观性、又不能让ML过滤器的偏见污染数据,只剩规则化手段可选,逼出"中立过滤"(仅语言识别用ML,成人内容只做URL过滤)。三组对应关系各2分;能指出三条原则其实是同一个约束(万亿尺度)的三个投影再加1分。

任务二 · 数字总对账

检查:(1) Chinchilla配比:1B@27GT、3B@60GT是否符合20 token/param?(2) OSCAR-21.09去重移除率10.8%与其Table 1标注"exact per-line (~55% removed)"是否矛盾?(3) 公开600GT占5000GT的比例,与datasheet"a tenth"的说法是否一致?(4) Figure 2的"23%剩余"与"过滤移除RW-Raw的50%"是否自洽?

参考答案(1) 27/1=27、60/3=20——1B那组其实是27 token/param,略高于20;论文原文写"on 27B and 60B tokens respectively",严格说是接近而非恰好等于Chinchilla比例,出题陷阱在此。(2) 不矛盾:Table 1说的是OSCAR官方构建时的逐行去重(已做过一轮),Table 5的10.8%是MDR在此基础上再做模糊+精确去重的额外移除率——两次去重叠加并不冲突,但10.8%之小说明其确实已较干净。(3) 600/5000=12%≈"约十分之一" ✓。(4) 48%×(1−50%)≈24%,与"23%"相差1个百分点,属四舍五入或口径差(文档vs token),正文未解释——应在精读笔记中标为存疑。每组判定+理由各1分,第(1)(4)组须指出瑕疵才得满分。

任务三 · 设计决策答辩

对以下决策各答三连:① 从WARC而非WET出发;② 屏蔽Wikipedia/arXiv等高质量源;③ 用9000哈希而非The Pile式的10哈希做MinHash。

参考答案要点① WET含菜单广告等噪声且前人(Pile/Gopher)已踩坑;不用WARC则正文抽取质量失控,后续一切过滤都在脏数据上进行——论据充分(引前人教训+自身消融RW-Raw表现差佐证)。② 因为RefinedWeb定位是聚合数据集中的"网页成分",混入维基会导致下游使用者重复计入这些源;不屏蔽则数据集角色混乱——但这也造成"单独使用RefinedWeb的模型缺百科知识"的隐忧,论文未讨论此点,论据半充分。③ 论文实证:弱设置(如10哈希)导致更低去重率和更差模型性能(§3.3原文);9000哈希的代价是计算开销,但换来约50%移除率——论据充分且有对照实验支撑。每项3分。

任务四 · 证据审计(回看1.4预评)

参考答案① "5000GT数据集构建"维持强支撑(漏斗数字完整)。② "纯网页匹敌精选语料"读后微降半档:内部对比和小规模证据扎实(强),但"追平GPT-3"依赖†级外部对比且无7B数值明细表,外部效度打折——综合仍可算强支撑但需附条件。③ "MDR可迁移"确认降级:Table 5自证过滤不系统,只有去重普适——预评为"部分支撑"正确,读后应进一步收窄为"去重可迁移、过滤不可"。④ "中立过滤防偏见"维持弱主张:全文无偏见度量实验,只有文献论证。变化最大的是②,理由:发现其核心卖点建立在评测设置不对齐的证据层上。

任务五 · 开放研究问题(可选)

论文留下的方向:① 去重能否支撑数据受限下的多epoch训练(§E.3);② 精选语料的去重价值重估(Pythia结论与本文的调和);③ 中立规则过滤与ML过滤在下游偏见上的系统性对比(本文只有立场没有数据)。任选其一写出实验设计草稿。