遇见数据集

fineweb

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

FineWeb 是一个大规模、高质量、开放许可的英文网络文本数据集,用于训练大型语言模型(LLM)。

FineWeb is a large-scale, high-quality, open-licensed English web text dataset for training large language models (LLMs).

创建时间:
2026-08-28
原始信息汇总

🍷 FineWeb 数据集详情

数据集概述

FineWeb 是一个大规模英文网页文本数据集,包含 超过 18.5T tokens(最初为 15T tokens)经过清洗和去重处理的 CommonCrawl 网络数据。该数据集由 Hugging Face 发布,旨在为大型语言模型(LLM)训练提供高质量的网络文本数据。

基本信息

属性 说明
许可证 ODC-By 1.0(开放数据共享署名许可)
任务类型 文本生成(text-generation)
语言 英语(en)
数据规模 超过 1T tokens
数据来源 CommonCrawl(2013 年至今的所有爬取快照)

数据集配置

FineWeb 提供了多种配置,以满足不同需求:

完整数据集

  • default:全部数据,位于 data/*/* 路径

样本版本

  • sample-10BT:约 10B GPT-2 tokens(27.6GB)
  • sample-100BT:约 100B GPT-2 tokens(277.4GB)
  • sample-350BT:约 350B GPT-2 tokens(388GB)

样本按层级抽样生成:sample-10BTsample-100BT 中采样,sample-100BTsample-350BT 中采样。

按爬取快照划分

包含自 2013 年至 2025 年 6 月的 100+ 个独立 CommonCrawl 快照配置,格式为 CC-MAIN-(年份)-(周数),例如:

  • CC-MAIN-2025-26(2025年最新快照)
  • CC-MAIN-2024-51
  • CC-MAIN-2023-50
  • CC-MAIN-2022-49
  • CC-MAIN-2021-49
  • CC-MAIN-2020-50
  • CC-MAIN-2019-51
  • CC-MAIN-2018-51
  • CC-MAIN-2017-51
  • CC-MAIN-2016-50
  • CC-MAIN-2015-48
  • CC-MAIN-2014-52
  • CC-MAIN-2013-48(最早快照)

所有配置均仅包含 train 分割。

数据集特点

处理流程

数据处理流程针对 LLM 性能进行了优化,基于 Hugging Face 的 datatrove 大规模数据处理库实现。处理步骤包括:

  • 清洗
  • 去重
  • 额外的过滤步骤

性能表现

在多个基准测试中表现优异,优于以下常用高质量网络数据集:

  • C4
  • Dolma-v1.6
  • The Pile
  • SlimPajama
  • RedPajama v2

与 RefinedWeb 的关系

FineWeb 最初旨在完整复现 RefinedWeb,但通过额外的过滤步骤,其性能已显著超越 RefinedWeb。

版本更新记录

版本 日期 更新内容
v1.4.0 2025-07-11 新增 2025 年 1-6 月的 6 个新快照(CC-MAIN-2025-05 至 CC-MAIN-2025-26)
v1.3.0 2025-01-31 修复部分快照未处理文档的问题,新增约 400B tokens 数据;根据删除通知移除了特定域名
v1.2.0 2025-01-03 新增 2024 年 5-12 月的 8 个新快照
v1.1.0 2024-05-31 修复去重 bug,重新处理并上传 11 个快照;新增 CC-MAIN-2024-18
v1.0.0 2024-04-21 初始版本

旧版本数据保留在对应的 version name 分支中。

使用方式

使用 datatrove

python from datatrove.pipeline.readers import ParquetReader

limit 决定流式读取的文档数量(移除则读取全部)

获取特定快照:hf://datasets/HuggingFaceFW/fineweb/data/CC-MAIN-2024-10

将 "data" 替换为 "sample/100BT" 可使用 100BT 样本

data_reader = ParquetReader("hf://datasets/HuggingFaceFW/fineweb/data", limit=1000) for document in data_reader(): print(document)

使用 huggingface_hub

可通过 Hugging Face Hub 直接下载数据集。

使用 datasets 库

可通过 Hugging Face datasets 库加载。

数据字段

数据集为 Parquet 格式,包含文本数据,具体字段结构可参照数据集页面结构说明。

补充资源

  • 完整复现代码:使用 datatrove 库的完整处理流程代码已公开
  • 消融模型:使用 nanotron 训练的验证数据集性能的小规模模型已发布,每 1000 步有检查点
  • 评估结果:评估结果 CSV 文件已公开
  • 评估设置:基于 lighteval 的评估任务代码已公开

许可与引用

  • 许可协议:ODC-By 1.0 许可证,允许开放共享使用
  • 详细的引用信息可在数据集的 Additional Information 部分查阅
搜集汇总
数据集介绍
fineweb 数据集图片
构建方式
FineWeb数据集源于CommonCrawl海量网络存档,通过HuggingFace团队开发的datatrove数据处理库,历经精细的清洗与去重流程构建而成。该流程涵盖了从2013年至2025年间的全部CommonCrawl快照,并针对大型语言模型(LLM)的训练效能进行了深度优化,最终产出超过18.5万亿tokens的高质量英文网络文本数据。数据集支持按不同时段(如特定年份或周次)的爬取快照进行切片访问,同时也提供了10BT、100BT及350BT的随机采样子集,以便于不同规模的计算资源进行适配。
特点
FineWeb的核心特质在于其卓越的数据质量与学术上的开放性。相较于RefinedWeb、C4、Dolma等主流数据集,基于FineWeb训练的模型在多个基准测试任务上展现出更优的性能,这得益于其精细的过滤策略与去重算法。此外,该数据集采用ODC-By 1.0许可,实现了完全开放,并公开了完整的处理代码、消融模型及评测结果,确保了高度的可复现性与透明度。其按照CommonCrawl快照进行组织的结构化设计,也为研究者提供了灵活的数据选择与时间维度上的分析能力。
使用方法
FineWeb提供了多样化的集成接口以适应不同工作流。用户可通过`datasets`库直接加载完整数据集或特定快照、采样子集。对于大规模分布式处理,可通过`datatrove`库中的ParquetReader进行流式读取,并灵活集成到自定义的处理管道中,实现数据过滤、转换等操作。同时,`huggingface_hub`也作为便捷的下载通道,支持获取完整数据或指定子集。这种多维度的访问方式,使得FineWeb既能满足快速原型验证的需求,也能支撑起超大规模模型的预训练任务。
背景与挑战
背景概述
FineWeb数据集由HuggingFace团队于2024年创建,旨在构建一个大规模、高质量的英文网络文本语料库,用于训练大型语言模型。该数据集基于CommonCrawl快照,经过精细的清洗与去重处理,最终包含超过18.5万亿个token(原始版本为15万亿),并遵循ODC-By 1.0许可证完全开放。其核心研究问题是探索如何通过系统化的数据过滤与处理流程,显著提升语言模型在下游任务中的性能。FineWeb的发布对自然语言处理领域产生了深远影响,其数据质量与处理透明度为后续研究提供了重要基准,推动了基于网络数据训练大模型的发展。
当前挑战
FineWeb所面临的挑战主要来自两方面:一是其解决的领域问题——网络文本数据虽丰富但噪声极大,涵盖低质量内容、重复信息、敏感数据等,需设计高效的去重与过滤算法以保留高质量子集,同时避免引入偏见或泄露隐私;二是在构建过程中,需处理海量数据(超过18.5T token)带来的计算与存储压力,并确保处理流程的可复现性。此外,不断更新的网络内容要求数据集的动态扩展,而版本迭代中曾发现去重缺陷,需重新处理部分快照,这些均反映了大规模数据构建的复杂性。
常用场景
经典使用场景
FineWeb数据集作为大规模英文网页文本语料库,在自然语言处理领域中被广泛用于预训练语言模型的基准数据。其涵盖了自2013年以来CommonCrawl的全面网络抓取内容,经过精细的去重与清洗流程,为文本生成任务提供了高质量的训练素材。研究人员常利用该数据集训练自回归语言模型,以提升模型在多种下游任务中的泛化能力。
解决学术问题
该数据集解决了以往网络文本语料库质量参差不齐、噪声过多的问题,通过系统的数据清洗与去重流程,显著提升了训练数据的纯净度与一致性。其公开的完整处理流水线使得研究能够精确复现数据构建过程,促进了可重复性研究的发展。在此数据基础上训练的模型在多项基准测试中表现优异,为语言模型性能的可靠评估与比较提供了坚实基础。
衍生相关工作
FineWeb数据集的发布催生了一系列衍生研究,包括数据筛选策略的优化、去重算法的改进,以及基于大规模语料预训练模型的性能分析。其开源的处理代码与评估框架成为后续数据集构建工作的重要参考,推动了如RefinedWeb等模型的发展,并促进了对数据质量与模型性能关系的深入理解,为自然语言处理领域的数据基础设施建设做出了关键贡献。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务