fineweb
收藏资源简介:
FineWeb 是一个大规模、高质量、开放许可的英文网络文本数据集,用于训练大型语言模型(LLM)。
FineWeb is a large-scale, high-quality, open-licensed English web text dataset for training large language models (LLMs).
🍷 FineWeb 数据集详情
数据集概述
FineWeb 是一个大规模英文网页文本数据集,包含 超过 18.5T tokens(最初为 15T tokens)经过清洗和去重处理的 CommonCrawl 网络数据。该数据集由 Hugging Face 发布,旨在为大型语言模型(LLM)训练提供高质量的网络文本数据。
基本信息
| 属性 | 说明 |
|---|---|
| 许可证 | ODC-By 1.0(开放数据共享署名许可) |
| 任务类型 | 文本生成(text-generation) |
| 语言 | 英语(en) |
| 数据规模 | 超过 1T tokens |
| 数据来源 | CommonCrawl(2013 年至今的所有爬取快照) |
数据集配置
FineWeb 提供了多种配置,以满足不同需求:
完整数据集
- default:全部数据,位于
data/*/*路径
样本版本
- sample-10BT:约 10B GPT-2 tokens(27.6GB)
- sample-100BT:约 100B GPT-2 tokens(277.4GB)
- sample-350BT:约 350B GPT-2 tokens(388GB)
样本按层级抽样生成:
sample-10BT从sample-100BT中采样,sample-100BT从sample-350BT中采样。
按爬取快照划分
包含自 2013 年至 2025 年 6 月的 100+ 个独立 CommonCrawl 快照配置,格式为 CC-MAIN-(年份)-(周数),例如:
CC-MAIN-2025-26(2025年最新快照)CC-MAIN-2024-51CC-MAIN-2023-50CC-MAIN-2022-49CC-MAIN-2021-49CC-MAIN-2020-50CC-MAIN-2019-51CC-MAIN-2018-51CC-MAIN-2017-51CC-MAIN-2016-50CC-MAIN-2015-48CC-MAIN-2014-52CC-MAIN-2013-48(最早快照)
所有配置均仅包含 train 分割。
数据集特点
处理流程
数据处理流程针对 LLM 性能进行了优化,基于 Hugging Face 的 datatrove 大规模数据处理库实现。处理步骤包括:
- 清洗
- 去重
- 额外的过滤步骤
性能表现
在多个基准测试中表现优异,优于以下常用高质量网络数据集:
- C4
- Dolma-v1.6
- The Pile
- SlimPajama
- RedPajama v2
与 RefinedWeb 的关系
FineWeb 最初旨在完整复现 RefinedWeb,但通过额外的过滤步骤,其性能已显著超越 RefinedWeb。
版本更新记录
| 版本 | 日期 | 更新内容 |
|---|---|---|
| v1.4.0 | 2025-07-11 | 新增 2025 年 1-6 月的 6 个新快照(CC-MAIN-2025-05 至 CC-MAIN-2025-26) |
| v1.3.0 | 2025-01-31 | 修复部分快照未处理文档的问题,新增约 400B tokens 数据;根据删除通知移除了特定域名 |
| v1.2.0 | 2025-01-03 | 新增 2024 年 5-12 月的 8 个新快照 |
| v1.1.0 | 2024-05-31 | 修复去重 bug,重新处理并上传 11 个快照;新增 CC-MAIN-2024-18 |
| v1.0.0 | 2024-04-21 | 初始版本 |
旧版本数据保留在对应的
version name分支中。
使用方式
使用 datatrove
python from datatrove.pipeline.readers import ParquetReader
limit 决定流式读取的文档数量(移除则读取全部)
获取特定快照:hf://datasets/HuggingFaceFW/fineweb/data/CC-MAIN-2024-10
将 "data" 替换为 "sample/100BT" 可使用 100BT 样本
data_reader = ParquetReader("hf://datasets/HuggingFaceFW/fineweb/data", limit=1000) for document in data_reader(): print(document)
使用 huggingface_hub
可通过 Hugging Face Hub 直接下载数据集。
使用 datasets 库
可通过 Hugging Face datasets 库加载。
数据字段
数据集为 Parquet 格式,包含文本数据,具体字段结构可参照数据集页面结构说明。
补充资源
- 完整复现代码:使用
datatrove库的完整处理流程代码已公开 - 消融模型:使用
nanotron训练的验证数据集性能的小规模模型已发布,每 1000 步有检查点 - 评估结果:评估结果 CSV 文件已公开
- 评估设置:基于 lighteval 的评估任务代码已公开
许可与引用
- 许可协议:ODC-By 1.0 许可证,允许开放共享使用
- 详细的引用信息可在数据集的 Additional Information 部分查阅




