遇见数据集

Ultra-FineWeb-L1

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

Ultra-FineWeb-L1是一个大规模英文网页语料库,基于Common Crawl快照构建,属于UltraData数据管理框架中的L1过滤层,为后续的L2选择和L3精炼提供基础。该数据集在FineWeb处理流程的基础上,升级了主文本提取工具(trafilatura 2.0),并采用UltraData的数据质量检测工具和清洗代理优化规则,对残存HTML、编码损坏、乱码、不可见字符、异常文档长度等问题进行了针对性处理。首个版本包含来自2025年六个Common Crawl快照的超过1万亿token(约11.4亿文档)。数据按Common Crawl快照组织,每个快照作为一个配置,包含训练集。每个样本包含四个字段:uid(字符串类型,UUID4文档标识符)、content(字符串类型,清洗后的纯文本)、meta(字符串类型,JSON编码的源数据和处理元数据,包括url、language、language_score、warc_record_id、warc_date、source_file)、dataset_index(int64类型,数据集源标识符)。该数据集适用于大型语言模型的预训练(文本生成任务)。实验表明,在MiniCPM5-1B模型上训练20B token后,Ultra-FineWeb-L1在12个基准测试上的六类别宏观平均得分和12任务微观平均得分分别达到9.668%和9.180%,优于FineWeb的9.033%和8.484%。许可证为Apache 2.0,用户需遵守原始网页内容的权利和许可。

Ultra-FineWeb-L1 is a large-scale English web corpus built from Common Crawl snapshots, serving as the L1 filtering layer within the UltraData data management framework, providing a foundation for subsequent L2 selection and L3 refinement. Building upon the FineWeb pipeline, it upgrades the main text extraction tool (trafilatura 2.0) and leverages UltraDatas data quality detection tools and cleaning agent optimization rules to address issues such as residual HTML, encoding corruption, garbled text, invisible characters, and abnormal document lengths. The first release contains over 1 trillion tokens (approximately 1.14 billion documents) from six Common Crawl snapshots in 2025. Data is organized by Common Crawl snapshots, each snapshot as a configuration containing a training set. Each sample includes four fields: uid (string type, UUID4 document identifier), content (string type, cleaned plain text), meta (string type, JSON-encoded source data and processing metadata including url, language, language_score, warc_record_id, warc_date, source_file), and dataset_index (int64 type, dataset source identifier). The dataset is suitable for pre-training large language models (text generation tasks). Experiments show that after training 20B tokens on the MiniCPM5-1B model, Ultra-FineWeb-L1 achieves 9.668% six-category macro average score and 9.180% 12-task micro average score on 12 benchmarks, outperforming FineWebs 9.033% and 8.484%. License is Apache 2.0, and users must comply with the rights and licenses of the original web content.

提供机构:
OpenBMB
创建时间:
2026-08-14
原始信息汇总

Ultra-FineWeb-L1 数据集概述

基本信息

  • 数据集名称:Ultra-FineWeb-L1
  • 语言:英语
  • 许可证:Apache 2.0
  • 规模:包含超过1万亿个token,约11.4亿个文档
  • 任务类别:文本生成
  • 发布时间:2026年8月20日
  • 发布机构:OpenBMB

数据集简介

Ultra-FineWeb-L1 是一个大规模英语网络语料库,基于 Common Crawl 快照构建。在 UltraData 的 L0-L4 分级数据管理框架中,它作为 L1 过滤层,为后续的 L2 精选和 L3 精炼提供基础。该数据集在 FineWeb 处理流水线的基础上进行了升级,包含六个 2025 年的 Common Crawl 快照,是目前覆盖最新 Common Crawl 快照(截至 CC-MAIN-2025-51)的开源网络预训练数据集。

数据处理流水线

每个 Common Crawl 转储独立处理,包含以下六个步骤:

  1. 页面和正文提取:使用 trafilatura 2.0 提取纯文本,排除评论、导航栏等非主要内容
  2. 语言过滤:使用 fastText 语言识别,保留高置信度的英文文档
  3. 启发式过滤:基于 FineWeb 的启发式过滤方法,处理重复、低质量文档、样板文本和异常行结构
  4. 敏感字段替换:将检测到的邮箱、IP 地址、电话号码、身份证号和信用卡号替换为有效占位符
  5. MinHash 去重:在每个 Common Crawl 转储内进行近似重复文档识别(与 FineWeb 一致,独立于各转储内进行)
  6. 定制化清洗:使用 UltraData 的数据质量检查工具和清洗智能体,处理残留 HTML、编码损坏和乱码、不可见字符、损坏内容及异常文档长度

数据集结构

数据集按 Common Crawl 转储组织,包含以下配置:

  • CC-MAIN-2025-30
  • CC-MAIN-2025-33
  • CC-MAIN-2025-38
  • CC-MAIN-2025-43
  • CC-MAIN-2025-47
  • CC-MAIN-2025-51

每个配置均包含训练分割,文件格式为 Parquet。

数据字段

字段 类型 描述
uid string UUID4 文档标识符
content string 清洗后的纯文本文档
meta string JSON 编码的源和处理元数据,包括 urllanguagelanguage_scorewarc_record_idwarc_datesource_file
dataset_index int64 数据集源标识符

实验结果

在 MiniCPM5-1B 模型上训练 200 亿 token 进行评测:

  • Ultra-FineWeb-L1 六类宏平均得分为 9.668%,12 任务微平均得分为 9.180%
  • 相比 FineWeb(9.033% / 8.484%),宏平均提升 0.635 个百分点,微平均提升 0.696 个百分点
  • 经过 L2 质量筛选后(Ultra-FineWeb-from-L1),宏平均达 10.379%,微平均达 9.798%,表明 L1 清洗与后续质量筛选具有互补效益

关联数据集

  • Ultra-FineWeb:L2 精选数据,包含约 1 万亿英文 token 和 1200 亿中文 token
  • Ultra-FineWeb-L3:L3 精炼数据,包含 4000 亿+英文 token 和 2000 亿+中文 token

使用须知

  • 数据集源于网络内容,用户需遵守原始来源的权利、许可和相关条款
  • 未经原作者书面许可,禁止任何机构或第三方平台直接转发、镜像、重新托管或商业性重新打包发布该项目成果
搜集汇总
数据集介绍
Ultra-FineWeb-L1 数据集图片
构建方式
Ultra-FineWeb-L1是基于Common Crawl快照构建的大规模英文网络语料库,属于UltraData框架中的L1过滤层。其构建流程包括利用trafilatura 2.0进行主文本提取,剔除导航等非核心内容,随后通过fastText进行语言过滤以保留高置信度英文文档,并沿袭FineWeb的启发式过滤策略处理重复、低质及样板文本。此外,对识别出的邮箱、IP等敏感信息进行占位符替换,采用MinHash算法在单个快照内进行去重,最后借助UltraData的质量检测工具与清洗代理,针对残留HTML、编码错误、乱码、不可见字符及异常文档长度进行定制化清理。
特点
该数据集涵盖2025年六个Common Crawl快照,包含超过1万亿token及约11.4亿篇文档,规模宏大且时效性强。其特色在于精细的多阶段清洗流程,显著提升了文本质量,实验表明在同等训练条件下,其下游任务表现优于FineWeb基线,宏平均与微平均分数分别提升0.635和0.696个百分点。数据集按快照组织,提供统一的字段结构,包括文档唯一标识、清洗后文本、元数据及数据源索引,便于追踪与使用。
使用方法
Ultra-FineWeb-L1可直接用于语言模型的预训练,支持通过HuggingFace datasets库加载,每个Common Crawl快照对应一个配置,如CC-MAIN-2025-30至CC-MAIN-2025-51。数据的content字段为清洗后的纯文本,适合作为自监督学习目标;meta字段提供来源URL、语言得分等元信息,可用于进一步过滤或分析。研究者可依据需求选择特定快照部分,或将其作为L2精选层Ultra-FineWeb的前置数据,构建更高质量的预训练语料。
背景与挑战
背景概述
Ultra-FineWeb-L1 是由 OpenBMB 团队于 2026 年 8 月发布的大规模英文网络语料库,其构建依托于 Common Crawl 快照,并基于 FineWeb 处理管线进行系统性优化。该数据集在 UltraData 平台的 L0-L4 分层数据管理框架中定位为 L1 过滤层,旨在为后续的 L2 精选与 L3 精炼提供高质量基础。其核心研究问题在于应对大规模网络文本中的噪声与冗余,提升预训练语料的纯净度与信息密度。通过升级主文本提取工具、引入数据质量检测与智能清洗规则,Ultra-FineWeb-L1 在 1T+ token 规模上实现了对 FineWeb 的显著性能超越,验证了精细化清洗流程的有效性,对大规模语言模型预训练的数据工程实践具有重要参考价值。
当前挑战
该数据集面临的挑战涵盖领域与构建两个层面。领域层面,通用网络语料存在大量重复、低质、模板化及噪声内容,如何在海量数据中高效识别并过滤这些信息,同时保留语义完整性,是提升预训练效果的关键难题。构建层面,需应对多源快照中的编码损坏、乱码、HTML 残留及异常文档长度等问题,并保持去重与清洗的可扩展性。此外,敏感信息替换需兼顾隐私保护与文本自然度,而跨快照的一致性处理与计算资源效率亦构成重要挑战。Ultra-FineWeb-L1 通过结合启发式规则、MinHash 去重及智能代理优化,部分缓解了上述问题,但如何在保证吞吐量的同时实现更精细的数据筛选,仍是后续研究的重要方向。
常用场景
经典使用场景
Ultra-FineWeb-L1作为大规模英文网络语料库,其核心应用场景在于大语言模型的预训练。在自然语言处理领域,高质量预训练数据的获取与处理是模型性能的基础保障。该数据集基于Common Crawl快照,经过精细化的文本抽取、语言过滤、启发式清洗、敏感信息替换及MinHash去重等系列流程,构建了超过1万亿token的庞大数据集,为语言模型的预训练提供了丰富且高质量的文本来源。研究者可依托此语料进行模型的基础训练,亦可用于领域自适应预训练或持续预训练,以增强模型对通识知识与语言规律的理解。其结构化的存储方式与详尽的数据元信息,亦便于研究者进行数据子集采样与实验配置,从而在标准化的条件下评估模型性能与数据质量之间的关联。
解决学术问题
该数据集的发布解决了大语言模型研究中长期存在的预训练数据质量参差不齐与处理流程不透明的问题。通过公开详尽的清洗pipeline与实验对比,Ultra-FineWeb-L1验证了系统性数据过滤与清洗能够显著提升模型在下游任务上的表现,其评测结果显示相比FineWeb在同一模型与训练配置下获得了0.6个百分点以上的提升,为数据驱动的人工智能研究提供了可复现的实证依据。此外,该数据集填补了最新Common Crawl快照(至2025年51周)在开源预训练语料中的空白,提供了覆盖最新网络内容的训练资源,有助于模型时效性与知识更新问题的研究。其在L0-L4层级数据管理框架中的定位,为数据生命周期管理与多粒度语料构建提供了学术参考,推动了数据质量评估与优化方法论的发展。
衍生相关工作
围绕Ultra-FineWeb-L1,相关研究工作已形成一系列衍生成果。其清洗流程的改进催生了基于分类器的数据精选方法,如Ultra-FineWeb-Classsifier,该分类器可从L1数据中筛选出更高品质的子集,形成L2层级的Ultra-FineWeb数据集,其包含约1T英文与120B中文token,进一步提升了预训练数据的质量密度。在此之上,衍生出了L3精炼数据集Ultra-FineWeb-L3,通过问答对生成与多风格改写技术,构建了超过400B英文与200B中文token的合成语料,为模型指令遵循与生成多样性提供了补充。这些工作共同构成了UltraData的L0-L4层级管理体系,推动了数据管理从单一清洗向分级筛选与精炼的范式转变。此外,Ultra-FineWeb-L1的技术报告(arXiv:2505.05427)与实验设计(如FinePhrase评估设置)为后续数据质量研究提供了标准的评测基准与可比较的参照体系,在开源社区与学术界引起了广泛关注与引用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务