遇见数据集

CC-FilteredCorpus

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集是一个以英语为主的网络文本数据集,来源于Common Crawl(CC-MAIN-2026-25)的爬取数据,经过清洗并转换为Markdown格式。其目标是保留网页文档的结构,使AI模型能够同时学习自然语言和Markdown格式。处理流程包括:HTML转Markdown、文本清洗、英语过滤、精确与近似去重、以及基于GPT-2困惑度的质量过滤。数据集包含7个字段:text(清洗后的Markdown文本)、url(原始URL)、warc_date(Common Crawl日期)、record_id(WARC记录ID)、payload_digest(Common Crawl摘要)、edu_score(FineWeb-Edu评分)、perplexity(GPT-2困惑度)。数据以压缩的Parquet分片形式存储,每个Common Crawl时间线(如CC-MAIN-2025-26)对应一个独立文件夹。当前处理仍在进行中,数据集逐步上传,Hugging Face数据查看器可能尚未可用,但Parquet分片可直接下载。该数据集规模约为10,000至100,000个样本,许可证为CC0-1.0。主要用途包括:Markdown感知语言模型的研究与实验、LLM预训练、Markdown生成、结构化文档生成以及网络文本研究。注意:数据集源自公开爬取的网页内容,各文档可能具有不同的版权或许可条件,使用者需自行核查;清洗流程为自动化,可能残留少量不期望或低质量内容。

This dataset is an English-focused web text dataset sourced from Common Crawl (CC-MAIN-2026-25) crawl data, cleaned and converted to Markdown format. Its goal is to preserve the structure of web documents, enabling AI models to learn both natural language and Markdown formatting simultaneously. The processing pipeline includes: HTML-to-Markdown conversion, text cleaning, English filtering, exact and near-deduplication, and quality filtering based on GPT-2 perplexity. The dataset contains 7 fields: text (cleaned Markdown text), url (original URL), warc_date (Common Crawl date), record_id (WARC record ID), payload_digest (Common Crawl digest), edu_score (FineWeb-Edu score), and perplexity (GPT-2 perplexity). Data is stored as compressed Parquet shards, with each Common Crawl timeline (e.g., CC-MAIN-2025-26) corresponding to a separate folder. Processing is ongoing, with the dataset being uploaded incrementally; the Hugging Face dataset viewer may not yet be available, but Parquet shards can be downloaded directly. The dataset size is approximately 10,000 to 100,000 samples, licensed under CC0-1.0. Primary use cases include: research and experimentation on Markdown-aware language models, LLM pre-training, Markdown generation, structured document generation, and web text studies. Note: The dataset originates from publicly crawled web content, and individual documents may have different copyrights or licenses; users must verify compliance. The cleaning pipeline is automated and may retain a small amount of unwanted or low-quality content.

创建时间:
2026-08-12
原始信息汇总

CC-FilteredCorpus 数据集概述

基本信息

  • 数据集名称:English Cleaned Common Crawl Markdown Dataset
  • 许可证:CC0-1.0
  • 语言:英语
  • 任务类别:文本生成、文本分类
  • 数据集规模:10K < n < 100K
  • 标签:webtext、markdown、Commoncrawl

数据集简介

该数据集基于 Common Crawl 构建,专注于英语内容,经过清洗并转换为 Markdown 格式。其核心目标是保留网页文档结构,使AI模型能够同时学习自然语言和 Markdown 格式。

来源

数据集来源于 Common CrawlCC-MAIN-2026-25 时间戳。

处理流程

数据集经过以下流水线处理:

  1. Common Crawl 原始数据
  2. HTML → Markdown 转换
  3. 文本清洗
  4. 英语内容过滤
  5. 精确与近似重复过滤
  6. 质量过滤(含 GPT-2 perplexity 过滤)
  7. 存储为压缩的 Parquet 分片

数据格式

每个文档包含以下字段:

  • text:清洗后的 Markdown 文本
  • url:原始网页 URL
  • warc_date:Common Crawl 抓取日期
  • record_id:WARC 记录 ID
  • payload_digest:Common Crawl 摘要
  • edu_score:FineWeb-Edu 得分
  • perplexity:GPT-2 困惑度

文件组织

每个 Common Crawl 时间区间(如 2025-26)存储为独立文件夹,命名格式如 CC-MAIN-2025-26

当前状态

  • 处理仍在进行中,数据集按分片逐步上传
  • 由于处理尚未完成,Hugging Face Data Viewer 可能不可用
  • 单个 Parquet 分片可随时从仓库下载

预期用途

该数据集主要用于以下研究和实验方向:

  • 支持 Markdown 感知的语言模型
  • LLM 预训练
  • Markdown 生成
  • 结构化文档生成
  • 网络文本研究

注意事项

  • 数据集来源于公开爬取的网络内容,单个文档可能具有不同的版权或许可条件,使用前需检查相关权利
  • 过滤流程为自动化操作,可能残留少量不需要或低质量的内容
搜集汇总
数据集介绍
CC-FilteredCorpus 数据集图片
构建方式
该数据集源于Common Crawl的公开网络爬取内容,选取CC-MAIN-2026-25时间切片,历经从HTML到Markdown的格式转换、文本清洗、英语语种过滤、精确与近似去重以及基于GPT-2困惑度与FineWeb-Edu评分的质量筛选,最终以压缩Parquet分片形式存储。每条记录包含清洗后的Markdown文本、原始URL、爬取日期、WARC记录标识及质量指标,旨在保留网页文档的结构信息,使模型能够同时习得自然语言与Markdown格式化语法。
特点
数据集聚焦英语高质量网页文本,通过双重质量把关(困惑度过滤与教育评分)确保内容纯净度。其突出特点在于保留文档结构,将HTML转化为Markdown,适用于结构化文档生成任务。数据以分片方式存储,便于分布式处理与流式加载。此外,每条样本携带丰富的元数据(如URL、时间戳、摘要),支持可追溯性与细粒度筛选。
使用方法
该数据集主要面向Markdown感知语言模型的研究与实验,如预训练、文本生成及结构化文档生成任务。使用时可直接下载Parquet分片,通过HuggingFace datasets库加载,亦可作为微调数据或评估基准。鉴于其源自网络爬取,文档可能受版权保护,研究者在应用前应审查个别文档的合法性与适用条款,并注意自动化流水线可能残留的噪声或低质内容。
背景与挑战
背景概述
CC-FilteredCorpus数据集诞生于2026年,由致力于大规模网络文本挖掘的研究团队基于Common Crawl快照CC-MAIN-2026-25构建,旨在应对大语言模型预训练中对高质量、结构丰富文本的迫切需求。该数据集的核心创新在于将原始HTML网页转换为Markdown格式,以保留文档的层次结构和格式信息,从而增强模型对结构化内容的理解与生成能力。通过英语言过滤、精确与近似去重、GPT-2困惑度筛选等严密流程,数据集提供了包含文本、URL、时间戳及教育质量评分的丰富字段,为Markdown感知语言模型、LLM预训练及结构化文档生成等研究提供了宝贵资源,并对网络文本处理领域产生了显著影响。
当前挑战
该数据集面临的核心挑战在于多维度平衡。领域层面上,大语言模型预训练需处理海量网络文本,然而原始网页含噪声、重复及低质量内容,如何在保留文档结构的同时实现高效清洗与去重,是确保模型学习效果的关键。构建过程中,从Common Crawl的海量快照中提取并转换Markdown,需应对HTML标签的复杂性与不规则性;文本清洗需去除广告、导航等无关元素,同时兼顾语言识别的准确性。此外,去重操作需处理精确及近重复文档,质量过滤需权衡困惑度与教育分数,而分片上传与数据完整性维持亦构成工程挑战,加之自动化管线难以完全剔除不适宜内容,使得数据集在质量保证与规模扩展之间面临持续张力。
常用场景
经典使用场景
在自然语言处理与大规模语言模型研究领域,高质量预训练语料的稀缺性始终是制约模型性能提升的关键瓶颈。CC-FilteredCorpus数据集以其独特的网页文本清洗与Markdown结构化保留能力,为学界提供了一条从海量非结构化互联网数据中提炼宝贵训练资源的全新路径。该数据集最经典的使用场景聚焦于语言模型的预训练阶段,研究者可基于其保留的文档结构信息,训练模型同时习得自然语言语义与Markdown格式语法,从而显著增强模型对半结构化文本的生成与理解能力。此外,其精细的过滤流程(包括去重与困惑度筛选)使得该数据集成为验证数据质量对模型性能影响的理想实验平台。
衍生相关工作
围绕该数据集的特性与处理流程,一系列前瞻性的研究脉络得以衍生。其精细化的数据质量标注信息,催生了对数据选择策略的深入探索,激励了利用教育评分或困惑度等元特征进行高效子集筛选的相关工作。在模型架构方面,该数据集对Markdown结构的强调,启发了针对结构化提示与格式化输出进行专门优化的模型变体研究。此外,其清洗与去重管线的公开化描述,也为构建更通用、更强大的网络文本处理工具链提供了参照蓝本,推动了数据驱动型研究范式在自然语言处理领域的持续深化与拓展。
数据集最近研究
最新研究方向
当前,大规模语言模型预训练语料的构建正经历从纯文本向结构化文档的深刻变革,CC-FilteredCorpus数据集恰是这一前沿方向的典型代表。该数据集基于Common Crawl最新爬虫快照,通过精细的清洗流程将海量HTML网页转化为保留文档结构的Markdown格式,并集成GPT-2困惑度过滤与FineWeb-Edu教育质量评分等多维质量筛选机制,旨在提升模型对网页语义与格式标记的联合建模能力。其研究焦点已从单纯的语言流畅性转向对Web文档内在结构(如标题、列表、链接)的感知与生成,这直接关联到Markdown感知语言模型、结构化文档自动生成以及高效预训练数据筛选等热点课题。该数据集的发布不仅为LLM预训练提供了高质量的结构化语料支撑,更推动了以文档结构为监督信号的下一代文本生成范式研究,对提升AI在学术写作、代码注释生成及富文本内容创作等实际应用中的表现具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务