CC-FilteredCorpus
收藏资源简介:
该数据集是一个以英语为主的网络文本数据集,来源于Common Crawl(CC-MAIN-2026-25)的爬取数据,经过清洗并转换为Markdown格式。其目标是保留网页文档的结构,使AI模型能够同时学习自然语言和Markdown格式。处理流程包括:HTML转Markdown、文本清洗、英语过滤、精确与近似去重、以及基于GPT-2困惑度的质量过滤。数据集包含7个字段:text(清洗后的Markdown文本)、url(原始URL)、warc_date(Common Crawl日期)、record_id(WARC记录ID)、payload_digest(Common Crawl摘要)、edu_score(FineWeb-Edu评分)、perplexity(GPT-2困惑度)。数据以压缩的Parquet分片形式存储,每个Common Crawl时间线(如CC-MAIN-2025-26)对应一个独立文件夹。当前处理仍在进行中,数据集逐步上传,Hugging Face数据查看器可能尚未可用,但Parquet分片可直接下载。该数据集规模约为10,000至100,000个样本,许可证为CC0-1.0。主要用途包括:Markdown感知语言模型的研究与实验、LLM预训练、Markdown生成、结构化文档生成以及网络文本研究。注意:数据集源自公开爬取的网页内容,各文档可能具有不同的版权或许可条件,使用者需自行核查;清洗流程为自动化,可能残留少量不期望或低质量内容。
This dataset is an English-focused web text dataset sourced from Common Crawl (CC-MAIN-2026-25) crawl data, cleaned and converted to Markdown format. Its goal is to preserve the structure of web documents, enabling AI models to learn both natural language and Markdown formatting simultaneously. The processing pipeline includes: HTML-to-Markdown conversion, text cleaning, English filtering, exact and near-deduplication, and quality filtering based on GPT-2 perplexity. The dataset contains 7 fields: text (cleaned Markdown text), url (original URL), warc_date (Common Crawl date), record_id (WARC record ID), payload_digest (Common Crawl digest), edu_score (FineWeb-Edu score), and perplexity (GPT-2 perplexity). Data is stored as compressed Parquet shards, with each Common Crawl timeline (e.g., CC-MAIN-2025-26) corresponding to a separate folder. Processing is ongoing, with the dataset being uploaded incrementally; the Hugging Face dataset viewer may not yet be available, but Parquet shards can be downloaded directly. The dataset size is approximately 10,000 to 100,000 samples, licensed under CC0-1.0. Primary use cases include: research and experimentation on Markdown-aware language models, LLM pre-training, Markdown generation, structured document generation, and web text studies. Note: The dataset originates from publicly crawled web content, and individual documents may have different copyrights or licenses; users must verify compliance. The cleaning pipeline is automated and may retain a small amount of unwanted or low-quality content.
CC-FilteredCorpus 数据集概述
基本信息
- 数据集名称:English Cleaned Common Crawl Markdown Dataset
- 许可证:CC0-1.0
- 语言:英语
- 任务类别:文本生成、文本分类
- 数据集规模:10K < n < 100K
- 标签:webtext、markdown、Commoncrawl
数据集简介
该数据集基于 Common Crawl 构建,专注于英语内容,经过清洗并转换为 Markdown 格式。其核心目标是保留网页文档结构,使AI模型能够同时学习自然语言和 Markdown 格式。
来源
数据集来源于 Common Crawl 的 CC-MAIN-2026-25 时间戳。
处理流程
数据集经过以下流水线处理:
- Common Crawl 原始数据
- HTML → Markdown 转换
- 文本清洗
- 英语内容过滤
- 精确与近似重复过滤
- 质量过滤(含 GPT-2 perplexity 过滤)
- 存储为压缩的 Parquet 分片
数据格式
每个文档包含以下字段:
- text:清洗后的 Markdown 文本
- url:原始网页 URL
- warc_date:Common Crawl 抓取日期
- record_id:WARC 记录 ID
- payload_digest:Common Crawl 摘要
- edu_score:FineWeb-Edu 得分
- perplexity:GPT-2 困惑度
文件组织
每个 Common Crawl 时间区间(如 2025-26)存储为独立文件夹,命名格式如 CC-MAIN-2025-26。
当前状态
- 处理仍在进行中,数据集按分片逐步上传
- 由于处理尚未完成,Hugging Face Data Viewer 可能不可用
- 单个 Parquet 分片可随时从仓库下载
预期用途
该数据集主要用于以下研究和实验方向:
- 支持 Markdown 感知的语言模型
- LLM 预训练
- Markdown 生成
- 结构化文档生成
- 网络文本研究
注意事项
- 数据集来源于公开爬取的网络内容,单个文档可能具有不同的版权或许可条件,使用前需检查相关权利
- 过滤流程为自动化操作,可能残留少量不需要或低质量的内容





