open-markdown-v2
收藏资源简介:
Open Markdown是一个基于Common Crawl构建的大规模网络文本数据集,旨在为训练和检索提供高质量的即用型Markdown格式文本。它通过处理原始HTML内容,将其转换为干净的Markdown,并保留可追溯的WARC元数据。当前版本包含Common Crawl的CC-MAIN-2026-25爬取批次,约2,043,916,315个文档,分布在100,000个分片中。原始HTML约332.8 TB被处理为约8.9 TB的Markdown,压缩率达97.3%。数据以Parquet文件格式存储,每个文件行代表一个网页,包含doc_id(基于URL的确定性SHA-256哈希)、url(原始URL)、host(主机名)、crawl_date(爬取日期)、warc_record_id(原始WARC记录ID)、html_length(原始HTML字节长度)、markdown_length(转换后Markdown字节长度)和markdown(干净的Markdown内容)。数据集适用于文本生成、特征提取等自然语言处理任务,并支持通过Hugging Face datasets库、huggingface_hub或DuckDB进行下载和使用。数据集采用Open Data Commons Attribution License (ODC-By) v1.0许可,并遵循Common Crawl的使用条款。需要注意的是,数据集可能包含个人可识别信息,且继承了Common Crawl和公共网络的偏见,未应用基于机器学习的质量或毒性过滤。
Open Markdown is a large-scale web text dataset based on Common Crawl, designed to provide high-quality, ready-to-use Markdown-formatted text for training and retrieval. It processes raw HTML content, converting it into clean Markdown while preserving traceable WARC metadata. The current version includes the CC-MAIN-2026-25 crawl batch from Common Crawl, with approximately 2,043,916,315 documents distributed across 100,000 shards. Raw HTML of about 332.8 TB is processed into about 8.9 TB of Markdown, achieving a compression rate of 97.3%. The data is stored in Parquet file format, with each row representing a webpage and containing fields such as doc_id (deterministic SHA-256 hash based on URL), url (original URL), host (hostname), crawl_date (crawl date), warc_record_id (original WARC record ID), html_length (original HTML byte length), markdown_length (converted Markdown byte length), and markdown (clean Markdown content). The dataset is suitable for natural language processing tasks like text generation and feature extraction, and supports download and usage via the Hugging Face datasets library, huggingface_hub, or DuckDB. It is licensed under the Open Data Commons Attribution License (ODC-By) v1.0 and adheres to Common Crawls terms of use. Note that the dataset may contain personally identifiable information and inherits biases from Common Crawl and the public web, with no machine learning-based quality or toxicity filtering applied.
数据集概述:Open Markdown
Open Markdown 是一个大规模网络文本数据集,由 Common Crawl 的网页内容经处理生成。它将原始 HTML 转换为干净的 Markdown 格式,便于直接用于模型训练和信息检索。
核心信息
- 发布机构:open-index
- 数据集页面:https://huggingface.co/datasets/open-index/open-markdown-v2
- 许可证:Open Data Commons Attribution License (ODC-By) v1.0
- 任务类别:文本生成、特征提取
- 语言:多语言
- 大小规模:1B < n < 10B(文档数量)
- 数据集标签:common-crawl, web, markdown, html-to-markdown, parquet, open-data
数据集结构与规模
- 当前包含的抓取批次:CC-MAIN-2026-25
- 文档数量:约 2,043,354,814 个文档
- 分片数量:100,000 个分片(每个分片对应一个 Common Crawl WARC 文件)
- 数据处理效果:
- 处理约 332.7 TB 原始 HTML,生成约 8.9 TB 干净 Markdown
- 相较于原始 HTML,体积减少了 97.3%
- 最终 Parquet 文件(Zstd 压缩)体积约为 4.6 TB
- 数据存储结构:采用 Hive 分区目录结构,便于多批次快照共存和按批次过滤
数据处理流程
- 下载:从 Common Crawl S3 下载原始 .warc.gz 文件。
- 过滤:仅保留 HTTP 200 响应且内容类型为
text/html的页面。 - 转换:使用 go-trafilatura 库,采用
FavorRecall模式并启用了 Readability 和 DomDistiller 后备方案,提取主要内容节点,移除导航、广告等无关内容,并将其转换为 GitHub 风格的 Markdown 格式,链接已解析为绝对 URL。 - 导出:直接将转换结果导出为 Zstd 压缩的 Apache Parquet 文件。
- 过滤空内容:转换后内容为空的页面会被丢弃。
数据字段说明
| 字段名 | 类型 | 描述 |
|---|---|---|
doc_id |
string | URL 的确定性 SHA-256 哈希值(前 16 字节十六进制表示),用于跨抓取批次去重 |
url |
string | 被爬取页面的原始 URL |
host |
string | 从 URL 中提取的主机名 |
crawl_date |
string | WARC 记录的日期(YYYY-MM-DD 格式) |
warc_record_id |
string | 原始 HTTP 响应的 WARC-Record-ID(格式:<urn:uuid:...>) |
html_length |
int64 | 转换前原始 HTML 主体的字节长度 |
markdown_length |
int64 | 转换后 Markdown 内容的字节长度 |
markdown |
string | 从页面提取的干净 Markdown 内容 |
数据使用方式
- 使用
datasets库加载:- 流式加载整个数据集:
load_dataset("open-index/open-markdown-v2", name="CC-MAIN-2026-25", split="train", streaming=True) - 加载单个分片:
load_dataset("open-index/open-markdown-v2", data_files="data/crawl=CC-MAIN-2026-25/000000.parquet", split="train")
- 流式加载整个数据集:
- 使用
huggingface_hub下载:通过snapshot_download下载指定模式的文件。 - 使用 DuckDB 查询:可直接通过
read_parquet函数查询 Hugging Face 上的数据集文件。
注意事项与局限
- 个人信息与敏感信息:未进行额外的 PII 过滤。数据集来源于公共网络,可能包含个人信息。用户如发现自己的信息,可在仓库中提问题单。
- 偏见:数据集继承了 Common Crawl 和公共网络的偏见。内容提取工具会更倾向于文章类页面,可能低估论坛、社交媒体等内容的比重。数据集未应用任何基于机器学习的质量或内容过滤。
- 已知局限:代码密集型页面转换效果不佳。高度结构化的页面(如维基百科)可能不如专门的转储格式良好。
- 许可:使用本数据集需同时遵守其 ODC-By 许可证和 Common Crawl 的使用条款。




