遇见数据集

open-index/open-markdown-v2

收藏
Hugging Face2026-07-04 更新2026-07-22 收录
官方服务:

资源简介:

Open Markdown是一个大规模网络文本数据集,基于Common Crawl构建。该数据集通过一个处理流程,从原始HTML中提取主要内容,转换为干净的Markdown格式,并将结果打包为Parquet文件,同时保留WARC元数据以支持可追溯性。当前版本包含爬虫CC-MAIN-2026-25,约2,039,988,496个文档,分布在100,000个分片中;处理了约329.3 TB的原始HTML,生成约8.9 TB的干净Markdown,数据量减少了97.3%。数据集采用Open Data Commons Attribution License (ODC-By) v1.0许可,旨在降低训练和检索高质量网络数据的门槛,适用于文本生成和特征提取等多语言任务。

Open Markdown is a large-scale web text dataset built from Common Crawl. Every page goes through a pipeline that extracts the main content from raw HTML, converts it to clean Markdown, and packages the result into Parquet files with WARC metadata for traceability. The dataset currently includes crawl CC-MAIN-2026-25 with ~2,039,988,496 documents across 100,000 shards. It processed ~329.3 TB of raw HTML into ~8.9 TB of clean Markdown, a 97.3% reduction. Released under the Open Data Commons Attribution License (ODC-By) v1.0, it aims to lower the barrier to training and retrieval of high-quality web data and is suitable for multilingual tasks such as text generation and feature extraction.

提供机构:
open-index
搜集汇总
数据集介绍
open-index/open-markdown-v2 数据集图片
构建方式
Open Markdown v2 数据集源自 Common Crawl 的非营利性网络爬虫存档,旨在将海量网页原始 HTML 高效转化为干净、结构化的 Markdown 文本。其构建流程为单次流式处理,无需中间文件:首先从 Common Crawl 的 Amazon S3 下载约 1 GB 压缩的 WARC 文件,仅保留 HTTP 200 且内容类型为 text/html 的响应,过滤图片、脚本与重定向;接着通过 go-trafilatura 工具(采用 FavorRecall 策略,辅以 Readability 和 DomDistiller 回退)提取主内容节点,剔除导航、广告与样板文本,再以节点树遍历方式直接渲染为 GitHub 风格的 Markdown,并解析链接为绝对 URL;最后将生成的 Markdown 内容以 Zstd 压缩写入 Apache Parquet 格式,每份 WARC 文件对应一个 Parquet 分片,空转换结果被自动丢弃。
特点
该数据集具有显著的规模与效率优势,当前包含 CC-MAIN-2026-25 爬取快照,约 20.4 亿文档分布于 10 万分片中,将约 329.3 TB 的未压缩 HTML 处理为仅 8.9 TB 的 Markdown 文本,实现 97.3% 的体积缩减。每个数据行保留了文档 ID(基于 URL 的确定性 SHA-256 哈希)、源 URL、主机名、爬取日期、WARC 记录 ID 以及原始 HTML 与 Markdown 的字节长度,支持跨爬取去重与完整溯源。数据集采用 Hive 分区目录结构,允许多个快照共存,并可通过分区感知工具按爬取 ID 高效过滤。此外,其基于 ODC-By 许可发布,未添加机器学习质量或毒性过滤,以避免对特定方言与社区内容的偏见。
使用方法
Open Markdown v2 支持多种灵活的数据访问方式。用户可通过 Hugging Face datasets 库加载整个数据集或单个分片,设置 streaming=True 可实现流式读取,避免内存溢出。借助 huggingface_hub 库的 snapshot_download 功能,可以按模式匹配下载指定爬取快照的 Parquet 文件,并可选装 hf_transfer 加速。对于 SQL 爱好者,DuckDB 可直接查询 Hugging Face 上的远程 Parquet 文件,例如按主机名筛选维基百科页面。数据集提供默认子集(包含所有可用爬取)与特定快照配置(如 CC-MAIN-2026-25),方便研究者根据需求灵活选择,广泛应用于文本生成与特征提取任务。
背景与挑战
背景概述
在大规模语言模型训练与信息检索研究的浪潮中,高质量、结构化且易于获取的文本数据集始终是驱动技术进步的核心基石。Open Markdown数据集诞生于2026年,由Open Index团队基于Common Crawl的海量网页存档构建而成。该数据集的核心研究问题在于如何将原始的、充斥着噪音的HTML网页内容高效转化为纯净的Markdown格式,从而直接服务于自然语言处理领域的文本生成与特征提取任务。凭借其超过20亿篇文档的庞大规模以及对多语言内容的广泛覆盖,Open Markdown迅速成为学术界与工业界在预训练、少样本学习等前沿探索中不可或缺的数据资源,显著降低了研究人员处理原始网络数据的门槛,有力推动了开放数据运动的发展。
当前挑战
Open Markdown数据集所面临的挑战首先体现在其解决的领域问题中:尽管图像分类领域的ImageNet等基准已高度成熟,但网络文本数据的标准化与质量提升仍是制约大规模语言模型性能的关键瓶颈。原始HTML页面充斥着导航栏、广告、脚本等无关信息,直接用于训练会引入大量噪音,损害模型的学习效率与生成质量。此外,数据集构建过程中亦遭遇了严峻挑战——如何在保证极高吞吐量的前提下,从约330TB的未压缩HTML中精准提取主内容并转换为Markdown,同时确保处理流程的流式化与可追溯性,是技术实现上的重大考验。项目还需应对非标准页面布局、代码密集型内容转换不佳以及多语言环境下的内容偏差等问题,这些均对数据集的完备性与通用性构成了持续挑战。
常用场景
经典使用场景
作为大规模网络文本语料库,Open Markdown最经典的使用场景是为大型语言模型的预训练提供高质量、结构化的文本数据。该数据集从Common Crawl中提取近乎200亿份网页,经由精细的HTML至Markdown转换流程,剔除了导航、广告和无关脚本,仅保留正文内容,并压缩至原始体积的2.7%。研究者和工程师可直接利用这些干净、格式规范的Markdown文本进行自监督学习或掩码语言建模,极大降低了从网络原始数据清洗到模型训练之间的工程成本和门槛。
解决学术问题
Open Markdown解决的核心学术问题是如何从海量、嘈杂的网络文本中高效获取语义连贯且格式统一的训练语料。传统方法要么保留原始HTML,将解析负担转嫁给用户,导致模型受大量无关标记干扰;要么依赖启发式规则或低质量过滤器,牺牲内容多样性与覆盖面。该数据集通过可复现的自动化管道,在保证93%以上存储缩减的同时,仍保留WARC元数据以支持可追溯性与归因分析,为语言模型预训练、跨语种表征学习以及网络文本压缩研究提供了可靠的实验基座。
衍生相关工作
Open Markdown的发布催生了一系列关于网络文本预处理、内容提取优化与多语言语料构建的后续工作。例如,研究者可基于该数据集比对不同HTML-to-Markdown转换工具(如trafilatura、readability、dom-distiller)在Recall与Precision上的取舍,进而设计更鲁棒的主内容提取器。还有团队利用其WARC记录ID的可追溯性,结合Common Crawl的原始存档,开展关于网页演变动态、内容质量随时间分布以及去重策略的专项分析。这些衍生工作共同推动了大语言模型数据工程从“黑盒清洗”向“可解释、可复现”的范式迁移。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务