cdx-cc-news
收藏资源简介:
cdx-cc-news数据集是Common Crawl新闻数据集(Common Crawl News Dataset)的CDXJ格式索引集合。该数据集旨在为大规模新闻网页爬取数据提供高效、结构化的检索入口,使用户能够通过索引快速定位并获取Common Crawl存档中的新闻内容。数据来源于Common Crawl基金会定期发布的新闻爬取WARC文件,覆盖多年的全球新闻网页。数据集规模在10亿到100亿条记录之间。数据以两种主要形式组织:一是按年月分片的CDXJ压缩索引文件(扩展名为.cdxj.zst),包含每条抓取记录的基本元数据;二是按年月分区的Parquet文件,便于大规模数据处理。每条索引记录包含三个核心字段:surt(经过排序优化的URL格式,便于二叉树查找)、capture_time(14位数字表示的抓取时间戳,格式为CCYYMMDDHHMMSSmmm)以及json_record(一个JSON对象,内含原始URL、MIME类型、HTTP状态码、内容摘要、字节长度、在WARC文件中的偏移量、源文件名等详细信息)。用户可以利用这些索引信息向Common Crawl的S3存储发起范围请求,从而提取对应的存档新闻网页内容。数据集适用于新闻内容分析、时序检索、网络存档研究、大规模文本语料构建等任务。需要注意的是,surt和capture_time的组合并非绝对唯一,部分处理脚本(如SQLite转换)仅保留首次出现的记录。数据集生成依赖于CDXJ索引器、Zstandard压缩、surt转换等开源工具。
数据集概述:cdx-cc-news
该数据集为 Common Crawl 新闻数据集 提供了 CDXj 索引,方便用户高效地检索和访问海量新闻存档。
- 许可证:MIT
- 标签:news, cdjx
- 数据规模:1B < n < 10B(约10亿至100亿条记录)
- 数据集地址:https://huggingface.co/datasets/brian-learns/cdx-cc-news
数据内容与结构
数据集包含两种核心文件类型:
-
CDXj 索引文件:
- 路径:
cdxj/cc-news_CCYY_MM.cdxj.zst - 格式:Zstandard 压缩的 CDXj 索引。
- 每条记录包含:
surt:经过排序友好的 URL 转换形式,适合 B 树查找。capture_time:抓取时间戳(CCYYMMDDHHMMSSmmm)。json_record:JSON 格式的元数据,包括 URL、MIME 类型、HTTP 状态码、内容摘要、文件偏移量及文件名。
- 路径:
-
Parquet 数据文件:
- 路径:
data/year=CCYY/month=MM/data_N.parquet - 格式:Apache Parquet。
- 数据按年份和月份分区,方便按时间范围进行过滤。
- 路径:
配置与分片
数据集默认只有一个配置(default),并按年份分为多个分片:
| 分片名称 | 对应数据路径 |
|---|---|
year_2016 |
data/year=2016/**/*.parquet |
year_2017 |
data/year=2017/**/*.parquet |
year_2018 |
data/year=2018/**/*.parquet |
year_2019 |
data/year=2019/**/*.parquet |
year_2020 |
data/year=2020/**/*.parquet |
year_2021 |
data/year=2021/**/*.parquet |
year_2022 |
data/year=2022/**/*.parquet |
year_2023 |
data/year=2023/**/*.parquet |
year_2024 |
data/year=2024/**/*.parquet |
year_2025 |
data/year=2025/**/*.parquet |
year_2026 |
data/year=2026/**/*.parquet |
数据用途
该数据集提供了访问 Common Crawl WARC 文件所需的元数据。用户通过提供的 surt、capture_time、offset 和 filename 信息,可以对存储在 S3 上的 WARC 文件发起范围请求(range request),从而直接拉取到被归档的新闻 URL 内容。
其他说明
- 注意事项:
surt和capture_time组合并非总是唯一的。部分处理脚本(如基于 SQLite 的操作)可能仅保留第一条重复记录。 - 相关资源与引用:
- Common Crawl 新闻数据集原始数据:https://data.commoncrawl.org/crawl-data/CC-NEWS/index.html
- CDXj 规范:https://specs.webrecorder.net/cdxj/0.1.0/
- 数据集涉及引用了 Common Crawl、GNU Parallel、Zstandard、cdxj-indexer、uv、surt、duckdb 和 SQLite 等相关工具或基金会。




