遇见数据集

cdx-cc-news

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

cdx-cc-news数据集是Common Crawl新闻数据集(Common Crawl News Dataset)的CDXJ格式索引集合。该数据集旨在为大规模新闻网页爬取数据提供高效、结构化的检索入口,使用户能够通过索引快速定位并获取Common Crawl存档中的新闻内容。数据来源于Common Crawl基金会定期发布的新闻爬取WARC文件,覆盖多年的全球新闻网页。数据集规模在10亿到100亿条记录之间。数据以两种主要形式组织:一是按年月分片的CDXJ压缩索引文件(扩展名为.cdxj.zst),包含每条抓取记录的基本元数据;二是按年月分区的Parquet文件,便于大规模数据处理。每条索引记录包含三个核心字段:surt(经过排序优化的URL格式,便于二叉树查找)、capture_time(14位数字表示的抓取时间戳,格式为CCYYMMDDHHMMSSmmm)以及json_record(一个JSON对象,内含原始URL、MIME类型、HTTP状态码、内容摘要、字节长度、在WARC文件中的偏移量、源文件名等详细信息)。用户可以利用这些索引信息向Common Crawl的S3存储发起范围请求,从而提取对应的存档新闻网页内容。数据集适用于新闻内容分析、时序检索、网络存档研究、大规模文本语料构建等任务。需要注意的是,surt和capture_time的组合并非绝对唯一,部分处理脚本(如SQLite转换)仅保留首次出现的记录。数据集生成依赖于CDXJ索引器、Zstandard压缩、surt转换等开源工具。

创建时间:
2026-07-17
原始信息汇总

数据集概述:cdx-cc-news

该数据集为 Common Crawl 新闻数据集 提供了 CDXj 索引,方便用户高效地检索和访问海量新闻存档。

  • 许可证:MIT
  • 标签:news, cdjx
  • 数据规模:1B < n < 10B(约10亿至100亿条记录)
  • 数据集地址:https://huggingface.co/datasets/brian-learns/cdx-cc-news

数据内容与结构

数据集包含两种核心文件类型:

  1. CDXj 索引文件

    • 路径:cdxj/cc-news_CCYY_MM.cdxj.zst
    • 格式:Zstandard 压缩的 CDXj 索引。
    • 每条记录包含:
      • surt:经过排序友好的 URL 转换形式,适合 B 树查找。
      • capture_time:抓取时间戳(CCYYMMDDHHMMSSmmm)。
      • json_record:JSON 格式的元数据,包括 URL、MIME 类型、HTTP 状态码、内容摘要、文件偏移量及文件名。
  2. Parquet 数据文件

    • 路径:data/year=CCYY/month=MM/data_N.parquet
    • 格式:Apache Parquet。
    • 数据按年份和月份分区,方便按时间范围进行过滤。

配置与分片

数据集默认只有一个配置(default),并按年份分为多个分片:

分片名称 对应数据路径
year_2016 data/year=2016/**/*.parquet
year_2017 data/year=2017/**/*.parquet
year_2018 data/year=2018/**/*.parquet
year_2019 data/year=2019/**/*.parquet
year_2020 data/year=2020/**/*.parquet
year_2021 data/year=2021/**/*.parquet
year_2022 data/year=2022/**/*.parquet
year_2023 data/year=2023/**/*.parquet
year_2024 data/year=2024/**/*.parquet
year_2025 data/year=2025/**/*.parquet
year_2026 data/year=2026/**/*.parquet

数据用途

该数据集提供了访问 Common Crawl WARC 文件所需的元数据。用户通过提供的 surtcapture_timeoffsetfilename 信息,可以对存储在 S3 上的 WARC 文件发起范围请求(range request),从而直接拉取到被归档的新闻 URL 内容。

其他说明

  • 注意事项surtcapture_time 组合并非总是唯一的。部分处理脚本(如基于 SQLite 的操作)可能仅保留第一条重复记录。
  • 相关资源与引用
    • Common Crawl 新闻数据集原始数据:https://data.commoncrawl.org/crawl-data/CC-NEWS/index.html
    • CDXj 规范:https://specs.webrecorder.net/cdxj/0.1.0/
    • 数据集涉及引用了 Common Crawl、GNU Parallel、Zstandard、cdxj-indexer、uv、surt、duckdb 和 SQLite 等相关工具或基金会。
搜集汇总
数据集介绍
cdx-cc-news 数据集图片
构建方式
cdx-cc-news数据集为Common Crawl新闻语料库提供了系统化的CDXj索引结构。其构建过程首先通过递归遍历AWS S3上Common Crawl存储桶中的新闻WARC路径文件,利用GNU Parallel和自定义的index_month.py脚本逐月处理warc.paths.gz文件,生成对应月份的cdxj.zst压缩索引。随后,通过parquet_from_cdxj.py脚本将索引转化为分区明确的Parquet格式文件,按年份和月份组织目录层级,构成了可高效查询的分布式数据存储体系。
使用方法
研究者可通过Hugging Face Datasets库直接加载此数据集,利用config参数指定年份分片进行针对性查询。具体使用时,可基于surt字段执行高效的范围查找,或解析capture_time字段实现时间序列分析。对于需要深度访问原始内容的场景,数据集提供的JSON元数据中包含了filename、offset和length字段,这些信息可用于构造针对Common Crawl S3存储的HTTP范围请求,从而高效获取完整的WARC新闻记录而不必下载整个归档文件。
背景与挑战
背景概述
在大规模网络文本分析领域,新闻语料凭借其时序性、多样性与真实性,成为自然语言处理与信息检索研究的核心资源。Common Crawl新闻数据集自2016年起持续收录全球范围内的公开新闻网页,为跨年份、跨领域的语言建模提供了宝贵素材,并催生了诸如多语言摘要、事件抽取与时序问答等前沿课题。然而,由于缺乏统一的索引结构,研究人员在高效定位与检索特定时段或来源的新闻内容时面临显著障碍。cdx-cc-news数据集由独立研究者brian-learns于2026年前后构建,其核心目标是为Common Crawl新闻语料创建标准化的CDXJ索引与Parquet格式元数据,从而大幅提升数据访问的便捷性与可重复性。该数据集覆盖2016年至2026年间每月新闻抓取的持久化索引,为大规模新闻语料的分布式查询、时序分析与下游模型预训练提供了基础设施级支持,在开放科学和语料工程领域具有奠基意义。
当前挑战
cdx-cc-news数据集所解决的领域核心挑战在于,Common Crawl新闻数据集长期缺乏可高效检索的索引机制,使得研究者无法直接通过URL或时间范围定位特定新闻条目,进行快速的内容抽取与分析。传统依赖全量WARC文件下载的处理方式不仅带宽消耗巨大,且数据解析效率低下,严重制约了新闻语料在时序建模、跨语言迁移等任务中的规模化应用。在构建过程中,主要挑战包括:如何跨越十年跨度、从数TB的索引文件中生成兼容性良好的CDXJ条目,并确保surt字段与capture_time的唯一性以避免数据冗余;如何设计高效的数据抽取与压缩流程,在有限计算资源(如单台c7g.2xlarge实例下)完成全量索引的重建与验证。此外,不同工具对CDXJ规范的解析差异(如嵌入JSON中的空格处理)亦为索引标准化引入了额外复杂性,需通过细致的脚本适配与数据清洗加以调和。
常用场景
经典使用场景
在数字人文与大规模网络存档研究领域,cdx-cc-news数据集为学者们提供了一座通往Common Crawl新闻存档的数字化桥梁。该数据集以精心编排的CDXJ索引格式,系统性地映射了从2016年至2026年间海量新闻网页的元数据,包括URL、抓取时间、MIME类型及文件定位信息。研究者的典型用法是,通过解析其中的SURT排序URL和WARC文件偏移量,精准地向Amazon S3上的原始压缩文档发起范围请求,从而高效地还原出各个时间点的新闻内容。这种索引化设计避免了遍历整个存档的庞大开销,使得针对特定新闻网页或特定时间段的回溯式检索成为可能,为大规模新闻语料的构建与时间序列分析奠定了坚实的数据基础。
解决学术问题
在计算社会科学与新闻传播学研究中,长期困扰学界的一个关键问题是如何从PB级别的网络存档中,高效、准确地提取出结构化的新闻历史数据。cdx-cc-news数据集通过提供轻量级、可排序的CDXJ索引文件,巧妙地解决了这一瓶颈。它使得研究人员能够在无需下载全部WARC文件的前提下,根据时间戳和URL快速定位并抽取所需新闻内容,从而支撑起跨年度的新闻议程变迁分析、媒体框架演变研究以及突发事件的信息扩散追踪。这一数据集的出现,不仅大幅降低了网络存档检索的准入门槛,更赋予了学者们驾驭长达十年新闻河流的能力,其意义在于将数据稀缺时代难以企及的纵向新闻语料研究,真正转化为可重复、可验证的科学实践。
实际应用
在新闻媒体监测与商业情报分析领域,cdx-cc-news数据集展现出了广泛的实用价值。媒体机构可利用该索引快速回溯自身或竞品的历史报道,进行年度报道风格的对比与内容策略的复盘。舆情分析公司则能借此构建跨年份的新闻事件数据库,通过批量抓取特定关键词或域名的新闻存档,训练出能够识别舆论周期性规律的预测模型。此外,数据新闻团队也可借助其Parquet格式的分月数据,在不依赖云存储直接权限的情况下,仅通过索引中的状态码、内容长度等字段,先行过滤掉无效记录,再进行精准下载,从而高效地创建面向特定主题(如气候、选举)的定制化新闻语料库。
数据集最近研究
最新研究方向
cdx-cc-news数据集聚焦于构建面向大规模新闻语料的索引化存档体系,依托Common Crawl新闻数据,通过CDXJ与Parquet格式实现高效检索与时空回溯。其前沿研究方向涵盖基于Web Archive的新闻语料时间序列分析、多模态新闻事件演化追踪,以及跨语言新闻内容的对齐与摘要生成。该数据集为自然语言处理中的时效性文本挖掘、舆情监测与历史新闻语料的开放科学计算提供了关键的基础设施支撑,尤其推动了社交媒体与传统新闻信息融合下的新闻溯源与事实核查研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务