遇见数据集

ccrawl-recrawl-urls

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

Common Crawl URL Recrawl 是一个实时重新抓取的数据集,它基于 Common Crawl 发布的 URL 索引,对每个页面重新发起 HTTP 请求,并将完整的响应、头部、时间信息及结果存储为 Parquet 格式的一行数据。同时,每个 HTML 页面在抓取时会被渲染为 Markdown 和纯文本,并附带语言检测和内容指纹。该数据集旨在解决原始 WARC 档案查询不便、数据陈旧的问题,使用户能够直接比较页面当前内容与历史存档的差异,而无需解析 HTML。数据集当前包含 777,573 行数据,压缩后约 22.4 GB,分布在 784 个分片中,由单台服务器从工作列表的一部分抓取完成。每一行代表一次抓取尝试,包括成功和失败的请求(如超时、DNS 解析失败等)。失败的请求会被保留,其中状态码为 0,错误原因分为六类(dns、timeout、refused、tls、skip、other)。数据字段丰富,包括:URL、主机名、HTTP 状态码、抓取时间戳、内容类型、正文长度、SHA-1 摘要、是否未修改(304)、ETag、Last-Modified、错误信息、元数据 JSON、Markdown 渲染结果、Markdown 长度、首字节时间、总抓取时间、最终 URL、IP 地址、响应头、请求头、原始正文、标题、纯文本、文本长度、词数、语言(ISO 639-3)、语言置信度、相似哈希(simhash)、提取器版本等。数据集仅包含一个训练分割,所有分片相互独立,任意子集均可作为有效样本。数据以 Open Data Commons Attribution License (ODC-By) v1.0 发布,与 Common Crawl 使用的许可证相同。适用场景包括:内容新鲜度比较、可用性测量、内容提取、基础设施研究、训练语料等。注意:每一行是一次抓取尝试而非成功的页面;状态码 200 且错误为空时才视为有效内容。304 响应无正文,需通过相同 URL 的先前抓取行获取正文。robots.txt 在该数据集中未被遵守。

Common Crawl URL Recrawl is a real-time recrawled dataset based on the URL index published by Common Crawl. It re-issues HTTP requests to each page, storing the complete response, headers, timing information, and results as a single row in Parquet format. Additionally, each HTML page is rendered into Markdown and plain text when crawled, with language detection and content fingerprinting. This dataset aims to address the inconvenience and staleness of the original WARC archives, allowing users to directly compare the current content of pages with historical snapshots without parsing HTML. The dataset currently contains 777,573 rows, approximately 22.4 GB compressed, distributed across 784 shards, crawled by a single server from a subset of the work list. Each row represents one crawl attempt, including both successful and failed requests (e.g., timeout, DNS resolution failure). Failed requests are retained with status code 0 and error reasons categorized into six types (dns, timeout, refused, tls, skip, other). The data fields are rich, including: URL, hostname, HTTP status code, crawl timestamp, content type, body length, SHA-1 digest, not modified (304), ETag, Last-Modified, error message, metadata JSON, Markdown rendering result, Markdown length, time to first byte, total crawl time, final URL, IP address, response headers, request headers, raw body, title, plain text, text length, word count, language (ISO 639-3), language confidence, simhash, extractor version, etc. The dataset contains only a training split, and all shards are independent; any subset can serve as a valid sample. The data is released under the Open Data Commons Attribution License (ODC-By) v1.0, the same license as Common Crawl. Use cases include: content freshness comparison, availability measurement, content extraction, infrastructure research, and training corpus. Note: Each row is a crawl attempt, not a successful page; a status code of 200 and no error indicate valid content. 304 responses have no body, and the body must be obtained from a previous crawl of the same URL. robots.txt is not respected in this dataset.

创建时间:
2026-08-20
原始信息汇总

Common Crawl URL Recrawl 数据集概述

数据集简介

这是一个对 Common Crawl URL 索引中的网页进行实时重新抓取(recrawl)的数据集。数据集中包含每个页面的原始响应体(body)、响应头、抓取时间、结果状态,以及将页面渲染为 Markdown 和纯文本的版本,方便用户无需解析 HTML 即可直接阅读页面内容。

数据集目前包含 1,173,440 行,压缩后大小为 33.1 GB,分布在 1,180 个分片(shards) 中,由 1 台服务器完成抓取。数据仍在持续更新,新的分片会持续提交。

许可证

数据集采用 Open Data Commons Attribution License (ODC-By) v1.0 许可协议,与 Common Crawl 使用的工作列表许可证一致。

数据规模

机器 分片数 行数 大小
server3 1,180 1,173,440 33.1 GB

数据分为单个 train 分割,覆盖所有分片。分片之间相互独立,任何子集均可作为整体的有效样本。

数据字段说明

每一行代表一次抓取尝试。字段来源分为四类:served(网站自身的应答)、computed(本管线的计算结果)、measured(在本机时钟和网络上测量的数值)、asked(我们发送的请求内容)。

主要字段包括:

  • url: 请求的 URL,直接来自工作列表
  • host: 请求 URL 的主机名
  • status: HTTP 状态码,0 表示从未收到响应
  • fetched_at: 抓取时间(Unix 毫秒)
  • body: 原始响应体(未解码)
  • markdown: 页面渲染为 Markdown 的版本
  • text: 去除样板内容后的纯文本版本
  • title: 文档标题
  • word_count: 提取文本中的单词数
  • language: 检测出的语言(ISO 639-3)
  • language_confidence: 语言检测置信度(0 到 1)
  • simhash: 内容指纹,用于查找近似重复页面
  • error: 抓取失败原因,取值包括:dnstimeoutrefusedtlsskipother,成功时为空
  • ttfb_ms: 首字节时间(毫秒)
  • fetch_duration_ms: 总抓取时长(毫秒)
  • final_url: 重定向后的最终 URL
  • ip_address: 请求到达的 IP 地址
  • resp_headers / req_headers: 响应/请求头(JSON 格式)
  • etag / last_modified: 服务器返回的验证器
  • unchanged: 服务器是否返回 304 Not Modified
  • extractor: 渲染页面的引擎及版本

核心使用场景

  • 新鲜度对比:比较页面当前内容与档案记录内容的差异
  • 可用性分析:衡量索引中仍有响应的 URL 比例及响应类型
  • 内容提取:原始响应体直接可用,无需访问 WARC 档案,且已提供渲染后的文本
  • 基础设施研究:每次抓取的状态、耗时、请求头、IP 等信息
  • 训练语料:许可证清晰、当前状态的真实网页快照

重要使用注意事项

  • 一行是一次尝试而非一个页面:失败的尝试(超时、DNS 解析失败、连接拒绝等)也会保留为一行,status 为 0。统计页面数量时需要先过滤 status = 200 AND error =
  • 抓取时间与爬取时间无关fetched_at 是实际请求时间,与 Common Crawl 最初看到该页面的时间间隔数月,且间隔随运行持续增长
  • 404 的含义有限:404 不区分页面被删除、被移动(无重定向)或服务器对陌生客户端返回的默认响应,403 和 429 同理
  • 304 响应体为空:当服务器返回 304 Not Modified 时,body 字段为空,需要通过同一 url 在早期批次中找到 digest 匹配的行来获取内容
  • 未遵循 robots.txt:本数据集抓取时不检查 robots.txt,每个 URL 均为无条件 GET 请求,每主机每个礼貌间隔一次请求
  • 内容为原始公开网页:可能包含作者放置的个人信息,数据集不对其进行过滤,仅抓取无需登录或付费墙的内容

如何使用

数据集为标准 Hugging Face Parquet 布局,可直接通过 DuckDB、datasetspandashuggingface_hub 读取,无需手动下载。可使用 load_dataset("open-index/ccrawl-recrawl-urls", split="train", streaming=True) 进行流式读取,或使用 snapshot_download 下载本地。如需加速下载,可安装 huggingface_hub[hf_transfer] 并设置 HF_HUB_ENABLE_HF_TRANSFER=1

数据构建方式

构建流程使用单个 Go 二进制文件,每台机器运行两个进程:

  1. 从已发布的 Parquet 中流式读取工作列表,按注册域名拆分,使同一站点的所有页面由同一台机器抓取
  2. 依次抓取每个 URL,记录响应体、请求头、耗时和结果
  3. 在内存中将 HTML 页面渲染为 Markdown 和纯文本,并检测语言
  4. 按负载切分生成 Zstandard 压缩的 Parquet 分片
  5. 将每个关闭的分片连同更新的账本文件和数据集卡片提交到 Hub,然后删除本地文件

原始响应体按原样存储(未解码),渲染后的列仅是附加在原始内容旁边,不替代原始数据。失败抓取同样保留为一行,并记录错误类别和详细错误信息(存储于 meta_jsonerror_detail 字段)。

数据来源

数据来自 open-index/ccrawl-urls 工作列表(即单个月度 Common Crawl 的 URL 索引),数据集中的每一行都是对该列表中一个 URL 的重新抓取结果。

搜集汇总
数据集介绍
ccrawl-recrawl-urls 数据集图片
构建方式
该数据集基于Common Crawl发布的URL索引,对其中记录的网页地址进行实时重新抓取。构建流程采用单一Go二进制程序,每个机器运行两个进程:一个进程流式读取工作列表,按照每个主机的礼貌间隔发送请求,并将每个响应以Parquet行格式存储于本地分片;另一个进程监控目录,在分片关闭后立即提交至Hugging Face Hub,同时更新账本和数据集卡片。工作列表按注册域名而非URL进行分割,确保同一站点的所有页面由同一机器抓取,维持单一的礼貌时钟。每个抓取尝试均被记录,包括失败的请求,响应体原样存储,并额外提取Markdown、纯文本、语言及指纹等信息。
使用方法
数据集可通过Hugging Face的datasets库、DuckDB或huggingface_hub直接访问。使用DuckDB时,可通过SQL查询进行状态分布分析、错误原因统计、语言分布、近似重复检测等。使用datasets库时,支持流式加载,逐行处理数据,便于快速浏览。huggingface_hub允许按需下载指定的Parquet文件。由于响应体可能较大,建议在查询时仅选择所需列,如markdown或text,以利用Parquet的列裁剪特性,避免读取不必要的数据。对于需要全文内容的分析,可通过快照下载全部数据,但流式处理更适合大规模筛选。
背景与挑战
背景概述
自2007年Common Crawl基金会启动其非营利性网络爬虫项目以来,其公开的URL索引与WARC归档已成为互联网存档研究的关键基石,为大规模网络分析提供了历时性数据。然而,这些索引所指向的页面内容深藏于难以查询的WARC文件中,且其快照时间随爬取周期滞后数月至数年,导致研究者难以高效获取页面的最新状态。为弥合这一时效性鸿沟,open-index团队于2024年推出了ccrawl-recrawl-urls数据集,该数据集基于Common Crawl的月度URL索引,通过实时重抓取这些URL,并以Parquet格式存储响应体、HTTP头、抓取时间与结果状态,同时将HTML渲染为Markdown与纯文本,从而构建了一个自包含、可即时查询的当前网络快照。该数据集的核心创新在于将历史索引与实时内容并置(每个抓取行都保留重抓时的fetch date与源爬取时间的差),使研究者能够直接对比页面在时间窗口内的变化,而无需处理原始的WARC格式。其发布采用与Common Crawl一致的ODC-By许可,保证了数据的开放性,并迅速成为网络新鲜度分析、内容提取与语料构建领域的重要资源,其影响力体现在为大规模网络研究提供了标准化的、可直接查询的实时数据基础。
当前挑战
该数据集在构建与应用中面临多重挑战。首先,领域问题层面,它旨在解决网络存档的时效性缺失,但重抓取过程引入了新的复杂性:每次抓取代表一次尝试,而非成功获取的页面,因此状态码0(如超时、DNS解析失败)的失败行被保留,这要求使用者必须区分‘尝试’与‘内容’,否则统计结果将产生系统偏差(例如,基于数月前网络图计算的域名排名可能导致大量域名已失效,从而无响应)。其次,成功获取的页面也并非原封不动:重定向(final_url)可能改变内容,而HTTP 304响应(表示未修改)的体为空,使得需要回溯先前快照才能获取实际内容,这增加了数据解释的难度。此外,构建过程中面临工程与伦理挑战:爬虫需处理数十亿URL,必须通过分片、检查点机制维持数月运行的持久性,并依靠流水线在等待网络间歇时即时渲染页面以控制成本;同时,由于未咨询robots.txt(这会使请求翻倍且约三分之一的hosts无响应),并遵循每域名一个请求的礼貌间隔,这虽提高了效率却可能触犯网站所有者意愿,导致403/404状态所反映的系统性遮蔽(如屏蔽未知客户端),而非页面真实缺失,从而影响了数据集的完整性与代表性,需要建立剔除机制与解释框架来缓解。
常用场景
经典使用场景
该数据集作为Common Crawl URL索引的实时重抓快照,为网络科学与时序分析提供了独特素材。研究者可借此对比页面在当前时刻与历史归档中的内容差异,量化网页的更新频率、消亡速率及重定向行为,亦可用于评估索引覆盖率的时效性。其丰富的元数据(如抓取状态、响应时间、内容指纹)支持构建网页生命周期模型,是研究网络动态演化的理想数据源。
解决学术问题
该数据集有效解决了传统WARC档案查询不便、时效性滞后的问题,使得大规模网页内容的纵向对比成为可能。它提供了统一的字段结构,涵盖抓取状态、内容摘要、语言识别及重复检测信息,满足了研究者在网页可用性评估、内容漂移检测、网络基础设施性能分析等多方面的学术需求,为互联网测量与信息检索领域提供了可靠的数据基础。
实际应用
在实际应用中,该数据集可助力构建高效的网页索引与搜索引擎优化工具,帮助运维人员监测站点可用性与性能瓶颈。其Markdown与纯文本的预处理形式,降低了自然语言处理任务的入门门槛,可用于训练大规模语言模型或构建领域语料库。同时,响应头与重定向信息为网络安全管理、CDN策略评估等实际业务提供了珍贵参考。
数据集最近研究
最新研究方向
该数据集聚焦于对Common Crawl URL索引进行实时重抓取,将页面正文、响应头、抓取时序及结果以Parquet格式内联存储,并同步提取Markdown、纯文本、语言及内容指纹,开创了离线网络档案与实时网络状态对比研究的新范式。当前研究前沿集中于利用此类重抓取数据监测网页的可用性演变、内容新鲜度及网络基础设施性能,同时通过请求失败分类与robots.txt处理策略,深入探究网络爬取伦理与合规性。该数据集凭借其自包含、分片独立的设计,为大语言模型训练提供了许可清晰、时效性强的语料源,尤其在网页近重复检测、多语言文本提取及动态内容追踪方面展现出巨大潜力,推动了网络科学、信息检索及自然语言处理领域的交叉研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务