遇见数据集

ccrawl-recrawl-domains

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

Common Crawl Domain Recrawl 是一个实时抓取 Common Crawl 域名排名列表中每个域名首页的数据集。该数据集基于 Common Crawl 的超链接网页图生成的域名排名,按排名顺序依次抓取每个域名的首页,并将响应完整存储为 Parquet 格式的一行,包括原始响应体、HTTP 头部、抓取时间、状态码等信息。同时,每个 HTML 页面会被实时渲染为 Markdown 和纯文本,并提取语言、正文长度、正文指纹等元数据。当前数据集包含 2,300,540 行,压缩后约 54.4 GB,分布在 794 个分片中,由两台服务器持续抓取并不断更新。数据集采用 Open Data Commons Attribution License (ODC-By) v1.0 许可证,与 Common Crawl 使用的许可证一致。主要用途包括:比较页面当前内容与存档的差异、测量索引中域名当前的可达性、直接获取原始响应体进行内容提取(无需从 WARC 中检索)、研究网络基础设施(状态、时间、头部、IP 等)、以及构建版权清洁、时效性强的训练语料。数据集中的每一行代表一次抓取尝试,包括失败的请求(超时、DNS 解析失败、连接被拒等),用户需通过 status=200 且 error 为空来筛选可读页面。此外,数据集还提供了丰富的字段说明,如 url、host、status、fetched_at、body、markdown、text、language、simhash 等,支持通过 DuckDB、datasets 或 huggingface_hub 直接查询或下载。

Common Crawl Domain Recrawl is a dataset that crawls the homepage of each domain in the Common Crawl domain ranking list in real time. Based on the domain ranking generated from the Common Crawl hyperlink graph, it sequentially fetches the homepage of each domain and stores the complete response as a row in Parquet format, including the raw response body, HTTP headers, fetch time, status code, etc. At the same time, each HTML page is rendered in real time into Markdown and plain text, and metadata such as language, body length, and body fingerprint are extracted. The current dataset contains 2,300,540 rows, approximately 54.4 GB compressed, distributed across 794 shards, continuously crawled and updated by two servers. The dataset is licensed under the Open Data Commons Attribution License (ODC-By) v1.0, consistent with the license used by Common Crawl. Main use cases include: comparing current page content with archived versions, measuring the current reachability of domains in the index, directly obtaining raw response bodies for content extraction (without retrieving from WARC), studying network infrastructure (status, timing, headers, IP, etc.), and building clean, timely training corpora with copyright considerations. Each row in the dataset represents a single crawl attempt, including failed requests (timeouts, DNS resolution failures, connection refused, etc.), and users need to filter for readable pages by status=200 and error is empty. In addition, the dataset provides rich field descriptions, such as url, host, status, fetched_at, body, markdown, text, language, simhash, etc., supporting direct query or download via DuckDB, datasets, or huggingface_hub.

创建时间:
2026-08-20
原始信息汇总

Common Crawl Domain Recrawl 数据集详情

数据集简介

Common Crawl Domain Recrawl 是一个实时抓取数据集,对 Common Crawl 网页图谱中排名靠前的域名进行主页抓取,并将结果存储为 Parquet 格式。每个域名在抓取时被渲染为 Markdown 和纯文本格式,同时保留原始响应体。该数据集目前包含 3,274,076 行数据,总大小 76.6 GB,分布在 1,288 个分片中。

基本信息

属性
许可证 Open Data Commons Attribution License (ODC-By) v1.0
任务类型 文本生成、文本检索、其他
数据集规模 1M < n < 10M(百万级)
标签 common-crawl, web-crawl, recrawl, html, markdown, text, parquet, open-data, domain-ranks
配置 default(单训练集)

数据内容与格式

数据行含义

每个数据行代表一次抓取尝试(而非成功的页面),包括:

  • 请求的 URL 及主机名
  • HTTP 状态码(0 表示抓取失败)
  • 抓取时间戳(Unix 毫秒)
  • 响应头与原始响应体
  • 渲染后的 Markdown 和纯文本内容
  • 语言检测结果(ISO 639-3 标准)
  • **内容指纹(simhash)**用于检测近似重复页面
  • 抓取性能指标(TTFB、总时长等)
  • IP 地址与响应/请求头信息

关键数据字段

字段 类型 说明
url VARCHAR 请求的 URL
status INTEGER HTTP 状态码,0 表示未获得响应
body BLOB 原始响应体(未解码)
markdown VARCHAR 页面渲染为 Markdown 的版本
text VARCHAR 去模板后的纯文本
language VARCHAR 页面语言(ISO 639-3)
error VARCHAR 失败原因(dns/timeout/refused/tls/skip/other)
fetched_at BIGINT 抓取时间(Unix 毫秒)
ttfb_ms BIGINT 首字节时间(毫秒)
simhash BIGINT 内容指纹,用于查找近似重复

数据覆盖与统计

机器 分片比例 分片数 行数 大小
server2 0/2 360 1,581,431 36.9 GB
server3 1/2 928 1,692,645 39.7 GB
总计 1,288 3,274,076 76.6 GB

数据使用注意事项

关键陷阱

  1. 行 ≠ 页面:包含所有失败尝试(超时、DNS 失败等),需过滤 status = 200 AND error = 才能获得有效内容
  2. 抓取时间 ≠ 抓取时间fetched_at 与实际网页爬取时间无关,两者可能相差数月
  3. 404 含义模糊:无法区分页面被删除、移动或无重定向,403 表示站点屏蔽陌生客户端
  4. 304 响应unchanged=true 时 body 为空,需在之前轮次查找相同 digest 的行获取内容
  5. robots.txt 未遵守:抓取过程未咨询 robots.txt,直接进行无条件 GET 请求

数据偏差

  • 屏蔽陌生客户端的网站在内容中代表性不足,在 403 错误中过度代表
  • 这种偏差是系统性的,而非随机的

数据用途

该数据集适用于:

  • 新鲜度对比:对比页面当前内容与归档记录的差异
  • 可用性分析:评估索引中仍可访问的域名比例
  • 内容提取:直接获取渲染后的文本,无需 WARC 文件检索
  • 基础设施研究:分析状态码、响应时间、服务器头信息等
  • 训练语料构建:获取许可证清晰、当前的网页快照
搜集汇总
数据集介绍
ccrawl-recrawl-domains 数据集图片
构建方式
本数据集源自Common Crawl的网页图谱,其构建方式别具匠心:以域名为核心,按排名顺序实时抓取每个域名的首页,并将响应结果完整存储为Parquet格式。抓取流程由两台服务器并行推进,依据注册域名进行切分,确保同一站点的所有页面由同一机器处理,遵循单一礼貌时钟。每个抓取尝试均被记录,无论成败,响应体、头部、计时及结果均汇入同一行,同时将HTML页面实时渲染为Markdown与纯文本,并提取语言与内容指纹,全程无重写,数据原始且完整。
特点
该数据集的独特之处在于其即时性与完整性:每行代表一次抓取尝试,而非仅收录成功的页面,失败记录亦被保留,使数据分布如实反映网络现状。所有页面均附带原始HTML、渲染后的Markdown与纯文本,配合语言检测、相似度哈希及详细元数据,使得研究者能够深入分析页面内容、结构及变化。此外,数据集持续更新,新分片不断提交,总量已逾三百三十万行,覆盖广泛,且以开放数据许可发布,便于合法使用与再分发。
使用方法
使用方式灵活多样,可直接通过DuckDB、Hugging Face datasets库或pandas读取,无需预先下载。推荐的查询策略包括:按状态筛选有效页面,利用Markdown列进行内容分析,通过语言字段统计分布,借助simhash识别近似重复页面,以及基于TTFB分析服务器响应性能。对于需要完整数据的场景,可通过huggingface_hub下载全部分片;而流式处理或仅需文本列时,应优先采用流式读取或列投影,以提升效率并节省存储。
背景与挑战
背景概述
Common Crawl Domain Recrawl数据集由开放索引项目于2025年创建,旨在实时重访Common Crawl网络图中所有排名域名的首页,并将响应存储为Parquet格式。该数据集由两台服务器协同工作,覆盖了整个工作列表,目前包含超过330万行数据,压缩后容量达77.5GB。其核心研究问题在于弥补网络索引与实时网页内容之间的鸿沟,使得研究者能够直接查询当前网页状态,而非仅仅依赖历史存档。该数据集在数字保存、网络测量和自然语言处理等领域具有重要影响力,为研究网页的可用性、内容演变及基础设施性能提供了新的数据基础。
当前挑战
该数据集面临的挑战主要来自两个方面。在领域问题层面,它解决了网页索引与实时内容不一致的问题,但同时也引入了新的复杂性:由于抓取时间与原始爬取时间存在数月间隔,比较两者时需注意时间窗口内的内容变化;此外,过滤失败请求(如DNS解析失败、超时等)对于获得有效网页内容至关重要,而某些网站的系统性屏蔽行为会导致数据偏差。在构建过程中,团队需应对大规模网络抓取的工程挑战,包括管理数十亿行的工作列表、平衡服务器负载以及确保长时间运行的稳定性。同时,为减少存储开销,304 Not Modified响应不包含响应体,这要求用户跨版本匹配才能获取完整内容,增加了数据使用的复杂度。
常用场景
经典使用场景
该数据集以Common Crawl的域名排名为索引,对全球核心域名的主页进行实时抓取,并将响应体、响应头、抓取时间与结果状态整合为单行Parquet记录,同时自动渲染为Markdown与纯文本格式。其经典使用场景聚焦于网络新鲜度评估,通过对比档案记录与当前抓取内容,精准捕捉网页随时间演变的动态轨迹;亦可用于可用性分析,系统度量索引中域名仍能响应访问的比例及失败类型分布,进而揭示域名失效的时变规律。
衍生相关工作
该数据集衍生了多项相关研究与实践,包括基于其抓取时间戳与内容指纹的网页变化检测方法,利用simhash聚类与语言分布分析进行网络内容生态研究,以及通过响应时序数据开展服务器性能基准测试。未来工作可能聚焦于跨时间版本追踪的增量更新机制、与历史WARC档案的深度融合分析,以及基于该数据集构建的实时网络知识图谱,为语义搜索与推荐系统提供动态事实基础。
数据集最近研究
最新研究方向
该数据集以实时重抓取方式重塑网络域名的动态图景,为现代网络研究注入鲜活脉搏。紧跟前沿方向,聚焦于网络生态的演化监测、内容时效性评估及可用性透视,其创新之处在于将每次抓取尝试完整记录,包括失败案例,从而揭示域名生命周期的真实面貌。此数据集支撑大规模网络基础设施研究、多语种语料构建及精细化的文本提取任务,与当前对网络新鲜度、鲁棒性和内容质量的追求紧密契合。通过提供高分辨率的时间快照,它赋能研究者探测网页更迭、域名沉寂与复活之谜,并因遵循ODC-By许可,成为构建合规训练语料的宝贵源泉,深刻影响网络科学、信息检索及语言模型领域的实证探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务