遇见数据集

commoncrawl/web-graph-testing-v1

收藏
Hugging Face2026-05-28 更新2026-06-14 收录
官方服务:

资源简介:

该数据集包含Common Crawl Foundation的Web Graphs之一,以neo4j图数据库转储形式存储。它基于2025年10月、11月和12月的爬取数据计算而成,是一个测试版本,覆盖这三个月的网络图。自2018年以来,Common Crawl一直计算此类网络图,每个爬取周期通常涵盖前3次爬取的数据。数据集提供主机和域名两个版本的Web Graph:主机Web Graph以每个主机名作为独立节点,链接作为边;域名Web Graph则基于publicsuffix.org维护的公共后缀列表,在付费级别域(PLD)级别聚合主机图而成。

This dataset contains one of the Common Crawl Foundations Web Graphs, stored in a neo4j graph database dump. It is a test dataset that includes the web graph computed over the crawls of October, November and December 2025. Common Crawl has been computing these web graphs since 2018, with each crawl typically covering the previous 3 crawls. The dataset provides both host and domain versions of the Web Graph: the host Web Graph contains each hostname as a separate node with links as edges, while the domain Web Graph is built by aggregating the host graph at the pay-level domain (PLD) level based on the public suffix list maintained on publicsuffix.org.

提供机构:
commoncrawl
搜集汇总
数据集介绍
commoncrawl/web-graph-testing-v1 数据集图片
构建方式
该数据集源自Common Crawl基金会历经多年迭代的Web图计算工程,自2018年起持续构建,覆盖近三次爬取周期。本版本为测试集,基于2025年10月至12月的宿主级与域名级网页爬取数据构建。其中,宿主Web图将每个主机名视为独立节点,并以有向边表征其间的超链接关系;域名Web图则依赖publicsuffix.org维护的公共后缀列表,将宿主图进一步聚合至有效顶级域名层级,从而形成更宏观的网页间链接拓扑。
使用方法
用户可通过Docker容器快速部署neo4j实例并加载图数据库转储文件,具体操作步骤已集成至Common Crawl的GitHub仓库中。建议遵循该仓库的指令完成环境搭建与数据导入,随后即可利用Cypher查询语言对Web图进行交互式分析,如检索特定主机或域名间的链接关系。当前版本处于公测阶段,开发者被鼓励尝试并提供反馈以优化后续发布。
背景与挑战
背景概述
在万维网的持续演化中,链接结构作为信息检索与网络分析的核心要素,催生了诸多图结构数据集。由Common Crawl基金会自2018年起持续构建的Web Graph系列数据集,正是这一领域的代表性成果。本次发布的web-graph-testing-v1数据集,基于2025年10月至12月的爬取数据生成,旨在提供主机级与域级两种粒度的网页链接图。该项目目前处于beta测试阶段,其核心研究问题聚焦于如何高效表征与查询大规模网络拓扑结构,为互联网拓扑分析、搜索引擎优化及图算法研究提供了可复用的基础设施。该数据集的影响力体现在将历来庞大的网页链接数据转化为标准化的图数据库(neo4j)格式,降低了研究者在网络科学领域开展实证研究的门槛。
当前挑战
该数据集面临的首要挑战在于所解决的领域问题:如何精准捕获并表达互联网动态演化的链接结构。网页间的超链接关系随时间快速变化,单一快照难以反映网络拓扑的全貌,而构建跨爬取周期的时序图则面临数据规模爆炸与一致性维护的难题。在构建过程中,数据集面临的技术挑战包括处理海量爬取数据(建议配置2–4核CPU、16–32GB内存及512GB至1TB存储)以及将无向的原始链接关系转换为有向、带权重的图模型。此外,主机与域两级聚合策略需依赖publicsuffix.org的公共后缀列表进行精确划分,该列表的更新滞后可能导致域名归属判断错误,进而影响图结构的准确性。当前beta测试阶段的不稳定性更是对实际应用的可靠性提出了考验。
常用场景
经典使用场景
在万维网拓扑结构与信息检索研究领域,web-graph-testing-v1数据集为研究人员提供了源自Common Crawl 2025年10月至12月爬取的网络图,涵盖主机级与域级两种粒度的图结构。经典使用场景聚焦于分析网页间的链接关系模式,包括度分布、连通分量、核心-边缘结构等宏观网络特性,以及对域级别聚合拓扑的探索。研究者可借助该neo4j格式的图数据库,高效地进行图算法实验,如PageRank、社区发现或影响力传播建模,从而洞察网络演化的时空规律。该数据集尤其适用于验证大规模网络图的压缩、存储与查询优化技术,为后续对更大规模Web图的研究奠定方法论基础。
解决学术问题
学术界长期面临从海量网页中提取结构化链接关系并加以系统研究的挑战,web-graph-testing-v1数据集精准回应了这一需求。它解决了Web图数据获取门槛高、标准不统一的问题,提供了一个跨三个月爬虫周期的连贯图快照,使研究者能够探究链接结构的短期演化动态。基于该数据集,可以定量分析主机与域之间的引用网络特性,回答诸如‘哪些域构成了信息传播的核心枢纽’、‘链接密度的统计规律是否服从幂律分布’等基础科学问题。其意义在于构建了一个可复现的基准测试平台,支撑图挖掘、网络科学以及大数据分析领域的理论验证与算法比较,推动了对全球Web图理解从定性描述向定量建模的跨越。
实际应用
在实际场景中,web-graph-testing-v1数据集的图结构信息可赋能多种下游任务。例如,搜索引擎优化(SEO)领域可依据域级别链接关系评估网站权威性与互引模式,辅助排名策略调整。网络安全方面,通过分析异常的图链接增长或孤立节点模式,可识别垃圾农场或僵尸网络的活动痕迹。此外,推荐系统得以利用域共现关系拓展内容关联性,提升跨站点内容发现的质量。该数据集还支持知识图谱构建中的实体对齐与关系挖掘,以及社会科学中的信息扩散路径还原。作为neo4j图数据库的预加载内容,它允许开发者直接部署图查询应用,大幅降低原型验证与产品迭代的周期成本。
数据集最近研究
最新研究方向
该数据集代表了Common Crawl基金会在网络图谱构建领域的最新探索,聚焦于2025年第四季度(十月至十二月)的爬虫数据,并以neo4j图数据库格式存储。当前研究前沿集中于利用图神经网络对大规模网络拓扑结构进行动态演化分析,例如基于主机级和域名级图谱的链接预测与社群发现。该测试数据集为beta版本,旨在验证从传统图谱向图数据库迁移的可行性与性能表现,其意义在于推动网络科学向更高效、可扩展的图计算框架迈进,为未来的实时网络分析、影响力传播建模及搜索引擎优化提供了实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务