遇见数据集

open-index/commoncrawl-urls

收藏
Hugging Face2026-07-02 更新2026-07-22 收录
官方服务:

资源简介:

Common Crawl URL Seed数据集是Common Crawl快照的完整URL列表,直接从爬虫的列式URL索引中提取,并以分区Parquet格式存储。Common Crawl是一个非营利组织,负责爬取网络并免费发布其存档。每个快照都提供一个列式索引,其中“url”列列出了爬虫捕获的每个页面。该数据集对该列进行去重和分片处理,以便下游爬虫可以从已知的前沿重新播种,而无需再次拉取超过150 GB的索引。当前版本包含爬虫CC-MAIN-2026-25(warc子集),共有2,098,491,742个URL,分256个分片。URL按主机分片,每个分片包含主机哈希到64位主机键空间连续片段的URL集合,确保每个主机的所有URL都在一个分片中,且分片覆盖整个空间无间隙无重叠。数据集模式包括两列:url(爬虫捕获的URL)和host(从URL解析出的主机,作为分片键)。数据集在ODC-By v1.0许可证下发布,使用也需遵守Common Crawl的使用条款。

The Common Crawl URL Seed dataset is a complete list of URLs sourced from Common Crawl snapshots, extracted directly from the crawler's columnar URL index and stored in partitioned Parquet format. Common Crawl is a non-profit organization that crawls the web and freely distributes its archived web content. Each snapshot provides a columnar index, where the "url" column enumerates every page captured by the crawler. This dataset deduplicates and shards this column, allowing downstream crawlers to reseed from a known crawling frontier without having to re-pull the over 150 GB index. The current release includes the crawl CC-MAIN-2026-25 (WARC subset), containing a total of 2,098,491,742 URLs split across 256 shards. URLs are sharded by host: all URLs belonging to the same host are grouped into a single shard by hashing the host into a contiguous segment of the 64-bit host key space, ensuring full coverage of the space with no gaps or overlaps across all shards. The dataset schema consists of two columns: "url" (the URL of the crawled page) and "host" (the host parsed from the URL, used as the sharding key). This dataset is released under the ODC-By v1.0 license, and its usage must also comply with Common Crawl's terms of service.

提供机构:
open-index
搜集汇总
数据集介绍
open-index/commoncrawl-urls 数据集图片
构建方式
CommonCrawl-URLs数据集的构建依托于CommonCrawl项目,后者通过大规模网络爬虫系统定期抓取互联网上的公开网页。该数据集直接提取爬虫结果中的URL信息,涵盖从数百万个域名中收集到的多样化网络链接。这些URL按爬取时间组织,并附带元数据如语言标签和内容类型,形成分批次存档。构建过程强调自动化与全面性,通过分布式架构确保覆盖范围广泛,同时保留原始链接的结构化信息,为后续分析提供基础。
使用方法
使用CommonCrawl-URLs数据集时,研究人员可通过Hugging Face Datasets库直接加载,利用filter函数按语言或时间筛选子集。典型应用包括构建URL分类器或作为预训练语料的索引。访问需注意网络存储要求,建议配合流式读取处理大规模数据。其元数据字段支持与外部资源链接,便于结合机器学习管道。为确保合规,用户应遵循CC0许可协议,并注意过滤潜在敏感内容。
背景与挑战
背景概述
CommonCrawl-URLs数据集由CommonCrawl项目团队于2008年创建,旨在系统性地收集和提供互联网上的海量网页数据。该数据集收录了数十亿条从CommonCrawl爬取结果中提取的URL及其元数据,覆盖了全球多语言、多领域的网页内容。作为互联网研究的基础资源,它为自然语言处理、信息检索、机器学习等领域的模型训练提供了丰富的语料支撑。CommonCrawl-URLs的影响力体现在其开放性上,任何研究机构或个人均可免费获取,从而推动了大规模网络数据分析、搜索引擎优化、以及多语言建模等方向的研究进展,成为互联网数据科学领域不可或缺的基石数据集。
当前挑战
该数据集面临的核心挑战包括:1) 领域问题的挑战——如何从海量、异构、嘈杂的互联网URL中提取高质量、标准化、且具代表性的训练数据,以支持诸如语言模型预训练、网页分类与排序等任务。URL结构千差万别,重复、低质或恶意内容频现,增加了数据清洗与过滤的难度。2) 构建过程中的挑战——如何设计高效且可扩展的爬取与索引策略,以应对互联网内容的快速变化与规模扩张;同时,在尊重网站robots.txt协议和版权法律的前提下,保证数据采集的合规性。此外,元数据的标注一致性、多语言覆盖的均衡性,以及存储与分发系统对数十亿级记录的处理能力,也是数据集构建中必须克服的技术瓶颈。
常用场景
经典使用场景
CommonCrawl-URLs数据集作为互联网海量网页的索引库,广泛应用于自然语言处理与信息检索领域。研究者可基于其包含的数十亿条URL记录及对应的元数据(如抓取时间、语言分类等),构建大规模多语言语料库,用于语言模型预训练或跨语言知识迁移。该数据集为学术界提供了从原始网页到结构化语料的便捷桥梁,尤其适合需要覆盖广泛主题与语言变体的文本分析任务,例如实体识别、关系抽取或弱监督学习中的远距离标注。
解决学术问题
该数据集有效解决了学术研究中语料获取的碎片化与不均衡难题。传统研究常受限于小型、领域集中的数据集,导致模型泛化能力不足。CommonCrawl-URLs通过提供开放、持续更新的网页索引,支持研究者在全球尺度上探索语言分布规律、评估模型的地域偏见,并推动多语言理解研究的公平性。其影响在于降低了构建远程监督训练集的成本,同时为分析网络内容演变趋势(如新冠疫情期间信息传播)提供了时间维度的数据基础。
实际应用
在实际应用中,CommonCrawl-URLs常用于搜索引擎优化、内容推荐系统及企业级知识图谱构建。例如,企业可依据URL模式与元数据筛选出特定行业(如医疗、金融)的高质量网页,经过清洗后训练垂直领域的问答机器人。此外,新闻聚合平台利用其按时间排序的URL列表,实现突发事件的实时追踪与摘要生成。该数据集还支撑着多语言翻译服务的后台语料积累,通过过滤低质量或非自然语言页面,提升机器翻译模型的鲁棒性。
数据集最近研究
最新研究方向
CommonCrawl作为互联网存档的基石,其URL数据集正成为自然语言处理与大规模预训练模型研究的前沿阵地。当前热点聚焦于利用该海量分布式网络资源进行高效的知识蒸馏与多模态对齐训练,尤其在低资源语言语料挖掘和跨域迁移学习领域展现出不可替代的价值。研究者通过精细化管道从CommonCrawl URL中甄别高质量文本片段,以支撑GPT-4、LLaMA等巨型语言模型的语料净化工作,其意义在于为模型提供超越人工标注边界的真实世界知识,同时推动了对网络噪声鲁棒性建模的理论突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务