遇见数据集

urls-sampled

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集为 URLs (hash-sampled),是 ks46/urls 的哈希采样版本,包含 74,918,894,107 个唯一 URL,通过 xxh3_64 哈希函数将整个语料库均匀随机划分为 2048 个块,每个块约 36.6M 行,作为 1/2048 的均匀随机样本。这种布局克服了 SURT 布局在抽样偏差、稳定性(块划分不随语料库变化)和并行性方面的不足。数据仅包含一个字段 url(字符串)。训练集样本数为 74,918,894,107,总字节数约 6.3 TB,下载大小约 1.79 TB。数据来源与 ks46/urls 相同:来自 62 个 URL 数据集和 43 个 Common Crawl 爬取,经过全局去重、轻微规范化和验证,并移除了 5,188,960 个无效 URL。数据以 Parquet V2 格式存储,zstd 等级 9 压缩,每行组 1,000,000 行。每个块内部的 URL 按 SURT 键和 URL 排序,但块之间无顺序。提供了验证方法(位置、排序、去重、未键控)和每个块的统计信息。该数据集适用于文本生成、文本检索等任务,并可用于可重现的样本划分(如按块选择)。许可证为每个来源各自的许可证,不包含页面内容。

This dataset is URLs (hash-sampled), a hash-sampled version of ks46/urls, containing 74,918,894,107 unique URLs. The entire corpus is uniformly and randomly partitioned into 2048 blocks using the xxh3_64 hash function, each block having approximately 36.6M rows, representing a 1/2048 uniform random sample. This layout overcomes the shortcomings of the SURT layout in terms of sampling bias, stability (block partitioning does not change with the corpus), and parallelism. The data contains only one field url (string). The training set has 74,918,894,107 samples, total bytes about 6.3 TB, and download size about 1.79 TB. The data source is the same as ks46/urls: from 62 URL datasets and 43 Common Crawl crawls, after global deduplication, slight normalization and validation, and removal of 5,188,960 invalid URLs. The data is stored in Parquet V2 format, zstd level 9 compression, with 1,000,000 rows per row group. URLs within each block are sorted by SURT key and URL, but blocks are not ordered. Validation methods (position, sorting, deduplication, unkeyed) and statistics for each block are provided. This dataset is suitable for tasks such as text generation and text retrieval, and can be used for reproducible sample partitioning (e.g., by block selection). The license is the respective license of each source, and the dataset does not contain page content.

创建时间:
2026-08-21
原始信息汇总

数据集概述

该数据集为 URLs (hash-sampled),由 ks46 发布,是一个包含 74,918,894,107 条 URL 的海量多语言数据集,覆盖文本生成、文本检索等任务场景。

核心特性

  • 数据规模:约 749 亿条 URL 记录,数据集总大小约 6.3 TB(下载大小约 1.79 TB)
  • 存储格式:Parquet V2,使用 zstd 压缩(等级 9),每个行组包含 1,000,000 行
  • 文件结构:共 2,048 个分块文件(data/part-00000.parquetdata/part-02047.parquet),另附 chunks.json 元数据、stats/ 统计目录及 removed.parquet(被剔除的 URL 记录)
  • 分块方式:基于 xxh3_64 哈希值将 URL 空间均匀划分为 2,048 个区块,每个区块约 3,660 万行,是整体语料的均匀随机样本

与原始数据集的关系

该数据集与 ks46/urls 包含 完全相同的 URL 集合,区别仅在于分块策略:

  • 原始数据集按 SURT 键范围分块,侧重主机聚类,磁盘占用约 665 GiB
  • 本数据集按哈希范围分块,实现均匀采样与稳定性,但磁盘占用约 1.79 TB(字节/URL 为 23.89,约为原始数据集的 2.5 倍)

设计优势

  1. 无偏采样:任意前缀区块均为全语料的 1/2048 均匀随机样本,避免 SURT 布局中按字母排序导致的偏差
  2. 稳定性:URL 到区块的映射是纯函数,语料增删不会改变已有 URL 的归属区块,适合构建可持续的训练/评估划分
  3. 并行友好:各区块行数差异仅 0.03%(约 3,657 万至 3,658 万行),远优于 SURT 布局中 5.6 M 至 118.8 M 的巨大差异

数据验证

所有 749 亿行数据均通过以下检查:

  • 位置校验:每个 URL 的 xxh3_64 哈希值落在其声明区块范围内(使用独立的 DuckDB 扩展实现)
  • 排序校验:区块内部按 surt(url), url 排序
  • 去重校验:无重复 URL
  • 键完整性:每行均包含 SURT 键

来源与许可

  • 数据来源包括 62 个 URL 数据集及 Common Crawl 的 43 次爬取,经全局去重、轻度标准化处理
  • 数据集中不包含网页内容,仅含 URL 字符串,属于对公共资源的客观引用
  • 各来源数据依据其自身许可条款使用;Common Crawl 数据遵循其使用条款
  • 如需移除特定 URL,可在数据集仓库发起讨论

使用建议

  • 单区块即可作为全语料的 1/2048 均匀样本
  • 如需可复现的 1% 样本,可直接选取任意 20 个区块文件(无需扫描或洗牌)
  • 计算 URL 所属区块无需查询索引,可通过 xxh3_64 哈希直接计算确定
搜集汇总
数据集介绍
urls-sampled 数据集图片
构建方式
该数据集基于ks46/urls的74,918,894,107条URL记录,采用xxh3_64哈希函数将URL均匀映射至2048个分片。每个分片对应哈希空间的连续区间,而非取模运算,以确保分片可灵活拆分或合并。构建过程严格验证了哈希映射的准确性,并独立实现了xxh3_64算法以交叉校验。所有URL经过全局去重、轻量标准化及有效性验证,剔除无效记录后按分片存储为Parquet格式,附有详细统计信息与验证结果。
使用方法
用户可通过HuggingFace datasets库直接加载任意分片,如pd.read_parquet读取part-00000.parquet获取1/2048样本。可组合多个分片构建任意比例的采样集,无需扫描全量数据。利用xxh3_64哈希函数可快速计算任意URL所属分片,实现高效的分布式处理与训练/验证集划分。分片内部按SURT排序,支持主机序扫描与二分查找。
背景与挑战
背景概述
urls-sampled数据集由ks46团队于2023年创建,旨在解决大规模URL数据集的存储与采样效率问题。该数据集包含约749亿条URL,源自62个URL数据集和43次Common Crawl抓取,经过去重、轻量标准化和严格验证。其核心创新在于采用xxh3_64哈希函数将URL均匀映射到2048个分块,打破了传统SURT排序按主机分组的模式,使得每个分块成为整个语料库的无偏随机样本。这一设计解决了SURT布局在样本抽取、稳定性和并行计算方面的局限性,为大规模网页数据研究提供了灵活、可扩展的基础设施,对自然语言处理、信息检索和网络分析等领域产生了重要影响。
当前挑战
该数据集面临的挑战包括:1) 领域问题层面,传统SURT布局在样本抽取时产生偏差,分块归属依赖语料库内容导致稳定性差,且主机大小不均造成并行计算倾斜。urls-sampled通过哈希分块解决了这些问题,但付出了2.5倍存储空间的代价,因为哈希打乱了URL前缀局部性,降低了压缩效率。2) 构建过程中,实现128位乘法以避免64位溢出错误,需验证所有分块边界;跨分块去重和验证涉及数十亿行数据,需确保独立实现的一致性;此外,主机计数在分块间不可加,增加了统计分析复杂度。这些挑战促使数据集在设计上兼顾高效率与可验证性。
常用场景
经典使用场景
该数据集作为大规模URL语料库的哈希均匀采样版本,其核心用途在于为网络科学和自然语言处理研究提供无偏的、可复现的样本。基于xxh3_64哈希函数将全局URL集合划分为2048个均匀分片,每个分片都是整个语料库的1/2048随机样本,使得研究者能够在不遍历全部数据的情况下,高效地进行统计分析、语言模型预训练语料构建、以及网络内容特征提取等任务。尤其适用于需要均衡代表不同站点和域名的大规模实验,例如跨域名的URL分类、垃圾信息检测或网络图构建。
解决学术问题
该数据集解决了互联网规模研究中的两个关键学术问题:样本偏差和分区不稳定。传统的SURT分区方式按主机名排序,导致早期分片集中于字母序靠前的域名和畸形URL,样本严重偏斜;同时分片边界依赖语料分布,语料更新后跨时间的数据划分不再稳定。通过哈希分片,每个分片成为无偏的均匀样本,且URL到分片的映射是纯函数,不随语料变化而变,从而保障了跨时间实验的可比性和可复现性,对追踪网络演化、构建长期基准数据集尤为关键。
实际应用
在实际应用中,该数据集为大规模网络数据处理提供了基础设施。其分片设计支持无需全局排序或扫描的确定性抽样——例如,选取固定范围的分片即可得到任意比例的可复现样本,这极大简化了分布式训练中训练集和验证集的划分流程。此外,每个分片内部按SURT顺序排列,支持高效的主机级扫描和二分查找,便于研究者进行细粒度的网络分析。其多语种、全量URL的特性,也为内容过滤、安全监控、以及搜索引擎索引构建等工业场景提供了坚实的数据基础。
数据集最近研究
最新研究方向
该数据集采用xxh3_64哈希均匀采样技术,将海量URL语料库划分为2048个无偏样本块,突破了传统SURT排序带来的偏倚与不稳定性,为大规模网页文本生成与检索任务提供了可复现、可扩展的数据基础。其前沿研究方向聚焦于跨语料库的稳定训练/评估分割,以及基于纯函数分块的高效并行处理,有力推动了Web规模语言模型训练数据治理与分布式计算的革新。该数据集不仅支持对Common Crawl等多元来源的去重与验证,更通过哈希分片的创造性设计,为应对互联网数据的动态增长与样本偏差挑战提供了新范式,对提升模型泛化能力与公平性评估具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务