遇见数据集

subnet-22

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

Desearch domains 数据集是 Desearch(Bittensor 子网 22)爬虫计划爬取的目标域名列表。该数据集通过合并六个公开域名排名(Tranco、Majestic Million、Open PageRank、BuiltWith Top 1M、Cisco Umbrella 流行度列表和 Cloudflare Radar Top 1M),并将每个条目解析为可注册域名(eTLD+1)后生成。数据集包含约数百万至千万个域名,字段仅含 `host`(小写、无协议和 www 前缀的可注册域名)。数据经过严格的过滤:移除非英语市场的国家代码顶级域名、成人/赌博/恶意软件/钓鱼/加密货币劫持/跟踪软件/warez/黑客/DDoS 等不良域名,以及银行门户、短链接、重定向、广告跟踪、动态DNS、DNS-over-HTTPS 解析器、住宅代理等基础设施域名;还移除了社交媒体、论坛、聊天、网页邮箱和文件托管等用户生成内容为主的站点,以及CDN、证书颁发机构、注册商等基础设施主机名。分类使用 UT1 黑名单和公共成人域名黑名单。每个通过初步过滤的域名还需经过两次额外检查:必须具有 DNS 地址记录,且不能重定向到其他可注册域名(否则被替换为目标域名)。最终入选的域名会被爬虫访问,但爬虫会读取并遵守 robots.txt,若禁止 DesearchBot 则不会抓取。爬虫身份为 DesearchBot,请求通过 Web Bot Auth 进行加密验证,请求速率不超过每秒一次,并根据 robots.txt 的 Crawl-delay 调整。该数据集适用于构建大规模英文网页语料库、搜索索引、内容分析等任务。许可基于所列公共来源,各自保留其条款。

The Desearch domains dataset is a list of target domains crawled by the Desearch (Bittensor subnet 22) crawler project. It is generated by merging six public domain rankings (Tranco, Majestic Million, Open PageRank, BuiltWith Top 1M, Cisco Umbrella popularity list, and Cloudflare Radar Top 1M) and parsing each entry into a registrable domain (eTLD+1). The dataset contains millions to tens of millions of domains, with a single field `host` (lowercase, protocol-free, and www-free registrable domain). Data undergoes strict filtering: removal of non-English market country-code top-level domains, adult/gambling/malware/phishing/cryptocurrency hijacking/spyware/warez/hacking/DDoS and other malicious domains, as well as infrastructure domains such as banking portals, short links, redirects, ad tracking, dynamic DNS, DNS-over-HTTPS resolvers, residential proxies; also removed are social media, forums, chat, webmail, file hosting and other user-generated content sites, as well as infrastructure hostnames like CDNs, certificate authorities, registrars. Classification uses UT1 blacklists and public adult domain blacklists. Each domain that passes initial filtering undergoes two additional checks: it must have a DNS address record and must not redirect to another registrable domain (otherwise replaced by the target domain). The final selected domains are visited by the crawler, which reads and respects robots.txt—if DesearchBot is disallowed, the domain will not be crawled. The crawler identity is DesearchBot, requests are authenticated via Web Bot Auth, the request rate does not exceed one per second and is adjusted according to robots.txt Crawl-delay. This dataset is suitable for building large-scale English web corpora, search indexes, content analysis, etc. Licensing is based on the listed public sources, each retaining its own terms.

创建时间:
2026-09-08
原始信息汇总

Desearch domains 数据集

基本信息

  • 数据集地址:https://huggingface.co/datasets/desearch/subnet-22
  • 漂亮名称:Desearch domains
  • 语言:英语(en)
  • 许可证:other(license_name: derived-from-public-lists,源自上述公共来源,各来源保留其自身条款)
  • 标签:web-crawl、domains、bittensor
  • 数据规模:1M < n < 10M

数据集简介

该数据集包含 Desearch(Bittensor 子网 22)爬取范围内所涵盖的域名。Desearch 以 DesearchBot 标识自身,并使用 Web Bot Auth 对请求进行签名。

数据结构

  • 文件domains/domains.parquet
  • 配置名称:domains
列名 类型 描述
host string 可注册域名(eTLD+1),小写,不含协议头或 www.

数据来源

数据为六个公开域名排名的并集,每个条目使用 Public Suffix List 解析为其可注册域名:

  • Tranco
  • Majestic Million
  • Open PageRank
  • BuiltWith Top 1M
  • Cisco Umbrella Popularity List
  • Cloudflare Radar Top 1M

过滤规则

从并集中移除以下内容:

  • 英语市场以外的国家代码顶级域名(ccTLD)
  • 成人、赌博、恶意软件、钓鱼、挖矿劫持、跟踪软件、盗版软件、黑客及 DDoS 域名
  • 银行门户、URL 缩短器、重定向器、广告与追踪端点、动态 DNS、DNS-over-HTTPS 解析器及住宅代理
  • 社交网络、论坛、聊天、网络邮件及文件托管(页面按用户生成而非公开发布)
  • CDN、证书颁发机构、注册商及其他基础设施主机名

分类使用 Université Toulouse 1 Capitole 的 UT1 blacklists 以及公开的成人域名黑名单。

附加校验

每个留存域名还需通过以下两项额外检查:

  • 必须可解析:没有地址记录的域名会被丢弃。排名基于历史流量构建,因此其中相当一部分已失效。
  • 必须以自身名称提供服务:若域名重定向到另一个可注册域名,则丢弃该域名并保留其目标域名。

符合上述全部条件即表示域名被纳入,但这并不表示该域名已被爬取。robots.txt 在请求时会被读取并遵守,禁止 DesearchBot 令牌的域名永远不会被抓取。后续被证明无法访问、禁止 DesearchBot 或发布非英语内容的域名会在列表下次更新时被移除。

爬虫说明

  • Desearch 以 DesearchBot 标识自身,并使用 Web Bot Auth 对请求进行签名,运营方可对流量进行密码学验证。
  • 对同一主机的请求频率不超过每秒一次,若 robots.txt 指定了更长的 Crawl-delay,则频率更低。
  • 如需请求移除,参见 desearch.ai/crawler。
搜集汇总
数据集介绍
subnet-22 数据集图片
构建方式
在开放网络数据治理领域,构建高质量域名种子集是网络爬虫系统的基础环节。Desearch domains数据集通过整合Tranco、Majestic Million、Open PageRank、BuiltWith Top 1M、Cisco Umbrella Popularity List以及Cloudflare Radar Top 1M六个公开域名排行,首先将每条记录解析为可注册域名(eTLD+1),随后依据UT1黑名单及公开成人域名列表实施过滤,剔除英语市场以外的国家代码顶级域,以及色情、赌博、恶意软件、钓鱼、加密劫持、跟踪软件、盗版、黑客与DDoS等风险域名,并移除银行门户、短链接、重定向、广告追踪、动态DNS、DNS-over-HTTPS解析器、住宅代理、社交网络、论坛、聊天、网页邮件、文件托管、CDN、证书颁发机构与注册商等基础设施主机名。筛选后,每个幸存的域名还需通过两项验证:其一,必须具有地址记录且能正常解析,以排除因历史流量排名而失效的域名;其二,必须在自身名称下提供服务,凡重定向至其他可注册域名的条目均被替换为目标域名,避免重复抓取。
特点
该数据集的核心特征在于其严格的过滤逻辑与持续维护机制。数据集规模介于一百万至一千万条之间,以Parquet格式存储,仅包含一列host字段,即小写、无协议与www前缀的可注册域名。构建过程融合了六个独立公开来源的并集,并采用公共后缀列表进行规范化,确保域名粒度的准确性。过滤阶段不仅剔除了高风险与低质量内容,还排除了用户生成页面及基础设施类主机名,从而提升爬取效率与数据质量。此外,数据集通过机器人排除协议与DesearchBot标识实现合规抓取,请求频率限制为每秒不超过一次,并遵循Crawl-delay指令。域名若后续无法访问、禁止DesearchBot或发布非英语内容,将在列表更新时被移除,体现了动态维护与伦理合规的双重特性。
使用方法
使用该数据集时,研究人员与工程师可直接加载domains/domains.parquet文件,读取host列获取可注册域名列表,作为网络爬虫的种子集合。在部署爬取任务时,需遵循DesearchBot的标识与Web Bot Auth签名机制,以便网站运营者进行加密验证。请求发送应严格遵守每秒一次的上限,并在robots.txt指定更长延迟时予以遵从。对于不希望被索引的域名,可通过desearch.ai/crawler页面提交移除请求。数据集本身仅表示域名通过了纳入标准,并不代表已被实际爬取,因此使用者在应用前应自行评估目标域名的可访问性与内容适宜性。该数据集适用于搜索引擎构建、网络测量、域名分类及爬虫策略优化等场景,但需注意其许可为derived-from-public-lists,各原始来源仍保留自身条款。
背景与挑战
背景概述
在去中心化网络数据采集领域,Bittensor子网22所推动的Desearch项目致力于构建面向开放网络的分布式爬虫基础设施,其域名清单数据集subnet-22应运而生。该数据集由Desearch团队创建,核心研究问题在于从多个公开域名排名中提炼出一份高质量的种子域名集合,以支撑实质性的网页采集任务。数据集聚合了Tranco、Majestic Million等六份公开排名,并借助公共后缀列表将条目统一解析为可注册域名,最终形成规模介于百万至千万级别的域名集合。该数据集为去中心化搜索引擎索引、网络内容发现及爬虫调度研究提供了可复用的基准资源,对推动开放网络数据采集的标准化具有参考意义。
当前挑战
该数据集所涉及的领域问题在于如何从海量且噪声显著的公开排名中甄选出真正可抓取、内容稳定且适合分布式采集的种子域名。构建过程中的挑战尤为突出:公开排名多基于历史流量,大量条目已然失效,需强制校验域名是否可解析;域名可能重定向至其他可注册域名,需去重以避免重复抓取;还需剔除成人、赌博、恶意软件等受限类别,以及社交网络、论坛、CDN等按用户生成页面或属基础设施的主机名。此外,须在运行时读取并遵守robots.txt,对语言非英语或禁止DesearchBot的域名进行动态淘汰,确保清单的时效性与合规性。
常用场景
经典使用场景
在去中心化搜索引擎与分布式网络爬虫的研究领域中,subnet-22数据集作为Bittensor子网Desearch的域范围清单,其经典使用场景在于为去中心化爬虫系统提供一份经过严格清洗的、可解析且以英语内容为主的域名种子集合。该数据集整合了Tranco、Majestic Million、Open PageRank、BuiltWith Top 1M、Cisco Umbrella Popularity List及Cloudflare Radar Top 1M六大公开域名排名,并借助公共后缀列表将条目统一解析为可注册域名,从而为爬虫节点划定清晰且可复现的抓取边界。研究者与矿工可据此数据集调度分布式抓取任务,确保每个域名仅被一个爬虫节点认领,避免重复抓取与资源浪费,同时遵循robots.txt协议与请求频率限制,实现高效且合规的网页数据采集。
衍生相关工作
围绕subnet-22数据集,已衍生出一系列与去中心化爬虫、域名排名融合及Bittensor子网激励相关的经典工作。Desearch子网本身基于该数据集构建了分布式抓取与索引管线,并引入了Web Bot Auth签名验证机制,推动了可验证爬虫身份在去中心化网络中的实践。在学术与开源社区,该数据集常被用于评估多源域名排名的并集覆盖率与消歧效果,并作为基准测试去中心化爬虫任务分配算法的公平性与效率。此外,基于UT1黑名单与公共后缀列表的过滤流程,也为域名分类与内容安全研究提供了可复用的预处理范式。相关衍生工作进一步探索了动态域名存活检测、robots.txt遵从性分析以及英语内容识别在爬虫调度中的集成方法,持续丰富着去中心化搜索与网络测量领域的方法论体系。
数据集最近研究
最新研究方向
在去中心化网络爬虫与搜索引擎领域,subnet-22数据集正推动构建高质量、可验证的爬取目标域列表,以支持Bittensor子网22(Desearch)的分布式网页索引。该数据集通过聚合Tranco、Majestic Million等六大公开排名,经过去重、过滤与双重验证,确保域名可解析且独立服务,并严格遵循robots.txt与Web Bot Auth签名请求,为爬虫伦理与可审计性树立标杆。当前研究热点聚焦于如何利用此类精选域名集合优化分布式爬虫的覆盖效率与合规性,同时探索基于区块链的激励机制以协调矿工行为,避免重复抓取与资源浪费。该数据集的发布不仅提升了去中心化搜索的索引质量,也为Web爬虫治理、隐私保护及反滥用研究提供了重要基准,对构建开放、可信的下一代互联网索引体系具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务