遇见数据集

umi-robots

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

umi-robots 是 umi 项目(一个开放的网络爬虫)的一部分,以 Parquet 格式发布。该数据集记录了每次对网站 robots.txt 文件的抓取结果,每行对应一次抓取,包含以下字段:host(主机名,无协议)、fetched_at_ms(Unix 毫秒时间戳)、status(HTTP 状态码,404 表示无文件,0 表示未收到响应)、body(原始文件内容,仅当状态为 2xx 时非空)、groups(User-agent 组数)、rules(适用于爬虫的规则数)、crawl_delay_ms(Crawl-delay 值,毫秒)、allows_us(是否允许根路径,1 或 0)、sitemaps(Sitemap 列表)、content_usage(AIPREF Content-Usage 值)。数据集的制作遵循 RFC 9309,爬虫标识为 umi,每行按抓取完成顺序写入。数据文件约 128 MB,每天一个文件夹。数据集许可证为 CC0。使用前需阅读并应用排除列表(位于 open-index/umi-meta 仓库)。数据集中存在少量重复行(约 0.46% 的重复),可通过按 host 分组取最新 fetched_at_ms 来处理。零状态码表示未收到响应,而非站点无 robots.txt。该数据集适用于研究网站爬虫策略、分析 robots.txt 分布、规划爬取等任务。

umi-robots is part of the umi project (an open web crawler), published in Parquet format. The dataset records the results of each crawl of a websites robots.txt file, with each row corresponding to one crawl, containing the following fields: host (hostname without protocol), fetched_at_ms (Unix timestamp in milliseconds), status (HTTP status code, 404 indicates no file, 0 indicates no response received), body (raw file content, non-empty only when status is 2xx), groups (number of User-agent groups), rules (number of rules applicable to the crawler), crawl_delay_ms (Crawl-delay value in milliseconds), allows_us (whether the root path is allowed, 1 or 0), sitemaps (list of Sitemaps), content_usage (AIPREF Content-Usage value). The dataset is built following RFC 9309, with the crawler identifier as umi, and rows are written in the order of crawl completion. Each data file is approximately 128 MB, with one folder per day. The dataset is licensed under CC0. Before use, the exclusion list (located in the open-index/umi-meta repository) must be read and applied. There is a small number of duplicate rows (about 0.46% duplicates), which can be handled by grouping by host and taking the latest fetched_at_ms. A status code of 0 indicates no response was received, not that the site lacks robots.txt. This dataset is suitable for studying web crawler strategies, analyzing robots.txt distribution, planning crawling, etc.

创建时间:
2026-09-01
原始信息汇总

umi-robots 数据集概述

基本信息

  • 许可证: CC0-1.0(公有领域贡献)
  • 所属项目: umi 开放网络爬虫项目的一部分
  • 格式: Parquet 文件,约 128 MB/文件,按天目录组织
  • 用途: 记录各个网站对爬虫的 robots.txt 响应历史

数据内容

该数据集每行对应一次 robots.txt 获取记录,包含以下字段:

字段 类型 可空 含义
host string 主机名(不含协议)
fetched_at_ms uint64 请求时间(Unix 毫秒)
status uint16 服务器响应状态码(404 表示该站点无 robots.txt;0 表示未收到任何响应)
body string robots.txt 原始内容(仅在状态码为 2xx 时非空)
groups uint32 文件中 User-agent 分组数量
rules uint32 适用于我们的分组中的规则数
crawl_delay_ms uint32 适用的 Crawl-delay 值(毫秒)
allows_us uint8 根路径是否允许 umi 爬虫(1 或 0)
sitemaps list<string> 文件中所有 Sitemap 行(按顺序)
content_usage string AIPREF Content-Usage 值(原文)

重要使用说明

  1. 必须阅读排除列表: 使用数据前,必须先查阅 open-index/umi-meta 中的排除列表并过滤相关行,这是使用数据的条件而非建议。

  2. 状态码 0 的含义: 约 40% 的行状态为 0,这表示完全未收到响应(DNS 解析失败、连接被拒绝等),不代表站点没有 robots.txt。此类行中 allows_us 为 0 是 umi 自身规则(RFC 9309 规定无法读取的 robots.txt 视为禁止),并非站点拒绝。

  3. 数据时效性: robots.txt 快照仅在 24 小时内有效(遵循 RFC 9309),每条记录反映的是获取时的状态,不能作为当前的爬取许可。

  4. 重复主机: 同一主机可能出现多次,截至 2026-09-06 统计有 26,987,785 行对应 26,863,085 个不同主机,约 0.46% 行是重复记录。建议按 fetched_at_ms 降序取每个主机最新记录。

数据创建方式

  • 由 umi 爬虫(版本 umi/0.0.1)在 RFC 9309 规范下获取
  • 行按获取完成顺序写入,fetched_at_ms 的统计信息可用于分区过滤
  • umi 项目不训练模型,不运行用户代理,不转售数据,旨在构建公开开放许可的网络索引

数据修正机制

  • 已发布文件不会被重写(保证校验和稳定性)
  • 修正通过 open-index/umi-meta 仓库中的追加排除列表实现
  • 每天目录包含清单文件及 Ed25519 签名,可用于验证文件完整性

联系方式

  • 删除请求: 发送邮件至 tamnd87@gmail.com,提供 URL 或主机名即可快速处理
  • 机器人页面: https://umi.dev/bot
搜集汇总
数据集介绍
umi-robots 数据集图片
构建方式
umi-robots数据集源于umi开放网络爬虫项目,其构建严格遵循RFC 9309规范,对每个主机的robots.txt文件进行周期性抓取,并记录抓取时间、HTTP状态码、原始文件内容及解析出的规则摘要。数据以Parquet格式存储,按日分文件夹组织,每个文件约128MB,采用追加式写入,确保历史记录完整留存。该数据集是网络爬虫政策领域罕见的公开记录,为研究网站对爬虫的授权与限制提供了宝贵的一手资料。
特点
该数据集的一大特色在于其细粒度的字段设计,不仅包含常规的抓取状态与规则统计,还特别记录了AIPREF Content-Usage声明及Crawl-delay等关键信息。尤为重要的是,其明确区分了404状态(代表无robots.txt文件)与零状态(代表无响应,可能是域名失效或连接失败),并详述了因两次抓取策略导致的约0.46%的重复记录问题及相应的剔除机制。此外,数据集的CC0许可与完善的更正流程(基于不可变文件与排除列表)确保了数据的开放性与可追溯性。
使用方法
该数据集适用于网络爬虫策略分析、网站可达性研究及合规性审查。推荐使用DuckDB直接查询远程Parquet文件,例如可按需筛选特定日期或主机的Crawl-delay与Sitemap信息。由于每行代表一次抓取快照且仅24小时有效,使用时需注意数据的时效性,建议按主机取最新记录。对于需要剔除重复或已撤回数据的场景,应参照umi-meta仓库中的排除列表与撤销记录实施过滤。
背景与挑战
背景概述
umi-robots数据集由开源网络爬虫项目umi于2025年创建,依托其公开爬取索引的附属元数据记录,系统采集全球网站的robots.txt文件内容。该数据集由tamnd领导的研究团队维护,旨在解决网络爬虫伦理与合规性研究中的核心问题:缺乏大规模、时序化的robots.txt记录,导致研究者难以理解网站对自动化代理的访问策略演变。每个条目详细记录了请求时间、HTTP状态、原始文件内容及解析后的规则摘要,为网络治理、爬虫策略优化和AI训练数据合规性分析提供了宝贵资源。作为开放许可数据,它对大规模网络测量和机器人行为研究产生了深远影响,成为构建负责任网络生态的关键数据基础设施。
当前挑战
umi-robots面临的挑战首先体现在领域问题层面:网络爬虫需遵守robots.txt协议(RFC 9309),但现有实践常忽视动态变化的访问规则,导致合规性风险。该数据集通过记录时间戳和抓取状态,揭示了协议的复杂性,如约40%的请求返回零状态,表示无法访问,且需区分域名不存在与服务器无响应的情况,为自动代理提供决策参考。在数据构建过程中,团队遭遇了同步问题:初期重复抓取率高达23.1%,后通过新增调度机制将重复率降至0.46%,并移除历史问题文件,体现了数据质量控制的艰难。此外,每个文件约128MB,日存储量大,且数据处理需手动应用排除列表进行内容删除,确保数据可追溯和可验证,这些构架上的细节共同构成了持续性的技术挑战。
常用场景
经典使用场景
umi-robots数据集作为网络爬虫治理领域的基石性资源,为探究robots.txt协议的演化轨迹提供了前所未有的时间序列数据。研究者可借助该数据集系统分析全球范围内网站对爬虫访问策略的响应模式,包括Crawl-delay的分布特征、Sitemap声明的更新频率以及Content-Usage偏好设定的演变趋势。通过挖掘不同域名排名段位的robots.txt获取状态差异,能够深入理解网络基础设施的健壮性对爬取效率的制约,进而优化爬虫调度算法,降低无效请求对源站造成的负载压力。
实际应用
在实践层面,umi-robots为商业搜索引擎与垂直领域爬虫提供了关键的情报支撑。开发者可借此批量获取目标站点的抓取延迟要求、Sitemap索引路径及内容使用授权声明,从而在爬取前进行智能路由规划,有效规避法律与道德风险。同时,它还服务于内容分发网络(CDN)的缓存策略优化、域名健康度监测服务以及数字内容版权合规管理工具的开发。任何依赖网络公开信息进行决策的智能体系统,均可利用此数据预判服务器响应行为,实现资源高效配置与访问合规性的双重保障。
衍生相关工作
围绕umi-robots数据集,学术界已衍生出一系列基于Web爬虫协议的深度测量研究。相关派生工作包括构建实时更新的robots.txt变更检测器,用以追踪网站管理员策略的瞬时变动;开发基于图神经网络的域名生存性预测模型,利用status=0样本推断域名的衰减趋势;以及设计融合Content-Usage偏好信号的智能爬虫训练环境。更为关键的是,该数据集的发布催生了关于开放爬虫伦理框架的讨论,推动形成了以exclusion list机制为代表的动态数据撤下标准,为后续大规模网络语料库的构建与维护树立了参照范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务