遇见数据集

ai-crawler-index

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

该数据集名为“AI Crawler Index”,是一个独立、非商业的自动化项目,旨在整理网络爬虫和AI用户代理的信息。它记录了来自74个运营商的150个网络爬虫和AI用户代理,包括每个爬虫的身份、robots.txt标记、用户代理子串、是否遵守robots.txt、验证方法、用途描述以及阻止它的成本。此外,数据集还包含从15个运营商发布的IP范围文件中收集的3049个前缀(1987个IPv4和1062个IPv6),以及编译的用户代理正则表达式。数据集中每个爬虫都按类别划分,包括AI训练、AI搜索、用户触发获取、语料库/数据集构建、搜索引擎、SEO/反向链接、存档、链接预览、工具/框架等。所有信息均可追溯至运营商发布的文档,且数据集采用CC0-1.0许可,无需署名。数据集以CSV和JSON格式提供,并可通过Hugging Face Datasets库加载,包含crawlers、ip_ranges和ua_patterns三个配置。

The dataset named "AI Crawler Index" is an independent, non-commercial automated project aimed at organizing information about web crawlers and AI user agents. It records 150 web crawlers and AI user agents from 74 operators, including each crawlers identity, robots.txt tag, user agent substring, compliance with robots.txt, verification method, purpose description, and cost of blocking it. Additionally, the dataset contains 3049 prefixes (1987 IPv4 and 1062 IPv6) collected from IP range files published by 15 operators, along with compiled user agent regular expressions. Each crawler in the dataset is categorized into types including AI training, AI search, user-triggered fetching, corpus/dataset construction, search engines, SEO/backlinks, archiving, link previews, tools/frameworks, etc. All information is traceable to operator-published documents, and the dataset is licensed under CC0-1.0, requiring no attribution. The dataset is available in CSV and JSON formats and can be loaded via the Hugging Face Datasets library, containing three configurations: crawlers, ip_ranges, and ua_patterns.

创建时间:
2026-09-01
原始信息汇总

AI Crawler Index 数据集概述

数据来源

来源地址:https://huggingface.co/datasets/pathwren/ai-crawler-index
许可证:CC0-1.0(公有领域奉献)
语言:英语
标签:网络爬虫、AI代理、robots.txt、机器人检测、IP范围、时间序列

核心内容

该数据集收录了 来自74家运营商的150个网络爬虫和AI用户代理,每条记录包含:该爬虫的用途、阻止其访问的代价、运营商公布的IP范围,以及编译好的用户代理正则表达式。数据集还汇总了15个运营商公布的1987个IPv4和1062个IPv6前缀。

数据规模

  • 样本量:1K-10K
  • 标注方式:机器生成
  • 数据来源:原始数据

数据集配置

配置名称 数据文件 说明
crawlers crawlers.csv 150条爬虫记录(当前快照)
ip_ranges ip_ranges.csv 3049条IP前缀记录(含来源)
ua_patterns ua_patterns.csv 150条匹配表记录
crawlers_history snapshots/crawlers-*.csv 每日快照(历史时间序列)
daily_totals history/daily_totals.csv 每日统计汇总(目前1天)

爬虫分类

  • AI训练爬虫:批量采集页面用于模型训练
  • AI搜索爬虫:构建检索索引供AI助手引用,此类爬虫可带来流量
  • 用户触发抓取:因用户实时请求而抓取单个页面
  • 语料与数据集构建者:将网页爬取为数据集供他人训练
  • 搜索引擎:传统索引排序爬虫
  • SEO与反向链接爬虫:商业链接图谱工具
  • 存档爬虫:永久性公共存档
  • 链接预览抓取:读取Open Graph标签
  • 工具与框架:可执行爬虫软件,非运营商

文件构成

  • agents.json:嵌套完整记录(含分类描述和逐爬虫说明)
  • ua-regex.json:编译好的不区分大小写正则(all、ai_only、每个分类一个)
  • ip-ranges-all.json:完整IP前缀联合(含运营商URL与抓取时间)
  • provenance.json:完整来源库(含URL与抓取时间)
  • live_api.py:约40行加载器代码

更新与维护

  • 快照约每6小时刷新一次
  • 自2026-09-05起每个UTC日生成独立快照文件且永不被覆盖
  • 数据随时间逐日增长,不删除任何记录(当前仅1天)

数据特性说明

  • 用户代理匹配是“声明而非证明”——verification_method列列明运营商支持的范围(IP范围/反向DNS/无验证)
  • respects_robots_txt字段反映的是“运营商文档所描述”,并非实际测量
  • 每条记录的last_reviewed表示最近从来源重建的时间,并非人工审计日期
  • provenance.json详细记载所有事实的可追溯来源(运营商文档URL和IP源URL)
搜集汇总
数据集介绍
ai-crawler-index 数据集图片
构建方式
在瞬息万变的网络生态中,识别与治理AI爬虫已成为网站运营者面临的迫切挑战。本数据集以自动化流水线为基础,独立且非商业性地整合了74家运营商旗下150个网络爬虫及AI用户代理的详尽档案。其构建过程严谨而透明,每一事实均溯源自运营商公开发布文档,通过周期约六小时的快照机制持续更新,并保留每日历史版本,形成可追溯的时间序列。数据涵盖身份标识、robots.txt令牌、用户代理子串、验证方法及IP前缀范围,所有信息均以机器可读格式存储,确保来源可靠且无外部聚合数据之嫌。
特点
该数据集的核心特质在于其综合性与实用导向性。它不仅提供每个爬虫的静态描述,还独创性地评估了拦截各爬虫的潜在代价,以分类方式(如AI训练、AI搜索、用户触发抓取等九大类别)清晰划分不同爬虫的功能意图与影响级别。尤为突出的是,数据集整合了来自15个运营商发布文件的3049个IP前缀(IPv4与IPv6),并编译了用户代理正则表达式,方便用户直接匹配。加之每日快照的历史档案,使得分析爬虫群体演变趋势成为可能,同时每个记录附有的验证方法和来源URL,保障了信息的可核查性。
使用方法
在应用层面,本数据集提供了灵活多样的接入途径。用户可直接获取快照文件,亦可利用随附的极简加载器连接实时API,获取最新数据并避免快照延迟。通过HuggingFace的datasets库,可轻松加载不同配置的数据子集,如爬虫主表、IP范围表或历史序列,从而支持从单一查询到趋势跟踪的多元需求。代码示例展示了如何快速遍历爬虫信息,而每日历史文件则为研究爬虫出现与IP发布的时间动态提供了坚实基础。该数据集致力于成为网站运维者与AI研究者不可或缺的参考工具,以数据驱动的方式明智应对爬虫管理决策。
背景与挑战
背景概述
随着人工智能技术的迅猛发展,网络爬虫已成为数据采集与模型训练的关键基础设施。然而,其身份识别与访问控制问题日益凸显,对网站运营者、内容提供商及研究机构构成严峻挑战。在此背景下,一个自动化项目于2026年创建了该数据集,其核心研究问题在于系统化梳理不同AI爬虫的用途、运营方及其对网站的影响。数据集由独立非商业的自动化系统维护,汇集了来自74个运营方的150种网络爬虫及AI用户代理信息,并整合了运营方公布的IP范围及robots.txt规则。该数据集填补了该领域系统化信息的空白,为网站管理者提供了明晰的决策依据,亦为学术研究及行业规范制定提供了宝贵的数据资源,对促进网络生态的健康发展具有重要影响力。
当前挑战
该领域面临的首要挑战在于爬虫识别的模糊性——用户代理字符串可被任意伪造,单纯的字符串匹配仅能作为线索而非确证,凸显了开发可靠验证机制(如IP逆向DNS查询)的紧迫性。构建过程中,数据收集的碎片化问题尤为突出,相关信息分散于数十个不同的文档页面,需逐一核实并整合,以确保数据的准确性与时效性。此外,数据集需应对运营方政策动态变化的挑战,并处理不同来源数据在格式与口径上的不统一性。最终,如何在确保全面覆盖的同时,维持数据的可维护性与可追溯性,构成了该数据集持续演进中必须攻克的关键难题。
常用场景
经典使用场景
AI Crawler Index数据集为网络爬虫与人工智能代理研究提供了系统化的知识图谱,其核心使用场景涵盖爬虫身份识别、行为分类及影响评估。研究者可借助该数据集构建爬虫检测模型,通过用户代理字符串、IP前缀及robots.txt令牌等特征精准区分不同运营者的爬虫,进而分析各类爬虫的抓取意图与潜在成本。该数据集特别适用于网络治理研究,帮助理解训练爬虫、搜索爬虫及用户触发抓取之间的差异化行为模式,并为制定精细化的访问控制策略奠定数据基础。
衍生相关工作
该数据集衍生出了一系列围绕爬虫识别与治理的经典工作,包括构建跨运营者的用户代理匹配库、开发动态的robots.txt解析工具,以及创建爬虫行为分析的时间序列基准。相关研究进一步探索了IP范围文件获取的自动化流程,并在此基础上提出了运营商级爬虫溯源模型。其开源且持续更新的特性,催生了网络测量领域的数据可视化平台与异常检测系统,强化了对网络流量中机器行为演变轨迹的追踪能力。此外,该数据集推动了关于AI伦理的讨论,作为实证资源被引用于分析不同AI训练爬虫对原创内容生态的影响,进而支持了关于公平使用与数据版权的政策研究。
数据集最近研究
最新研究方向
该数据集聚焦于AI爬虫与网络爬虫的识别与管理,其最新研究动向在于构建动态、可追溯的爬虫行为知识图谱,以应对生成式AI对网络内容的大规模抓取。通过整合150余个爬虫的标识、运营商公开的IP段及robots.txt合规信息,研究推动了爬虫生态的透明化治理。前沿方向包括利用时序快照追踪爬虫演化、开发基于用户代理正则的实时检测工具,以及评估封锁不同类别爬虫(如AI训练、AI搜索)对网站流量与模型训练的经济影响。此工作为网站运营者、AI开发者及政策制定者提供了数据驱动的决策依据,促进了网络资源分配与AI伦理治理的平衡。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务