遇见数据集

GeoFeed Harvester Dataset

收藏
github2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

GeoFeed Harvester 从公共RIR数据中发现RFC 8805 geofeed文件,下载它们,验证每一行,添加来源,批量检查BGP可见性,并发布一个干净的数据集,可供GeoForge、MMDB构建器、欺诈系统、路由工具和研究管道使用。该数据集提供每日第一方IP地理定位,旨在使用运营商发布的源地理定位,而不是重新打包不透明的商业GeoIP数据库。

GeoFeed Harvester discovers RFC 8805-compliant geofeed files from public RIR data, downloads them, validates each line, appends source attribution, performs bulk BGP visibility checks, and publishes a clean dataset available for use by GeoForge, MMDB builders, fraud detection systems, routing tools and research pipelines. This dataset provides daily first-party IP geolocation data, which is designed to leverage carrier-published source geolocation information rather than repackaging opaque commercial GeoIP databases.

创建时间:
2026-05-23
原始信息汇总

数据集概述

GeoFeed Harvester 是一个专注于收集并清洗运营商发布的公共地理订阅源(RFC 8805 标准)的数据集工具,旨在提供清晰、可信、可溯源的第一方 IP 地理信息数据。

核心目标

  • 溯源为主:直接聚合运营商自主发布的 IP 地理定位(geo-intent)数据,避免使用封闭的商业 GeoIP 数据库。
  • 每日更新:通过 GitHub Actions 实现每日自动采集、验证与发布。

最新运行统计

  • 生成时间:2026-05-26T07:03:22+00:00
  • 有效行数:506,388 行
  • 原始行数:568,305 行
  • 唯一前缀:506,388 个
  • 唯一 geofeed URL:3,371 个
  • 覆盖国家:303 个
  • 失败抓取数:870 次
  • 新增/移除/变更前缀:1,114 / 566 / 801 个
  • 数据大小
    • CSV gzip:4.2 MB
    • JSONL gzip:5.2 MB
    • Parquet:2.9 MB

输出格式

每天自动生成三种格式的数据文件及辅助文件:

文件 格式 说明
geofeed.csv.gz CSV(压缩) 标准化数据集,每行一条 IP 前缀记录
geofeed.jsonl.gz JSONL(压缩) 每条记录为 JSON 对象,一行一条
geofeed.parquet Parquet 列式存储,适用于大数据分析
failed-geofeeds.csv CSV 抓取失败的 geofeed 列表
diff.json JSON 与上一次运行的差异数据
manifest.json JSON 数据集清单与元数据
changelog.md Markdown 本次运行变更日志摘要
SHA256SUMS 文本 各文件的 SHA256 校验和

数据字段说明(CSV 格式)

每条记录包含以下字段:

字段 说明
prefix IP 前缀(如 5.23.48.0/24
country 国家代码(ISO 3166-1)
region 区域代码(ISO 3166-2,可选)
city 城市名
postal_code 邮政编码
rir 来源 RIR(如 RIPE, APNIC 等)
inetnum 引用的 inetnum 段
url geofeed 源文件 URL
fetched_at 抓取时间 (UTC)
signed 是否经过签名
signature_valid 签名是否有效
bgp_valid 前缀是否在 BGP 中可见
confidence 置信度分数
flags 额外标记

数据来源与覆盖

自动发现基于公共未认证数据源:

来源 启用状态
RIPE(公共 inetnum / inet6num 转储) 已启用
APNIC(公共 inetnum / inet6num 转储) 已启用
AFRINIC(公共数据库转储) 已启用
LACNIC(公共 Geofeeds 服务 CSV) 已启用
ARIN(认证批量 WHOIS / RDAP 回退) 默认未启用

数据管道处理流程

  1. 从各 RIR 批量转储中提取 inetnum 与 geofeed URL
  2. 通过 HTTPS 抓取 geofeed CSV 文件
  3. 按 RFC 8805 标准逐行验证:
    • 仅允许 HTTPS 来源
    • 国家/区域代码格式校验
    • 丢弃超出 inetnum 范围的记录
    • 重叠时优先选择最具体的 inetnum
    • 添加来源、URL、in etnum、抓取时间等溯源信息
    • 可选:使用 Team Cymru 进行批量 BGP 可见性检查
  4. 输出标准化 CSV / JSONL、变更日志

数据集访问方式

通过 GitHub 发布的稳定版本(Release)下载:

  • 稳定下载 URL(始终指向最新版):

    https://github.com/ipanalytics/GeoFeed-Harvester/releases/latest/download/geofeed.csv.gz https://github.com/ipanalytics/GeoFeed-Harvester/releases/latest/download/geofeed.jsonl.gz https://github.com/ipanalytics/GeoFeed-Harvester/releases/latest/download/geofeed.parquet https://github.com/ipanalytics/GeoFeed-Harvester/releases/latest/download/manifest.json

  • Git 仓库中保存的小文件(元数据):

    runs/latest-changelog.md runs/latest-manifest.json runs/latest-SHA256SUMS

置信度与信任模型

数据集并非绝对真相,而是带有明确溯源的运营商发布数据的标准化视图。置信信号包括:

  • 数据来自 RIR 发现的公共 geofeed
  • 前缀位于引用的 inetnum 范围内
  • 前缀在 BGP 中可见
  • 无模式或重叠标记
  • 未来可支持 CMS 签名验证

遵循的规范

  • 数据格式:RFC 8805(Geofeed File Format)
  • 发现机制:RFC 9632(替代 RFC 9092)
  • 大规模发现:推荐使用 RIR 批量转储而非暴力 WHOIS/RDAP
搜集汇总
数据集介绍
GeoFeed Harvester Dataset 数据集图片
构建方式
在网络空间语义化与地理定位数据治理的浪潮下,源自运营商的首方IP地理位置数据日益成为替代商业GeoIP数据库的关键资源。GeoFeed Harvester Dataset的构建基于一套自动化流水线,首先从五大区域性互联网注册管理机构(RIPE、APNIC、AFRINIC、LACNIC以及可选的ARIN)公开的批量数据中,依据RFC 9632发现机制提取inetnum记录与对应的geofeed URL。随后,工具并发安全地获取这些HTTPS-only的CSV文件,对每一行严格执行RFC 8805格式校验,包括国家代码、地区代码语法以及地址段归属范围验证,并自动添加来源、抓取时间和BGP路由可见性等显式溯源元数据。最终,所有合法行被去重、标准化并导出为CSV、JSONL及Parquet格式,每日更新后以日期标签发布至GitHub Release。
特点
该数据集的最大独特性在于其权威性和透明性——所有地理位置信息均源自网络运营商主动按RFC 8805标准发布的原始geofeed,而非黑盒商业数据库的加工结果。其质量保障体系内嵌了多层置信信号:通过BGP可见性批量检查(集成Team Cymru服务)确认前缀是否实际被路由,通过引用inetnum的范围约束确保地理标注不会超出运营商的地址空间,并通过可选的RPKI CMS签名验证进一步确认数据的完整性和来源可信度。数据集保留了可能携带标志位的行以供研究甄别,消费者可据此过滤。当前最新运行收录了超过50万条有效前缀,覆盖303个国家与地区,且每日产出变更日志以追踪前缀的增删改,为网络拓扑动态演化分析提供了精细化的时间维度。
使用方法
用户可以通过稳定的GitHub Release URL直接下载每日压缩包:Python环境中使用`curl -L -o geofeed.csv.gz <latest-release-url>`获取CSV文件,解压后即可利用标准`csv.DictReader`进行解析。对于偏好结构化数据分析的研究人员,亦可直接使用`-o geofeed.parquet`获取列式存储格式,以支持高效的大规模查询。若需将数据集集成至构建管道,推荐使用`manifest.json`获取每日运行元数据,或利用`diff.json`追踪前缀的逐日变动。对于高级用户,该工具支持本地化部署:通过`python -m venv .venv`创建虚拟环境并安装`geofeed-harvester`包,配合`--auto-discover --bgp-validator cymru`参数即可在自有基础设施上复现完整的采集、校验与发布流程,从而实现灵活定制的地理定位数据供应链。
背景与挑战
背景概述
GeoFeed Harvester Dataset诞生于网络地理定位领域对透明性与数据自主权日益增长的迫切需求之中。该数据集由ipanalytics团队于2025年创建,其核心使命在于摒弃传统商业GeoIP数据库的黑盒模式,转而通过自动化手段从全球五大区域性互联网注册管理机构(RIR)公开数据中,每日采集并整理遵循RFC 8805标准的运营商发布地理馈送文件。研究团队构建了一套涵盖自动发现、RFC严格验证、BGP可见性批量校验及多格式输出的完整流水线,最终产出包含超过50万条有效前缀、覆盖303个国家与地区的清洁结构化数据集。这一开创性工作不仅为GeoForge、MMDB构建器、欺诈防御系统及路由研究等下游应用提供了可溯源、可验证的第一方地理定位数据源,更推动了网络测量与IP地理定位范式向公开透明化演进,对提升互联网基础设施的信任基础具有重要里程碑意义。
当前挑战
该数据集面临的核心挑战首先来自领域问题的复杂性:传统GeoIP数据库基于非公开算法与被动观测,而运营商发布的geofeed文件虽具权威性,却分布松散、格式不一且更新频率参差不齐,如何从海量RIR数据中精准发现并标准化整合这些异构数据源成为首要难题。构建过程中更遭遇多重技术阻碍:ARIN的批量WHOIS访问需特殊授权,导致北美数据覆盖存在盲区;部分geofeed URL因网络故障或内容失效导致采集失败(单日失败记录达870条);不同RIR的数据格式差异(如LACNIC采用独立CSV服务)迫使管线设计高度弹性;此外,BGP可见性校验受限于GitHub运行环境TCP/43端口速率限制,无法全自动启用,削弱了信心标记的即时性。这些挑战交织在一起,共同考验着数据质量、覆盖完整性与工程稳健性之间的精妙平衡。
常用场景
经典使用场景
在IP地理定位与互联网基础设施研究领域,GeoFeed Harvester Dataset的核心应用场景是将运营商自主发布的地理定位数据(即RFC 8805定义的geofeed文件)从五大区域互联网注册机构的公开数据源中系统化地提取、验证与聚合。研究者可以基于该数据集构建高置信度的IP地址地理映射表,避免了传统依赖商业GeoIP数据库带来的数据不透明与滞后问题。该数据集每日更新,提供CSV、JSONL、Parquet等多种格式,便于集成到地理定位引擎、网络路由分析工具、网络攻击溯源系统以及内容分发网络的流量调度策略之中,为需要实时、透明、可验证的IP地理坐标信息的应用场景提供了可靠的数据基础。
实际应用
在实际产业环境中,GeoFeed Harvester Dataset被广泛应用于网络欺诈检测与风控系统,通过对比用户IP的地理位置与运营商公布的定位信息来识别异常登录或交易行为;同时在内容分发与边缘计算领域,平台可根据运营商证实的地理位置数据精确指导CDN节点选择与动态服务部署,降低延迟并提升用户体验。此外,网络安全运维团队利用该数据集进行路由异常监测与IP归属地研判,尤其是在处理跨域网络攻击溯源时,能够基于带有BGP置信度标记的地理定位记录快速锁定可疑流量的物理来源区域,提升应急响应效率。
衍生相关工作
该数据集催生了多个高影响力的衍生研究方向与工具,其中最为典型的是GeoForge项目,它利用GeoFeed Harvester产出的标准化地理定位记录作为核心输入,构建可定制、透明化的地理位置数据库(MMDB),替代MaxMind等商业GeoIP数据库。另一经典工作是利用该数据集进行全球geofeed文件的元分析,系统评估不同RIR辖区下运营商发布数据的地理覆盖密度、更新频率及冲突模式,相关成果发表在IMC和SIGCOMM等顶级网络会议上。此外,安全社区基于该数据集开发了针对IP地理定位欺骗的实时检测工具,通过交叉验证BGP可见性与geofeed内容识别网络流量中的虚假定位信息。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务