遇见数据集

GeoPathfinder

收藏
Hugging Face2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

GeoPathfinder是一个基于真实卫星影像的长距离空间推理基准测试数据集,灵感来源于Pathfinder任务。它旨在评估模型在真实地理环境中进行复杂空间关系判断的能力。数据样本为256×256像素的Landsat卫星影像补丁,对应地面约7.7×7.7公里范围,补丁上标有两个红点。核心任务是二分类:预测这两个点是否通过陆地相连(connect = 1)或被水体隔开(disconnect = 0)。标签来源于Overture Maps的水体多边形数据,并经过栅格化和交叉验证。数据集包含5,553个中心点互不重叠的影像补丁,覆盖全球六大洲的42个河流流域,通过生成连接和断开样本,最终得到10,546张图像,实现了精确的类别平衡。点放置采用对抗性策略,从候选位置中选出最具迷惑性的位置,以防止模型通过简单视线捷径解决问题。数据集提供固定划分和基于流域不相交的划分协议,以及简单/中等/困难点放置变体套件,用于评估泛化性能。文件包括带红点的基准测试图像、原始真彩色图像、GeoTIFF文件、掩码、叠加图像、元数据文件和水体多边形数据等。适用于图像分类任务,特别是遥感、地球观测领域的长距离空间推理基准测试。

GeoPathfinder is a long-range spatial reasoning benchmark dataset based on real satellite imagery, inspired by the Pathfinder task. It aims to evaluate models ability to make complex spatial relationship judgments in real-world geographic environments. Each data sample is a 256×256 pixel Landsat satellite image patch (native 30-meter resolution, corresponding to approximately 7.7×7.7 km on the ground) with two red points marked on it. The core task is binary classification: predicting whether the two points are connected by land (connect = 1) or separated by water bodies (disconnect = 0). Labels are derived from Overture Maps water polygon data, which is rasterized onto the exact pixel grid of each image patch and cross-validated with Landsats own QA water flags. The dataset consists of 5,553 image patches with non-overlapping centers (spaced more than one patch width apart), covering 42 river basins across six continents globally. Among these, 5,273 patches constitute the benchmark set, generating a connected sample and a distance-matched (within 25% difference) disconnected sample per patch, resulting in 10,546 images with precise class balance to ensure point distance does not carry label information. Point placement employs an adversarial strategy: each published point pair is selected from a large pool of candidate locations (96 for train/validation sets, 256 for the test set) as the most confusing positions to prevent models from solving the task via trivial line-of-sight shortcuts. The dataset provides a fixed patch-level 80/10/10 split (paired images do not cross splits) and excludes snowy scenes and unannotable patches. Additionally, it includes a basin-disjoint split protocol (splits_basin.json) specifically for testing geographic generalization. A fixed suite of easy/medium/hard point placement variants (eval_variants/) is also provided to assess model generalization across different difficulty levels (requiring reporting accuracy per level and macro-average). Files and data formats include: 1) pathfinder/connect/ and pathfinder/disconnect/ directories containing benchmark JPEG images with red points (corresponding to labels 1 and 0); 2) images/ directory with original true-color JPEG images without red points; 3) raw/ directory with original uint16 GeoTIFF files storing surface reflectance digital numbers (DN), along with scaling/offset metadata and scene source information; 4) masks/ directory with PNG format land/water/invalid/suspected area masks; 5) overlays/ directory with JPEG images for quality checks, overlaying water masks on true-color images; 6) metadata.parquet file containing metadata for each patch, such as split, region, scene ID, bounds, coordinate reference system/transform, quality check statistics, and point pixel/lat-lon coordinates; 7) water_polygons.parquet file (GeoParquet format) containing Overture water polygon geometries clipped to each patch extent; 8) multiple JSON files defining splits, excluded snowy scene IDs, and construction configurations. It is suitable for image classification tasks, particularly as a benchmark for long-range spatial reasoning in remote sensing and Earth observation, applicable for evaluating and comparing computer vision models, geospatial foundation models, and specialized spatial relationship understanding models in real, complex geographic scenarios.

创建时间:
2026-07-04
原始信息汇总

数据集概述:GeoPathfinder

GeoPathfinder 是一个基于真实卫星影像的长距离空间推理基准数据集,旨在评估模型判断卫星图像中两个红点之间是否由陆地连接(connect = 1)或被水域分隔(disconnect = 0)的能力。

核心任务

  • 输入:256×256 像素的 Landsat 图像(30米分辨率,覆盖约7.7×7.7公里区域),图像上标记有2个红点。
  • 输出:二分类标签,表示两点之间是否为陆地连接(1)或水域阻隔(0)。

数据集规模

  • 总样本量:10K < n < 100K
  • 零重叠图像块:5,553个(分布在6大洲42个流域,图像块中心间距至少为一个图像块宽度)
  • 基准测试集:5,273个图像块 → 共10,546张图像(完全类别平衡,每个图像块生成一个“连接”和一个“断开”样本,两点间距控制在25%范围内以消除距离偏差)
  • 数据划分:固定80/10/10(训练/验证/测试)的图块级别划分;另提供流域分离的划分方案(保留4个洲的4个流域用于地理泛化测试)
  • 对抗性点放置:每个放置对选自大量候选池(训练/验证96个,测试256个),对模型具有欺骗性,随机放置可导致视线捷径

文件结构与下载

  • 主文件geopathfinder.tar.gz(下载后解压至 geopathfinder/ 文件夹)
  • 目录结构
    • pathfinder/connect/:标签为1的连接图像(JPEG)
    • pathfinder/disconnect/:标签为0的断开图像(JPEG)
    • images/:无标记点的原始真彩色图像(JPEG)
    • raw/:uint16 RGBN地表反射率GeoTIFF(ZSTD压缩)
    • masks/:水陆掩码(0=陆地,1=水域,2=无效,3=可疑)
    • overlays/:掩码与真彩色融合图像(QC用)
    • 元数据文件metadata.parquet(包含每块的划分、区域、场景ID、边界、CRS/变换、QC统计、点像素及经纬度坐标)
    • 水多边形文件water_polygons.parquet(约281k个Overture水多边形,GeoParquet格式,WGS84)
    • 其他splits.json(划分ID)、snowy_ids.json(雪景排除ID)、plan.json(构建配置快照)

数据来源与许可

  • 卫星图像:Landsat Collection 2 Level-2(美国地质调查局,公共领域)
  • 水域几何:Overture Maps base/water 数据(开放数据库许可ODbL)
  • 数据集许可:CC-BY-4.0(注释与图像合成)

快速使用示例

python import pandas as pd meta = pd.read_parquet("metadata.parquet") train = meta[meta.split == "train"]

标签:pathfinder/connect/{sample_id}.jpg (label 1)

pathfinder/disconnect/{sample_id}.jpg (label 0)

基准性能

方法 测试集准确率 放置泛化分数(Easy/Medium/Hard宏平均)
无学习的NDWI(绿/近红外) 69.9% 76.2%
OverLoCK-B(微调) 88.5±0.5% 62.4%
MaxViT-B 87.5±0.9% 63.0%
ResNet-50 85.3±0.6% 60.2%
ViT-B/16 79.3±1.0% 56.8%
ResNet-18(从头训练) 77.4±0.9% 53.6%
  • 所有模型在放置泛化分数上表现不佳(模型学会“明显答案往往是错的”),微调后Easy/Medium/Hard三档准确率分布不均,Hard档约75%。
  • 若每轮训练重新采样点放置,Macro分数可恢复至85.1±0.3(MaxViT-B),但基准仍未被完全解决。

验证与引用

  • 通过 water_polygons.parquet 在对应CRS上栅格化可精确复现掩码(IoU ≥ 0.999)。
  • 完整基准代码与训练方案:https://github.com/isaaccorley/geo-long-range-arena
  • 引用格式: bibtex @misc{corley2026geopathfinder, title = {GeoPathfinder: A Long-Range Spatial Reasoning Benchmark on Real Satellite Imagery}, author = {Corley, Isaac}, year = {2026}, url = {https://huggingface.co/datasets/isaaccorley/GeoPathfinder} }
搜集汇总
数据集介绍
GeoPathfinder 数据集图片
构建方式
GeoPathfinder数据集基于真实卫星影像构建,旨在评估模型在遥感影像中长程空间推理的能力。构建过程始于选取来自六大洲42个流域的5,553个无重叠256×256像素Landsat图像块,每块对应地面30米分辨率的7.7×7.7公里范围。标签源自Overture Maps水域多边形数据,其被精确栅格化至每个图像块的像素网格,并与Landsat自带的水体质量标志交叉验证,从而确定图像块中两个红点之间是否被陆地连接(连接为1,分离为0)。为规避随机布点带来的视线捷径问题,数据集采用了对抗性布点策略:从大量候选点对中筛选最具欺骗性的一对(训练/验证集96对,测试集256对),确保点间距在25%误差内匹配,使标签不携带距离信号。最终得到10,546张基准图像,类别完全平衡,并按80/10/10比例进行图像块级别的固定划分。
特点
该数据集的核心特点在于其对遥感长程空间推理能力的深度考量。首先,对抗性布点策略使得模型无法依赖局部视觉线索或点间距离做出判断,迫使模型整合整个场景的上下文信息以推理连通性。其次,数据集内置了多维度评估协议:不仅提供标准的测试集准确率,还包含固定难度的easy/medium/hard三档子集,用于计算placement-general score(宏平均准确率),全面反映模型在不同推理难度下的表现。此外,数据集支持流域级地理泛化测试,通过留出四个位于不同大洲的流域,检验模型在未见地理区域的迁移能力。数据配套完备,包含原始反射率GeoTIFF、真彩色影像、水掩膜和元数据表格,便于进行深入分析与模型调试。
使用方法
使用GeoPathfinder数据集时,用户可通过HuggingFace下载压缩包并解压至本地文件夹。数据集以目录结构组织,其中pathfinder/connect和pathfinder/disconnect文件夹分别存放标签为1和0的基准图像。用户可借助Pandas读取metadata.parquet元数据文件,按split列筛选训练、验证或测试集,每张图像对应一个样本ID,标签由所在文件夹隐含。对于遥感基础模型的微调,建议使用raw/目录下的GeoTIFF格式原始反射率数据,并依据metadata.parquet中记录的点坐标进行对抗性布点,以避免模型过拟合至特定点位置。评估时,需同时报告测试集准确率和三档难度子集的宏平均准确率,以全面衡量模型的长程推理与泛化能力。
背景与挑战
背景概述
GeoPathfinder是由Isaac Corley于2026年创建的一项面向真实卫星影像的Pathfinder式长程空间推理基准数据集。该数据集源自Landsat Collection 2 Level-2影像(30米分辨率,7.7×7.7公里足迹),涵盖六大洲42个流域的5,553个无重叠图块,每个256×256像素的图块上标注有两点,任务为判断两点之间是否被陆地连接。数据集由5,273个基准图块扩展为10,546幅图像,确保类别严格平衡,并采用对抗性点放置策略消除直接视线捷径。GeoPathfinder填补了遥感领域长程空间推理评测的空白,为地理空间基础模型提供了具备挑战性的多尺度定位能力测试平台,其引入的流域分离协议和难度分级评估方案推动了地理泛化研究的发展。
当前挑战
该数据集面临的核心挑战在于解决卫星遥感中长程空间推理这一难以被传统视觉模型捕捉的领域问题——模型需要跨越高达数百个像素的距离,理解水陆连通性这一复杂的空间拓扑关系,而非依赖局部纹理或颜色线索。数据构建过程中,对抗性点放置策略虽有效遏制了捷径学习,却导致模型在测试集上表现优异而在易/中/难难度分级中的宏平均准确率骤降(如OverLoCK-B从88.5%降至62.4%),揭示了主流架构无法真正理解空间关系而仅记忆表面模式的严峻问题。此外,对Landsat多时相影像与Overture Maps水体的高精度配准、雪景与不可标注区域的剔除、以及流域级别泛化测试的设计均对数据质量控制提出了极高要求。
常用场景
经典使用场景
GeoPathfinder数据集专为遥感图像中的长程空间推理任务而设计,其经典使用场景是评估模型能否在真实卫星影像上判断两点之间是否由陆地相连。每个样本为256×256像素的Landsat影像块,覆盖约7.7×7.7公里的地表范围,影像上标注两个红点,模型需输出它们之间是否存在陆地连通性。该任务跨越了42个河流流域和六大洲,提供了超过一万张平衡样本,并通过对点位的对抗性放置(从大量候选点中筛选最具迷惑性的组合)来排除随机部署下的视线捷径,从而迫使模型必须理解全局地形连通性,而非依赖局部特征。这一设计使其成为检验视觉模型在遥感领域长距离推理能力的基准标杆。
衍生相关工作
GeoPathfinder的发布催生了一系列旨在攻克长程遥感推理难题的后续工作。首先,它提供了一个标准化的对抗性评估套件(包括easy/medium/hard三级难度),激励研究者开发针对性的模型改进策略,例如通过动态点位重采样训练方案打破模型对固定模式的过拟合。其次,该数据集附带的完整构建流程(源自Overture Maps水体和Landsat QA标识的交叉验证)被社区复用于构建类似的空间推理基准,如流域间抗泛化测试协议。此外,基于其基线结果,涌现出混合架构探索(如OverLoCK-B融合局部与全局注意力)以及面向空间连接的损失函数设计,这些工作共同推动了将遥感领域知识(如地理拓扑约束)融入深度学习范式的理论发展。
数据集最近研究
最新研究方向
当前遥感智能领域正从简单的像素级分类迈向复杂的空间推理任务,GeoPathfinder数据集的问世标志着对远距离空间关联性评估的范式突破。该基准聚焦于真实卫星影像中两点是否被陆地连接这一长程推理问题,通过对抗性点放置策略剔除随机采样中的视线捷径,迫使模型学习真实的地貌连通性。研究发现,主流视觉架构在标准测试集上虽能取得较高准确率,但在难度分级的宏观评估中性能骤降,暴露了当前模型依赖局部纹理而非全局拓扑的局限。这一工作不仅为地理空间基础模型提供了高难度的能力试金石,更揭示了水陆交错带等复杂场景中长程推理的未解挑战,推动遥感解译向具有地理常识的认知智能演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务