GEOBench-VLM
收藏资源简介:
GEOBench-VLM是一个专门设计用于评估视觉-语言模型在地理空间任务中的基准数据集。该数据集包括超过10,000个问题,涵盖了地球观测中的多种任务,如时间理解、参考分割、视觉定位、场景理解、计数、详细图像描述和关系推理。每个任务都旨在捕捉独特的领域特定挑战,涉及不同的视觉条件和对象尺度,适用于灾害评估、城市规划和环境监测等应用。
GEOBench-VLM is a benchmark dataset specifically designed for evaluating vision-language models (VLMs) in geospatial tasks. This dataset contains over 10,000 questions covering multiple Earth observation tasks, including temporal understanding, referring segmentation, visual grounding, scene understanding, counting, detailed image captioning, and relational reasoning. Each task is intended to capture distinct domain-specific challenges, involving varied visual conditions and object scales, and is applicable to applications such as disaster assessment, urban planning, and environmental monitoring.
GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
💡 概述
GEOBench-VLM 是一个专门用于评估视觉语言模型(VLM)在地理空间任务上的基准测试。该基准测试包含超过10,000个问题,涵盖了地球观测任务中的多种任务,如时间理解、指代分割、视觉定位、场景理解、计数、详细图像描述和关系推理。每个任务都旨在捕捉独特的领域特定挑战,涉及不同的视觉条件和对象尺度,适用于灾害评估、城市规划和环境监测等应用。
🏆 贡献
- GEOBench-VLM 基准测试:引入了一个专门用于评估 VLM 在地理空间任务上的基准测试套件,涵盖8个主要类别和31个子任务,包含超过10,000个手动验证的问题。
- VLM 评估:详细评估了十个最先进的 VLM,包括通用(开源和闭源)和任务特定的地理空间 VLM,突出了它们在处理地理空间任务方面的能力和局限性。
- 地理空间任务性能分析:分析了 VLM 在多种任务中的表现,包括场景分类、计数、变化检测、关系预测、视觉定位、图像描述、分割、灾害检测和时间分析,提供了改进 VLM 以用于地理空间应用的关键见解。
🗂️ 基准测试比较
提供了通用和地理空间特定数据集与基准测试的概述,详细说明了模态、数据源、答案类型和注释类型。
🔍 数据集注释流程
注释流程整合了多样化的数据集、自动化工具和手动注释。任务如场景理解、对象分类和非光学分析基于分类数据集,而 GPT-4o 生成独特的多选题,包含一个正确答案、一个语义上最接近的选项和三个合理的替代选项。空间关系任务依赖于手动注释的对象对关系,通过交叉验证确保一致性。
📊 结果
- 总体性能:GPT-4o 在相对简单的任务中表现较好,如飞机类型分类、灾害类型分类、场景分类和土地利用分类,但在多样化的地理空间任务中平均准确率仅为40%。
- 时间理解结果:GPT-4o 在分类和计数任务中总体表现最佳。
- 指代表达检测:报告了在0.5 IoU 和0.25 IoU 下的精度。
🤖 定性结果
展示了模型在地理空间场景理解、计数、对象分类、事件检测和空间关系任务中的表现,强调了上下文推理和处理重叠视觉线索的重要性。




