RSHR
收藏资源简介:
RSHR是一个用于评估多模态大语言模型在遥感领域细粒度感知和复杂推理能力的基准数据集,包含5,329张全场景图像,原始分辨率从4K到3×10^8像素(300 MP)。数据集汇集了来自DOTA-v2.0、MiniFrance、FAIRIM、HRSCD、XLRS-Bench以及自有的100MP无人机捕获图像的专家标注数据,涵盖了多种真实世界遥感场景。数据集支持9种感知类别和4种推理类型,包括多项选择视觉问答(MCQ)、开放式视觉问答(OEQ)、图像描述(IC)和单图像评估(SIE)等任务。
RSHR is a benchmark dataset for evaluating the fine-grained perception and complex reasoning capabilities of multimodal large language models in the remote sensing domain. It contains 5,329 full-scene images with original resolutions ranging from 4K to 3×10^8 pixels (300 MP). The dataset incorporates expert-annotated data from DOTA-v2.0, MiniFrance, FAIRIM, HRSCD, XLRS-Bench, and our own 100 MP drone-captured images, covering a variety of real-world remote sensing scenarios. It supports 9 perception categories and 4 reasoning types, including tasks such as multiple-choice visual question answering (MCQ), open-ended visual question answering (OEQ), image captioning (IC), and single-image evaluation (SIE).
RSHR 数据集概述
数据集基本信息
- 数据集名称:RSHR
- 核心定位:一个用于评估多模态大语言模型在超高分辨率遥感数据上进行细粒度感知与复杂推理的基准数据集。
- 数据规模:包含 5,329 张全场景图像。
- 图像分辨率:原生分辨率从 4K 到 3 × 10^8 像素(300 MP)。
数据来源与构成
- 数据来源:汇集了来自 DOTA-v2.0, MiniFrance, FAIRIM, HRSCD, XLRS-Bench 以及自采集的 100MP 无人机图像 的专家标注数据。
- 场景覆盖:涵盖多种真实世界遥感场景。
任务与评估体系
- 任务类别:涵盖 9 个感知类别(如颜色、方向、区域定位)和 4 种推理类型。
- 主要任务族:
- 多项选择视觉问答:评估在固定答案空间内的决策能力,支持单轮和多轮对话。
- 开放式视觉问答:评估无需依赖选项先验的自由形式视觉理解和组合能力。
- 图像描述:要求对全局场景(整图摘要)和区域细节(定向区域)进行简洁、准确的描述。
- 单图像评估:专门用于测试对超高分辨率图像的深度理解,探究每张图像上的多尺度感知与推理。
- 评估流程:采用两阶段 “人类-LLM对抗性验证” 流程(LLM对抗性过滤 + 人工审查),以消除仅凭语言先验即可解决的问题,确保模型必须真正“看到”图像才能回答。
评估结果与关键发现
- 评估模型:评估了 14 个最先进的模型,包括通用MLLM和遥感专用模型。
- 主要评估项:覆盖多项选择视觉问答、开放式视觉问答和图像描述。
- 关键洞察:单图像评估揭示了模型性能与分辨率支持之间的关键鲁棒性问题。
相关资源
- 论文地址:https://arxiv.org/abs/2512.17319
- 基准数据集地址:https://huggingface.co/datasets/FelixKAI/XHRBench




