GeoRefusalBench
收藏资源简介:
GeoRefusalBench 是一个用于评估遥感视觉语言模型(RSVLM)拒绝能力的基准。大多数现有基准仅衡量答案正确性,但地球观测图像常因空间分辨率不足、云层遮挡、时间分辨率限制等原因无法提供问题所需的证据,因此模型应具备拒绝回答并说明理由的能力。该基准包含 587 个样本,每个样本由一个可解的二值存在性问题经过扰动生成,扰动来自涵盖 5 个拒绝类别和 3 个强度的 90 个杠杆(最终使用 83 个)。数据基于五种光学和两种 SAR 遥感影像源构建。标注采用混合策略:193 个样本基于像素和几何测量,394 个样本基于验证器模型间的一致性,所有样本均经过盲专家审查。任务要求模型对给定的单张图像和问题输出 JSON 格式的评判(verdict),包括 ANSWER(可回答)和五种拒绝理由(信息缺失、粒度不匹配、查询模糊、错误前提、非事实性查询)。数据分为 cases、labels、provenance 三个配置,每个配置包含 A、B、C 三个子集(非训练/开发/测试划分),图像以无损 PNG 格式提供。评分时,只要预测的 verdict 属于样本接受的集合即视为正确,建议与始终回答的基线(50.3%)比较。数据集以 CC BY 4.0 许可发布,图像源自 EO-Gym 等公开数据集。已知限制包括三个样本存在条件后续问题、一个重复样本、类别分布不均及图像编码差异。
GeoRefusalBench is a benchmark for evaluating the refusal ability of remote sensing vision-language models (RSVLM). Most existing benchmarks only measure answer correctness, but Earth observation images often cannot provide the evidence required by the question due to insufficient spatial resolution, cloud遮挡, temporal resolution limitations, etc., so the model should be able to refuse to answer and provide reasons. The benchmark contains 587 samples, each generated by perturbing a solvable binary existence problem, with perturbations from 90 levers (83 finally used) covering 5 refusal categories and 3 strengths. Data is constructed based on five optical and two SAR remote sensing image sources. Annotation uses a hybrid strategy: 193 samples based on pixel and geometric measurements, 394 samples based on consistency among validator models, all samples reviewed by blind experts. The task requires the model to output a verdict in JSON format for a given single image and question, including ANSWER (answerable) and five refusal reasons (missing information, granularity mismatch, query ambiguity, false premise, non-factual query). The data is divided into three configurations: cases, labels, provenance, each containing three subsets A, B, C (not train/dev/test split), with images provided in lossless PNG format. Scoring: prediction is correct if the predicted verdict belongs to the samples accepted set, recommended to compare with the always-answer baseline (50.3%). The dataset is released under CC BY 4.0, images from public datasets like EO-Gym. Known limitations include three samples with conditional follow-up questions, one duplicate sample, uneven category distribution, and image encoding differences.
GeoRefusalBench 数据集概述
GeoRefusalBench 是一个用于评估遥感视觉-语言模型(RSVLMs)在拒绝回答能力上的基准数据集。其核心目标不是仅衡量模型回答的正确性,而是测试模型在面对地球观测图像无法为问题提供充分证据时,是否能够合理地拒绝回答并给出理由。
数据集规模与构成
- 包含 587 个测试样本(episodes),由五个光学和两个 SAR(合成孔径雷达)源数据集构建而成。
- 每个样本从一个已确认可解的二元存在性问题出发,应用从包含 90 种扰动机制(levers) 的目录中选取的一种扰动,这些扰动覆盖了五种拒绝类别和三种强度等级,最终使用了其中的 83 种机制。
- 数据标注采用混合方式:193 个样本由像素和几何测量锚定,其余 394 个样本基于验证器模型间的共识(作为实际过滤器,而非认证锚点)。所有样本均通过了盲审专家审查,审查中移除了 59 个项目并修改了 73 个判定。
任务定义
模型仅输入一张图像和一个问题,需输出一个 JSON 格式的结构,包含以下字段:
verdict:判定结果(必须为以下六种之一)answer:回答内容justification:判定理由
判定类别
| 判定值 | 含义 |
|---|---|
ANSWER |
图像中存在足够清晰的证据来解决问题 |
REFUSE_INFO_MISSING_IN_CONTEXT |
证据应在此场景中,但被遮挡、涂黑、饱和、截断或缺失通道 |
REFUSE_GRANULARITY_MISMATCH |
场景的空间或时间采样过于粗糙,无法满足问题要求 |
REFUSE_AMBIGUOUS_QUERY |
问题未明确唯一的指代对象或标准 |
REFUSE_FALSE_PREMISE_IN_QUERY |
问题预设了图像所驳斥的内容 |
REFUSE_NONFACTUAL_QUERY |
任何图像都无法解决该问题 |
当多个拒绝类别适用时,需按以下顺序报告第一个:FALSE_PREMISE > AMBIGUOUS_QUERY > GRANULARITY_MISMATCH > NONFACTUAL_QUERY > INFO_MISSING_IN_CONTEXT。
数据文件布局
数据集按 A、B、C 三个构建批次组织,每批包含三个配置文件:
cases:包含id、set、image、question字段,是模型可看到的全部内容。labels:包含id、set、gold 判定、类别、强度、扰动机制。provenance:包含id、set、基础问题、操作符、种子及测量数据。
此外,图像文件存储在 images/{A,B,C}/<id>.png,为无损 PNG 格式。A、B、C 三个批次并非训练/开发/测试集,它们共享基础问题池但使用不同的生成-验证委员会,论文结果基于全部 587 个样本汇总。
评估关键要点
- 禁止将
provenance/中的任何数据放入提示:其中包含有效地面采样距离等信息,元数据分类器仅凭该数值即可达到 0.695 的准确率,而正常情况仅为 0.351。泄露会导致基准测试衡量的是查表而非感知能力。 - 样本 ID 为不透明设计:原始内部 ID 编码了来源、答案、拒绝类别和强度等信息,解析字符串即可完全恢复标签,因此发布 ID 仅包含
<set>-<sha1前缀>。 - 评分标准:当预测的
verdict属于该样本的接受集合时,预测正确。15 个样本接受多个拒绝理由,匹配任一即可。始终回答(always-answer)基线得分为 50.3%,在评估的七个开放 RSVLM 系统中,没有任何系统能超过此基线。
来源与许可
- 图像来源于 EO-Gym 重新分发的影像,遵循 CC BY 4.0 许可协议。
- 源数据集包括:fMoW、DOTA、DIOR、FAIR1M、xView(光学),以及 SARDet-100K、M4-SAR(SAR)。
- 每个原始数据集合有其使用条款,用户需自行检查相关适用条款。
已知局限
- B 批次中有三个低强度样本偏离了二元控制协议,附带条件后续问题,在报告任何答案级指标前应将其排除。
- 基于图像字节和问题文本的内容指纹显示有 586 个唯一项,存在一个真正的重复项。
- 五个类别的样本数量分布不均,这是可行性和验证器门控的结果,而非平衡采样的目标。
- 图像以无损 PNG 形式发布,论文评估时重新编码为 JPEG q95,这比集合中最弱的扰动安静 13 dB,但并非无损。





