遇见数据集

GeoRefusalBench

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

GeoRefusalBench 是一个用于评估遥感视觉语言模型(RSVLM)拒绝能力的基准。大多数现有基准仅衡量答案正确性,但地球观测图像常因空间分辨率不足、云层遮挡、时间分辨率限制等原因无法提供问题所需的证据,因此模型应具备拒绝回答并说明理由的能力。该基准包含 587 个样本,每个样本由一个可解的二值存在性问题经过扰动生成,扰动来自涵盖 5 个拒绝类别和 3 个强度的 90 个杠杆(最终使用 83 个)。数据基于五种光学和两种 SAR 遥感影像源构建。标注采用混合策略:193 个样本基于像素和几何测量,394 个样本基于验证器模型间的一致性,所有样本均经过盲专家审查。任务要求模型对给定的单张图像和问题输出 JSON 格式的评判(verdict),包括 ANSWER(可回答)和五种拒绝理由(信息缺失、粒度不匹配、查询模糊、错误前提、非事实性查询)。数据分为 cases、labels、provenance 三个配置,每个配置包含 A、B、C 三个子集(非训练/开发/测试划分),图像以无损 PNG 格式提供。评分时,只要预测的 verdict 属于样本接受的集合即视为正确,建议与始终回答的基线(50.3%)比较。数据集以 CC BY 4.0 许可发布,图像源自 EO-Gym 等公开数据集。已知限制包括三个样本存在条件后续问题、一个重复样本、类别分布不均及图像编码差异。

GeoRefusalBench is a benchmark for evaluating the refusal ability of remote sensing vision-language models (RSVLM). Most existing benchmarks only measure answer correctness, but Earth observation images often cannot provide the evidence required by the question due to insufficient spatial resolution, cloud遮挡, temporal resolution limitations, etc., so the model should be able to refuse to answer and provide reasons. The benchmark contains 587 samples, each generated by perturbing a solvable binary existence problem, with perturbations from 90 levers (83 finally used) covering 5 refusal categories and 3 strengths. Data is constructed based on five optical and two SAR remote sensing image sources. Annotation uses a hybrid strategy: 193 samples based on pixel and geometric measurements, 394 samples based on consistency among validator models, all samples reviewed by blind experts. The task requires the model to output a verdict in JSON format for a given single image and question, including ANSWER (answerable) and five refusal reasons (missing information, granularity mismatch, query ambiguity, false premise, non-factual query). The data is divided into three configurations: cases, labels, provenance, each containing three subsets A, B, C (not train/dev/test split), with images provided in lossless PNG format. Scoring: prediction is correct if the predicted verdict belongs to the samples accepted set, recommended to compare with the always-answer baseline (50.3%). The dataset is released under CC BY 4.0, images from public datasets like EO-Gym. Known limitations include three samples with conditional follow-up questions, one duplicate sample, uneven category distribution, and image encoding differences.

创建时间:
2026-08-17
原始信息汇总

GeoRefusalBench 数据集概述

GeoRefusalBench 是一个用于评估遥感视觉-语言模型(RSVLMs)在拒绝回答能力上的基准数据集。其核心目标不是仅衡量模型回答的正确性,而是测试模型在面对地球观测图像无法为问题提供充分证据时,是否能够合理地拒绝回答并给出理由。

数据集规模与构成

  • 包含 587 个测试样本(episodes),由五个光学和两个 SAR(合成孔径雷达)源数据集构建而成。
  • 每个样本从一个已确认可解的二元存在性问题出发,应用从包含 90 种扰动机制(levers) 的目录中选取的一种扰动,这些扰动覆盖了五种拒绝类别和三种强度等级,最终使用了其中的 83 种机制。
  • 数据标注采用混合方式:193 个样本由像素和几何测量锚定,其余 394 个样本基于验证器模型间的共识(作为实际过滤器,而非认证锚点)。所有样本均通过了盲审专家审查,审查中移除了 59 个项目并修改了 73 个判定。

任务定义

模型仅输入一张图像和一个问题,需输出一个 JSON 格式的结构,包含以下字段:

  • verdict:判定结果(必须为以下六种之一)
  • answer:回答内容
  • justification:判定理由

判定类别

判定值 含义
ANSWER 图像中存在足够清晰的证据来解决问题
REFUSE_INFO_MISSING_IN_CONTEXT 证据应在此场景中,但被遮挡、涂黑、饱和、截断或缺失通道
REFUSE_GRANULARITY_MISMATCH 场景的空间或时间采样过于粗糙,无法满足问题要求
REFUSE_AMBIGUOUS_QUERY 问题未明确唯一的指代对象或标准
REFUSE_FALSE_PREMISE_IN_QUERY 问题预设了图像所驳斥的内容
REFUSE_NONFACTUAL_QUERY 任何图像都无法解决该问题

当多个拒绝类别适用时,需按以下顺序报告第一个:FALSE_PREMISE > AMBIGUOUS_QUERY > GRANULARITY_MISMATCH > NONFACTUAL_QUERY > INFO_MISSING_IN_CONTEXT

数据文件布局

数据集按 ABC 三个构建批次组织,每批包含三个配置文件:

  • cases:包含 idsetimagequestion 字段,是模型可看到的全部内容。
  • labels:包含 idset、gold 判定、类别、强度、扰动机制。
  • provenance:包含 idset、基础问题、操作符、种子及测量数据。

此外,图像文件存储在 images/{A,B,C}/<id>.png,为无损 PNG 格式。ABC 三个批次并非训练/开发/测试集,它们共享基础问题池但使用不同的生成-验证委员会,论文结果基于全部 587 个样本汇总。

评估关键要点

  • 禁止将 provenance/ 中的任何数据放入提示:其中包含有效地面采样距离等信息,元数据分类器仅凭该数值即可达到 0.695 的准确率,而正常情况仅为 0.351。泄露会导致基准测试衡量的是查表而非感知能力。
  • 样本 ID 为不透明设计:原始内部 ID 编码了来源、答案、拒绝类别和强度等信息,解析字符串即可完全恢复标签,因此发布 ID 仅包含 <set>-<sha1前缀>
  • 评分标准:当预测的 verdict 属于该样本的接受集合时,预测正确。15 个样本接受多个拒绝理由,匹配任一即可。始终回答(always-answer)基线得分为 50.3%,在评估的七个开放 RSVLM 系统中,没有任何系统能超过此基线。

来源与许可

  • 图像来源于 EO-Gym 重新分发的影像,遵循 CC BY 4.0 许可协议。
  • 源数据集包括:fMoW、DOTA、DIOR、FAIR1M、xView(光学),以及 SARDet-100K、M4-SAR(SAR)。
  • 每个原始数据集合有其使用条款,用户需自行检查相关适用条款。

已知局限

  • B 批次中有三个低强度样本偏离了二元控制协议,附带条件后续问题,在报告任何答案级指标前应将其排除。
  • 基于图像字节和问题文本的内容指纹显示有 586 个唯一项,存在一个真正的重复项。
  • 五个类别的样本数量分布不均,这是可行性和验证器门控的结果,而非平衡采样的目标。
  • 图像以无损 PNG 形式发布,论文评估时重新编码为 JPEG q95,这比集合中最弱的扰动安静 13 dB,但并非无损。
搜集汇总
数据集介绍
GeoRefusalBench 数据集图片
构建方式
GeoRefusalBench的构建基于一个严谨的多阶段流程,旨在模拟遥感视觉语言模型在实际应用中面临的不可回答情境。首先,从五个光学和两个合成孔径雷达(SAR)数据集中精心挑选587个可解答的二元存在性问题作为基础,并设计了一个包含90种扰动机制的目录,涵盖五种拒绝类别和三种强度,最终有83种扰动被纳入。随后,采用混合标注策略:对193个样本进行像素级和几何测量标注,其余394个样本则通过多个验证模型的一致性来标注,并辅以盲审专家审核,剔除59个不合格样本并修正73个判定,确保了标注的准确性和可靠性。数据划分为A、B、C三个构建批次,每个批次源自不同的生成-验证委员会,共享基础问题池,但并非训练/验证/测试集,而是作为整体评估的组成部分。
使用方法
使用GeoRefusalBench时,研究者需通过HuggingFace的datasets库加载cases、labels和provenance三个配置文件。每个样本包含一张图像和一个问题,模型需输出包含verdict、answer和justification的JSON。评估时,将预测的verdict与标签中的可接受判定集合进行匹配。需特别注意的是,在输入模型时切勿包含provenance中的任何信息,以免无意中泄露物理参数导致结果偏差。此外,存在三个低强度样本带有条件后续问题,评分时需排除。建议在报告结果时,参考论文中推荐的JPEG压缩预处理,并强调与始终回答的基线进行对比,以凸显模型在拒绝任务上的提升。
背景与挑战
背景概述
GeoRefusalBench是一个针对遥感视觉语言模型(RSVLMs)的基准测试,于2023年由多机构研究团队创建,旨在评估模型在面对无法回答的遥感图像问题时是否能够恰当地拒绝回答并给出理由。该基准的核心研究问题在于,现有的RSVLM评估几乎完全侧重于答案的正确性,而忽视了模型对证据不足或问题不明确等情况的处理能力。GeoRefusalBench通过构建587个精心设计的测试场景,覆盖多种拒绝类型和扰动强度,为RSVLM的可靠性评估提供了新维度。其影响力体现在推动遥感AI领域对模型不确定性和安全性的关注,也为后续研究提供了标准化的评估工具。
当前挑战
GeoRefusalBench所面临的挑战主要包括:1)解决遥感图像中证据缺失或不足导致的问题不可回答性,如地面采样距离过粗、云层遮挡、单次采集无法反映变化等,这些使得模型难以基于现有信息做出准确判断;2)构建过程中的挑战,包括从多源光学和SAR数据中生成高质量的测试场景,确保每个场景的可解性和合理性,同时避免信息泄露(如元数据中隐含答案),以及处理标签不一致和类别不均衡等问题。此外,如何设计有效的基线评估方法,以应对模型倾向于“总是回答”的默认行为,也是一大难点。
常用场景
经典使用场景
GeoRefusalBench作为遥感视觉语言模型(RSVLMs)的专项评测基准,其核心应用场景在于系统性地衡量模型在面对无法从影像中获取充分证据的问题时,能否做出合理且具备可解释性的拒答行为。该基准通过精心构建的587个测试样本,覆盖了五种拒答类别和三种扰动强度,要求模型在仅凭单一影像与问题的情况下,输出包含裁决、答案及理由的结构化响应。这一设计使得其成为评估模型不确定性处理能力、鲁棒性以及避免过度自信猜测能力的标准化测试平台,尤其适用于那些需要严格保障地理空间信息决策可靠性的研究领域。
解决学术问题
该数据集深刻回应了遥感视觉语言模型评估中长期被忽视的核心问题:即当影像证据缺失、分辨率不足或问题本身存在歧义时,模型应当具备识别自身知识边界并主动拒绝回答的能力。过往研究仅聚焦于答案正确率,而GeoRefusalBench通过引入精细的拒答分类体系和多等级扰动机制,使得研究者能够定量分析模型在信息不充分情境下的行为模式,从而揭示模型在现实遥感分析中可能产生的幻觉或误导性输出。其意义在于推动了模型从‘强答’向‘可信拒答’的能力转化,为构建更加可靠、负责任的地理空间智能系统奠定了评测基础。
实际应用
在实际应用中,GeoRefusalBench所定义的拒答能力对于多个高风险的遥感分析场景至关重要。例如,在灾害应急响应中,当卫星影像因云层遮挡或地面采样距离不足而无法确认灾区道路损毁情况时,系统应明确说明证据不足,而非提供可能误导救援决策的猜测性答案。在环境监测、军事侦察及城市规划等领域,该基准同样适用,它确保基于遥感影像的智能问答系统能够清晰区分‘影像可证’与‘影像不可证’的问题,从而辅助分析师在有限信息条件下做出更加审慎的判断,显著降低因模型过度自信而引发的决策风险。
数据集最近研究
最新研究方向
GeoRefusalBench作为遥感视觉-语言模型(RSVLMs)领域的开创性基准,聚焦于模型在信息不足或存在歧义时能否进行根因性拒绝回答。该基准通过精心设计的587个场景,涵盖遮挡、分辨率失配、歧义查询、错误前提及非事实查询等五类拒答原因,并引入多等级扰动机制,推动模型从单纯追求答案正确性转向具备鲁棒的确定性估计与选择性预测能力。其混合标注策略与严格的专家审查流程,为遥感领域提供了高质量的评估基准,同时还警示了元数据泄露与ID编码带来的评估风险,对推动RSVLMs在可信赖AI方向的发展具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务