遇见数据集

GroundVQA

收藏
Hugging Face2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

GroundVQA是一个对抗性视觉问答(VQA)基准数据集,用于评估前沿多模态大语言模型(MLLMs)在视觉基础、抗幻觉、不确定性校准、OCR鲁棒性和物理基础推理等方面的能力。该数据集包含约4,000个经过手动审核的对抗性VQA示例,这些示例基于作者图像以及来自Visual Genome、WearVQA、TextCaps、DocVQA、ChartQA和GQA等多个公共图像源的数据构建。与传统的VQA基准不同,GroundVQA侧重于模型评估而非训练,要求模型能够拒绝不支持的前提、在视觉证据不足时主动弃权、区分可见观察内容与推断内容,并避免对对象、属性、关系或OCR文本产生幻觉。数据集涵盖多个推理类别,包括OCR基础、空间推理、物理推理、对抗性幻觉、文档理解、图表推理以及模糊视觉证据处理。GroundVQA适用于前沿MLLMs的评估、幻觉分析、视觉基础研究以及不确定性感知多模态推理的基准测试,但不适用于监督训练任务。

GroundVQA is an adversarial Visual Question Answering (VQA) benchmark dataset developed to evaluate the capabilities of state-of-the-art multimodal large language models (MLLMs) across visual grounding, hallucination mitigation, uncertainty calibration, OCR robustness, and physical grounding reasoning. This dataset contains approximately 4,000 manually reviewed adversarial VQA examples, constructed using both author-provided images and data from multiple public image sources including Visual Genome, WearVQA, TextCaps, DocVQA, ChartQA, and GQA. Unlike traditional VQA benchmarks, GroundVQA focuses on model evaluation rather than training, requiring models to reject unsupported premises, actively abstain when visual evidence is insufficient, distinguish between observable content and inferred content, and avoid hallucinating objects, attributes, relationships, or OCR text. The dataset covers multiple reasoning categories, including OCR grounding, spatial reasoning, physical reasoning, adversarial hallucination, document understanding, chart reasoning, and ambiguous visual evidence handling. GroundVQA is suitable for evaluating state-of-the-art MLLMs, conducting hallucination analysis, advancing visual grounding research, and benchmarking uncertainty-aware multimodal reasoning, but it is not intended for supervised training tasks.

创建时间:
2026-07-05
原始信息汇总

GroundVQA 数据集概述

数据集名称:GroundVQA
许可证:Apache-2.0
任务类别:视觉问答(Visual Question Answering)
语言:英语
规模:约 1,000 至 10,000 条样本(当前版本约 4,000 条)

数据集描述

GroundVQA 是一个对抗性视觉问答(VQA)基准,专为评估前沿多模态大语言模型(MLLMs)在以下方面的能力而设计:

  • 视觉定位:模型对图像中具体元素的定位准确性。
  • 抗幻觉能力:拒绝无依据的假设、在视觉证据不足时拒绝回答、区分可见观察与推断内容。
  • 不确定性校准:在模棱两可的视觉证据下做出合理判断。
  • OCR 鲁棒性:处理文本光学字符识别任务的稳健性。
  • 物理推理:基于物理常识的推理能力。

数据集由约 4,000 条人工审核的对抗性 VQA 样本构成,图像来源包括作者自有图像以及 Visual Genome、WearVQA、TextCaps、DocVQA、ChartQA 和 GQA 等公开数据集(其中部分问答内容已重新整理)。

推理类别

GroundVQA 涵盖多种推理类型:

  • OCR 定位:识别并定位图像中的文本。
  • 空间推理:理解物体间的空间关系。
  • 物理推理:基于物理规则的推断。
  • 对抗性幻觉:检测模型对虚构信息的倾向。
  • 文档理解:处理文档图像中的信息。
  • 图表推理:分析图表数据与视觉呈现。
  • 模糊视觉证据:在信息不明确时进行判断。

预期用途

  • 评估前沿多模态大语言模型:作为测试基准。
  • 幻觉分析:研究模型生成虚假信息的现象。
  • 视觉定位研究:探索模型对图像元素的精确指向能力。
  • 不确定性感知推理基准测试:推动模型在不确定性场景下的推理研究。

注意:该数据集主要用于评估,不适合作为监督训练数据。

搜集汇总
数据集介绍
GroundVQA 数据集图片
构建方式
GroundVQA数据集是一个专为评估前沿多模态大语言模型而设计的对抗性视觉问答基准。其构建过程融合了作者自主拍摄的图像与来自Visual Genome、WearVQA、TextCaps、DocVQA、ChartQA及GQA等多个公开图像源的素材,并对已有问答对进行了重新策划与审核。最终形成的约4000个对抗性样本均经过人工严格审查,以确保每个问题都能有效考察模型在视觉定位、幻觉抵抗、不确定性校准、OCR鲁棒性及物理推理等方面的能力。
特点
该数据集的核心特色在于其对抗性与诊断性,摒弃了传统VQA基准中仅关注答案准确率的局限。样本设计迫使模型必须能够拒绝无根据的前提、在视觉证据不足时选择弃权、区分可见事实与推断内容,以及避免对物体、属性、关系或OCR文本产生幻觉。涵盖的推理类别包括OCR定位、空间推理、物理推理、对抗性幻觉、文档理解、图表推理及模糊视觉证据处理,系统性地暴露了当前MLLM在认知层面的薄弱环节。
使用方法
GroundVQA并非用于模型训练的监督数据集,而是作为评估工具使用。研究者可将其直接应用于前沿多模态大语言模型的评测中,尤其适用于幻觉分析、视觉定位研究以及不确定性感知多模态推理的基准测试。使用时可按照标准VQA评估流程进行,通过模型对每个对抗性样本的响应来判断其是否具备可靠的视觉理解与稳健的推理能力,从而为模型改进提供明确方向。
背景与挑战
背景概述
GroundVQA数据集于近期由多位研究人员基于Visual Genome、WearVQA、TextCaps、DocVQA、ChartQA及GQA等多个公开图像来源构建而成,旨在评估前沿多模态大语言模型在视觉定位、幻觉抵抗、不确定性校准、OCR鲁棒性及物理推理等方面的能力。该数据集聚焦于对抗性视觉问答任务,包含约4000个人工审查的对抗性样本,要求模型具备拒绝无依据前提、在视觉证据不足时弃权、区分可见观察与推断内容、以及避免幻觉生成等高级推理能力,为多模态模型的鲁棒性评估设立了新标准。
当前挑战
GroundVQA所解决的领域挑战在于传统VQA基准往往忽略模型对视觉证据的虚假关联与幻觉生成,而该数据集通过设计对抗性示例迫使模型处理无支撑前提、模糊证据及物理矛盾等复杂情境。构建过程中,研究者需从多源图像中精心筛选并人工构建需要精细视觉定位与推理的问答对,确保样本能有效触发模型在OCR接地、空间推理、物理常识及文档理解等维度的缺陷,同时维护样本的多样性与平衡性,以避免评估偏差,这对数据的质量控制与标注一致性提出了极高要求。
常用场景
经典使用场景
GroundVQA作为对抗性视觉问答基准,其经典使用场景聚焦于评估前沿多模态大语言模型在视觉定位、幻觉抵抗、不确定性校准、OCR鲁棒性以及物理接地推理等维度的综合能力。研究者通过提交模型在約4000个经人工审核的对抗性样本上的表现,能够系统性地检验模型在面对未支持前提、视觉证据不足、可见观察与推断内容混淆等情境时的决策质量。该基准特别强调模型应具备拒绝回答、主动弃权以及区分视觉观察与推理内容的元认知能力,从而为多模态模型的可靠性提供严苛的度量标尺。
衍生相关工作
围绕GroundVQA已衍生出一系列富有洞见的经典工作,主要集中在多模态语言模型的幻觉抑制策略与不确定性感知机制的创新设计上。研究者基于该基准提出了对抗性训练增强方法,通过动态生成未支持前提的混合样本提升模型对视觉锚点的敏感度;另有一些工作借鉴校准理论,在模型输出层引入置信度评估模块以量化推理可靠性。此外,GroundVQA的OCR接地子任务还催生了专注文档理解与图表推理的专项评估协议,这些衍生工作共同丰富了多模态对齐评估的技术树,并为后续如MMBench、MME等综合基准的设计提供了对抗性构建的范式参考。
数据集最近研究
最新研究方向
GroundVQA作为前沿多模态大语言模型(MLLMs)的对抗性视觉问答测评基准,聚焦于视觉定位、幻觉抵抗、不确定性校准、OCR鲁棒性及物理世界推理等核心能力的评估。该数据集由约4000个经过人工审查的对抗性示例构成,要求模型能够拒绝未经视觉证据支持的假设、在证据不足时保持谨慎、区分显性观测与推断内容,并避免对象、属性、关系或OCR文本的幻觉生成。当前研究热点围绕利用GroundVQA挑战现有MLLMs的视觉推理极限,推动模型在空间推理、物理常识理解、文档与图表深度解析等领域的稳健性提升,其对抗性设计为揭示模型在复杂视觉场景下的认知缺陷提供了关键基准,对构建更可靠、可解释的多模态智能系统具有重要科学价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务