遇见数据集

PVFH-Bench

收藏
github2026-08-25 更新2026-09-07 收录
数据链接:
官方服务:

资源简介:

PVFH-Bench是一个用于评估视觉语言模型中前提诱导视觉固定幻觉的基准测试数据集。

PVFH-Bench is a benchmark dataset for evaluating premise-induced visual fixation hallucinations in vision-language models.

创建时间:
2026-08-25
原始信息汇总

数据集概述

PVFH-Bench 是一个用于评估大型视觉-语言模型(LVLMs)在前提诱导的视觉固定幻觉(Premise-Induced Visual Fixation Hallucination, PVFH) 现象上的基准数据集。

该数据集的核心发现是:LVLMs 在面对直接的存在性问题时能正确识别物体,但当引入误导性前提,且图片中存在视觉上相似但实际缺失的物体时,模型会倾向于产生幻觉,错误地“看到”并“确认”该物体。PVFH-Bench 通过设计成对的对比问题来隔离并量化这一失败模式。

数据集规模与设计

  • 图像来源:基于 MSCOCO 2014 验证集,共包含 258 张图像及经过验证的真实-虚假物体对。
  • 测试规模:构建了 4 个均衡子集,每个子集包含 258 个问题,总计 1,032 个评估实例
  • 问题类型:采用 8 种空间关系模板,涵盖物体相对关系和图像相对关系。
  • 类别覆盖:涉及 160 个唯一真实物体类别160 个唯一易混淆物体类别,以及 293 个跨所有角色的唯一类别

诊断子集结构

数据集通过以下四个子集构成一个受控的诊断递进过程,用以区分不同类型的幻觉:

子集 查询对象 问题类型 预期行为
Vanilla (基准) 图像中实际存在的物体 二元存在性 回答
Visual Fixation 视觉上易混淆但实际缺席的物体 二元存在性 回答
False Premise 生成的缺席物体 空间关系问题 拒绝该前提
Core PVFH 视觉上易混淆但实际缺席的物体 空间关系问题 拒绝该前提

关键结果

  • 性能显著下降:在 10 个基础模型上,平均准确率从 Vanilla 子集的 97.36 下降至 Visual Fixation 的 77.78,False Premise 的 72.76,并在 Core PVFH 子集降至最低的 43.51
  • 核心差距:Vanilla 与 Core PVFH 之间存在 53.85 个百分点的巨大差距,表明即使模型具备较强的普通识别能力,在面对视觉混淆和误导性前提的组合压力时,其可靠性仍会大幅下降。
  • 推理模式的局限:显式推理并不能消除该幻觉模式。在 5 个具有推理模式结果的模型中,Core PVFH 的平均准确率反而下降了 20.77 个百分点(从 60.93 降至 40.16),表明推理过程可能加剧了该幻觉现象。

基准数据与构建流程

  • 已发布基准:构建好的基准文件位于仓库中的 data/benchmark/my_merged.json。该文件引用 MSCOCO 图像的文件名(source_image 字段),需要用户自行下载 MSCOCO 2014 验证集图像并解析路径。仓库本身不重新分发 COCO 图像。
  • 构建工具:仓库提供了完整的构建流程脚本(位于 src/ 目录),包括:
    1. 批量识别视觉易混淆物体对。
    2. 生成四个诊断子集。
    3. 合并子集为最终基准文件。
  • 环境要求:需要 Python 3.9+、MSCOCO 2014 验证图像以及可访问的 OpenAI 兼容多模态 API。

数据格式示例

每条数据记录了共享的图像与物体对元数据,以及四类成对问题。核心字段包括:

  • source_image: 源图像文件名。
  • 原物体: 图像中实际存在的物体。
  • 对应物体: 视觉上易混淆但实际缺席的物体。
  • presence_actual_object: 关于真实物体存在性的问题及标注答案(是)。
  • presence_corresponding_object: 关于易混淆物体存在性的问题及标注答案(否)。
  • false_premise_spatial: 关于生成缺席物体的空间关系问题。
  • spatial_with_llm_absent_object: 关于易混淆物体的空间关系问题,该问题隐含了一个误导性前提。

许可与引用

  • 数据许可:数据集构建自 MSCOCO 2014 验证集,源图像遵循 MSCOCO 使用条款
  • 项目许可:项目代码以 MIT 许可证 发布。
  • 引用:相关论文引用信息将在论文正式发布后于仓库中更新。
搜集汇总
数据集介绍
PVFH-Bench 数据集图片
构建方式
PVFH-Bench的构建源于对多模态大语言模型中一种特殊幻觉现象的精准把握,即当引入误导性前提时,模型可能将实际物体错误识别为视觉上相似却缺席的物体。为此,研究团队从MSCOCO 2014验证集中筛选出258张图像及其经过验证的真实-虚假物体对,通过精心设计,构架了四个平衡的诊断性子集,共1032个评估实例。构建流程包括:首先,利用多模态API识别视觉上易混淆的物体对;其次,生成8种空间关系模板,覆盖物体相对和图像相对关系;最后,合成四个子集的问题,并确保图像与物体对信息对齐,最终形成统一的数据集文件。
特点
该数据集的核心特色在于其系统化的诊断架构,将幻觉现象分解为四个递进层级:基础识别(Vanilla)、视觉固着(Visual Fixation)、虚假前提接受(False Premise)和核心PVFH。这种设计使得研究者能够精准定位模型在不同复杂度下的失败模式。实验显示,模型在Vanilla上平均准确率高达97.36%,而在核心PVFH上骤降至43.51%,相差53.85个百分点,深刻揭示了显式推理能力并不足以消除此类幻觉。数据集涵盖160个真实物体类别与160个易混淆类别,并支持多模态API的自动化评估,为视觉幻觉研究提供了严谨的基准。
使用方法
PVFH-Bench的使用需先获取MSCOCO 2014验证集图像,并按GitHub指引配置环境与OpenAI兼容API。用户可直接加载数据文件`data/benchmark/my_merged.json`,其中包含共享图像元数据和四组配对问题。评估模型时,可通过标准脚本批量运行,或采用提供的生成流程复现子集构建。若要复现基准的完整流程,需依次执行三步脚本,并依赖API辅助,但最终评估可脱离API。该设计旨在便于研究者灵活测试其模型,并与基准结果对比分析。
背景与挑战
背景概述
PVFH-Bench是由Xinhao Wang、Junbo Cui等研究者于近年构建的专用基准数据集,旨在剖析大型视觉-语言模型(LVLMs)中一类新颖的失效模式——前提诱导的视觉固着幻觉(PVFH)。该数据集基于MSCOCO 2014验证集精心筛选258幅图像及对应的真实-混淆物体对,构建了四个诊断性子集,共计1032个评估实例,涵盖八种空间关系模板,涉及160个真实物体类别与160个混淆物体类别。其核心研究问题在于揭示模型在存在直接询问下能正确识别物体,却在误导性前提引导下对视觉相似但实际缺失的物体产生幻觉的现象。该基准通过渐进式诊断设计,量化了从基本识别到完整幻觉模式间的性能落差,为LVLMs的鲁棒性和忠实性评估提供了关键工具,对相关领域的研究具有重要推动作用。
当前挑战
PVFH-Bench所应对的核心挑战源于多模态推理中视觉与语义交互的复杂性。领域层面,现有LVLMs在标准识别任务上表现优异,却难以抵御融合视觉混淆与语言前提压力的情境,导致生成与图像内容相悖的输出,暴露出模型在细粒度视觉辨别和逻辑一致性上的脆弱性。构建过程中,研究者需从MSCOCO中高效识别视觉易混淆的物体对,并确保生成的前提问题具有语义合理性与空间关系约束的准确性,同时需通过多阶段流水线(如lookalike对象识别、问题生成)平衡数据集规模与标注质量,确保各子集间的对照有效性。此外,实验表明,即使采用显式推理模式,模型仍无法完全规避此类幻觉,突显了该问题对现有模型的普遍挑战。
常用场景
经典使用场景
PVFH-Bench作为首个专门针对大型视觉语言模型(LVLMs)中前提诱导视觉固定幻觉(PVFH)的系统性评估基准,其核心应用在于对模型进行诊断性压力测试。该基准通过四组精心设计的受控子集——基础识别、视觉固定、虚假前提接受及综合PVFH失效模式,逐步引入视觉混淆性与前提压力,从而精准刻画模型在复杂查询下从高置信正确到灾难性错误的性能退化轨迹。研究者可利用该基准对模型进行细粒度的多维度评测,不仅检验模型对真实物体的存在性判断能力,更考察其在误导性前提与视觉相似干扰并存时的抵御幻觉韧性,为LVLMs的可靠性与鲁棒性评估树立了新的范式。
实际应用
PVFH-Bench的实际应用价值广泛渗透于依赖LVLMs进行精确视觉问答的诸多现实场景,如自动驾驶辅助系统中的障碍物判断、医疗影像中病理特征的确认、电商平台中商品与用户描述的一致性校验等。在这些高风险环境中,一个由误导性此前提引发的幻觉(如将风筝误认为鸟)可能导致灾难性决策。该基准为模型开发者提供了精确调试工具:通过分析模型在False Premise与Visual Fixation子集上的表现,可识别特定模型对空间关系模板或视觉相似类别的脆弱点,进而指导数据增强、对抗训练或推理策略的优化,提升模型在真实世界复杂交互中的可信度与安全性。
衍生相关工作
PVFH-Bench的提出催生了一系列影响深远的研究脉络。其一,它激发了针对前提鲁棒性的新评测协议设计,借鉴其受控子集划分思想,后续研究扩展至多模态对话、指代表达理解等场景中的欺骗性提示评估。其二,该基准揭示的视觉固定幻觉现象,直接推动了对抗性提示生成、去幻觉微调策略及基于外部知识的推理约束等缓解方法的涌现。其三,其公开的构建流程(包括视觉相似对自动识别管线)被广泛复用,促进了跨数据集的一致性与可比性研究。此外,该工作与认知科学中的'固定'现象形成呼应,为理解神经网络视觉注意力机制提供了行为学证据,成为连接AI可解释性与认知建模的桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务