遇见数据集

MM-Hallu/PROVE

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

PROVE是一个用于评估视觉语言模型(VLM)自由形式回答中幻觉现象的基准测试工具,基于场景图表示。它包含10,606个QA对,这些QA对基于来自超详细DOCCI图像描述的结构化视觉属性元组。数据集的特征包括图像、图像URL、超详细图像描述、问题、真实答案、图像元组和QA差异元组。元组涵盖了颜色、形状、材料、空间关系、大小、纹理等方面。评估指标包括准确性和程序化验证。

Benchmark for evaluating hallucinations in VLM free-form responses using scene-graph representations. 10,606 QA pairs grounded in structured visual property tuples from hyper-detailed DOCCI image captions. Features include image, image URL, hyper-detailed image caption, question, ground truth answer, image tuples, and QA diff tuples. Tuples cover color, shape, material, spatial relations, size, texture, etc. Evaluation metrics include Accuracy and Programmatic verification.

提供机构:
MM-Hallu
搜集汇总
数据集介绍
MM-Hallu/PROVE 数据集图片
构建方式
PROVE数据集专为评估视觉语言模型(VLM)在自由形式回答中的幻觉现象而构建。其构建基础源自DOCCI数据集中的超详细图像描述,通过场景图表示技术,从每张图像中提取出涵盖颜色、形状、材质、空间关系、尺寸、纹理等属性的结构化视觉元组。基于这些元组,自动生成与图像内容紧密关联的问答对,共计10,606个样本,每个问答对均带有对应的场景图元组以及与之相关的差异化元组,从而确保问题与答案的精确可验证性。
特点
该数据集的核心特点在于利用场景图元组作为事实性的结构化锚点,实现对VLM输出中幻觉现象的程序化检测。每个样本包含图像、超详细描述、问题、标准答案以及多层元组信息,其中`qa_diff_tuples`字段专门标识与当前问答对相关的局部元组,支持细粒度的正确性验证。任务类型涵盖视觉问答,语言为英语,数据规模适中(10K-100K),适合作为幻觉评估的基准测试集。
使用方法
使用PROVE数据集时,可基于其标准化的问答对与场景图元组,采用程序化验证方法评估模型的回答准确性。具体流程包括:将模型输出的自由形式文本与结构化元组进行匹配解析,计算准确率指标。数据集以parquet格式存储,可通过HuggingFace的`datasets`库加载默认配置的`train`分片。研究者可直接利用`image`、`question`、`answer`字段进行常规测试,或利用`image_tuples`和`qa_diff_tuples`字段实现更深入的符号级幻觉诊断。
背景与挑战
背景概述
PROVE数据集诞生于2024年,由研究团队基于DOCCI数据集构建,旨在解决视觉语言模型(VLM)在开放式回答中普遍存在的幻觉问题。其核心研究挑战在于,当前的大规模多模态模型虽能生成流畅的自由形式描述,却时常产生与图像事实不符的陈述,这一缺陷严重制约了其在安全敏感场景中的部署。PROVE通过引入场景图表示,将超详细的图像标注转化为结构化的视觉属性元组,涵盖了颜色、形状、材质、空间关系等细粒度信息,并据此构建了10,606个问答对。该数据集为幻觉评估提供了可程序化验证的基准,推动了多模态系统忠实性评测的标准化进程,对视觉问答、场景理解及可信人工智能领域产生了重要影响。
当前挑战
PROVE数据集所解决的核心领域挑战是视觉语言模型中幻觉现象的精确检测与量化。传统评估方法依赖人工标注或模糊的文本匹配,难以捕捉模型对特定视觉属性的错误推理,而PROVE通过场景图元组实现了对颜色、空间关系等细粒度属性的程序化验证。在构建过程中,主要挑战包括如何从DOCCI的密集描述中自动抽取可靠的结构化元组,并确保这些元组能够覆盖多样的视觉属性类型且保持语义一致性。此外,将自然语言问答与图结构进行对齐,以生成差异化元组来精确对应每个问答对,同样需要精巧的设计以避免信息丢失或引入噪声。最终,数据集需要平衡规模与标注质量,在10K+样本量级上维持对幻觉评估的鉴别力。
常用场景
经典使用场景
PROVE数据集是为评估视觉语言模型(VLM)在自由形式文本生成中的幻觉现象而精心设计的基准。其核心创新在于引入场景图(scene graph)表示方法,通过将DOCCI数据集中超详细图像描述转化为结构化视觉属性元组(覆盖颜色、形状、材质、空间关系、大小、纹理等维度),构建了10,606个高质量问答对。模型的回答需与这些结构化元组进行程序化匹配验证,从而精准检测模型是否生成与图像事实不符的内容。该数据集尤其适用于测试VLM在开放式问答中避免虚构细节或错误推理的能力,为幻觉检测提供了细粒度、可解释的评估框架。
解决学术问题
该数据集直击当前多模态大模型研究中“幻觉评估缺乏结构化标准”的痛点。传统评估多依赖人工标注或简单的文本匹配,难以量化模型在细微属性(如物体颜色、空间布局)上的错误。PROVE通过场景图元组定义了视觉事实的原子化表示,使每个问答对可被程序化验证,避免了人工评估的主观性和低效性。学术界长期面临的“如何客观衡量VLM对视觉细节的忠实度”问题因此得到突破性解决,为模型幻觉研究提供了可复现、可扩展的参照基准,推动了多模态理解评估从粗粒度语义向细粒度属性一致性的范式转变。
衍生相关工作
PROVE数据集的出现催生了多项延伸研究。其程序化验证方法启发了CLIPScore等指标向结构化场景图评估的演进,衍生出如SceneGraphHallu等更细粒度的幻觉检测工具。基于PROVE的评估范式,研究者进一步提出了将场景图与因果推理相结合的方法(如CausalVLM),用于分析幻觉的潜在成因。此外,PROVE中的属性元组设计被引用至多模态上下文学习研究中,例如利用其结构化问答对训练模型在图像描述中避免位置或颜色混淆。这些工作共同推动了视觉语言模型从“生成流畅文字”向“生成事实精确描述”的转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务