Hallu-PI
收藏资源简介:
Hallu-PI 是首个用于评估多模态大型语言模型在扰动输入下幻觉现象的基准数据集。它包含七个扰动场景,涵盖1,020张来自11种对象类型的扰动图像,每张图像都附有详细的注释,包括细粒度的幻觉类型,如存在、属性和关系。这些注释配备了丰富的问题集,使其适用于区分性和生成性任务。
Hallu-PI is the first benchmark dataset for evaluating hallucination phenomena in multimodal large language models under perturbed inputs. It includes seven perturbation scenarios, covering 1,020 perturbed images spanning 11 object types. Each image is accompanied by detailed annotations covering fine-grained hallucination categories such as existence, attributes, and relationships. These annotations are paired with a comprehensive set of questions, making the dataset suitable for both discriminative and generative tasks.
Hallu-PI 数据集概述
数据集简介
Hallu-PI 是一个专门设计用于评估多模态大型语言模型(MLLMs)在扰动输入下幻觉现象的基准数据集。该数据集旨在填补现有评估方法在处理真实世界中常见扰动输入(如图像裁剪或模糊)方面的空白。
数据集内容
- 扰动场景:包含七个不同的扰动场景。
- 图像数量:共有 1,020 张扰动图像。
- 对象类型:图像涵盖 11 种不同的对象类型。
- 详细标注:每张图像都附有详细的标注信息,包括细粒度的幻觉类型,如存在性、属性和关系。
- 适用任务:数据集配备了一系列问题,适用于区分性和生成性任务。
实验结果
- 模型评估:对 12 个主流 MLLMs(如 GPT-4V 和 Gemini-Pro Vision)进行了广泛实验,结果显示这些模型在 Hallu-PI 上表现出显著的幻觉现象,这在未扰动场景中未被观察到。
- 幻觉类型偏差:研究发现 MLLMs 在处理不同类型幻觉的能力上存在严重偏差。
基准设计
- Perturbed-Reminder:针对扰动场景设计的基准之一。
- Perturbed-ICL:另一个针对扰动场景设计的基准。
数据集发布
- 即将发布:目前正在整理代码和数据,将尽快发布。




