遇见数据集

MM-Hallu/HALLUCINOGEN

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

HALLUCINOGEN是一个用于评估大型视觉语言模型(LVLMs)中物体幻觉的综合基准数据集。它扩展了POPE风格的问答,涵盖4种任务类型(识别、定位、视觉上下文和反事实推理)和3种POPE分割(对抗性、流行性和随机性),共产生36,000个图像-问题对,这些图像来自COCO数据集。每个问题对包括一个COCO图像、问题ID、COCO图像ID、基础POPE问题、标签(“是”或“否”)、任务类型、POPE分割以及5个重新表述的问题变体。数据集旨在通过多种任务类型和分割方式全面评估模型在物体幻觉方面的表现,评估指标包括准确率、精确率、召回率和F1分数。

HALLUCINOGEN is a comprehensive benchmark for evaluating object hallucination in LVLMs. It extends POPE-style questions across 4 task types (identification, localization, visual contextual, and counterfactual) and 3 POPE splits (adversarial, popular, random), producing 36,000 image-question pairs from COCO images. Each pair includes a COCO image, question ID, COCO image ID, base POPE question, label ("yes" or "no"), task type, POPE split, and 5 rephrased question variants. The dataset aims to comprehensively evaluate model performance on object hallucination through various task types and splits, with metrics including Accuracy, Precision, Recall, and F1.

提供机构:
MM-Hallu
搜集汇总
数据集介绍
MM-Hallu/HALLUCINOGEN 数据集图片
构建方式
HALLUCINOGEN数据集源于对大型视觉语言模型(LVLMs)中对象幻觉现象的系统评估需求,基于COCO图像库构建。该数据集以POPE风格的提问范式为核心,通过扩展四种任务类型——识别、定位、视觉上下文推理与反事实推理——并融合三种POPE划分方式(对抗性、流行性、随机性),生成了共计36,000个图像-问答对。每个问题均配备五个语义等价的改写变体,以增强评估的鲁棒性。数据集的构建过程严格遵循二元标注(是/否),确保了基准测试的客观性与可重复性。
特点
HALLUCINOGEN数据集的显著特点在于其多维度的任务设计与系统性评估框架。其四个任务类型分别考察了模型在不同认知层次上的幻觉倾向:识别任务检验基础对象存在性判断,定位任务聚焦空间关系理解,视觉上下文任务评估场景推理能力,反事实任务则探究对假设性场景的响应逻辑。同时,三种POPE划分方式从随机、流行到对抗性样本,逐步提升了问题的误导性与挑战性。这种多层次架构使得数据集能够全面诊断LVLMs在不同复杂程度下的幻觉模式。
使用方法
使用HALLUCINOGEN数据集时,可直接加载包含图像、问题、标签及任务信息的标准格式文件。评估流程采用二分类方法,以准确性、精确率、召回率和F1分数作为核心指标。用户可根据研究目标选择特定任务类型或POPE划分的子集进行聚焦分析,例如单独评估模型在反事实推理任务上的幻觉率。数据集提供的每个问题均包含五个语义改写版本,允许研究者通过对比模型在不同表述下的表现,深入分析语言变体对幻觉触发的影响,从而优化模型的鲁棒性。
背景与挑战
背景概述
HALLUCINOGEN数据集诞生于2024年,由来自多模态与视觉语言模型领域的研究团队基于大规模视觉语言模型(LVLMs)中普遍存在的物体幻觉问题而创建。该数据集以COCO图像为底本,设计了涵盖识别、定位、视觉上下文推理及反事实推理四类任务的三万六千个图像-问题对,旨在系统性地评估模型对视觉内容的忠实程度。通过引入POPE三种分割策略,HALLUCINOGEN不仅拓展了幻觉评估的广度与深度,还为研究者提供了多维度、细粒度的度量标准,显著推动了对LVLMs可靠性的理解与改进。
当前挑战
HALLUCINOGEN所应对的核心领域挑战在于LVLMs在生成响应时频繁编造不存在的物体或关系,即物体幻觉问题,这严重削弱了模型在安全关键应用中的可信度。数据集的构建亦面临严峻挑战:如何设计覆盖多模态语义、空间定位、上下文依赖及反事实假设的任务类型以全面暴露幻觉模式;同时在原始COCO标注基础上进行人工标注与自动生成,确保问题变体多样性与标签一致性,并平衡各任务与分割的样本分布以避免评价偏差。
常用场景
经典使用场景
HALLUCINOGEN数据集为大型视觉语言模型(LVLMs)的物体幻觉评估提供了前所未有的综合性基准。在计算机视觉与自然语言处理交叉领域,模型常因过度依赖语言先验或对视觉特征理解不足而产生虚假描述,该数据集通过精心设计的四类任务——直接识别、空间定位、视觉语境推理以及反事实场景推演,系统性地检验模型对图像内容的忠实程度。研究者可借助该基准对主流LVLMs进行标准化评估,精准定位其在物体存在性判断、空间关系理解等维度的薄弱环节,从而推动更可靠的多模态推理能力发展。
实际应用
在实际部署中,该数据集直接影响着自动驾驶、医疗影像辅助诊断、智能监控等高风险视觉理解系统的安全性与可信度评估。例如,在自动驾驶场景中,模型对路面障碍物的误报或漏报可能引发严重后果,HALLUCINOGEN的反事实任务恰恰模拟了这类边缘情境,帮助企业筛选出对场景异常变化敏感的模型。此外,视觉问答系统的开发商可将其作为质量门禁,在产品发布前系统性检验模型回答是否忠实于输入图像,从而降低因幻觉引发用户误解或决策失误的风险。
衍生相关工作
该数据集已在学术界催生出多项具有影响力的后续工作。核心贡献者基于其评估结果提出了幻觉缓解策略——包括增强视觉编码器的注意力锚定机制,以及在训练阶段引入反事实数据增强。更为深远的是,它激发了针对LVLMs生成内容的事实性验证方法研究,研究者开始将问题从“是否产生幻觉”转向“如何预测并修正幻觉”。同时,该数据集的四维任务分类框架已被后继的跨领域幻觉基准所借鉴,形成了评估泛化能力的新范式,推动了多模态模型走向更严谨的规范化评估体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务