zhenfen1/MHaluBench
收藏官方服务:
资源简介:
MHaluBench是一个用于多模态大型语言模型(MLLMs)幻觉检测的基准测试数据集,包含图像到文本和文本到图像生成的内容,旨在严格评估多模态幻觉检测器的进展。数据集统计信息包括不同任务(如图像描述和文本到图像合成)的声明级别数据统计,以及幻觉标签声明中幻觉类别的分布。
MHaluBench is a benchmark dataset for hallucination detection in multimodal large language models (MLLMs), encompassing content from image-to-text and text-to-image generation, aiming to rigorously assess the advancements in multimodal hallucination detectors. The dataset includes claim-level data statistics for different tasks (e.g., image captioning and text-to-image synthesis) and the distribution of hallucination categories within hallucination-labeled claims.
提供机构:
zhenfen1搜集汇总
数据集介绍

构建方式
MHaluBench的构建旨在为多模态大语言模型的幻觉检测提供元评估基准。该数据集整合了图像描述和文本到图像生成两大任务场景,通过系统收集来自不同MLLMs生成的图文对,并采用统一的多模态幻觉分类体系进行标注。具体而言,每个样本包含视觉输入(图像或合成视觉输出)与对应的文本响应,其中文本被细化为多个声明(claims),由人工标注者依据对象、属性、场景文本等模态冲突及事实冲突的细粒度分类标准,判定每个声明是否为幻觉。数据覆盖1K至10K规模,并划分为训练集与验证集,验证集历经版本迭代以修正标签一致性。
使用方法
使用MHaluBench时,用户可通过HuggingFace平台直接加载预划分的训练集(MHaluBench_train.json)与验证集(MHaluBench_val-v0.1.json)。数据集与EasyDetect框架无缝集成,用户需配置YAML文件以指定工具参数(如GroundingDINO、OCR模型及外部知识API),随后调用Pipeline.run()方法输入文本与图像路径,即可获取声明级别的幻觉检测结果。框架支持图像到文本与文本到图像两种模式,并允许用户自定义检测工具链。此外,预训练的HalDet-LLaVA模型(7B/13B)可从HuggingFace等平台下载,用于直接推理或微调,以加速研究实验。
背景与挑战
背景概述
多模态大语言模型(MLLMs)在图像理解与文本生成领域取得了突破性进展,然而其生成内容常与视觉输入或事实知识产生偏差,即多模态幻觉问题,严重制约了模型在高可靠性场景中的部署。为系统评估与推动该问题的研究,浙江大学等机构的研究团队于2024年2月发布了MHaluBench数据集。该数据集由陈翔、王晨曦等研究人员主导,依托OpenKG社区,旨在为多模态幻觉检测提供统一的元评估基准。MHaluBench涵盖了图像描述与文本到图像生成两大任务,包含数千条细粒度标注的声明级数据,覆盖模态冲突幻觉(如对象、属性、场景文本错误)与事实冲突幻觉,为检测器的性能度量提供了标准化平台。其发布迅速引起了学术界对多模态幻觉检测的广泛关注,成为该领域重要的评估资源。
当前挑战
MHaluBench数据集所应对的核心挑战在于多模态幻觉检测的复杂性与统一性。首先,领域问题层面,现有检测方法多局限于单一模态或特定幻觉类型,难以覆盖MLLMs中多样化的错误形式,如对象误判、属性冲突、场景文本偏差及事实不一致,亟需一个综合性的评估框架来推动检测技术的全面发展。其次,构建过程中,研究团队面临标注粒度与一致性的难题:需将每条多模态输出拆解为细粒度的声明,并确保不同标注者及跨任务(图像到文本与文本到图像)的标签标准统一。此外,幻觉类别分布不均衡增加了数据采集与标注的难度,而多模态证据的自动收集与验证则对工具链的鲁棒性提出了更高要求。这些挑战使得MHaluBench的构建成为一项兼具理论深度与工程复杂性的工作。
常用场景
经典使用场景
在多模态大语言模型(MLLMs)蓬勃发展的时代,幻觉问题犹如悬顶之剑,严重制约着模型的可靠性与可信度。MHaluBench数据集应运而生,其最为经典的使用场景便是作为元评估基准,系统性地评测各类多模态幻觉检测器的性能。该数据集精心涵盖了图像到文本与文本到图像两种生成任务,通过对细粒度声明级别的标注,为研究者提供了一个标准化的测试平台,用以客观衡量不同检测方法在识别物体、属性、场景文本等模态冲突幻觉以及事实冲突幻觉时的准确性与鲁棒性。
解决学术问题
MHaluBench的构建直击了多模态幻觉检测领域长期存在的学术痛点——缺乏统一、全面且细粒度的评估基准。此前的研究往往各自为政,检测范畴与评估标准不一,导致不同方法间难以进行公平比较。该数据集通过提出统一的幻觉分类体系(模态冲突与事实冲突),并定义细粒度的声明级检测任务,首次为学界提供了一个系统性的评估框架。其意义在于推动了幻觉检测从碎片化走向标准化,使得研究者能够精准定位检测器的优势与不足,进而为开发更可靠、更可信的多模态大语言模型奠定了坚实的评测基础。
实际应用
在实际应用中,MHaluBench所推动的幻觉检测技术具有广阔的应用前景。例如,在自动图像描述生成系统中,部署经该基准验证的检测器可以有效过滤掉描述中错误的对象、颜色或场景文本,确保输出内容的准确性,这对于视障辅助技术至关重要。在文本到图像生成领域,如AI绘画工具,检测器能够核查生成的图像是否忠实反映了用户提示中的事实知识,避免出现违背常识的视觉谬误,从而提升生成内容的质量与可信度。此外,在内容审核、人机交互等场景中,基于MHaluBench的检测能力也能有效识别并纠正多模态信息中的不一致与错误。
数据集最近研究
最新研究方向
随着多模态大语言模型(MLLMs)在视觉与语言任务中的广泛应用,幻觉问题已成为制约其可靠性的核心挑战。MHaluBench数据集聚焦于多模态幻觉的统一检测,涵盖图像描述与文本生成图像两大任务,系统性地评估对象、属性、场景文本等模态冲突幻觉以及事实冲突幻觉。该基准的提出源于对GPT-4V、Gemini等前沿模型幻觉现象的深入剖析,其标注数据覆盖细粒度的声明级别,为检测器的鲁棒性评价提供了标准化平台。当前研究热点集中在利用UniHD框架融合外部工具(如GroundingDINO、OCR)进行多模态证据收集,以实现对幻觉的精准定位与解释。这一方向不仅推动了MLLMs在安全、医疗等高风险领域的可信部署,更通过开源模型HalDet-LLaVA的发布,加速了学术界与工业界对幻觉检测技术的协同创新,具有重要的理论价值与应用前景。
以上内容由遇见数据集搜集并总结生成



