遇见数据集

CLEVR-X

收藏
arXiv2022-04-06 更新2024-06-21 收录
官方服务:

资源简介:

CLEVR-X数据集是由德国图宾根大学创建的,旨在通过自然语言解释增强视觉问题回答(VQA)的能力。该数据集包含360万个解释,对应于85万个图像-问题对。每个解释都是从场景图中生成的,确保了信息的准确性和完整性。CLEVR-X特别适用于分析和改进VQA系统中的解释生成过程,尤其是在需要详细推理和理解图像内容的场景中。数据集的应用领域包括机器学习、人工智能以及视觉和语言处理的研究,旨在提高模型的透明度和解释性,增强人机交互的信任和效率。

The CLEVR-X dataset was constructed by the University of Tübingen in Germany, with the aim of enhancing the performance of visual question answering (VQA) systems through natural language explanations. This dataset comprises 3.6 million explanations, which correspond to 850,000 image-question pairs. Every explanation is generated from a scene graph, thus guaranteeing the accuracy and completeness of the contained information. CLEVR-X is specifically designed for analyzing and refining the explanation generation module within VQA systems, particularly in scenarios that demand elaborate reasoning and thorough comprehension of image content. The application scenarios of this dataset span research in machine learning, artificial intelligence, and vision-and-language processing, with the objectives of boosting model transparency and interpretability, as well as strengthening trust and efficiency in human-computer interaction.

提供机构:
图宾根大学
创建时间:
2022-04-06
搜集汇总
数据集介绍
CLEVR-X 数据集图片
构建方式
在视觉问答(VQA)领域,自然语言解释的生成是提升模型透明度的关键挑战。CLEVR-X数据集基于CLEVR场景图,通过三步构建:首先,针对每个图像-问题对,执行对应的功能程序并在场景图上追踪其执行过程,记录所有中间输出;其次,进行相关性过滤,仅保留与问题相关的对象属性,并确保形状属性始终被提及以维持可读性;最后,利用多种自然语言模板,将追踪结果填充为结构化解释,并通过同义词随机采样、对象顺序随机化以及重复描述聚合(如使用数字合并相同对象)来生成多样化且语法正确的文本。该流程避免了人类标注的误差,确保了解释的完整性与正确性。
特点
CLEVR-X数据集具有显著的结构化优势。其解释完全由场景图自动生成,无需外部先验知识,且每个图像-问题对平均包含4.29个不同表述的参考解释,覆盖了正确解释空间的广泛范围。与VQA-X和e-SNLI-VE等数据集相比,CLEVR-X的词汇量虽小(仅96个单词),但解释长度与问题复杂度高度相关(斯皮尔曼相关系数0.89),且通过用户研究验证了99.67%的零跳问题相关性和92.19%的整体完整性。数据集包含9种问题类型和3种答案类型(二进制、计数、属性),特别支持对计数难题(如比较整数问题)的细粒度诊断分析,这是其他数据集所缺乏的。
使用方法
CLEVR-X适用于训练和评估VQA模型中的解释生成模块。使用时,模型需联合预测答案并生成自然语言解释,评估指标包括BLEU-4、METEOR、ROUGE-L和CIDEr,且仅对正确回答的样本计算解释质量。数据集提供官方训练/验证/测试划分(基于图像级分割避免重叠),并支持通过控制参考解释数量(1至10个)来研究指标收敛性。研究者可基于场景图扩展至其他数据集(如CLEVR-CoGenT),或利用问题族、复杂度等元数据对模型性能进行分组分析。代码与数据均公开在https://github.com/ExplainableML/CLEVR-X。
背景与挑战
背景概述
在视觉问答(VQA)领域,为模型决策提供自然语言解释是提升深度学习系统透明度与人类信任的关键步骤。然而,现有解释数据集如VQA-X和e-SNLI-VE,其人工生成的解释质量参差不齐,常包含冗余、不完整或依赖外部常识的表述,难以系统分析解释生成方法的优劣。为弥补这一空白,来自德国图宾根大学、马克斯·普朗克信息学研究所及智能系统研究所的研究团队于2022年提出了CLEVR-X数据集。该数据集以合成图像为基础,在经典的CLEVR数据集上扩展了约360万条结构化自然语言解释,覆盖85万对图像-问题样本。其核心创新在于利用场景图与功能程序追踪自动生成正确且完整的解释,并通过用户研究验证了人类可解析性。CLEVR-X为诊断VQA模型的视觉推理与解释生成能力提供了可控、可细粒度分析的标准化基准,对推动可解释人工智能研究具有重要价值。
当前挑战
CLEVR-X所面临的挑战主要源于其领域问题与构建过程。在领域层面,该数据集聚焦于VQA中自然语言解释生成的准确性、完整性与忠实性,尤其针对计数问题(如“有多少个红色物体?”)这一长期难题,现有模型在计数型答案上的解释质量显著低于属性型答案,METEOR得分差距达6个百分点。在构建过程中,挑战在于如何从场景图自动生成既正确又简洁的解释:需通过追踪功能程序记录所有相关对象,同时进行相关性过滤以避免冗余(如仅提及问题中涉及的属性),并设计多样化的语言模板与同义词采样以覆盖解释空间。此外,用户研究显示,复杂问题类型(如比较整数类)的工人准确率仅77%,表明解释的可读性与人类认知一致性仍需优化。这些挑战共同制约了CLEVR-X在细粒度诊断与模型评估中的效能,也指明了未来改进方向。
常用场景
经典使用场景
在视觉问答与可解释人工智能的交汇领域,CLEVR-X数据集被广泛用于评估和提升模型生成自然语言解释的能力。其经典使用场景是作为诊断性基准,测试模型在合成场景中回答关于物体属性、空间关系及计数问题的同时,能否生成准确、完整且与图像内容一致的文本解释。由于CLEVR-X中的解释源自场景图的系统化构造,研究者可借此精确衡量模型在零跳、一跳至多跳推理任务中的解释质量,从而深入剖析视觉推理链条的薄弱环节。
实际应用
在实际应用中,CLEVR-X数据集为构建透明可信的视觉问答系统提供了关键支撑。例如,在自动驾驶场景中,模型需解释为何检测到前方障碍物并做出决策;在智能教育领域,它可用于训练系统在解答几何或物理题目时,阐述推理步骤。此外,该数据集的合成特性使其适用于工业质检,当模型识别出产品缺陷时,能生成如“左侧红色金属球右侧的青色圆柱体存在划痕”之类的明确解释,从而增强人机协作的信任度。
衍生相关工作
CLEVR-X数据集的提出催生了一系列衍生工作,推动了可解释视觉推理的边界拓展。例如,研究者基于其结构化场景图构建了CLEVR-XAI-simple与CLEVR-XAI-complex数据集,用于评估热力图类视觉解释的准确性;同时,CLOSURE基准利用CLEVR的渲染引擎衡量模型在组合泛化任务上的表现。此外,CLEVR-X的多参考解释特性启发了对自然语言生成指标(如BLEU、CIDEr)收敛行为的深入分析,促使后续工作探索更鲁棒的解释评估方法。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务