遇见数据集

QLEVR

收藏
arXiv2022-05-06 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

QLEVR是一个用于量化语言和基础视觉推理的诊断数据集,由东北大学创建。该数据集包含100,000张合成图像和999,446个独特问题,旨在超越现有的存在性和数值量化,专注于更复杂的量化器及其组合。数据集创建过程中,通过自动构建场景图并生成合成图像,确保了图像中对象的位置、属性和关系的准确性。QLEVR的应用领域广泛,特别是在视觉问答系统中,用于测试和提高系统对复杂量化语言的理解和推理能力。

QLEVR is a diagnostic dataset for quantificational language and grounded visual reasoning, developed by Northeastern University. It comprises 100,000 synthetic images and 999,446 unique questions. Unlike existing datasets that focus solely on existential and numerical quantification, this dataset is designed to center on more complex quantifiers and their combinatorial applications. During its construction, scene graphs are automatically built and synthetic images are generated, ensuring the accuracy of object positions, attributes and relational details within the images. QLEVR has a wide range of application scenarios, especially in visual question answering (VQA) systems, where it is used to test and improve the systems' capabilities of understanding and reasoning about complex quantificational language.

提供机构:
东北大学
创建时间:
2022-05-06
搜集汇总
数据集介绍
QLEVR 数据集图片
构建方式
QLEVR数据集基于场景图自动构建,首先通过Blender渲染三维图像,图像中包含1至5个几何平面(三角形、矩形或圆形)和白色非几何平面,每个平面放置1至12个不同形状、颜色、材质和大小的三维物体。随后,依据广义量词理论设计671种问题模板,结合平面模板与物体模板,对场景图执行模型检验操作,生成涉及属性识别、计数、空间关系及量词推理的自然语言问题,最终产出100,000张图像与999,446道独特问题。
特点
该数据集聚焦于复杂量化语言与基础视觉推理,涵盖27种量词(如all、most、exactly N、at least F等)及其组合,问题长度显著长于CLEVR,平均包含30至40个单词。数据集通过拒绝采样确保答案分布均衡,避免无图像可答的偏差。每张图像对应10个来自不同问题族的问题,且问题几乎全部唯一,极少跨数据集分割重叠,从而有效诊断模型在量化推理上的薄弱环节。
使用方法
QLEVR适用于评估视觉问答系统在量化语言上的推理能力,使用时可将图像与问题输入模型,输出布尔型答案(True/False)。数据集已划分为训练集(70%)、验证集(15%)和测试集(15%),支持监督学习。研究者可利用其分析模型在不同量词类型、问题复杂度及平面数量上的表现,并可通过扩展问题族或添加新量词进一步定制测试,代码与数据均开源于GitHub。
背景与挑战
背景概述
在视觉问答(VQA)领域,合成数据集已被广泛用于诊断模型的推理能力,其中CLEVR数据集通过评估形状、颜色、大小、数值推理和存在性声明等能力,奠定了该方向的研究基础。然而,现有数据集在处理量化语言(quantificational language)方面存在显著不足,尤其是复杂量词及其组合的推理任务尚未得到充分探索。为弥补这一空白,美国东北大学的Zechen Li与哥本哈根大学的Anders Søgaard于2022年共同创建了QLEVR数据集,旨在系统性地测试VQA模型对广义量词(如“大多数”“至少”“除了”等)的理解与推理能力。该数据集包含10万张合成图像和近百万个独特问题,其问题平均长度远超以往数据集,覆盖27种量词类型及多种组合形式,为量化语言与基础视觉推理的交叉研究提供了关键诊断工具,对推动VQA模型在复杂语义理解方面的发展具有重要影响力。
当前挑战
QLEVR数据集面临的核心挑战在于量化语言的复杂性与视觉推理的深度交织。首先,量词推理本身涉及集合成员检测、基数比较及集合间关系推理,例如“大多数红色立方体是否在黄色球体右侧”这类问题要求模型同时处理属性识别、空间关系与量化逻辑,远超传统存在性声明或数值比较的难度。其次,数据集的构建过程中需确保图像与问题的平衡性,避免语言偏差导致的无图可答问题,同时通过接受-拒绝采样约束答案分布,这对模板设计与场景图生成提出了严苛要求。此外,量词间的蕴涵关系(如“全部”与“没有”的语义等价)增加了问题生成的复杂性,而多平面场景下的空间歧义性(如深度影响空间关系判断)进一步加大了视觉推理的挑战,导致现有模型(如MAC网络)在复杂量词上的准确率仅略高于纯文本基线,凸显出视觉特征提取与计数推理的瓶颈。
常用场景
经典使用场景
在视觉问答领域,QLEVR数据集被设计用于诊断模型对量化语言的理解能力,尤其是在涉及复杂量词及其组合的场景中。该数据集通过合成图像与模板化问题生成,要求模型不仅识别物体属性(如颜色、形状、材质),还需处理集合间的包含、计数与比例关系。例如,问题“图像中是否有多于两个比至少三个蓝色球小的红色球?”迫使模型进行多步推理,涵盖属性过滤、空间关系判断与数值比较。其经典使用场景聚焦于评估模型在结构化场景下对广义量词(如“大多数”、“恰好N个”、“至少F比例”)的语义解析与视觉对齐能力,为探究视觉推理的深层机制提供了可控的测试平台。
解决学术问题
QLEVR解决了现有视觉问答数据集(如CLEVR)在量化语言处理上的不足,填补了复杂量词推理研究的空白。学术上,它揭示了当前顶尖模型(如MAC、CNN+LSTM)在应对非数值量词(如“所有”、“大多数”)和阈值量词(如“多于N个”)时的显著性能下降,证实了纯文本模型(如BERT)能利用虚假相关性达到一定准确率,而视觉模型在复杂计数场景中依赖的ResNet特征信息有限。该数据集推动了视觉问答领域向更精细的语义诊断发展,促使研究者关注量化语言的逻辑结构(如对当方阵中的蕴涵关系),并强调了合成数据在隔离特定认知能力(如集合论推理)上的独特价值。
衍生相关工作
QLEVR的提出催生了一系列衍生工作,包括对量化语言在跨语言视觉问答中的扩展研究(如将量词类型学应用于非英语场景),以及基于其场景图的迁移学习探索(如利用二维图像与三维渲染的联合训练提升模型泛化能力)。受其启发,研究者进一步设计了针对假设性推理的CLEVR_HYP数据集,以及结合形容词语义的MALeViC数据集,共同构建了从简单属性识别到复杂量化推理的渐进式诊断体系。此外,QLEVR中量词对当方阵的嵌入方法被应用于文本蕴含系统的误差分析,推动了自然语言处理中量化表达的形式化建模。这些工作共同拓展了视觉与语言交叉领域的研究边界,凸显了合成数据集在理论验证与模型诊断中的不可替代性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务