遇见数据集

CLEVR-Dialog

收藏
arXiv2019-09-19 更新2024-06-21 收录
官方服务:

资源简介:

CLEVR-Dialog是由卡内基梅隆大学开发的一个大型诊断数据集,专注于研究视觉对话中的多轮推理。该数据集基于CLEVR图像,通过构建对话语法,为约85,000张图像生成了5个10轮对话实例,总计425,000个问答对。CLEVR-Dialog的特点是所有视觉对话方面均完全标注,适用于研究视觉参照解析等复杂挑战。数据集的应用领域包括训练和评估视觉对话模型,特别是在处理视觉参照和多轮对话推理方面的能力。

CLEVR-Dialog is a large-scale diagnostic dataset developed by Carnegie Mellon University, focusing on multi-turn reasoning in visual dialogue. By constructing dialogue grammars, it generates 5 instances of 10-turn dialogues for approximately 85,000 images, resulting in a total of 425,000 question-answer pairs. A notable feature of CLEVR-Dialog is that all aspects of visual dialogue are fully annotated, making it suitable for studying complex challenges such as visual reference resolution. The dataset can be employed to train and evaluate visual dialogue models, especially their capabilities in handling visual reference and multi-turn dialogue reasoning.

提供机构:
卡内基梅隆大学
创建时间:
2019-03-08
搜集汇总
数据集介绍
CLEVR-Dialog 数据集图片
构建方式
在视觉对话研究领域,多轮推理能力的评估常受限于真实数据集中标注的匮乏。为突破这一瓶颈,CLEVR-Dialog 数据集应运而生。其构建根植于 CLEVR 图像的场景图,通过精心设计的对话语法,将对话生成模拟为回答者与提问者之间的通信过程。回答者掌握完整场景图,生成基于图像的描述性标题;提问者仅依据对话历史构建的部分场景图,逐步提出三类问题(计数、存在性、属性查询),并通过束搜索算法确保对话的多样性与历史依赖性。最终,该数据集覆盖约 85,000 张 CLEVR 图像,每张图像包含 5 条 10 轮对话,总计 425 万问答对,所有视觉对话要素均被完整标注。
特点
CLEVR-Dialog 的核心特色在于其诊断性与可控性。与以往合成数据集(如 MNIST-Dialog)相比,该数据集的指代距离分布更为广泛(从 1 到 10 轮,均值 3.2),迫使模型必须深入理解对话历史才能正确解析指代关系。此外,其问题类型丰富多样,涵盖 23 种模板,词汇量达 125 词,问题平均长度 10.6 词,显著提升了语言多样性。尤为重要的是,由于场景图的全标注特性,数据集中每轮对话的指代链均可自动提取,使得研究者能够首次系统性地评估视觉对话模型在指代消解任务上的表现,而无需昂贵的人工标注。
使用方法
CLEVR-Dialog 为视觉对话模型的诊断性评估提供了理想平台。研究者可直接利用其全标注的对话历史与场景图,分析模型在不同指代距离、问题类型及历史依赖程度下的性能差异。例如,通过对比模型在需要指代消解的问题与独立问题上的准确率,可精准定位其推理瓶颈。该数据集还支持对文本与视觉定位能力的量化评估,借助预定义的指代短语标注与物体边界框,可计算归一化折损累计增益来度量模型注意力机制的准确性。代码与数据集均已公开,便于复现与扩展。
背景与挑战
背景概述
视觉对话作为多模态领域的前沿课题,要求智能体在图像基础上进行多轮问答,融合视觉感知、语言理解与逻辑推理能力。然而,现有真实数据集(如VisDial)因缺乏对图像场景与对话状态的完备标注,难以独立剖析模型在视觉、语言、推理及指代消解等子任务上的表现瓶颈。为突破这一困境,卡内基梅隆大学与Facebook AI Research的研究团队于2019年提出了CLEVR-Dialog数据集。该数据集基于CLEVR合成图像及其场景图,通过精心设计的对话语法自动生成10轮对话,涵盖约8.5万张图像、425万问答对。其核心研究问题聚焦于多轮推理中的视觉指代消解,首次实现了对模型在不同指代距离下性能的定量诊断,为视觉对话领域提供了可细粒度分析的基准平台。
当前挑战
CLEVR-Dialog所应对的核心挑战在于视觉对话中多轮推理的复杂性,尤其是视觉指代消解任务。真实场景中,指代短语与其先行词间的距离可跨越多个对话轮次(该数据集中从1到10轮不等),而现有模型(如CorefNMN)在处理此类长距离指代时,性能较无指代问题下降逾30个百分点,凸显了历史依赖建模的困难。此外,数据集构建过程本身亦面临挑战:需在保证对话多样性的同时,通过约束满足与束搜索算法生成符合语法规则且非冗余的问答序列,并确保计数、存在性及属性查询等23种问题类型的均衡分布,同时限制独立于历史的问题比例低于20%,以强化多轮推理的难度与诊断价值。
常用场景
经典使用场景
在视觉对话研究中,CLEVR-Dialog作为一个诊断性数据集,主要用于评估和剖析模型在多轮对话中的推理能力。其经典使用场景聚焦于视觉共指消解任务,即模型需在对话历史中追踪并正确关联当前问题与先前提及的同一视觉实体。通过合成图像与完全标注的场景图,研究者能够精确量化模型在不同共指距离下的表现,从而揭示其在复杂多轮交互中的瓶颈。该数据集为视觉对话领域提供了首个可细粒度拆解推理环节的标准化测试平台。
解决学术问题
CLEVR-Dialog解决了视觉对话研究中长期存在的难题:如何在缺乏完整标注的情况下,系统性地诊断模型在多轮推理中的缺陷。传统真实数据集因缺乏对图像状态(如实体、共指链)的穷举标注,导致研究者难以分离视觉、语言、推理等子挑战。该数据集通过合成图像与对话语法,实现了对每一轮对话中实体、共指关系及历史依赖的完全标注,从而首次支持了针对共指距离对模型性能影响的量化分析,为识别模型瓶颈提供了前所未有的洞察。
衍生相关工作
CLEVR-Dialog的诞生催生了一系列相关研究工作。其中,CorefNMN模型专门针对该数据集中的视觉共指消解挑战而设计,通过显式建模参考短语与图像实体的对应关系,取得了显著性能提升。此外,该数据集还启发了对历史依赖类型(如全局历史依赖与共指依赖)的细致分类研究,并促进了如HRE-QIH等模型在特定依赖类型上的优化。这些工作共同推动了视觉对话领域从端到端黑箱模型向可解释、可诊断模块化架构的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务