遇见数据集

Cops-Ref

收藏
arXiv2020-03-01 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

Cops-Ref数据集由香港大学创建,专注于组合指称表达理解,旨在通过复杂的语言表达识别图像中的特定对象。该数据集包含148,712条表达式,基于真实世界图像,强调视觉真实性和语义丰富性。数据集的创建过程中,设计了六种逻辑形式,灵活结合丰富的视觉信息生成具有不同组合性的表达式。Cops-Ref的应用领域包括视觉问答和视觉对话,旨在解决模型在复杂视觉场景中理解和定位对象的问题。

The Cops-Ref dataset, created by The University of Hong Kong, focuses on compositional referring expression comprehension, with the goal of identifying specific objects in images via complex linguistic expressions. This dataset comprises 148,712 expressions, which are developed based on real-world images and prioritize visual authenticity and semantic richness. During the dataset construction process, six logical forms were designed to flexibly combine rich visual information and generate expressions with diverse levels of compositionality. The application domains of Cops-Ref include visual question answering (VQA) and visual dialogue, aiming to address the challenges of models understanding and localizing objects in complex visual scenes.

提供机构:
香港大学
创建时间:
2020-03-01
搜集汇总
数据集介绍
Cops-Ref 数据集图片
构建方式
Cops-Ref数据集的构建依托于GQA真实图像及其场景图标注,核心创新在于设计了一个新颖的表达引擎。该引擎定义了六种抽象的逻辑形式(链式、与、或、顺序、相同、非),这些逻辑可灵活地与丰富的视觉属性(如对象类别、属性、位置及交互)组合,生成具有不同组合性的描述性表达。具体而言,对于每个待描述区域,首先从预定义的逻辑家族中选择一种逻辑形式并获取对应的文本模板,随后以场景图中的目标对象节点为根,扩展出特定的推理树以填充模板,最终生成语法正确且无歧义的复杂表达。此外,数据集的测试集引入了四类具有可控干扰因素的图像(如包含相同类别或属性的对象),以削弱无推理的跨域对齐成功率。
特点
Cops-Ref数据集具备两大显著特征。其一,表达具有高度组合性与逻辑性,涵盖链式推理、属性否定、空间顺序等六种逻辑形式,且这些基本逻辑可相互嵌套以形成更复杂的推理链,从而全面评估模型的深层推理能力。其二,测试阶段创新性地引入了包含视觉相似干扰物的图像集,包括不同类别、相同类别、相同类别与属性以及相同对象但不同关系等四类干扰,迫使模型必须完整理解表达中的完整推理链条并区分细微视觉差异。该数据集包含148,712个表达和1,307,885个区域,平均表达长度达14.4个词,对象类别、属性和关系分别达508、601和299种,显著优于现有数据集。
使用方法
Cops-Ref任务的典型使用方式为:给定一条自然语言表达和一组视觉相似的图像,模型需从所有图像的区域候选中定位出表达所指的目标区域。由于训练阶段不提供干扰图像,现有REF模型可直接通过密集匹配表达与每个区域并选取最高得分来应用。为应对跨图像的困难负样本,论文提出基于模块的硬挖掘策略(MattNet-Mine),利用表达中不同模块(主体、位置、关系)的嵌入相似性,从同类别区域-表达对中采样困难负例并加入排序损失进行训练。评估指标采用准确率,即模型是否能在包含干扰的图像集中正确选出目标区域。实验表明,该策略在完整干扰场景下显著优于基线模型,但仍留有较大提升空间。
背景与挑战
背景概述
在视觉与语言交叉领域,指代表达理解(REF)任务要求模型依据自然语言描述在场景中精准定位目标对象,是评估视觉推理能力的重要基石。然而,既有数据集如refCOCO和refCOCOg,受限于表达式的简短性与图像中干扰信息的匮乏,难以充分激发模型的深层推理潜能。为弥补这一缺憾,Zhenfang Chen等人于2020年联合香港大学、伍伦贡大学、腾讯AI Lab及阿德莱德大学的研究团队,基于GQA真实场景图,构建了Cops-Ref数据集。该数据集通过设计六种推理逻辑引擎(链、与、或、顺序、相同、非)生成组合性丰富的表达式,并引入包含相似视觉属性的干扰图像,开创了组合性指代表达理解的新任务,显著提升了视觉推理的评估难度与深度,对推动REF领域从浅层匹配向复杂推理演进产生了重要影响。
当前挑战
Cops-Ref数据集面临的核心挑战在于其旨在解决的领域问题:现有REF模型在面对需完整推理表达式语义、区分细微视觉差异的组合性描述时,常因依赖浅层特征(如物体类别或简单属性)而失效,尤其是在干扰图像包含同类别、同属性甚至同关系物体的场景下,模型性能急剧下降。此外,数据集构建过程中亦遭遇多重障碍:如何从GQA的密集场景图中自动提取并组合多样化的推理树,以保证表达式既符合语法又具备歧义消除能力;如何高效发现并筛选出四类具有渐进干扰性的图像(从不同类别到完整推理树对象),以构建公正的测试环境;以及如何后处理以消除场景图标注错误、类别不平衡和简单空间关系偏置,确保数据集的真实性与挑战性。这些挑战共同使得Cops-Ref成为评估视觉推理能力的严峻试金石。
常用场景
经典使用场景
在视觉与语言交叉领域,Cops-Ref数据集最经典的使用场景是作为组合式指代表达理解(Compositional Referring Expression Comprehension)的基准测试平台。该数据集基于真实图像GQA构建,通过设计六种推理逻辑(如链式、与、或、顺序、相同、否定)与丰富的视觉属性灵活组合,生成具有不同组合层次的复杂指代表达。研究者常利用该数据集评估模型在多重干扰图像中定位目标对象的能力,这些干扰图像包含与目标共享相似视觉属性的物体,从而迫使模型必须完整理解表达式的推理链条而非依赖浅层跨域对齐。该场景特别适用于测试模型在对象识别、属性判别和关系抽取等细粒度视觉推理方面的综合表现。
实际应用
在实际应用层面,Cops-Ref数据集所倡导的细粒度组合式推理能力对于人机交互系统具有重要价值。例如,在智能机器人辅助场景中,用户可能发出如“左侧那只躺在白色毛巾上睡觉的猫”的复杂指令,系统需在视觉环境存在多个相似物体时精准抓取目标。该数据集模拟了现实世界中因光照、遮挡或类别相似性导致的歧义挑战,可应用于增强现实中的物体识别、自动驾驶中的行人意图理解以及医疗影像中的病灶定位。此外,其模块化硬挖掘策略为工业界构建鲁棒的视觉问答系统提供了方法论基础,尤其适用于需要区分细微视觉差异的高精度检索任务。
衍生相关工作
Cops-Ref数据集的提出催生了多项衍生研究工作。在模型层面,基于其模块化硬挖掘策略的MattNet-Mine模型成为处理组合式指代表达的强基线,后续研究者在此基础上发展了更高效的跨模态注意力擦除机制(CM-Att-Erase)和图注意力网络(Neighbourhood Watch)。在任务扩展方面,该数据集启发了将文本检索与指代理解结合的“检索+REF”两阶段策略,以及针对不同推理逻辑形式(如顺序、否定)的专项优化方法。此外,Cops-Ref的表达式引擎设计理念被迁移至视觉对话和视觉问答领域,推动了场景图解析与组合式语言理解的研究进展,其影响力已延伸至多模态预训练模型的推理能力诊断基准构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务