遇见数据集

OV-VG

收藏
arXiv2023-10-23 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

OV-VG数据集由北京航空航天大学电子信息工程学院的研究团队创建,旨在支持开放词汇视觉定位(OV-VG)研究。该数据集包含7272张从MS COCO选取的图像,涵盖10000个实例,分为基础类别和新颖类别,以促进对未预定义词汇中概念的理解。数据集的构建过程包括精细的类别选择和专业的标注策略,确保了数据的高质量和适用性。OV-VG数据集特别关注视觉与语言信息的精确对齐,适用于多种实际应用,如机器人导航和视觉对话,旨在解决复杂场景下的目标定位问题。

The OV-VG dataset was developed by the research team from the School of Electronic and Information Engineering, Beihang University, to support research on open-vocabulary visual grounding (OV-VG). It comprises 7272 images selected from MS COCO, covering 10,000 instances, and is categorized into base classes and novel classes, aiming to facilitate the comprehension of concepts in non-predefined vocabularies. The construction of the OV-VG dataset involves meticulous category selection and professional annotation strategies, which ensures high data quality and applicability. The OV-VG dataset specifically focuses on precise alignment between visual and linguistic information, and is applicable to various practical applications such as robot navigation and visual dialogue, with the goal of solving target localization problems in complex scenarios.

创建时间:
2023-10-23
搜集汇总
数据集介绍
OV-VG 数据集图片
构建方式
开放词汇视觉定位(OV-VG)数据集旨在应对传统视觉定位任务中无法识别新颖类别的挑战。其构建过程从MS COCO数据集中精选7,272张图像,确保与RefCOCO、RefCOCO+及RefCOCOg的训练集无重叠。基础类别沿用COCO的80个类别,而100个新颖类别则从LVIS数据集中选取,与COCO类别完全互斥,涵盖真实世界中多样化的物体。每张图像包含多个新颖类别实例,以增强任务难度。数据标注由6名专家完成,并经过双重质检,确保描述详尽,涵盖颜色、形状及物体间相对关系。边界框直接源自LVIS,但尺寸变化更大,包含大量小目标,以模拟现实场景。此外,从OV-VG中提取1,000张图像构建OV-PL子集,每个图像提供两条结构化描述,分别仅含基础类别或混合新颖类别,遵循Flickr30k Entities的标注格式。
特点
OV-VG数据集的核心特点在于其开放词汇设定与高度挑战性。它首次将视觉定位任务扩展至新颖类别识别,克服了传统方法依赖预定义词汇的局限。数据集包含10,000个实例,描述平均长度达9.32个单词,远超现有数据集,强调视觉-语言对齐的深度。边界框尺寸分布广泛,小目标占比显著,考验模型在复杂场景下的精准定位能力。新颖类别涵盖100种常见但易混淆的物体,如“按钮”、“铰链”等,导致现有最先进方法在无数据泄露时表现不佳。此外,OV-PL子集通过对比基础与新颖类别的描述,进一步评估模型在短语定位中的泛化能力。数据集的设计迫使模型必须理解长句中的语义关系,而非简单匹配视觉特征。
使用方法
使用OV-VG数据集时,研究者需基于图像-语言对进行开放词汇视觉定位训练与评估。模型输入包括图像与自然语言描述,输出为目标物体的边界框。推荐采用端到端架构,如结合CLIP视觉与文本编码器,并通过文本-图像查询选择(TIQS)和语言引导特征注意力(LGFA)模块增强跨模态对齐。训练时需避免数据泄露,例如仅在RefCOCO等基础类别数据上训练,并在OV-VG上测试新颖类别性能。评估指标以Acc50为主,按目标尺寸(小、中、大)分组统计。OV-PL子集则用于短语定位任务,采用Recall@1、Recall@5及Recall@10衡量模型对名词短语的定位精度。代码与数据集已开源,支持复现与扩展。
背景与挑战
背景概述
开放词汇学习作为视觉语言领域的前沿方向,旨在突破预定义词汇表的限制,使模型能够理解新颖概念。视觉定位(Visual Grounding, VG)作为该领域的关键任务,致力于根据自然语言描述在图像中精准定位目标区域。然而,现有视觉定位方法受限于封闭集假设,难以应对开放场景中涌现的新类别。为此,北京航空航天大学与南洋理工大学的研究团队于2023年提出了开放词汇视觉定位基准数据集OV-VG,该数据集包含7,272张图像与10,000个实例,涵盖100个新颖类别,并配套发布了开放词汇短语定位数据集OV-PL。该工作通过精心设计的标注策略与创新性网络架构,为视觉语言理解领域提供了全新研究范式,显著推动了开放场景下目标定位技术的发展。
当前挑战
OV-VG数据集面临的核心挑战涵盖三个层面。其一,任务层面需解决开放词汇视觉定位的领域难题,即在缺乏新颖类别标注的情况下,模型需仅依赖基础类别知识实现对未知目标的精准定位,这对视觉-语言语义对齐能力提出了极高要求。其二,数据集构建过程中面临多重困境:图像与类别需严格独立于现有训练集以避免数据泄露;标注需包含丰富属性描述与复杂空间关系,平均描述长度达9.32词;目标尺度差异悬殊,小目标占比显著高于传统VG数据集,部分目标面积不足32×32像素。其三,实验表明现有最先进方法在无数据泄露场景下表现欠佳,Acc50仅约3.64%,且对词汇混淆、极小目标及多目标场景的定位存在系统性失效。
常用场景
经典使用场景
OV-VG数据集专为开放词汇视觉定位任务设计,其经典使用场景在于评估和提升模型对未见过类别目标的定位能力。研究人员利用该数据集测试模型在复杂场景中,依据自然语言描述(如“戴着红色头盔的男人”)精准定位目标区域的效果,尤其关注模型对新颖类别(如“头盔”、“滑雪杖”)的泛化性能。该数据集包含7272张图像和10000个实例,覆盖100个新颖类别,且描述语句平均长度达9.32词,远长于传统数据集,从而挑战模型对细粒度语义和空间关系的理解。
实际应用
在实际应用中,OV-VG数据集赋能了机器人导航、视觉对话和自动驾驶等领域的开放场景理解。例如,机器人可依据“左数第二个抽屉”等自然语言指令,精准抓取未知物体;自动驾驶系统能根据“公交车左侧的雨刮器”等描述,实时定位道路元素。该数据集强调的目标尺度多样性(从小型按钮到大面积标牌)和长尾分布,模拟了真实世界的复杂性,使模型在工业质检、智能监控和辅助视觉系统中展现出更强的鲁棒性。此外,其衍生任务开放词汇短语定位(OV-PL)进一步提升了图像字幕生成和人机交互的语义精确度。
衍生相关工作
OV-VG数据集催生了多项经典研究工作,包括基于Grounding DINO的改进框架、GLIP和FIBER的短语定位优化,以及X-Decoder、SEEM等通用分割模型的跨任务迁移。研究者在其基础上提出了TIQS与LGFA模块,通过跨模态注意力机制增强视觉-语言对齐,并在数据泄露场景下验证了模块的有效性。此外,该数据集推动了开放词汇学习在视频理解(如Kosmos-2)和3D场景分析中的拓展,启发了如OpenSeeD等统一检测-分割架构的诞生。其100个新颖类别的细粒度分析(如“婴儿车”准确率70%,“按钮”仅15%)为后续研究提供了明确改进方向,促使领域聚焦于小目标定位和语义混淆消除等核心挑战。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务