遇见数据集

ranjaykrishna/visual_genome

收藏
Hugging Face2023-06-29 更新2024-06-15 收录
官方服务:

资源简介:

Visual Genome是一个数据集和知识库,旨在将结构化的图像概念与语言连接起来。它包含108,077张图像,5.4百万区域描述,1.7百万视觉问答,3.8百万对象实例,2.8百万属性和2.3百万关系。该数据集主要用于图像到文本、对象检测和视觉问答等任务,所有注释均使用英语。

Visual Genome is a dataset and knowledge base designed to connect structured image concepts with language. It contains 108,077 images, 5.4 million region descriptions, 1.7 million visual question answering (VQA) pairs, 3.8 million object instances, 2.8 million attributes, and 2.3 million relationships. This dataset is primarily used for tasks including image-to-text generation, object detection, and visual question answering, and all annotations are in English.

提供机构:
ranjaykrishna
原始信息汇总

数据集概述

数据集基本信息

  • 名称: VisualGenome
  • 语言: 英语
  • 许可证: CC BY 4.0
  • 多语言性: 单语种
  • 数据量: 100K<n<1M
  • 源数据: 原始数据
  • 任务类别:
    • 图像到文本
    • 目标检测
    • 视觉问答
  • 任务ID: 图像描述
  • PapersWithCode ID: visual-genome

数据集内容

  • 图像: 108,077张
  • 区域描述: 540万条
  • 视觉问答: 170万条
  • 对象实例: 380万条
  • 属性: 280万条
  • 关系: 230万条

数据结构

特征

  • 图像: 图像数据
  • image_id: 图像唯一ID
  • url: 图像源URL
  • width: 图像宽度
  • height: 图像高度
  • coco_id: COCO索引ID
  • flickr_id: Flickr索引ID
  • regions: 区域列表
    • region_id: 区域唯一ID
    • image_id: 图像唯一ID
    • phrase: 区域描述
    • x: 区域左上角x坐标
    • y: 区域左上角y坐标
    • width: 区域宽度
    • height: 区域高度

配置

  • 配置名称: region_descriptions_v1.0.0
  • 分割:
    • train: 108077个样本

数据字段

  • region_descriptions:

    • image: 图像数据
    • image_id: 图像唯一ID
    • url: 图像源URL
    • width: 图像宽度
    • height: 图像高度
    • coco_id: COCO索引ID
    • flickr_id: Flickr索引ID
    • regions: 区域列表
      • region_id: 区域唯一ID
      • image_id: 图像唯一ID
      • phrase: 区域描述
      • x: 区域左上角x坐标
      • y: 区域左上角y坐标
      • width: 区域宽度
      • height: 区域高度
  • objects:

    • image: 图像数据
    • image_id: 图像唯一ID
    • url: 图像源URL
    • width: 图像宽度
    • height: 图像高度
    • coco_id: COCO索引ID
    • flickr_id: Flickr索引ID
    • objects: 对象列表
      • object_id: 对象唯一ID
      • x: 对象左上角x坐标
      • y: 对象左上角y坐标
      • w: 对象宽度
      • h: 对象高度
      • names: 对象名称列表
      • synsets: WordNet同义词集列表
  • attributes:

    • image: 图像数据
    • image_id: 图像唯一ID
    • url: 图像源URL
    • width: 图像宽度
    • height: 图像高度
    • coco_id: COCO索引ID
    • flickr_id: Flickr索引ID
    • attributes: 属性列表
      • object_id: 对象唯一ID
      • x: 对象左上角x坐标
      • y: 对象左上角y坐标
      • w: 对象宽度
      • h: 对象高度
      • names: 对象名称列表
      • synsets: WordNet同义词集列表
      • attributes: 对象属性列表
  • relationships:

    • image: 图像数据
    • image_id: 图像唯一ID
    • url: 图像源URL
    • width: 图像宽度
    • height: 图像高度
    • coco_id: COCO索引ID
    • flickr_id: Flickr索引ID
    • relationships: 关系列表
      • relationship_id: 关系唯一ID
      • predicate: 关系谓词
      • synsets: WordNet同义词集列表
      • subject: 主体对象
      • object: 客体对象
  • question_answers:

    • image: 图像数据
    • image_id: 图像唯一ID
    • url: 图像源URL
    • width: 图像宽度
    • height: 图像高度
    • coco_id: COCO索引ID
    • flickr_id: Flickr索引ID
    • qas: 问答列表
      • qa_id: 问答唯一ID
      • image_id: 图像唯一ID
      • question: 问题
      • answer: 答案
      • q_objects: 问题关联对象
      • a_objects: 答案关联对象

数据分割

  • train: 108077个样本

数据集创建

  • 注释创建者: 通过Amazon Mechanical Turk收集,共有超过33,000名独特工作者参与。
  • 注释过程: 通过AMT进行,每个HIT设计为工作者每小时赚取$6-$8,符合伦理研究标准。
  • 注释者信息: 93.02%来自美国,年龄主要在25-34岁之间,54.15%为男性,45.85%为女性。

许可证信息

  • 许可证: Creative Commons Attribution 4.0 International License

引用信息

bibtex @article{Krishna2016VisualGC, title={Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations}, author={Ranjay Krishna and Yuke Zhu and Oliver Groth and Justin Johnson and Kenji Hata and Joshua Kravitz and Stephanie Chen and Yannis Kalantidis and Li-Jia Li and David A. Shamma and Michael S. Bernstein and Li Fei-Fei}, journal={International Journal of Computer Vision}, year={2017}, volume={123}, pages={32-73}, url={https://doi.org/10.1007/s11263-016-0981-7}, doi={10.1007/s11263-016-0981-7} }

搜集汇总
数据集介绍
ranjaykrishna/visual_genome 数据集图片
构建方式
Visual Genome 数据集旨在弥合计算机视觉与自然语言之间的鸿沟,通过密集标注构建了一个图像概念与语言描述相连接的知识库。该数据集以108,077张图像为基础,借助亚马逊土耳其机器人(AMT)平台,动员了超过33,000名标注员,在六个月内完成了约80万次人工任务。每张图像平均包含35个物体、26个属性和21个成对关系,所有标注均被规范化至WordNet同义词集,形成了包括区域描述、视觉问答、物体实例、属性及关系在内的多层次结构化数据。
使用方法
该数据集通过HuggingFace Datasets库加载,支持五种配置:region_descriptions、objects、attributes、relationships和question_answers。使用时需指定版本后缀,例如`load_dataset("visual_genome", "region_description_v1.2.0")`。所有数据均位于训练集内,图像以PIL对象自动解码。用户可根据任务需求选择相应配置,如利用区域描述进行图像字幕生成,或借助问答对训练视觉推理模型。数据字段包含边界框坐标和WordNet同义词,便于与预训练模型集成,但需注意大规模图像解码可能耗时,建议先查询样本索引再访问图像列。
背景与挑战
背景概述
Visual Genome数据集由斯坦福大学和华盛顿大学的研究团队于2016年创建,核心研究人员包括Ranjay Krishna、李飞飞等人,旨在弥补计算机视觉在认知任务上的不足。该数据集包含超过10万张图像,每张图像平均标注35个对象、26个属性和21个关系,并提供了540万条区域描述、170万个视觉问答对以及丰富的对象、属性和关系实例。其核心研究问题在于超越传统图像分类等感知任务,推动模型对图像中对象间交互与关系的理解,从而支撑图像描述、视觉问答等认知任务的突破。作为连接语言与视觉的桥梁,Visual Genome对计算机视觉与自然语言处理交叉领域产生了深远影响,为场景图生成、视觉推理等方向奠定了重要基准。
当前挑战
Visual Genome所解决的领域挑战在于传统数据集仅聚焦于感知任务(如图像分类),而缺乏对图像中对象间复杂关系和属性的结构化描述,导致模型在认知任务上表现欠佳。该数据集通过密集的语义标注,迫使模型学习对象间的空间、语义和逻辑关系。在构建过程中,研究团队面临多重挑战:首先,需要设计统一的标注框架以兼容对象、属性、关系和问答等多种信息;其次,依赖亚马逊机械众包平台,动员超过3.3万名标注员在6个月内完成约80万次任务,需保证标注质量与一致性;此外,数据规模庞大导致存储与处理开销显著,且需通过WordNet同义词集对标注进行规范化,以维护语义的连贯性。
常用场景
经典使用场景
Visual Genome 数据集以其对图像中对象、属性及对象间关系的细粒度标注而著称,为场景图生成(Scene Graph Generation)任务提供了黄金标准。研究者利用其超过10万张图像及数百万对关系三元组(如“人骑马车”),训练模型从像素层面自动构建结构化的场景图,从而实现对复杂视觉场景的深度理解。这一经典使用场景推动了计算机视觉从简单的物体识别迈向关系推理的关键一步。
解决学术问题
该数据集核心解决了视觉认知任务中“关系理解”缺失的学术瓶颈。传统数据集(如ImageNet、COCO)侧重物体分类与检测,难以支撑“人骑何物”这类需推理对象间交互的问题。Visual Genome通过提供密集的关系标注(如“骑”、“拉”)和属性标注(如“绿色的钟”),使模型能够学习视觉语义的拓扑结构,显著提升了视觉问答(VQA)与图像描述(Captioning)的推理能力,为认知型AI研究奠定了数据基础。
实际应用
在实际应用中,Visual Genome 的细粒度关系知识被广泛用于智能驾驶中的场景解析(如识别“行人正穿过斑马线”)、工业质检中的部件关系校验,以及交互式机器人导航(理解“杯子在桌子的左边”等指令)。其问答对(1.7百万组)还赋能了多模态对话系统,使虚拟助手能基于图像内容进行更精准的上下文推理,例如在辅助视障人士的应用中回答“冰箱里有什么食物?”等复杂问题。
数据集最近研究
最新研究方向
Visual Genome数据集以其密集的场景图标注和丰富的视觉-语言关联信息,正成为多模态认知推理研究的核心基石。当前前沿方向聚焦于利用其超过200万对关系三元组和540万区域描述,推动场景图生成(SGG)与视觉问答(VQA)的深度融合。在大语言模型与视觉语言模型(如CLIP、GPT-4V)迅猛发展的背景下,该数据集被广泛用于训练模型理解对象间细粒度交互与复杂语义关系,例如在自动驾驶场景中解析“人骑马车”这类隐含因果链的视觉逻辑。其与WordNet对齐的规范化本体设计,为构建可解释的视觉常识推理系统提供了关键支撑,同时催生了多项关于场景图鲁棒性、长尾关系预测及跨模态对齐的热点研究,深刻影响着从智能机器人交互到医疗影像分析的认知计算范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务