遇见数据集

vg

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

该数据集是经过结构化处理的Visual Genome场景图数据集,可通过Hugging Face datasets库直接加载。它基于Visual Genome数据集,专门用于场景图生成、视觉关系检测等计算机视觉任务。数据集包含89,154张图像样本,划分为62,407个训练样本、8,915个验证样本和17,832个测试样本。每张图像都附有详细的场景图标注,包括对象边界框(格式为[x_min, y_min, x_max, y_max])、对象类别标签(采用VG150体系,包含150个前景对象类别,如airplane、animal、car等,以及一个__background__类别)、属性标签(200个前景属性类别,如颜色、大小、材质等描述性属性)以及对象间的关系(50个前景关系类别,如above、holding、sitting on等)。关系以三元组形式表示,包含主语索引、宾语索引和谓词。数据集的图像直接嵌入在Parquet文件中,加载时可解码为PIL图像对象。标注遵循特定约定,如边界框被裁剪到图像范围内,面积为零的对象被移除,关系端点引用当前对象数组的索引。该数据集适用于场景理解、视觉关系检测、图像描述生成等研究。

This dataset is a structured version of the Visual Genome scene graph dataset, which can be directly loaded via the Hugging Face datasets library. It is based on the Visual Genome dataset and is specifically designed for computer vision tasks such as scene graph generation and visual relationship detection. The dataset contains 89,154 image samples, divided into 62,407 training samples, 8,915 validation samples, and 17,832 test samples. Each image is accompanied by detailed scene graph annotations, including object bounding boxes (in the format [x_min, y_min, x_max, y_max]), object category labels (using the VG150 system, which includes 150 foreground object categories such as airplane, animal, car, etc., and one __background__ category), attribute labels (200 foreground attribute categories, such as color, size, material, and other descriptive attributes), and relationships between objects (50 foreground relationship categories, such as above, holding, sitting on, etc.). Relationships are represented as triplets, including subject index, object index, and predicate. The images are directly embedded in Parquet files and can be decoded into PIL image objects upon loading. The annotations follow specific conventions, such as bounding boxes being cropped to the image boundaries, zero-area objects being removed, and relationship endpoints referencing indices in the current object array. The dataset is suitable for research in scene understanding, visual relationship detection, image caption generation, and related areas.

创建时间:
2026-07-11
原始信息汇总

Visual Genome 场景图数据集

数据集概述

该数据集为经过结构化处理的 Visual Genome 场景图数据集,可通过 Hugging Face datasets 库直接加载。数据采用 VG150 类别体系,包含 150 个前景对象类别50 个前景关系类别200 个前景属性类别,每组类别均包含索引为 0 的 __background__ 类别。

数据规模

数据划分 样本数
train 62,407
validation 8,915
test 17,832
合计 89,154

数据集下载大小约为 12.7 GB,存储大小约为 12.86 GB。图片直接嵌入 Parquet 文件中,读取样本时 image 字段由 Hugging Face 解码为 PIL 图片对象。

字段说明

每行数据表示一张图片及其对应的场景图,包含以下字段:

  • id:样本 ID。
  • image:Hugging Face Image 字段,读取样本时返回 PIL 图片。
  • width、height:图片的宽度和高度。
  • boxes:对象边界框,格式为 [x_min, y_min, x_max, y_max]
  • labels:与 boxes 一一对应的对象类别 ID。
  • attributes:与对象一一对应的属性类别 ID 列表。
  • relations.subject_index:关系主语在对象数组中的索引。
  • relations.object_index:关系宾语在对象数组中的索引。
  • relations.predicate:关系类别 ID。

对象、属性和关系均使用 ClassLabel 类型表示,可通过 Dataset 的 features 获取对应的类别名称列表。

数据加载示例

python from datasets import load_dataset

dataset = load_dataset("wliafe/vg") print(dataset)

sample = dataset["train"][0] print(sample["id"]) print(sample["image"].size) print(len(sample["boxes"])) print(len(sample["relations"]["predicate"]))

如需避免立即解码图片,可先将 image 字段转换为 decode=False。类别名称可通过以下方式读取:

python features = dataset["train"].features object_names = features["labels"].feature.names attribute_names = features["attributes"].feature.feature.names predicate_names = features["relations"]["predicate"].feature.names

标注约定

  • 边界框会裁剪到图片范围内。
  • 裁剪后面积为零的对象不会保留。
  • 引用已删除对象的关系不会保留。
  • 关系端点保存为当前对象数组的索引,而非 Visual Genome 的原始对象 ID。
  • boxeslabelsattributes 使用相同的对象顺序。

引用信息

如果该数据集对你的研究有帮助,请引用 Visual Genome 原始论文:

bibtex @article{krishna2017visual, title={Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations}, author={Krishna, Ranjay and Zhu, Yuke and Groth, Oliver and Johnson, Justin and Hata, Kenji and Kravitz, Joshua and Chen, Stephanie and Kalantidis, Yannis and Li, Li-Jia and Shamma, David A. and Bernstein, Michael S. and Fei-Fei, Li}, journal={International Journal of Computer Vision}, volume={123}, pages={32--73}, year={2017} }

数据的使用许可和适用范围请以 Visual Genome 官方发布条款为准。

搜集汇总
数据集介绍
vg 数据集图片
构建方式
Visual Genome场景图数据集通过众包方式,对图像中的丰富视觉信息进行结构化标注。数据集的构建依托于Hugging Face的datasets库,将原始VG数据经过精心处理后,统一采用VG150类别体系,涵盖150个对象类别、50个关系类别与200个属性类别。每张图像都以场景图的形式呈现,对象边界框采用标准化的[x_min, y_min, x_max, y_max]格式,同时属性与关系分别以列表和索引结构存储。数据集划分遵循严密的标注约定,包括边界框裁剪至图像范围、过滤面积为零的对象及断联关系,确保数据质量。最终生成训练集62,407张、验证集8,915张和测试集17,832张,总样本量达89,154张,图片直接嵌入Parquet文件中。
特点
该数据集的核心特点在于其多维度的场景图结构,不仅包含经典的对象检测标注,还融入了丰富的属性和关系信息。对象类别覆盖从生活用品到动物植物的广泛实体,属性类别则囊括颜色、材质、空间状态与动作等细致描述,关系类别刻画了对象间的空间、功能和交互关联。这种多层级标注模式使得每张图像都成为一张完整的语义关系网,支持从视觉识别到场景理解的深度任务。此外,数据集采用统一的ClassLabel编码,类别名称通过features属性即可便捷获取,而关系端点以当前对象索引而非原始ID存储,优化了数据读取与模型训练的效率。
使用方法
使用该数据集时,可通过load_dataset('wliafe/vg')一步加载,数据自动划分为train、validation和test三个子集。样本以字典形式返回,包含id、image、boxes、labels等字段,其中image由Hugging Face解码为PIL图片对象。研究者可直接利用框、标签与关系索引进行目标检测与场景图生成任务,也可通过cast_column方法将image字段设为decode=False以延迟解码节约内存。类别名称通过访问features中对应ClassLabel的names属性获得,进而实现对象、属性和关系ID与真实类别的映射。关系结构中的subject_index与object_index指向对象数组下标,便于快速构建三元组,适用于视觉关系推理等多种下游任务。
背景与挑战
背景概述
在计算机视觉领域,超越简单的物体识别而迈向场景理解,一直是研究者孜孜以求的目标。Visual Genome(VG)数据集正是在这一背景下,由斯坦福大学的Ran-jay Krishna、Yuke Zhu、李飞飞教授等团队于2017年正式发布。该数据集旨在构建大规模、结构化的视觉常识库,通过众包的方式为近8.9万张图片提供了丰富的标注,包括150个物体类别、50种关系谓词和200个属性类别,并详细描述了物体间的空间与语义关系。VG的出现极大地推动了视觉关系检测、场景图生成以及视觉问答等前沿课题的发展,成为连接语言与视觉的关键桥梁,其对多模态理解领域的深远影响至今犹存。
当前挑战
VG数据集的核心挑战在于其试图解决的领域难题:如何让机器具备细粒度的场景理解能力,超越简单的“图片里有什么”,达到“物体之间有何关系”的深度认知。在构建过程中,挑战同样严峻——通过众包方式获取高质量、一致性的密集标注极其困难,例如确保不同标注者对同一关系的描述(如“坐在”与“在……上”)保持统一。此外,该数据集如何处理大规模、长尾分布的视觉关系,以及如何应对复杂场景中物体间可能存在的多种关系,仍然是当前模型面临的主要瓶颈。数据集的后续版本(如VG150)虽对类别进行了规约,但样本不均衡和关系稀疏性等问题依然构成挑战。
常用场景
经典使用场景
Visual Genome数据集凭借其丰富的场景图标注,成为视觉关系理解与场景图生成任务中的基石性资源。该数据集的经典使用场景集中于训练模型从图像中提取结构化语义信息,即识别图中对象(如人、动物、物品)并推断它们之间的空间、动作或从属关系(如“人骑自行车”、“猫在桌上”)。研究者在目标检测与关系检测的联合框架下,将图像转化为包含对象属性、边界框以及三元组(主语-谓词-宾语)的场景图,从而实现对复杂视觉场景的深度解析。此外,该数据集常被用于评估模型对细粒度属性(如颜色、材质、形状)的认知能力,推动视觉推理从简单分类迈向关系级理解。
解决学术问题
该数据集解决了长期以来视觉研究领域中对场景进行结构化表达的学术难题。传统视觉任务如分类或检测仅输出对象的存在性与位置,无法捕捉对象间的语义互动。Visual Genome通过提供大规模、密集标注的场景图,使得研究者能够系统性地探究视觉关系建模、场景图生成、视觉推理(如视觉问答中的关系链路推理)以及多模态表征学习等核心课题。其影响在于构建了统一的评测基准,促使学界从孤立的目标识别转向上下文感知的视觉理解,显著提升了模型在复杂场景中解读隐含语义关系的能力,为视觉与语言交叉领域的理论突破提供了数据基石。
衍生相关工作
该数据集衍生了一系列推动计算机视觉进步的经典研究工作。在场景图生成方向,Motta等提出的Graph RCNN和Tang等人开创的Neural Motif模型均基于Visual Genome进行训练与评测,建立了关系检测的基线范式。视觉关系检测任务中,SG-AdjNet等网络通过嵌入邻接矩阵优化关系推理效率。此外,多模态领域涌现了诸如视觉场景图增强的视觉问答模型(如GraphVQA)和对场景图进行神经符号推理的NS-VQA等工作。这些衍生研究不仅巩固了Visual Genome作为标准基准的地位,还催生了在关系零样本学习领域(如ZSL关系分类)的理论创新,形成了以该数据集为起点的学术演进脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务