遇见数据集

ljnlonoljpiljm/visual_genome

收藏
Hugging Face2026-05-11 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个多模态视觉数据集,专注于对象检测、图像标注和视觉问答(VQA)任务。它包含108,077张训练图像,每张图像都带有丰富的元数据,如图像ID、URL、宽度和高度,以及与COCO和Flickr数据集的关联ID。数据集中还包含对象级注释,如对象的边界框、属性、标签、对象ID、同义词集和类型;区域短语注释,用于描述图像中的特定区域;关系注释,表示对象之间的交互或关系(如主语-谓语-宾语结构);以及视觉问答数据,包括问题和答案对。数据集总大小约为9.92 GB,下载大小为15.6 GB,适用于计算机视觉和自然语言处理的研究,特别是多任务学习场景。

This dataset is a multimodal visual dataset focused on object detection, image captioning, and visual question answering (VQA) tasks. It contains 108,077 training images, each with rich metadata such as image ID, URL, width, height, and associated IDs from COCO and Flickr datasets. The dataset also includes object-level annotations like bounding boxes, attributes, labels, object IDs, synsets, and types; region phrase annotations for describing specific areas in images; relationship annotations that represent interactions or relations between objects (e.g., subject-predicate-object structures); and visual question answering data with question-answer pairs. The total dataset size is approximately 9.92 GB, with a download size of 15.6 GB, making it suitable for computer vision and natural language processing research, particularly in multi-task learning scenarios.

提供机构:
ljnlonoljpiljm
二维码
社区交流群
二维码
科研交流群
商业服务