zwz-37k
收藏资源简介:
该数据集是一个多模态数据集,包含图像和文本数据,旨在支持视觉问答或相关任务。数据集提供了两个配置版本:37k版本包含36,992个训练样本,数据量约为209GB;74k版本包含73,996个训练样本,数据量约为416GB。每个样本包含以下主要字段:一组图像(images)、原始图像(original_images)、教师图像(teacher_images)、边界框坐标(bbox)、问题文本(problem)、答案文本(answer)、额外信息(extra_info,其中包含question和answer子字段)、能力标签(ability)以及数据来源标识(data_source)。数据集的结构表明其可能用于训练或评估模型在结合视觉和文本信息进行问题解答方面的能力。
This dataset is a multimodal dataset containing image and text data, designed to support visual question answering or related tasks. The dataset provides two configuration versions: the 37k version includes 36,992 training samples with a data volume of approximately 209 GB; the 74k version includes 73,996 training samples with a data volume of approximately 416 GB. Each sample contains the following main fields: a set of images (images), original images (original_images), teacher images (teacher_images), bounding box coordinates (bbox), problem text (problem), answer text (answer), additional information (extra_info, which includes question and answer subfields), ability labels (ability), and data source identifiers (data_source). The structure of the dataset suggests that it may be used for training or evaluating models in combining visual and textual information for question answering.
数据集概述:zwz-37k
该数据集包含两个子配置,分别为 37k 和 74k,均用于训练。
数据特征
所有配置共享相同的特征结构,每个样本包含以下字段:
- images:图像列表(
list: image) - original_images:原始图像列表(
list: image) - teacher_images:教师图像列表(
list: image) - bbox:边界框列表(
list: float64) - problem:问题描述(
string) - answer:答案(
string) - extra_info:附加信息,包含
answer(答案)和question(问题),均为string类型 - ability:能力标签(
string) - data_source:数据来源(
string)
数据划分
| 配置名称 | 划分名称 | 样本数量 | 数据集大小 |
|---|---|---|---|
| 37k | train | 36,992 | 209,254,991,396 字节 |
| 74k | train | 73,996 | 416,647,543,176 字节 |
下载信息
- 37k 配置:下载大小约为 209,271,616,747 字节
- 74k 配置:下载大小约为 416,679,782,943 字节




