LEP
收藏资源简介:
该数据集包含两个主要配置:mme 和 textvqa_val_pruning。mme配置主要用于多模态问答任务,包含问题ID、图像、问题、答案和类别等特征,数据集分为lite分割,包含500个样本。textvqa_val_pruning配置则专注于文本视觉问答任务,包含图像ID、问题ID、问题、问题标记、图像、图像尺寸、图像URL、答案、图像类别、集合名称和OCR标记等特征,数据集分为多个分割,包括random、random_1000p、random_0.2p和kcenter_0.2p,每个分割包含1000个样本。
This dataset contains two primary configurations: mme and textvqa_val_pruning. The mme configuration is primarily intended for multimodal question answering tasks, with features including question ID, image, question, answer, and category. It is divided into the lite split, which contains 500 samples. The textvqa_val_pruning configuration focuses on text-based visual question answering tasks, and includes features such as image ID, question ID, question, question tokens, image, image dimensions, image URL, answer, image category, collection name, and OCR tokens. This dataset provides multiple splits, including random, random_1000p, random_0.2p, and kcenter_0.2p, with each split containing 1000 samples.
数据集概述
配置信息
配置1: mme
- 特征:
question_id: 类型为stringimage: 类型为imagequestion: 类型为stringanswer: 类型为stringcategory: 类型为string
- 分割:
lite: 包含 500 个样本,数据大小为 365010090.3395114 字节
- 下载大小: 352079118 字节
- 数据集大小: 365010090.3395114 字节
配置2: textvqa_val_pruning
- 特征:
image_id: 类型为stringquestion_id: 类型为int32question: 类型为stringquestion_tokens: 类型为sequence的stringimage: 类型为imageimage_width: 类型为int32image_height: 类型为int32flickr_original_url: 类型为stringflickr_300k_url: 类型为stringanswers: 类型为sequence的stringimage_classes: 类型为sequence的stringset_name: 类型为stringocr_tokens: 类型为sequence的string
- 分割:
random: 包含 500 个样本,数据大小为 143485382.6 字节random_1000p: 包含 1000 个样本,数据大小为 286970765.2 字节random_0.2p: 包含 1000 个样本,数据大小为 286970765.2 字节kcenter_0.2p: 包含 1000 个样本,数据大小为 286970765.2 字节
- 下载大小: 997275093 字节
- 数据集大小: 1004397678.2 字节
数据文件路径
- mme:
lite:mme/lite-*
- textvqa_val_pruning:
random:textvqa_val_pruning/random-*random_1000p:textvqa_val_pruning/random_1000p-*random_0.2p:textvqa_val_pruning/random_0.2p-*kcenter_0.2p:textvqa_val_pruning/kcenter_0.2p-*




