nimapourjafar/mm_docvqa
收藏资源简介:
--- dataset_info: features: - name: images sequence: image: decode: false - name: audios sequence: 'null' - name: videos sequence: 'null' - name: data list: - name: data dtype: string - name: modality dtype: string - name: role dtype: string splits: - name: train num_bytes: 6896013328 num_examples: 10189 download_size: 6887856672 dataset_size: 6896013328 configs: - config_name: default data_files: - split: train path: data/train-* ---
数据集信息: 特征: - 名称:images(图像),类型为序列,序列元素为图像数据,且解码参数(decode)设置为false - 名称:audios(音频),类型为序列,取值为null - 名称:videos(视频),类型为序列,取值为null - 名称:data,类型为列表,列表元素为包含三个子字段的结构体: - 子字段1:名称为data,数据类型为字符串 - 子字段2:名称为modality(模态),数据类型为字符串 - 子字段3:名称为role(角色),数据类型为字符串 数据集拆分: - 拆分名称:train(训练集),占用字节数:6896013328,样本数量:10189 下载大小:6887856672,数据集总大小:6896013328 数据集配置: - 配置名称:default(默认配置),对应数据文件: - 关联拆分:train(训练集),数据路径:data/train-*
数据集概述
数据集信息
- 特征:
- images: 包含图像数据,图像未解码。
- audios: 包含音频数据。
- videos: 包含视频数据。
- data: 包含以下子特征:
- data: 数据类型为字符串。
- modality: 数据类型为字符串。
- role: 数据类型为字符串。
数据集分割
- train:
- 样本数量: 10189
- 字节数: 6896013328
数据集大小
- 下载大小: 6887856672 字节
- 数据集大小: 6896013328 字节
配置
- default:
- 数据文件:
- train: 路径为
data/train-*
- train: 路径为
- 数据文件:




