tuandunghcmut/VSearch_Benchmark_All
收藏资源简介:
--- dataset_info: features: - name: split dtype: string - name: captions sequence: string - name: file_path dtype: string - name: processed_tokens sequence: sequence: string - name: id dtype: int64 - name: image dtype: image - name: height dtype: int64 - name: width dtype: int64 - name: dataset_name dtype: string splits: - name: train num_bytes: 1064079700.875 num_examples: 115233 download_size: 1009765719 dataset_size: 1064079700.875 configs: - config_name: default data_files: - split: train path: data/train-* ---
数据集信息: 特征字段: - 字段名:split(数据集划分),数据类型:字符串 - 字段名:captions(图像描述文本),数据类型:字符串序列 - 字段名:file_path(文件路径),数据类型:字符串 - 字段名:processed_tokens(经过处理的Token序列),数据类型:字符串序列的序列 - 字段名:id(样本标识符),数据类型:64位整数 - 字段名:image(图像数据),数据类型:图像 - 字段名:height(图像高度),数据类型:64位整数 - 字段名:width(图像宽度),数据类型:64位整数 - 字段名:dataset_name(数据集名称),数据类型:字符串 数据集划分列表: - 划分名称:train(训练集),占用字节数:1064079700.875,样本数量:115233 下载大小:1009765719 字节 数据集总存储大小:1064079700.875 字节 配置项: - 配置名称:default(默认配置),数据文件: - 数据集划分:train(训练集),文件路径:data/train-*
数据集概述
数据集特征
- split: 数据类型为字符串(string)。
- captions: 数据类型为字符串序列(sequence: string)。
- file_path: 数据类型为字符串(string)。
- processed_tokens: 数据类型为字符串序列的序列(sequence: sequence: string)。
- id: 数据类型为64位整数(int64)。
- image: 数据类型为图像(image)。
- height: 数据类型为64位整数(int64)。
- width: 数据类型为64位整数(int64)。
- dataset_name: 数据类型为字符串(string)。
数据集分割
- train: 包含115233个样本,占用空间为1064079700.875字节。
数据集大小
- 下载大小: 1009765719字节。
- 数据集大小: 1064079700.875字节。
配置
- config_name: default
- data_files:
- split: train
- path: data/train-*




