terrycraddock/GPT2-PretrainV1-Tokenized-en
收藏资源简介:
--- license: mit dataset_info: features: - name: text dtype: large_string - name: input_ids sequence: int32 - name: attention_mask sequence: int8 splits: - name: train num_bytes: 175021436352 num_examples: 32136787 - name: val num_bytes: 19446807404 num_examples: 3570755 download_size: 13514846754 dataset_size: 194468243756 configs: - config_name: default data_files: - split: train path: data/train-* - split: val path: data/val-* ---
许可证:MIT许可证 数据集信息: 特征列表: - 名称:text,数据类型:大字符串(large_string) - 名称:输入标识符(input_ids),序列类型:32位整数(int32) - 名称:注意力掩码(attention_mask),序列类型:8位整数(int8) 划分集: - 名称:训练集(train),字节数:175021436352,样本数:32136787 - 名称:验证集(val),字节数:19446807404,样本数:3570755 下载大小:13514846754字节 数据集总大小:194468243756字节 配置项: - 配置名称:默认配置(default),数据文件: - 划分集:训练集(train),路径:data/train-* - 划分集:验证集(val),路径:data/val-*
数据集概述
数据特征
- text: 数据类型为
large_string - input_ids: 数据类型为
int32的序列 - attention_mask: 数据类型为
int8的序列
数据分割
- train:
- 字节数: 175021436352
- 样本数: 32136787
- val:
- 字节数: 19446807404
- 样本数: 3570755
数据大小
- 下载大小: 13514846754 字节
- 数据集大小: 194468243756 字节
配置
- config_name: default
- data_files:
- train: 路径为
data/train-* - val: 路径为
data/val-*
- train: 路径为
- data_files:



