lizhiqi/processed_bert_dataset
收藏官方服务:
资源简介:
--- dataset_info: features: - name: input_ids sequence: int32 - name: token_type_ids sequence: int8 - name: attention_mask sequence: int8 - name: special_tokens_mask sequence: int8 splits: - name: train num_bytes: 245232000.0 num_examples: 68120 download_size: 71824059 dataset_size: 245232000.0 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
lizhiqi原始信息汇总
数据集概述
数据集特征
- input_ids:序列类型为
int32。 - token_type_ids:序列类型为
int8。 - attention_mask:序列类型为
int8。 - special_tokens_mask:序列类型为
int8。
数据集分割
- 训练集(train):
- 数据量:68120个样本。
- 存储大小:245232000.0字节。
数据集大小
- 下载大小:71824059字节。
- 数据集总大小:245232000.0字节。
配置信息
- 默认配置(default):
- 训练数据文件路径:
data/train-*。
- 训练数据文件路径:



