gokuls/wiki_book_corpus_processed_bert_dataset_small
收藏资源简介:
--- dataset_info: features: - name: input_ids sequence: int32 - name: token_type_ids sequence: int8 - name: attention_mask sequence: int8 - name: special_tokens_mask sequence: int8 splits: - name: train num_bytes: 5550400800.0 num_examples: 1541778 download_size: 1636779213 dataset_size: 5550400800.0 --- # Dataset Card for "wiki_book_corpus_processed_bert_dataset_small" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集信息: 特征项: - 名称:输入ID序列(input_ids),序列类型:int32 - 名称:Token类型ID序列(token_type_ids),序列类型:int8 - 名称:注意力掩码序列(attention_mask),序列类型:int8 - 名称:特殊Token掩码序列(special_tokens_mask),序列类型:int8 数据集划分: - 名称:训练集(train),占用字节数:5550400800.0,样本数量:1541778 下载大小:1636779213 数据集总大小:5550400800.0 # 「wiki_book_corpus_processed_bert_dataset_small」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集概述
数据集名称
- 名称: wiki_book_corpus_processed_bert_dataset_small
数据集特征
- 特征列表:
- input_ids: 序列类型为 int32
- token_type_ids: 序列类型为 int8
- attention_mask: 序列类型为 int8
- special_tokens_mask: 序列类型为 int8
数据集分割
- 训练集:
- 样本数量: 1541778
- 数据大小: 5550400800.0 字节
数据集大小
- 下载大小: 1636779213 字节
- 总数据大小: 5550400800.0 字节



