相关数据集
hyperdemocracy/usc-llm-tokens-bert-base-uncased-2048
--- dataset_info: features: - name: input_ids sequence: int32 - name: attention_mask sequence: int8 splits: - name: train num_bytes: 1295254968 num_examples: 126391 - name:
Hugging Face2024-03-22 更新130
gokuls/wiki_book_corpus_processed_bert_dataset_small
--- dataset_info: features: - name: input_ids sequence: int32 - name: token_type_ids sequence: int8 - name: attention_mask sequence: int8 - name: special_tokens_mask sequence
Hugging Face2023-02-25 更新90
Tensorflow Hub BERT - bert_en_uncased
BERT trained model and preprocessor for uncase English from Tensorflow Hub
kaggle2022-08-21 更新70
orafandina/wiki_long_200k
该数据集包含约20万篇维基文章,这些文章是从维基数据集中随机抽取的。文章使用了AutoTokenizer.from_pretrained(bert-base-uncased)进行分词处理。数据集创建的目的是用于研究。
Hugging Face2023-10-23 更新100
gmongaras/wikipedia_book_BERT_512
该数据集使用了bert-cased tokenizer,并且是books和wikipedia数据集的合并。数据集的特征包括input_ids、token_type_ids和attention_mask,数据分割为train,下载大小为7045365171字节,数据集大小为248147577432字节。
Hugging Face2023-11-08 更新80



