数据链接:
官方服务:
资源简介:
English text wikipedia dump
应用场景:
创建时间:
2020-01-21
相关数据集
saibo/bookcorpus_compact_512_test
--- dataset_info: features: - name: text dtype: string - name: concept_with_offset dtype: string splits: - name: train num_bytes: 39735149 num_examples: 6160 download_size:
Hugging Face2023-01-23 更新90
mrm8488/large_spanish_corpus_ds_tokenized_and_gropuped
--- dataset_info: features: - name: input_ids sequence: int32 splits: - name: train num_bytes: 16824296700 num_examples: 4103487 - name: test num_bytes: 885489300 num_exa
Hugging Face2023-02-13 更新60
German CBOW FastText embeddings with min count 100
FastText embeddings built from Common Crawl german dataset Parameters Parameters Value(s) Dimensions 256 and 384 Context window 5 Negative sampled 10 Epochs 1 Number of buckets 131072 or 262144 Min n
Zenodo2021-10-25 更新40
prli/pubmed-full_draft_chopped-rare-qwen-alpha0-85
--- dataset_info: features: - name: text dtype: string - name: meta struct: - name: pile_set_name dtype: string splits: - name: validation num_bytes: 5377008 num_ex
Hugging Face2026-04-27 更新60
PatrickHaller/wiki-and-book-corpus-1B
该数据集包含一个名为train的特征,数据类型为字符串。数据集被分割为train部分,包含31,297,158个样本,总大小为5,770,333,481字节。下载大小为3,761,712,924字节。
Hugging Face2024-08-23 更新60



