官方服务:
资源简介:
llmse wikipedia pages
LLMSE 维基百科页面
应用场景:
创建时间:
2023-09-12
相关数据集
open-wikipedia-markdown
Open Wikipedia (Markdown) 数据集包含所有语言版本的维基百科文章,这些文章已从原始的 MediaWiki 标记转换为干净、可读的 Markdown 格式。数据集保留了标题、粗体、斜体、代码块和内部链接等 Markdown 语法,同时移除了模板、信息框、引用、表格、分类等噪音内容。当前数据集包含 139.4K 篇文章,涵盖 1 种语言(拉丁语),数据来源于官方的 Wikime
Hugging Face2026-04-03 更新320
Tristan/olm-wikipedia-20221220-1-percent-tokenized-766
--- dataset_info: features: - name: input_ids sequence: int32 - name: attention_mask sequence: int8 - name: special_tokens_mask sequence: int8 splits: - name: train num_byt
Hugging Face2023-01-18 更新70
if001/wikimedia_en_long
--- dataset_info: features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes:
Hugging Face2026-04-26 更新60
AksaraLLM/aksara-bahasa-daerah-v1
AksaraLLM Bahasa Daerah v1 是一个预训练语料库,包含印度尼西亚8种地区语言的文本数据,这些数据是从2023年11月的维基百科快照中收集的。覆盖的语言包括爪哇语、巽他语、米南加保语、亚齐语、布吉语、巴厘语、班贾尔语和马都拉语。数据集提供了每种语言的ISO代码、文章数量和相关注释。创建该数据集的动机是取代之前的数据集,提供更大量和多样化的语料库。需要注意的是,米南加保语维基百
Hugging Face2026-04-23 更新70
reds0510/redpajama-wiki-tiny-250
这是一个包含文本数据的训练集,其中包括文本内容(text)、元数据(meta)、数据来源(source)和语言类型(language)四个字段。训练集共有250个样本,总大小约为1.43MB。
Hugging Face2025-02-27 更新60



