相关数据集
olmo-mix-1124
# OLMo 2 (November 2024) Pretraining set Collection of data used to train OLMo-2-1124 models. The majority of this dataset comes from DCLM-Baseline with no additional filtering, but we provide the e
魔搭社区2026-06-27 更新240
erhwenkuo/c4-chinese-zhtw
这个繁体中文数据集来自Common Crawl的2023-14数据存档,经过清理后用于预训练语言模型。数据集包含URL、时间戳、内容语言、内容类型和清理后的文本等字段。清理过程包括下载、筛选、过滤非句子和有毒文档、去除重复文本和过度重复的文档。
Hugging Face2023-10-12 更新200
ArmelR/the-pile-splitted
该数据集是一个由EleutherAI设计的800GB英文文本数据集,用于训练大规模语言模型。数据集分为22个高质量的子数据集,并通过`meta`列将数据集正确划分为子集。每个实例都有一个`domain`列,表示其所属的子集。数据集进一步被划分为训练集和测试集(97%/3%)。
Hugging Face2023-09-06 更新280
h-8m-cleaned-and-prompts
该数据集包含三个配置文件,分别为chunk-00000、chunk-00001和chunk-00006。每个配置文件都包含两个特征:清理后的文本(cleaned_text)和提示(prompt),均为字符串类型。数据集仅包含训练集split,每个split的大小略有不同。总下载大小约为1.5GB,总数据集大小约为2.6GB。
Hugging Face2025-09-04 更新240



