相关数据集
Daniel-P-Gonzalez/OCD
Only Clean Data (OCD)是一个精心策划和清理的文本语料库,旨在为训练基础语言模型提供最高质量的文本数据。数据集包括从C4、PLOS和CCOpenBooks等来源筛选的文本,经过手动检查和修复,确保文本质量。目前数据集包含三个子集:经过过滤的网页数据、经过处理的同行评审研究文章以及非小说类书籍。数据集还在持续开发中,计划扩展更多领域的内容。
Hugging Face2023-12-23 更新250
Slowblood/guanaco-llama2-1k
--- dataset_info: features: - name: text dtype: string splits: - name: train num_bytes: 1654448 num_examples: 1000 download_size: 966693 dataset_size: 1654448 configs: - config
Hugging Face2023-10-19 更新210
mayflowergmbh/airoboros-3.0_de
这是一个针对[jondurbin/airoboros-3.0](https://huggingface.co/datasets/jondurbin/airoboros-3.0)数据集的德语翻译版本,数据来源于[seedboxventures/multitask_german_examples_32k](https://huggingface.co/datasets/seedboxventures/
Hugging Face2024-02-14 更新170
premio-ai/TheArabicPile_Reviews
The Arabic Pile是一个专注于阿拉伯语的综合数据集,旨在与The Pile和The Nordic Pile的结构相平行。该数据集涵盖了现代标准阿拉伯语(MSA)以及多种黎凡特、北非和埃及方言,适用于训练和微调大型语言模型。数据集包含13个子集,每个子集针对不同的语言领域,如数学内容、对话、医学文本等。数据集分为原始子集和去重子集,原始子集为从源收集的原始数据,去重子集则经过过滤和清理,
Hugging Face2024-03-21 更新230
BramVanroy/wikipedia_culturax_dutch
--- language: - nl size_categories: - 10B<n<100B task_categories: - text-generation - text2text-generation pretty_name: Filtered CulturaX + Wikipedia for Dutch dataset_info: - config_name: 100M feat
Hugging Face2024-12-23 更新190



