官方服务:
资源简介:
Stockholm-Umeå-korpus 2.0 omkastad Stockholm-Umeå corpus 2.0 scrambled
应用场景:
相关数据集
SEVENLLM-Instruct
SEVENLLM-Instruct是由北京航空航天大学国家重点实验室创建的高质量双语指令数据集,包含85000个样本,用于训练大型语言模型以增强网络安全事件分析能力。该数据集通过爬取网络安全网站的原始文本构建,采用Select-Instruct方法生成监督学习数据。SEVENLLM-Instruct旨在解决网络安全领域数据稀缺问题,通过多任务学习提升模型在威胁识别和响应方面的性能,广泛应用于网络安
arXiv2024-05-06 更新920
Slowblood/guanaco-llama2-1k
--- dataset_info: features: - name: text dtype: string splits: - name: train num_bytes: 1654448 num_examples: 1000 download_size: 966693 dataset_size: 1654448 configs: - config
Hugging Face2023-10-19 更新210
BramVanroy/wikipedia_culturax_dutch
--- language: - nl size_categories: - 10B<n<100B task_categories: - text-generation - text2text-generation pretty_name: Filtered CulturaX + Wikipedia for Dutch dataset_info: - config_name: 100M feat
Hugging Face2024-12-23 更新190
Daniel-P-Gonzalez/OCD
Only Clean Data (OCD)是一个精心策划和清理的文本语料库,旨在为训练基础语言模型提供最高质量的文本数据。数据集包括从C4、PLOS和CCOpenBooks等来源筛选的文本,经过手动检查和修复,确保文本质量。目前数据集包含三个子集:经过过滤的网页数据、经过处理的同行评审研究文章以及非小说类书籍。数据集还在持续开发中,计划扩展更多领域的内容。
Hugging Face2023-12-23 更新250
drodin/TextBooksPersonaHub
TextBooksPersonaHub数据集是proj-persona/PersonaHub数据集的扩展,使用Qwen2-72B-Instruct模型生成与特定人物相关的教科书式段落。每个条目包含原始人物描述和生成的内容。数据集旨在用于训练语言模型、研究人物驱动的内容生成以及探索教科书质量数据在语言模型训练中的有效性。
Hugging Face2024-07-21 更新200



