相关数据集
togethercomputer/RedPajama-Data-V2
Red Pajama V2是一个用于训练大型语言模型的开放数据集,包含超过1000亿个文本文档,其中30亿个文档带有质量信号,20亿个文档是去重后的唯一文档。数据集支持多种语言(如英语、德语、法语、西班牙语和意大利语),并提供了详细的下载和使用示例。此外,README还介绍了如何根据质量信号过滤数据集,并提供了质量注释的详细说明。
Hugging Face2024-11-21 更新2370
togethercomputer/Long-Data-Collections
该数据集集合是专门为需要从大量文本输入中进行广泛理解和推理的任务设计的长上下文数据集集合。目前,它包括用于训练强大基础模型的数据集,这些数据集位于pretrain/目录中。此外,还包括为特定需求定制的数据集,位于fine-tune/目录中。这些专门的数据集包括从Natural Questions派生的多段落问答数据集和BookSum长上下文摘要数据集。
Hugging Face2025-01-04 更新730
togethercomputer/RedPajama-Data-Instruct
--- license: apache-2.0 --- # Dataset Summary RedPajama-Instruct-Data is curated from a diverse collection of NLP tasks from both [P3 (BigScience)](https://huggingface.co/datasets/bigscience/P3) and
Hugging Face2023-06-06 更新160
togethercomputer/RedPajama-Data-1T
RedPajama是一个用于文本生成任务的大型数据集,包含2084个jsonl文件,总token数达到1.2万亿。数据集主要使用英语,但也包含多语言的Wikipedia部分。数据集结构包括文本内容、元数据(如URL、时间戳、来源和语言)以及标识数据子集的字段。创建过程涉及从多个源(如Commoncrawl、C4、GitHub等)下载和预处理数据,以尽可能接近LLaMa论文的描述。
Hugging Face2024-06-17 更新1610
togethercomputer/llama-instruct
--- license: llama2 language: - en --- # llama-instruct This dataset was used to finetune [Llama-2-7B-32K-Instruct](https://huggingface.co/togethercomputer/Llama-2-7B-32K-Instruct). We follow the di
Hugging Face2023-08-18 更新180



