SomethingNew
收藏资源简介:
该数据集是一个专为文本生成任务设计的英语混合预训练数据集。它通过整合来自11个不同开源数据源(或特定配置)的文本内容构建而成,旨在为语言模型提供多样化的训练数据。数据构成明确标注了各来源及其在混合中的权重比例,主要来源包括:HuggingFaceTB/smollm-corpus (fineweb-edu-dedup,20%)、openbmb/Ultra-FineWeb-L3 (Ultra-FineWeb-L3-en-Multi-Style-Synthetic,10%)、HuggingFaceTB/dclm-edu (20%)、HuggingFaceFW/finewiki (en,20%)、HuggingFaceTB/cosmopedia (stories,2%;stanford,2%)、HuggingFaceFW/finephrase (all,6%)、HuggingFaceTB/finemath (finemath-l4,5%)、nampdn-ai/tiny-math-textbooks (5%)、HuggingFaceTB/cosmopedia (auto_math_text,5%) 以及 AxiomicLabs/NPset-2-Python-Edu (5%)。数据集总规模为100,000个文本样本(行),以5个Parquet格式的分片文件存储,所有数据均划分在训练集(`train` split)中。
本数据集为面向文本生成任务打造的英语混合预训练数据集。其通过整合11个不同开源数据源(或特定配置)的文本内容构建而成,旨在为语言模型提供多样化的训练数据。 数据集已明确标注各数据来源及其在混合语料中的权重占比,核心数据源如下: 1. HuggingFaceTB/smollm-corpus(fineweb-edu-dedup,占比20%) 2. openbmb/Ultra-FineWeb-L3(Ultra-FineWeb-L3-en-Multi-Style-Synthetic,占比10%) 3. HuggingFaceTB/dclm-edu(占比20%) 4. HuggingFaceFW/finewiki(en,占比20%) 5. HuggingFaceTB/cosmopedia(stories,占比2%;stanford,占比2%) 6. HuggingFaceFW/finephrase(all,占比6%) 7. HuggingFaceTB/finemath(finemath-l4,占比5%) 8. nampdn-ai/tiny-math-textbooks(占比5%) 9. HuggingFaceTB/cosmopedia(auto_math_text,占比5%) 10. AxiomicLabs/NPset-2-Python-Edu(占比5%) 数据集总规模为100,000个文本样本(行),以5个Parquet格式的分片文件存储,所有数据均划分至训练集(train split)中。
数据集概述
- 名称: SomethingNew
- 许可证: Apache-2.0
- 任务类别: 文本生成
- 语言: 英语
数据集构成
该数据集是一个混合预训练数据集,由以下来源按指定权重组合而成:
| 来源 | 配置 | 权重 |
|---|---|---|
| HuggingFaceTB/smollm-corpus | fineweb-edu-dedup | 20% |
| openbmb/Ultra-FineWeb-L3 | Ultra-FineWeb-L3-en-Multi-Style-Synthetic | 10% |
| HuggingFaceTB/dclm-edu | — | 20% |
| HuggingFaceFW/finewiki | en | 20% |
| HuggingFaceTB/cosmopedia | stories | 2% |
| HuggingFaceTB/cosmopedia | stanford | 2% |
| HuggingFaceFW/finephrase | all | 6% |
| HuggingFaceTB/finemath | finemath-l4 | 5% |
| nampdn-ai/tiny-math-textbooks | — | 5% |
| HuggingFaceTB/cosmopedia | auto_math_text | 5% |
| AxiomicLabs/NPset-2-Python-Edu | — | 5% |
数据规模与划分
- 总行数: 100,000
- 分片数量: 5 个 parquet 文件
- 数据划分: 全部数据位于
train分片中




