遇见数据集

SomethingNew

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

该数据集是一个专为文本生成任务设计的英语混合预训练数据集。它通过整合来自11个不同开源数据源(或特定配置)的文本内容构建而成,旨在为语言模型提供多样化的训练数据。数据构成明确标注了各来源及其在混合中的权重比例,主要来源包括:HuggingFaceTB/smollm-corpus (fineweb-edu-dedup,20%)、openbmb/Ultra-FineWeb-L3 (Ultra-FineWeb-L3-en-Multi-Style-Synthetic,10%)、HuggingFaceTB/dclm-edu (20%)、HuggingFaceFW/finewiki (en,20%)、HuggingFaceTB/cosmopedia (stories,2%;stanford,2%)、HuggingFaceFW/finephrase (all,6%)、HuggingFaceTB/finemath (finemath-l4,5%)、nampdn-ai/tiny-math-textbooks (5%)、HuggingFaceTB/cosmopedia (auto_math_text,5%) 以及 AxiomicLabs/NPset-2-Python-Edu (5%)。数据集总规模为100,000个文本样本(行),以5个Parquet格式的分片文件存储,所有数据均划分在训练集(`train` split)中。

本数据集为面向文本生成任务打造的英语混合预训练数据集。其通过整合11个不同开源数据源(或特定配置)的文本内容构建而成,旨在为语言模型提供多样化的训练数据。 数据集已明确标注各数据来源及其在混合语料中的权重占比,核心数据源如下: 1. HuggingFaceTB/smollm-corpus(fineweb-edu-dedup,占比20%) 2. openbmb/Ultra-FineWeb-L3(Ultra-FineWeb-L3-en-Multi-Style-Synthetic,占比10%) 3. HuggingFaceTB/dclm-edu(占比20%) 4. HuggingFaceFW/finewiki(en,占比20%) 5. HuggingFaceTB/cosmopedia(stories,占比2%;stanford,占比2%) 6. HuggingFaceFW/finephrase(all,占比6%) 7. HuggingFaceTB/finemath(finemath-l4,占比5%) 8. nampdn-ai/tiny-math-textbooks(占比5%) 9. HuggingFaceTB/cosmopedia(auto_math_text,占比5%) 10. AxiomicLabs/NPset-2-Python-Edu(占比5%) 数据集总规模为100,000个文本样本(行),以5个Parquet格式的分片文件存储,所有数据均划分至训练集(train split)中。

创建时间:
2026-07-11
原始信息汇总

数据集概述

  • 名称: SomethingNew
  • 许可证: Apache-2.0
  • 任务类别: 文本生成
  • 语言: 英语

数据集构成

该数据集是一个混合预训练数据集,由以下来源按指定权重组合而成:

来源 配置 权重
HuggingFaceTB/smollm-corpus fineweb-edu-dedup 20%
openbmb/Ultra-FineWeb-L3 Ultra-FineWeb-L3-en-Multi-Style-Synthetic 10%
HuggingFaceTB/dclm-edu 20%
HuggingFaceFW/finewiki en 20%
HuggingFaceTB/cosmopedia stories 2%
HuggingFaceTB/cosmopedia stanford 2%
HuggingFaceFW/finephrase all 6%
HuggingFaceTB/finemath finemath-l4 5%
nampdn-ai/tiny-math-textbooks 5%
HuggingFaceTB/cosmopedia auto_math_text 5%
AxiomicLabs/NPset-2-Python-Edu 5%

数据规模与划分

  • 总行数: 100,000
  • 分片数量: 5 个 parquet 文件
  • 数据划分: 全部数据位于 train 分片中
搜集汇总
数据集介绍
SomethingNew 数据集图片
构建方式
SomethingNew数据集是一个精心构建的混合预训练语料库,通过从多个高质量数据源中按特定权重采样而成。其组成部分包括来自HuggingFaceTB的smollm-corpus(细粒度教育去重数据占比20%)、openbmb的Ultra-FineWeb-L3(多风格合成英文数据占比10%)、HuggingFaceTB的dclm-edu(教育数据占比20%)、HuggingFaceFW的finewiki(英文维基数据占比20%),以及来自cosmopedia的stories和stanford子集(各占2%)、finephrase(全部数据占比6%)、finemath的l4子集(占比5%)、tiny-math-textbooks(占比5%)、cosmopedia的auto_math_text(占比5%)、和AxiomicLabs的NPset-2-Python-Edu(占比5%)。数据集总计包含10万行样本,被划分为5个parquet文件,且所有数据均归属于训练集。
特点
该数据集凸显了多元化与均衡性的显著特点。其融合了教育文本、百科全书内容、合成故事、数学教材、短语集合及Python教育数据等多种类型,通过加权混合策略实现知识覆盖的广度与深度。特别地,教育类数据(如fineweb-edu-dedup、dclm-edu、finewiki)合计占比高达60%,为模型提供坚实的知识基础;数学与代码相关数据(包括finemath、tiny-math-textbooks、auto_math_text、NPset-2-Python-Edu)合计占比约20%,增强了模型的逻辑推理与编程能力。此外,合成数据(如Ultra-FineWeb-L3、stories、stanford)的加入丰富了文本风格多样性。整个数据集以10万行的规模兼顾了质量与效率,适合作为轻量级预训练或微调资源。
使用方法
该数据集通过HuggingFace Datasets库可便捷加载。用户首先需安装datasets库(`pip install datasets`),随后在Python环境中执行`from datasets import load_dataset`,并使用`dataset = load_dataset('SomethingNew', split='train')`即可获取全部10万行训练数据。由于数据集以parquet格式存储,加载时会自动处理分片,将所有5个shard文件整合为单一数据集对象。加载后,用户可利用标准的HuggingFace API进行数据探索、分词、批处理等操作,或结合transformers库直接用于语言模型的预训练与微调实验。该数据集采用Apache-2.0许可证,适用于学术研究及商业应用,无额外使用限制。
背景与挑战
背景概述
在大语言模型预训练领域,数据质量与多样性是决定模型泛化能力的关键因素。SomethingNew数据集由HuggingFace团队及多家合作机构于近年构建,旨在融合多源、多风格的高质量文本数据,以解决单一语料库覆盖不足的问题。该数据集精心整合了FineWeb-Edu、Ultra-FineWeb-L3、DCLM-Edu、FineWiki等11个来源,涵盖教育文本、合成数据、数学推理、编程教学等类型,形成总计10万条样本的混合预训练语料。通过差异化权重配置,SomethingNew平衡了知识密度、风格多样性与领域专精度,为开发更鲁棒的语言模型提供了更具代表性的训练基础,在开放学术与工业研究中展现出潜在影响力。
当前挑战
SomethingNew所应对的核心挑战在于如何从海量、异构的网络文本中提取高质量且均衡的教育性语料,以缓解通用预训练数据中常见的事实错误、重复冗余与学科偏置问题。构建过程中,团队首先面临跨源数据过滤与去重的技术难题,需确保来自FineWeb、Cosmopedia、FineMath等不同格式与质量层次的数据在语义与统计特性上协调一致。其次,各来源权重分配(如FineWeb-Edu占20%而Cosmopedia故事类仅2%)需基于严格的消融实验优化,以最大化下游任务表现而不引入风格偏移。此外,处理约650MB的Parquet分片时,如何保证流式加载效率与长尾样本(如数学课本与合成数据)的保留完整性,亦是工程实现层面的重要挑战。
常用场景
经典使用场景
在自然语言处理与大规模语言模型的研究浪潮中,预训练数据集的构建质量直接决定了模型的知识广度与泛化能力。SomethingNew数据集作为一款精心混合的预训练语料库,其经典使用场景聚焦于为中小规模语言模型的从头训练提供高质量、多样化的文本素材。该数据集从多个权威源头按比例抽取样本,涵盖教育性网页文本(如FineWeb-Edu-Dedup)、百科全书式内容(如FineWiki)、数学推理语料(如FineMath)以及代码教学资源(如Python-Edu),累计十万条精选样本,特别适用于探索高效数据配比策略、验证模型在通用知识理解与推理能力上的协同提升效果。
实际应用
在实际应用中,SomethingNew数据集因其精炼的体量与多维知识覆盖,尤为适合部署至资源受限的科研团队或工业场景,作为教学用语言模型的预训练基石。例如,在低算力设备上训练轻量级教育问答助手时,可直接基于该数据集快速获得具备基础百科、数学与编程能力的模型原型。此外,它也可作为数据增强环节引入成熟模型微调流程,通过补充高质量推理语料来缓解领域知识遗忘问题,或作为持续学习评测中的种子集,验证模型在新知识吸收过程中的灾难性遗忘抑制能力。
衍生相关工作
SomethingNew数据集的发布催生了若干富有启发性的后续研究。其多源混合策略直接启发了关于最优数据配比的经验性探索,如围绕FineWeb-Edu与Cosmopedia等组件的消融实验,系统量化了教育文本与创意故事对模型推理与生成流畅度的贡献权重。同时,基于该数据集训练的模型常被用作基线,在少样本学习与跨任务泛化评测框架中对比不同语料清洗方法的效果。此外,其数学与代码子集的均衡融入,为验证语言模型在符号推理上的涌现能力提供了标准化测试平台,间接推动了如FineMath系列数据集的迭代优化与专用评估集的设计。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务