遇见数据集

cosmopedia-v2

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

Format-Separated Cosmopedia-v2 是一个基于 HuggingFaceTB/smollm-corpus 数据集中 cosmopedia-v2 子集重新格式化的数据集。原始数据集被按文本格式(format)划分为 15 个独立的子集,每个子集存储在对应的目录中,以 Parquet 文件形式提供。该数据集旨在方便用户按需下载或流式传输特定类型的数据(例如,仅获取教科书或故事类数据),无需过滤整个数据集。数据集包含以下 15 种格式:对话(dialogue)、电子学习模块(e-learning_module)、科学文章(scientific_article)、故事(story)、儿童故事(story_children)、论坛故事(story_forums)、人生教训故事(story_life_lessons)、道德故事(story_morality)、Reddit 故事(story_reddit)、教科书(textbook)、学术教科书(textbook_academic)、叙事教科书(textbook_narrative)、叙事语调教科书(textbook_narrative_tone)、无条件主题教科书(textbook_unconditionned_topic)以及 wikiHow。数据集的许可证为 ODC-By,语言为英语,适用于文本生成任务。

Format-Separated Cosmopedia-v2 is a dataset reformatted from the cosmopedia-v2 subset of the HuggingFaceTB/smollm-corpus dataset. The original dataset is divided into 15 independent subsets based on text format, each stored in a corresponding directory and provided as Parquet files. This dataset aims to facilitate users to download or stream specific types of data (e.g., only textbooks or stories) on demand, without filtering the entire dataset. The dataset contains the following 15 formats: dialogue, e-learning_module, scientific_article, story, story_children, story_forums, story_life_lessons, story_morality, story_reddit, textbook, textbook_academic, textbook_narrative, textbook_narrative_tone, textbook_unconditionned_topic, and wikiHow. The dataset is licensed under ODC-By, the language is English, and it is suitable for text generation tasks.

创建时间:
2026-08-07
原始信息汇总

数据集详情:Format-Separated Cosmopedia-v2

基本概述

该数据集是 cosmopedia-v2 子集的重新格式化版本,源自 HuggingFaceTB/smollm-corpus 原始数据集。本数据集根据文本的格式字段将原始数据划分为独立的目录,使用户能够轻松下载或流式获取特定子集(例如仅获取教科书或仅获取故事),而无需对整个数据集进行过滤。

许可证与语言

  • 许可证:odc-by(Open Data Commons Attribution License)
  • 语言:英语(en)
  • 任务类别:文本生成(text-generation)

数据集结构

数据集按 15 种格式组织为独立目录,Parquet 文件存储在各格式目录中,遵循以下结构:

text /data/{格式名称}/train-00000-of-00104.parquet

可用格式(子集)

序号 格式名称
1 dialogue
2 e-learning_module
3 scientific_article
4 story
5 story_children
6 story_forums
7 story_life_lessons
8 story_morality
9 story_reddit
10 textbook
11 textbook_academic
12 textbook_narrative
13 textbook_narrative_tone
14 textbook_unconditionned_topic
15 wikihow

每个子集均作为独立的 config 提供,数据文件路径为 data/{格式名称}/*.parquet,划分为 train 分割。

源数据

数据处理方式

处理过程通过按 format 列过滤行,将数据分别保存到各自对应的目录中,同时保留原始的分块编号(train-XXXXX-of-00104.parquet),确保分块结构与原始数据集一致。

搜集汇总
数据集介绍
cosmopedia-v2 数据集图片
构建方式
该数据集源自HuggingFaceTB/smollm-corpus中cosmopedia-v2子集,经重新格式化处理而成。构建过程依据原始数据中的format字段,将全部样本划分至十五个独立目录,分别对应对话、电子学习模块、科学文章、故事、儿童故事、论坛故事、人生教训故事、道德故事、Reddit故事、教科书、学术教科书、叙事教科书、叙事语调教科书、无主题限制教科书以及wikiHow等类别。处理时保留原始分块编号,确保数据完整性与可追溯性,最终以Parquet格式存储于各目录下,形成结构清晰、便于按格式访问的语料库。
使用方法
使用该数据集时,用户可通过HuggingFace数据集库直接加载特定配置。每个格式对应一个配置名称,如dialogue或textbook,并指向相应目录下的Parquet文件。通过指定配置名称,即可获取对应格式的训练集数据。对于需要流式处理的场景,可利用数据集库的流式模式,避免全量下载。若需自定义处理,可依据目录结构直接访问Parquet文件,利用Pandas或PyArrow等工具读取。该设计支持灵活的数据筛选与组合,适用于文本生成模型的训练与评估,尤其适合需要特定文本格式的研究与应用。
背景与挑战
背景概述
大规模语言模型预训练对高质量合成文本语料的需求日益迫切,Cosmopedia-v2应运而生。该数据集由HuggingFaceTB团队于2024年构建,旨在通过生成大规模、多样化、教育导向的合成文本,为小型语言模型提供媲美网络规模语料的训练资源,以突破真实网络数据在质量、版权与可复现性方面的限制,其采用Mixtral模型生成并覆盖教科书、故事等十五种文本格式。
当前挑战
该数据集所应对的领域问题在于,如何以合成方式生成兼具规模、多样性与知识密度的预训练语料,从而弥补高质量开放文本的稀缺。在构建过程中,挑战尤为严峻:既要确保生成内容的事实准确性与逻辑连贯性,避免错误信息的规模化传播,又需在多种文本格式间维持风格一致性与内容差异性,同时防范模型自身偏见与分布偏差在合成语料中的放大与固化。
常用场景
经典使用场景
在大规模语言模型的预训练与指令微调领域,合成语料库已成为提升模型泛化能力的关键基础设施。Cosmopedia-v2数据集凭借其精心构建的十五类文本格式——涵盖对话、电子学习模块、科学论文、儿童故事、论坛叙事、道德寓言、教科书及WikiHow指南等——为研究者提供了高度结构化的训练素材。其最经典的使用场景在于面向小规模语言模型的预训练,通过格式分离的存储结构,研究者可按需抽取特定格式子集,用以探究不同文本形态对模型语言习得与知识内化的差异化影响,进而优化预训练数据的配比策略。
解决学术问题
合成数据在语言模型训练中的效用长期缺乏系统性验证,尤其在数据格式多样性如何影响模型下游表现这一问题上,学术界尚存认知空白。Cosmopedia-v2通过提供格式标注清晰、规模可观的合成语料,有效回应了合成数据能否替代或补充真实网络文本的学术争议。该数据集使研究者得以在受控条件下比较不同格式对模型推理、生成与知识保持能力的贡献,为预训练数据工程提供了可复现的实验基础,对推动数据-centric的人工智能研究具有方法论层面的重要意义。
实际应用
在实际应用层面,Cosmopedia-v2为资源受限场景下的模型开发提供了高效的数据解决方案。教育科技领域可利用其教科书与电子学习模块子集构建智能辅导系统;内容创作平台可借助故事与对话格式训练叙事生成模型;科研辅助工具则可基于科学论文子集优化文献摘要与问答系统。其格式分离的设计显著降低了数据筛选的工程成本,使开发者能够快速定位与任务匹配的语料,从而加速从数据准备到模型部署的迭代周期。
数据集最近研究
最新研究方向
在大规模语言模型预训练数据工程领域,格式感知的数据组织与课程学习策略正成为前沿探索方向。Format-Separated Cosmopedia-v2通过细粒度划分对话、教材、故事等15种文本格式,为研究数据混合比例对模型能力的影响提供了可控实验平台。当前研究聚焦于利用此类结构化合成语料优化预训练课程,例如动态调整叙事性文本与学术教材的采样权重以提升推理与知识迁移能力,同时探索格式标签驱动的数据增强与去偏方法。该数据集亦呼应了开源社区对透明、可复现训练管线的需求,其与SmolLM系列模型的关联推动了小规模高效语言模型的合成数据缩放规律研究,对降低数据获取门槛、促进教育公平具有积极意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务