遇见数据集

BetterDataset-v3

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

bison-data-v2是一个经过精心整理的预训练数据集,包含9,735,064行数据,分布在74个分片中。该数据集由Phase 0 · Bison Dataset Curator v2构建,专门用于文本生成任务。数据集包含四个核心字段:text(文档文本内容)、source(数据源别名,如fineweb_edu)、curriculum_phase(课程阶段:1=基础、2=知识、3=推理)和domain(领域:web/合成/wiki/数学/代码)。数据来源于9个不同的公开数据集,包括fineweb_edu、cosmopedia_v2、tiny_textbooks、tiny_strange、mini_en、finewiki、arithmetic、tiny_math和python_edu,涵盖了教育网页、合成文本、维基百科、数学和代码等多个领域。每个数据源都有指定的课程阶段和采样权重。数据集以Arrow格式存储,采用zstd压缩,适用于大规模语言模型预训练任务。

bison-data-v2 is a meticulously curated pre-training dataset containing 9,735,064 rows of data distributed across 74 shards. It was constructed by Phase 0 · Bison Dataset Curator v2 and is specifically designed for text generation tasks. The dataset includes four core fields: text (document text content), source (data source alias, such as fineweb_edu), curriculum_phase (curriculum phase: 1=basic, 2=knowledge, 3=reasoning), and domain (domain: web/synthetic/wiki/math/code). The data is sourced from 9 different public datasets, including fineweb_edu, cosmopedia_v2, tiny_textbooks, tiny_strange, mini_en, finewiki, arithmetic, tiny_math, and python_edu, covering various domains such as educational web pages, synthetic text, Wikipedia, mathematics, and code. Each data source has a specified curriculum phase and sampling weight. The dataset is stored in Arrow format with zstd compression, making it suitable for large-scale language model pre-training tasks.

创建时间:
2026-06-26
搜集汇总
数据集介绍
BetterDataset-v3 数据集图片
构建方式
该数据集名为BetterDataset-v3,是基于Bison Dataset Curator v2工具精心构建的预训练语料库。其构建遵循三阶段课程学习范式:Phase 1聚焦基础语料,整合了来自HuggingFaceFW/fineweb-edu的网络文本、smollm-corpus的综合语料以及tiny-textbooks等合成教材;Phase 2引入finewiki的百科全书知识,强化知识密度;Phase 3则纳入Arithmetic-1.5M数学题库与python_edu代码片段以提升推理能力。最终整合73个来源,通过加权混合形成约974万条记录,涵盖74个分片以分布式存储。
特点
该数据集以结构化课程学习为核心特色,每条数据均标注了课程阶段(curriculum_phase)与领域标签(domain),从基础网络文本逐步过渡到复杂数学与代码。数据来源多样且权重经过精心设计,兼顾文本质量与领域平衡。采用Apache Arrow格式压缩存储,配有详细的分片清单与统计清单,便于理解数据构成。此外,支持流式加载,可高效处理海量数据而无需全量下载。
使用方法
用户可通过HuggingFace Datasets库便捷加载,推荐使用流式模式以降低内存开销:调用load_dataset('CyanMonkey/BetterDataset-v3', split='train', streaming=True)即可迭代访问。数据以'train'分割形式发布,每条记录包含原始文本、来源、课程阶段及领域信息,适用于自回归语言模型的预训练。高级用户可结合分片清单与元数据进行定制化采样或混合训练策略。
背景与挑战
背景概述
在大规模语言模型预训练领域,数据集的规模与质量直接决定了模型的知识广度与推理能力。BetterDataset-v3(亦称为bison-data-v2)由Phase 0团队于近期构建,旨在为文本生成任务提供经过精心策划的预训练语料。该数据集包含超过970万行文本,覆盖74个分片,整合了来自多个权威来源的数据,如FineWeb-Edu、Cosmopedia v2、FineWiki等,并创新性地引入了基于课程学习的三阶段划分(基础、知识、推理)。该数据集通过结构化的来源权重与领域分类,为提升语言模型在不同学习阶段的适应性与表现提供了重要支撑,对推动开放预训练数据集的发展具有显著影响力。
当前挑战
BetterDataset-v3面临的核心挑战包括:一是领域问题的挑战,即如何构建一个既具备广泛知识覆盖又能支持模型在不同难度阶段逐步学习的数据集,解决传统单一来源预训练数据在知识深度与推理能力上的不足。二是构建过程中的挑战,如从多个异构来源(网页、合成数据、百科、数学、代码)中高效整合并去重,确保数据一致性与无冗余;同时,在课程阶段划分与权重分配之间需要精细调校,以避免数据分布偏差对模型性能产生负面影响,此外还需处理超大规模数据的管理与流式加载效率问题。
常用场景
经典使用场景
在自然语言处理领域,BetterDataset-v3作为一款精心策展的预训练语料库,其最经典的使用场景在于为大型语言模型提供分阶段、多领域的训练数据支持。该数据集囊括了来自互联网、合成文本、维基百科、数学及代码等多源信息,并按基础、知识与推理三个课程阶段进行组织,使研究者能够依据模型训练的不同周期灵活调配数据。这种设计不仅提升了语言模型对通用知识的覆盖面,更强化了其在逻辑推理与数学编程等专业维度的能力,成为构建高性能基座模型的基石。
衍生相关工作
围绕BetterDataset-v3的设计理念,学界衍生出一系列关于课程学习与多源数据融合的经典工作。研究者常以该数据集为基线,探索不同课程阶段(如基础→知识→推理)对最终模型性能的影响,或对比其与单一来源语料(如仅使用FineWeb-Edu)在下游任务中的表现。此外,该数据集的源信息标注(如domain与curriculum_phase)为后续的数据筛选与权重优化研究提供了结构化元数据,推动了诸如自适应数据采样与领域平衡策略等前沿方法的迭代。
数据集最近研究
最新研究方向
BetterDataset-v3作为一款精心策划的预训练数据集,其前沿研究方向主要聚焦于**多阶段课程学习**与**多源异构数据融合**。该数据集通过划分基础、知识与推理三大学习阶段,巧妙整合了来自FineWeb-Edu的高质量网络文本、Cosmopedia的合成数据、FineWiki的百科全书知识,以及专用于数学推理与代码教育的结构化语料。这种设计顺应了当前大语言模型训练中从“规模至上”转向“质量与结构化学习”的潮流,尤其与近期业界对**课程学习**和**专业化数据配比**的热点关注相呼应。通过分阶段引入不同复杂度的文本,该数据集旨在引导模型逐步建立从基本语言理解到复杂逻辑推理的能力,为开发更高效、更智能的下一代语言模型奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务