BetterDataset-v3
收藏资源简介:
bison-data-v2是一个经过精心整理的预训练数据集,包含9,735,064行数据,分布在74个分片中。该数据集由Phase 0 · Bison Dataset Curator v2构建,专门用于文本生成任务。数据集包含四个核心字段:text(文档文本内容)、source(数据源别名,如fineweb_edu)、curriculum_phase(课程阶段:1=基础、2=知识、3=推理)和domain(领域:web/合成/wiki/数学/代码)。数据来源于9个不同的公开数据集,包括fineweb_edu、cosmopedia_v2、tiny_textbooks、tiny_strange、mini_en、finewiki、arithmetic、tiny_math和python_edu,涵盖了教育网页、合成文本、维基百科、数学和代码等多个领域。每个数据源都有指定的课程阶段和采样权重。数据集以Arrow格式存储,采用zstd压缩,适用于大规模语言模型预训练任务。
bison-data-v2 is a meticulously curated pre-training dataset containing 9,735,064 rows of data distributed across 74 shards. It was constructed by Phase 0 · Bison Dataset Curator v2 and is specifically designed for text generation tasks. The dataset includes four core fields: text (document text content), source (data source alias, such as fineweb_edu), curriculum_phase (curriculum phase: 1=basic, 2=knowledge, 3=reasoning), and domain (domain: web/synthetic/wiki/math/code). The data is sourced from 9 different public datasets, including fineweb_edu, cosmopedia_v2, tiny_textbooks, tiny_strange, mini_en, finewiki, arithmetic, tiny_math, and python_edu, covering various domains such as educational web pages, synthetic text, Wikipedia, mathematics, and code. Each data source has a specified curriculum phase and sampling weight. The dataset is stored in Arrow format with zstd compression, making it suitable for large-scale language model pre-training tasks.




