OLMo3-1B-Dataset
收藏资源简介:
该数据集是 Ai2/AllenAI 官方 OLMo 3 训练数据的重新分发归档,采用 OLMo-core 可直接加载的目录布局形式。数据包含预训练阶段(Stage 1-3,源自 Dolma 3 系列混合数据集)和后训练阶段(Stage 4-5,源自 Dolci 系列 SFT 数据集),以及用于困惑度验证的评估子集。所有数据均为预标记化的 uint32 token-ID 序列,后训练阶段还附带对齐的标签掩码。数据集总未压缩大小约 1.36 TB,压缩后约 220 GB,共包含 49 个归档文件、20,167 个文件。用户需通过下载归档文件并执行提取脚本,将其重建为 OLMo-core 训练配方可直接使用的数据根目录。该数据集主要面向大规模语言模型(OLMo 3)的预训练、持续训练(中期训练)和指令微调(SFT)等任务,不适用于直接使用 Hugging Face Datasets 的 load_dataset 方法。
This dataset is a redistribution archive of the official OLMo 3 training data from Ai2/AllenAI, organized in a directory layout directly loadable by OLMo-core. It includes pre-training stages (Stage 1-3, derived from the Dolma 3 series mixed dataset) and post-training stages (Stage 4-5, derived from the Dolci series SFT dataset), as well as an evaluation subset for perplexity validation. All data consists of pre-tokenized uint32 token-ID sequences, with post-training stages additionally including aligned label masks. The total uncompressed size is approximately 1.36 TB, compressed to about 220 GB, comprising 49 archive files and 20,167 individual files. Users need to download the archive files and execute extraction scripts to rebuild the dataset into a root directory directly usable by OLMo-core training recipes. This dataset is primarily intended for pre-training, continued training (mid-training), and instruction fine-tuning (SFT) of large language models (OLMo 3), and is not suitable for direct use with Hugging Face Datasets load_dataset method.
OLMo 3 预分词处理训练数据(OLMo3-1B-Dataset)数据集详情
数据集概述
该数据集是 Ai2/AllenAI 官方 OLMo 3 训练数据的重分发版本,采用 OLMo-core 兼容的归档布局,并非新策划的数据混合。数据集以归档形式提供(而非基于行的 Hugging Face Datasets 构建器),需下载并解压,而非使用 datasets.load_dataset() 或 Dataset Viewer。主要内容为 uint32 类型的 token-ID 流,并包含与后训练阶段对齐的标签掩码。
数据布局
数据集包含归档文件(archives/)和文件列表(lists/)两个主要目录,归档文件按阶段(stage1 至 stage5 及 eval)分别存放。解压后形成 OLMo-core 训练配方可直接加载的数据根目录,包含预训练数据(preprocessed/)、后训练数据(Dolci-Think-SFT-7B/、Dolci-Instruct-SFT/)和评估数据(eval-data/)三大部分。
数据来源与阶段划分
| 阶段 | 数据内容 | 上游数据来源 |
|---|---|---|
| Stage 1 | Dolma2-0625 150B 混合(预分词) | Dolma 3 Sample: 150B Mix |
| Stage 2 | Dolma3 Dolmino 官方 100B 混合(预分词) | Dolma 3 Dolmino Mix: 100B |
| Stage 3 | Dolma3 Longmino 50B 混合(预分词) | Dolma 3 Longmino Mix: 50B |
| Stage 4 | Dolci-Think-SFT-7B 处理后的 SFT 数据 | 用于 Olmo-3-7B-Think-SFT 训练 |
| Stage 5 | Dolci-Instruct-SFT 处理后的 SFT 混合 | 用于 Olmo-3-7B-Instruct-SFT 训练 |
| Eval | 小型多源 PPL 验证混合 | OLMo-core 验证数据,非训练混合 |
文件规模
| 归档组 | 归档数 | 文件数 | 原始大小 | 压缩大小 | 压缩率 |
|---|---|---|---|---|---|
| Stage 1 | 15 | 6,915 | 629.875 GB | 71.065 GB | 11.282% |
| Stage 2 | 18 | 11,933 | 399.802 GB | 83.303 GB | 20.836% |
| Stage 3 | 10 | 998 | 200.001 GB | 47.409 GB | 23.705% |
| Stage 4 | 4 | 284 | 123.519 GB | 17.268 GB | 13.980% |
| Stage 5 | 1 | 26 | 9.058 GB | 1.166 GB | 12.875% |
| Eval | 1 | 11 | 0.027 GB | 0.008 GB | 30.627% |
| 总计 | 49 | 20,167 | 1,362.282 GB | 220.219 GB | 16.165% |
下载与解压方式
通过 Hugging Face Hub 使用 hf download 命令下载整个数据集或按阶段选择性下载(Stage 1 和 Stage 2 还需下载 eval 数据)。下载后通过 bash extract.sh /path/to/olmo3_data_root 解压成 OLMo-core 数据根目录,支持部分阶段解压及后续安全合并。
许可证与版权
该重分发版本遵循与官方 OLMo 3 数据集相同的 Open Data Commons Attribution License v1.0 (ODC-By)。底层数据集的署名归 Ai2/AllenAI 和 Team OLMo 所有,下游分发和使用需保留 ODC-By 要求的署名和声明。




