遇见数据集

OLMo3-1B-Dataset

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

该数据集是 Ai2/AllenAI 官方 OLMo 3 训练数据的重新分发归档,采用 OLMo-core 可直接加载的目录布局形式。数据包含预训练阶段(Stage 1-3,源自 Dolma 3 系列混合数据集)和后训练阶段(Stage 4-5,源自 Dolci 系列 SFT 数据集),以及用于困惑度验证的评估子集。所有数据均为预标记化的 uint32 token-ID 序列,后训练阶段还附带对齐的标签掩码。数据集总未压缩大小约 1.36 TB,压缩后约 220 GB,共包含 49 个归档文件、20,167 个文件。用户需通过下载归档文件并执行提取脚本,将其重建为 OLMo-core 训练配方可直接使用的数据根目录。该数据集主要面向大规模语言模型(OLMo 3)的预训练、持续训练(中期训练)和指令微调(SFT)等任务,不适用于直接使用 Hugging Face Datasets 的 load_dataset 方法。

This dataset is a redistribution archive of the official OLMo 3 training data from Ai2/AllenAI, organized in a directory layout directly loadable by OLMo-core. It includes pre-training stages (Stage 1-3, derived from the Dolma 3 series mixed dataset) and post-training stages (Stage 4-5, derived from the Dolci series SFT dataset), as well as an evaluation subset for perplexity validation. All data consists of pre-tokenized uint32 token-ID sequences, with post-training stages additionally including aligned label masks. The total uncompressed size is approximately 1.36 TB, compressed to about 220 GB, comprising 49 archive files and 20,167 individual files. Users need to download the archive files and execute extraction scripts to rebuild the dataset into a root directory directly usable by OLMo-core training recipes. This dataset is primarily intended for pre-training, continued training (mid-training), and instruction fine-tuning (SFT) of large language models (OLMo 3), and is not suitable for direct use with Hugging Face Datasets load_dataset method.

创建时间:
2026-08-15
原始信息汇总

OLMo 3 预分词处理训练数据(OLMo3-1B-Dataset)数据集详情

数据集概述

该数据集是 Ai2/AllenAI 官方 OLMo 3 训练数据的重分发版本,采用 OLMo-core 兼容的归档布局,并非新策划的数据混合。数据集以归档形式提供(而非基于行的 Hugging Face Datasets 构建器),需下载并解压,而非使用 datasets.load_dataset() 或 Dataset Viewer。主要内容为 uint32 类型的 token-ID 流,并包含与后训练阶段对齐的标签掩码。

数据布局

数据集包含归档文件(archives/)和文件列表(lists/)两个主要目录,归档文件按阶段(stage1 至 stage5 及 eval)分别存放。解压后形成 OLMo-core 训练配方可直接加载的数据根目录,包含预训练数据(preprocessed/)、后训练数据(Dolci-Think-SFT-7B/Dolci-Instruct-SFT/)和评估数据(eval-data/)三大部分。

数据来源与阶段划分

阶段 数据内容 上游数据来源
Stage 1 Dolma2-0625 150B 混合(预分词) Dolma 3 Sample: 150B Mix
Stage 2 Dolma3 Dolmino 官方 100B 混合(预分词) Dolma 3 Dolmino Mix: 100B
Stage 3 Dolma3 Longmino 50B 混合(预分词) Dolma 3 Longmino Mix: 50B
Stage 4 Dolci-Think-SFT-7B 处理后的 SFT 数据 用于 Olmo-3-7B-Think-SFT 训练
Stage 5 Dolci-Instruct-SFT 处理后的 SFT 混合 用于 Olmo-3-7B-Instruct-SFT 训练
Eval 小型多源 PPL 验证混合 OLMo-core 验证数据,非训练混合

文件规模

归档组 归档数 文件数 原始大小 压缩大小 压缩率
Stage 1 15 6,915 629.875 GB 71.065 GB 11.282%
Stage 2 18 11,933 399.802 GB 83.303 GB 20.836%
Stage 3 10 998 200.001 GB 47.409 GB 23.705%
Stage 4 4 284 123.519 GB 17.268 GB 13.980%
Stage 5 1 26 9.058 GB 1.166 GB 12.875%
Eval 1 11 0.027 GB 0.008 GB 30.627%
总计 49 20,167 1,362.282 GB 220.219 GB 16.165%

下载与解压方式

通过 Hugging Face Hub 使用 hf download 命令下载整个数据集或按阶段选择性下载(Stage 1 和 Stage 2 还需下载 eval 数据)。下载后通过 bash extract.sh /path/to/olmo3_data_root 解压成 OLMo-core 数据根目录,支持部分阶段解压及后续安全合并。

许可证与版权

该重分发版本遵循与官方 OLMo 3 数据集相同的 Open Data Commons Attribution License v1.0 (ODC-By)。底层数据集的署名归 Ai2/AllenAI 和 Team OLMo 所有,下游分发和使用需保留 ODC-By 要求的署名和声明。

搜集汇总
数据集介绍
OLMo3-1B-Dataset 数据集图片
构建方式
OLMo3-1B-Dataset数据集由Ai2/AllenAI官方发布的OLMo 3训练数据重新打包而成,以OLMo-core就绪的存档布局呈现。该数据集包含六个部分:三个阶段(Stage 1-3)的预训练数据、两个后训练阶段(Stage 4-5)的SFT数据以及评估数据。所有数据均已预先分词,采用100,278词表的OLMo 3分词器家族,其中前三个阶段和评估数据使用dolma2-tokenizer,后两个阶段使用olmo-3-tokenizer-instruct-dev@55f211d。数据以uint32 token-ID流形式存储,并附有对齐的标签掩码,以便直接用于OLMo-core训练流程。整体架构通过存档文件和提取脚本实现高效分发,总计包含49个存档、20,167个文件,压缩后总大小约220 GB。
特点
该数据集的核心特点在于其作为官方OLMo 3训练数据的直接再分发,未经任何重新分词或内容变换,确保了与原始训练流程的高度一致性。它涵盖了从预训练到后训练的完整数据流水线,包括150B样本的Dolma 2混合、100B的Dolma 3 Dolmino混合以及50B的Longmino混合,以及两个SFT数据集(Dolci-Think-SFT-7B和Dolci-Instruct-SFT)。数据以高度压缩的存档形式存储,压缩率平均达16.2%,显著降低了存储和传输成本。此外,该数据集提供了精细的分级下载选项,允许用户仅获取所需阶段的数据,实现了灵活的资源管理。
使用方法
使用时,首先通过Hugging Face Hub下载数据集的存档文件,随后运行extract.sh脚本将数据解压至指定目录,形成OLMo-core可直接加载的数据根目录。用户可根据训练需求,仅下载和提取特定阶段的数据,如预训练或SFT阶段,并可与后续阶段安全合并至同一根目录。对于Stage 4和5,需使用Open-Instruct的转换脚本重新生成数据,该过程已由官方提供,并指定了特定的tokenizer版本和最大序列长度。评估数据需与Stage 1和2配合使用,用于困惑度评估。最终,将数据根目录路径配置到OLMo-core训练配方中即可启动训练。
背景与挑战
背景概述
OLMo3-1B-Dataset是艾伦人工智能研究所(AI2)及其OLMo团队在2025年发布的大规模语言模型预训练与后训练数据集,旨在支撑OLMo 3系列模型的开发。该数据集整合了多阶段训练语料,包括从Dolma 2和Dolma 3混合语料中精选的预训练数据,以及用于指令微调和思考微调的SFT数据,并统一采用OLMo 3定制的100,278词元分词器进行预处理,以令牌ID流形式存储。其核心研究问题在于如何构建一个高质量、可复现且支持高效训练的数据管道,从而推动开放科学语言模型的发展。该数据集作为OLMo 3训练的基础,对开放语言模型社区具有重要影响力,为后续研究提供了标准化的数据基准和可扩展的训练范式。
当前挑战
该数据集面临的挑战主要来自领域问题与构建过程两个层面。领域层面上,语言模型训练需要海量多样且高质量的文本数据,而原始语料往往存在噪声、重复和偏见,如何设计混合比例与过滤策略以优化模型性能是关键难题。构建过程中,数据集规模庞大,总计超过1.3TB原始文本,需经过分词、去重、掩码对齐等复杂流水线,且涉及多阶段(预训练、后训练)的数据格式转换与一致性维护。此外,确保数据来源的合规性、版权归属以及在不同训练阶段间平滑过渡,亦对工程实现与数据治理提出了极高要求。
常用场景
经典使用场景
OLMo3-1B-Dataset作为OLMo 3模型全流程训练数据的预分词归档,其核心使用场景在于支持科研人员复现和探索开放语言模型的预训练与后训练流程。数据集涵盖从大规模语料预训练(Stage 1-3)到监督微调(Stage 4-5)以及评估数据,并以uint32 token ID流的形式存储,配合对齐的标签掩码,使得研究人员可直接将其输入OLMo-core训练框架,进行从零开始的语言模型训练、继续训练或针对特定任务的微调。该数据集特别适用于需要精确控制数据预处理过程的学术实验,如比较不同数据混合策略、验证分词器一致性对模型性能的影响,或研究长序列建模中的上下文扩展。其分阶段的设计允许研究者针对特定训练阶段进行定制化研究,而无需处理原始文本的复杂清洗与分词环节,从而大幅提高了实验的可重复性与效率。
实际应用
在实际应用中,OLMo3-1B-Dataset为工业界和学术界提供了一套可直接用于生产环境的训练数据基础设施。企业或研究机构可借助该数据集快速启动自研语言模型的训练项目,尤其是在资源受限的情况下,通过复用其预处理的token流,显著降低数据工程成本。在模型后训练阶段,Stage 4和Stage 5的SFT数据经过精心设计,可用于开发具备推理能力和指令遵循能力的模型,例如构建聊天机器人、代码助手或领域专家系统。评估数据的加持使得模型开发过程中的性能监控与回归测试更加便捷。此外,该数据集的开放许可(ODC-By)允许商业应用,促进了基于OLMo系列模型的技术创新和产品落地,例如在智能客服、内容生成、教育辅导等场景中部署定制化的语言模型服务。
衍生相关工作
该数据集是OLMo系列开放语言模型研究生态的核心衍生品,其发布催生了多项相关研究与实践。它直接支撑了OLMo 3系列模型的训练与评测,包括Olmo-3-7B-Think-SFT和Olmo-3-7B-Instruct-SFT等后训练模型的开发,后者在指令遵循和推理任务上展现了先进性能。此外,数据集的分阶段设计鼓励了针对数据配比、训练动态分析、以及长文本处理能力增强的后续研究,例如,研究者可基于Stage 3的长文本数据探索位置编码的改进或上下文窗口的扩展技术。OLMo-core框架的集成便利性也促成了多个下游工作的产生,包括数据混合策略的优化、不同分词器的影响评估、以及可复现训练管线的建立。该数据集还作为基准,用于比较其他开放数据集(如RedPajama、RefinedWeb)在训练效果上的差异,推动了开放数据在语言模型研究中的标准化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务