dclm-baseline-1.0-llama3-tokenized
收藏资源简介:
DCLM-Baseline Pretokenized 数据集是 DCLM-Baseline 的预分词和全局洗牌版本,专为大规模语言模型预训练设计,尤其适用于 LLaMA 3.1 风格的训练流程。数据集包含约 4T 令牌和 2,949,254,346 份文档,使用 LLaMA 3.1 分词器进行独立编码,无填充或截断。通过固定随机种子对所有文档进行全局洗牌,确保原始数据的分片顺序不保留任何局部性。文档通过最佳适应裁剪算法打包成长度为 8,192 的序列,实现 100% 令牌利用率,但约 35% 的令牌因序列边界裁剪被丢弃。数据集仅适用于自回归语言模型预训练,不适用于微调、指令调优或任何监督任务。其底层数据源自 Common Crawl 网络爬取数据,遵循 CC-BY-4.0 许可,并仅用于研究目的。
The DCLM-Baseline Pretokenized dataset is a pretokenized and globally shuffled version of DCLM-Baseline, specifically designed for large-scale language model pretraining, particularly suitable for LLaMA 3.1-style training pipelines. The dataset contains approximately 4T tokens and 2,949,254,346 documents, independently encoded using the LLaMA 3.1 tokenizer without padding or truncation. A fixed random seed is used to globally shuffle all documents, ensuring that the original datas shard order retains no locality. Documents are packed into sequences of length 8,192 using a best-fit cropping algorithm, achieving 100% token utilization, though approximately 35% of tokens are discarded due to sequence boundary cropping. The dataset is exclusively suitable for autoregressive language model pretraining and not for fine-tuning, instruction tuning, or any supervised tasks. The underlying data is sourced from Common Crawl web crawls, follows the CC-BY-4.0 license, and is intended for research purposes only.
数据集概述:DCLM-Baseline Pretokenized (LLaMA 3.1, 8192 context)
基本信息
- 数据集名称:DCLM-Baseline Pretokenized (LLaMA 3.1, 8192 context)
- 许可证:CC-BY-4.0
- 语言:英语
- 标签:预标记化、预训练、LLaMA 3、文本
数据来源
- 基于 DCLM-Baseline 数据集(原始地址:https://huggingface.co/datasets/mlfoundations/dclm-baseline-1.0),该数据集源自 Common Crawl 网络爬取数据。
- 原始 DCLM-Baseline 是一个包含约 4T tokens / 3B 文档 的预训练数据集。
- 相关论文:https://arxiv.org/abs/2406.11794
标记化
- 分词器:使用 LLaMA 3.1 分词器(meta-llama/Llama-3.1-8B)
- 库:HuggingFace transformers 中的 AutoTokenizer
- 处理方式:每个文档独立编码,无填充、无截断
- 数据规模:
- 总文档数:2,949,254,346
- 估计总 tokens:约 4T
全局混洗
- 对所有 2,949,254,346 个文档进行了全局文档级混洗
- 使用固定随机种子(seed=42)确保完全可复现
序列打包
- 文档被打包为长度为 8,192 的序列
- 采用 Best-Fit Cropping 算法(实现代码来源:https://github.com/karpathy/nanochat/blob/0aaca56805eb13f6e6e1fff789a08086902f12ab/nanochat/dataloader.py#L74-L161)
- 关键特性:
- 每个序列以 BOS token 开头
- 100% token 利用率,无填充 token
- 当没有文档能填入剩余空间时,裁剪最短的缓冲文档以恰好填满
- 由于序列边界裁剪,约 35% 的 token 被丢弃
- 上下文长度 8,192 遵循 LLaMA 3 论文(https://arxiv.org/abs/2407.21783)中的预训练安排
预期用途
- 仅用于 自回归语言模型预训练
- 不适用于微调、指令微调或任何监督任务
- 继承原始 DCLM-Baseline 数据集的 研究用途限制
非适用范围
- 不适用于生产环境下的模型训练
- 在代码和数学等特定领域任务上表现可能有限
- 仅限研究目的使用
引用
如需使用该数据集,请引用原始 DCLM 论文(见 README 中的引文格式)。




