fineweb-edu-gpt2-tokenized
收藏资源简介:
FineWeb-Edu GPT-2 Tokenized Dataset 是一个使用 GPT-2 分词器(tiktoken)对 FineWeb-Edu 数据集进行分词处理的版本,专为训练 GPT 风格的自回归语言模型而优化。数据集以二进制分片形式存储,以实现最高的训练吞吐量。 数据集内容: - 原始 FineWeb-Edu 文本语料库被转换为连续的 GPT-2 令牌流,并存储在二进制分片中。 - 每个文件包含一个连续的令牌流,可在训练期间随机采样。 数据规模与格式: - 每个分片包含约 1 亿个令牌,文件大小约为 200MB。 - 令牌以 uint16 数据类型编码,对应于 GPT-2 词汇表令牌 ID。 分词细节: - 使用 GPT-2 BPE 分词器,词汇量为 50,257。 - 每个文档后附加 EOS 令牌(<|endoftext|>,50256)以保留文档边界。 预处理流程: 1. 加载 FineWeb-Edu parquet 分片 2. 使用 GPT-2 分词器对文本进行分词 3. 在每个文档后附加 EOS 令牌 4. 将令牌连接成连续流 5. 将令牌写入二进制分片 适用任务: - GPT 风格的语言模型预训练 - 研究实验 - 分词器实验 - 中小型 LLM 训练 优势: - 无分词成本 - 训练吞吐量极高 - 磁盘空间更小 - 加载速度极快 原始数据集来源:karpathy/fineweb-edu-100b-shuffle,包含经过高质量内容筛选的教育类网页文本。
FineWeb-Edu GPT-2 Tokenized 数据集概述
数据集基本信息
- 数据集名称:FineWeb-Edu GPT-2 Tokenized Dataset
- 存储库:
LaughTaleAI/fineweb-edu-gpt2-tokenized - 许可证:apache-2.0
- 原始数据集:
karpathy/fineweb-edu-100b-shuffle - 原始数据集来源:https://huggingface.co/datasets/karpathy/fineweb-edu-100b-shuffle
数据集内容与格式
- 内容描述:该数据集是使用GPT-2分词器(
tiktoken)对FineWeb-Edu数据集进行分词后的版本,包含高质量的教育类网络文本。 - 核心格式:数据以二进制分词分片(
.bin文件)形式存储,旨在实现最大化的训练吞吐量。 - 数据特征:包含
text、id、dump、url、file_path、language、language_score、token_count、score、int_score、raw_text、document_id、overlap_score等字段。 - 数据分割:仅包含训练集(
train)。 - 数据规模:
- 下载大小:625799字节
- 数据集大小:1049455字节
- 示例数量:100
分词与预处理详情
- 分词器:GPT-2 BPE
- 分词库:tiktoken
- 词汇表大小:50,257
- 特殊标记:
<|endoftext|>(50256) - 处理流程:
- 加载FineWeb-Edu的parquet分片。
- 使用GPT-2分词器对文本进行分词。
- 在每个文档后附加EOS(句子结束)标记。
- 将分词结果连接成一个连续的流。
- 将分词写入二进制分片。
- 关键特性:处理过程完全确定且可复现。每个分片包含一个连续的标记流,便于训练时随机采样。
技术规格
- 文件格式:二进制文件(
.bin) - 数据类型:
uint16 - 分片规格:
- 每个文件约包含1亿个标记。
- 每个文件大小约为200MB。
- 文件命名示例:
train_00000.bin,train_00001.bin,train_00002.bin等。
预期用途
- GPT风格的自回归语言模型预训练。
- 研究实验。
- 分词器实验。
- 训练中小型大语言模型。
训练使用方式
- 设计目标:用于GPT风格的因果语言建模。
- 典型工作流:
- 使用
numpy.memmap加载.bin分片。 - 随机采样标记偏移量。
- 提取固定长度的序列。
- 训练自回归模型。
- 使用
- 示例配置:
- 序列长度:512
- 批次大小:256
- 优化器:AdamW
- 学习率:3e-4
优势对比
与文本数据集相比,二进制分词数据集具有以下优势:
- 分词成本:无(文本数据集为高)。
- 训练吞吐量:极高(文本数据集为中等)。
- 磁盘占用:更小(文本数据集更大)。
- 加载速度:极快(文本数据集较慢)。
引用与致谢
-
引用要求:使用本数据集时,请引用原始的FineWeb数据集。
-
引用格式:
@dataset{fineweb, title = {FineWeb Dataset}, year = {2024}, publisher = {HuggingFace} }
-
致谢对象:FineWeb数据集、Hugging Face Datasets、tiktoken分词器的创建者。



