llm_speedrun
收藏资源简介:
该数据集是为LLM Speedrun练习准备的预分词训练产物。它包含一个JSON序列化的BPE分词器文件(tokenizer_50M.bpe)以及两个token流二进制文件:一个是经过混洗的FineWeb-Edu数据集10B子集(fineweb-edu-10BT.shuffle.bin,约94.4亿tokens),另一个是经过混洗的SmolTalk数据集全部数据(smoltalk.shuffle.bin,约8.75亿tokens)。所有.bin文件均为无头的小端序无符号16位token ID格式,可使用NumPy的memmap进行内存映射读取。该数据集适用于预训练和指令微调任务,特别适合需要预分词token流的LLM训练实验。
This dataset is a pre-tokenized training product prepared for the LLM Speedrun exercise. It includes a JSON-serialized BPE tokenizer file (tokenizer_50M.bpe) and two token stream binary files: one is a shuffled subset of the FineWeb-Edu dataset of 10B tokens (fineweb-edu-10BT.shuffle.bin, approximately 9.44 billion tokens), and the other is the full shuffled SmolTalk dataset (smoltalk.shuffle.bin, approximately 0.875 billion tokens). All .bin files are headerless little-endian unsigned 16-bit token ID formats, which can be read via memory mapping using NumPys memmap. This dataset is suitable for pre-training and instruction fine-tuning tasks, especially for LLM training experiments that require pre-tokenized token streams.
数据集概述:LLM Speedrun token streams
该数据集是用于 LLM Speedrun 练习 的预分词训练资源,包含一个 BPE 分词器文件和两个经过打乱的 token 流文件,旨在支持文本生成任务的预训练与指令调优。
- 语言:英语
- 许可协议:其他(需参考
DATA_CARD.md获取详细信息) - 任务类别:文本生成
- 标签:预训练、指令调优、已分词
文件内容与规模
| 文件名 | 描述 | Token 数量 |
|---|---|---|
tokenizer_50M.bpe |
JSON 序列化的 BPE 分词器 | — |
fineweb-edu-10BT.shuffle.bin |
FineWeb-Edu sample/10BT 打乱后的 token 流 |
9,440,023,113 |
smoltalk.shuffle.bin |
SmolTalk data/all 打乱后的 token 流 |
875,269,408 |
技术说明
.bin文件为无头部信息的 小端序无符号 16 位 token ID,可通过 NumPy 直接进行内存映射读取,示例代码已提供。- 使用
tokenizer_50M.bpe需要配套的 LLM Speedrun BPE 实现。
附加信息
数据集的来源、处理流程、许可协议及使用限制等详细说明,请参考 DATA_CARD.md 文件。




