遇见数据集

llm_speedrun

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

该数据集是为LLM Speedrun练习准备的预分词训练产物。它包含一个JSON序列化的BPE分词器文件(tokenizer_50M.bpe)以及两个token流二进制文件:一个是经过混洗的FineWeb-Edu数据集10B子集(fineweb-edu-10BT.shuffle.bin,约94.4亿tokens),另一个是经过混洗的SmolTalk数据集全部数据(smoltalk.shuffle.bin,约8.75亿tokens)。所有.bin文件均为无头的小端序无符号16位token ID格式,可使用NumPy的memmap进行内存映射读取。该数据集适用于预训练和指令微调任务,特别适合需要预分词token流的LLM训练实验。

This dataset is a pre-tokenized training product prepared for the LLM Speedrun exercise. It includes a JSON-serialized BPE tokenizer file (tokenizer_50M.bpe) and two token stream binary files: one is a shuffled subset of the FineWeb-Edu dataset of 10B tokens (fineweb-edu-10BT.shuffle.bin, approximately 9.44 billion tokens), and the other is the full shuffled SmolTalk dataset (smoltalk.shuffle.bin, approximately 0.875 billion tokens). All .bin files are headerless little-endian unsigned 16-bit token ID formats, which can be read via memory mapping using NumPys memmap. This dataset is suitable for pre-training and instruction fine-tuning tasks, especially for LLM training experiments that require pre-tokenized token streams.

创建时间:
2026-09-02
原始信息汇总

数据集概述:LLM Speedrun token streams

该数据集是用于 LLM Speedrun 练习 的预分词训练资源,包含一个 BPE 分词器文件和两个经过打乱的 token 流文件,旨在支持文本生成任务的预训练与指令调优。

  • 语言:英语
  • 许可协议:其他(需参考 DATA_CARD.md 获取详细信息)
  • 任务类别:文本生成
  • 标签:预训练、指令调优、已分词

文件内容与规模

文件名 描述 Token 数量
tokenizer_50M.bpe JSON 序列化的 BPE 分词器
fineweb-edu-10BT.shuffle.bin FineWeb-Edu sample/10BT 打乱后的 token 流 9,440,023,113
smoltalk.shuffle.bin SmolTalk data/all 打乱后的 token 流 875,269,408

技术说明

  • .bin 文件为无头部信息的 小端序无符号 16 位 token ID,可通过 NumPy 直接进行内存映射读取,示例代码已提供。
  • 使用 tokenizer_50M.bpe 需要配套的 LLM Speedrun BPE 实现。

附加信息

数据集的来源、处理流程、许可协议及使用限制等详细说明,请参考 DATA_CARD.md 文件。

搜集汇总
数据集介绍
llm_speedrun 数据集图片
构建方式
该数据集针对大语言模型预训练与指令微调的高效实验需求而设计,提供了经过预处理的token流文件。其构建过程涉及从FineWeb-Edu的10BT子集和SmolTalk的全量数据中采样,通过分片与随机打乱操作,最终生成了无文件头的16位无符号整数token序列,以二进制格式存储。这些文件可直接通过内存映射加载,极大提升了数据读取效率。配套的BPE分词器文件以JSON格式保存,与自定义分词实现相匹配,确保数据处理的兼容性与复现性。
特点
该数据集的核心特征在于其高度工程化的预处理层级,去除了文本原始形态而直接提供token级别的数据流,便于研究者快速接入训练管道。其中FineWeb-Edu部分占据主导,含有约94.4亿个token,覆盖大规模预训练语料;SmolTalk则贡献约8.75亿token,聚焦于指令调优场景。每个bin文件均经洗牌处理,以避免序列顺序偏差。此外,数据以无头文件结构存储,配合内存映射技术,可显著降低IO开销,并支持超大数据集的临界加载与随机访问。
使用方法
使用者可通过HuggingFace Hub下载bin文件与分词器。推荐利用NumPy的memmap接口以dtype='<u2'的模式映射文件,从而无损地将token序列视为只读数组,便于直接输入至模型训练循环。分词器的使用需遵循LLMspeedrun项目提供的BPE实现,确保token与文件内id一一对应。该数据集专门为LLMSpeedrun练习设计,用户需参考DATA_CARD文档以了解数据来源、许可及限制,并依据自身任务合理选择预训练或指令调优的token流。
背景与挑战
背景概述
大型语言模型(LLM)的预训练与指令微调是自然语言处理领域的核心研究命题,其性能高度依赖于语料的质量与规模。llm_speedrun数据集由zkolter团队于2024年创建,旨在为LLM的快速迭代与基准测试提供标准化、预处理的训练资源。该数据集整合了FineWeb-Edu的10B规模去重样本与SmolTalk的指令数据,并配套定制化的BPE分词器,形成了总计约10.3B tokens的高效数据流,使研究者能够规避重复的数据清洗与分词开销,专注于模型架构与训练动态的探索。其发布为LLM训练流程的标准化提供了重要支撑,并促进了跨实验室对比研究的可复现性,在开源社区与学术界均产生了显著影响。
当前挑战
该数据集核心解决的技术挑战在于预训练语料处理的复杂性与资源密集性,包括去重、清洗及有效分词策略的制定,通过提供可直接内存映射的二进制token流,极大降低了数据工程门槛。然而,数据集的构建亦面临继承自源语料的领域挑战,如FineWeb-Edu固有的内容偏差与SmolTalk指令集的多样性限制。此外,文件格式的无头部设计虽便于高效加载,却对不熟悉此类协议的使用者构成理解与适配的壁垒。同时,版权与合规性问题在聚合过程中需慎重考量,许可限制可能阻碍商业用途的扩展。未来,在追求数据纯净度与拼接效率之间寻求平衡的持续推进,仍将是该领域亟待攻克的难点。
常用场景
经典使用场景
llm_speedrun数据集作为预分词(pre-tokenized)的语料流,专为大规模语言模型(LLM)的预训练与指令微调实验设计。其核心用途在于为研究者和开发者提供可直接内存映射的高效数据流,免去繁琐的原始文本清洗与分词流程。借助NumPy的memmap机制,用户能够以零拷贝方式流式读取数十亿级别的token序列,从而将精力聚焦于模型架构、训练策略及超参数优化等核心环节。该数据集涵盖FineWeb-Edu精选教育语料与SmolTalk对话数据,前者承载94亿高质量文本token,后者提供约8.75亿指令遵循样本,二者协同为从零训练基础模型和进行领域自适应微调提供了坚实的数据基石,是复现‘数据规模-模型性能’规律研究以及探索低资源训练范式的理想试验场。
解决学术问题
在深度学习学术探索中,数据预处理环节常成为制约实验效率与可复现性的瓶颈。llm_speedrun通过提供统一格式、经打乱处理的预分词token流,深刻回应了这一难题——它消除了不同研究团队因分词器差异、数据清洗规则不一而导致的横向对比偏差,使实验结果能够映射至同一数据坐标系中进行公平衡量。该数据集支撑了关于模型规模、数据规模与计算预算之间缩放律(scaling laws)的高精度验证,有助于厘清预训练语料纯洁度(如FineWeb-Edu的筛选机制)对下游任务泛化能力的因果影响。同时,其内嵌的指令微调数据为探索‘预训练-对齐’两阶段训练中数据配比和顺序效应提供了受控变量,显著增强了科学实验的严谨性与结论的普适性,推动了语言模型高效训练理论的发展。
衍生相关工作
围绕llm_speedrun数据集已衍生出一系列富有成效的研究路径。其一,基于其标准化的token流格式,诸多工作聚焦于开发更高效的数据调度算法,例如课程学习(curriculum learning)中按照语料难度安排训练顺序的策略,通过在不同数据分片上动态调整采样权重,揭示数据选择性对收敛速度与最终性能的影响。其二,数据子集最优化研究借助该数据集的可重组性,探究在token预算固定时如何通过质量过滤或多样性平衡来逼近全量样本表现,从而催生出感知数据效用的动态剪枝方法。最后,该数据集作为‘速度跑(speedrun)’范式基础设施,配套产生了多篇关于训练流程加速的基准文章,它们系统比较了不同优化器、批次调度及长上下文扩展方案在统一数据基准上的表现,这些比较性成果为社区提供了可复现的参考基线,有力促进了开源生态中训练配方知识的快速迭代与共享。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务