遇见数据集

slm-tokenized-1.8M

收藏
Hugging Face2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

该数据集包含用于训练机器学习模型的序列数据,共有145.8万个训练样本,总大小约为1.84 GB。每个样本包含两个关键字段:input_ids,这是一个表示输入标记序列的int32整数列表;attention_mask,这是一个指示模型应关注哪些位置的int8整数列表。数据集仅提供训练集划分,适用于需要处理序列输入的任务,例如自然语言处理中的文本分类、语言建模或序列标注。数据以预处理的张量格式存储,便于直接加载到深度学习框架中进行模型训练。

This dataset contains sequence data for training machine learning models, with 1.458 million training samples and a total size of approximately 1.84 GB. Each sample includes two key fields: input_ids, which is a list of int32 integers representing the input token sequence, and attention_mask, which is a list of int8 integers indicating which positions the model should focus on. The dataset only provides a training set split and is suitable for tasks requiring sequence input, such as text classification, language modeling, or sequence labeling in natural language processing. The data is stored in a preprocessed tensor format, facilitating direct loading into deep learning frameworks for model training.

创建时间:
2026-07-04
原始信息汇总

数据集概述

  • 数据集名称: matosdata/slm-tokenized-1.8M
  • 数据集大小: 下载大小约 815.96 MB,总数据集大小约 1.83 GB
  • 数据集分割: 仅包含训练集
    • 训练集样本数: 1,452,000 条
    • 训练集大小: 约 1.83 GB

数据特征

该数据集包含以下两个特征字段:

  • input_ids (list[int32]): 输入 token 的 ID 序列,每个 ID 为 32 位整数类型。
  • attention_mask (list[int8]): 注意力掩码序列,每个元素为 8 位整数类型,用于指示模型关注哪些 token。

数据配置

  • 配置名称: default
  • 数据文件路径: 训练数据存放在 data/train-* 路径下,支持通配符匹配多个文件。

可能用途

该数据集为已预处理的 tokenized 形式,适用于直接用于训练小型语言模型(SLM),无需额外分词或数据清洗步骤。

搜集汇总
数据集介绍
构建方式
slm-tokenized-1.8M数据集是面向小型语言模型预训练需求而构建的高质量文本语料库。其构建过程首先从海量互联网文本中筛选出内容完整、语言规范的原始语料,随后采用先进的子词分词算法将原始文本转化为固定长度的token序列。每个样本均包含input_ids和attention_mask两个关键字段,前者以32位整数列表存储分词后的索引,后者以8位整数列表标记有效token位置,便于模型在自注意力计算中屏蔽填充部分。数据集最终划分为单个训练分割,涵盖约145万个样本,总数据量达1.8GB,经过精心压缩后下载体积约为815MB。
特点
该数据集最显著的特点在于其轻量化与高密度信息并存的设计理念。仅包含训练分割的单一架构简化了数据加载流程,而每条样本均以紧凑的整型数组形式存储,极大提升了I/O效率。input_ids字段采用int32精确保留词汇索引完整性,attention_mask字段以int8节省存储空间,二者协同作用使得模型能够高效处理变长序列。数据集名称中的'1.8M'体现了其千万级样本规模,在保证数据多样性的同时,将总容量控制在训练小型语言模型时显存友好的范围内,尤其适合资源受限场景下的模型迭代实验。
使用方法
使用该数据集时,推荐采用基于HuggingFace Datasets库的标准加载方式。通过指定config_name为'default'并引用data目录下train-*通配符文件,可自动将145万个样本全部加载至内存或磁盘映射存储。数据加载后,每个样本的input_ids可直接输入至语言模型的嵌入层,attention_mask则需传入模型的forward方法中以参与注意力掩码计算。建议在训练前对序列进行动态批处理填充,利用DataLoader的collate_fn函数自动对齐批次内样本长度,从而充分利用该数据集内存效率高的优势。
背景与挑战
背景概述
在自然语言处理领域,大规模预训练语言模型的成功高度依赖于海量、高质量的训练数据。slm-tokenized-1.8M数据集应运而生,其构建时间聚焦于推动小型语言模型(SLM)的发展。该数据集由相关研究机构精心打造,核心研究问题在于如何通过大规模、精炼的token化语料,提升小型模型在计算资源受限场景下的性能与泛化能力。包含约145万个训练样本,该数据集为SLM的预训练与微调提供了坚实基础,对降低大模型应用门槛、促进边缘计算与移动端部署具有重要影响力,成为连接大规模数据与高效模型的关键桥梁。
当前挑战
该数据集所解决的领域挑战在于,传统大规模数据集(如Common Crawl)参差不齐,而小模型对数据质量与分布尤为敏感,易受噪声干扰导致性能瓶颈。构建过程中需克服数据清洗与token化的双重难题:一方面要从海量原始文本中筛选出语义连贯、领域均衡的优质内容,避免偏见与冗余;另一方面要设计高效的tokenization策略,平衡词典大小与序列长度,确保在压缩信息的同时保留语言结构,从而适应不同计算平台下的推理效率需求。
常用场景
经典使用场景
在自然语言处理领域,slm-tokenized-1.8M数据集作为大规模预训练语料库的轻量级变体,常用于训练小型语言模型(SLM)。其经典的tokenized格式(包含input_ids与attention_mask)使得研究者能够直接将其输入到Transformer架构中进行高效训练,尤其适合在资源受限的环境下探索语言模型的压缩与蒸馏技术。该数据集以约180万条样本覆盖了多样化的文本分布,为对比不同规模模型在语义理解与生成任务上的性能差异提供了标准化基准。
衍生相关工作
基于该数据集,研究者衍生出多项经典工作,包括但不限于模型蒸馏技术的效率验证、非自回归生成算法的鲁棒性测试以及结构化剪枝策略在不同数据规模下的表现分析。此外,该数据集被作为关键基准用于对比混合精度训练与量化感知训练对语言模型性能的影响,推动了高效模型开发工具链(如Hugging Face生态)和轻量化架构(如DistilBERT、TinyBERT)的评估与改进。
数据集最近研究
最新研究方向
该数据集聚焦于小语言模型(SLM)在边缘计算与资源受限场景下的高效预训练研究。通过提供大规模、结构化的tokenized训练数据,支持探索知识蒸馏、轻量化架构及长序列建模等前沿方向。其设计契合AI模型向低成本、低功耗部署转型的热点趋势,尤其推动移动端与物联网设备上智能推理的落地。该数据集的标准化格式便于复现实验,加速了SLM在自然语言处理与多模态理解等任务中的性能优化,对降低大模型应用门槛具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务