遇见数据集

bergson-smollm2-scaling

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集包含用于训练语言模型的tokenized序列。每条样本包含两个字段:input_ids(整数列表,表示token序列)和length(整数,表示序列长度)。数据集提供了多种规模的训练子集:train_4k(4000样本)、train_8k(8000样本)、train_16k(16000样本)、train_32k(32000样本)、train_64k(64000样本)、train_128k(128000样本)和train_256k(256000样本),以及一个heldout_4k验证集(4000样本)和两个小规模查询集query_50(50样本)和query_20(20样本)。总数据量约1GB,适用于不同规模的语言模型预训练、微调或评估任务。

This dataset contains tokenized sequences for training language models. Each sample includes two fields: input_ids (a list of integers representing token sequences) and length (an integer representing sequence length). The dataset provides training subsets of various sizes: train_4k (4000 samples), train_8k (8000 samples), train_16k (16000 samples), train_32k (32000 samples), train_64k (64000 samples), train_128k (128000 samples), and train_256k (256000 samples), as well as a heldout_4k validation set (4000 samples) and two small query sets query_50 (50 samples) and query_20 (20 samples). The total data volume is approximately 1GB, suitable for pre-training, fine-tuning, or evaluation tasks of language models at different scales.

提供机构:
EleutherAI
创建时间:
2026-08-20
原始信息汇总

数据集概述:EleutherAI/bergson-smollm2-scaling

基本信息

  • 数据集地址:https://huggingface.co/datasets/EleutherAI/bergson-smollm2-scaling
  • 数据集大小:约 1,054,864,200 字节(约 1.05 GB)
  • 下载大小:约 1,051,574,307 字节(约 1.05 GB)

数据特征

  • 特征字段
    • input_ids:数据类型为 int32 的列表
    • length:数据类型为 int64

数据划分

该数据集包含以下多个子集,按数据规模逐步递增:

训练集

子集名称 样本数量 数据大小
train_4k 4,000 8,240,000 字节
train_8k 8,000 16,480,000 字节
train_16k 16,000 32,960,000 字节
train_32k 32,000 65,920,000 字节
train_64k 64,000 131,840,000 字节
train_128k 128,000 263,680,000 字节
train_256k 256,000 527,360,000 字节

保留集

子集名称 样本数量 数据大小
heldout_4k 4,000 8,240,000 字节

查询集

子集名称 样本数量 数据大小
query_50 50 103,000 字节
query_20 20 41,200 字节

配置信息

  • 默认配置名称:default
  • 数据文件路径:各子集分别对应 data/ 目录下的文件,使用通配符(*)匹配多个分片文件。

用途说明

该数据集专为语言模型缩放实验设计,提供了从 4,000 到 256,000 数量不等的训练样本,用于研究模型性能随数据规模的变化规律。同时包含独立的保留集(heldout_4k)用于验证,以及少量查询样本(query_50、query_20)用于测试或快速演示。

搜集汇总
数据集介绍
bergson-smollm2-scaling 数据集图片
构建方式
该数据集为语言模型缩放法则研究而精心构建,以SmolLM2为基底模型,通过采样策略生成不同规模的训练子集。具体而言,从原始数据中抽取了4k至256k不等数量的样本,形成七个训练切片(train_4k至train_256k),每个切片按比例扩大样本量,以支持模型在不同数据规模下的性能评估。此外,设有独立的heldout_4k作为验证集,以及query_50和query_20两个小型查询集,用于专门的任务测试。数据以input_ids和length字段存储,分别表示token序列及序列长度,确保格式统一且便于加载。
特点
数据集的核心特征在于其多尺度划分设计,能够系统性地揭示数据规模对语言模型性能的影响。每个训练子集均以指数级增长(4k至256k),覆盖从微小到中等规模的样本范围,为研究缩放定律提供了理想的数据梯度。同时,heldout集与查询集的独立设置,保障了评估的可靠性和任务的可重复性。数据集整体大小约1GB,存储高效,且每个子集均提供完整的样本计数和字节数,便于统计分析与计算资源规划。
使用方法
使用时,研究者可根据研究目标选择合适的训练切片,例如进行小规模基准测试可选train_4k,而探索数据规模效应则依次使用多个切片。通过HuggingFace datasets库,可便捷地加载指定split(如train_128k),数据已预处理为input_ids序列,可直接用于模型训练或二次微调。heldout_4k作为验证集,用于监控训练过程中的泛化性能,而query_50和query_20则适合快速测试模型在少量样本上的即时响应。整个数据集设计兼容常见的NLP训练流程,易于集成到现有实验框架中。
背景与挑战
背景概述
在大规模语言模型(LLM)训练中,数据规模与模型性能之间的标度律(scaling law)是决定计算资源分配和训练效率的核心问题。为此,研究者构建了一个结构化递增数据集,包含从4k到256k不等的训练子集,以及用于验证的heldout和query集合,旨在系统探究数据量对模型性能的影响。该数据集由Bergson团队于近期创建,其核心研究问题聚焦于在固定模型架构下,如何通过精确控制数据规模来预测并优化模型能力,从而为大规模训练提供理论指导。这一数据集的发布填补了标准化标度律研究中的数据空白,为社区提供了可复现、可比较的基准,对语言模型的高效训练和资源规划具有重要意义。
当前挑战
该数据集所面临的挑战首先源于标度律研究的固有复杂性——数据规模与模型性能之间往往存在非线性和饱和效应,需要在多个规模下进行精细测量,而计算成本随规模指数增长,使得实验设计需在数据量和算力之间权衡。其次,数据构建过程中面临质量控制难题,包括确保各子集的数据分布一致性、避免重复内容对训练信号的影响,以及如何设计有效的heldout和query集以准确评估模型泛化能力。此外,不同规模子集间的数据均衡和长度控制也增加了构建复杂度,要求精密的数据筛选与采样策略,方能支撑可靠的标度分析。
常用场景
经典使用场景
该数据集专为语言模型缩放定律(Scaling Laws)研究而设计,提供了从4k到256k的多种规模训练子集,以及对应的heldout验证集和少量query样本。经典使用场景是探究模型性能与训练数据量之间的幂律关系,通过在递增数据规模上训练小型Transformer(如SmolLM2),构建损失曲线并外推最优数据配比。研究者可利用各split精确控制训练集大小,从而分离数据规模对模型困惑度、下游任务准确率等指标的影响,是验证计算最优训练策略和数据效率的基石资源。
解决学术问题
该数据集解决了如何系统评估数据规模对语言模型性能影响的实证难题。传统研究常因数据混合复杂而难以隔离数据量变量,本数据集通过标准化增量子集(4k至256k)和heldout集,提供了可控实验环境,使研究者能精确量化数据规模与模型损失之间的关系,验证缩放定律在小规模计算预算下的有效性。此外,query_50与query_20子集支持小样本评测,有助于在有限资源下快速迭代,推动了关于数据效率、过拟合边界以及最优数据剪裁策略的理论研究。
衍生相关工作
该数据集衍生了多项研究工作。基于其分档结构,研究者开发了自适应数据采样算法,用于动态平衡训练集中不同难度的样本;亦有工作利用heldout集研究模型泛化能力与训练数据规模的关系,提出新的早停准则。此外,有的后续成果将query_50与query_20作为小样本评测基准,验证了模型在极少示例下的涌现能力。还有团队将其与模型架构搜索结合,探究数据规模与最优层数、头数之间的交互效应。这些衍生工作进一步扩展了该数据集在模型缩放研究中的辐射范围,成为新方法验证的重要参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务