遇见数据集

EleutherAI/bergson-smollm2-lds-chunks

收藏
Hugging Face2026-07-17 更新2026-07-21 收录
官方服务:

资源简介:

该数据集包含多个配置(4k、8k、16k、32k、query),每个配置提供训练分割,特征为input_ids(整数列表)和length(整数),表示经过分词后的文本令牌ID序列及其长度。数据量从50到32000个样本不等,适用于语言模型的预训练或微调。

The dataset contains multiple configurations (4k, 8k, 16k, 32k, query), each with a train split. Features include input_ids (list of int32) and length (int64), representing tokenized text sequences and their lengths. The number of examples ranges from 50 to 32000, suitable for language model pre-training or fine-tuning.

提供机构:
EleutherAI
搜集汇总
数据集介绍
EleutherAI/bergson-smollm2-lds-chunks 数据集图片
构建方式
在大规模语言模型训练中,高质量且结构化的长序列数据对模型性能的提升至关重要。该数据集基于HuggingFace平台上的SmolLM2模型与Bergson算法中的局部密度缩放(LDS)策略构建而成,通过将源语料分割成不同长度的连续文本块(chunks),形成了包含4k、8k、16k和32k四种序列长度的训练子集,以及一个由50个样本构成的查询子集。每个样本以整数列表形式的token ID(input_ids)及其对应长度(length)为结构特征,便于直接用于语言模型的预训练或微调任务。
特点
该数据集的核心特点在于其多尺度的序列长度设计,分别涵盖了4千至3.2万个token的文本片段,为研究者提供了灵活选择上下文窗口的能力。其中,32k子集包含3.2万个样本,总量约65.9MB,而4k子集则含4000个样本,规模小巧。各子集均采用统一的数据格式与分片存储方式,减少了数据加载时的内存压力。此外,专门设置的query子集虽仅有50个样本,却为少样本学习或推理测试场景提供了精炼的测试基准。
使用方法
使用该数据集时,可通过HuggingFace的`datasets`库按配置名称(如'4k'、'32k')加载对应子集,所有配置均只包含训练集划分。建议根据模型的最大输入长度选择合适的配置,例如处理长文档任务时可优先选择32k子集。加载后的数据可直接用于标准的自回归语言模型训练流程,其input_ids字段符合Transformers库的输入格式要求,无需额外预处理。查询子集可结合检索增强生成(RAG)场景进行验证,以评估模型对特定内容的感知能力。
背景与挑战
背景概述
在自然语言处理领域,高质量训练语料的构建始终是推动模型性能提升的关键驱动力。bergson-smollm2-lds-chunks数据集由研究团队为适配轻量级语言模型(如SmolLM2)而精心创建,其核心研究问题在于探索不同规模数据分片对模型长期依赖关系捕获能力的影响。该数据集通过提供多个配置(4k、8k、16k、32k及query分片),为评估和优化小参数模型在长文本理解任务上的表现提供了标准化基准,对推动高效能、资源友好型语言模型的发展具有重要实践价值。
当前挑战
数据集面临的挑战首先源于领域问题:小参数模型在有限容量下需准确建模长距离语义依赖,而传统的固定长度分片方式易导致上下文断裂,引发信息丢失与理解偏差。其次,构建过程中,如何平衡分片粒度(如4k至32k)与训练效率成为关键难点——过大的分片虽保留完整语境,却增加计算开销并可能超出小模型的处理区间;过小的分片则难以支撑复杂推理。此外,确保各分片内噪声低、语义连贯性高,以及query分片作为真实查询示例的代表性,也对数据清洗与标注质量提出了严苛要求。
常用场景
经典使用场景
在语言模型预训练与微调的研究中,该数据集以其多尺度的序列长度配置(4k、8k、16k、32k)著称,成为探索长上下文建模与模型容量扩展的经典基准。研究者常通过控制不同长度的样本训练小型语言模型(如SmolLM2架构),以系统评估模型在递增序列长度下的困惑度变化与记忆能力。其独特的query子集更被设计为快速验证工具,用于测试训练后模型对特定输入模式的响应一致性。
实际应用
在工业级语言模型部署中,该数据集常用于测试推理引擎对非对称输入长度的适配能力。开发者利用其query子集模拟真实场景中的短查询与长文档匹配任务,用于优化检索增强生成(RAG)系统的上下文截断策略。其分层结构也服务于边缘设备模型压缩,通过观察参数量与上下文窗口间的性能权衡曲线,指导移动端聊天机器人等应用选择最优模型副本。
衍生相关工作
围绕该数据集衍生出多项基础性工作:例如基于其多长度配置提出的动态批处理调度算法,显著提升了分布式训练中的吞吐量;另有学者利用其query子集与主样本集合的差异,开发出基于困惑度差异的幻觉检测指标。这些成果进一步催生了针对小型语言模型的课程学习框架,通过渐进式增加训练序列长度来改善模型的指令遵循能力,成为低资源场景下模型优化的范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务