遇见数据集

MOMENT-DAPT-Scaling

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

该数据集是一个结构化数据集,包含多个配置,每个配置对应不同的数据规模和类型(混合或纯)。数据集由训练集和验证集组成,每个样本包含三个特征:dataset_origin(字符串类型,标识数据来源)、item_id(字符串类型,唯一项目标识符)和target(浮点数列表,代表目标值)。配置名称以mixed(混合)或pure(纯)开头,后缀数字(如0.05B、0.1B、0.25B、0.5B、1.0B、2.0B)表示不同的数据规模等级(可能以亿计样本)。例如,mixed_0.05B配置的训练集包含21,212个样本,验证集包含201,025个样本;pure_2.0B配置的训练集包含804,030个样本,验证集包含201,025个样本。所有配置的验证集规模保持一致(201,025个样本),而训练集规模随配置等级增加而扩大。数据集适用于需要处理来源标识、项目ID和数值列表目标值的机器学习任务,例如回归、序列预测或多目标预测场景。

This dataset is a structured dataset containing multiple configurations, each corresponding to different data scales and types (mixed or pure). The dataset consists of a training set and a validation set, with each sample containing three features: dataset_origin (string type, identifying the data source), item_id (string type, unique item identifier), and target (a list of floating-point numbers, representing target values). Configuration names start with mixed (mixed) or pure (pure), followed by a suffix number (e.g., 0.05B, 0.1B, 0.25B, 0.5B, 1.0B, 2.0B) indicating different data scale levels (likely in hundreds of millions of samples). For example, the mixed_0.05B configuration has a training set with 21,212 samples and a validation set with 201,025 samples; the pure_2.0B configuration has a training set with 804,030 samples and a validation set with 201,025 samples. The validation set size is consistent across all configurations (201,025 samples), while the training set size increases with higher configuration levels. The dataset is suitable for machine learning tasks that require handling source identifiers, item IDs, and numerical list target values, such as regression, sequence prediction, or multi-target prediction scenarios.

创建时间:
2026-06-25
搜集汇总
数据集介绍
MOMENT-DAPT-Scaling 数据集图片
构建方式
在时间序列预训练模型(如MOMENT)的发展中,针对性的适配数据对提升模型在下游任务中的表现至关重要。该数据集精心构建了两种不同性质的配置,即“mixed”与“pure”系列,它们均包含从0.05B到2.0B的多个规模等级。每个配置下,数据集由训练集和验证集两部分组成,训练集样本量随规模递增,而验证集则保持约20万个样本的固定规模。每条数据均包含“dataset_origin”标识数据来源、“item_id”作为序列的唯一标识,以及“target”字段存储浮点数时间序列数据。混合系列(mixed)可能融合了多种来源或类型的时序数据,而纯净系列(pure)则可能专注于单一品质的数据源,二者共同构建了规模丰富的时序预训练适配数据集。
特点
MOMENT-DAPT-Scaling数据集展现出显著的系统性与层次化特征。其参数规模从0.05B到2.0B呈阶梯式扩张,覆盖了从轻量级到大规模预训练模型适配的多种实验需求。混合与纯净两种配置的并置,使得研究者能够对比研究数据多样性对模型性能的影响。验证集在所有配置中保持统一且庞大的体量,确保了不同规模模型评估基准的一致性。此外,数据存储采用高效的float32列表形式,并利用分片文件组织,便于大规模数据的分布式加载与处理,充分体现了面向现代深度学习工作流的工程优化。
使用方法
该数据集通过HuggingFace Datasets库进行加载与管理。用户可根据研究需求,通过指定配置名称(如“mixed_1.0B”)精确选取对应的数据子集。加载时可直接将训练集与验证集分开处理,验证集在所有配置中共享同一数据块,便于跨规模模型评估。数据中的“target”字段可直接作为时间序列模型的输入特征,“item_id”可用于序列对齐或分组操作,而“dataset_origin”则为数据溯源与领域迁移分析提供了依据。建议使用者根据模型参数量级选取匹配的训练数据规模,并利用混合/纯净对比实验探索数据纯度对域适应性能的影响。
背景与挑战
背景概述
MOMENT-DAPT-Scaling数据集是面向时间序列基础模型领域的重要资源,由相关研究机构于近年创建,旨在探索大规模预训练时间序列模型在多样本场景下的领域自适应微调(Domain Adaptive Pre-Training, DAPT)的扩展规律。该数据集的核心研究问题聚焦于不同数据规模(从0.05B到2.0B参数)与混合(mixed)或纯净(pure)数据组成对模型迁移性能的影响,为理解时间序列基础模型的扩展性与泛化能力提供了系统性的实验素材。其对时间序列分析领域的影响力体现在,通过公开多规模、多配置的基准,推动了预训练模型在金融、气象、工业等实际应用中的可重复研究与方法迭代。
当前挑战
该数据集面临的挑战贯穿领域问题与构建过程两个层面。在领域问题层面,时间序列数据固有的异质性(如来源多样、采样频率不一、模式复杂)使得单一预训练模型难以覆盖所有下游任务,需要研究如何通过DAPT实现高效领域适配,而数据集中不同规模与纯度配置的设计正是为了探究这一扩展瓶颈。在构建过程中,挑战在于如何保持不同子集间数据分布的平衡性与代表性,同时确保混合数据(mixed)与纯净数据(pure)的设置能清晰剥离出数据组成对模型性能的独立影响,避免因样本重叠或任务泄露而干扰结论的普适性。
常用场景
经典使用场景
在时间序列预测与表示学习领域,MOMENT-DAPT-Scaling数据集为研究者提供了大规模、多样化的预训练基准。该数据集包含从0.05B到2.0B参数量的多种配置,分为混合与纯净两大类别,覆盖丰富的时序源与模式。其经典使用场景在于评估和微调时间序列预训练模型(如MOMENT系列)的下游适应性,尤其是在域外泛化与分布迁移场景中,通过控制数据规模与纯度,系统性地探究模型性能的缩放规律。
解决学术问题
该数据集精准回应了时间序列基础模型在规模化训练时面临的三大瓶颈:数据多样性不足、规模效应验证困难以及域适应机制不明确。通过系统性的划分与对比,MOMENT-DAPT-Scaling帮助学界厘清数据纯度与混合策略对预训练效果的影响,揭示了在不同参数规模下模型鲁棒性的演变路径。其意义在于为时间序列预训练领域提供了可复现的规模化实验框架,从而推动了从传统单域学习向通用时序基础模型演进的关键一步。
衍生相关工作
基于MOMENT-DAPT-Scaling,衍生了一系列关于时间序列预训练缩放法则与域自适应机制的经典研究。例如,研究者通过在该数据集上进行梯度分析,提出了针对不同数据纯度的模型剪枝策略与参数高效微调方法。进一步地,它催生了如TS-LARS和SeqScaLe等启发性工作,专门探讨时序基础模型中数据规模、模型容量与任务性能之间的幂律关系,为后续构建更通用、更高效的时序基础模型奠定了坚实的实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务