遇见数据集

imbalance-hub

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

imbalance-hub是一个精心策划且版本化的不平衡时间序列数据集目录,旨在为时间序列预测任务提供不平衡回归的基准。该目录从136,673个原始序列中筛选出59,489个存在稀有模式(即不平衡)的序列,筛选率为43.5%。数据来源包括GluonTS(58,354个序列,涵盖M4、M3、电力、交通、旅游等数据集)和TSLib(1,135个序列,包括ETT、天气、汇率、国家疾病等)。每个序列以独立的Parquet文件存储,路径格式为{source}/{collection}/{shard}/{key}.parquet。每个文件包含一个float64类型的value列(原始值,保留NaN),以及一个可选的datetime64类型的timestamp列(仅当源序列包含真实时间戳时存在)。数据集提供了丰富的元数据列,用于过滤和选择,包括source(来源)、license(许可证)、imbalance_level(不平衡程度,分为mild、moderate、severe、extreme)、granularity(粒度,从分钟到年共12种)和collection(集合名称,共55种)。数值范围:序列长度从12到526,980,中位数330;%Rare从0.01%到100%,中位数8.70%;IR(不平衡比)从0到8,766,中位数10.50。该数据集适用于时间序列预测中的不平衡回归研究,尤其适合评估模型在稀有事件上的预测能力。使用示例:通过imbalance_hub库的load_catalog()加载元数据,使用pull()按id下载具体序列数据。

imbalance-hub is a curated and versioned directory of imbalanced time series datasets, designed to provide a benchmark for imbalanced regression in time series forecasting tasks. It filters 59,489 sequences with rare patterns (i.e., imbalanced) from 136,673 raw sequences, with a screening rate of 43.5%. Data sources include GluonTS (58,354 sequences covering M4, M3, electricity, traffic, tourism, etc.) and TSLib (1,135 sequences including ETT, weather, exchange rate, national illness, etc.). Each sequence is stored as an independent Parquet file with path format {source}/{collection}/{shard}/{key}.parquet. Each file contains a float64 value column (raw values, retaining NaN) and an optional datetime64 timestamp column (only present if the source sequence has real timestamps). The dataset provides rich metadata columns for filtering and selection, including source, license, imbalance_level (mild, moderate, severe, extreme), granularity (12 types from minute to year), and collection (55 types). Numerical ranges: sequence length from 12 to 526,980 (median 330), %Rare from 0.01% to 100% (median 8.70%), IR (imbalance ratio) from 0 to 8,766 (median 10.50). This dataset is suitable for imbalanced regression research in time series forecasting, especially for evaluating model predictive ability on rare events. Usage example: load metadata via the imbalance_hub librarys load_catalog(), and download specific sequence data by id using pull().

创建时间:
2026-08-20
原始信息汇总

imbalance-hub 数据集概述

基本信息

  • 数据集名称:imbalance-hub
  • 任务类型:时间序列预测(time-series-forecasting)
  • 许可协议:混合许可(mixed-per-collection,非单一许可)
  • 数据规模:10K<n<100K(约59,489个序列)

核心内容

imbalance-hub 是一个经过精选、带版本控制的不平衡时间序列目录,其定位类似于"OpenML for imbalanced time series"。数据集中的每个序列均使用 imbalance_eval 工具(基于 Moniz, Branco & Torgo 2017 年提出的 relevance-function 方法论)进行评分,仅保留存在稀有机制(rare regime)的序列。

数据规模与统计

  • 共扫描 136,673 个序列,其中 59,489 个被接受(约43.5%)
  • 来源覆盖 55 个源集合
    • GluonTS:58,354个序列(M4、M3、电力、交通、旅游等)
    • TSLib:1,135个序列(ETT、天气、汇率、国家疾病等)
  • 不平衡程度分布
    • extreme:1,172
    • severe:13,256
    • moderate:32,867
    • mild:12,194

数据结构

每个被接受的序列对应一个 Parquet 文件,存储路径为 {source}/{collection}/{shard}/{key}.parquet。文件包含以下列:

列名 类型 说明
value float64 原始值,按原始顺序排列,保留缺失值
timestamp datetime64 仅当源序列携带真实时间戳时存在(TSLib),GluonTS 序列仅有索引

可筛选列

列名 取值范围
source gluonts (58,354), tslib (1,135)
license cc-by-4.0 (28,868), unlicensed (29,486), unknown (1,135)
imbalance_level moderate (32,867), severe (13,256), mild (12,194), extreme (1,172)
granularity 12个规范化的时间粒度值(从 minY
collection 55个不同集合,从 m4_monthly (16,998) 到单序列集合

常用数值列范围

列名 最小值 中位数 最大值
length 12 330 526,980
%Rare 0.01 8.70 100.00
IR 0 10.50 8,766

使用方式

通过安装 GitHub 仓库中的客户端库进行访问:

bash pip install git+https://github.com/jpmsilva1/imbalance-hub.git

  • load_catalog():获取元数据 CSV(从 GitHub,而非本数据集仓库),并支持本地缓存
  • pull():根据目录中记录的 content_hash 校验后,下载指定的单个 Parquet 文件
  • 浏览全部 59k+ 行目录信息无需下载额外的数据文件

许可说明

该目录不适用于单一许可,其数据来源具有不同的使用条款:

  • 大部分 GluonTS 集合(电力、交通、旅游、NN5、天气等)来源于 Monash Time Series Forecasting Archive(Zenodo),采用 CC BY 4.0 许可
  • M4 系列来源于 M4Competition/M4-methods GitHub 仓库,该仓库未发布任何许可,数据在默认版权下不授予再分发权利。数据集维护者表示,若 M4 组织者提出要求,将移除相关序列
  • TSLib 系列:其代码仓库为 MIT 许可,但内置基准 CSV 的原始许可未在该仓库中声明
  • 数据集的策展层(元数据、评分方法、流水线代码)为 MIT 许可,但不延伸至底层数据

引用

引用目录本身:

bibtex @software{silva2026imbalancehub, author = {Silva, João P. M.}, title = {imbalance-hub}, year = {2026}, url = {https://github.com/jpmsilva1/imbalance-hub} }

若使用不平衡评分方法,请同时引用:

bibtex @article{moniz2017resampling, title={Resampling strategies for imbalanced time series forecasting}, author={Moniz, Nuno and Branco, Paula and Torgo, Lu{\i}s}, journal={International Journal of Data Science and Analytics}, volume={3}, pages={161--181}, year={2017}, publisher={Springer} }

补充说明

  • 数据集的元数据与客户端库存放于 GitHub 仓库 jpmsilva1/imbalance-hub,包含完整的 schema、评分方法论及构建方式
  • shard 目录仅为实现细节(2位十六进制字符目录),用于控制每个目录下的文件数量,不属于目录 ID 的组成部分
  • 目录 ID 格式为 source:collection:key(例如 gluonts:m4_hourly:h1),可通过 GitHub 仓库中的 blob_path_for() 方法或目录 CSV 中的 blob_path 列进行路径映射
搜集汇总
数据集介绍
imbalance-hub 数据集图片
构建方式
imbalance-hub数据集通过一套严谨的筛选流程构建而成。研究者从GluonTS与TSLib两个广泛使用的时间序列库中扫描了136,673个序列,并利用基于相关函数的方法(源自Moniz等人2017年的研究)进行不平衡度评分。只有那些展现出稀有状态(即存在值得研究的罕见动态)的序列才被纳入最终目录,这一筛选标准确保了数据集的针对性与研究价值。最终,59,489个序列(约占43.5%)被保留,每个序列以独立的Parquet文件存储,并配有详尽的元数据目录(包含长度、粒度、不平衡等级等关键信息),为后续的时间序列不平衡回归与预测研究提供了坚实的实验基础。
特点
该数据集的核心特征在于其多维度、系统化的不平衡标注体系。它提供了四个不平衡等级(从'极端'到'轻微'),每个序列都附有'稀有百分比'和'不平衡比率(IR)'等量化指标,使得研究者能够精准地选取不同不平衡程度的数据进行实验。此外,数据集的多样性突出,涵盖55个来源集合,时间粒度从分钟到年度不等,序列长度跨越12至超过50万个时间点,为跨领域、跨规模的研究提供了丰富的比较基准。其模块化的数据结构(以Parquet格式存储)和版本化设计,确保了数据可复现性和轻量级访问,仅需按需下载特定序列即可,大大提升了研究的便捷性与效率。
使用方法
使用imbalance-hub数据集简便高效。研究者可通过Python客户端库中的load_catalog()函数加载完整元数据目录,该目录作为可过滤的DataFrame,支持按来源、集合、不平衡等级、时间粒度、序列长度等多个条件进行组合查询。随后,pull()函数能够根据所选序列的唯一标识符(如'source:collection:key')从Hugging Face仓库中精确下载对应的单个Parquet文件,该文件包含原始时间序列值(保留缺失值位置)及时间戳(若源数据包含)。此设计支持细粒度的数据获取,便于集成到自定义的时间序列预测或重采样实验流程中。此外,数据集遵循混合许可模式,使用前需核对具体序列的许可证,以符合合规要求。
背景与挑战
背景概述
imbalance-hub是由João P. M. Silva于2026年创建的一个精心策划的时间序列数据集目录,旨在解决时间序列预测中不平衡回归问题。该数据集基于Moniz、Branco和Torgo于2017年提出的相关性函数方法,对来自GluonTS和TSLib的136,673个时间序列进行筛选,最终保留了59,489个具有罕见状态的时间序列,按不平衡程度分级。作为“OpenML for imbalanced time series”,它提供了标准化的元数据、版本控制和便捷的数据访问接口,填补了该领域缺乏专门数据集的空白,对推动不平衡时间序列预测研究具有重要意义。
当前挑战
imbalance-hub面临的挑战主要来自两个方面。领域层面,时间序列预测中的不平衡回归问题常被忽视,罕见状态(如极端事件)对预测模型影响重大,但缺乏标准化的数据集来评估模型性能。构建层面,从多个源(GluonTS和TSLib)整合数据时需处理格式不一致、许可复杂(如M4系列无明确许可)和计算开销等问题;同时需确保筛选过程的准确性和可重复性,并对每个序列进行不平衡评分,以实现自动化的质量控制和版本管理,这些都为数据集的持续维护和更新带来了挑战。
常用场景
经典使用场景
imbalance-hub作为精心策划的失衡时间序列目录,为时间序列预测与不平衡回归研究提供了标准化基准。研究者可借助其元数据筛选功能,依据失衡等级(如extreme、severe)、时间粒度及序列长度精准挑选实验数据,构建针对稀有事件预测任务的评估套件。其即插即用的API设计,使得加载特定序列及元数据过滤操作变得极为便捷,成为验证新模型在处理尾部分布或罕见模式时性能的首选工具。
衍生相关工作
基于imbalance-hub的研究工作已催生了多个衍生产物。一方面,其失衡评分方法论(源于Moniz等人研究)被集成至开源库imbalance_eval,促进了对重采样策略的标准化评估。另一方面,该目录的出现推动了针对罕见事件预测的专门模型设计,如成本敏感损失函数、异常值感知的注意力机制和生成式数据增强技术。此外,它亦成为领域自适应和迁移学习研究的公共资源,用于探究不同失衡模式间的知识共享。
数据集最近研究
最新研究方向
imbalance-hub数据集聚焦于时间序列预测中的不平衡回归问题,通过系统化采集并评估59,489条具有稀有机制的时间序列,构建了涵盖GluonTS与TSLib两大来源的标准化目录。该数据集采用Moniz等人提出的相关函数方法对序列的不平衡程度进行量化分级,为研究极端事件预测、异常检测及稀有模式识别提供了高质量基准。其前沿价值在于,它促进了不平衡学习策略在时间序列领域的系统评估,推动了针对罕见但关键事件(如极端天气、突发故障)的预测模型开发,对金融风控、能源调度及医疗预警等应用具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务