imbalance-hub
收藏资源简介:
imbalance-hub是一个精心策划且版本化的不平衡时间序列数据集目录,旨在为时间序列预测任务提供不平衡回归的基准。该目录从136,673个原始序列中筛选出59,489个存在稀有模式(即不平衡)的序列,筛选率为43.5%。数据来源包括GluonTS(58,354个序列,涵盖M4、M3、电力、交通、旅游等数据集)和TSLib(1,135个序列,包括ETT、天气、汇率、国家疾病等)。每个序列以独立的Parquet文件存储,路径格式为{source}/{collection}/{shard}/{key}.parquet。每个文件包含一个float64类型的value列(原始值,保留NaN),以及一个可选的datetime64类型的timestamp列(仅当源序列包含真实时间戳时存在)。数据集提供了丰富的元数据列,用于过滤和选择,包括source(来源)、license(许可证)、imbalance_level(不平衡程度,分为mild、moderate、severe、extreme)、granularity(粒度,从分钟到年共12种)和collection(集合名称,共55种)。数值范围:序列长度从12到526,980,中位数330;%Rare从0.01%到100%,中位数8.70%;IR(不平衡比)从0到8,766,中位数10.50。该数据集适用于时间序列预测中的不平衡回归研究,尤其适合评估模型在稀有事件上的预测能力。使用示例:通过imbalance_hub库的load_catalog()加载元数据,使用pull()按id下载具体序列数据。
imbalance-hub is a curated and versioned directory of imbalanced time series datasets, designed to provide a benchmark for imbalanced regression in time series forecasting tasks. It filters 59,489 sequences with rare patterns (i.e., imbalanced) from 136,673 raw sequences, with a screening rate of 43.5%. Data sources include GluonTS (58,354 sequences covering M4, M3, electricity, traffic, tourism, etc.) and TSLib (1,135 sequences including ETT, weather, exchange rate, national illness, etc.). Each sequence is stored as an independent Parquet file with path format {source}/{collection}/{shard}/{key}.parquet. Each file contains a float64 value column (raw values, retaining NaN) and an optional datetime64 timestamp column (only present if the source sequence has real timestamps). The dataset provides rich metadata columns for filtering and selection, including source, license, imbalance_level (mild, moderate, severe, extreme), granularity (12 types from minute to year), and collection (55 types). Numerical ranges: sequence length from 12 to 526,980 (median 330), %Rare from 0.01% to 100% (median 8.70%), IR (imbalance ratio) from 0 to 8,766 (median 10.50). This dataset is suitable for imbalanced regression research in time series forecasting, especially for evaluating model predictive ability on rare events. Usage example: load metadata via the imbalance_hub librarys load_catalog(), and download specific sequence data by id using pull().
imbalance-hub 数据集概述
基本信息
- 数据集名称:imbalance-hub
- 任务类型:时间序列预测(time-series-forecasting)
- 许可协议:混合许可(mixed-per-collection,非单一许可)
- 数据规模:10K<n<100K(约59,489个序列)
核心内容
imbalance-hub 是一个经过精选、带版本控制的不平衡时间序列目录,其定位类似于"OpenML for imbalanced time series"。数据集中的每个序列均使用 imbalance_eval 工具(基于 Moniz, Branco & Torgo 2017 年提出的 relevance-function 方法论)进行评分,仅保留存在稀有机制(rare regime)的序列。
数据规模与统计
- 共扫描 136,673 个序列,其中 59,489 个被接受(约43.5%)
- 来源覆盖 55 个源集合
- GluonTS:58,354个序列(M4、M3、电力、交通、旅游等)
- TSLib:1,135个序列(ETT、天气、汇率、国家疾病等)
- 不平衡程度分布:
- extreme:1,172
- severe:13,256
- moderate:32,867
- mild:12,194
数据结构
每个被接受的序列对应一个 Parquet 文件,存储路径为 {source}/{collection}/{shard}/{key}.parquet。文件包含以下列:
| 列名 | 类型 | 说明 |
|---|---|---|
value |
float64 | 原始值,按原始顺序排列,保留缺失值 |
timestamp |
datetime64 | 仅当源序列携带真实时间戳时存在(TSLib),GluonTS 序列仅有索引 |
可筛选列
| 列名 | 取值范围 |
|---|---|
source |
gluonts (58,354), tslib (1,135) |
license |
cc-by-4.0 (28,868), unlicensed (29,486), unknown (1,135) |
imbalance_level |
moderate (32,867), severe (13,256), mild (12,194), extreme (1,172) |
granularity |
12个规范化的时间粒度值(从 min 到 Y) |
collection |
55个不同集合,从 m4_monthly (16,998) 到单序列集合 |
常用数值列范围:
| 列名 | 最小值 | 中位数 | 最大值 |
|---|---|---|---|
length |
12 | 330 | 526,980 |
%Rare |
0.01 | 8.70 | 100.00 |
IR |
0 | 10.50 | 8,766 |
使用方式
通过安装 GitHub 仓库中的客户端库进行访问:
bash pip install git+https://github.com/jpmsilva1/imbalance-hub.git
load_catalog():获取元数据 CSV(从 GitHub,而非本数据集仓库),并支持本地缓存pull():根据目录中记录的content_hash校验后,下载指定的单个 Parquet 文件- 浏览全部 59k+ 行目录信息无需下载额外的数据文件
许可说明
该目录不适用于单一许可,其数据来源具有不同的使用条款:
- 大部分 GluonTS 集合(电力、交通、旅游、NN5、天气等)来源于 Monash Time Series Forecasting Archive(Zenodo),采用 CC BY 4.0 许可
- M4 系列来源于 M4Competition/M4-methods GitHub 仓库,该仓库未发布任何许可,数据在默认版权下不授予再分发权利。数据集维护者表示,若 M4 组织者提出要求,将移除相关序列
- TSLib 系列:其代码仓库为 MIT 许可,但内置基准 CSV 的原始许可未在该仓库中声明
- 数据集的策展层(元数据、评分方法、流水线代码)为 MIT 许可,但不延伸至底层数据
引用
引用目录本身:
bibtex @software{silva2026imbalancehub, author = {Silva, João P. M.}, title = {imbalance-hub}, year = {2026}, url = {https://github.com/jpmsilva1/imbalance-hub} }
若使用不平衡评分方法,请同时引用:
bibtex @article{moniz2017resampling, title={Resampling strategies for imbalanced time series forecasting}, author={Moniz, Nuno and Branco, Paula and Torgo, Lu{\i}s}, journal={International Journal of Data Science and Analytics}, volume={3}, pages={161--181}, year={2017}, publisher={Springer} }
补充说明
- 数据集的元数据与客户端库存放于 GitHub 仓库 jpmsilva1/imbalance-hub,包含完整的 schema、评分方法论及构建方式
shard目录仅为实现细节(2位十六进制字符目录),用于控制每个目录下的文件数量,不属于目录 ID 的组成部分- 目录 ID 格式为
source:collection:key(例如gluonts:m4_hourly:h1),可通过 GitHub 仓库中的blob_path_for()方法或目录 CSV 中的blob_path列进行路径映射




