RMISC
收藏资源简介:
RMISC是一个大规模、真实世界的多元时间序列语料库,专为预训练和基准测试多元时间序列基础模型而构建。它包含约200个数据集、200万个时间序列文件、160亿个时间步和1420亿个时间点,涵盖多个真实世界领域。实验结果表明,将RMISC纳入训练数据可以提高最先进时间序列基础模型的泛化性能,有助于更深入地理解真实世界多元数据如何促进更强时间序列基础模型的发展。
RMISC is a large-scale, real-world multivariate time series corpus built specifically for pre-training and benchmarking multivariate time series foundation models. It encompasses approximately 200 datasets, 2 million time series files, 1.6 billion time steps, and 142 billion time points, spanning multiple real-world domains. Experimental results demonstrate that incorporating RMISC into training data can enhance the generalization performance of state-of-the-art time series foundation models, and facilitate a deeper understanding of how real-world multivariate data contributes to the development of more powerful time series foundation models.
数据集概述
RMISC 是一个大规模、真实世界的多元时间序列语料库,专为预训练和基准测试多元时间序列基础模型(TSFMs)而设计。
核心规模
- 数据集数量:约 200 个
- 时间序列文件:约 200 万个
- 时间步长:约 160 亿
- 时间点总数:约 1420 亿
- 数据领域:覆盖能源、环境、金融、工业、交通等多个真实世界领域
目的与意义
该语料库旨在解决当前时间序列基础模型主要使用合成多元数据进行预训练的问题。真实世界多元数据能更好地捕捉复杂的时间动态和跨变量关系。实验表明,将 RMISC 纳入训练数据可以提升最先进 TSFMs 的泛化性能。
数据构成
RMISC 包含约 200 个来自不同领域的公开数据集,领域分布如下:
| 领域 | 包含的数据集示例 |
|---|---|
| 能源 (Energy) | ACSF1, ApplianceEnergy, AzurePublicDatasetV1, ETT, Electricity, SolarEnergy, WindFarms 等 |
| 环境 (Environment) | BeijingAirQuality, Weather, Subseasonal, CMIP6-2000-PartI, ERA5HourlySingleLevels 等 |
| 金融 (Finance) | ExchangeRate, M5, SP500, Bitcoin, ChinaMinuteStock, TushareStockDaily 等 |
| 工业 (Industry) | Behavior-1k, BTS, GasPipeline, ServerMachineDataset, SWAT 等 |
| 交通 (Traffic) | BeijingSubway, MetroTraffic, PEMS-Bay-METRO-LA, Traffic, QtrafficSpeed 等 |
| 其他 (Others) | BCI_Competetion_IV_1, Covid, BoschCNC, CinCECGTorso, Car 等 |
关键发现
通过在多个主流 TSFMs 上进行预训练实验,得出以下结论:
- 多元数据优势:使用多元数据(真实或合成)预训练的模型,其性能始终优于仅使用真实世界单变量数据(RU)的模型。
- 真实世界数据优势:在所有比较中,使用 RMISC 真实世界多元数据(RM)预训练的模型,其性能一致优于使用合成多元数据(SM)的模型。
- 最佳组合:联合使用真实世界单变量、合成多元和真实世界多元数据(RU+SM+RM)进行预训练,在所有配置中取得了最佳的平均性能排名。




