遇见数据集
数据链接:
官方服务:

资源简介:

RMISC是一个大规模、真实世界的多元时间序列语料库,专为预训练和基准测试多元时间序列基础模型而构建。它包含约200个数据集、200万个时间序列文件、160亿个时间步和1420亿个时间点,涵盖多个真实世界领域。实验结果表明,将RMISC纳入训练数据可以提高最先进时间序列基础模型的泛化性能,有助于更深入地理解真实世界多元数据如何促进更强时间序列基础模型的发展。

RMISC is a large-scale, real-world multivariate time series corpus built specifically for pre-training and benchmarking multivariate time series foundation models. It encompasses approximately 200 datasets, 2 million time series files, 1.6 billion time steps, and 142 billion time points, spanning multiple real-world domains. Experimental results demonstrate that incorporating RMISC into training data can enhance the generalization performance of state-of-the-art time series foundation models, and facilitate a deeper understanding of how real-world multivariate data contributes to the development of more powerful time series foundation models.

创建时间:
2026-07-07
原始信息汇总

数据集概述

RMISC 是一个大规模、真实世界的多元时间序列语料库,专为预训练和基准测试多元时间序列基础模型(TSFMs)而设计。

核心规模

  • 数据集数量:约 200 个
  • 时间序列文件:约 200 万个
  • 时间步长:约 160 亿
  • 时间点总数:约 1420 亿
  • 数据领域:覆盖能源、环境、金融、工业、交通等多个真实世界领域

目的与意义

该语料库旨在解决当前时间序列基础模型主要使用合成多元数据进行预训练的问题。真实世界多元数据能更好地捕捉复杂的时间动态和跨变量关系。实验表明,将 RMISC 纳入训练数据可以提升最先进 TSFMs 的泛化性能。

数据构成

RMISC 包含约 200 个来自不同领域的公开数据集,领域分布如下:

领域 包含的数据集示例
能源 (Energy) ACSF1, ApplianceEnergy, AzurePublicDatasetV1, ETT, Electricity, SolarEnergy, WindFarms 等
环境 (Environment) BeijingAirQuality, Weather, Subseasonal, CMIP6-2000-PartI, ERA5HourlySingleLevels 等
金融 (Finance) ExchangeRate, M5, SP500, Bitcoin, ChinaMinuteStock, TushareStockDaily 等
工业 (Industry) Behavior-1k, BTS, GasPipeline, ServerMachineDataset, SWAT 等
交通 (Traffic) BeijingSubway, MetroTraffic, PEMS-Bay-METRO-LA, Traffic, QtrafficSpeed 等
其他 (Others) BCI_Competetion_IV_1, Covid, BoschCNC, CinCECGTorso, Car 等

关键发现

通过在多个主流 TSFMs 上进行预训练实验,得出以下结论:

  1. 多元数据优势:使用多元数据(真实或合成)预训练的模型,其性能始终优于仅使用真实世界单变量数据(RU)的模型。
  2. 真实世界数据优势:在所有比较中,使用 RMISC 真实世界多元数据(RM)预训练的模型,其性能一致优于使用合成多元数据(SM)的模型。
  3. 最佳组合:联合使用真实世界单变量、合成多元和真实世界多元数据(RU+SM+RM)进行预训练,在所有配置中取得了最佳的平均性能排名。
搜集汇总
数据集介绍
构建方式
RMISC是一个大规模、真实世界的多变量时间序列语料库,旨在为多变量时间序列基础模型(TSFMs)的预训练与基准测试提供支持。该数据集从能源、环境、金融、工业、交通等多个真实领域广泛收集数据,整合了约200个高质量公开数据集,涵盖海量时间序列文件与时间点。构建过程中,研究人员特别注重跨变量信息的保留,以确保语料库能够真实反映现实世界中复杂的时间动态与变量间关联,从而弥补合成数据在捕捉真实时序特征方面的不足。
使用方法
RMISC可直接用于多变量时间序列基础模型的预训练与评估。研究人员可将原始数据通过提供的文件链接进行下载,并根据数据集目录整合至模型训练流程中。建议采用RMISC作为预训练语料的一部分,与真实单变量或合成多变量数据组合使用,以构建更强大的TSFMs。相关实验设置与评价基准(如GIFT-Eval和fev-bench)已公开,便于研究者复现结果或开展横向对比分析。
背景与挑战
背景概述
RMISC是由研究团队构建的大规模真实世界多元时间序列语料库,创建于近年,旨在推动多元时间序列基础模型(TSFMs)的预训练与基准测试。核心研究问题聚焦于真实世界多元数据相较于合成数据在提升TSFMs泛化性能方面的优势。该语料库汇聚约200个数据集、200万时间序列文件、160亿时间步及1420亿时间点,覆盖能源、环境、金融、交通等多元领域。实验表明,将RMISC纳入训练数据可显著提升前沿TSFMs的泛化能力,为理解真实世界多元数据如何助力更强TSFMs的构建提供了深刻洞见,对时间序列建模领域具有重要影响力。
当前挑战
RMISC所解决的领域挑战在于,现有TSFMs多依赖易于扩展的合成多元数据预训练,却难以捕捉真实时间序列中复杂的时序动态与跨变量关联。构建过程中,挑战包括:1) 收集与整合来自能源、环境、金融等多元领域的约200个高质量真实数据集,确保数据规模与多样性;2) 处理异质数据源,统一时间戳、变量维度及缺失值,形成一致的语料格式;3) 精心组织数据划分,避免信息泄露,例如设置留出分布内与分布外基准,以严谨评估模型泛化性能。这些挑战的克服使RMISC成为构建更强TSFMs的优选预训练语料库。
常用场景
经典使用场景
RMISC作为大规模真实世界多元时间序列语料库,最经典的使用场景是用于预训练与评估多元时间序列基础模型。研究人员利用该语料库中涵盖能源、环境、金融、交通、工业等多个领域的约200个数据集、2百万个时间序列文件及1420亿个时间点,对主流TSFMs(如Chronos-2、GTT、Moirai-2.0、TimesFM-2.5)进行预训练。实验表明,相较于仅使用单变量或合成多元数据,融入RMISC真实多元数据能显著提升模型的泛化性能,从而为构建更强大的多元时间序列基础模型提供关键的训练语料支撑。
解决学术问题
该数据集核心解决了时间序列基础模型研究中真实多元数据缺失的学术难题。此前,主流TSFMs多依赖合成多元数据预训练,难以捕捉真实世界中复杂的时序动态与跨变量关联。RMISC通过提供大规模、高质量、开放获取的真实多元语料,使得学术界能够系统比较不同预训练语料(真实单变量、合成多元、真实多元)对模型性能的影响。研究证实,真实多元语料在提升模型预测准确性方面显著优于合成数据,为理解真实数据如何贡献于更强TSFMs的构建提供了实证依据,推动了时间序列基础模型的理论发展。
实际应用
在实际应用中,RMISC可直接服务于各类真实场景的时序预测任务,如能源领域的电力负荷预测与太阳能发电量估计,金融领域的股票价格走势分析与交易量预测,环境领域的气候变化监测与空气质量预报,以及交通领域的流量管理与拥堵预测。得益于其跨领域、多变量的丰富数据构成,RMISC为工业界部署通用型时间序列预测系统提供了高质量的训练资源,有助于提升能源调度效率、优化金融风险管理、增强环境预警能力和改善城市交通规划。
数据集最近研究
最新研究方向
RMISC语料库的构建旨在推动多变量时间序列基础模型(TSFMs)的前沿发展,其核心研究方向聚焦于真实世界多变量数据相较于合成数据的优越性。该语料库汇集了约200个涵盖能源、环境、金融、交通等多领域的真实数据集,包含2百万时间序列文件、160亿时间步长及1420亿时间点,为TSFMs的预训练与基准测试提供了前所未有的规模与多样性。实验表明,将RMISC纳入训练数据显著提升了先进TSFMs的泛化性能,尤其在跨变量关系捕捉上,真实多变量数据(RM)优于合成多变量数据(SM),而结合单变量(RU)、合成多变量(SM)与真实多变量(RM)的完整组合在MASE排名中达到最优。这一发现不仅验证了真实世界多变量数据在增强模型鲁棒性与实用性方面的关键作用,也为构建更强TSFMs提供了明确的数据策略——优先采用包含RMISC的复合预训练语料库。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务