遇见数据集

RESCAST-100K

收藏
arXiv2026-06-02 更新2026-06-05 收录
数据链接:
官方服务:

资源简介:

RESCAST-100K是由肯塔基大学研究团队创建的大规模住宅能源预测基准数据集,旨在解决跨领域泛化研究的空白。该数据集包含约10万个美国家庭的15分钟分辨率时间序列,涵盖总负荷、HVAC负荷和室内温度三大耦合目标变量,并整合了天气数据、HVAC设定点及40多项静态建筑协变量,数据总量达百万级时间点。数据集通过ResStock统计模型与EnergyPlus物理模拟相结合构建,采用高性能计算集群生成全年仿真数据,并统一整合了五个真实住宅数据集以支持仿真到现实的评估。该数据集主要应用于住宅能源管理、电网需求响应和社区能效项目,通过配置驱动接口支持地理、气候区、建筑围护结构和供暖设备等多维度领域划分,为机器学习模型在数据稀缺场景下的跨领域适应和零样本泛化研究提供系统化评估平台。

RESCAST-100K is a large-scale residential energy forecasting benchmark dataset developed by the research team at the University of Kentucky, aiming to fill the gap in cross-domain generalization research. This dataset contains 15-minute resolution time series from approximately 100,000 U.S. households, covering three coupled target variables: total load, HVAC load, and indoor temperature. It also integrates weather data, HVAC setpoints, and over 40 static building covariates, with a total of millions of time points across the dataset. The dataset is constructed by combining the ResStock statistical model and EnergyPlus physics-based simulations, with full-year simulated data generated via high-performance computing clusters, and unifies five real residential datasets to support simulation-to-reality evaluation. This dataset is primarily applied in residential energy management, grid demand response, and community energy efficiency projects. It supports multi-dimensional domain partitioning across dimensions such as geography, climate zones, building envelopes, and heating equipment via configuration-driven interfaces, providing a systematic evaluation platform for cross-domain adaptation and zero-shot generalization research of machine learning models in data-scarce scenarios.

创建时间:
2026-06-02
原始信息汇总

数据集概述:RESCAST-100K

名称
RESCAST-100K: A Comprehensive Dataset for Cross-Domain Residential Load and Indoor Temperature Forecasting

发布机构与论文

  • arXiv 预印本 ID: arXiv:2606.02852v1
  • 作者:Jainam Dhruva, Yousaf Raza, A.B. Siddique, Simone Silvestri
  • 提交日期:2026年6月1日
  • 所属领域:计算机科学 > 机器学习 (cs.LG)

背景与目的

  • 精准的短期住宅能耗负荷与室内温度预测对家庭能源管理系统、电网需求响应及社区能效提升至关重要。
  • 现有住宅数据集覆盖范围窄,且难以支持结构化的跨域评估。
  • RESCAST-100K 旨在为跨域泛化研究提供大规模住宅预测基准,推动迁移学习、域适应和零样本泛化的系统评估。

数据集规模与来源

  • 覆盖约 100,000 个美国住宅,基于 EnergyPlus 模拟数据,源自 ResStock 项目。
  • 时间序列分辨率为 15 分钟,对于每个住宅包含三个耦合目标变量:总负荷、HVAC 负荷和室内温度。
  • 配套数据包括天气通道、HVAC 设定点以及超过 40 个静态建筑协变量

核心特性

  • 提供配置驱动接口,可沿可解释轴(如地理区域、气候区、墙体构造、供暖设备)实例化源域与目标域。
  • 支持在受控域偏移条件下,系统评估迁移学习、域适应和零样本泛化。
  • 集成 5 个真实世界住宅数据集,采用统一 schema,支持 sim-to-real(模拟到真实)评估。

评估与基线

  • 基准测试涵盖循环神经网络、注意力机制模型和 MLP-Mixer 架构,评估内容:跨域零样本性能、缺失输入条件及多预测任务。
  • 实验表明:跨注意力模型和 MLP-Mixer 模型在域偏移下持续优于循环网络和经典 Transformer 基线。
搜集汇总
数据集介绍
RESCAST-100K 数据集图片
构建方式
面向住宅负荷与室内温度跨域预测需求,RESCAST-100K基于美国能源部ResStock统计住宅模型与约9000个典型气象年(TMY3)天气文件,通过条件采样生成约10万户美国住宅的模拟输入,并在EnergyPlus中逐户模拟一年运行数据,以15分钟分辨率输出总负荷、HVAC负荷及室内温度三项目标时间序列,同时耦合室外干湿球温度、相对湿度、风速、太阳辐射、冷暖设定点等外生变量,以及超过40项涵盖地理、气候区、围护结构、HVAC设备等静态建筑协变量。数据集以Parquet格式分片存储,并通过配置驱动的YAML接口实现源域与目标域的实例化,支撑地理、气候区、墙体构造、供暖设备等多维可解释轴线的域划分。为支持仿真到真实场景的评估,还统一整合了来自ECOBEE、HEAPO、IDEAL、NEST、REFIT的五个真实住宅数据集,并经过重采样、异常值剔除及缺失值填补等预处理对齐至统一模式。
特点
RESCAST-100K的突出特征在于其规模与结构完备性:覆盖约10万户全美住宅,提供三项耦合目标与丰富外生变量及静态协变量,实现了以往数据集在住宅领域难以同时满足的多元时序与静态信息的统一。其核心优势在于配置驱动的域抽象机制——用户可通过YAML文件指定地理区域、气候分区、围护构造或供暖技术等轴线,灵活定义源域与目标域,从而系统性地评估迁移学习、域适应及零样本泛化方法在受控域偏移下的表现。此外,数据集整合了仿真与真实数据,支持仿真到真实的迁移评估,为解决真实住宅数据稀缺问题提供了可控实验平台。对比已有数据集,RESCAST-100K是唯一一个同时覆盖住宅领域、开放访问、包含三项目标、外生变量、控制信号及静态协变量,并支持地理、气候、围护、HVAC多维域划分与仿真-真实融合的综合性基准。
使用方法
RESCAST-100K的使用依赖其提供的配置驱动数据加载器:用户通过编写YAML文件,指定目标域所涉及的静态属性值(如州名、气候区、墙体类型、供暖设备等),数据加载器即根据定义从庞大的Parquet分片中抽取对应住宅的15分钟分辨率时间序列,并返回PyTorch兼容的数据迭代器。该加载器同时处理仿真与真实数据集,确保模型训练与评估在相同接口下进行。数据集预定义了面向状态、气候区、墙体构造及供暖技术的四类域划分,用户可直接用于零样本跨域评估。推荐采用T个时间步的上下文窗口(论文默认384步,即4天)输入,预测96步(1天)的未来目标,支持点预测与概率预测,并通过掩码操作模拟实际场景中天气通道、设定点或静态属性的缺失情况,以评估模型的鲁棒性。
背景与挑战
背景概述
RESCAST-100K数据集由肯塔基大学计算机科学系的Jainam Dhruva、Yousaf Raza、A.B Siddique和Simone Silvestri于2026年创建,旨在填补跨域住宅能耗与室内温度预测领域大规模基准数据的空白。随着深度学习在建筑能耗预测中的广泛应用,模型往往依赖目标域的大量历史数据,而住宅场景下数据稀缺、碎片化且涉及隐私,导致模型泛化能力受限。现有数据集多聚焦于非住宅建筑,缺乏关键外生变量(如气象、控制信号),且未涵盖HVAC负荷与室内温度等多维目标。RESCAST-100K通过整合约10万套基于EnergyPlus模拟的美国住宅数据与5个真实数据集,提供了15分钟分辨率的时间序列,覆盖总负荷、HVAC负荷、室内温度及40余项静态建筑协变量,为跨域迁移学习与零样本泛化研究提供了统一平台,对建筑能源管理、电网需求响应及社区能效优化具有重要推动作用。
当前挑战
该数据集面临的核心挑战包括:1)住宅负荷与温度预测的高度异质性——不同地理区域、气候带、墙体构造及供暖设备导致数据分布显著偏移,传统模型在跨域场景下性能骤降,尤其在HVAC负荷与室内温度预测中,分布漂移使模型泛化极为困难;2)数据稀缺与不完整性——真实住宅数据常因传感器缺失、隐私限制或老旧基础设施而存在通道级缺失,例如气象数据、恒温器设定值或建筑元数据不全,需在训练中引入结构化掩码机制以模拟缺失场景;3)模拟到真实的迁移鸿沟——基于EnergyPlus的物理仿真虽能覆盖广泛建筑类型,但无法完全复现真实住户的随机行为与电器异质性,导致合成数据训练的模型在真实数据集上的点预测精度大幅下降,而概率预测虽更稳健,仍需进一步缩小分布对齐差距。
常用场景
经典使用场景
RESCAST-100K最为经典的应用场景是作为跨领域住宅负荷与室内温度预测的基准测试平台。研究者可利用其配置驱动的领域抽象接口,沿地理、气候区、墙体构造、供暖设备等可解释轴线,系统性地定义源域与目标域,从而评估迁移学习、域适应与零样本泛化等方法的效能。该数据集包含约十万户美国住宅的15分钟分辨率时序数据,涵盖总负荷、暖通空调负荷及室内温度三个耦合目标,辅以气象通道、温控设定点及逾四十项静态建筑协变量,为短时负荷预测与热动态建模提供了结构化、多层次的实验基础。
解决学术问题
该数据集直面住宅级预测中普遍存在的数据稀缺性与跨域分布偏移问题。现有数据集或局限于非住宅建筑,或缺失暖通空调负荷与室内温度等关键目标变量,亦缺乏支持可控域偏移评估的架构。RESCAST-100K通过大规模合成数据与统一模式下的真实数据整合,填补了这一空白。它使得学术社区能够在受控条件下系统研究零样本泛化与合成到真实迁移的挑战,为评估不同深度学习架构(如循环网络、注意力机制与MLP混合模型)在域偏移下的鲁棒性提供了前所未有的资源。
衍生相关工作
RESCAST-100K衍生的经典工作主要集中在探索注意力机制与混合架构在住宅预测中的泛化能力。重要发现包括:交叉注意力与MLP混合模型(如TimeXer与TSMixer)在域偏移下持续超越传统Transformer与循环网络,在总负荷与暖通空调负荷预测中表现最优,而在室内温度预测中TimeXer凭借自注意力对热惯性的捕捉占据优势。此外,该数据集催生了鲁棒模型变体(如LSTM-R、Transformer-R等),这些模型通过结构化缺失掩码与NaN感知编码,在输入数据不完整条件下展现出卓越的恢复力,推动了鲁棒时序预测方法的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务