遇见数据集

thermoshift-1b

收藏
Hugging Face2026-09-12 更新2026-09-13 收录
官方服务:

资源简介:

ThermoShift 是一个大规模的合成数据集,模拟建筑冷却系统每小时运行轨迹。它包含观察到的决策(三种冷却行动及其记录概率)和对应的反事实结果(每个行动下的潜在状态和潜在结果)。数据集提供两种配置:logged(包含决策时刻的观测、冷却动作、倾向得分、事实目标以及轨迹边界)和 oracle(包含潜在温度、物理参数、传感器标签、三个潜在结果以及最佳一步动作)。数据来源为基于单区域热模型生成的合成建筑,每小时推进一个时间步。共包含 1,000,000,000 条独立的每小时决策记录,来自 5,952,381 栋合成建筑,每条记录步长为 168 步。数据被划分为训练集(699,746,200 条)、验证集(99,921,528 条)、测试集(100,018,296 条)、热浪测试集(50,108,016 条)和传感器退化测试集(50,205,960 条)。数据集以 Parquet 格式存储,通过 row_id 可以连接 logged 和 oracle 配置,building_id 和 step 标识轨迹中的位置。该数据集适用于多种任务,包括预测下一小时的温度、能耗、排放或舒适度偏差;使用配对结果评估行动效应;基于记录状态的离线策略评估;重构传感器状态并识别漂移或缺失观测;以及评估建筑物跨泛化能力和压力条件。数据集采用 MIT 许可证发布。

ThermoShift is a large-scale synthetic dataset simulating hourly operating trajectories of building cooling systems. It contains observed decisions (three cooling actions with their recorded probabilities) and corresponding counterfactual outcomes (potential states and potential outcomes under each action). The dataset offers two configurations: logged (containing observations at decision time, cooling actions, propensity scores, factual targets, and trajectory boundaries) and oracle (containing potential temperatures, physical parameters, sensor labels, three potential outcomes, and the best one-step action). The data is generated from synthetic buildings based on a single-zone thermal model, advancing one time step per hour. It includes 1,000,000,000 independent hourly decision records from 5,952,381 synthetic buildings, each with a trajectory length of 168 steps. The data is split into training (699,746,200 records), validation (99,921,528 records), test (100,018,296 records), heatwave test (50,108,016 records), and sensor degradation test (50,205,960 records) sets. The dataset is stored in Parquet format, with row_id linking logged and oracle configurations, and building_id and step identifying positions within trajectories. It is suitable for various tasks, including predicting next-hour temperature, energy consumption, emissions, or comfort deviations; evaluating action effects using paired outcomes; offline policy evaluation based on recorded states; reconstructing sensor states and identifying drift or missing observations; and assessing cross-building generalization and stress conditions. The dataset is released under the MIT license.

创建时间:
2026-09-12
原始信息汇总

ThermoShift 数据集概述

基本信息

  • 数据集名称:ThermoShift
  • 数据集地址:https://huggingface.co/datasets/neuralsorcerer/thermoshift-1b
  • 许可证:MIT
  • 任务类别:表格回归、表格分类、强化学习
  • 标签:合成数据、能源、因果推断、反事实、离线强化学习、分布偏移、时间序列

数据集内容

该数据集包含每小时合成的建筑冷却轨迹,包含观测到的决策以及配对的反事实结果。数据集包含三种冷却动作、其记录概率、事实结果,以及一个包含潜在状态和每个动作潜在结果(potential outcomes)的预言机(oracle)表。建筑被分配到训练、验证和测试划分中,包括热浪和传感器退化两种压力条件。

配置(Configurations)

名称 内容
logged 决策时刻的观测、冷却动作、倾向性(propensities)、事实目标以及轨迹边界
oracle 潜在温度、物理参数、传感器标签、三种潜在结果以及最佳单步动作

两个配置通过 row_id 进行连接;building_idstep 用于标识每个轨迹中的位置。schema.json 描述了每一列的类型、单位与角色。feature_roles.json 提供了策略和转移模型的特征列表。

加载方式

python from datasets import load_dataset

records = load_dataset( "neuralsorcerer/thermoshift-1b", name="logged", split="train", streaming=True, columns=["row_id", "building_id", "step", "obs_temp_last_c", "action", "y_next_temp_c"], ) print(next(iter(records)))

在记录实验时,应将 revision 设置为已完成的提交 SHA。流式读取会在消费记录时逐步读取。对于序列任务需保持轨迹有序,并通过标识符匹配 oracle 标签。

任务

  • 预测下一小时温度、能耗、排放或舒适度偏差。
  • 使用配对结果作为评估标签来估计动作效应。
  • 在记录状态下使用提供的倾向性评估单步策略。
  • 重建传感器状态并识别漂移或缺失观测。
  • 衡量跨建筑以及两种压力条件下的泛化能力。

策略输入来自 policy_features。转移预测器也可以使用已记录的动作。Oracle 字段提供评估标签或明确选择的监督来源。单步潜在结果从当前事实状态分支;评估不同的轨迹策略需要模拟其产生的状态序列。

模型与来源

单区热力学模型每小时推进每个建筑一个步长。冷却水平为额定电力输入的 0%、50% 和 100%。天气、占用率、电网可用性和传感在轨迹过程中演变。电力与舒适度决定奖励。DATASHEET.md 给出了方程和参数分布。

run_config.json 记录配置、生成器指纹和运行时版本。manifest.json 包含计数、大小和文件校验和。完成标记绑定清单与发布元数据。validation.json 记录最近保存的验证状态及其检查范围。

本版本发布信息

  • 总决策记录数:1,000,000,000 条唯一每小时决策记录
  • 合成建筑数量:5,952,381 个
  • 每条决策在 loggedoracle 配置中各有一条对应行,通过 row_id 关联。
划分 决策记录数
test 100,018,296
test_heatwave 50,108,016
test_sensor 50,205,960
train 699,746,200
validation 99,921,528
  • 随机种子(Seed):42
  • 回合长度(Episode length):168 个每小时步长
  • 隐藏混杂模式(Hidden-confounding mode):False
  • 配置指纹(Config fingerprint):b32ebac0c5e6da38f1a7aadad9c77ff4388e8f67d8c05186d4f0b09a3c9d4538
  • 压缩 Parquet 字节数(两种配置):199915309678

生成参数与运行时版本见 run_config.json。列角色与单位见 schema.json

复现与验证

  • 生成器:ThermoShift commit 3d92172f8168(https://github.com/neuralsorcerer/thermoshift/tree/3d92172f81687c4ee1261767c04d50caabb2bb77),生成器及其物理模型未做修改。
  • reproduction/publish_streaming.py 生成完整的建筑分片(shards),对每一行运行上游记录与方程检查,并在删除本地数据前验证上传文件的大小和 SHA-256 哈希。每个分片的验证回执位于 provenance/shards/
  • 最终化检查所有配置分片区间和两张表的精确覆盖。validation.json 包含生成时验证的汇总结果。
  • 当存在时,audit/validation.json 记录单独的完整下载、方程扫描以及精确确定性重放审计;_AUDIT_SUCCESS.json 标识其成功完成。
  • 在下载或实验中应使用所记录的已完成不可变 revision。_SUCCESS.json 绑定最终清单和数据集文档。
搜集汇总
数据集介绍
thermoshift-1b 数据集图片
构建方式
在建筑能耗优化与离线强化学习领域,高保真且带有反事实标注的轨迹数据长期匮乏。ThermoShift依托单区域热力学模型,逐小时推进建筑状态演化,冷却动作仅取额定电输入的0%、50%、100%三档,并让天气、 occupancy、电网可用性与传感特性沿时间线动态变化。生成器完整记录行为策略的决策概率、事实结果,同时计算隐含温度与三种潜在动作结果,形成logged与oracle双配置。全部一亿条决策记录以row_id对齐,并按建筑划分训练、验证与测试集,其中测试集进一步分化出热浪与传感器退化两种压力工况。
特点
数据集的核心特质在于事实观测与反事实结果并置。logged配置提供决策时刻的观测、动作倾向性、事实目标及轨迹边界,oracle配置则揭露潜在温度、物理参数、传感器标签、三种单步潜在结果与最优动作。每栋建筑严格归属单一划分,避免信息泄漏;同时覆盖热浪与传感器漂移等分布偏移情形,为泛化评估提供天然压力测试。配置间通过row_id精确关联,building_id与step共同锁定轨迹位置,schema.json与feature_roles.json分别界定列单位及策略与转移动力学所需的特征集合。
使用方法
研究人员可借助HuggingFace的datasets库加载数据,按需选择logged或oracle配置及对应划分,支持列裁剪与流式读取以降低内存开销。对于序列任务,应保持轨迹顺序;若需利用潜在结果,则通过标识符匹配oracle标签。典型任务涵盖下一小时温度、能耗、排放或舒适度偏差预测,动作效应估计,基于倾向性的一步策略评估,传感器状态重建与漂移识别,以及跨建筑和压力工况的泛化度量。策略输入取自policy_features,转移模型可额外纳入动作,而oracle字段既可作为评估标签,也可作为显式监督来源。
背景与挑战
背景概述
建筑能源系统的优化与需求响应研究长期受限于真实运行数据的稀缺性和反事实不可观测性,难以在多变环境条件下系统评估控制策略的鲁棒性与泛化能力。ThermoShift数据集于2024年前后由neuralsorcerer团队构建并发布,旨在为离线强化学习、因果推断与分布偏移研究提供一个大规模、可控且可复现的合成基准。其核心研究问题在于如何在记录策略偏差、气候突变与传感器退化等条件下,准确估计冷却动作的因果效应并评估单步策略性能。该数据集以十亿级小时级决策记录和配对反事实结果,显著推动了能源领域时序决策与因果机器学习交叉方向的发展。
当前挑战
该数据集所应对的领域问题在于建筑冷却控制中反事实结果不可直接观测,且记录策略产生的选择偏差会干扰动作效应估计,同时热浪与传感器退化引发的分布偏移对模型泛化构成严峻考验。在构建过程中,需在十亿级规模上维持合成建筑物理模型与记录策略的概率一致性,确保每条决策记录与潜在结果表通过row_id精确对齐,并保证九个分片区间与两类配置的完整覆盖。生成流程还须对每一行执行方程校验与哈希验证,以维系数据在因果推断与离线强化学习任务中的可信度。
常用场景
经典使用场景
在能源管理与建筑节能领域,基于因果推断的序贯决策优化长期依赖高质量的反事实数据。ThermoShift数据集以其十亿级逐小时合成建筑冷却轨迹及配对反事实结果,成为评估离策略强化学习与因果效应估计的经典基准。研究者常利用logged配置中的决策观测、动作倾向性与事实目标,结合oracle配置提供的潜在状态与三种动作的潜在结果,开展一步策略评估、动作效应估计与状态重建等任务。该数据集通过热浪与传感器退化两种压力测试条件,为分布偏移下的策略泛化能力检验提供了标准化场景。
解决学术问题
针对建筑能源系统中反事实不可观测、离策略评估缺乏真值标签以及分布偏移下模型鲁棒性难以量化等长期学术难题,ThermoShift提供了大规模配对潜在结果与倾向性得分,使动作效应估计和策略评估得以在已知真值下进行。其热浪与传感器退化分割系统地暴露了协变量偏移与观测噪声对预测和决策的影响,为因果推断、离线强化学习与时间序列预测中的泛化性研究提供了可控实验平台,推动了可复现的基准测试与算法比较。
衍生相关工作
ThermoShift的发布激发了多项后续研究,包括基于潜在结果的离策略评估方法、结合物理模型与数据驱动的混合预测器、以及针对分布偏移的领域自适应策略。部分工作利用其oracle表作为监督信号,探索了反事实回归与双重稳健估计在建筑控制中的适用性;另一些研究则借助其压力测试分割,系统比较了离线强化学习算法在传感器退化与热浪场景下的鲁棒性。该数据集亦被用于基准测试因果发现与序列决策的融合框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务