EnergyBench|能源计量数据集|建筑能耗分析数据集
收藏EnergyBench 数据集概述
基本信息
- 许可证: CC-BY-SA-4.0
- 任务类别: 时间序列预测
- 语言: 英语
- 标签: 能源、智能电表、电力、建筑、数据集、croissant
- 数据规模: 10B < n < 100B
数据集配置
商业建筑数据
- 时间粒度: 每小时、15分钟、30分钟
- 包含的子数据集:
- BDG-2、Berkely、CLEMD、CU-BEMS、DGS、ECRG-Commercial、Enernoc、EWELD、HB、IBlend、IOT、IPC-Commercial、NEST-Commercial、PSS、RKP、SEWA、SKC、UCIE、ULE、UNICON
光伏(PV)数据
- 时间粒度: 每小时、15分钟
- 包含的子数据集:
- DLEP、HSG、MYMG、SPV、SWC、SDWPF
风电数据
- 时间粒度: 每小时、15分钟
- 包含的子数据集:
- SDWPF、SWC
住宅数据
- 时间粒度: 每小时、15分钟、30分钟
- 包含的子数据集:
- AMPD、BTS、CEEW、DCB、DEDDIAG、DESM、DTH、ECCC、ECRG-Residential、ECWM、ENERTALK、fIEECe、GoiEner、GREEND、HES、HONDA-Smart-Home、HSG、HUE、iFlex、IHEPC、IPC-Residential、IRH、LCL、LEC、METER、MFRED、MIHEC、NDB、NEEA、NESEMP、NEST、Norwegian、PES、Plegma、Prayas、REED、REFIT、RHC、RSL、SAVE、SFAC、SGSC、SMART-Star、SRSA、UKST、WED
合成数据
- 时间粒度: 每小时、15分钟
- 包含的子数据集:
- SynD、Buildings-900K-Commercial、Buildings-900K-Residential、SDG
元数据
- 包含的文件:
- Metadata-datasets.csv
- missing/*.csv
数据格式
- 文件格式: Parquet
- 数据路径示例:
Dataset_V0.0/Energy-Load-Profiles/Hourly/Commercial/BDG-2/*.parquet
Dataset_V0.0/Synthetic-Energy-Load-Profiles/15min/SynD/*.parquet

diegopdlv5/test_dataset_0049c
该数据集主要包含音频数据,分为训练集,共有135个样本,总大小为51580253字节。下载大小为51573551字节。
hugging_face 收录
giovannidemuri__sharegpt-ex50000-seed5_llama8b-er-v573-seed2-hx_256_ngt0.7_tp0.9
该数据集包含了用户与助手之间的对话,其中包含两个字段:用户发言和助手回应,均为字符串类型。训练集大小为38646852字节,共有44096条对话记录。
huggingface 收录
中国区域地面气象要素驱动数据集 v2.0(1951-2024)
中国区域地面气象要素驱动数据集(China Meteorological Forcing Data,以下简称 CMFD)是为支撑中国区域陆面、水文、生态等领域研究而研发的一套高精度、高分辨率、长时间序列数据产品。本页面发布的 CMFD 2.0 包含了近地面气温、气压、比湿、全风速、向下短波辐射通量、向下长波辐射通量、降水率等气象要素,时间分辨率为 3 小时,水平空间分辨率为 0.1°,时间长度为 74 年(1951~2024 年),覆盖了 70°E~140°E,15°N~55°N 空间范围内的陆地区域。CMFD 2.0 融合了欧洲中期天气预报中心 ERA5 再分析数据与气象台站观测数据,并在辐射、降水数据产品中集成了采用人工智能技术制作的 ISCCP-ITP-CNN 和 TPHiPr 数据产品,其数据精度较 CMFD 的上一代产品有显著提升。 CMFD 历经十余年的发展,其间发布了多个重要版本。2019 年发布的 CMFD 1.6 是完全采用传统数据融合技术制作的最后一个 CMFD 版本,而本次发布的 CMFD 2.0 则是 CMFD 转向人工智能技术制作的首个版本。此版本与 1.6 版具有相同的时空分辨率和基础变量集,但在其它诸多方面存在大幅改进。除集成了采用人工智能技术制作的辐射和降水数据外,在制作 CMFD 2.0 的过程中,研发团队尽可能采用单一来源的再分析数据作为输入并引入气象台站迁址信息,显著缓解了 CMFD 1.6 中因多源数据拼接和气象台站迁址而产生的虚假气候突变。同时,CMFD 2.0 数据的时间长度从 CMFD 1.6 的 40 年大幅扩展到了 74 年,并将继续向后延伸。CMFD 2.0 的网格空间范围虽然与 CMFD 1.6 相同,但其有效数据扩展到了中国之外,能够更好地支持跨境区域研究。为方便用户使用,CMFD 2.0 还在基础变量集之外提供了若干衍生变量,包括近地面相对湿度、雨雪分离降水产品等。此外,CMFD 2.0 摒弃了 CMFD 1.6 中通过 scale_factor 和 add_offset 参数将实型数据化为整型数据的压缩技术,转而直接将实型数据压缩存储于 NetCDF4 格式文件中,从而消除了用户使用数据时进行解压换算的困扰。 本数据集原定版本号为 1.7,但鉴于本数据集从输入数据到研制技术都较上一代数据产品有了大幅的改变,故将其版本号重新定义为 2.0。
国家青藏高原科学数据中心 收录
Chinese-Poetry-Corpus
本语料库收集自互联网,包含了从先秦到当代的古诗词数据,以CSV格式进行存储。经过去重后,包含诗词共计1014508首。古诗词按朝代进行划分,存储于文件夹下,命名规则为朝代.csv。每首诗词数据包含五个字段,分别为标题、朝代、作者、体裁、内容。
github 收录
Amazon电影评论数据集
该数据集包含从1997年8月至2012年10月期间,Amazon用户对253,059种产品的7,911,684条评论。数据集被添加了真实标签,这些标签是通过爬取/抓取Amazon.com获得的,用于分类产品。
github 收录