遇见数据集

yzhuang/autotree_automl_electricity_gosdt_l256_d3_sd0

收藏
Hugging Face2023-08-31 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: id dtype: int64 - name: input_x sequence: sequence: float64 - name: input_y sequence: sequence: float32 - name: rtg sequence: float64 - name: status sequence: sequence: float32 - name: split_threshold sequence: sequence: float64 - name: split_dimension sequence: int64 splits: - name: train num_bytes: 2773600000 num_examples: 100000 - name: validation num_bytes: 277360000 num_examples: 10000 download_size: 691921046 dataset_size: 3050960000 --- # Dataset Card for "autotree_automl_electricity_gosdt_l256_d3_sd0" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征字段: - 字段名:id,数据类型为int64(64位整数类型) - 字段名:input_x,数据类型为嵌套序列,内层序列元素的数据类型为float64(64位浮点数类型) - 字段名:input_y,数据类型为嵌套序列,内层序列元素的数据类型为float32(32位浮点数类型) - 字段名:rtg,数据类型为序列,元素的数据类型为float64(64位浮点数类型) - 字段名:status,数据类型为嵌套序列,内层序列元素的数据类型为float32(32位浮点数类型) - 字段名:split_threshold(分割阈值),数据类型为嵌套序列,内层序列元素的数据类型为float64(64位浮点数类型) - 字段名:split_dimension(分割维度),数据类型为序列,元素的数据类型为int64(64位整数类型) 数据集划分: - 划分集名称:train(训练集),字节占用大小:2773600000,样本总数:100000 - 划分集名称:validation(验证集),字节占用大小:277360000,样本总数:10000 下载总大小:691921046 数据集总存储大小:3050960000 # "autotree_automl_electricity_gosdt_l256_d3_sd0"数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
yzhuang
原始信息汇总

数据集概述

数据特征

  • id: 数据类型为 int64
  • input_x: 序列类型为 float64
  • input_y: 序列类型为 float32
  • rtg: 序列类型为 float64
  • status: 序列类型为 float32
  • split_threshold: 序列类型为 float64
  • split_dimension: 数据类型为 int64

数据分割

  • train: 包含 100000 个样本,总字节数为 2773600000
  • validation: 包含 10000 个样本,总字节数为 277360000

数据集大小

  • 下载大小: 691921046 字节
  • 数据集总大小: 3050960000 字节
搜集汇总
数据集介绍
yzhuang/autotree_automl_electricity_gosdt_l256_d3_sd0 数据集图片
构建方式
该数据集名为yzhuang/autotree_automl_electricity_gosdt_l256_d3_sd0,专注于电力领域自动化机器学习中的最优稀疏决策树(GOSDT)模型训练。其构建基于大规模电力数据样本,包含10万条训练样本与1万条验证样本,每条样本由输入特征(input_x)、目标变量(input_y)、回报值(rtg)、状态信息(status)以及分裂阈值(split_threshold)和分裂维度(split_dimension)等结构化字段组成。数据通过自动化管道生成,旨在为GOSDT算法提供标准化的训练与评估输入,支持最大叶子节点数为256、树深度为3的稀疏决策树学习。
特点
该数据集的一大显著特点在于其多模态序列化结构,其中input_x和input_y均为嵌套序列类型,分别存储高精度浮点特征与浮点标签,能够有效捕捉电力时间序列中的动态关联。rtg和status字段进一步强化了强化学习场景下的回报与状态表征,而split_threshold和split_dimension则直接服务于决策树分裂逻辑的预定义与验证。数据划分科学,训练集与验证集比例为10:1,总数据量约3.05GB,确保了模型训练的充分性与评估的可靠性。
使用方法
使用该数据集时,用户可通过HuggingFace Datasets库直接加载,利用load_dataset函数指定数据集名称及所需划分(train或validation)。数据以表格形式呈现,每行代表一个独立样本,各字段可直接映射为模型输入。建议在加载后对嵌套序列进行适当展平或填充处理,以适配GOSDT等决策树框架的输入格式。此外,可结合split_threshold与split_dimension字段进行分裂策略的预分析,或利用rtg与status设计强化学习奖励机制,从而在电力负荷预测或自动化调参任务中发挥数据价值。
背景与挑战
背景概述
在自动化机器学习(AutoML)与可解释人工智能(XAI)交叉领域,决策树模型因其固有的透明性而备受青睐,但传统贪婪生长算法常陷入局部最优。该数据集由研究团队于近年创建,聚焦于电力负荷预测这一典型时间序列回归任务,旨在为全局最优稀疏决策树(GOSDT)算法提供标准化训练与验证基准。其核心研究问题在于:如何通过大规模合成数据,评估并推动可微分树结构学习在能源领域的应用。数据集包含10万训练样本及1万验证样本,特征维度为256,深度限制为3,稀疏度设为0,这种精心设计的参数配置为比较不同AutoML管道在受限模型复杂度下的表现提供了关键资源,对推动可解释性强的轻量级模型在工业场景落地具有重要参考价值。
当前挑战
当前该数据集面临的核心挑战可归纳为三方面。其一,电力负荷数据固有的高度非线性和多尺度周期性,使得任何决策树模型都需在拟合精度与泛化能力间艰难权衡,传统分治策略难以捕捉长程依赖。其二,构建过程中采用合成数据生成方法,虽保证了标签的完全可控性,却可能引入与真实电力系统噪声分布不匹配的系统偏差,导致模型在迁移至实际电网数据时性能骤降。其三,受限的树深度(3层)虽提升了可解释性,却严重限制了特征交互的表达能力,使得GOSDT算法在256维稀疏特征空间中极易陷入欠拟合,亟需开发更高效的剪枝策略或特征选择机制来突破这一容量瓶颈。
常用场景
经典使用场景
该数据集专为自动化机器学习(AutoML)中的树模型优化而设计,尤其聚焦于广义最优稀疏决策树(GOSDT)算法的训练与评估。其经典使用场景在于,研究人员可利用此数据集探索电力系统负荷预测任务中的稀疏决策树构建,通过预设的树深度(如256层)和稀疏度参数(如3)来平衡模型复杂度与泛化能力。数据集中包含的输入特征、回归目标及分裂阈值等结构化信息,为监督学习中的决策树剪枝与超参数调优提供了标准化基准。
解决学术问题
该数据集有效解决了电力时间序列预测中可解释性与预测精度难以兼得的学术困境。传统黑箱模型虽能逼近复杂非线性关系,却缺乏决策逻辑的透明性;而经典决策树虽具可解释性,却在高维时序数据中易陷入过拟合或欠拟合。通过提供预分割的稀疏决策树参数空间(如分裂维度与阈值),该数据集使得研究者能够系统性地评估正则化策略对模型泛化边界的影响,推动了可解释人工智能(XAI)在能源领域的理论深化。
衍生相关工作
围绕该数据集衍生的经典工作包括GOSDT算法的稀疏性约束改进、基于贝叶斯优化的树结构搜索策略,以及将决策树与神经网络结合的混合模型(如Neural-GOSDT)。此外,研究者还将其扩展至多任务学习框架,通过共享分裂阈值实现不同电力区域间的知识迁移。这些工作不仅提升了稀疏决策树的训练效率,还验证了其在避免过拟合时的鲁棒性,为AutoML社区提供了可复现的基准实验平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务