遇见数据集

Wild-Tab

收藏
arXiv2023-12-04 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

Wild-Tab是一个专为表格回归任务中的分布外泛化(OOD)设计的大型基准。该数据集包含三个来自天气预测和电力消耗估计等领域的工业数据集,即V PowerS、V PowerR和Weather。这些数据集为评估OOD性能提供了具有挑战性的测试平台,特别是在真实世界条件下。数据集的创建涉及从公开可用数据中进行规范分区,并遵循特定的方法论进行数据分割。Wild-Tab的应用领域主要集中在解决机器学习模型在面对训练集分布之外的数据时的泛化问题,这对于部署在各种现实世界环境中处理分布偏移的机器学习模型至关重要。

Wild-Tab is a large-scale benchmark specifically designed for out-of-distribution (OOD) generalization in tabular regression tasks. This dataset encompasses three industrial datasets originating from domains such as weather forecasting and electricity consumption estimation, namely V PowerS, V PowerR, and Weather. These datasets serve as a challenging testbed for evaluating OOD performance, especially under real-world conditions. The construction of Wild-Tab involves standardized partitioning from publicly accessible data, with data splits adhering to a specific methodological framework. The primary application scope of Wild-Tab lies in addressing the generalization issue of machine learning models when encountering data outside the training distribution, which is critical for deploying machine learning models that handle distribution shifts across diverse real-world scenarios.

提供机构:
Tinkoff
创建时间:
2023-12-04
搜集汇总
数据集介绍
Wild-Tab 数据集图片
构建方式
在表格数据领域,分布偏移的挑战长期未获充分探索。为弥合这一空白,Wild-Tab基准数据集应运而生,其构建融合了来自航运能耗预测与气象预报的三大工业级真实数据集。具体而言,数据集包括船舶动力合成与真实测量数据,以及涵盖全球五大气候类型的天气预测数据,样本总量逾五百万条。构建过程严格遵循Shifts评估协议,将数据沿时间与源域两个维度进行划分,形成训练、验证与测试子集,并进一步在验证与测试集中区分域内与域外片段,从而系统模拟现实世界中源域偏移与时序偏移交织的混合场景。
使用方法
研究者可借助Wild-Tab基准系统评估与对比表格回归模型在分布偏移下的鲁棒性。使用方法遵循标准流程:首先依据数据集规范加载经规范划分的训练、验证与测试集,其中验证与测试集均明确区分为域内与域外子集。模型基于训练集进行学习,并采用平均域外验证性能进行模型选择。最终,通过比较模型在测试集域内与域外片段上的平均绝对误差、均方根误差等回归指标,量化其泛化能力。基准代码与数据划分公开可用,支持对经验风险最小化及各类分布外泛化算法的公平评估与深入分析。
背景与挑战
背景概述
表格数据在金融、医疗和电子商务等众多工业应用中占据核心地位,然而深度学习模型在此类数据上的分布外泛化研究却相对滞后。2023年,由Tinkoff研究机构的Sergey Kolesnikov等人提出的Wild-Tab基准数据集,旨在填补这一空白。该数据集整合了来自天气预测和电力消耗估计等领域的三个大规模工业数据集,专门用于评估表格回归任务中的分布外泛化能力。Wild-Tab的发布为机器学习社区提供了一个极具挑战性的测试平台,推动了在真实世界分布偏移场景下模型鲁棒性的研究,其影响力体现在对现有十种主流分布外泛化方法的系统性评估,揭示了该领域亟待突破的瓶颈。
当前挑战
Wild-Tab所面临的挑战集中于两个层面。首先,在领域问题层面,表格回归任务中的分布外泛化面临显著的性能退化,实验表明模型在未见数据上的平均绝对误差(MAE)相比分布内数据存在高达58.3%的泛化差距,且现有方法如CORAL、DANN等均未能稳定超越简单的经验风险最小化(ERM)基线。其次,在构建过程中,数据集需同时处理源偏移与时间偏移的混合场景,增加了数据划分与评估的复杂性;此外,表格数据缺乏像图像领域那样成熟的数据增强技术,且高级神经网络架构(如MLP-PLR、FT-Transformer)在分布外场景下并未带来预期的性能提升,反而加剧了超参数调优的敏感性,为基准的构建与方法的公平比较增添了困难。
常用场景
经典使用场景
在表格数据回归任务中,分布偏移(Distribution Shift)是模型部署于真实世界时面临的严峻挑战。Wild-Tab基准数据集应运而生,其经典使用场景聚焦于评估与提升模型在分布外(Out-of-Distribution, OOD)环境下的泛化能力。该数据集整合了来自船舶动力预测和气象温度估计等工业领域的三个大规模表格数据集,通过引入源域偏移与时间偏移的混合场景,构建了一个极具挑战性的测试平台。研究者可借助Wild-Tab系统性地评测不同OOD泛化方法在未见数据上的表现,从而揭示模型在真实分布变化下的脆弱性。
解决学术问题
Wild-Tab填补了表格数据回归任务中OOD泛化研究的空白,解决了以往基准多集中于图像分类而忽视表格数据这一关键领域的问题。通过提供大规模、多来源的工业级数据集,该基准使学术界能够量化评估分布偏移对回归模型性能的影响,并深入分析经验风险最小化(ERM)与各类复杂OOD方法之间的性能差异。其研究意义在于揭示了现有方法在表格回归中普遍存在的泛化鸿沟,以及模型选择策略对OOD性能的显著影响,从而推动更具鲁棒性的深度学习模型设计,为后续理论突破奠定了坚实的实验基础。
实际应用
在工业实践中,Wild-Tab所模拟的分布偏移场景具有广泛的应用价值。例如,在航运领域,船舶动力预测模型需应对不同风速和海况下的数据分布变化,以优化燃油消耗并减少碳排放;在电力负荷估计中,模型必须适应季节性波动与极端天气事件,确保能源调度系统的稳定性;而在气象预报任务里,准确预测不同气候带与时间点的温度变化,对于农业规划、灾害预警等关键决策至关重要。Wild-Tab为这些实际应用提供了一个严苛的测试环境,助力开发出能够在数据分布动态变化中保持高可靠性的机器学习系统。
数据集最近研究
最新研究方向
在表格数据领域,分布外泛化研究正成为前沿热点,尤其是针对回归任务的挑战。Wild-Tab基准的提出填补了该领域缺乏大规模专用评测平台的空白,其整合了来自工业场景的船舶能耗预测与天气预测数据集,聚焦于源域与时间域混合偏移下的模型鲁棒性。研究发现,现有OOD方法在未见数据上普遍存在显著性能下降,而简单的经验风险最小化(ERM)竟展现出与先进方法相匹敌的稳健性,这一反直觉现象揭示了当前算法在表格回归任务中的局限性。该基准的发布不仅推动了分布偏移理论在工业应用中的验证,也为开发更适应真实场景的泛化策略提供了关键评估工具,具有重要的实践指导意义。
相关研究论文
  • 1
    Wild-Tab: A Benchmark For Out-Of-Distribution Generalization In Tabular RegressionTinkoff · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务