CLiMB
收藏数据链接:
官方服务:
资源简介:
CLiMB是一个由南加州大学开发的多模态持续学习基准数据集,包含四个视觉-语言任务、五个语言任务和四个视觉任务,总计13个任务。该数据集旨在研究多模态任务在持续学习设置下的挑战,并系统评估上游持续学习如何快速泛化到新的多模态和单模态任务。数据集通过GitHub提供,支持研究者探索新的持续学习算法和模型。
CLiMB is a multimodal continual learning benchmark dataset developed by the University of Southern California. It contains a total of 13 tasks, including four vision-language tasks, five language tasks and four vision tasks. This dataset aims to investigate the challenges of multimodal tasks under the continual learning setting, and systematically evaluate how upstream continual learning can rapidly generalize to new multimodal and unimodal tasks. The dataset is available via GitHub, enabling researchers to explore novel continual learning algorithms and models.
提供机构:
南加州大学创建时间:
2022-06-18
搜集汇总
数据集介绍

构建方式
CLiMB基准数据集以系统性收集与统一整合为构建核心,从OpenML平台精心筛选了73个真实世界中的表格型类别不平衡数据集,覆盖金融、医疗、工程等多个领域,且其不平衡比率从2.1至577.9不等,确保了任务的多样性与现实挑战性。同时,该基准统一实现了29种具有代表性的类别不平衡学习算法,涵盖欠采样、过采样、清洗、代价敏感学习及集成方法等主流范式。所有算法均采用与scikit-learn兼容的统一API设计,并配套详尽的文档与高质量的代码质量控制,旨在提供一个公平、可复现且易于扩展的评估平台。
特点
CLiMB数据集最显著的特点在于其全面性与严谨性。它跨越了以往研究局限于单一领域或少数算法的碎片化格局,首次在同一框架下对多种算法范式进行大规模横向对比。此外,该基准不仅关注分类性能,还深入剖析了算法在不同不平衡程度下的效率与鲁棒性,揭示了朴素重平衡策略的局限性、集成方法的关键作用以及数据质量相较于类别不平衡本身的深远影响。这些基于约80万次超参数搜索与千万级模型训练的实证洞察,使其成为该领域极具价值的参考基准。
使用方法
使用CLiMB基准时,研究者可借助其开源的Python包便捷地访问所有数据集与算法。首先,用户通过统一API加载预处理完毕的数据集,其数值特征已标准化,类别特征则依据基数进行编码。随后,可选用内置的29种算法之一进行模型训练,并利用5折分层划分与Optuna超参数优化确保评估的公正性。该基准特别强调根据具体应用场景选择合适的评估指标,如关注少数类识别精度的AUPRC或关注类别间召回均衡的平衡准确率,从而获得对模型效果更精准的解读。
背景与挑战
背景概述
在现实世界的分类任务中,类别不平衡是一种普遍存在的挑战,其中少数类往往代表着关键但稀有的结果,例如金融交易中的欺诈检测、网络日志中的恶意连接识别以及医疗记录中的阳性诊断预测。表格数据作为工业和科学领域众多核心应用的基础,其上的类别不平衡学习(CIL)长期以来一直是机器学习、人工智能和数据挖掘领域的重要研究焦点。然而,现有针对表格数据CIL的基准资源却呈现碎片化状态,覆盖的算法范式、数据集和应用领域均十分有限。为弥补这一空白,伊利诺伊大学厄巴纳-香槟分校、罗切斯特大学及IBM研究院等机构的研究人员于2025年提出了CLiMB基准。该基准精心收集了73个跨越不同领域和不平衡程度的真实世界表格数据集,并统一实现了29种代表性的CIL算法,旨在为相关研究提供一个全面、公平且可扩展的评估平台。
当前挑战
CLiMB基准所面临的挑战涵盖领域问题与构建过程两个层面。在领域问题层面,表格数据由于具有异质性特征类型、样本量小以及缺乏有意义的局部相关性等独特属性,其上的类别不平衡问题被进一步放大,少数类样本的稀缺严重制约了模型的泛化能力。此外,简单的重平衡技术(如欠采样、过采样或代价敏感重加权)在极端不平衡场景下往往适得其反,导致性能下降而非提升。在构建过程中,挑战主要体现在:其一,需要从海量数据中筛选出满足真实世界来源、自然不平衡、具备学习难度且数据完整等七项严格标准的73个数据集,确保基准的现实性与非平凡性;其二,统一实现并标准化29种分属不同范式(如重采样、代价敏感学习、集成方法)的算法,以保证公平比较;其三,设计并执行了包含约80万次超参数搜索、超过1000万基模型训练的大规模实验,以系统评估各方法在有效性、效率和鲁棒性上的表现。
常用场景
经典使用场景
在类别不平衡学习的广阔领域中,表格数据因其在金融欺诈检测、医疗诊断和网络入侵识别等关键任务中的核心地位而备受关注。CLiMB基准数据集应运而生,其最经典的用途在于系统性地评估和比较各类不平衡学习算法在真实世界表格数据上的表现。通过整合73个跨越不同领域与不平衡程度的数据集,以及29种代表性算法的统一实现,CLiMB为研究者提供了一个标准化的实验平台,用以严谨地衡量重采样、代价敏感学习和集成方法等技术的效果与效率。
解决学术问题
CLiMB精准地填补了现有研究中的空白,解决了长期以来学术界在表格数据不平衡学习领域面临的碎片化与缺乏统一比较的困境。该基准通过大规模实证分析,揭示了若干关键洞见:简单的重平衡策略往往收效甚微,甚至适得其反;集成学习是提升鲁棒性的关键;而数据质量(如标签噪声与缺失值)对模型性能的负面影响,其严重性甚至可能超越类别不平衡本身。这些发现为后续算法设计提供了坚实的理论依据与实践导向。
衍生相关工作
基于CLiMB的丰富洞见,一系列衍生工作得以蓬勃发展。研究者们开始深入探索数据质量与类别不平衡的联合效应,例如开发灵活的表格数据合成框架以模拟噪声与缺失值并存的情景。此外,将深度学习方法与CLiMB中验证有效的集成范式(如下采样集成)相结合,成为提升深度不平衡学习性能的新方向。自动机器学习(AutoML)领域也受其启发,致力于设计能够动态组合数据清洗与重采样模块的智能系统,以应对复杂多变的现实数据挑战。
以上内容由遇见数据集搜集并总结生成



