遇见数据集

CLUBench

收藏
arXiv2026-05-28 更新2026-06-02 收录
官方服务:

资源简介:

CLUBench是由香港中文大学(深圳)研究团队构建的一个综合性聚类基准数据集,旨在系统评估传统算法、深度学习方法及基础模型在聚类任务中的性能表现。该数据集涵盖表格、文本和图像三种模态,共包含131个来自医学、生物学、金融等多元领域的真实世界数据集,样本规模从61至10,000不等,特征维度介于2至27,648之间。数据集的构建基于公开数据集档案和现有研究工作的整合,通过统一框架对24种聚类算法进行了178,815次实验验证。该基准主要应用于聚类算法评估与选择研究,致力于解决跨模态聚类方法性能对比不足、算法部署缺乏指导等核心问题,并为聚类研究提供标准化工具和性能分析基础。

CLUBench is a comprehensive clustering benchmark dataset constructed by the research team from The Chinese University of Hong Kong, Shenzhen, aiming to systematically evaluate the performance of traditional algorithms, deep learning methods, and foundation models on clustering tasks. This dataset covers three modalities: tabular, text, and image, and comprises a total of 131 real-world datasets from diverse fields including medicine, biology, finance and others. The sample sizes of these datasets range from 61 to 10,000, while their feature dimensions vary between 2 and 27,648. Built upon the integration of public dataset repositories and existing research works, CLUBench has conducted 178,815 experimental evaluations on 24 clustering algorithms via a unified framework. This benchmark is primarily applied to research on clustering algorithm evaluation and selection, aiming to address core challenges such as insufficient performance comparison of cross-modal clustering methods and lack of guidance for algorithm deployment, while providing standardized tools and performance analysis foundations for clustering research.

创建时间:
2026-05-28
原始信息汇总

📖 CLUBench (A Clustering Benchmark) 数据集详情

摘要

CLUBench 是一个综合性的聚类基准测试平台,旨在系统性地评估多种聚类算法。它涵盖了 24 种不同原理的算法,并在 131 个数据集上进行了评估,这些数据集涵盖表格、文本和图像三种模态。该基准测试统一比较了最先进的基线方法和基于基础模型的聚类策略。通过 178,815 次实验,CLUBench 提供了具有统计意义的见解,例如在跨模型性能矩阵中观察到低秩结构,这有助于在实践应用中快速进行算法评估和选择。

数据集构成

CLUBench 包含 131 个数据集,分为表格、文本和图像三大类。数据集来源包括 IEEE TPAMI 论文及 OpenML 平台。

  • 数量: 131 个
  • 类型: 表格 (tabular)、文本 (text)、图像 (image)
  • 数据规模: 样本数量从 61 (echocardiogram) 到 10,000 (如 paris_housing_classification) 不等。
  • 维度 (dim): 从 2 (tamilnadu-electricity) 到 27,648 (PCam) 不等。
  • 类别数 (clusters): 从 2 到 40 (olivetti_faces) 不等。

部分数据集示例:

  • 表格数据: breast_cancer_wisconsin_original, iris, wine, spambase, mnist64 等。
  • 图像数据: MNIST_CLIP+, fashion_mnist, cifar10, COIL20_CLIP+ 等。
  • 文本数据: cnae9, imdb, 20newsgroups, reuters 等。

算法列表

CLUBench 集成了 10 种深度聚类方法,包括:

  • DEC (ICML 2016)
  • IDEC (IJCAI 2017)
  • DSCN (NeurIPS 2017)
  • PICA (CVPR 2020)
  • ConClu (AAAI 2021)
  • EDESC (CVPR 2022)
  • DMICC (AAAI 2023)
  • DIVC (CVPR 2023)
  • P²OT (ICLR 2024)
  • LFSS (ICML 2025)

工具与使用

CLUBench 提供了一个易于使用的工具箱,将官方代码整合到统一框架中,并附有详细说明。

1. 安装与依赖

  • 环境: Python 3.10, CUDA 12.1
  • 安装命令: pip install -e .

2. 数据集下载

3. 快速开始

  • 列出所有数据集: python from CLUBench import DATASETS print(DATASETS)

  • 使用 DEC 聚类: python import numpy as np from CLUBench import DEC, load_data data_name = weather.npz X, Y = load_data(data_name) hpc = {n_clusters: len(np.unique(Y))} CM = DEC(**hpc) CM.fit_predict(X) acc, nmi, ari = CM.evaluation(Y)

4. 扩展功能

  • 新增数据集: 构建数据字典 {x: data, y: labels},保存为 .npz 文件,并将名称加入 DATASETS 列表。
  • 新增算法: 创建继承 BaseCluster 的新 Python 文件,实现 fit_predict(self, X) 方法,并在 __init__.py 中导入。

分析与工具

  • 低秩分析:

    • 目录: ./low_rank
    • 命令: python main.py (可调整缺失率 --missing_rate 和秩 --rank)
  • 元特征加载: python from utils import load_meta_features meta_features = load_meta_features()

  • 性能矩阵加载: python from utils import load_best_p acc, nmi, ari = load_best_p()

    python from utils import load_all_p acc, nmi, ari = load_all_p()

搜集汇总
数据集介绍
CLUBench 数据集图片
构建方式
在数据科学领域,聚类分析作为一项基础性课题,催生了众多经典与前沿算法。然而,现有评估往往局限于单一算法范式或有限数据集,难以全面指导方法选择与部署。为填补这一空白,CLUBench应运而生。其构建过程严谨而系统:首先,从公开数据仓库与既往研究中汇聚了131个涵盖表格、文本与图像三种模态的真实世界数据集;其次,精心遴选了24种代表性聚类算法,囊括14种传统方法和10种深度聚类方法,并额外融入了基于大语言模型等基础模型的聚类策略;最后,针对每种算法,系统性地探索了多个超参数配置,总计开展了178,815次实验,构成了一个规模空前、跨范式的综合评估基准。
特点
CLUBench的显著特点在于其规模宏大、维度丰富且分析深入。它不仅是目前涵盖算法种类最多、数据集最广泛的聚类基准之一,更在多个层面提供了独特洞见。研究发现,所有评估的深度聚类方法在平均性能上并未显著超越顶尖的传统算法(如KMeans与谱聚类),而将预训练嵌入与传统算法相结合,对于图像和文本聚类任务而言是一种高效且有效的方案。此外,该基准揭示了超参数调优对性能的巨大影响、算法偏好的上下文依赖性,并发现跨模型性能矩阵存在显著的低秩结构,这为高效性能预测与模型选择开辟了新途径。
使用方法
为了方便研究者充分利用这一丰富资源,CLUBench提供了一个与scikit-learn完全兼容的Python工具箱。用户可通过统一的接口调用全部24种算法,其使用模式简洁直观:实例化模型对象(如DEC(**hpc)),调用fit_predict(X)方法进行聚类,并可直接访问labels、time等属性获取预测标签与运行时间,通过evaluation(Y)方法计算ACC、NMI、ARI等评价指标。该工具箱易于扩展,新数据集和算法可无缝集成。研究领域,该基准提供了全面的实验数据与元特征,支持从相似性分析、偏好分析到基于性能矩阵的模型选择等一系列高阶研究,为方法对比与未来探索奠定了坚实基础。
背景与挑战
背景概述
聚类作为数据科学中的基本问题,长期以来孕育了众多经典算法。然而,随着深度学习与基础模型的蓬勃发展,一种能够系统整合传统算法、深度学习方法及基于基础模型的聚类策略的大规模实证评估却始终缺位,导致算法选择与部署缺乏有效指导。为填补这一空白,CLUBench于2026年由香港中文大学(深圳)的冯晓、傅大志、丁志国和范继聪等研究者联合创建。该基准精心汇集了24种涵盖不同原理的聚类算法,在横跨表格、文本和图像三种数据模态的131个数据集上开展了共计178,815次实验。通过深入分析超参数调优的影响、数据类型与特征的作用、预训练嵌入的效果、大语言模型聚类的表现、算法之间的相似性以及性能矩阵的低秩结构,CLUBench为聚类研究提供了富有洞察力的发现与有前景的研究方向,显著推动了该领域的系统性评估与理解。
当前挑战
CLUBench所应对的首要挑战在于聚类领域长期存在的算法选择困境:不同算法在不同数据集与实验配置下性能高度不一致,而此前缺乏涵盖传统、深度及基础模型方法的统一对比框架。在构建过程中,研究团队面临了数据集模态与规模的巨大差异、深度聚类方法在表格数据上难以发挥优势、以及基础模型在无监督聚类任务中的适用性受限等难题。例如,实验揭示所有评估的深度聚类方法在平均性能上并未显著超越如KMeans和谱聚类等顶级传统算法;将预训练嵌入与简单传统算法结合在图像与文本聚类中反而更为高效。此外,即使是在基础模型日益主导的时代,聚类依然是一个极具挑战性的非平凡问题。为应对这些挑战,CLUBench通过构建涵盖131个数据集的全面基准、提供统一易用的工具箱,并创新性地利用低秩结构实现性能矩阵的快速预测与模型选择,为聚类研究提供了切实可行的解决方案。
常用场景
经典使用场景
在数据科学领域,聚类分析作为一项基础性研究问题,长期以来涌现了大量算法,但缺乏系统性的跨范式评估。CLUBench通过整合24种涵盖传统聚类、深度聚类及基于基础模型的聚类方法,在131个数据集上开展了178,815次实验,为研究者提供了一个统一的标准化评估平台。该数据集的核心使用场景在于对聚类算法进行大规模、多维度的性能比较,尤其聚焦于表格、文本和图像三种数据类型,通过统一的多项评估指标,揭示了不同算法在不同数据特征下的行为模式与性能差异。
解决学术问题
CLUBench系统性地填补了聚类研究中长期存在的评估空白,解决了以往研究因数据集和算法覆盖有限而导致的评估偏差问题。该数据集联合对比了传统聚类、深度聚类与基础模型聚类三大范式,揭示出深度聚类在平均性能上并未显著超越传统算法,而结合预训练嵌入的传统方法在图像和文本聚类中表现出高效性。此外,CLUBench通过偏好分析、低秩矩阵分解和基于元特征的模型选择,为算法与超参数的自适应选择提供了理论依据,推动了聚类研究向更科学、更可复现的方向发展。
衍生相关工作
基于CLUBench的丰富实验结果,衍生出多项具有深远影响的后续研究工作。其中包括基于性能向量相似性的算法分类,通过t-SNE可视化揭示了不同算法在方法论上的亲缘关系,为聚类算法的理论归纳提供了实证基础;此外,低秩矩阵补全技术被用于从部分性能观测中高效预测整体表现,显著降低了大规模评估的实验成本。模型选择方向的工作则探索了利用元特征回归方法实现超参数自动配置,为实现全自动聚类流程奠定了关键基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务