probkit/CalArena
收藏资源简介:
CalArena是一个大规模基准数据集,专门用于评估分类模型的后处理校准方法。它覆盖了表格和计算机视觉领域的7个基准,涉及数百个(数据集,模型)对,包括三类问题类型:二分类、多分类和大规模多分类。每个基准条目是一个(p_cal, y_cal, p_test, y_test)元组,包含校准集和测试集的预测概率与真实标签,校准方法在校准集上拟合并在测试集上评估。数据集包含多个HDF5文件(存储概率和标签数据)和CSV实验索引文件(列出每个(数据集,模型)对的详细信息),支持通过Python(h5py)或CalArena运行器加载。基准涵盖了经典表格模型(如CatBoost、XGBoost)、现代表格基础模型(如TabPFN、TabICL)和深度计算机视觉模型(如ResNet、ViT),数据集来源包括TabRepo、TabArena和多个计算机视觉数据集(如CIFAR-10、ImageNet)。数据集构建时确保了无数据泄漏,校准集对应验证折叠,测试集为保留测试集。预期用途包括校准算法基准测试、研究模型类型与校准难度关系,以及开发新校准方法。数据集发布在CC BY 4.0许可证下,下游模型预测来源保留原始许可证。
license: cc-by-4.0 tags: - 校准(calibration) - 事后校准(post-hoc calibration) - 不确定性量化(uncertainty quantification) - 基准测试(benchmark) - 表格数据(tabular) - 计算机视觉(computer vision) size_categories: - 1,000,000 < 样本量 < 10,000,000 # CalArena — 校准基准数据集(CalArena) CalArena是一款用于评估分类模型**事后校准(post-hoc calibration)**方法的大规模基准数据集。其覆盖表格数据与计算机视觉两大领域下的7个基准任务,涵盖数百组「数据集-模型」配对与三类任务类型:二分类、多分类与大规模多分类。 本基准的每个条目均为`(p_cal, y_cal, p_test, y_test)`元组,即单一组「数据集-模型」配对的校准划分与测试划分下的预测概率与真实标签。校准方法将在校准划分上完成拟合,并在测试划分上进行评估。 👩💻 本数据集配套[CalArena代码仓库](https://github.com/probkit/CalArena)。 📄 可在此查阅相关论文:[《CalArena:大规模事后校准基准测试集》](https://arxiv.org/abs/2605.30188) --- ## 文件列表 | 文件名 | 描述 | 大小 | |---|---|---| | `Licenses.zip` | 用于构建基准的各数据源的许可证文件 | < 1 MB | | `tabrepo-binary.h5` | 二分类任务,经典表格模型 | ~36 MB | | `tabrepo-binary-experiments.csv` | `tabrepo-binary` 的实验索引文件 | < 1 MB | | `tabarena-binary.h5` | 二分类任务,现代表格基础模型 | ~26 MB | | `tabarena-binary-experiments.csv` | `tabarena-binary` 的实验索引文件 | < 1 MB | | `cv-binary.h5` | 二分类任务,计算机视觉模型 | < 1 MB | | `cv-binary-experiments.csv` | `cv-binary` 的实验索引文件 | < 1 MB | | `tabrepo-multiclass.h5` | 多分类任务,经典表格模型 | ~115 MB | | `tabrepo-multiclass-experiments.csv` | `tabrepo-multiclass` 的实验索引文件 | < 1 MB | | `tabarena-multiclass.h5` | 多分类任务,现代表格基础模型 | ~11 MB | | `tabarena-multiclass-experiments.csv` | `tabarena-multiclass` 的实验索引文件 | < 1 MB | | `cv-multiclass.h5` | 多分类任务,计算机视觉模型 | ~39 MB | | `cv-multiclass-experiments.csv` | `cv-multiclass` 的实验索引文件 | < 1 MB | | `imagenet-multiclass.h5` | 1000类ImageNet数据集,计算机视觉模型 | ~1.5 GB | | `imagenet-multiclass-experiments.csv` | `imagenet-multiclass` 的实验索引文件 | < 1 MB | --- ## 基准任务概览 | 基准任务 | 任务类型 | 基础模型 | 数据集 | 实验数 | |---|---|---|---|---| | `tabrepo-binary` | 二分类 | 8款经典表格模型 | 104个表格数据集 | 832 | | `tabarena-binary` | 二分类 | 11款先进表格模型 | 30个表格数据集 | 314 | | `cv-binary` | 二分类 | 9款深度计算机视觉模型 | CIFAR-10(动物vs机器)、Breast、Pneumonia | 13 | | `tabrepo-multiclass` | 多分类 | 8款经典表格模型 | 65个表格数据集 | 520 | | `tabarena-multiclass` | 多分类 | 11款现代表格模型 | 8个表格数据集 | 84 | | `cv-multiclass` | 多分类 | 10款深度计算机视觉模型 | CIFAR-10/100、Birds、SVHN、Derma、OCT | 20 | | `imagenet-multiclass` | 大规模多分类 | 8款深度计算机视觉模型 | ImageNet | 8 | ### 基础模型 **TabRepo(经典表格模型)**:CatBoost、ExtraTrees、LightGBM、LinearModel、NeuralNetFastAI、NeuralNetTorch、RandomForest、XGBoost。数据源为[TabRepo](https://github.com/autogluon/tabrepo)仓库的`D244_F3_C1530_200`,针对每组「数据集-模型-折」通过验证误差选择最优超参数配置。 **TabArena(现代表格模型)**:TabPFN-v2.6、TabICLv2、RealTabPFN-v2.5、TabICL_GPU、LimiX_GPU、TabM_GPU、RealMLP_GPU、BetaTabPFN_GPU、ModernNCA_GPU、Mitra_GPU、TabDPT_GPU。所选模型需在[TabArena排行榜](https://huggingface.co/spaces/TabArena/leaderboard)(分类任务、全数据集,截至2026年4月1日)中ELO评分≥1300,数据源为[TabArena](https://github.com/autogluon/tabarena)。 **计算机视觉模型**:ResNet、DenseNet、WideResNet、ViT、BEiT、ConvNeXt、Swin、EVA及其他适配各数据集的模型。模型对数概率源自两个开源集合:[NN_calibration](https://github.com/markus93/NN_calibration/tree/master/logits)与[Beyond Overconfidence](https://zenodo.org/records/15229730)。 --- ## 数据格式 ### HDF5文件 每个`.h5`文件的结构如下: {dataset}/ {model}/ probas_cal float32 (n_cal,) # 二分类任务:正类概率 float32 (n_cal, n_classes) # 多分类任务:各类概率 labels_cal int32 (n_cal,) probas_test float32 (n_test,) # 格式约定与上述一致 labels_test int32 (n_test,) 文件级属性: - `source`:取值为`"tabrepo"`、`"tabarena"`、`"cv"`或`"imagenet"` - `problem_type`:取值为`"binary"`(二分类)或`"multiclass"`(多分类) 所有概率均合法(非负,多分类任务下和为1),标签为从0开始的整数。 ### 实验CSV文件 每个`{benchmark}-experiments.csv`的每一行对应一组「数据集-模型」配对: | 列名 | 描述 | |---|---| | `dataset` | 数据集名称,与HDF5中的组键匹配 | | `model` | 模型名称,与HDF5中的组键匹配 | | `cal_size` | 校准样本数 | | `test_size` | 测试样本数 | | `n_classes` | 类别数,仅多分类基准任务包含该列 | | `tabrepo_fold` / `tabarena_fold` | 所用折索引,仅TabRepo/TabArena基准任务包含该列 | | `tabrepo_config` / `tabarena_config` | 所选最优超参数配置,仅TabRepo/TabArena基准任务包含该列 | --- ## 数据加载 ### Python(使用h5py库) python import h5py import numpy as np with h5py.File("tabrepo-binary.h5", "r") as f: # 列出所有「数据集-模型」配对 pairs = [(ds, mdl) for ds in f for mdl in f[ds]] # 加载单组实验 grp = f["anneal/CatBoost"] p_cal = grp["probas_cal"][:] # 形状:(n_cal,) y_cal = grp["labels_cal"][:] # 形状:(n_cal,) p_test = grp["probas_test"][:] # 形状:(n_test,) y_test = grp["labels_test"][:] # 形状:(n_test,) ### 使用CalArena工具加载 [CalArena仓库](https://github.com/probkit/CalArena)提供了`run_benchmark.py`脚本,可自动加载上述文件并运行所有校准器: bash # 将.h5与.csv文件放置于 calibration_benchmarks/ 目录下 python run_benchmark.py --benchmark tabrepo-binary --- ## 数据集构建 用于生成基准文件的脚本可在[CalArena仓库](https://github.com/probkit/CalArena)中获取。 ### 校准/测试划分 对于TabRepo与TabArena数据集,校准划分对应仓库中的**验证折**,测试划分为**留出测试集**,此举可确保无数据泄露:基础模型在训练阶段从未接触过校准集。 对于计算机视觉数据集,校准与测试划分采用原始数据源提供的固定分区。 ### 排除的数据集 由于上游仓库存在错误,以下数据集被排除: - **TabRepo二分类任务**:MiniBooNE - **TabRepo多分类任务**:jannis、kropt、shuttle --- ## 预期用途 本数据集适用于以下场景: 1. 在多样化分类任务上基准测试事后校准算法 2. 研究模型类型、数据集特征与校准难度之间的关联 3. 开发新的校准方法,可直接使用预计算的概率估计结果 --- ## 许可证 本基准数据集采用**CC BY 4.0**协议发布。下游模型预测源保留其原始许可证;在重新分发前请查阅各自的数据源: - [TabArena](https://github.com/autogluon/tabarena) - [TabRepo](https://github.com/autogluon/tabarena/blob/main/tabrepo.md) - [NN_calibration](https://github.com/markus93/NN_calibration) - [《Beyond Overconfidence》相关数据](https://zenodo.org/records/15229730) 我们衷心感谢原始论文作者允许我们在此重新发布他们的模型预测结果。 --- ## 引用 bibtex @article{calarena2026, title = {CalArena: A Large-Scale Post-Hoc Calibration Benchmark}, author = {Eugène Berta and David Holzmüller and Francis Bach and Michael I. Jordan}, journal = {arXiv preprint arXiv:2605.30188}, year = {2026}, url = {https://arxiv.org/abs/2605.30188}, }





