super-anonymous-researcher/CalArena
收藏资源简介:
CalArena是一个大规模基准数据集,用于评估分类模型的后验校准方法。它覆盖了表格和计算机视觉领域的7个基准测试,涵盖数百个(数据集,模型)对以及三种问题类型(二元分类、多元分类和大规模多元分类)。每个基准条目是一个`(p_cal, y_cal, p_test, y_test)`元组,表示一个(数据集,模型)对的校准分割和测试分割的预测概率与真实标签。校准方法在校准分割上拟合,并在测试分割上评估。该数据集是CalArena代码仓库的数据伴侣。
许可证:CC BY 4.0 标签: - 校准(calibration) - 事后校准(post-hoc calibration) - 不确定性量化(uncertainty quantification) - 基准测试(benchmark) - 表格型数据(tabular) - 计算机视觉(computer vision) 样本量范围:1M<n<10M # CalArena — 校准基准数据集 CalArena是一款用于评估分类模型事后校准(post-hoc calibration)方法的大规模基准测试(benchmark)集。它覆盖了表格型数据(tabular)与计算机视觉(computer vision)领域的**7个基准测试**,涵盖数百组「数据集-模型」对,以及三类任务(二分类、多分类与大规模多分类)。 该基准测试中的每个条目均为`(p_cal, y_cal, p_test, y_test)`元组——即单一组「数据集-模型」对的校准集与测试集的预测概率及真实标签。校准方法在校准集上拟合,并在测试集上完成评估。本数据集是[CalArena代码仓库](https://github.com/super-anonymous-researcher/CalArena)的数据配套资源。 ## 文件 | 文件名 | 描述 | 大小 | |---|---|---| | `Licenses.zip` | 用于构建基准测试的各数据源的许可文件 | < 1 MB | | `tabrepo-binary.h5` | 二分类任务,经典表格型模型 | ~36 MB | | `tabrepo-binary-experiments.csv` | `tabrepo-binary` 的实验索引文件 | < 1 MB | | `tabarena-binary.h5` | 二分类任务,现代表格型基础模型 | ~26 MB | | `tabarena-binary-experiments.csv` | `tabarena-binary` 的实验索引文件 | < 1 MB | | `cv-binary.h5` | 二分类任务,计算机视觉模型 | < 1 MB | | `cv-binary-experiments.csv` | `cv-binary` 的实验索引文件 | < 1 MB | | `tabrepo-multiclass.h5` | 多分类任务,经典表格型模型 | ~115 MB | | `tabrepo-multiclass-experiments.csv` | `tabrepo-multiclass` 的实验索引文件 | < 1 MB | | `tabarena-multiclass.h5` | 多分类任务,现代表格型基础模型 | ~11 MB | | `tabarena-multiclass-experiments.csv` | `tabarena-multiclass` 的实验索引文件 | < 1 MB | | `cv-multiclass.h5` | 多分类任务,计算机视觉模型 | ~39 MB | | `cv-multiclass-experiments.csv` | `cv-multiclass` 的实验索引文件 | < 1 MB | | `imagenet-multiclass.h5` | 1000类ImageNet数据集,计算机视觉模型 | ~1.5 GB | | `imagenet-multiclass-experiments.csv` | `imagenet-multiclass` 的实验索引文件 | < 1 MB | ## 基准测试概览 | 基准测试名称 | 任务类型 | 基础模型数量 | 数据集数量 | 实验数量 | |---|---|---|---|---| | `tabrepo-binary` | 二分类 | 8 | 104个表格型数据集 | 832 | | `tabarena-binary` | 二分类 | 11 | 30个表格型数据集 | 314 | | `cv-binary` | 二分类 | 9 | 3个(CIFAR-10†、Breast、Pneumonia) | 13 | | `tabrepo-multiclass` | 多分类 | 8 | 65个表格型数据集 | 520 | | `tabarena-multiclass` | 多分类 | 11 | 8个表格型数据集 | 84 | | `cv-multiclass` | 多分类 | 10 | 6个(CIFAR-10、CIFAR-100、Birds、SVHN、Derma、OCT) | 20 | | `imagenet-multiclass` | 大规模多分类 | 8 | 1个(ImageNet) | 8 | † CIFAR-10通过对类别组进行边缘化处理,被转换为二分类任务(动物vs非动物)。 ### 基础模型 **TabRepo(经典表格型模型)**:CatBoost、ExtraTrees、LightGBM、LinearModel、NeuralNetFastAI、NeuralNetTorch、RandomForest、XGBoost。数据来源:[TabRepo](https://github.com/autogluon/tabrepo) 仓库的 `D244_F3_C1530_200`。基于验证误差,为每组「数据集-模型-折」选择最优超参数配置。 **TabArena(现代表格型模型)**:TabPFN-v2.6、TabICLv2、RealTabPFN-v2.5、TabICL_GPU、LimiX_GPU、TabM_GPU、RealMLP_GPU、BetaTabPFN_GPU、ModernNCA_GPU、Mitra_GPU、TabDPT_GPU。所选模型在[TabArena排行榜](https://huggingface.co/spaces/TabArena/leaderboard)(分类任务、全数据集,截至2026年4月1日)上的ELO评分≥1300。数据来源:[TabArena](https://github.com/autogluon/tabarena)。 **计算机视觉模型**:ResNet、DenseNet、WideResNet、ViT、BEiT、ConvNeXt、Swin、EVA及其他适配各数据集的模型。模型预测对数几率(logits)来源于两个数据集:[NN_calibration](https://github.com/markus93/NN_calibration/tree/master/logits) 与 [Beyond Overconfidence](https://zenodo.org/records/15229730)。 ## 数据格式 ### HDF5文件 每个`.h5`文件的结构如下: {dataset}/ {model}/ probas_cal float32 (n_cal,) # 二分类任务:正类预测概率 float32 (n_cal, n_classes) # 多分类任务:各类别预测概率 labels_cal int32 (n_cal,) probas_test float32 (n_test,) # 与上述格式一致 labels_test int32 (n_test,) 文件级属性: - `source` — 取值为 `"tabrepo"`、`"tabarena"`、`"cv"` 或 `"imagenet"` - `problem_type` — 取值为 `"binary"`(二分类)或 `"multiclass"`(多分类) 所有预测概率均合法(非负,多分类任务下和为1)。标签为从0开始的整数。 ### 实验CSV文件 每个`{benchmark}-experiments.csv`为每组「数据集-模型」对对应一行: | 列名 | 描述 | |---|---| | `dataset` | 数据集名称(与HDF5中的组键一致) | | `model` | 模型名称(与HDF5中的组键一致) | | `cal_size` | 校准集样本数 | | `test_size` | 测试集样本数 | | `n_classes` | 类别数(仅多分类基准测试包含该列) | | `tabrepo_fold` / `tabarena_fold` | 所用折的索引(仅TabRepo/TabArena基准测试包含) | | `tabrepo_config` / `tabarena_config` | 所选最优超参数配置(仅TabRepo/TabArena基准测试包含) | ## 数据加载 ### Python(h5py) python import h5py import numpy as np with h5py.File("tabrepo-binary.h5", "r") as f: # 列出所有「数据集-模型」对 pairs = [(ds, mdl) for ds in f for mdl in f[ds]] # 加载单组实验 grp = f["anneal/CatBoost"] p_cal = grp["probas_cal"][:] # 形状为 (n_cal,) y_cal = grp["labels_cal"][:] # 形状为 (n_cal,) p_test = grp["probas_test"][:] # 形状为 (n_test,) y_test = grp["labels_test"][:] # 形状为 (n_test,) ### 使用CalArena运行工具 [CalArena仓库](https://github.com/super-anonymous-researcher/CalArena) 提供了`run_benchmark.py`,可自动加载这些文件并运行所有校准器: bash # 将 .h5 和 .csv 文件放置于 calibration_benchmarks/ 目录下 python run_benchmark.py --benchmark tabrepo-binary ## 数据集构建 用于生成基准测试文件的脚本可在[CalArena仓库](https://github.com/super-anonymous-researcher/CalArena)中找到。 ### 校准集/测试集划分 对于TabRepo与TabArena,校准集对应对应仓库的**验证折**,测试集为**预留测试集(held-out test set)**。这确保了无数据泄露(data leakage):基础模型在训练过程中从未接触过校准集。 对于计算机视觉数据集,校准集与测试集为原始数据源提供的固定划分。 ### 排除的数据集 由于上游仓库存在错误,以下数据集被排除: - **TabRepo二分类**:MiniBooNE - **TabRepo多分类**:jannis、kropt、shuttle ## 预期用途 本数据集适用于: - 在多样化分类任务上基准测试事后校准(post-hoc calibration)算法 - 研究模型类型、数据集特征与校准难度之间的关系 - 开发新的校准方法(可直接使用预计算的预测概率) ## 许可协议 本基准测试数据采用**CC BY 4.0**协议发布。下游模型预测源保留其原始许可;重新分发前请查阅各自的来源: - [TabArena](https://github.com/autogluon/tabarena) - [TabRepo](https://github.com/autogluon/tabarena/blob/main/tabrepo.md) - [NN_calibration](https://github.com/markus93/NN_calibration) - [《Beyond Overconfidence》相关数据](https://zenodo.org/records/15229730) 我们衷心感谢原始论文作者允许我们在此重发布其模型预测结果。 ## 引用 bibtex @inproceedings{calarena2025, title = {CalArena: A Large-Scale Benchmark for Post-Hoc Calibration}, author = {...}, booktitle = {...}, year = {2025}, }




