遇见数据集

Out-of-Distribution Performance Prediction Benchmark (ODP-Bench)

收藏
arXiv2025-10-31 更新2025-11-04 收录
官方服务:

资源简介:

ODP-Bench是一个全面的基准数据集,用于评估模型在未标记的分布外测试数据集上的性能。它包括29个分布外数据集,涵盖了多种分布变化类型,以及10种性能预测算法。该基准数据集提供了1444个预训练模型,方便研究人员进行公平和便捷的比较。此外,该数据集还提供了代码库,方便研究人员添加和测试新提出的算法。

ODP-Bench is a comprehensive benchmark dataset designed to evaluate model performance on unlabeled out-of-distribution (OOD) test datasets. It encompasses 29 OOD datasets covering diverse distribution shift types, alongside 10 performance prediction algorithms. This benchmark provides 1444 pre-trained models, enabling researchers to conduct fair and convenient comparisons. Additionally, it offers a code repository that allows researchers to add and test newly proposed algorithms.

创建时间:
2025-10-31
搜集汇总
数据集介绍
Out-of-Distribution Performance Prediction Benchmark (ODP-Bench) 数据集图片
构建方式
在分布外泛化研究领域,ODP-Bench通过系统整合29个分布外测试数据集构建而成,涵盖合成扰动、图像风格、数据采集过程等多种分布偏移类型。该数据集采用多源架构训练策略,提供1,444个预训练模型作为测试基准,包括从Torchvision直接获取的109个ImageNet模型、基于CIFAR系列训练的228个模型,以及针对WILDS、领域泛化和子群体偏移数据集分别训练的特定架构模型。通过统一采用留一域/组外验证协议,确保评估设置的科学性与一致性。
特点
该数据集最显著的特征在于其覆盖范围的全面性,不仅包含传统合成扰动数据集如CIFAR-10-C和ImageNet-C,还纳入了自然分布偏移场景下的真实数据集。特别值得关注的是,数据集首次系统整合了领域泛化领域的PACS、OfficeHome等六个核心数据集,以及子群体偏移研究中的Waterbirds、CelebA等关键数据集。评估体系采用跨架构模型性能预测的斯皮尔曼秩相关系数作为核心指标,相较于传统同架构评估更具挑战性和实际意义。数据集的另一个突出特点是提供了完整的代码库支持,便于新算法的快速集成与公平比较。
使用方法
研究者可利用该数据集提供的预训练模型库直接测试性能预测算法,无需重复模型训练过程。使用流程包括:首先加载目标分布外测试数据集及对应的预训练模型集合;然后应用性能预测算法计算预测分数或直接估计准确率;最后通过计算预测分数与真实性能之间的秩相关系数评估算法效果。对于需要模型置信度、特征可分性或分布差异等中间信息的算法,数据集提供了完整的预测矩阵和特征提取接口。新算法可通过标准化的代码接口集成到基准测试框架中,确保评估过程的可复现性和结果可比性。
背景与挑战
背景概述
随着深度学习模型在风险敏感场景中的广泛应用,分布外泛化问题日益凸显。清华大学与中国人民大学研究团队于2025年提出ODP-Bench基准,旨在系统评估训练模型在未标注分布外数据上的性能预测能力。该基准整合了29个涵盖合成扰动、自然场景变化等多元分布偏移的数据集,并提供了1,444个预训练模型作为标准化测试平台,为算法公平比较与模型部署可靠性研究奠定了重要基础。
当前挑战
当前性能预测算法在合成扰动数据集上表现良好,但面对自然场景中的复杂分布偏移时效果显著下降,尤其在子群体偏移场景中普遍失效。基准构建过程中需克服三大挑战:一是统一异构数据集的评估协议,消除因模型架构、训练策略差异导致的比较偏差;二是平衡数据集覆盖广度与计算成本,确保29个数据集的标注质量与分布多样性;三是设计跨架构模型的评估指标,解决传统线性相关性指标对异常值敏感的问题。
常用场景
经典使用场景
在分布外泛化研究中,ODP-Bench数据集被广泛应用于评估性能预测算法的鲁棒性。该数据集整合了29个涵盖合成扰动、自然分布偏移等多种场景的测试集,为研究者提供了统一的评估框架。通过分析模型在未标注分布外数据上的表现预测能力,该数据集成为验证算法跨域适应性的重要工具,尤其在处理复杂现实世界偏移时展现出独特价值。
实际应用
在自动驾驶和医疗影像等高风险领域,ODP-Bench通过预测预训练模型在未知环境中的表现,为模型部署提供安全保障。其提供的1444个预训练模型可直接用于评估模型在特定场景的适用性,有效降低实际应用中的性能风险。该基准还能辅助模型选择,确保在分布偏移情况下仍能维持可靠性能。
衍生相关工作
基于该数据集的研究催生了多项重要工作,包括对模型置信度、分布差异和模型一致性等预测方向的深入探索。相关研究揭示了不同预测方法在各类分布偏移下的能力边界,特别是针对子群体偏移中伪相关问题的分析,推动了性能预测理论与实际应用的协同发展。这些工作共同构建了分布外性能预测的方法体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务