遇见数据集

VisAlign

收藏
arXiv2023-10-20 更新2024-07-31 收录
官方服务:

资源简介:

用于测量AI与人类在视觉感知上对齐程度的数据集,包含图像分类任务中的样本,分为三组:必须分类、必须回避和不确定,基于图像中视觉信息的数量和清晰度,进一步分为八个类别。所有样本都有人类感知标签,即使是严重模糊的不确定样本标签也是通过众包获得的。

This dataset is designed to measure the alignment between AI and human visual perception. It contains samples for image classification tasks, divided into three groups: must-classify, must-avoid, and uncertain. Based on the quantity and clarity of visual information in the images, these samples are further categorized into eight classes. All samples have human perception labels; even the labels of severely blurred uncertain samples are obtained via crowdsourcing.

创建时间:
2023-08-03
原始信息汇总

VisAlign 数据集概述

数据集描述

VisAlign 数据集用于测量人工智能与人类在视觉感知中的对齐程度。

数据下载

训练集和开放测试集可以从以下链接下载: VisAlign 数据集下载链接

数据结构

下载并解压文件后,将包含以下文件和目录:

  • open_test_corruption_labels.pk
  • open_test_set/
  • train_files/
  • train_split_filenames/
    • final_eval/
    • final_train/

配置文件路径

config/imagenet.yaml 文件中,替换以下路径: yaml dataset: train: label_path: {path to train_split_filenames/final_train} imagenet21k_path: {path to train_files} eval: label_path: {path to train_split_filenames/final_eval} imagenet21k_path: {path to train_files}

训练模型

可以使用以下命令训练基线模型: bash python main.py --config {config} # 配置文件路径 --seed {seed} # 环境种子 --early_stopping # 激活早停 --early_stopping_patience {early_stopping_patience} # 早停的 epoch 数 --save_dir {save_dir} # 保存检查点的路径 --n_epochs {n_epochs} # epoch 数 --save_top_k {save_top_k} # 保存的模型检查点数量 --reload_ckpt_dir {reload_ckpt_dir} # 继续未完成的会话 --n_gpus {n_gpus} # 使用的 GPU 数量 --model_name {model_name} # 模型名称 --batch_size {batch_size} # 批次大小 --ssl # 自监督训练选项 --ssl_type {ssl_type} # 自监督学习方法 --cont_ssl # 微调 SSL 训练模型选项 --ssl_ckpt_dir {ssl_ckpt_dir} # 保存的 SSL 训练模型检查点路径

模型架构和大小

  • ViT: vit_30_16
  • Swin Transformer: swin_extra
  • ConvNeXt: convnext_extra
  • DenseNet: densenet_extra
  • MLP-Mixer: mlp

自监督学习方法

  • SimCLR: simclr
  • BYOL: byol
  • DINO: dino

评估模型

可以使用以下命令评估拒绝函数: bash python test_main.py --save_dir {save_dir} # 保存拒绝函数结果的目录 --ckpt_dir {ckpt_dir} # 模型检查点存在的目录 --model_name {model_name} # 要评估的模型名称 --postprocessor_name {abstention_function} # 后处理器名称 --test_dataset_path {test_dataset_path} # 开放测试集路径 --train_dataset_path {train_dataset_path} # 训练集路径,用于计算距离 --seed {seed} # 训练时使用的种子

拒绝函数选项

  • knn
  • mcdropout
  • mds
  • odin
  • msp
  • tapudd

引用

@article{lee2024visalign, title={VisAlign: Dataset for Measuring the Alignment between AI and Humans in Visual Perception}, author={Lee, Jiyoung and Kim, Seungho and Won, Seunghyun and Lee, Joonseok and Ghassemi, Marzyeh and Thorne, James and Choi, Jaeseok and Kwon, O-Kil and Choi, Edward}, journal={Advances in Neural Information Processing Systems}, volume={36}, year={2024} }

搜集汇总
数据集介绍
构建方式
VisAlign数据集的构建基于对AI与人类视觉感知对齐度的量化需求,聚焦于图像分类这一基础任务。数据集包含三类样本:Must-Act(必须分类)、Must-Abstain(必须弃权)和Uncertain(不确定),并进一步细分为八个类别,以覆盖真实世界中可能出现的多样化场景。所有样本均经过人工审核以确保仅包含单一对象,避免背景干扰。Must-Act和Must-Abstain样本的标签通过专家验证获得,而Uncertain样本的黄金人类标签则通过众包方式收集,每张图像由134名标注者参与,以确保统计误差在5%以内。数据集构建严格遵循抽样理论、调查设计统计方法及专家咨询,共包含900个测试样本。
使用方法
VisAlign数据集作为通用基准,可用于评估任意图像分类模型的视觉对齐度和可靠性。使用时,研究者需在自有训练集上训练模型,并在开放测试集上评测。对齐度量采用基于Hellinger距离的指标,比较模型输出分布与人类标签分布在11个类别上的差异,避免阈值依赖和单一类别偏差。可靠性评分则通过引入弃权机制,对Must-Act和Must-Abstain样本分别计分,并允许调整错误预测的成本参数c。此外,数据集提供开放测试集供开发者直接评估,封闭测试集则需提交模型以供验证,确保评测的公正性和全面性。
背景与挑战
背景概述
在人工智能安全领域,模型与人类意图的契合度(即AI对齐)是部署前的核心考量。现有对齐研究多聚焦于社会伦理议题,如偏见与公平性,而对视觉感知这一基础认知维度的对齐度量尚存空白。为此,韩国科学技术院(KAIST)联合首尔大学、麻省理工学院等机构的研究人员于2023年提出了VisAlign数据集,旨在量化评估AI模型与人类在图像分类任务中的视觉感知对齐程度。该数据集通过构建涵盖清晰可识别、必须弃权及不确定三大类共八种细分的真实世界场景,并引入统计抽样理论确保标注可靠性,为衡量模型在复杂视觉环境下的行为一致性提供了标准化基准。VisAlign的诞生填补了现有鲁棒性与分布外检测数据集缺乏人类金标准标签的缺陷,对推动AI安全评估从伦理层面向感知层面延伸具有里程碑意义。
当前挑战
VisAlign所解决的领域问题核心在于:现有图像分类模型在面对噪声、伪影或虚假相关性时,往往做出与人类直觉相悖的过度自信预测,而人类在信息不充分时则会合理弃权。构建该数据集面临双重挑战。其一,如何定义并覆盖视觉感知对齐的多样性场景,要求数据集必须包含清晰可辨的Must-Act样本、明确应弃权的Must-Abstain样本,以及介于两者之间、人类判断存在分歧的Uncertain样本——后者需通过众包获取每人134次标注以达成5%误差范围内的统计稳健性。其二,在数据构建过程中,需严格遵循调查设计统计理论(如Cronbach's alpha确保样本量有效性、Fleiss' Kappa评估标注一致性),并借助生物学分类学确保类别定义的清晰无歧义,避免因类间模糊性引入噪声。此外,生成非真实感图像(如风格化或组合物种)时需依赖扩散模型合成,并人工筛选确保每张图像仅含单一主体,这些步骤均显著增加了数据构建的复杂度与成本。
常用场景
经典使用场景
VisAlign作为衡量AI与人类视觉感知对齐程度的数据集,在计算机视觉领域扮演着基准测试的关键角色。其核心应用场景在于评估图像分类模型在面对多样化真实世界情境时的表现,涵盖清晰可辨的必分类图像、人类会选择弃权的必弃权图像,以及因裁剪或损坏而导致认知模糊的不确定图像。通过这三类共八个子类别的精心设计,VisAlign能够系统性地检验模型是否具备与人类相似的视觉判断能力,尤其是在处理背景异常、对抗扰动、类间混淆及风格迁移等复杂情况时,为视觉感知对齐研究提供了标准化的评估框架。
解决学术问题
该数据集解决了当前学术研究中一个关键但未被充分探索的问题:如何定量衡量AI模型与人类在视觉感知上的对齐程度。现有工作多聚焦于模型在特定鲁棒性或分布外检测任务上的表现,却忽视了人类在视觉识别中会自然展现的弃权行为与不确定性判断。VisAlign首次将必分类、必弃权与不确定三类情境统一纳入评估体系,并通过统计抽样理论确保人类标注的可靠性,从而揭示了现有模型与人类感知之间存在的显著差距。这一工作不仅为AI安全研究提供了新的代理指标,更推动了视觉感知领域从单一精度评估向多维度对齐评估的范式转变。
实际应用
在实际应用层面,VisAlign为视觉AI系统的安全部署提供了至关重要的检验工具。例如,在自动驾驶场景中,模型需能准确识别道路上的动物(如斑马、大象),同时在面对模糊、裁剪或非真实感图像时做出弃权判断以避免误判。在医疗影像分析中,面对因拍摄条件不佳而导致的不确定图像,模型若能像放射科医生一样谨慎决策,将显著降低误诊风险。此外,在安防监控与内容审核领域,VisAlign所涵盖的背景混淆、风格迁移及跨类合成等情境,可用于检验模型是否能在复杂环境中保持与人类一致的判断力,从而提升系统的可信赖度与安全性。
数据集最近研究
最新研究方向
在人工智能安全日益受到关注的背景下,AI对齐(AI Alignment)已成为确保模型行为符合人类意图与伦理准则的核心议题。VisAlign数据集聚焦于视觉感知领域的对齐问题,开创性地提出了一个量化评估AI与人类视觉感知一致性的基准。该数据集不仅涵盖了传统的清晰可分类图像(Must-Act)和明确应弃权的图像(Must-Abstain),更创新性地引入了“不确定”(Uncertain)类别,通过众包获取人类标注的软标签,以反映真实世界中视觉信息连续变化时的认知不确定性。当前前沿研究利用VisAlign对多种主流视觉模型及弃权策略进行基准测试,揭示了现有模型在应对模糊、损坏或混淆样本时的显著不足,证明鲁棒性与OOD检测方法无法直接迁移至视觉对齐任务。这一发现强调了开发新型视觉对齐方法的迫切性,为构建更安全、更可靠的AI系统提供了关键评估工具与研究方向。
相关研究论文
  • 1
    VisAlign: Dataset for Measuring the Degree of Alignment between AI and Humans in Visual Perception · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务