遇见数据集

人类注意力基准

收藏
arXiv2020-06-29 更新2024-06-21 收录
官方服务:

资源简介:

人类注意力基准是由德克萨斯A&M大学和佛罗里达大学合作创建的一个多领域数据集,旨在通过收集多个注释者的注意力掩码来评估机器学习模型的解释性。该数据集包含图像和文本两个领域,总计约1500个样本,涵盖了PASCAL VOC 2012、ILSVRC 2014、20 Newsgroup和IMDB 50K等多个数据集。创建过程中,研究者通过亚马逊Mechanical Turk平台招募了至少1000次批准任务的注释者,确保了数据的高质量和多样性。该数据集主要用于机器学习解释性的定量评估,特别是模型解释的完整性和正确性,以解决模型透明度和用户信任的问题。

Human Attention Benchmark is a multi-domain dataset co-created by Texas A&M University and the University of Florida, which aims to evaluate the interpretability of machine learning models by collecting attention masks from multiple annotators. The dataset covers two domains, image and text, with approximately 1,500 total samples, including multiple benchmark datasets such as PASCAL VOC 2012, ILSVRC 2014, 20 Newsgroups, and IMDB 50K. During the dataset construction, researchers recruited annotators who had completed at least 1,000 approved tasks via the Amazon Mechanical Turk platform to ensure high data quality and diversity. This dataset is primarily used for the quantitative evaluation of machine learning interpretability, particularly the completeness and correctness of model explanations, to address issues related to model transparency and user trust.

提供机构:
德克萨斯A&M大学
创建时间:
2018-01-16
搜集汇总
数据集介绍
人类注意力基准 数据集图片
构建方式
在可解释机器学习领域,模型解释的评估长期面临客观性与主观性之间的权衡。为弥合这一鸿沟,研究者提出了一种基于人类注意力机制的多层基准数据集。该数据集涵盖图像与文本两大领域,分别从PASCAL VOC 2012、ImageNet、20 Newsgroup及IMDB 50K等经典数据集中精选样本。针对每个样本,研究团队通过Amazon Mechanical Turk平台招募十名独立标注者,要求其使用套索工具或文本选择方式,标记出与目标类别最相关的图像区域或文本短语。所有标注结果经聚合后形成多层注意力掩码,相较于传统的单层分割掩码,该基准更精细地反映了人类对特征的关注程度。此外,图像领域的数据还结合了精确的目标分割掩码,以消除标注者手部抖动等噪声干扰,确保基准的准确性与泛化能力。
特点
该基准的核心特点在于其多层注意力掩码的设计,突破了传统单层分割掩码的局限性。在图像数据中,标注者倾向于选择面部等具有判别性的特征,而非均匀覆盖整个目标物体,这使得掩码权重呈非均匀分布,更贴近人类真实的视觉注意力模式。在文本数据中,标注者则聚焦于与情感或主题高度相关的词语,从而生成带有注意力分数的索引-词对。这种多层结构不仅支持阈值无关的评估指标(如平均绝对误差),避免了传统IoU方法中阈值选择的困扰,还能同时评估解释的完整性(假阴性错误)与正确性(假阳性错误)。实验表明,该基准与人类主观评分呈中等强度相关,且能揭示用户在评分中存在的偏差,例如对假阳性错误关注不足,而对假阴性错误更为敏感。
使用方法
该数据集为量化评估模型显著性解释提供了标准化工具。使用者可基于像素级或词级的平均绝对误差,计算模型生成的显著性图与人类注意力掩码之间的差异,从而获得客观、可复现的评估分数。具体而言,研究者无需对显著性图进行二值化处理,可直接保留其原始分数信息,以进行细粒度的误差分析。该基准支持跨领域应用,既可用于图像分类中的Grad-CAM、LIME等解释方法的比较,也可用于文本分类中注意力机制的验证。此外,通过对比人类注意力基准与分割掩码基准的评估结果,研究者能够识别出模型解释中存在的用户偏见,进而优化解释的呈现方式。该基准已公开在GitHub上,供学术界免费使用,旨在推动可解释人工智能评估方法的标准化与可复现性。
背景与挑战
背景概述
在可解释人工智能(XAI)领域,如何定量评估机器学习模型解释的可靠性始终是核心难题。2020年,Sina Mohseni等来自德州农工大学与佛罗里达大学的研究团队,针对这一困境提出了人类注意力基准(Human Attention Benchmark)。该数据集基于PASCAL VOC 2012、ImageNet子集及20 Newsgroup、IMDB等文本语料,通过招募多位众包标注员对图像与文本中与目标类别最相关的区域进行精细标注,生成多层人类注意力掩码。其核心研究问题在于弥合客观标注基线与主观人类判断之间的鸿沟,为模型显著图解释提供可复现、可量化的评估标准。该基准的提出显著推动了XAI评估方法学的发展,为后续研究在解释正确性与完整性度量上奠定了重要基础。
当前挑战
该数据集面临的核心挑战源于多维度评估目标的冲突。首先,领域问题层面,现有单层分割掩码无法区分特征的重要性梯度,导致模型显著图评估粒度不足;而人类主观评分又易受视觉偏好与认知偏误影响,难以保证客观性与可复现性。其次,构建过程中,需平衡多层注意力掩码的标注成本与数据质量——每张样本需10位独立标注员参与,虽提升了泛化性,但显著增加了资源开销。此外,如何统一不同标注员对“显著特征”的认知标准,以及如何消除漏报与误报两类解释错误在主观评价中的系统性偏差,仍是制约基准广泛应用的瓶颈。
常用场景
经典使用场景
在可解释人工智能(XAI)的蓬勃发展中,模型解释的可靠性评估成为核心挑战。人类注意力基准(Human Attention Benchmark)为图像与文本领域的显著性图解释提供了基于多层人类注意力掩码的定量评估框架。其经典使用场景在于,通过聚合多位标注者对图像中目标对象或文本中关键短语的注意力标注,生成细粒度的注意力热图,从而替代传统的单层分割掩码或主观评分,实现对模型解释(如Grad-CAM、LIME生成的显著性图)的客观、可复现的量化评价。该基准尤其适用于对比不同解释技术对同一模型输出的忠实度,为研究者提供了一种兼顾人类认知特性与计算效率的评估工具。
实际应用
在实际应用中,该基准为高可靠性需求场景下的AI系统部署提供了关键支撑。例如,在医疗影像诊断中,模型需解释其关注哪些解剖区域以辅助医生决策,人类注意力基准可量化解释热图与临床专家关注区域的一致性,从而筛选出更可信的解释方法。在金融风控领域,文本分类模型的解释需突出关键条款或异常词汇,该基准通过对比人类标注的注意力分布,能够有效识别生成误导性解释的模型,防止用户因虚假解释而误信错误预测。此外,在人机协作系统中,该基准可迭代优化解释质量,降低因模型解释不完整或偏差导致的操作风险,显著提升用户对AI系统的信任与接纳度。
衍生相关工作
该数据集的提出催生了一系列后续研究。例如,Choe等人(2020)在其弱监督定位评估协议中借鉴了阈值无关的度量思想,但未引入人类注意力权重;而Das等人(2017)的VQA-HAT基准虽关注人类注意力,却局限于视觉问答领域且未实现多层标注聚合。在此基础上,后续工作进一步探索了如何利用人类注意力基准优化模型训练,如通过注意力蒸馏引导模型聚焦于人类关注的区域,从而提升解释质量与预测理性。此外,该基准的跨域设计(图像与文本)启发了多模态解释评估框架的构建,推动了从单层标注向多层、多视角标注的演进,为理解人类与机器注意力之间的认知差异开辟了新方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务