BERT 情感分类解释可靠性数据
收藏国家基础学科公共科学数据中心2026-03-21 收录
官方服务:
资源简介:
本数据集旨在评估基于Bert架构的情感分类模型在SST-2数据集上的解释可靠性。数据集的构建基于“与或交互”可解释性理论,通过计算模型输出中无法由显著交互解释的分量比例(即不可解释分量ρ),来量化解释的忠实度。我们选取了在SST-2数据集上微调好的Bert-base-uncased模型,并从其测试集中随机选取了20个句子作为测试样本(覆盖正面与负面情感类别,句子长度大于20个字符)。为了确保结果的稳定性,我们进行了三组不同随机种子的独立实验。每个样本的数据均包含通过“与或交互”算法计算得到的“与”交互效用值、“或”交互效用值以及所有遮挡情况下模型对目标类别的分类置信度。通过本数据集,用户可以复现我们提出的解释可靠性指标(ρ<0.1视为通过测试),为可解释人工智能领域中自然语言处理模型的解释方法比较与评估提供了标准化的基础数据资源。
提供机构:
上海交通大学搜集汇总
数据集介绍

背景与挑战
背景概述
本数据集基于“与或交互”可解释性理论,提供在SST-2数据集上微调的BERT-base-uncased模型对20个测试句子的解释可靠性评估数据。通过计算不可解释分量比例(ρ)量化解释忠实度,包含多组随机种子的“与”交互、“或”交互效用值及分类置信度,为自然语言处理模型的可解释性研究提供标准化基准。
以上内容由遇见数据集搜集并总结生成



