MM-SAP数据集
收藏国家基础学科公共科学数据中心2026-06-03 收录
官方服务:
资源简介:
MM-SAP是一个专门用于评估多模态大语言模型在视觉感知任务中自我意识能力的综合基准数据集。该数据集旨在解决当前多模态模型容易产生幻觉的问题,即模型无法正确识别自己能否回答某个问题。MM-SAP数据集包含三个主要子数据集,分别对应“知识象限”中的不同认知状态,总计涵盖19个细分子任务:BasicVisQA(基础视觉问答):评估模型对基础视觉信息(如颜色、形状、数量)的感知能力,对应“已知”范畴;KnowVisQA(知识型视觉问答):评估模型结合图像信息与外部知识(如名人、地标、品牌)进行回答的能力,对应模型知识边界上的“已知或未知”;BeyondVisQA(超视觉问答):评估模型在面对无法仅凭图像回答的问题(如被遮挡的物体细节、图像拍摄者的意图等)时,能否正确拒绝回答,对应“未知”范畴。数据主要包含图像文件和对应的问答文本(问题、选项、答案),每个样本都特别设计了“拒绝回答”的选项,以测试模型的自我认知水平。
提供机构:
上海交通大学


