遇见数据集

SABRE-Prior

收藏
arXiv2026-08-08 更新2026-08-11 收录
数据链接:
官方服务:

资源简介:

SABRE-Prior是由芝加哥大学、丰田工业大学芝加哥分校和石溪大学联合构建的视觉语言模型压力测试数据集,旨在评估模型在视觉证据与先验知识冲突时的表现。该数据集包含600张精心生成的图像和1000个问答对,覆盖上下文、纹理、属性和语言诱导四个子集,每个子集均通过反事实或非常规场景设计来挑战模型对视觉信息的依赖。数据集创建采用SABRE流水线,从任务设计规范出发,经图像生成、编辑、自动化筛选及人工验证,确保样例的有效性和难度。该数据集主要应用于VLM鲁棒性评估,揭示模型在对抗先验偏差时的系统性缺陷,为模型改进提供方向。

SABRE-Prior is a visual-language model (VLM) stress-test dataset jointly developed by the University of Chicago, Toyota Technological Institute at Chicago, and Stony Brook University. It is designed to evaluate model performance in scenarios where visual evidence conflicts with prior knowledge. This dataset comprises 600 meticulously generated images and 1,000 question-answer pairs, spanning four subsets: context, texture, attribute, and language-induced. Each subset adopts counterfactual or unconventional scene designs to challenge the model's reliance on visual information. The dataset is constructed via the SABRE pipeline: starting from task design specifications, it undergoes image generation, editing, automated filtering, and manual validation to ensure the validity and difficulty of the samples. Primarily applied to VLM robustness evaluation, this dataset reveals the systematic flaws of models when confronting prior biases, providing guidance for subsequent model improvement.

创建时间:
2026-08-08
原始信息汇总

SABRE:可扩展自动化VLM压力测试数据集构建平台

数据集概述

SABRE(Scalable and Automated Benchmarking of VLMs under Stress)是一个可扩展、自动化的视觉语言模型(VLM)压力测试基准数据集构建流水线。该流水线将测试设计(Test Primer)转化为结构化规范、生成或编辑的图像以及问答对,通过自动化过滤与人工审核相结合的方式,构建能够有效考验VLM视觉证据遵循能力的高质量测试数据。

数据集核心构成

构建流程

  1. Test Primer输入:以Markdown任务设计与数据模式作为输入
  2. 编译与构建:通过智能体编译器生成结构化样本规范,包含问答构建、图像生成与编辑
  3. 压力候选集:生成带有受控视觉变化和固定参考答案的证据约束问答对
  4. 过滤与验证:使用过滤VLM自动筛除可解的简单样本,保留困难样本;随后进行人工审核(验证视觉证据、标注问答与区域、局部图像修复)

数据规模与类别

SABRE-Prior包含600张图像和1,000个问题,涵盖四类压力测试:

类别 测试内容
Context(上下文) 熟悉场景中出现意外实体
Texture(纹理) 反事实材质
Attribute(属性) 非规范组件计数
Language Elicitation(语言诱导) 由语言提示但图像不支持的回答

此外,工作流还支持Counting(计数)和Spatial(空间关系)等其他压力测试场景的扩展。

模型性能表现

在SABRE-Prior数据集上对六个VLM进行了评估,宏平均准确率范围为17.8%至31.3%(均值22.6%)。具体结果如下:

排名 模型 Context Texture Attribute Language 宏平均
1 Claude 4.6 10 40 17 58 31.3
2 Kimi-k2.6 7 52 17 17 23.3
3 Qwen 3.5 3 46 14 29 23.0
4 Gemini 3.5 0 52 26 11 22.3
5 GPT-5.4 1 28 20 23 18.0
6 Grok-4.3 4 28 16 23 17.8

整体而言,各模型在压力测试下表现普遍偏低,凸显了当前VLM在依赖世界先验而非视觉证据方面存在的显著弱点。

工具与资源

  • 本地图像修复演示:支持在浏览器端进行实体移除与实体交换操作,图像不会上传至服务器
  • 代码可用性:提供面向非商业研究的代码
  • 论文:可于arXiv(编号:2608.07435)获取
搜集汇总
数据集介绍
SABRE-Prior 数据集图片
构建方式
SABRE-Prior依托SABRE自动化流水线构建,由基准设计者提供以Markdown编写的任务设计及数据模式作为测试蓝图,大型语言模型据此生成结构化的样本规范,涵盖图像生成与编辑提示、问题及参考答案。随后利用FLUX.2、Gemini 3.1 Flash Image等生成或编辑图像,并构建对应的问答对。候选样本经由过滤型视觉语言模型(Gemini 3.5 Flash)进行压力筛选,仅保留被其回答错误的样本,再通过人工审核平台验证有效性,必要时进行局部图像修复,最终形成包含400个案例、600张图像及1000个问答样本的基准。
特点
SABRE-Prior聚焦于视觉证据与世界先验之间的冲突,包含四个互补子集:上下文、纹理、属性和语言诱发,分别考察意外物体、反事实材质、非规范组件数量及语言暗示不支持答案的情境。该基准采用多种问题格式,包括成对图像的四项是/否探针、开放式计数和四选一选择题。六种前沿视觉语言模型在宏平均准确率上仅达到17.8%至31.3%,显著低于现有基准,揭示出模型在依赖视觉证据而非先验知识方面的系统性缺陷。
使用方法
SABRE-Prior可用于评估视觉语言模型在压力条件下的鲁棒性,尤其检测其是否过度依赖世界先验。使用时需遵循各子集的专属评估协议:上下文和纹理子集采用严格的全对标准,属性和语言诱发子集分别采用归一化精确匹配和选择题准确率。研究者可直接利用该基准对比不同模型的性能,或评估针对视觉增强的干预措施(如视觉对比解码、标记提示)的效果。此外,其模块化设计允许通过更换测试蓝图和过滤模型来生成新的压力测试,以适应不断演进的模型能力。
背景与挑战
背景概述
SABRE-Prior 数据集由芝加哥大学、丰田工业大学芝加哥分校及石溪大学的研究人员于2026年联合构建,旨在系统评估视觉语言模型(VLM)在面对视觉证据与世界先验冲突时的表现。该数据集源于对现有基准测试在压力测试场景下扩展性不足的深刻洞察,其核心研究问题在于:能否通过自动化流水线快速生成可靠且具有挑战性的压力测试,以揭示VLM在遵循视觉证据而非依赖习得先验方面的缺陷。SABRE-Prior包含600张图像和1000个问题,涵盖上下文、纹理、属性及语言诱导四个子集,全面探测模型在非典型场景下的视觉接地能力。其对六种前沿VLM的评测结果显示平均准确率仅22.6%,显著低于现有基准,凸显了其在暴露模型盲点方面的独特价值,为VLM评估领域提供了可扩展且可更新的基准构建范式。
当前挑战
SABRE-Prior所面临的挑战主要体现在领域问题与构建过程两个层面。在领域层面,其核心挑战在于如何设计能够有效区分视觉证据与世界先验冲突的测试样例,当前模型在上下文子集上的平均准确率仅4.2%,表明模型难以在编辑后的图像中一致识别反事实对象,而在语言诱导子集上模型的性能差异巨大(11%-58%),反映出模型在证据不足时拒绝合理猜测的能力参差不齐。在构建层面,挑战在于确保生成或编辑的图像严格符合规格要求,避免生成器遗漏对象、误改无关区域或产生错误计数,同时保持任务的答案性;此外,自动化过滤虽能筛选出模型易错的样本,但无法保证其有效性,必须辅以人工验证和局部图像修复,以平衡可扩展性与数据质量,这一过程在成本控制与效率提升上构成显著挑战。
常用场景
经典使用场景
SABRE-Prior数据集作为视觉语言模型(VLM)压力测试的基准,其经典使用场景在于系统性地评估模型在视觉证据与先验知识发生冲突时的表现。该数据集精心构建了四种对抗性情境:将出人意料的实体置于熟悉场景中(Context)、以反事实材质呈现日常物品(Texture)、更改物体的非标准部件数量(Attribute)、以及通过问题措辞诱使模型给出图像不支持的回答(Language Elicitation)。研究者借助这一基准,可以精准剖析VLM在依赖视觉证据而非固化的世界常识方面的薄弱环节,从而为模型诊断提供了精细化的探针。
解决学术问题
该数据集直面当前VLM评估基准趋于饱和、难以揭示模型深层缺陷的困境。传统基准多依赖真实图像收集与人工标注,构建成本高昂且难以扩展至压力测试所需的异常与反常识场景。SABRE-Prior通过自动化生成与编辑流程,结合模型在环的困难筛选与人工验证,有效解决了压力测试样本构建的规模化与有效性问题。它使得研究者能够快速、可靠地生成针对特定先验依赖缺陷的测试用例,填补了现有评估体系在检测模型‘以视觉为准’能力上的空白,为VLM的鲁棒性研究提供了关键的工具支撑。
衍生相关工作
SABRE-Prior的发布催生了一系列后续研究方向。一方面,它促进了针对先验依赖问题的专用缓解方法的发展,如视觉对比解码(VCD)和Set-of-Mark(SoM)等推理期干预技术在此基准上的效果验证,揭示了简单视觉增强手段难以根除该缺陷,从而推动了更复杂的因果视觉推理方法的探索。另一方面,其模块化的构建范式,即通过‘测试原语’快速生成新压力测试的理念,被后续研究借鉴,用于构建针对计数、空间感知等特定能力的定制化基准,形成了可迭代更新的VLM评估生态,深刻影响了动态基准生成领域的研究趋势。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务