遇见数据集

Distract-Bench

收藏
github2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

Distract-Bench是一个用于评估多模态推理中对答案保持语义干扰鲁棒性的基准测试,包含506个样本,每个样本包括问题、图像、答案选项和黄金答案,并提供了语义干扰的详细规格说明。

Distract-Bench is a benchmark designed to assess the robustness of multimodal reasoning against semantic interference targeting answers. It comprises 506 samples, each of which includes a question, an image, a set of answer options, and a gold standard answer, alongside detailed specifications for the semantic interference.

创建时间:
2026-06-08
原始信息汇总

数据集概述

Distract-Bench 是一个用于评估多模态推理模型在面对“答案保持型语义干扰”(answer-preserving semantic distractions)时鲁棒性的基准测试。该基准在论文《Are Reasoning Vision-Language Models Robust to Semantic Visual Distractions?》中提出。

数据集规模

  • 共包含 506 个样本。

数据格式与组成

数据集以 JSONL 格式提供,主要包含两个元数据文件:

  1. data/questions.jsonl:每个样本包含一个 JSON 对象,字段包括:

    • final_id:数值型样本ID(字符串形式)。
    • image:干扰图像的相对路径。
    • question:基准测试问题文本。
    • options:答案选项(如有)。
    • answer:标准答案。
  2. data/edit_instructions.jsonl:以相同的 final_id 索引,包含语义干扰的具体说明:

    • edit.dead_end_description:注入的干扰因素的简要描述。
    • edit.trap_reasoning_path:干扰因素旨在诱导的推理路径。
    • edit.trap_answer:预期的陷阱答案。
    • edit.edit_instruction:用于创建干扰图像的图像编辑指令。
    • edit.style_constraints:编辑的视觉风格约束。

数据获取

  • 图像数据托管在 Hugging Face 上,可通过 EthanSun/Distract-Bench 数据集加载。
  • 元数据和模型输出存储在 GitHub 仓库 Yizheng-Sun/Distract-Bench 中。
  • 通过 Hugging Face 数据集加载时,可使用 final_id(值范围为 1506)将图像数据与 JSONL 元数据及模型输出进行关联。

评估指标

基准测试提出了两个关键指标:

  • DRR (Distractor Reference Rate):衡量模型明确提及、引用或使用注入的语义干扰因素的频率。计算方式为:# 引用干扰因素 / # 总样本数
  • HFR (Harmful Reference Rate):衡量模型引用干扰因素并给出错误答案的频率。计算方式为:# 引用干扰因素且答案错误 / # 总样本数
  • RRR (Robust Reference Rate):衡量模型引用干扰因素但最终给出正确答案的频率。计算方式为:# 引用干扰因素且答案正确 / # 引用干扰因素

HFR 是衡量有害干扰吸收的更直接指标;模型可能具有高 DRR(表明注意到干扰),但如果能正确恢复答案,其 HFR 可能较低。

结果概览

已发布的模型输出涵盖了 8 个模型和 4,047 个已加入的样本。在这些样本中,1,110 个输出引用了干扰因素,447 个既引用了干扰因素又回答错误。

各模型在 Distract-Bench 上的准确率、DRR、HFR 等详细数据见仓库中的模型结果表格。

代码与工具

  • 干扰引用判断scripts/judge_distractor_reference.py 脚本用于调用 LLM(默认 gpt-5-nano)判断模型输出是否显式引用干扰因素。该脚本无需图像文件。
  • 指标计算scripts/compute_drr_hfr.py 脚本用于计算 DRR、HFR 和 RRR 指标,可处理分离的或合并的判断文件。
  • 模型输出:干扰条件下的模型输出存储于 model_outputs/corrupt_results/,对应的干扰引用判断存储于 model_outputs/corruption_reference/
搜集汇总
数据集介绍
Distract-Bench 数据集图片
构建方式
在视觉-语言推理模型快速发展的背景下,如何评估其对抗语义干扰的鲁棒性成为关键问题。Distract-Bench 正是为填补这一空白而构建的基准测试集。其构建过程围绕“保留答案的语义分心”这一核心概念展开:基于原始图像,通过精细的图像编辑指令注入精心设计的语义干扰物,同时确保正确答案在视觉线索中依然可辨。每个样本均包含具有语义干扰的编辑图像、对应的问题、选项及标准答案,并配套记录了干扰物描述、诱导演绎路径与预期陷阱答案等元数据,最终形成包含 506 个样本的标准化测试集。
特点
Distract-Bench 最显著的特点在于其专注于语义层面的视觉干扰,而非简单的像素级噪声或物体遮挡。该基准集通过设计对抗性的推理陷阱,专门用于衡量模型在面对与正确答案并存的误导性视觉信息时的表现。为此,其不仅提供传统的准确率评估,更创新性地引入了 DRR(干扰物提及率)和 HFR(有害提及导致错误率)两项指标,从而能够精细区分模型是否识别了干扰物,以及在识别后能否依旧保持正确推理,为深入理解模型的鲁棒性机制提供了独特视角。
使用方法
该数据集的使用路径清晰且资源完备。用户可直接通过 Hugging Face 加载完整的图像与元数据,脚本从数据集中读取图像及其对应的原始图像。对于模型输出的评估,库中提供了独立的计分脚本,通过输入包含模型答案正确性判断与干扰物提及判断的 JSONL 文件,即可自动计算 DRR 与 HFR 等关键指标。此外,还集成了基于 LLM 的干扰物提及自动评判器,协助用户快速生成评判结果,从而高效地对不同视觉-语言推理模型在这一针对性基准上的表现进行标准化测试与对比。
背景与挑战
背景概述
多模态大语言模型的推理能力在近年来取得了长足进步,然而,其在应对语义级视觉干扰时的鲁棒性仍然是一个亟待探索的课题。Distract-Bench基准数据集正是为填补这一评估空白而构建,由研究团队于2025年提出,旨在系统性地衡量视觉语言推理模型在面对保持答案正确性但包含语义干扰的图像时的脆弱性。该数据集通过精心设计的图像编辑指令,在原始图像中注入与问题语义相关但会导致错误推理路径的视觉干扰元素,从而模拟真实世界中存在的视觉歧义与误导场景。Distract-Bench的发布为相关领域提供了一套标准化的评估工具,其核心研究问题直指模型在推理过程中对于视觉干扰的敏感程度,对于理解当前模型的局限性、推动更鲁棒的多模态推理系统发展具有重要意义。
当前挑战
Distract-Bench所聚焦的核心挑战在于多模态推理模型对语义级视觉干扰的脆弱性,该类干扰并非简单的噪声或遮挡,而是精心设计、与问答逻辑紧密耦合的视觉陷阱,极易诱导模型产生错误的引用与推理。在数据集构建过程中,面临的挑战包括如何生成既保持答案语义不变又能有效误导模型的干扰图像,这要求对图像编辑指令与视觉风格约束进行精细控制。同时,如何客观地评估模型是否“引用”了干扰信息,并区分其引用行为是导致错误还是能够成功规避,也是评估方法论上的难点。为此,Distract-Bench创新性地提出了DRR(干扰引用率)和HFR(有害干扰引用率)两套指标,前者衡量模型注意到干扰的频率,后者则更严格地量化模型被干扰误导并给出错误答案的频率,为深入分析模型行为提供了量化准绳。
常用场景
经典使用场景
Distract-Bench作为一个专注于评估多模态推理模型鲁棒性的基准数据集,其核心应用场景在于系统性地测试视觉-语言模型在面对答案保持型语义干扰时的表现。在经典的研究范式下,研究者通过向原始图像中注入精心设计的语义干扰物(如无关物体、误导性场景元素等),并保持正确答案不变,来考察模型能否在干扰中准确提取关键信息并完成推理任务。该数据集覆盖506个精心构建的样本,每个样本不仅包含受干扰图像和原始问题,还详细记录了干扰物的描述、诱导向的错误推理路径及视觉编辑规范,使得研究者能够深入剖析模型在何种干扰模式下容易出错,从而为提升模型鲁棒性提供精准的诊断工具。
实际应用
在实际应用层面,Distract-Bench所反映的鲁棒性问题具有深远的现实意义。自动驾驶系统需要从充满广告牌、行人、临时路标等视觉干扰的街道场景中稳健提取交通信号信息;医疗影像分析系统必须在组织切片中精准定位病灶,避免被正常生理结构或染色杂质误导;而智能客服系统在处理用户上传的图片时,也需抵御刻意插入的无关元素以保证回答的可靠性。通过部署Distract-Bench的评估方法,开发者能够系统性地测试模型在这些高风险场景下的抗干扰能力,并依据DRR和HFR指标定位模型易受干扰的薄弱环节,进而通过数据增强、对抗训练或推理策略改进等方式提升系统在实际部署中的安全性和可信度。
衍生相关工作
Distract-Bench的提出已经衍生出一系列富有启发性的相关工作与研究线索。其核心发现——即使顶级多模态推理模型如Qwen3-VL-8B(准确率83.6%)仍存在8.3%的HFR——直接催生了对模型内部干扰处理机制的研究,包括利用注意力图可视化分析模型在受干扰图像中的关注区域,以及探索基于链式推理(Chain-of-Thought)的干扰规避策略。该基准提供的LLM法官自动化评估框架(基于gpt-5-nano进行干扰物引用判断)也为后续大规模鲁棒性评估提供了高效的工具范式。此外,研究人员已在探索将Distract-Bench的干扰设计方法(即通过死胡同描述和陷进推理路径的规范注入)推广至更多模态和更复杂的推理场景,如视频时序推理和多轮对话中的持续性干扰问题,从而推动整个领域对模型鲁棒性和安全性的关注迈入新阶段。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务