Selection Bias of LVLMs
收藏资源简介:
该数据集旨在评估大型视觉语言模型(LVLMs)在多项选择题回答(MCQA)中的选择偏差。数据集包含三个难度级别(简单、中等、困难),以及包含和不包含类名的选项变体。数据集从六个细粒度分类数据集中构建,包括CUB-200-2011、斯坦福狗、FGVC飞机、斯坦福汽车、Food-101和iNaturalist-2021。每个图像-类别对都有六个独特的MCQs,总共包含63894个MCQs。数据集可用于评估LVLMs在不同难度级别下的选择偏差,并帮助研究如何缓解这种偏差,以提高模型的鲁棒性和准确性。
This dataset aims to evaluate the selection bias of Large Vision-Language Models (LVLMs) in multiple-choice question answering (MCQA). It includes three difficulty levels (easy, medium, hard), as well as option variants with and without class names. The dataset is constructed from six fine-grained classification datasets, namely CUB-200-2011, Stanford Dogs, FGVC Aircraft, Stanford Cars, Food-101 and iNaturalist-2021. Each image-category pair has six unique MCQs, with a total of 63,894 MCQs. This dataset can be used to evaluate the selection bias of LVLMs across different difficulty levels, and help investigate methods to mitigate such bias so as to improve model robustness and accuracy.
数据集概述
数据集标题
Benchmarking and Mitigating MCQA Selection Bias of Large Vision-Language Models (EMNLP 2025)
研究背景
大型视觉语言模型在视觉语言任务中表现出色,特别是在视觉问答任务上。先前的研究探索了视觉问答中的单模态偏差,但多选问答中的选择偏差问题仍未得到充分探索。
研究内容
- 研究问题:多选问答中的选择偏差,即模型可能偏向特定选项标记或位置。
- 研究方法:通过细粒度多选问答基准进行调查,涵盖简单、中等和困难难度级别。
- 难度定义:根据干扰项的语义相似性定义难度级别。
- 解决方案:提出一种推理时对数级去偏方法,估计通用和上下文提示的集成偏差向量,并对模型输出应用置信度自适应校正。
- 方法特点:无需重新训练,与冻结大型视觉语言模型兼容。
实验结果
- 偏差发现:多个先进模型存在一致的选择偏差,且偏差随任务难度增加而加剧。
- 方法效果:去偏方法显著减少偏差,并在具有挑战性的设置中提高准确性。
研究意义
- 理论贡献:揭示大型视觉语言模型在多选问答中的局限性。
- 实践价值:提供提高细粒度视觉推理鲁棒性的实用方法。

- 1Benchmarking and Mitigating MCQA Selection Bias of Large Vision-Language Models弗吉尼亚理工大学计算机科学系 · 2025年



