VPBench
收藏arXiv2025-09-30 收录
官方服务:
资源简介:
该数据集名为VPBench,包含了用于视频修复和视频编辑评估的基于分割的遮罩视频。数据内容丰富多样,涵盖了物体、人类、动物、风景以及多范围遮罩。规模上,该数据集包含了100个6秒的视频和16个较长的视频,任务重点在于视频修复和编辑。
The dataset named VPBench consists of segmentation-based masked videos for evaluating video inpainting and video editing tasks. The dataset features diverse content categories, including objects, humans, animals, natural landscapes, and multi-range masks. In terms of scale, it contains 100 6-second videos and 16 longer-length videos, with the core tasks centered on video inpainting and editing.
搜集汇总
数据集介绍
构建方式
VPBench的构建源于对视觉提示基准测试脆弱性的深刻洞察。研究团队发现,现有基准如BLINK中视觉标记的微小变化即可显著扰动模型排名,为此从DA2K和SPair-71k两个大规模数据集中精心筛选,分别构建了相对深度估计(VPBench-RD)和语义对应(VPBench-SC)两个子集。通过将像素级深度标注转化为配对比较任务,并沿用BLINK的提示风格,最终形成了包含35,088张标注图像、覆盖16种视觉标记变体的大型基准,相较于BLINK仅224个样本的规模,实现了数量级上的扩展。
特点
VPBench的核心特质在于其系统性揭示了视觉提示基准的脆弱性根源。数据集囊括了颜色、形状、尺寸和标签位置四个维度的16种标记变体,实验表明仅改变标记颜色即可导致模型准确率波动高达21%,甚至引发排行榜的彻底洗牌。更为关键的是,这种不稳定性是视觉提示任务所特有的——传统知识型基准如MME在相同干预下表现稳定。此外,JPEG压缩等看似无关的底层实现细节也能显著改变模型排序,凸显了视觉提示评估中非语义因素的深远影响。
使用方法
VPBench的使用旨在推动更稳健的视觉语言模型评估。研究者可基于提供的16种标记变体及原始坐标,对模型进行多风格、多设置的交叉验证,而非依赖单一标记样式。建议在报告结果时附上置信区间和排名稳定性分析,并标准化JPEG压缩级别、输入分辨率等底层参数。数据集配套的参考推理代码支持灵活调整标记样式与压缩设置,为构建可信的排行榜提供了标准化工具,有助于区分模型真实感知能力与偶然的设计偏差。
背景与挑战
背景概述
在视觉语言模型(VLM)飞速发展的当下,如何精准评估其视觉感知能力而非语言先验与事实记忆,成为了领域内亟待突破的核心命题。针对这一需求,视觉提示范式应运而生,通过将图像区域显式标记并辅以空间或感知问题,旨在剥离高层推理、直击模型对低层级视觉信息的理解。基于此,来自加州大学伯克利分校的Haiwen Feng、Long Lian、Lisa Dunlap等研究者于2025年创建了VPBench数据集。该数据集旨在揭示现有视觉提示基准(如BLINK)中存在的脆弱性问题:微小的设计变动,如标记颜色从红变蓝,即可颠覆模型排名。VPBench将原有224样本的基准扩展至包含16种视觉标记变体、总计超过35000张标注图像的庞大规模,涵盖相对深度与语义对应两大任务,为稳定、可信的VLM视觉感知评测提供了坚实基石。
当前挑战
VPBench所应对的核心挑战在于视觉提示评估中普遍存在的结构性脆弱性。首先,在领域问题层面,当前最先进的VLM在对人类而言轻而易举的视觉感知任务上表现极不稳定,随机采样、标记风格(形状、颜色、大小、标签位置)乃至JPEG压缩等低层实现细节,均可导致高达21%的准确率波动,甚至使开源模型InternVL3-8B超越闭源巨头Gemini 2.5 Pro,严重扭曲了模型真实能力的排名。其次,在构建过程中,团队面临如何系统化量化并隔离这些非语义混淆因素的挑战,需对来自DA2K与SPair-71k的大规模数据进行精心重注释,并设计16种标记变体以覆盖颜色、形状、大小与文本位置等多维变化,同时通过配对自助法验证标记方差与数据方差的独立性,确保评测结果的统计显著性。
常用场景
经典使用场景
在视觉语言模型(VLM)的评估体系中,VPBench被设计为一种大规模、多模态的视觉提示基准,专注于衡量模型在低层级视觉感知任务上的真实能力。其经典使用场景包括相对深度估计与语义对应任务:模型需根据图像中标记的视觉提示(如圆圈、箭头或数字标签)判断两个点中哪一个更靠近相机,或识别与参考点对应的同一物体部件。通过引入16种不同的视觉标记变体(如颜色、形状、大小和标签位置),VPBench系统性地揭示出VLM对提示设计细节的脆弱敏感性,从而为研究者提供一个更为稳健、可重复的评估平台。
解决学术问题
VPBench直面当前视觉语言模型评估中的核心学术困境:传统基准常将视觉感知与语言先验混淆,导致模型表现难以反映其真实的视觉理解能力。该数据集通过扩展现有基准(如BLINK)的样本规模,从DA2K和SPair-71k中构建了35,088张标注图像,显著降低了因随机采样引发的排名波动。更重要的是,它揭示了视觉标记风格、JPEG压缩等级等非语义因素对模型排名的系统性影响,填补了学界对评估脆弱性认知的空白,推动研究者关注评估流程的标准化与鲁棒性,为构建可信的VLM能力比较框架奠定了方法论基础。
衍生相关工作
VPBench的发布催生了一系列后续研究,聚焦于VLM评估的稳定性与感知增强。例如,Bigverdi等人提出的感知令牌(Perception Tokens)方法,旨在通过显式注入视觉推理信号来提升模型对精细空间关系的理解,其有效性正是基于VPBench所暴露的模型脆弱性。此外,SpatialVLM与InternSpatial等数据集与架构的涌现,进一步拓展了空间推理的评估边界,它们借鉴了VPBench的多标记变体策略,以更全面地度量模型对几何不变性的保持能力。这些衍生工作共同推动了一个新研究范式的形成:即从单一指标排名转向对评估流程本身进行元分析,以确保视觉语言领域的进步真正反映模型能力的提升。
以上内容由遇见数据集搜集并总结生成



