遇见数据集

ENTRAP-VL

收藏
arXiv2026-07-22 更新2026-07-24 收录
官方服务:

资源简介:

ENTRAP-VL是由印度多所研究机构联合创建的一个专门用于评估视觉-语言模型中双上下文牵引现象的数据集。该数据集包含1500个条目,分为文本牵引流和视觉牵引流,涵盖八个类别,通过手动精心构建以体现其分类学结构。其创建过程基于对项目关联性和真实性关系的双重轴分类,旨在探究模型在文本和视觉两种独立上下文影响下的行为偏差。该数据集主要应用于行为分析领域,旨在解决视觉-语言模型在辅助上下文影响下可能产生的非理性输出问题,为可信人工智能和跨模态决策解码研究提供结构化评估工具。

ENTRAP-VL is a dataset jointly developed by multiple research institutions across India, specifically tailored to evaluate the dual context priming phenomenon in vision-language models. It consists of 1500 entries, categorized into two streams: text priming stream and visual priming stream, spanning eight categories. The dataset is meticulously handcrafted to reflect its taxonomic framework. Its development adopts a dual-axis classification based on project relevance and authentic relationality, with the goal of exploring behavioral biases exhibited by models under the influence of two independent contexts: textual and visual. Primarily applied in the field of behavioral analysis, this dataset aims to resolve the problem of irrational outputs that vision-language models may produce when affected by auxiliary contexts, providing a structured evaluation tool for trustworthy artificial intelligence and cross-modal decision-making decoding research.

创建时间:
2026-07-22
搜集汇总
数据集介绍
ENTRAP-VL 数据集图片
构建方式
ENTRAP-VL的构建基于一套精细的双轴分类法,分别沿“关联性”(relatable vs. random)与“真实性”(true, contradictory, counterfactual)两个维度组织上下文条件。数据集包含文本与视觉两个镜像流:文本流由800个条目构成,每个条目包含一张固定图像、一个文本查询及八种上下文条件,每种条件配备三条陈述,共计19,200次上下文注入;视觉流包含700个条目,每个条目以一个文本查询为锚点,配以三张候选图像(relatable_true, relatable_distractor, random_distractor)。所有数据均由作者手工策展,文本流完全无生成式辅助,图像源自免版税图库并经人工筛选以确保水印消除、触发词与答案无词汇重叠、同条目内图像色调一致等设计约束。
特点
该数据集的核心特点在于其双模态、双轴分类结构,能够独立探测文本上下文与视觉上下文对视觉语言模型(VLM)的牵引效应。文本流引入了八种上下文条件,其中“矛盾性”(relatable_contradictory)条件为场景相对假但世界可能成立的陈述,是纯文本基准中不存在的创新维度,弥补了先前工作对感知接地场景中局部虚假性识别的缺失。视觉流则聚焦关联性轴,通过relatable_true、relatable_distractor与random_distractor三类图像,分别测试模型对答案实体、部分匹配实体及无关实体的视觉牵引敏感性。整体数据集跨越8个类别(如生物、电子、水果等),确保查询类型与场景的多样性,为逐条目、逐条件的高精度测量提供支撑。
使用方法
使用ENTRAP-VL时,研究者需将模型固定于每一测试条目上,分别注入不同上下文条件并记录输出。文本流中,通过对比有/无上下文注入时模型输出相对于真实答案的偏移量,量化文本牵引强度;视觉流中,以无图像输入时的模型回答为基准,评估三类图像条件导致的输出偏差。每种条件的三条陈述允许计算条目内方差以估计测量可靠性。关键对比包括:同一模型内文本与视觉牵引程度的跨流比较、不同真实性条件下的牵引差异(如矛盾陈述 vs. 反事实陈述)、以及完整语句与裸实体触发词之间的形式对比。所有测量应逐条件报告,避免聚合平均,并辅以无上下文参考值以确保可解释性。
背景与挑战
背景概述
近年来,视觉语言模型(VLM)在检索增强生成等实际场景中日益普及,其输入常包含文本与视觉双重辅助信息,然而这种多模态上下文的引入在提升性能的同时,也潜在地诱发了模型输出的系统性偏移——即上下文引导(contextual entrainment)现象。该问题虽已在纯语言模型中得到机制性解释,但在跨视觉与文本双模态的框架下仍属未竟之域。为此,Karan Goyal等研究人员于2026年提出了ENTRAP-VL数据集,旨在构建一个经精心分类学设计的双模态探测工具,以严谨考察视觉语言模型是否及如何被文本与视觉上下文所引导。该数据集涵盖八个类别、共1500个手工精选项目,并开创性地引入了“矛盾性”这一依赖场景真实性的新维度,为多模态可信人工智能研究提供了关键资源。
当前挑战
ENTRAP-VL所应对的核心挑战在于两个层面。从领域问题看,现有工作局限于单模态语言的上下文引导研究,缺乏针对视觉语言模型内双源(文本与视觉)引导效应的系统探测手段,尤其未能区分针对场景的局部虚假与世界虚假,也无法独立量化两种模态各自引发的语言偏差程度。从数据集构建过程看,传统模板化生成方法无法满足多模态环境下对关联性、真实性与场景依赖性的精细判断需求,必须依靠人工逐项判别“有关联但矛盾”等八种上下文条件的建构;此外,视觉流数据还需规避答案与干扰物的子词重叠、保证图像色调一致,以减少低层统计特征对实验结果的影响。这些严格的设计约束使得ENTRAP-VL的构建过程尤其复杂,却也为多模态模型的行为可信性分析奠定了坚实基础。
常用场景
经典使用场景
ENTRAP-VL作为一套专为视觉-语言模型设计的双模态语境牵引探测数据集,其最经典的使用场景在于系统性评估模型在接收无关、矛盾或反事实的上下文信息时,是否倾向于违背视觉观察或世界知识而向注入内容偏移。研究者通过向固定图片与查询对中嵌入结构化的文本或视觉干扰,精准量化模型在八种文本条件与三种视觉条件下的行为偏差,从而揭示上下文牵引力的来源、强度与模态特异性。
解决学术问题
该数据集旨在填补多模态领域中关于语境牵引系统性研究的空白,解决了现有工具无法分离文本与视觉双通道牵引力、无法刻画场景相对真值层级(即与场景矛盾但世界可能的“矛盾性”条件)以及缺乏细粒度分类学框架等关键学术问题。ENTRAP-VL通过手工构建的1500条样本与双轴八类条件划分,为研究者提供了严谨的行为测量协议,推动了可信AI与多模态决策可解释性的理论进展,使学界得以首次区分来自不同模态的牵引效应。
衍生相关工作
基于ENTRAP-VL的分类学框架与评估协议,研究社区可衍生出若干重要相关工作,包括但不限于:开发针对多模态语境牵引的机械可解释性方法以定位引发牵引的注意力头,构建跨语言或多领域的扩展版本以检验牵引力的泛化性,以及设计对比式解码策略或对抗训练算法以缓解上下文带来的负面干扰。此外,该数据集的“矛盾性”条件理念可启发新一代针对感知优先级的基准,推动视觉-语言模型在语言先验解耦与事实忠实性方面的研究深入发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务