遇见数据集

ULVR-Bench

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

ULVR-Bench(通用潜在视觉推理基准)是一个用于评估模型视觉推理能力的多模态基准数据集。它包含18,218个样本,根据中间视觉推理类型划分为7个独立的数据分割:text_reasoning、bbox_reasoning、scene_graph_reasoning、visual_repr_reasoning、helper_reasoning、chart_reasoning和doc_reasoning。每个样本包括输入图像、自然语言问题和最终答案真值,并提供中间状态真值(如文本、JSON或图像)。数据集遵循统一模式,主要字段包括样本唯一标识、推理类型、问题、答案真值、输入图像、中间状态类型和中间状态真值。所有样本来自知名数据集的公开测试或验证分割,确保与训练数据无重叠,旨在为视觉问答和复杂视觉推理任务提供一个全面、无偏的评估基准。核心评估指标仅为最终答案的准确率。

ULVR-Bench (Universal Latent Visual Reasoning Benchmark) is a multimodal benchmark dataset for evaluating model visual reasoning capabilities. It contains 18,218 samples, divided into 7 independent data splits based on the intermediate visual reasoning types: text_reasoning, bbox_reasoning, scene_graph_reasoning, visual_repr_reasoning, helper_reasoning, chart_reasoning, and doc_reasoning. Each sample includes an input image, a natural language question, and the corresponding ground truth final answer, with intermediate state ground truths (e.g., text, JSON, or images) provided. The dataset follows a unified schema, with key fields such as sample unique identifier, reasoning type, question, answer ground truth, input image, intermediate state type, and intermediate state ground truth. All samples are sourced from public test or validation splits of well-known datasets, ensuring no overlap with training data, and aim to provide a comprehensive, unbiased evaluation benchmark for visual question answering and complex visual reasoning tasks. The core evaluation metric is solely the accuracy of the final answer.

创建时间:
2026-05-25
原始信息汇总

数据集概述:ULVR-Bench

ULVR-Bench 是一个用于评估多模态模型通用潜在视觉推理能力的基准测试数据集,包含 14,083 个样本,涵盖 7 种不同的推理类型。

  • 语言:英语
  • 许可证:Apache-2.0
  • 任务类别:视觉问答
  • 数据集大小:10K < n < 100K

数据集结构

数据集包含 7 个独立的分片(Split),每个分片对应一种推理类型,并可在 Hugging Face 上通过 load_dataset 按分片名称加载。

分片名称 样本数 数据来源 中间状态 GT 答案 GT
text_reasoning 1,526 ScienceQA 测试集 ✅ 讲义与解题文本
bbox_reasoning 910 GQA val_balanced ✅ 场景图生成的边界框 JSON
scene_graph_reasoning 3,707 GQA val_balanced ✅ 完整场景图 JSON
visual_repr_reasoning 587 GQA val_balanced ✅ 3 张辅助图像:深度图、边缘图、分割图
helper_reasoning 88 GeoQAPlus-StepbyStep 测试集(严格辅助线子集) ✅ 中文解题过程描述辅助线构造 ✅ (A/B/C/D)
chart_reasoning 2,375 ChartQA 测试集 ⏳ 待手动标注的区域坐标
doc_reasoning 4,890 DocVQA 验证集 ⏳ 待手动标注的区域坐标

数据清洗与质量审核

  • 原始数据集包含 18,218 个样本,经过启发式过滤和人工抽样审核后,移除了 4,135 个(22.7%) 低质量样本。
  • 具体过滤规则和已知限制记录在 BENCH_QUALITY_AUDIT.md 文件中(本地副本)。

数据模式(Schema)

每个样本包含以下字段:

  • bench_id: 字符串,例如 "bbox_reasoning_00042"
  • reasoning_type: 字符串
  • question: 字符串
  • answer: 字符串,最终答案 GT
  • input_image: 字典(bytes, path)
  • intermediate_state_type: 字符串
  • intermediate_state: 字符串/JSON,中间状态 GT;对于 chart/doc 分片为空(待手动标注)
  • intermediate_image: 字典(bytes, path);对于无 GT 图像的分片为 NULL
  • source: 字符串

特殊说明

  • GQA val_balanced 的使用:由于 GQA testdev 没有公开的场景图 GT,无法填充 intermediate_state,因此使用 val_balanced 分片。
  • DocVQA 验证集的使用:DocVQA 测试集不公开答案,验证集(5,349 个问题,过滤后 4,890 个)具有 answers 字段。
  • GeoQAPlus-StepbyStep 子集:通过关键词筛选带有辅助线构造的几何题,共 88 个样本。
  • 视觉表征推理visual_repr_reasoning 分片额外提供三个辅助图像(深度图、边缘图、分割图)。

设计原则

  • 模型仅接收 input_image + question,仅根据 answer 评分。
  • intermediate_stateintermediate_image 是参考 GT,用于分析模型推理过程,不参与评分。
  • 所有样本均来自公开的测试/验证集,与 ULVR_v2 训练语料无重叠。
搜集汇总
数据集介绍
ULVR-Bench 数据集图片
构建方式
ULVR-Bench是一个用于评估视觉语言模型中间推理能力的基准数据集,精心整合了来自ScienceQA、GQA、GeoQAPlus-StepbyStep、ChartQA和DocVQA等公开数据集的测试与验证子集,涵盖七类中间视觉推理类型,共计14,083个样本。在构建过程中,研究团队对原始18,218个样本进行了严格的启发式过滤与人工抽检,剔除了22.7%的低质量样本,包括纯知识性问题、场景标注而非边界框推理、单一关系查询等,确保每个样本均能有效检验模型的中间推理环节,而非依赖表层模式匹配或外部知识。
使用方法
用户可通过HuggingFace Datasets库便捷加载ULVR-Bench,例如使用`load_dataset("RuoliuYang/ULVR-Bench", split="text_reasoning")`获取文本推理子集。模型仅接收输入图像与问题,最终答案与提供的真值进行比对评分,中间状态与图像作为分析模型推理行为的参考,不参与评分。该基准特别适用于需要评估视觉语言模型在复杂推理任务中是否真正执行了多步中间推理的研究场景,为模型中间层表征分析、推理错误诊断及后续改进方向提供了标准化的评测平台。
背景与挑战
背景概述
ULVR-Bench(通用潜在视觉推理基准)于2024年由研究者Ruoliu Yang等构建,旨在评估多模态大模型在视觉推理任务中的中间表征能力。该基准源自ScienceQA、GQA、GeoQAPlus、ChartQA与DocVQA等公开数据集,涵盖文本推理、边界框推理、场景图推理、视觉表征推理、辅助线推理、图表推理与文档推理七类子任务,共计14,083个样本。其核心研究问题在于:模型能否在仅给定图像与问题的条件下,依赖内部潜在状态而非显式视觉中间步骤完成推理?通过提供中间状态参考标注,ULVR-Bench为细粒度分析模型推理路径提供了标准测试平台,对多模态认知科学、可解释人工智能与视觉问答领域具有重要推动作用。
当前挑战
ULVR-Bench所解决的领域挑战包括:现有视觉推理基准普遍忽略对模型内部潜在推理过程的评估,多数基准仅关注最终答案精度,而无法揭示模型是否依赖正确的中间视觉表征。构建过程中的挑战则在于:为保障数据质量,研究者从18,218个初筛样本中手工剔除4,135个低质量样本,包括纯知识记忆型问题、单关系检索、场景标签等;同时,对GQA、DocVQA等数据集的验证集而非测试集进行采样,以确保中间状态标注的可用性。此外,视觉表征推理子任务中的深度图、边缘图与分割图依赖现有模型生成,存在模型特定失败模式的风险,边界框推理与场景图推理子任务也需精确过滤嵌套空间子句等复杂问题,以保证每个样本均真正需要多步视觉推理,而非简单模式匹配。
常用场景
经典使用场景
ULVR-Bench作为多模态视觉推理领域的综合性基准数据集,其经典使用场景聚焦于评估模型在多样化视觉推理任务中的表现。该数据集精心设计了7类推理子集,涵盖文本推理、边界框推理、视觉表征推理、场景图推理、图表推理、文档推理及辅助线推理,全面考察模型从视觉输入中提取信息并逻辑推导最终答案的能力。研究者通常利用该基准对多模态大语言模型进行标准化测试,通过最终答案准确率这一单一指标,比较不同模型在各类视觉推理任务上的相对优劣,从而揭示模型在视觉理解层面的核心能力边界与潜在缺陷。
解决学术问题
该数据集首次系统性地解决了多模态模型在视觉推理过程中'中间状态'可解释性缺失的学术难题。传统基准仅关注最终答案的正确性,而ULVR-Bench为每个样本提供了中间状态的真实标注(如场景图JSON、辅助图像、推理文本),使得研究者能够深入剖析模型在回答过程中是否进行了正确的视觉表征构建、空间关系推理或逻辑链条推导。这一设计有力地推动了视觉推理领域从'结果导向'向'过程透明'的范式转变,为诊断模型在深度感知、边缘提取、场景理解等中间环节的薄弱点提供了量化工具,进而引导更具针对性的模型改进策略。
实际应用
在实际应用层面,ULVR-Bench的评估能力可广泛服务于需要精确视觉理解的工业场景。例如,在自动驾驶领域,模型需根据道路图像进行空间位置推理(如边界框推理);在文档分析系统中,模型应能理解图表数据与文本布局(如图表与文档推理);在教育科技领域,通过辅助线推理评估模型能否辅助解题。该数据集为这些高可靠性需求场景提供了模型筛选与验证的标尺,确保部署前的模型具备扎实的视觉推理基本功,从而降低实际应用中因视觉误判导致的决策风险。
数据集最近研究
最新研究方向
当前,多模态大模型的视觉推理能力评估正从粗粒度的整体正确率向细粒度的中间推理过程可解释性迈进。ULVR-Bench作为一款专门针对潜在视觉推理过程的基准测试,通过涵盖文本推理、边界框推理、视觉表征推理、场景图推理、图表推理、文档推理及辅助线推理等七种推理类型的14,083个样本,系统性地考察模型在感知、空间关系理解、符号推理与逻辑演绎等多个维度的表现。该基准特别关注中间状态的可获取性,例如为视觉表征推理提供深度、边缘与分割三幅辅助图,为场景图推理提供完整场景图JSON,从而支持对模型推理路径的内部机制分析。这一设计理念与近期可解释人工智能、神经符号推理及多模态能力分解研究高度契合,有助于揭示当前主流模型如GPT-4V、Gemini等在复杂视觉任务中的真实推理瓶颈,推动模型从‘答案正确’向‘过程合理’的关键跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务