遇见数据集

ULVR_v2

收藏
Hugging Face2026-05-25 更新2026-05-26 收录
官方服务:

资源简介:

ULVR_v2(通用潜在视觉推理数据集)是一个大规模多模态数据集,旨在支持视觉推理和思维链任务。它包含约151万个样本,分为8个不同的数据分割,每个分割针对特定的视觉或文本推理方面。数据形式多样,包括文本思维链生成对应的PNG图像、随机颜色边界框高亮图像、带填充的边界框裁剪图像、深度图和边缘检测辅助图像、交错式推理图像、图表区域高亮图像、节点-边场景图以及文档裁剪图像。该数据集适用于多模态任务,如图像-文本到文本生成和视觉问答,特别强调视觉空间推理和复杂推理过程。数据来源整合了多个现有数据集和方法,如ScienceQA、LLaVA-CoT、Mulberry-SFT等。数据集设计用于训练和评估能够处理视觉和文本联合推理的模型,尤其关注潜在推理步骤的显式表示。

ULVR_v2 (Universal Latent Visual Reasoning Dataset) is a large-scale multimodal dataset designed to support visual reasoning and chain-of-thought tasks. It contains approximately 1.51 million samples, divided into 8 different data splits, each targeting specific aspects of visual or textual reasoning. The data formats are diverse, including PNG images corresponding to text chain-of-thought generation, random-color bounding box highlighted images, bounding box cropped images with padding, depth maps and edge detection auxiliary images, interleaved reasoning images, chart region highlighted images, node-edge scene graphs, and document cropped images. This dataset is suitable for multimodal tasks, such as image-text-to-text generation and visual question answering, with a particular emphasis on visual spatial reasoning and complex reasoning processes. The data sources integrate multiple existing datasets and methods, such as ScienceQA, LLaVA-CoT, Mulberry-SFT, and others. The dataset is designed for training and evaluating models capable of handling joint visual and textual reasoning, especially focusing on the explicit representation of latent reasoning steps.

创建时间:
2026-05-21
原始信息汇总

数据集概述:ULVR_v2 — Universal Latent Visual Reasoning Dataset

  • 语言:英语
  • 许可证:Apache 2.0
  • 任务类别:图像-文本到文本、视觉问答
  • 标签:多模态、视觉推理、思维链
  • 数据规模:约 151 万样本,分布在 8 个数据子集

数据子集及样本数量

子集名称 样本数 描述
text_cot 355,793 文本思维链 → PNG(来源:ScienceQA + LLaVA-CoT + Mulberry-SFT)
bbox_highlight 321,365 随机颜色边界框高亮(来源:Visual-CoT + ThinkMorph)
bbox_crop 321,365 带 10% 填充的边界框裁剪(与 highlight 配对)
visual_representation 50,000 深度图 + 边缘检测(DepthAnything-V2 + PIDINet)
helper_interleaved ~350,052 推理图像(来源:Zebra-CoT + ThinkMorph + V-Interaction)
chart_focus 91,756 图表区域高亮(来源:ThinkMorph + ChartGemma)
scene_graph 13,715 节点-边图(来源:Visual Genome,节点≤15)
doc_crop 9,892 文档裁剪(来源:ArxivQA GroundingDINO)

使用方式

python from datasets import load_dataset ds = load_dataset("RuoliuYang/ULVR_v2", split="visual_representation")

关键特性

  • bbox_highlight 与 bbox_crop 配对:两者共享同一源图像。高亮使用 10 种随机颜色。训练时每张图像仅使用其中一种。
  • visual_representation:每个样本包含深度图(DepthAnything-V2,viridis 色图)和边缘检测图(PIDINet),作为空间推理问题的辅助图像。

数据配置

  • 配置名称:default
  • 数据文件路径
    • 子集 text_cotdata/text_cot/*.parquet
    • 子集 bbox_highlightdata/bbox_highlight/*.parquet
    • 子集 bbox_cropdata/bbox_crop/*.parquet
    • 子集 visual_representationdata/visual_representation/*.parquet
    • 子集 helper_interleaveddata/helper_interleaved/*.parquet
    • 子集 chart_focusdata/chart_focus/*.parquet
    • 子集 scene_graphdata/scene_graph/*.parquet
    • 子集 doc_cropdata/doc_crop/*.parquet
搜集汇总
数据集介绍
ULVR_v2 数据集图片
构建方式
ULVR_v2数据集以多模态视觉推理为核心,通过融合多种公开数据源与自动化处理流程构建而成。该数据集整合了ScienceQA、LLaVA-CoT、Mulberry-SFT等文本推理数据,以及Visual-CoT、ThinkMorph、ChartGemma等视觉推理数据,并借助DepthAnything-V2、PIDINet等模型生成深度图与边缘检测图。所有样本以Parquet格式组织,支持8个子集的高效加载与灵活组合。
特点
该数据集规模达151万样本,涵盖文本链式推理、边界框高亮与裁剪、视觉表征、图表聚焦、场景图及文档裁剪等多种模态。其独特之处在于提供了边界框高亮与裁剪的配对样本,以及深度图与边缘检测相结合的辅助视觉特征,为空间推理与细粒度理解提供丰富训练材料。每个子集服务于特定的推理任务,如场景图仅保留不超过15个节点的图结构,确保数据质量与任务适配性。
使用方法
用户可通过HuggingFace Datasets库直接加载数据集,例如使用`load_dataset(RuoliuYang/ULVR_v2, split=visual_representation)`获取某一子集。训练时,边界框高亮与裁剪子集共享源图像,需按需选择其一使用。视觉表征子集包含深度图与边缘检测图,可作为空间推理问题的辅助输入。各子集通过config配置中的split参数独立调用,便于按任务需求组合数据流水线。
背景与挑战
背景概述
ULVR_v2数据集于近期由RuoliuYang等研究人员构建,旨在推动多模态视觉推理领域的发展。该数据集包含约151万样本,横跨8个子集,覆盖文本链式推理、边界框标注、深度图与边缘检测等多种视觉表示形式。其核心研究问题在于如何通过统一的潜在视觉推理机制,提升模型在复杂视觉问答任务中的表现。ULVR_v2整合了ScienceQA、Visual-CoT等多个前沿基准,为多模态大模型提供了丰富的训练资源,对视觉推理与链式思考领域具有重要影响力。
当前挑战
该数据集应对的核心挑战包括:1)视觉推理任务中,模型常难以将图像细节与文本描述进行深度对齐,导致推理逻辑断裂;2)构建过程中,需从不同来源的图像中统一生成高质量的边界框、深度图及场景图,并确保标注一致性与多样性;3)处理大规模多模态数据时,如何平衡子集间的样本分布以避免偏置,同时维持链式推理步骤的清晰度。这些挑战凸显了设计通用视觉推理数据集的复杂性。
常用场景
经典使用场景
ULVR_v2数据集专为提升多模态大模型的视觉推理能力而设计,尤其在需要链式思维推理的任务中表现出色。其丰富的分割配置涵盖了文本引导的推理链、边界框标注、视觉表示以及场景图等多种模态信息,使得研究者能够构建和评估模型在复杂视觉问答、空间关系理解以及图表推理等经典场景下的表现。该数据集通过统一的潜在视觉表示框架,为模型提供了从图像中提取结构化推理线索的标准化素材。
衍生相关工作
围绕ULVR_v2已衍生出一系列具有影响力的研究工作,包括基于链式思考的视觉推理框架、多模态思维链生成方法,以及融合深度信息和边缘检测的增强视觉表示学习。相关成果如LMMs-R1、Visual-CoT和ThinkMorph等模型,均在不同程度上借鉴了该数据集的分割设计和标注范式,进一步拓展了视觉推理在复杂场景下的应用边界。
数据集最近研究
最新研究方向
ULVR_v2数据集聚焦于多模态视觉推理的前沿探索,通过整合链式思维推理、边界框标注、视觉表征增强及图表场景图等多样化子集,旨在提升大语言模型在复杂视觉问答任务中的空间理解与因果推断能力。其设计呼应了当前多模态大模型从简单感知向深度推理演进的热点趋势,尤其在科学图解推理、文档级视觉问答及交互式场景分析等方向上提供规模化训练支撑。该数据集的问世不仅推动了视觉推理从单一图像描述迈向结构化逻辑推演,还为缓解模型在细粒度空间定位与跨模态对齐上的局限性奠定了数据基础,对构建可解释、高鲁棒性的通用视觉智能系统具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务