遇见数据集

ULVR_v2_premium

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

ULVR_v2_premium 是通用潜在视觉推理(ULVR)数据集 ULVR_v2_clean 的一个精选优质子集,包含 262,556 个高质量样本。该数据集专为训练视觉推理模型而设计,每个推理类别都作为独立的数据分割。数据内容涵盖多种视觉推理任务,包括边界框高亮与裁剪、文本链式思维推理、交错辅助图像推理、抽象视觉表示(深度/边缘/分割)生成与使用、场景图关系推理、图表区域聚焦以及文档区域裁剪。每个样本包含样本ID、类别、源数据集、问题、答案、输入图像、最多三个中间步骤图像、中间步骤数量以及以对话格式(系统/用户/助手)封装推理过程的消息JSON。数据集通过基于 Qwen2.5-VL-7B 模型的双重评估(在有/无辅助图像下回答问题)进行质量筛选,优先选择辅助图像能有效纠正错误(P1)或两者均正确(P2)的样本,以确保推理步骤的必要性和有效性。该数据集仅包含训练分割,适用于多模态视觉问答、图像到文本生成及复杂的视觉推理任务的研究与模型训练。

ULVR_v2_premium is a curated premium subset of the Universal Latent Visual Reasoning (ULVR) dataset ULVR_v2_clean, containing 262,556 high-quality samples. This dataset is specifically designed for training visual reasoning models, with each reasoning category treated as an independent data split. The data content covers a variety of visual reasoning tasks, including bounding box highlighting and cropping, textual chain-of-thought reasoning, interleaved auxiliary image reasoning, generation and use of abstract visual representations (depth/edges/segmentation), scene graph relationship reasoning, chart region focusing, and document region cropping. Each sample includes a sample ID, category, source dataset, question, answer, input image, up to three intermediate step images, the number of intermediate steps, and a message JSON encapsulating the reasoning process in a dialogue format (system/user/assistant). The dataset undergoes quality screening through dual evaluation based on the Qwen2.5-VL-7B model (answering questions with/without auxiliary images), prioritizing samples where auxiliary images effectively correct errors (P1) or both are correct (P2), ensuring the necessity and effectiveness of reasoning steps. The dataset only includes a training split and is suitable for research and model training in multimodal visual question answering, image-to-text generation, and complex visual reasoning tasks.

创建时间:
2026-05-30
原始信息汇总

数据集概述:ULVR_v2_premium

ULVR_v2_premium 是一个精选的高质量子集,源自 RuoliuYang/ULVR_v2_clean,专门用于通用潜在视觉推理(ULVR)。该数据集包含 262,556 个高质量样本,每个推理类别均作为独立的数据划分(split)。

数据集详情

  • 语言:英语
  • 许可协议:Apache-2.0
  • 任务类型:视觉问答(Visual Question Answering)、图像到文本(Image-to-Text)
  • 标签:视觉推理、多模态、潜在视觉推理
  • 样本数量:100K < n < 1M

数据划分与样本数量

划分名称 样本数量 描述
bbox_highlight 70,000 高亮感兴趣区域,然后回答
bbox_crop 70,000 裁剪到感兴趣区域,然后回答(与 bbox_highlight 相同的 70k 样本,但以不同形式呈现)
text_cot 35,000 基于图像的文本思维链(Chain-of-Thought)
helper_interleaved 25,000 在推理轨迹中交错插入辅助图像
visual_representation 20,000 生成/使用抽象表示(深度/边缘/分割)
scene_graph 17,945 关系场景图推理
chart_focus 15,000 在回答前聚焦/缩放图表区域
doc_crop 9,611 在回答前裁剪文档区域

数据特征

每条记录包含以下字段:

  • sample_id(字符串):样本ID
  • category(字符串):类别
  • source_dataset(字符串):来源数据集
  • question(字符串):问题
  • answer(字符串):答案
  • input_image(图像):输入图像
  • intermediate_image_1/2/3(图像):最多三个中间图像
  • num_intermediate_steps(整数):中间步骤数量
  • messages_json(字符串):训练对话,格式为:系统消息 / 用户消息(输入图像+问题)/ 助手消息(<abs_vis_token></abs_vis_token> + 中间图像 + oxed{answer}

精选标准

ULVR_v2_clean 出发,使用基础版 Qwen2.5-VL-7B 进行双重评估(不借助 vs 借助辅助/中间图像,max_tokens=60),将样本分为不同质量等级:

  • P1 — 辅助挽救(没有辅助图像时答错,有辅助图像时答对):视觉推理步骤必要且有效,为最高优先级
  • P2 — 两者都正确:干净、可验证的样本,为第二优先级。
  • P3(即使有辅助图像也答错)和 AVOID(辅助图像使正确答案变错)被排除。

对于 visual_representation 划分,使用更精细的每表示信号(needed_rep)进行筛选:特定表示(深度/边缘/分割)能使答案从错变对的样本排名最高;仅使答案变差的样本被丢弃。

各划分的优先级组成(摘要):

  • bbox(highlight 和 crop 共享相同的 70k 个 sample_id):约 14.8k/13.9k P1 + 约 54.7k/55.0k P2,无 P3 / 无 AVOID
  • text_cot 35k:26,825 P1 + 8,175 P2(纯 P1+P2)。
  • helper_interleaved 25k:14,327 P1 + 10,673 P2(纯 P1+P2)。
  • visual_representation 20k:3,297 表示有帮助 + 16,703 干净正确。
  • scene_graph(全部 17,945)doc_crop(全部 9,611)chart_focus(15,000 of 15,056)——应要求保留(近)完整,因此包含部分P3样本。

使用方式

python from datasets import load_dataset

每个类别对应一个划分

ds = load_dataset("RuoliuYang/ULVR_v2_premium", split="bbox_highlight")

或流式加载

ds = load_dataset("RuoliuYang/ULVR_v2_premium", split="text_cot", streaming=True)

注意事项

  • 双重评估信号来自一个基础版(未经过 LVR 训练)的 Qwen2.5-VL-7B 模型,使用 max_tokens=60;这是一个样本质量的代理指标,并非衡量潜在视觉推理对于经过适当 LVR 训练的模型的价值。
  • 来自 GQA / ChartQA / ArxivQA / Visual-CoT 的源答案可能带有其自身的标注噪声(原样继承)。
  • 该数据集仅作为训练子集(无验证划分)。如需完整的清洗语料库和验证划分,请参考 ULVR_v2_clean
搜集汇总
数据集介绍
ULVR_v2_premium 数据集图片
构建方式
ULVR_v2_premium数据集是从ULVR_v2_clean全量数据中精心筛选的高质量子集,专为通用潜视觉推理任务设计。构建过程采用基于Qwen2.5-VL-7B模型的双重评估策略:针对每个候选样本,分别在不含与包含辅助中间图像的条件下回答视觉问题,并将结果划分为四个质量等级。其中,无辅助时回答错误而借助辅助图像转为正确的样本(P1级)被视为视觉推理步骤必要且有效的首要保留样本;无辅助时已然正确的样本(P2级)作为二级保留来源;而辅助图像导致错误或使正确答案变错的样本则被排除。针对视觉表示子集,采用更精细的逐表示信号评估,仅保留特定表示能真正提升回答正确性的样本。最终数据集包含262,556个高质量样本,并按推理类别划分为八个独立子集。
特点
该数据集的核心特点在于其精细化的质量分层与丰富的推理类别覆盖。每个样本均包含样本标识、类别标签、源数据信息、问题与答案、输入图像、最多三张中间辅助图像、中间步骤数量以及结构化的训练对话序列。八个子集分别聚焦于不同的视觉推理范式:边界框高亮与裁剪、文本思维链、交织辅助图像、抽象视觉表示生成、场景图推理、图表聚焦以及文档区域裁剪。这种设计使得数据集不仅能用于标准视觉问答,更能有效训练模型学习在推理过程中生成并利用中间视觉表示。所有数据均以Apache-2.0许可协议开放,且仅作为训练子集使用,不包含验证划分。
使用方法
使用该数据集极为便捷,通过HuggingFace Datasets库即可直接加载。用户可按推理类别指定子集名称进行访问,例如加载'bbox_highlight'子集用于边界框高亮推理任务,或加载'text_cot'子集用于文本思维链训练。支持流式加载模式以应对大规模数据处理需求。每个样本中的'messages_json'字段已预设为训练对话格式,包含系统提示、用户输入(图像与问题)以及包含特殊视觉标记和中间图像的助手回答结构,可直接用于多模态大语言模型的训练流程。值得注意的是,该数据集的样本质量信号来源于基础版本的Qwen2.5-VL-7B模型评估,作为质量代理指标而非对潜视觉推理价值的绝对度量。
背景与挑战
背景概述
ULVR_v2_premium数据集诞生于多模态大语言模型迅速发展的时代,由Ruoliu Yang等研究者于2024年构建,旨在攻克视觉推理中模型对潜在视觉中间表征利用不足的难题。该数据集聚焦于“通用潜在视觉推理”(Universal Latent Visual Reasoning)这一核心研究问题,精心筛选了262,556条高质量样本,覆盖边界框高亮、裁剪、文本思维链、辅助图像交错、抽象视觉表征、场景图推理、图表聚焦及文档裁剪等八类推理场景。作为ULVR_v2_clean的精选子集,它通过双评估质量分级机制(P1/P2/P3)确保了样本的纯度与教学价值,为多模态模型提供了一种系统化的训练资源,推动了视觉推理从浅层匹配向深层具象推理的范式转变。
当前挑战
视觉推理领域长期面临模型依赖显式文本提示而忽略视觉中间步骤的挑战,即仅凭问题与图像难以引导模型生成蕴含多步空间逻辑的正确回答。ULVR_v2_premium所解决的领域问题恰恰在于:如何通过显式或隐式的潜在视觉操作(如区域定位、图表示意生成)弥合视觉输入与语言输出之间的推理鸿沟。在数据集构建过程中,最大的挑战源自质量筛选的平衡——既要确保中间图像步骤的“必要性”,又要避免引入人工标注噪声。研究者采用双评估代理模型打分,但仅凭单次基座模型判断存在标注偏差,且对P3类样本的处置需依据不同子集特性灵活折衷(如场景图完全保留),而非统一丢弃,这进一步加剧了子集间标注一致性与推理难度控制的复杂性。
常用场景
经典使用场景
ULVR_v2_premium数据集的核心价值在于推动多模态大模型在潜在视觉推理(Latent Visual Reasoning)能力上的突破。该数据集被广泛用于训练具备中间视觉表征能力的视觉问答模型,模型不仅需要回答最终问题,还需在推理过程中生成或调用中间图像(如边界框高亮、裁剪区域、场景图等),从而显式地模拟人脑进行递进式视觉分析的过程,是评估模型‘看’与‘想’耦合程度的重要基准。
衍生相关工作
基于ULVR_v2_premium数据集,研究者们衍生了多项标志性工作。其中最具代表性的是Qwen2.5-VL模型的LVR(Latent Visual Reasoning)训练范式,通过引入该数据集中的视觉中间步骤,模型在推理时能够主动生成辅助图像(如裁剪结果、深度估计)并整合问答流程,显著提升了复杂视觉任务的零样本性能。此外,该数据集还催生了多种视觉链增强策略,如基于注意力驱动的边界框引导机制与结构化的场景图推理框架,进一步推动了多模态认知智能体的发展,成为连接基础视觉感知与高层语义推理的关键数据枢纽。
数据集最近研究
最新研究方向
在当前多模态大模型蓬勃发展的时代,视觉推理能力成为衡量模型智能水平的关键指标,而高质量、可解释的训练数据正是突破瓶颈的基石。ULVR_v2_premium数据集的问世,精准回应了“潜在视觉推理”这一前沿方向,其核心创新在于通过精心设计的辅助图像(如边界框高亮、裁剪、场景图、图表聚焦等),引导模型在推理链条中显式利用中间视觉表征,而非仅依赖端到端的文本生成。该数据集采用双评估筛选策略,确保每个样本的辅助视觉信息对正确答案具有实际增益,从而剔除噪声或误导性数据。此项工作不仅提升了视觉问答任务的透明度和可解释性,更为社区提供了构建具备结构化思维链的多模态智能体提供了标准化的训练资源,对于推动具身智能、科学图表理解等复杂场景下的可解释推理具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务