遇见数据集

ULVR_v2_clean

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

ULVR_v2_lean 是一个经过清理的通用潜在视觉推理训练数据集,专为多模态视觉问答和视觉推理任务设计。该数据集旨在训练或评估模型执行需要潜在推理的视觉理解任务,即模型不仅需要给出答案,还需要展示其推理过程中的中间视觉步骤。数据集包含八个不同的子集(配置),每个子集都围绕特定的视觉处理或表示技术构建,例如文本思维链(text_cot)、边界框高亮(bbox_highlight)、边界框裁剪(bbox_crop)、视觉表示(visual_representation)、助手交错(helper_interleaved)、图表聚焦(chart_focus)、场景图(scene_graph)和文档裁剪(doc_crop)。每个数据样本均包含一个输入图像、一个自然语言问题以及对应的答案。此外,样本还提供了模型推理过程中生成的一系列中间视觉步骤图像(最多三个)以及记录对话过程的消息JSON,完整呈现了从问题到答案的多步视觉推理链条。数据集总计提供约1,435,539个训练样本和18,860个验证样本,规模庞大且覆盖多样化的视觉推理场景。相较于原始版本,本数据集进行了系统的清理工作,包括合并数据分割、移除对模型训练有害的样本、修复答案、统一数据格式并执行去重,确保了数据质量与一致性。

ULVR_v2_lean is a cleaned general-purpose latent visual reasoning training dataset, purpose-built for multimodal visual question answering (VQA) and visual reasoning tasks. This dataset is designed to train or evaluate models for visual understanding tasks that require latent reasoning, wherein models must not only output the final answer but also exhibit the intermediate visual steps throughout their reasoning process. The dataset comprises eight distinct subsets (configurations), each constructed around a specific visual processing or representation technique, including text chain-of-thought (text_cot), bounding box highlight (bbox_highlight), bounding box cropping (bbox_crop), visual representation (visual_representation), helper interleaved (helper_interleaved), chart focus (chart_focus), scene graph (scene_graph), and document cropping (doc_crop). Each data sample includes an input image, a natural language question, and its corresponding answer. Furthermore, each sample provides up to three intermediate visual step images generated during the model's reasoning procedure, alongside a message JSON file that records the dialogue process, fully encapsulating the multi-step visual reasoning chain from the initial question to the final answer. In total, the dataset contains approximately 1,435,539 training samples and 18,860 validation samples, featuring a substantial scale and covering a wide range of diverse visual reasoning scenarios. Compared with the original version, this dataset has undergone systematic data cleaning, including merging data splits, removing samples that are detrimental to model training, correcting erroneous answers, unifying data formats, and conducting deduplication, thus ensuring data quality and consistency.

创建时间:
2026-05-29
原始信息汇总

数据集概述:ULVR_v2_clean

数据集地址:https://huggingface.co/datasets/RuoliuYang/ULVR_v2_clean

许可证:Apache-2.0

任务类别:视觉问答(Visual Question Answering)

标签:视觉推理、多模态、潜在推理

数据集描述: ULVR_v2_clean 是通用潜在视觉推理(Universal Latent Visual Reasoning)训练数据的清理版本,包含 8 个子集(类别),每个子集均划分为训练集和验证集。每个样本包括一张输入图像、一个相关问题,助手输出包含 <abs_vis_token>、中间视觉推理步骤和 oxed{answer} 格式的答案。

数据集构成

子集 训练集样本数 验证集样本数
text_cot 340,473 4,115
bbox_highlight 311,016 5,167
bbox_crop 333,662 3,283
visual_representation 57,123 1,427
helper_interleaved 350,653 4,484
chart_focus 15,056 161
scene_graph 17,945 138
doc_crop 9,611 85
总计 1,435,539 18,860

各子集特征

每个子集均包含以下字段:

  • sample_id(字符串)
  • category(字符串)
  • source_dataset(字符串)
  • question(字符串)
  • answer(字符串)
  • input_image(图像)
  • intermediate_image_1(图像)
  • intermediate_image_2(图像)
  • intermediate_image_3(图像)
  • num_intermediate_steps(整数)
  • messages_json(字符串)

数据文件

每个子集的数据文件存储在对应的 Parquet 文件中,训练集和验证集分开存放:

  • text_cot:data/text_cot/*.parquet(训练集),data/text_cot_val/*.parquet(验证集)
  • bbox_highlight:data/bbox_highlight/*.parquet(训练集),data/bbox_highlight_val/*.parquet(验证集)
  • bbox_crop:data/bbox_crop/*.parquet(训练集),data/bbox_crop_val/*.parquet(验证集)
  • visual_representation:data/visual_representation/*.parquet(训练集),data/visual_representation_val/*.parquet(验证集)
  • helper_interleaved:data/helper_interleaved/*.parquet(训练集),data/helper_interleaved_val/*.parquet(验证集)
  • chart_focus:data/chart_focus/*.parquet(训练集),data/chart_focus_val/*.parquet(验证集)
  • scene_graph:data/scene_graph/*.parquet(训练集),data/scene_graph_val/*.parquet(验证集)
  • doc_crop:data/doc_crop/*.parquet(训练集),data/doc_crop_val/*.parquet(验证集)

数据清理说明

与原始 ULVR_v2 相比,清理工作包括:

  • 将每个类别的测试集合并到训练集中。
  • 移除了每个类别中的 AVOID/genuine_dirty(helper-hurts)样本。
  • 应用了 VR repr-hurts 过滤器。
  • 从 ArxivQA 恢复了 doc_crop 的答案。
  • 清理了 VR 答案标记并统一了中间图像。
  • 统一了 messages_json 包装格式。
  • 对 helper_interleaved 进行了去重,移除了 64,071 个字节相同的行。

数据加载示例

python from datasets import load_dataset ds = load_dataset("RuoliuYang/ULVR_v2_clean", "text_cot", split="train")

搜集汇总
数据集介绍
ULVR_v2_clean 数据集图片
构建方式
在视觉推理领域,多模态模型的训练高度依赖于蕴含中间推理步骤的高质量数据。ULVR_v2_clean数据集正是在此背景下应运而生,它是对原始ULVR_v2版本的精细化清洗与重构。构建过程包含八大子集,每个子集均以“输入图像+问题”的范式组织样本,助理模型需输出抽象视觉令牌、中间视觉步骤序列以及最终框定答案。清洗工作尤为深入:将各子集的测试集并入训练集,删除了每个类别中标记为AVOID与genuine_dirty的有害样本,并针对视觉表示子集实施了hurt样本过滤。此外,从ArxivQA中恢复了doc_crop子集的答案,统一规范了视觉答案标记与辅助图像一致性,最终通过消息格式的统一封装与helper_interleaved子集的字节级去重,移除了超过六万行冗余数据。
特点
该数据集的核心特质在于其多维度、多粒度的中间视觉推理表征能力。八个配置子集分别从文本思维链、边界框高亮与裁剪、视觉表示、辅助交叠、图表聚焦、场景图解析以及文档裁剪等角度,刻画了视觉推理的不同侧面。每个样本均包含最多三张中间图像,用以可视化推理的逐步演化过程,配合num_intermediate_steps字段精确控制推理链长度。数据总量超过一百四十三万训练样本与一万八千验证样本,规模宏大且分布均衡。尤其值得关注的是,数据集通过messages_json字段统一存储多轮对话结构,为潜在的交互式推理任务提供了便利。学科覆盖面广,兼顾了自然图像与文档图表等专业领域,展现了极强的泛化潜力。
使用方法
研究人员可通过HuggingFace的datasets库便捷加载该数据集。使用时需明确指定配置名称与数据切分,例如load_dataset("RuoliuYang/ULVR_v2_clean", "text_cot", split="train")即可获取文本思维链子集的训练样本。每个样本遵循标准的多模态结构,输入图像为PIL图像格式,中间图像以相同格式依次排列。研究人员既可以利用question与answer字段进行端到端的视觉问答训练,也可借助intermediate_image系列字段构建分段式的推理模型。对于需要结构化对话交互的场景,messages_json字段提供了完整的对话消息历史。建议用户根据具体任务选择合适的子集,例如图表推理可选用chart_focus,文档理解可选用doc_crop,通用视觉推理则推荐text_cot或bbox_highlight等规模较大的配置。
背景与挑战
背景概述
ULVR_v2_clean数据集由研究机构或团队于近期构建并发布,旨在推动多模态视觉推理领域的发展,特别是在潜在视觉推理(Latent Visual Reasoning)任务上。该数据集聚焦于视觉问答(Visual Question Answering)这一核心研究问题,通过引入中间视觉步骤(intermediate visual steps)和抽象视觉标记(<abs_vis_token>),使模型能够进行类似于人类的多步视觉推理。数据集包含8个子集,如text_cot、bbox_highlight等,覆盖了从文本链式推理到边界框标注、场景图理解等多种视觉推理场景,总计超过140万训练样本。其在多模态学习社区中具有重要影响力,为评估和提升视觉语言模型的推理能力提供了标准化基准。
当前挑战
ULVR_v2_clean数据集面临的挑战具有双重性。在领域问题层面,核心挑战是如何使视觉语言模型突破简单模式匹配,实现真正推理驱动的理解,例如对遮挡、非典型视角或复杂关系场景的解析,这要求模型在缺乏显式视觉信息时仍能进行有效的中间表征推断。在构建过程中,挑战包括从原始数据中精确提取和标注多步推理路径,确保中间图像与推理步骤的一致性,并清理如AVOID样本(helper-hurts)和重复数据,例如helper_interleaved子集移除了64,071行重复条目。此外,doc_crop子集的答案需从ArxivQA中恢复,以及VR答案标注的统一和辅助图像的对齐,均需要复杂的自动化校验与人工介入,以保证数据质量与科学价值。
常用场景
经典使用场景
在视觉与语言交叉领域,ULVR_v2_clean数据集以其精巧的结构设计,成为训练多模态大模型进行视觉推理的基石。其核心使用场景在于引导模型通过一连串中间视觉步骤(如边界框高亮、区域裁剪、场景图构建等)来逐步解答视觉问答任务,而非直接给出答案。这种“链式视觉推理”范式,使得模型能够复现人类逐步检视图像细节的认知过程,尤其适用于需要空间理解、逻辑演绎或视觉证据定位的复杂问题。
实际应用
在实际应用中,ULVR_v2_clean训练出的模型可被部署于需要严格视觉验证的场景,如自动医学影像报告解读,要求模型不仅指出病灶,还需高亮关键区域并分步解释诊断依据。在工业质检领域,模型能针对产品图像执行局部检查,通过裁剪和比对中间图像来判断缺陷。此外,在智能教育辅助系统中,该数据集支撑的模型能够为学生的几何或图表题目生成可视化解题步骤,实现交互式辅导。
衍生相关工作
基于ULVR_v2_clean的中间视觉步骤设计理念,衍生出一系列经典工作。例如,研究者提出了“视觉思维链”框架,将语言思维链的成功范式迁移至视觉模态。部分工作专注于优化中间图像表征的生成效率,通过场景图压缩与边界框注意力机制减少计算开销。另一分支工作则探索将该数据集的清洗流程与对抗训练结合,提升模型对视觉干扰项的鲁棒性。此外,多模态指令微调领域已将其子集作为基准,以衡量模型在分步视觉推理任务上的生成忠实度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务