遇见数据集

ulvr_subset

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

ULVR stage-0子数据集是统一视觉潜在推理(ULVR)阶段0训练数据的精选嵌套子集,专门设计用于多模态视觉推理和潜在表示学习任务。它包含视觉问答和图像到文本两种核心任务类型。数据集采用双模式结构:latent模式提供预计算的教师潜在表示,遵循step0-all数据集的模式;source模式提供匹配的原始源样本,包括图像、问题、答案和对话消息,遵循ULVR_v2_clean数据集的模式。两种模式的数据可通过sample_id在类别内进行关联。数据集涵盖8个类别:bbox_crop、bbox_highlight、helper_interleaved、scene_graph、text_cot、depth、edge以及segmentation(在source中)或visual_representation(在latent中)。提供了7种不同规模的子集配置,总样本量从40,000到472,592不等,采用确定性嵌套选择机制,确保子集间的包含关系。数据以Parquet格式存储,包含图像字节、文本字段和潜在表示向量等多种数据类型。该数据集适用于训练和评估视觉语言模型、研究潜在表示学习、进行消融实验以及多模态推理任务。

The ULVR stage-0 sub-dataset is a curated nested subset of the Unified Visual Latent Reasoning (ULVR) stage-0 training data, specifically designed for multimodal visual reasoning and latent representation learning tasks. It includes two core task types: visual question answering and image-to-text. The dataset employs a dual-mode structure: the latent mode provides pre-computed teacher latent representations, following the pattern of the step0-all dataset; the source mode provides matching original source samples, including images, questions, answers, and conversation messages, following the pattern of the ULVR_v2_clean dataset. Data from both modes can be correlated within categories via sample_id. The dataset covers 8 categories: bbox_crop, bbox_highlight, helper_interleaved, scene_graph, text_cot, depth, edge, and segmentation (in source) or visual_representation (in latent). It offers 7 subset configurations of varying scales, with total sample sizes ranging from 40,000 to 472,592, using a deterministic nested selection mechanism to ensure inclusion relationships between subsets. Data is stored in Parquet format and includes various data types such as image bytes, text fields, and latent representation vectors. This dataset is suitable for training and evaluating vision-language models, researching latent representation learning, conducting ablation experiments, and performing multimodal reasoning tasks.

创建时间:
2026-06-03
原始信息汇总

数据集概览:ULVR stage-0 subsets (latent + source)

该数据集是 Unified Visual Latent Reasoning (ULVR) stage-0 训练数据的精选子集,提供两种类型的数据:latent(预计算的教师隐空间表示)和 source(原始样本,包含图像、问答对和消息)。

  • 许可协议:Apache-2.0
  • 任务类别:视觉问答 (visual-question-answering)、图像到文本 (image-to-text)
  • 标签:多模态、视觉推理、隐空间推理、教师隐空间、ULVR

数据组成与结构

每个子集文件夹包含两个子目录:

Latent 和 source 行通过 sample_id 在类别内可连接。

目录布局

<folder>/ latent/data/<category>/<category>-NNNNN.parquet source/data/<category>/<category>-NNNNN.parquet

类别 (<category>)bbox_crop, bbox_highlight, helper_interleaved, scene_graph, text_cot, depth, edge, segmentation

注意:segmentation 目录中的 source 行类别为 segmentation,其对应的 latent 行类别为 visual_representation


子集列表

子集文件夹 每个类别的样本数 总计
size-40k 全部 8 个类别 × 5,000 40,000
size-80k 全部 8 个类别 × 10,000 80,000
size-250k depth/edge/scene_graph/segmentation = 全部;bbox_crop/bbox_highlight/text_cot/helper_interleaved = 各 40,000 246,263
size-500k 全部数据 (完整 stage-0) 472,592
ablate-5 depth, edge, scene_graph, bbox_crop, helper_interleaved × 8,000 40,000
ablate-3 bbox_crop, depth, scene_graph × 13,334 40,002
ablate-1 bbox_crop × 40,000 40,000
  • ablate-8 等价于 size-40k,故未重复列出。

选择机制

  • 确定性:每个类别内的样本顺序基于种子为 42 的固定随机混洗排序。
  • 嵌套性size-40k ⊂ size-80k ⊂ size-250k ⊂ size-500k,即较小子集是较小子集的前缀。
  • ablate-* 子集同样遵循该固定顺序的前缀规则。

索引文件 (index/)

索引文件支持无需下载全部子集文件夹,仅下载完整的 size-500k 并通过索引切换子集。

文件路径 说明
index/master_order.parquet 所有 472,592 个样本的 ID,按 seed-42 排序;包含列:dataset_name, dir, sample_id, rank
index/<subset>.parquet 每个子集的确切 ID 列表;包含列:dataset_name, dir, sample_id
index/<subset>.jsonl 可用于训练的清单文件(stage2_train.jsonl 的子集,保持原始顺序)
index/subsets_spec.json 每个子集每个类别的容量及总计

推荐工作流:下载一次 size-500k,通过索引切换不同子集。


数据模式

latent 模式 (list<float16>): |

列名 类型 说明
sample_id - 样本唯一标识
category str 类别
source_dataset str 来源数据集
num_intermediate_steps int 中间步骤数
latent_dtype str 隐空间数据类型(固定为 "bfloat16")
latent_shape list[int64] 隐空间的形状,例如 [29, 8, 3584]
latent list[float16] 平铺的隐空间数据

source 模式: |

列名 类型 说明
sample_id - 样本唯一标识
category str 类别
source_dataset str 来源数据集
question str 问题文本
answer str 答案文本
input_image bytes 输入图像字节
intermediate_image_1/2/3 bytes 中间图像字节(可为空)
num_intermediate_steps int 中间步骤数
messages_json str 消息的 JSON 字符串

加载示例

加载 source 和 latent 数据: python from datasets import load_dataset

加载 source 子集 (size-40k)

src = load_dataset("RuoliuYang/ulvr_subset", "size-40k-source", split="train")

加载 matching latent 子集

lat = load_dataset("RuoliuYang/ulvr_subset", "size-40k-latent", split="train")

通过索引加载子集: python import pyarrow.parquet as pq from datasets import load_dataset

idx = pq.read_table("hf://datasets/RuoliuYang/ulvr_subset/index/ablate-5.parquet")

full_src = load_dataset("RuoliuYang/ulvr_subset", "size-500k-source", split="train") want_src = set(zip(idx["dir"].to_pylist(), idx["sample_id"].to_pylist())) sub_src = full_src.filter(lambda r: (r["category"], r["sample_id"]) in want_src)

full_lat = load_dataset("RuoliuYang/ulvr_subset", "size-500k-latent", split="train") want_lat = set(zip(idx["dataset_name"].to_pylist(), idx["sample_id"].to_pylist())) sub_lat = full_lat.filter(lambda r: (r["category"], r["sample_id"]) in want_lat)

解码图像: python from PIL import Image import io

img = Image.open(io.BytesIO(src[0]["input_image"]["bytes"]))


来源说明

  • Latent 数据:复现自 step0-all,以 float16 存储;原始 bfloat16 可无损恢复(最大绝对误差极小)。
  • Source 数据:复现自 ULVR_v2_clean,图像字节和文本/元数据列逐字复制。
  • source_dataset 列遵循 ULVR_v2_clean 的约定,在 latentsource 两部分中保持一致。
搜集汇总
数据集介绍
ulvr_subset 数据集图片
构建方式
该数据集构建于统一视觉潜在推理(ULVR)阶段零训练数据之上,通过精心设计的分层采样策略,衍生出多个不同规模的子集。每个子集均采用确定性的嵌套方式生成,即先对所有类别内的样本进行固定种子的随机打乱(seed=42),再依次截取前N个样本。这种设计确保了小规模子集始终是大规模子集的子集,从而为不同计算资源条件下的实验提供了灵活的选择。数据集同时提供源数据(source)与预计算教师潜在特征(latent)两套模式,两者通过唯一的样本编号(sample_id)在同一类别内实现精确关联。
特点
该数据集最显著的特征在于其双模态对齐的结构:源数据部分包含图像、问答对及完整的消息序列,而潜在特征部分则存储了教师模型生成的中间层表征,涵盖边界框裁剪、深度图、场景图等8种不同视觉推理任务。数据以Parquet格式高效存储,每个子集文件夹自包含,便于独立使用。所有子集均提供索引文件(index/),用户仅需下载完整数据集(size-500k)即可通过索引随时切换不同子集,无需重复下载。数据格式设计严谨,潜在特征以float16存储,经简单转换即可无损恢复为bfloat16格式,支持直接用于模型训练。
使用方法
推荐的工作流程为一次性下载最大规模子集(size-500k-source与size-500k-latent),再通过索引文件选择具体子集。用户可利用HuggingFace Datasets库加载数据,通过PyArrow读取索引文件中的样本编号与类别信息,然后对完整数据集执行过滤操作。对于源数据,图像以字节形式存储,可使用PIL库解码;潜在特征则以一维float16列表形式保存,需根据latent_shape信息重塑为多维张量并转换至bfloat16精度。此外,数据集的jsonl格式索引文件支持基于本地文件布局的训练流程,适用于将Parquet数据还原为.pt潜在特征文件与图像文件后的模型训练场景。
背景与挑战
背景概述
ULVR(Unified Visual Latent Reasoning)数据集由Ruoliu Yang等研究人员于近期创建,专注于推动多模态视觉推理领域的发展。该数据集通过整合教师网络生成的潜在表示(latents)与原始图像-文本对,旨在为视觉问答(VQA)和图像到文本生成任务提供统一的训练资源。其核心研究问题在于如何利用结构化的潜在推理路径提升模型的跨模态理解能力。ULVR数据集以其分阶段、嵌套式的子集划分方式(涵盖40k至500k样本规模)以及丰富的视觉特征(如边界框、场景图、深度图等八类标注)著称,为多模态模型的训练和消融实验提供了灵活且标准化的基准。该数据集已在相关研究中展现出对视觉推理任务性能的显著提升潜力,成为领域内探索潜在推理机制的重要资源。
当前挑战
当前,ULVR数据集面临的主要挑战包括:1)多模态推理中不同视觉特征(如深度图与场景图)的异构表示如何有效融合,以避免信息冗余或冲突;2)教师潜在向量的存储与重建过程(float16至bfloat16转换)中,虽误差微小,但仍需验证其对长序列训练稳定性的影响;3)数据集构建时需协调八个类别的样本平衡(如size-40k中每类仅5000例),确保消融实验(ablate系列)的统计可靠性;4)大规模子集(如size-500k)的索引过滤操作(基于sample_id的集合匹配)在分布式训练中的效率优化,以及嵌套子集间确定性采样策略(seed=42)对模型泛化能力的潜在偏差。
常用场景
经典使用场景
在视觉与语言融合的多模态推理研究领域,ULVR 子集数据集为训练和评估视觉潜在推理模型提供了关键资源。其最经典的用途是作为统一视觉潜在推理框架的阶段性训练数据,研究者可利用其中成对提供的原始图像问答样本与预计算的教师潜在表示,进行从视觉感知到高层语义推理的端到端学习。该数据集的嵌套子集设计允许科研人员灵活选择不同规模与控制变量组合,高效地进行消融实验与控制变量分析,从而深入探究不同视觉线索——如边界框、场景图、深度图等——对模型潜在推理路径的影响。这种结构化的数据供给方式,使其成为理解视觉推理中潜在空间构造与利用的标杆性实验平台。
解决学术问题
该数据集着力破解多模态推理研究中两大核心瓶颈:其一,如何将视觉特征的高维表征与语言推理的抽象符号系统有效对齐,其内置的教师潜在表示为此提供了可复现的桥梁;其二,如何系统评估不同视觉信息类型——如目标检测、空间关系、纹理与深度——对推理质量的独立贡献。通过提供严格控制的消融子集,该数据促使研究者厘清视觉表征质量与推理准确率之间的因果关系,推动领域从模型集成性能竞赛回归至机制理解层面。其对潜在空间进行显式建模与存储的创新范式,重塑了多模态学习的研究路径,为后续工作奠定了可比较、可复现的基准平台。
衍生相关工作
该数据集的出现催生了一系列探索视觉潜在语义空间与推理路径的方法论工作。基于其提供的教师潜在表征,研究者相继提出了潜在推理链蒸馏框架、潜在干预式视觉问答模型,以及基于潜在空间的鲁棒性分析工具。在模型层面,衍生了利用该数据集进行预训练的轻量级多模态编码器以适配下游任务,并出现了关注视觉潜在空间可解释性的解析性研究。此外,其嵌套消融子集的设计思路被后续多个视觉语言数据集采纳,成为一种规范的实验控制基准。这些衍生工作共同构建了从数据供给到理论建模再到应用迁移的完整学术生态,推动了视觉推理研究从数据驱动向机制驱动的转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务