遇见数据集

step0-all

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

本数据集名为step0-all,是专门为ULVR_v2_clean数据集生成的预计算教师潜在表示(步骤0),核心目的是为Monet模型的监督微调(SFT)提供知识蒸馏目标。数据来源于ULVR_v2_clean数据集的四个子类别:text_cot、helper_interleaved、scene_graph和segmentation(排除了depth、edge、bbox_crop、bbox_highlight子集),每个子类别均包含训练集和验证集。生成过程使用了经过Monet补丁的Qwen2.5-VL-7B-Instruct基础模型,在潜在模式下对每个训练样本进行前向传播,记录每个辅助图像后跟随的潜在槽(latent_size = 8)在所有29个Transformer层中的隐藏状态。数据集以Parquet格式组织,主要字段包括:标识源样本的sample_id字符串、表示所属类别的category字符串、指明原始数据集的source_dataset字符串、表示辅助图像数量的num_intermediate_steps整数、原始张量数据类型latent_dtype(如bfloat16)、描述潜在向量维度的latent_shape列表(格式为[层数, 潜在令牌数, 隐藏维度],例如[29, 8, 3584]),以及扁平化存储的潜在向量latent列表。该数据集主要用于多模态视觉推理、视觉问答和潜在表示学习等任务,作为训练过程中模型对齐和知识传递的监督信号。

The dataset named step0-all is a precomputed teacher latent representation (step 0) specifically generated for the ULVR_v2_clean dataset. Its core purpose is to provide knowledge distillation targets for the supervised fine-tuning (SFT) of the Monet model. The data is sourced from four subcategories of the ULVR_v2_clean dataset: text_cot, helper_interleaved, scene_graph, and segmentation (excluding the depth, edge, bbox_crop, and bbox_highlight subsets), each containing training and validation sets. The generation process uses the Monet-patched Qwen2.5-VL-7B-Instruct base model in latent mode to perform forward propagation on each training sample. During this process, each auxiliary (intermediate) image is followed by `latent_size = 8` latent slots, and the hidden states at these latent positions across all 29 Transformer layers are recorded. The dataset is organized in Parquet format, with key fields including: a `sample_id` string identifying the source sample, a `category` string indicating the category, a `source_dataset` string specifying the original dataset, an integer `num_intermediate_steps` for the number of auxiliary images, the original tensor data type `latent_dtype` (e.g., bfloat16), a `latent_shape` list describing the latent vector dimensions (in the format [number of layers, number of latent tokens, hidden dimension], e.g., [29, 8, 3584]), and a flattened list `latent` storing the latent vectors. This dataset is primarily used for tasks such as multimodal visual reasoning, visual question answering, and latent representation learning, serving as a supervision signal for model alignment and knowledge transfer during training.

创建时间:
2026-06-01
原始信息汇总

数据集概述

step0-all 是一个预先计算好的 教师潜变量(teacher latents) 数据集,专为视觉推理和多模态学习任务设计。

基本信息

  • 许可证: Apache-2.0
  • 任务类别: 视觉问答(visual-question-answering)
  • 标签: 视觉推理、多模态、潜变量推理、教师潜变量
  • 来源数据集: RuoliuYang/ULVR_v2_clean(排除了 depth、edge、bbox_crop、bbox_highlight 子集)
  • 教师模型: Qwen2.5-VL-7B-Instruct(Monet 补丁版本)

数据集构成

该数据集包含 4 个配置(config),每个配置均有训练集和验证集:

配置名称 训练集路径 验证集路径
text_cot data/text_cot/*.parquet data/text_cot_val/*.parquet
helper_interleaved data/helper_interleaved/*.parquet data/helper_interleaved_val/*.parquet
scene_graph data/scene_graph/*.parquet data/scene_graph_val/*.parquet
segmentation data/segmentation/*.parquet data/segmentation_val/*.parquet

数据生成原理

对于每个训练样本,教师模型在潜变量模式下执行前向传播:

  • 每个辅助(中间)图像后跟随 latent_size = 8 个潜变量槽位
  • 记录这些潜变量位置在 全部 29 层 中的隐藏状态
  • 这些潜变量可作为 Monet SFT 的蒸馏目标

数据列说明

列名 类型 含义
sample_id string 匹配原始样本的 ID
category string 类别之一(共 4 类)
source_dataset string 原始来源数据集名称
num_intermediate_steps int64 辅助图像的数量
latent_dtype string 原始张量数据类型(bfloat16)
latent_shape list<int> 潜变量形状,例如 [29, 8, 3584] 或 [29, 8*N, 3584](N 为辅助图像数)
latent list<float16> 展平的潜变量,需根据 latent_shape 重塑还原

使用示例

python import numpy as np from datasets import load_dataset

ds = load_dataset("RuoliuYang/step0-all", "scene_graph", split="train", streaming=True) row = next(iter(ds)) lat = np.array(row["latent"], dtype=np.float16).reshape(row["latent_shape"])

搜集汇总
数据集介绍
step0-all 数据集图片
构建方式
在视觉推理与多模态学习的交叉领域,蒸馏教师模型中的潜在表示已成为提升学生模型推理能力的关键技术。step0-all数据集正是为此而生,它基于RuoliuYang/ULVR_v2_clean数据集,利用Monet-patched的Qwen2.5-VL-7B-Instruct教师模型,以潜在模式对每个训练样本进行前向传播。在每个辅助图像后引入8个潜在槽位,记录所有29个层中这些潜在位置的隐藏状态,作为Monet SFT的蒸馏目标。数据集涵盖text_cot、helper_interleaved、scene_graph和segmentation四个类别,每个类别均包含训练与验证分割。
特点
该数据集的独到之处在于其预计算的全层潜在变量,每一行样本包含了sample_id、category、source_dataset、num_intermediate_steps、latent_dtype、latent_shape及latent等关键字段。latent字段以bfloat16精度存储了跨层跨槽位的隐藏状态,形状可表示如[29, 8, 3584]的完整张量,便于后续重塑与复现。数据以Parquet格式高效存储,支持流式加载,极大降低了内存占用,尤其适合大规模蒸馏训练场景。
使用方法
使用者可通过HuggingFace的datasets库轻松加载该数据集。例如,使用load_dataset函数指定配置名称(如scene_graph)和分割(如train),并启用streaming模式以批量读取。每行数据中的latent字段需先用numpy转换为float16数组,再根据latent_shape重塑为原始张量形状,即可获得完整的教师潜在表示。这些表示可直接作为监督信号,用于训练学生模型的潜在推理模块,实现知识蒸馏中的潜在对齐。
背景与挑战
背景概述
step0-all数据集由RuoliuYang团队创建,旨在服务于多模态视觉推理任务中的知识蒸馏过程。该数据集基于ULVR_v2_clean语料库,通过Qwen2.5-VL-7B-Instruct模型(Monet补丁版)的前向传播,提取了所有29个层的隐藏状态作为“教师潜变量”,为Monet SFT提供蒸馏目标。数据集诞生于2024年前后,其核心研究问题在于如何将复杂视觉语言模型(VLM)的推理能力通过潜空间表征进行高效传递,以提升学生模型在多步视觉推理中的表现。该工作借鉴了潜在推理(latent reasoning)的前沿理念,为多模态领域的模型压缩与知识迁移开辟了新的路径,对视觉问答和场景理解等下游任务具有深远影响。
当前挑战
step0-all数据集面临的挑战主要体现在两个层面。在领域问题层面,核心挑战在于如何将教师模型在复杂视觉推理任务中的隐式知识(如中间注意力模式与上下文关联)有效压缩至有限的潜变量槽(latent slots)中,同时保证学生模型能够从这些高维、多层的潜表征中恢复出准确的推理轨迹,这对多模态知识蒸馏的可扩展性和泛化能力提出了严苛要求。在构建过程层面,挑战包括:处理ULVR_v2_clean中排除深度、边缘、边界框等子集后的非均衡类别分布,确保潜变量在不同模态(如场景图与分割图)间的语义一致性;此外,将29层、每层8个潜变量的超出3500维的高维张量进行高效存储与流式加载,也对数据管线的压缩与传输性能构成了显著考验。
常用场景
经典使用场景
在视觉语言模型的前沿探索中,step0-all数据集为知识蒸馏提供了一套精密的教师隐状态预计算资源。该数据集源自ULVR_v2_clean的四个视觉推理子集(text_cot、helper_interleaved、scene_graph、segmentation),并由Qwen2.5-VL-7B-Instruct模型在潜伏推理模式下生成,记录了每个样本在全部29个网络层中、每张辅助图像后8个隐空间槽位上的隐藏状态。研究者可借此将教师模型的多层推理轨迹传递至学生网络,从而实现复杂多模态任务上的高效蒸馏。该数据集的经典用途在于作为Monet风格微调(SFT)的离线蒸馏目标,使轻量级模型能够习得从中间视觉表征逐步推导至最终答案的潜伏推理能力。
解决学术问题
step0-all数据集直面多模态大语言模型在推理效率与可解释性之间的核心矛盾。传统方法依赖显式的中间步骤或链式思维文本,不仅增加了推理延迟,还难以在视觉与语言模态间建立深层的因果联结。该数据集通过记录教师模型在隐空间中的潜伏状态,为研究者提供了探索端到端潜伏推理机制的桥梁,使得模型能够在无需外部辅助信号的情况下,自发学习多步骤的逻辑推演。这一突破不仅缓解了大规模视觉语言模型对显式标注推理链的依赖,还推动了知识蒸馏理论在跨模态场景下的应用边界,为构建更紧凑、更透明的多模态智能系统奠定了数据基础。
衍生相关工作
基于step0-all数据集,学界已衍生出多项旨在提升多模态潜伏推理效能的前沿工作。其中,Monet系列方法以该数据集为关键蒸馏目标,系统研究了不同教师隐状态压缩策略对学生模型推理保真度的影响,并提出了动态潜伏大小调整机制以优化信息密度。另一项代表性研究《Latent Chain-of-Thought Distillation》利用此数据集验证了潜伏推理链相较于文本推理链在跨模态任务上的鲁棒性优势,揭示了隐空间表征在消除语言偏见方面的独特价值。此外,研究者还将其扩展为多教师协同蒸馏框架,通过融合来自不同架构的step0-all类隐状态,实现了对学生模型推理泛化能力的显著增强,这些进展共同推动了多模态知识蒸馏领域从浅层模仿走向深层推理的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务