遇见数据集

VBVR-Pro-SFT-Image

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

VBVR-Pro-SFT-Image 是 VBVR-Pro 项目中的图像交错监督微调子集,旨在训练模型将推理过程渲染为一系列图像(而非视频)。该数据集包含 250 个参数化任务,共 1,250,000 个程序生成的推理实例(每个任务 5,000 个实例)。每个实例以 512x512 的初始帧图像作为条件,并附带详细的元数据(任务参数、真实答案、评分协议)和指令文本(prompt.txt)。输出为一系列图像帧(frame_1.png 至 frame_N.png,N 取值范围 1-21,取决于任务),表示推理步骤。数据集总大小约 66.1 GB,以 250 个 tar.gz 压缩包形式组织(每个任务一个),并配有相应的 JSONL 标注文件和全局索引文件。数据采用 CC BY-NC 4.0 许可。该数据集适用于视觉推理、图像生成、交错图像生成等任务的训练与评估。

VBVR-Pro-SFT-Image is an image interleaved supervised fine-tuning subset of the VBVR-Pro project, designed to train models to render the reasoning process as a series of images (rather than videos). The dataset contains 250 parameterized tasks, totaling 1,250,000 procedurally generated reasoning instances (5,000 instances per task). Each instance is conditioned on an initial 512x512 frame image, accompanied by detailed metadata (task parameters, ground truth answers, scoring protocols) and instruction text (prompt.txt). The output is a series of image frames (frame_1.png to frame_N.png, where N ranges from 1 to 21 depending on the task), representing reasoning steps. The total dataset size is approximately 66.1 GB, organized as 250 tar.gz archives (one per task), along with corresponding JSONL annotation files and a global index file. The data is licensed under CC BY-NC 4.0. This dataset is suitable for training and evaluation on tasks such as visual reasoning, image generation, and interleaved image generation.

创建时间:
2026-08-17
原始信息汇总

VBVR-Pro-SFT-Image 数据集总结

数据集简介

VBVR-Pro-SFT-Image是VBVR-Pro项目的交错图像监督微调(interleaved-image supervised-fine-tuning) 数据分割,包含125万个通过程序化方式生成的推理实例,覆盖250个参数化任务,每个任务对应一个独立的tar.gz压缩包。该分割要求模型以图像序列的形式呈现推理过程,与要求以视频形式呈现推理过程的VBVR-Pro-SFT-Video数据集互补。

核心统计

属性 数值
任务数量 250
实例数量 1,250,000(每个任务5,000个)
压缩包数量 250个tar.gz文件,每个任务一个
总体大小 66.1 GB
分辨率 512 × 512
输出帧数 每个实例1–21帧,依任务而定

适用场景

  • 图像生成
  • 交错生成(Interleaved Generation)
  • 视觉推理训练

数据组织结构

数据集目录结构如下:

  • tars/:包含250个按任务分组的tar.gz压缩包
  • annotated_jsonl/:包含250个与任务对应的交错训练JSONL文件
  • meta_image_train.json:任务索引文件

每个解压后的压缩包内部结构为:

  • 每个样本包含:
    • first_frame.png:条件图像(512 × 512)
    • metadata.json:任务参数、真值标签和评分契约
    • image/ 目录:包含 prompt.txt(指令)和 frame_1.pngframe_N.png(参考输出步骤)
  • 每个任务包含5,000个样本,样本ID从 0000000000004999
  • 所有250个压缩包结构一致且互不重叠,可解压至同一目录

索引文件 meta_image_train.json 将每个任务映射到其对应的JSONL文件,包含任务名称、注释文件路径、数据长度、重复次数、任务类型及是否多轮等信息。JSONL中每条记录包含 idimage(图像路径列表)和 conversations(系统/人类/GPT多轮对话,GPT回复中交错包含推理文本和图像占位符)等字段。

数据下载与使用

可通过 huggingface-cli 命令行工具下载数据集,也可配合VBVR-Pro训练代码中的 prepare_data.py 脚本直接生成训练清单。若需直接使用数据,可将所有压缩包解压至同一目录并更新 root 字段路径。

许可协议

  • 代码部分:Apache License 2.0
  • 数据及基准材料:CC BY-NC 4.0(非商业使用)
  • 模型权重及第三方材料遵循其各自的上游条款

相关资源

  • 项目主页:https://video-reason.com/?v=pro
  • 论文:https://arxiv.org/abs/2608.26105
  • 训练与推理代码:https://github.com/Video-Reason/VBVR-Pro
  • 评估代码:https://github.com/Video-Reason/VBVR-Pro-Bench
  • 视频版本数据集:https://huggingface.co/datasets/Video-Reason/VBVR-Pro-SFT-Video
  • 强化学习数据集:https://huggingface.co/datasets/Video-Reason/VBVR-Pro-RL
  • 基准测试数据集:https://huggingface.co/datasets/Video-Reason/VBVR-Pro-Bench
  • 排行榜:https://video-reason.com/pro/bench/#leaderboard
搜集汇总
数据集介绍
VBVR-Pro-SFT-Image 数据集图片
构建方式
VBVR-Pro-SFT-Image作为VBVR-Pro套件中的交错图像监督微调分割,其构建依托于程序化生成范式,涵盖250个参数化任务,每个任务精心设计了5000个推理实例,总计逾124万个样本。每个任务以独立压缩档案形式存储,内含条件图像、元数据及参考输出图像序列,并配套详细的JSONL标注文件,系统性地将推理过程映射为多帧视觉表达,确保任务多样性与结构一致性。
特点
该数据集的核心特色在于其高度的结构化和可验证性,每个实例均携带完整的任务参数、真值标签及评分契约,支持精准的模型训练与评估。其图像序列输出设计灵活,从单帧至多帧不等,适应不同推理深度需求。此外,索引文件实现了任务与标注的高效映射,且各任务间无重叠,便于灵活组合与扩展,为多模态推理研究提供了坚实的数据基础。
使用方法
使用者可借助HuggingFace CLI便捷下载数据集,并通过VBVR-Pro官方训练代码一步完成解压与数据清单生成。亦可手动解压全部归档至统一目录,并调整索引文件中的根路径。数据格式兼容主流训练框架,其中conversations字段采用交错式对话结构,巧妙融合思考文本与图像占位符,便于直接输入至多模态模型进行监督微调,显著降低数据预处理复杂度。
背景与挑战
背景概述
VBVR-Pro-SFT-Image数据集由Video-Reason团队于2026年发布,是VBVR-Pro套件中用于图像交错生成的监督微调分割,包含125万个通过程序化方式生成的推理实例,覆盖250个参数化任务,每个任务包含5000个样本。该数据集的核心研究问题在于推动原生视觉推理能力的发展,要求模型将推理过程以图像序列的形式呈现,而非传统的文本或视频。其构建基于可扩展的生成框架,每个实例均配有条件图像、指令、参考输出及元数据,确保了数据的多样性和可验证性。该数据集在视觉推理领域具有重要影响,为多模态大模型提供了高质量的训练资源,尤其适用于需要细致视觉推理能力的场景。
当前挑战
该数据集面临的挑战主要来自领域问题和构建过程两方面。在领域问题层面,视觉推理任务本身具有高度复杂性,要求模型不仅理解静态图像,还需生成连贯的多帧序列来展示推理步骤,这超出了传统图像生成或视觉问答的范畴。在构建过程中,挑战在于确保250个任务的数据质量与一致性,每个任务需设计参数化指令和标注方案,并生成结构化的推理链,同时要避免任务间的重叠。此外,数据规模庞大(66.1 GB),需要有效的存储和索引方案,以及确保生成的图像序列在视觉和语义上均准确反映推理过程,这要求高度自动化的质量控制机制。
常用场景
经典使用场景
VBVR-Pro-SFT-Image作为VBVR-Pro套件中专门针对交错图像生成与视觉推理任务的监督微调数据分割,其核心应用场景在于训练多模态大语言模型以图像序列形式逐步呈现推理过程。该数据集包含250个参数化任务、逾百万个程序化生成的推理实例,每个实例由条件图像、指令文本及对应的多帧参考输出构成,为模型提供了结构化、可验证的视觉推理训练材料。研究者借助此数据,可引导模型在生成最终答案前,先通过一系列中间图像进行显式推理,从而强化模型在复杂视觉任务中的逐步思考能力。该数据集特别适用于需要精细空间或时序理解的任务,如物体重现处理、多步操作规划等,其设计支持灵活的交错训练协议,便于与文本推理协同优化。
衍生相关工作
VBVR-Pro-SFT-Image的发布催生了一系列衍生研究方向。其一,围绕交错图像生成与推理的联合优化,研究者开始探索统一的训练框架,将图像序列生成与文本推理无缝衔接,推动了多模态指令跟随模型的发展。其二,该数据集的程序化生成范式激发了对自动化数据合成方法的研究,即如何利用参数化任务模板批量生成高质量、可验证的训练样本,以缓解人工标注的成本瓶颈。其三,基于其可验证特性,相关研究进一步拓展了推理模型的强化学习策略,利用任务评分契约作为奖励信号,提升模型的自我修正与探索能力。此外,该数据集还促进了跨模态推理基准的建立,衍生出诸如视频推理、多轮交互推理等扩展任务,为多模态智能体的整体演进提供了重要参考。
数据集最近研究
最新研究方向
该数据集聚焦于视觉推理与图像生成的前沿交叉领域,通过程序化生成的大规模交错图像训练样本,推动模型在多步骤视觉推理任务中的精细化表征学习。其1.24M实例覆盖250种参数化任务,强调以图像序列形式呈现推演过程,这一设计旨在弥合静态图像理解与动态思维链生成之间的鸿沟,为构建具备原生视觉推理能力的多模态模型奠定数据基础。相关研究趋势显示,此类可验证、可扩展的合成数据正成为训练下一代视觉语言模型的核心资源,尤其在家具操作、物体重现等复杂场景中,其影响在于提升模型对时空一致性与因果逻辑的建模能力,对具身智能、自动内容创作等领域具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务