遇见数据集

VBVR-Pro-SFT-Video

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

VBVR-Pro-SFT-Video 是 VBVR-Pro 项目中的视频监督微调数据集,专为图像到视频生成和视觉推理任务设计。该数据集包含约 125 万个程序化生成的推理实例,涵盖 250 个参数化任务(每个任务 5000 个样本)。每个样本包括一个 512×512 像素的条件图像、元数据(任务参数、真实值、评分合约)、参考视频(16 fps,H.264 编码,CRF 20)、最终帧以及指令提示。数据集总大小约 76.6 GB,以 250 个 tar.gz 压缩包形式提供(每个任务一个),解压后每个样本的目录结构一致。该数据集可用于训练视频生成模型和视觉推理模型,特别适用于需要程序化生成、可控推理以及大规模监督微调的场景。

VBVR-Pro-SFT-Video is a video supervised fine-tuning dataset in the VBVR-Pro project, designed for image-to-video generation and visual reasoning tasks. It contains approximately 1.25 million programmatically generated reasoning instances covering 250 parametrized tasks (5,000 samples per task). Each sample includes a 512×512 conditional image, metadata (task parameters, ground truth, scoring contract), reference video (16 fps, H.264 encoding, CRF 20), final frame, and instruction prompt. The total dataset size is about 76.6 GB, provided as 250 tar.gz archives (one per task). After decompression, each sample has a consistent directory structure. This dataset can be used to train video generation models and visual reasoning models, particularly suitable for scenarios requiring programmatic generation, controllable reasoning, and large-scale supervised fine-tuning.

创建时间:
2026-08-18
原始信息汇总

VBVR-Pro-SFT-Video 数据集概述

基本信息

  • 数据集名称:VBVR-Pro-SFT-Video
  • 许可证:数据与基准材料采用 CC BY-NC 4.0(知识共享-非商业使用);代码部分采用 Apache License 2.0
  • 语言:英语
  • 数据规模:1M ~ 10M 条样本
  • 标签:视频生成、图生视频、视觉推理、训练

数据集内容

该数据集是 VBVR-Pro 的视频(图生视频,I2V)监督微调(SFT)部分,包含通过程序化方式生成的 125 万条推理实例,覆盖 250 个参数化任务,每个任务包含 5,000 条样本。

关键规格

属性 数值
任务数量 250
实例数量 1,250,000(每任务 5,000 条)
归档文件 250 个 tar.gz,每个对应一个任务
总大小 76.6 GB
分辨率 512 × 512
视频编码 H.264,CRF 20

数据目录结构

tars/ # 250 个 tar.gz 归档,每个对应一个任务 jsonl/ # 250 个 JSONL 索引文件,每个对应一个任务 meta_video_train.json # 全部 250 个任务的索引文件

每个归档文件对应一个任务,解压后包含一个子任务目录,内含 5,000 个样本子目录,每个样本包含:

  • first_frame.png:条件图像(512 × 512)
  • metadata.json:任务参数、真实值、评分契约
  • video/prompt.txt:指令文本
  • video/ground_truth.mp4:参考视频(16 fps,H.264)
  • video/final_frame.png:参考视频的最后一帧

索引文件字段说明

meta_video_train.json 将每个任务映射到其 JSONL 文件,包含 root(解压目录)、annotation(JSONL 路径)、length(行数)、task(任务类型)等字段。

JSONL 中每行对应一个样本,字段包括:sample_idfirst_frame(条件图像)、metadata(元数据)、clip_path(参考视频)、final_frame(末帧)、prompt(指令)。

下载与使用

可通过 huggingface-cli 下载数据集,VBVR-Pro 训练代码中的 prepare_data.py 脚本可解压归档并生成训练清单。也可以手动解压所有归档到同一目录后直接使用数据。

关联资源

  • 项目主页:https://video-reason.com/?v=pro
  • 论文:https://arxiv.org/abs/2608.26105
  • 训练与推理代码:https://github.com/Video-Reason/VBVR-Pro
  • 评测代码:https://github.com/Video-Reason/VBVR-Pro-Bench
  • 图像 SFT 数据集:https://huggingface.co/datasets/Video-Reason/VBVR-Pro-SFT-Image
  • RL 数据集:https://huggingface.co/datasets/Video-Reason/VBVR-Pro-RL
  • 基准数据集:https://huggingface.co/datasets/Video-Reason/VBVR-Pro-Bench
搜集汇总
数据集介绍
VBVR-Pro-SFT-Video 数据集图片
构建方式
VBVR-Pro-SFT-Video数据集是VBVR-Pro套件中专为视频生成(图像到视频)监督微调而设计的分支,其构建过程体现了高度程序化与规模化相结合的理念。该数据集包含125万条由程序化生成器自动产生的推理实例,覆盖250个参数化任务,每个任务严格配备5000个样本。所有视频均以512×512分辨率、H.264编码(CRF 20)及16帧每秒的帧率统一编码,并附带条件图像、元数据、提示词及参考视频等结构化文件。每个任务被封装为独立的tar.gz压缩包,并辅以jsonl索引文件及全局元数据文件,确保数据组织清晰且易于扩展。
特点
该数据集的核心特点在于其宏大的规模与精细的标注质量。250个任务的多样性设计旨在模拟丰富的视觉推理场景,每个样本均包含详细的元数据(任务参数、真值及评分合约),为模型提供明确的监督信号。数据架构高度模块化,每个样本由条件图像、提示词、参考视频和末帧组成,支持灵活的训练策略。此外,数据集采用CC BY-NC 4.0许可,限制商业用途,但代码部分以Apache 2.0授权,便于研究社区使用。其程序化生成机制确保了数据的一致性和可重复性,为视频生成模型的鲁棒训练提供了坚实基础。
使用方法
研究者可通过HuggingFace CLI便捷下载该数据集,并利用VBVR-Pro官方训练代码中的prepare_data.py脚本自动解压并生成训练清单。若需直接操作,可将所有压缩包解压至统一目录并调整meta_video_train.json中的root路径。每个样本的jsonl条目提供了完整的路径指引,涵盖首帧、视频、提示词等关键字段,便于自定义数据加载器。该数据集专为图像到视频生成任务设计,适用于监督微调阶段,可无缝集成至现有训练流程。其详细的元数据与评分合约也支持后续的强化学习或评估环节,为视觉推理模型的迭代优化提供了完整的数据支撑。
背景与挑战
背景概述
VBVR-Pro-SFT-Video是VBVR-Pro项目在2026年推出的视频监督微调子集,由多机构合作开发,旨在推动视觉推理与视频生成的交叉领域研究。该数据集包含250个参数化任务、125万个程序化生成的推理样本,每个任务提供5000个实例,涵盖从物体重现到复杂场景理解的广泛能力。其创建团队汇集了来自学术界与工业界的专家,核心研究问题在于如何构建可扩展且可验证的视觉推理训练数据,以弥补现有数据集中推理链缺乏显式标注的不足。该数据集通过统一的任务模板、元数据与评分协议,为视频理解与生成模型提供了标准化训练基准,其影响力体现在促进可解释性视觉推理模型的发展,并为后续的强化学习与基准测试提供了基础。
当前挑战
VBVR-Pro-SFT-Video所应对的领域挑战在于视频推理与生成任务的复杂性与高昂标注成本。传统数据集往往依赖人工标注,难以覆盖细粒度物理规律与多步因果推理,而该数据集通过程序化生成,虽克服了标注瓶颈,却面临任务设计需兼具多样性与一致性的难题,确保每个实例的可验证性(如ground truth与评分契约)是核心工程挑战。构建过程中,团队需在512×512分辨率、16fps的规格下,高效生成76.6GB的高质量视频数据,并对250个任务进行去重叠与索引管理,保证数据无冗余且可扩展。此外,许可证的差异化(代码Apache 2.0、数据CC BY-NC 4.0)也需在合规性上谨慎处理,以平衡研究开放性与商业限制。
常用场景
经典使用场景
VBVR-Pro-SFT-Video作为视频生成与视觉推理交叉领域的核心监督微调数据集,其经典使用场景在于为图像到视频(I2V)生成模型提供大规模、参数化的推理训练范例。该数据集精心构建了250个参数化任务,涵盖1.24M个视频样本,每个任务均包含条件图像、指令提示、参考视频及元数据,旨在训练模型理解复杂视觉动态并生成符合逻辑的后续帧。研究者通常利用此数据集对预训练的视频扩散模型进行指令微调,使其能够根据静态图像和自然语言指令生成连贯、合理的视频片段,从而提升模型在物体重现、运动预测等视觉推理任务上的表现。数据集的独特设计,即每个样本附带任务参数和评分契约,使得其成为验证和比较不同视频生成架构在受控条件下推理能力的标准基准。
衍生相关工作
VBVR-Pro-SFT-Video的发布衍生了一系列前沿研究工作。在模型架构方面,研究者利用该数据集探索了更为高效的视频扩散模型,如引入时空注意力机制或级联生成策略,以提升生成视频的长程一致性和时间连贯性。在训练方法论上,该数据集促进了强化学习与人类反馈在视频生成中的应用,通过将生成的视频与参考视频进行对比,优化模型的策略网络。此外,该数据集还催生了专门的评估基准VBVR-Pro-Bench,用于标准化视频推理任务的测评标准,促进了社区内不同模型的公平比较。后续工作进一步拓展了该数据集在多模态学习中的应用,如结合音频或文本信息进行联合视频生成,以及将其作为预训练语料提升大型视觉语言模型的时空感知能力。这些衍生工作不仅丰富了视频生成的研究生态,也为通用人工智能的视觉理解发展贡献了重要力量。
数据集最近研究
最新研究方向
VBVR-Pro-SFT-Video数据集专为视频生成与视觉推理的交叉领域设计,其最新研究方向聚焦于通过大规模参数化任务推动原生视觉推理能力的跃升。该数据集包含125万条程序化生成的推理实例,覆盖250项精细化任务,为图像到视频(I2V)生成提供了丰富的监督微调资源。在当前视频生成模型追求高保真与可控性的背景下,该数据集通过引入结构化任务参数、元数据与评分契约,实现了对生成过程的可验证性约束,从而促进模型从简单像素合成向复杂事件推理的范式转变。其与VBVR-Pro系列中图像、强化学习及基准数据集的协同设计,预示着多模态推理与生成一体化模型的构建趋势,对提升视频内容理解的时空连贯性及因果逻辑建模具有里程碑式意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务