VBVR-Pro-SFT-Video
收藏资源简介:
VBVR-Pro-SFT-Video 是 VBVR-Pro 项目中的视频监督微调数据集,专为图像到视频生成和视觉推理任务设计。该数据集包含约 125 万个程序化生成的推理实例,涵盖 250 个参数化任务(每个任务 5000 个样本)。每个样本包括一个 512×512 像素的条件图像、元数据(任务参数、真实值、评分合约)、参考视频(16 fps,H.264 编码,CRF 20)、最终帧以及指令提示。数据集总大小约 76.6 GB,以 250 个 tar.gz 压缩包形式提供(每个任务一个),解压后每个样本的目录结构一致。该数据集可用于训练视频生成模型和视觉推理模型,特别适用于需要程序化生成、可控推理以及大规模监督微调的场景。
VBVR-Pro-SFT-Video is a video supervised fine-tuning dataset in the VBVR-Pro project, designed for image-to-video generation and visual reasoning tasks. It contains approximately 1.25 million programmatically generated reasoning instances covering 250 parametrized tasks (5,000 samples per task). Each sample includes a 512×512 conditional image, metadata (task parameters, ground truth, scoring contract), reference video (16 fps, H.264 encoding, CRF 20), final frame, and instruction prompt. The total dataset size is about 76.6 GB, provided as 250 tar.gz archives (one per task). After decompression, each sample has a consistent directory structure. This dataset can be used to train video generation models and visual reasoning models, particularly suitable for scenarios requiring programmatic generation, controllable reasoning, and large-scale supervised fine-tuning.
VBVR-Pro-SFT-Video 数据集概述
基本信息
- 数据集名称:VBVR-Pro-SFT-Video
- 许可证:数据与基准材料采用 CC BY-NC 4.0(知识共享-非商业使用);代码部分采用 Apache License 2.0
- 语言:英语
- 数据规模:1M ~ 10M 条样本
- 标签:视频生成、图生视频、视觉推理、训练
数据集内容
该数据集是 VBVR-Pro 的视频(图生视频,I2V)监督微调(SFT)部分,包含通过程序化方式生成的 125 万条推理实例,覆盖 250 个参数化任务,每个任务包含 5,000 条样本。
关键规格
| 属性 | 数值 |
|---|---|
| 任务数量 | 250 |
| 实例数量 | 1,250,000(每任务 5,000 条) |
| 归档文件 | 250 个 tar.gz,每个对应一个任务 |
| 总大小 | 76.6 GB |
| 分辨率 | 512 × 512 |
| 视频编码 | H.264,CRF 20 |
数据目录结构
tars/ # 250 个 tar.gz 归档,每个对应一个任务 jsonl/ # 250 个 JSONL 索引文件,每个对应一个任务 meta_video_train.json # 全部 250 个任务的索引文件
每个归档文件对应一个任务,解压后包含一个子任务目录,内含 5,000 个样本子目录,每个样本包含:
first_frame.png:条件图像(512 × 512)metadata.json:任务参数、真实值、评分契约video/prompt.txt:指令文本video/ground_truth.mp4:参考视频(16 fps,H.264)video/final_frame.png:参考视频的最后一帧
索引文件字段说明
meta_video_train.json 将每个任务映射到其 JSONL 文件,包含 root(解压目录)、annotation(JSONL 路径)、length(行数)、task(任务类型)等字段。
JSONL 中每行对应一个样本,字段包括:sample_id、first_frame(条件图像)、metadata(元数据)、clip_path(参考视频)、final_frame(末帧)、prompt(指令)。
下载与使用
可通过 huggingface-cli 下载数据集,VBVR-Pro 训练代码中的 prepare_data.py 脚本可解压归档并生成训练清单。也可以手动解压所有归档到同一目录后直接使用数据。
关联资源
- 项目主页:https://video-reason.com/?v=pro
- 论文:https://arxiv.org/abs/2608.26105
- 训练与推理代码:https://github.com/Video-Reason/VBVR-Pro
- 评测代码:https://github.com/Video-Reason/VBVR-Pro-Bench
- 图像 SFT 数据集:https://huggingface.co/datasets/Video-Reason/VBVR-Pro-SFT-Image
- RL 数据集:https://huggingface.co/datasets/Video-Reason/VBVR-Pro-RL
- 基准数据集:https://huggingface.co/datasets/Video-Reason/VBVR-Pro-Bench




