VIVG-Bench
收藏资源简介:
VIVG-Bench是一个专门用于评估图像到视频生成模型在视觉错觉场景下性能的基准数据集。其核心目标是测试模型能否从具有误导性的首帧图像中恢复隐藏的真实世界关系,而不是延续错误的初始解释。数据集包含680个高质量图像-提示对,每个对由一个视觉错觉图像和一个生成提示组成。提示仅指定操作(如相机运动、物体运动、光照变化或局部交互),而不描述错觉机制或揭示正确解释。数据涵盖7个主要错觉类别:反射错觉、折射错觉、投影错觉、想象错觉、绘画错觉、透视错觉和阴影错觉,并进一步细分为19个子类别。每个数据实例的元数据包括图像文件路径、主要类别、细分子类别和生成提示。生成的视频通过语义/动作遵循性(SA)、隐藏关系一致性(HRC)和视频稳定性(VS)进行评估,结果被分类为完全成功(FS)、稳定失败(SF)或崩溃(Col)。该数据集适用于图像到视频生成任务的基准测试和评估,特别是在需要理解复杂空间、光学或表面关系的场景中。
VIVG-Bench is a benchmark dataset specifically designed for evaluating the performance of image-to-video generation models in visual illusion scenarios. Its core objective is to test whether models can recover the hidden real-world relationships from misleading initial frame images, rather than perpetuating the incorrect initial interpretations. The dataset contains 680 high-quality image-prompt pairs, each consisting of a visual illusion image and a generation prompt. The prompts only specify the operation (such as camera movement, object movement, lighting changes, or local interactions) without describing the illusion mechanism or revealing the correct interpretation. The data covers 7 main illusion categories: reflection illusion, refraction illusion, projection illusion, imaginary illusion, painting illusion, perspective illusion, and shadow illusion, which are further subdivided into 19 subcategories. The metadata of each data instance includes the image file path, primary category, detailed subcategory, and generation prompt. The generated videos are evaluated based on semantic/action adherence (SA), hidden relationship consistency (HRC), and video stability (VS), with the results classified into Full Success (FS), Stable Failure (SF), or Collapse (Col). This dataset is suitable for benchmarking and evaluating image-to-video generation tasks, especially in scenarios that require understanding of complex spatial, optical, or surface relationships.
数据集概述:VIVG-Bench
基准测试目标
VIVG-Bench 是一个用于评估图像到视频(Image-to-Video)生成模型的基准测试。其核心目标是检验模型能否从具有误导性的首帧图像中,恢复并展示隐藏的真实世界关系。不同于常规的图生视频基准(首帧通常提供明确场景条件),VIVG-Bench 使用真实世界的 3D 视觉错觉图像作为首帧输入,这些图像的首帧外观会诱导对真实空间、光学、投影、表面、物体身份或光照关系的错误解读。
一个成功的视频应当遵循提示中要求的运动或交互,同时根据底层真实关系更新场景,而非延续误导性的首帧解释。
数据集规模与组成
- 总数量:包含 680 个高质量的图像与提示配对样本。
- 样本结构:每个样本由一个错觉图像(Illusion Image)和一个不包含错觉描述的提示(Prompt)组成。提示仅指定相机运动、物体运动、光照变化或局部交互等操作,不描述错觉机制或揭示正确解读。
评估指标
生成的视频通过以下三个维度进行评估,并最终组合为三种标签:
- 语义/动作一致性(SA,Semantic/Action Adherence):视频是否遵循提示中的语义和动作要求。
- 隐藏关系一致性(HRC,Hidden-Relation Consistency):视频是否展示了与隐藏真实关系一致的场景更新。
- 视频稳定性(VS,Video Stability):视频本身的生成质量是否稳定。
- 最终标签:
- 完全成功(FS,Full Success):满足 SA 和 HRC,且 VS 良好。
- 稳定失败(SF,Stable Failure):满足 SA,但未反映 HRC,且 VS 良好。
- 崩溃(Col,Collapse):VS 较差,或未满足 SA。
数据集分类(Taxonomy)
基准测试涵盖 7 大主要类别和 19 个细分子类别:
- 反射错觉(Reflection Illusions)
- 折射错觉(Refraction Illusions)
- 投影错觉(Projection Illusions)
- 想象错觉(Imaginative Illusions)
- 绘画错觉(Painting Illusions)
- 透视错觉(Perspective Illusions)
- 阴影错觉(Shadow Illusions)
仓库结构
data/:主基准数据集,包含图像与提示对。metadata.jsonl:包含图像路径、类别、子类别和生成提示的元数据文件。images/:存放 680 张输入视觉错觉图像,按主类别/细分类别/*.jpg组织。
video/:定性展示用的精选生成结果视频。README.md:定性示例的画廊和描述。- 视频按
主类别/结果标签/*.mp4组织。
元数据字段(data/metadata.jsonl)
| 字段 | 描述 |
|---|---|
file_name |
输入图像的路径,相对于 data/ 目录。 |
eval_category |
七个主要错觉类别之一。 |
eval_subcategory |
细粒度的错觉类型。 |
generation_prompt |
图像到视频的生成提示文本。 |
许可与语言
- 许可:other(自定义许可)
- 语言:英语(en)




