遇见数据集

VIVG-Bench

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

VIVG-Bench是一个专门用于评估图像到视频生成模型在视觉错觉场景下性能的基准数据集。其核心目标是测试模型能否从具有误导性的首帧图像中恢复隐藏的真实世界关系,而不是延续错误的初始解释。数据集包含680个高质量图像-提示对,每个对由一个视觉错觉图像和一个生成提示组成。提示仅指定操作(如相机运动、物体运动、光照变化或局部交互),而不描述错觉机制或揭示正确解释。数据涵盖7个主要错觉类别:反射错觉、折射错觉、投影错觉、想象错觉、绘画错觉、透视错觉和阴影错觉,并进一步细分为19个子类别。每个数据实例的元数据包括图像文件路径、主要类别、细分子类别和生成提示。生成的视频通过语义/动作遵循性(SA)、隐藏关系一致性(HRC)和视频稳定性(VS)进行评估,结果被分类为完全成功(FS)、稳定失败(SF)或崩溃(Col)。该数据集适用于图像到视频生成任务的基准测试和评估,特别是在需要理解复杂空间、光学或表面关系的场景中。

VIVG-Bench is a benchmark dataset specifically designed for evaluating the performance of image-to-video generation models in visual illusion scenarios. Its core objective is to test whether models can recover the hidden real-world relationships from misleading initial frame images, rather than perpetuating the incorrect initial interpretations. The dataset contains 680 high-quality image-prompt pairs, each consisting of a visual illusion image and a generation prompt. The prompts only specify the operation (such as camera movement, object movement, lighting changes, or local interactions) without describing the illusion mechanism or revealing the correct interpretation. The data covers 7 main illusion categories: reflection illusion, refraction illusion, projection illusion, imaginary illusion, painting illusion, perspective illusion, and shadow illusion, which are further subdivided into 19 subcategories. The metadata of each data instance includes the image file path, primary category, detailed subcategory, and generation prompt. The generated videos are evaluated based on semantic/action adherence (SA), hidden relationship consistency (HRC), and video stability (VS), with the results classified into Full Success (FS), Stable Failure (SF), or Collapse (Col). This dataset is suitable for benchmarking and evaluating image-to-video generation tasks, especially in scenarios that require understanding of complex spatial, optical, or surface relationships.

创建时间:
2026-07-24
原始信息汇总

数据集概述:VIVG-Bench

基准测试目标

VIVG-Bench 是一个用于评估图像到视频(Image-to-Video)生成模型的基准测试。其核心目标是检验模型能否从具有误导性的首帧图像中,恢复并展示隐藏的真实世界关系。不同于常规的图生视频基准(首帧通常提供明确场景条件),VIVG-Bench 使用真实世界的 3D 视觉错觉图像作为首帧输入,这些图像的首帧外观会诱导对真实空间、光学、投影、表面、物体身份或光照关系的错误解读。

一个成功的视频应当遵循提示中要求的运动或交互,同时根据底层真实关系更新场景,而非延续误导性的首帧解释。

数据集规模与组成

  • 总数量:包含 680 个高质量的图像与提示配对样本。
  • 样本结构:每个样本由一个错觉图像(Illusion Image)和一个不包含错觉描述的提示(Prompt)组成。提示仅指定相机运动、物体运动、光照变化或局部交互等操作,不描述错觉机制或揭示正确解读。

评估指标

生成的视频通过以下三个维度进行评估,并最终组合为三种标签:

  • 语义/动作一致性(SA,Semantic/Action Adherence):视频是否遵循提示中的语义和动作要求。
  • 隐藏关系一致性(HRC,Hidden-Relation Consistency):视频是否展示了与隐藏真实关系一致的场景更新。
  • 视频稳定性(VS,Video Stability):视频本身的生成质量是否稳定。
  • 最终标签
    • 完全成功(FS,Full Success):满足 SA 和 HRC,且 VS 良好。
    • 稳定失败(SF,Stable Failure):满足 SA,但未反映 HRC,且 VS 良好。
    • 崩溃(Col,Collapse):VS 较差,或未满足 SA。

数据集分类(Taxonomy)

基准测试涵盖 7 大主要类别和 19 个细分子类别:

  • 反射错觉(Reflection Illusions)
  • 折射错觉(Refraction Illusions)
  • 投影错觉(Projection Illusions)
  • 想象错觉(Imaginative Illusions)
  • 绘画错觉(Painting Illusions)
  • 透视错觉(Perspective Illusions)
  • 阴影错觉(Shadow Illusions)

仓库结构

  • data/:主基准数据集,包含图像与提示对。
    • metadata.jsonl:包含图像路径、类别、子类别和生成提示的元数据文件。
    • images/:存放 680 张输入视觉错觉图像,按 主类别/细分类别/*.jpg 组织。
  • video/:定性展示用的精选生成结果视频。
    • README.md:定性示例的画廊和描述。
    • 视频按 主类别/结果标签/*.mp4 组织。

元数据字段(data/metadata.jsonl

字段 描述
file_name 输入图像的路径,相对于 data/ 目录。
eval_category 七个主要错觉类别之一。
eval_subcategory 细粒度的错觉类型。
generation_prompt 图像到视频的生成提示文本。

许可与语言

  • 许可:other(自定义许可)
  • 语言:英语(en)
搜集汇总
数据集介绍
VIVG-Bench 数据集图片
构建方式
VIVG-Bench旨在评估图像到视频生成模型能否从具有误导性的首帧中恢复隐藏的真实世界关系,其构建方式独具匠心。该基准数据集以现实世界的三维视错觉图像作为输入首帧,而非一般基准中的明确场景条件。每一条基准实例由一幅视错觉图像与一个不揭示错觉机制的文本提示配对构成,提示仅描述具体的相机运动、物体运动、光照变化或局部交互操作,共包含680个高质量图像-提示对。数据集的分类体系涵盖反射错觉、折射错觉、投影错觉、想象错觉、绘画错觉、透视错觉和阴影错觉7个大类及19个细分子类,所有数据以JSONL格式的元数据文件及对应图像文件进行组织,确保结构清晰且便于使用。
特点
VIVG-Bench的核心特点在于其针对图像到视频生成模型的评估难度与深度。与依赖首个画面即提供明确场景条件的一般基准不同,VIVG-Bench刻意选择可能诱导错误解读的真实视错觉图像作为首帧,从空间、光学、投影、表面、物体身份或光照关系等多维度设置陷阱。生成的视频需同时满足三项指标:语义/动作遵循度(SA)、隐藏关系一致性(HRC)和视频稳定性(VS),并据此被划分为完全成功(FS)、稳定失败(SF)和崩溃(Col)三类标签。这种多维度、层次化的评估框架能够细致甄别模型在应对复杂视觉误导时的鲁棒性,揭示其在超越表面现象、理解深层物理关系方面的能力。
使用方法
使用VIVG-Bench对图像到视频生成模型进行评估时,研究者需将数据集中的视错觉图像与对应的生成提示作为输入,调用目标模型生成视频。数据集的元数据文件data/metadata.jsonl记录了每个实例的图像路径、所属大类与子类及生成提示。评估过程需按照基准定义的语义/动作遵循度(SA)、隐藏关系一致性(HRC)和视频稳定性(VS)三项指标对生成视频进行打分,最终汇总为完全成功(FS)、稳定失败(SF)或崩溃(Col)的结果标签。此外,数据集还提供了部分模型的生成示例视频以作视觉参考。这一标准化的流程确保了评估的可复现性与公平性,便于横向比较不同模型处理视错觉挑战的能力。
背景与挑战
背景概述
VIVG-Bench是由研究团队于近期提出的一个创新型图像到视频生成评估基准,旨在探索生成模型如何从具有误导性的第一帧图像中恢复隐藏的真实世界关系。该数据集由680个高质量图像-提示对构成,涵盖反射、折射、投影、想象、绘画、透视及阴影等七大类视觉错觉现象。与传统基准不同,VIVG-Bench将三维真实视觉错觉作为输入图像,挑战现有模型对场景单义解读的依赖。其核心研究问题在于:当初始帧呈现一种欺骗性的空间或光学关系时,生成模型是否能够通过运动或交互提示揭示潜在的客观规律。这一工作填补了评估生成模型对物理因果关系理解能力的空白,对推动视频生成技术从表面视觉相似性走向深层语义理解具有重要影响。
当前挑战
VIVG-Bench面临的挑战首先来自其定义的领域问题:当前图像到视频生成模型普遍假定第一帧提供了明确的场景信息,然而视觉错觉的存在使得这一假定不再成立。模型需克服对第一帧的错误解读,从静态的欺骗性外观中推断出真正的空间、投射、光学或对象属性关系,并在生成的动态过程中维持这种隐藏关系的一致性。例如,当错觉图像中镜面反射暗示了错误的深度顺序时,模型必须在不依赖显式错觉描述的条件下,仅通过简单的运动提示(如摄像机平移)生成符合物理规律的新视图。此外,基准构建过程本身也面临挑战:如何确保每个错觉实例不包含多余的上下文提示、如何设计无偏的提示语句以避免泄露正确答案,以及如何平衡七大类错觉及其19个细分子类别的分布,使其覆盖足够广泛的视觉歧义场景,都是构建过程中需要克服的关键难点。
常用场景
经典使用场景
VIVG-Bench作为首个专注于视觉错觉场景的图像到视频生成基准数据集,其最经典的使用场景在于评估生成模型能否从误导性的首帧图像中恢复出隐藏的真实世界关系。该数据集精心收集了680对高质量图像与提示,涵盖反射、折射、投影、透视、阴影等七大类视觉错觉。研究者通过输入看似歧义的首帧,要求模型生成符合物理规律或隐含几何关系的运动视频,从而系统性地检验模型对空间、光学及表面等复杂关系的理解能力,而非仅仅生成符合表层视觉逻辑的连贯帧序列。
解决学术问题
VIVG-Bench有效解决了现有视频生成评估中缺失对模型物理常识与因果推理能力检验的学术问题。传统基准多聚焦于动作语义一致性或帧间图像质量,忽略了从单帧歧义场景中推断真实三维关系的关键挑战。通过引入全面而细致的分类体系,VIVG-Bench填补了这一空白,为衡量模型超越像素级模仿、理解世界深层规律的潜能提供了可靠标尺。其意义在于引导研究界关注生成模型在认知层面的局限性,推动技术从视觉感知走向具备常识推理的更高阶段。
衍生相关工作
围绕VIVG-Bench,相关研究工作已逐步展开。首先,基于该基准的三项评估指标——语义/动作一致性、隐藏关系一致性与视频稳定性——催生了针对幻觉视频生成模型的自动化评分与诊断方法。其次,该数据集推动了专门针对错觉场景的微调策略研究,例如结合物理约束的视频扩散模型或引入因果注意力机制的架构创新。此外,VIVG-Bench也启发了一系列针对错觉类型识别与首帧消歧任务的工作,逐渐形成以常识关系恢复为核心的新兴研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务