遇见数据集

GraphVid-Bench

收藏
arXiv2026-07-24 更新2026-07-27 收录
数据链接:
官方服务:

资源简介:

GraphVid-Bench是由伊利诺伊大学厄巴纳-香槟分校和索尼研究印度公司联合构建的大规模交互中心视频数据集,旨在支持交互感知视频生成模型的训练与评估。该数据集包含约27,000个视频片段,每个片段均配有结构化交互图标注,数据来源于多样化的开放域场景,以精准捕捉多实体间的复杂交互关系。数据集的创建过程涉及从输入图像中检测实体并提取关系边,构建有向交互场景图,从而为视频生成提供语义丰富的控制信号。该数据集主要应用于可控视频生成领域,通过交互图实现多对象动态的精确控制,解决传统轨迹或物理标注方法在表示复杂交互时的局限性,提升生成视频的物理合理性和时序一致性。

GraphVid-Bench is a large-scale interaction-centric video dataset jointly constructed by the University of Illinois Urbana-Champaign and Sony Research India, intended to support the training and evaluation of interaction-aware video generation models. This dataset contains approximately 27,000 video clips, each annotated with structured interaction graphs, and is derived from diverse open-domain scenarios to accurately capture complex interactive relationships among multiple entities. The construction process of this dataset involves detecting entities and extracting relational edges from input images, then building directed interactive scene graphs to provide semantically rich control signals for video generation. Primarily applied in the field of controllable video generation, this dataset enables precise control over the dynamics of multiple objects via interaction graphs, addresses the limitations of traditional trajectory or physical annotation methods in representing complex interactions, and enhances the physical plausibility and temporal consistency of generated videos.

创建时间:
2026-07-24
原始信息汇总

GraphVid 数据集详情总结

数据集名称

GraphVid-Bench

数据集规模

  • 总视频片段数:27,504 个经过精心挑选的视频片段
  • 视频规格:分辨率 512×288,帧数 81 帧,帧率 16 FPS
  • 数据处理:使用动态信函框保留宽高比,通过运动能量窗口选取交互最活跃的片段

数据来源

视频片段来源于以下三个数据集:

  • WISA-80K
  • Something-Something v2
  • MagicData

图结构统计

统计指标 平均值 中位数 标准差
每图节点数 7.76 5.0 8.03
每图边数 4.85 4.0 3.46

交互复杂度分布

交互类型 视频片段数
无明确交互 3,881
单一交互 10,982
多交互 12,641

交互类型覆盖

数据集涵盖了力与操纵、运动学与运动、物理接触、支撑与位置关系等多种交互类型,真实世界动态往往结合多种交互基元。

标注信息

每个视频片段配有结构化的有向场景图:

  • 节点:表示场景中的实体
  • :编码交互的类型、方向和文本上下文

数据集用途

GraphVid-Bench 专为图条件可控视频生成任务设计,支持用户通过编辑有向交互图来指定物体级别的运动关系(如推、拉、举、相对移动等),替代传统的密集轨迹标注方式。

搜集汇总
数据集介绍
GraphVid-Bench 数据集图片
构建方式
GraphVid-Bench的构建源于对视频生成领域缺乏交互级结构标注数据这一痛点的深刻洞察。研究团队从WISA-80K、Something-Something v2和Magic-Data三个公开数据集中精心筛选了约27K个以交互为中心的视频片段,每个片段统一为81帧、16帧/秒。在预处理阶段,通过视觉语言模型对运动源进行自动语义过滤,剔除由相机运动或环境背景主导的序列,仅保留离散的物体-物体交互。为捕捉交互最活跃的时段,采用滑动运动能量窗口算法提取最高能量的81帧片段。最终,每个视频被注释为一张有向交互图,节点表征物体、边编码交互关系与物理属性,构建起可支撑交互感知视频生成模型训练的高质量结构化数据集。
特点
该数据集的核心优势在于其结构化、交互式以及细粒度的语义表示能力。不同于传统依赖文本描述或低层运动线索的视频基准,GraphVid-Bench为每个视频配备了显式有向交互图,其中节点涵盖视觉特征、语义标签与空间信息,边则明确刻画交互方向与类型。数据集的交互类型覆盖了力与操控、运动学、物理接触及支撑与位置四大类别,并包含丰富的多元交互共现模式,平均每个图包含7.76个节点和4.85条边。此外,数据集中还纳入了约3,881个无显式交互的样本,为模型学习通用视频动态提供了基线,从而在稀疏与密集交互场景间构建了平衡且全面的评估框架。
使用方法
GraphVid-Bench专为训练和评估基于交互图的视频生成模型而设计,其典型使用方式始于将单张输入图像转化为场景图。用户通过添加、删除或编辑图中的交互边(如“推动”、“举起”)直观指定物体间的期望动态,系统则利用Edge-Aware Graph Reasoning模块将图结构映射为条件化令牌,注入冻结的视频扩散Transformer中进行生成。在模型训练中,仅更新图神经网络、图转适配器MLP层及LoRA模块,而视频扩散主干网络保持不变,从而实现参数高效的交互感知学习。该数据集支持从简单单一交互到复杂多物体交互场景的全面性能评测,为理解结构化关系在可控视频生成中的效用提供了标准化测试平台。
背景与挑战
背景概述
GraphVid-Bench是由伊利诺伊大学香槟分校(UIUC)PLAN实验室的Vedant Shah、Ismini Lourentzou等多位研究者于2025年创建的大规模交互中心视频数据集。该数据集旨在解决可控视频生成领域中对多对象交互进行精确结构控制的核心难题。传统方法依赖文本提示或轨迹控制,难以建模实体间的复杂因果关系。GraphVid-Bench提供了约27K个视频片段,每个片段均配有显式的有向交互图,详细标注了实体间的交互类型与方向,涵盖推、拉、支撑等二十余种物理交互原语。该数据集不仅为训练交互感知的视频生成模型提供了高质量监督信号,还通过其结构化的关系标注,推动了场景图在视频生成中的应用,为后续研究奠定了坚实基础。
当前挑战
GraphVid-Bench所应对的挑战涵盖两个层面。在领域问题层面,现有可控视频生成方法主要依赖低层几何轨迹或全局文本描述,无法精确表达多对象之间的结构化交互关系,导致生成的动态在物理上不连贯或交互意图不明确。在数据集构建层面,需要从海量视频中自动化提取精确的对象级交互图,克服对象检测、关系推理、时空对齐等技术难点;同时,为确保训练数据的多样性与质量,必须设计多源数据融合和运动能量窗口筛选等流程,以过滤掉相机运动或环境噪声带来的干扰。此外,如何将稀疏的交互图翻译为稠密的视频生成条件token,并在不破坏预训练生成模型先验的前提下实现有效控制,也是一项重大挑战。
常用场景
经典使用场景
GraphVid-Bench的核心价值在于为交互感知的视频生成模型提供结构化监督信号。该数据集最经典的使用场景是训练图条件图像到视频生成模型,通过将约27K视频片段与显式的有向交互场景图配对,使模型能够学习从实体关系描述到运动动力学的映射。研究者利用该数据集训练图到令牌适配器,将交互图转换为条件令牌注入冻结的视频扩散变压器,从而实现基于结构化交互的多对象运动控制。这一范式替代了传统依赖密集轨迹或低层物理标注的路径,使得用户仅通过编辑场景图中的关系边即可直观指定场景动态,极大地提升了复杂多实体交互情境下视频生成的灵活性与可控性。
解决学术问题
GraphVid-Bench系统性地解决了可控视频生成领域中长期存在的关键学术难题:如何以语义化、结构化方式表征并控制多对象之间的交互动态。现有方法受限于文本提示的模糊性或轨迹控制的可扩展性瓶颈,难以精准描述物体间推、拉、握等关系性运动。该数据集通过提出交互图作为控制接口,克服了低层几何控制信号在多对象场景下的累积误差问题,并为缺乏交互标注的大规模视频集合提供了高质量的补充训练资源。其贡献在于推动了从像素级运动控制到语义级关系推理的范式转变,显著降低了生成模型对大规模稠密标注数据的依赖,为构建物理一致且可交互的视频生成模型奠定了数据基础。
衍生相关工作
GraphVid-Bench的发布催生了一系列进一步探索结构化语义控制的重要工作。其直接衍生的核心技术包括Edge-Aware Graph Reasoning模块,该模块将边的语义属性纳入图神经网络的消息传递过程,使得节点表示能显式捕捉交互类型对运动传播的影响。后续研究在此基础上拓展了图到视频适配器的轻量化设计,通过LoRA微调方法在预训练扩散变压器中注入交互条件,实现了高效且通用的控制框架。此外,该数据集启发了多对象交互场景下的评估协议,促使后继工作从纯质量指标延伸至运动准确性(如端点误差EPE)和人类偏好评价等维度,形成了更为全面的可控视频生成评测体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务