遇见数据集

VGenST-Bench

收藏
github2026-05-23 更新2026-05-26 收录
官方服务:

资源简介:

VGenST-Bench是一个完全生成的基准,用于评估多模态大语言模型(MLLMs)中的时空推理。每个视频、场景图、场景、提示和问答对都由可控的代理流程生成,从而精确控制场景组成、相机轨迹和推理目标。该基准涵盖12个推理任务(组织在三个空间尺度:图形、远景、环境)、12种问答类型(跨越三个推理级别:视觉感知、场景理解、时空推理)以及每个问答的4个问题变体,共包含1200个视频(12个任务×100个主题),每个视频都配有完整的生成来源。

VGenST-Bench is a fully synthetic benchmark for evaluating spatiotemporal reasoning in multimodal large language models (MLLMs). Each video, scene graph, scene, prompt, and question-answer pair is generated via a controllable agentic pipeline, enabling precise control over scene composition, camera trajectories, and reasoning objectives. This benchmark covers 12 reasoning tasks organized across three spatial scales: graphic, distant view, and environment, 12 question-answering types spanning three reasoning levels: visual perception, scene understanding, and spatiotemporal reasoning, plus 4 question variants for each QA pair, totaling 1200 videos (12 tasks × 100 topics), each accompanied by complete generation provenance.

创建时间:
2026-05-22
原始信息汇总

数据集概述

VGenST-Bench 是一个完全生成式的基准测试,用于评估多模态大语言模型(MLLMs)的时空推理能力。其所有视频、场景图、场景、提示和问答对均由可控智能体流程生成,从而对场景构成、相机轨迹和推理目标实现精确控制。

核心规模

  • 1,200 个视频:涵盖 12 个任务,每个任务包含 100 个主题。
  • 12 个推理任务:按照三个空间尺度组织——图形(Figural)、视景(Vista)、环境(Environmental)。
  • 12 种问答类型:分布于三个推理层级——视觉感知(L1)、场景理解(L2)、时空推理(L3)。
  • 4 种问题变体:每个问答包含基础多项选择、NoT-干扰项、NoT-答案、开放式,用于探测位置偏差及错误/真实回避。

任务分类 (3 × 2 × 2)

尺度 × 动态 自我中心 (Egocentric) 外部中心 (Exocentric)
图形 静态 多容器属性映射 (MC) 容器交集推理 (CI)
图形 动态 数量变化追踪 (QC) 因果映射 (CM)
视景 静态 方向估计 (DE) 高度排序 (HO)
视景 动态 交互对象识别 (IO) 可见性识别 (VI)
环境 静态 方向标牌定位 (DS) 地标空间构成 (LS)
环境 动态 相对速度识别 (RV) 行为触发识别 (BT)

问答类型层级

L1: 视觉感知 L2: 场景理解 L3: 时空推理
物体存在 (OE) 身份追踪 (IT) 视角转换 (PT)
物体属性识别 (OA) 动作识别 (AR) 反事实推理 (CR)
2D帧定位 (FL) 物体计数 (OC) 预测性推理 (PR)
时序排序 (TO)
相机运动识别 (CM)
空间布局理解 (SL)

生成流程

该流程通过四个由大型语言模型(LLM)支持的智能体,协同合成场景图、场景、视频和问答集:

阶段 智能体 输出
1 场景图智能体 (SceneGraphAgent) 基于主题的任务驱动场景图
2 场景智能体 (ScenarioAgent) 基于场景图的时间场景
3 视频智能体 (VideoAgent) 图像提示 → 首帧 → 视频提示 → 视频
4 问答智能体 (QAAgent) 跨适用问答类型的多项选择问答

仓库结构

VGenST-final/ ├── VGenST_run.py # 流程编排器 ├── eval.py # 评估框架 ├── config.json # 流程配置 ├── eval_config.json # 评估配置 ├── llm_client.py # 统一LLM客户端 ├── media_client.py # 图像/视频生成客户端 ├── agents/ # 各智能体实现 │ ├── base_agent.py │ ├── scene_graph_agent.py │ ├── scenario_agent.py │ ├── video_agent.py │ └── qa_agent.py ├── sysprompt/ # 各智能体系统提示和模板 └── utils/ └── settings.py # 目标任务和主题定义

使用方式

  • 基准模式:运行 python VGenST_run.py --config config.json,遍历所有目标任务和主题。
  • 自定义模式:运行 python VGenST_run.py --themes "主题1" "主题2",使用指定主题。
  • 恢复运行:通过配置文件设置 RESUME_FROM 时间戳,可从先前运行的某阶段继续执行。
  • 评估:运行 python eval.py --config eval_config.json,可配置裁判模型、评估模式和任务筛选条件。
搜集汇总
数据集介绍
VGenST-Bench 数据集图片
构建方式
VGenST-Bench的构建依托于一个全自动化的可控代理管线,该管线由四个核心代理协同运作。首先,SceneGraphAgent从给定的主题出发,生成任务导向的场景图。随后,ScenarioAgent基于该场景图创建时序化的场景描述。接着,VideoAgent将场景描述转化为图像提示,生成首帧,进而合成完整视频。最后,QAAgent为每个视频生成涵盖多种推理类型的多项选择题及其变体。整个流程由大型语言模型(如Claude、OpenAI等)和图像/视频生成模型共同驱动,确保数据生成的精确性与可复现性,最终产出包含1200个视频及完整生成溯源的高质量基准。
特点
该数据集最显著的特点在于其全生成(fully generative)属性,所有视频、场景图、问答对均由可控管线自动产生,赋予了对场景构成、相机轨迹与推理目标的精密控制。数据集设计了3种空间尺度(Figural、Vista、Environmental)与12项推理任务,并结合3个推理层次(视觉感知、场景理解、时空推理)的12种问答类型。每个问答还包含4种变体,用于探测模型的定位偏差与真假回避能力。这种多层次、多维度的结构设计,使其能够全面且细致地评估多模态大模型的时空推理能力。
使用方法
使用VGenST-Bench时,研究者首先通过克隆代码仓库、安装依赖并配置API密钥完成环境搭建。在基准模式下,只需运行VGenST_run.py脚本,工具便会自动遍历所有预设任务与主题,生成测试数据。若需定制,可通过命令行指定自定义主题。管线支持断点续跑,方便分阶段调试。评估阶段通过eval.py脚本,可配置目标模型与裁判模型,并选择不同的评估模式(如环形、变体等),以灵活适配多样化的模型评估需求。完整的输出结构为后续分析提供了清晰的路径。
背景与挑战
背景概述
时空推理能力是评估多模态大语言模型对动态视觉世界理解深度的关键维度。VGenST-Bench由成均馆大学和延世大学的研究团队于2026年提出,旨在系统性地衡量多模态大语言模型在复杂视频场景中的时空推理表现。该基准的核心研究问题在于如何构建一个完全可控、可复现且覆盖多粒度推理任务的评估框架,以应对现有基准在场景组成、相机轨迹与推理目标精细化控制上的不足。通过包含1200个视频、涵盖图级、视野级与环境级三个空间尺度及12类推理任务,VGenST-Bench为领域提供了一套丰富的合成数据资产,其可完全溯源的生成流程显著提升了评测的透明度与可解释性,从而推动了多模态大语言模型时空推理能力研究的前沿。
当前挑战
在领域问题层面,现有基准数据集受限于真实视频的采集成本与标注噪声,难以精确分离感知错误与推理错误,导致对多模态大语言模型时空推理能力的评估存在混淆。VGenST-Bench所解决的挑战在于构建一个可精细控制场景元素、运动轨迹与提问意图的合成视频环境,从而实现推理目标的精准靶向。在构建过程中,面临的挑战包括:设计能够协同生成场景图、时间情景、视频与问答对的多智能体流水线,确保各生成阶段的一致性与可控性;覆盖12类推理任务与多层级问答类型的体系化构造需权衡任务难度与覆盖广度,避免评估偏差;同时,生成式视频的保真度与多样性需达到足以支撑可靠评估的水平,以避免因视觉质量不足而引入额外噪声。
常用场景
经典使用场景
在多媒体内容理解与人工智能交叉领域,视频时空推理能力的评测一直是多模态大语言模型(MLLM)发展的关键瓶颈。VGenST-Bench作为首个完全基于生成式管线的基准测试集,精准聚焦于评估MLLM在动态视觉场景中的时空推理能力。其经典使用场景涵盖三大空间尺度(Figural、Vista、Environmental)与两种观察视角(Egocentric、Exocentric)交织形成的12项推理任务,例如数量变化追踪、因果映射、相对速度识别及行为触发判别等。配合12种问答类型构成的三级推理层级(视觉感知、场景理解、时空推理),以及每种问答包含的四种变体(基础选择题、干扰项、否定答案、开放式提问),该基准系统性地揭示了模型在不同复杂度与视角下的推理局限性,为时空推理能力评估提供了标准化试验场。
解决学术问题
在学术层面,VGenST-Bench着力攻克了现有视频理解基准中普遍存在的三大研究难题:场景可控性不足导致因果溯源困难、标注成本高昂带来数据集规模限制、以及评测单一化使得模型缺陷难以系统揭示。通过集成场景图生成、时空叙事构建、可控视频合成及问答生成四阶段智能管线的自动协作,该数据集精确掌控了场景构成、相机轨迹与推理目标,使得研究者能够逐一解耦并检验模型在视觉感知、场景理解与时空推理三个层次上的表现。其对12种问答类型中位置偏差、虚假拒绝与真实拒绝等微妙现象的深入探测,不仅暴露了前沿模型在因果推理与视角变换等高级认知任务上的脆弱性,更推动多模态推理评测从粗粒度分类迈进细粒度诊断的新阶段。
衍生相关工作
VGenST-Bench引发了一系列具有深远影响的衍生工作,有力地推动了多模态推理研究范式的革新。其可复现的全自动生成管线启发了后续研究朝着自演化基准方向演进——即模型在完成当前评测后,能够借助生成的场景图与时空叙事,自动构造更具挑战性的新测试样本,形成评测与训练的闭环。许多工作借鉴了该基准中任务-问答适用性矩阵的设计框架,将其扩展至文本视频检索、视频问答与视觉推理等下游任务中,用于构建更平衡、更少偏见的评测集合。此外,部分研究者基于该数据集的细粒度诊断结果,提出了强化视角变换与长程时序依赖关系的注意力机制改进方案,催生了一批在时空推理性能上显著超越基线的模型架构。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务