VGenST-Bench
收藏资源简介:
VGenST-Bench是一个完全生成的基准,用于评估多模态大语言模型(MLLMs)中的时空推理。每个视频、场景图、场景、提示和问答对都由可控的代理流程生成,从而精确控制场景组成、相机轨迹和推理目标。该基准涵盖12个推理任务(组织在三个空间尺度:图形、远景、环境)、12种问答类型(跨越三个推理级别:视觉感知、场景理解、时空推理)以及每个问答的4个问题变体,共包含1200个视频(12个任务×100个主题),每个视频都配有完整的生成来源。
VGenST-Bench is a fully synthetic benchmark for evaluating spatiotemporal reasoning in multimodal large language models (MLLMs). Each video, scene graph, scene, prompt, and question-answer pair is generated via a controllable agentic pipeline, enabling precise control over scene composition, camera trajectories, and reasoning objectives. This benchmark covers 12 reasoning tasks organized across three spatial scales: graphic, distant view, and environment, 12 question-answering types spanning three reasoning levels: visual perception, scene understanding, and spatiotemporal reasoning, plus 4 question variants for each QA pair, totaling 1200 videos (12 tasks × 100 topics), each accompanied by complete generation provenance.
数据集概述
VGenST-Bench 是一个完全生成式的基准测试,用于评估多模态大语言模型(MLLMs)的时空推理能力。其所有视频、场景图、场景、提示和问答对均由可控智能体流程生成,从而对场景构成、相机轨迹和推理目标实现精确控制。
核心规模
- 1,200 个视频:涵盖 12 个任务,每个任务包含 100 个主题。
- 12 个推理任务:按照三个空间尺度组织——图形(Figural)、视景(Vista)、环境(Environmental)。
- 12 种问答类型:分布于三个推理层级——视觉感知(L1)、场景理解(L2)、时空推理(L3)。
- 4 种问题变体:每个问答包含基础多项选择、NoT-干扰项、NoT-答案、开放式,用于探测位置偏差及错误/真实回避。
任务分类 (3 × 2 × 2)
| 尺度 × 动态 | 自我中心 (Egocentric) | 外部中心 (Exocentric) |
|---|---|---|
| 图形 静态 | 多容器属性映射 (MC) | 容器交集推理 (CI) |
| 图形 动态 | 数量变化追踪 (QC) | 因果映射 (CM) |
| 视景 静态 | 方向估计 (DE) | 高度排序 (HO) |
| 视景 动态 | 交互对象识别 (IO) | 可见性识别 (VI) |
| 环境 静态 | 方向标牌定位 (DS) | 地标空间构成 (LS) |
| 环境 动态 | 相对速度识别 (RV) | 行为触发识别 (BT) |
问答类型层级
| L1: 视觉感知 | L2: 场景理解 | L3: 时空推理 |
|---|---|---|
| 物体存在 (OE) | 身份追踪 (IT) | 视角转换 (PT) |
| 物体属性识别 (OA) | 动作识别 (AR) | 反事实推理 (CR) |
| 2D帧定位 (FL) | 物体计数 (OC) | 预测性推理 (PR) |
| 时序排序 (TO) | ||
| 相机运动识别 (CM) | ||
| 空间布局理解 (SL) |
生成流程
该流程通过四个由大型语言模型(LLM)支持的智能体,协同合成场景图、场景、视频和问答集:
| 阶段 | 智能体 | 输出 |
|---|---|---|
| 1 | 场景图智能体 (SceneGraphAgent) | 基于主题的任务驱动场景图 |
| 2 | 场景智能体 (ScenarioAgent) | 基于场景图的时间场景 |
| 3 | 视频智能体 (VideoAgent) | 图像提示 → 首帧 → 视频提示 → 视频 |
| 4 | 问答智能体 (QAAgent) | 跨适用问答类型的多项选择问答 |
仓库结构
VGenST-final/ ├── VGenST_run.py # 流程编排器 ├── eval.py # 评估框架 ├── config.json # 流程配置 ├── eval_config.json # 评估配置 ├── llm_client.py # 统一LLM客户端 ├── media_client.py # 图像/视频生成客户端 ├── agents/ # 各智能体实现 │ ├── base_agent.py │ ├── scene_graph_agent.py │ ├── scenario_agent.py │ ├── video_agent.py │ └── qa_agent.py ├── sysprompt/ # 各智能体系统提示和模板 └── utils/ └── settings.py # 目标任务和主题定义
使用方式
- 基准模式:运行
python VGenST_run.py --config config.json,遍历所有目标任务和主题。 - 自定义模式:运行
python VGenST_run.py --themes "主题1" "主题2",使用指定主题。 - 恢复运行:通过配置文件设置
RESUME_FROM时间戳,可从先前运行的某阶段继续执行。 - 评估:运行
python eval.py --config eval_config.json,可配置裁判模型、评估模式和任务筛选条件。




