遇见数据集

VSTAT

收藏
github2026-06-03 更新2026-06-04 收录
数据链接:
官方服务:

资源简介:

VSTAT(视觉状态跟踪)是一个基准数据集,用于评估多模态大语言模型在长视频中跟踪细粒度视觉状态变化的能力。与测试静态场景理解或简单事件识别的基准不同,VSTAT要求模型在来自YouTube的扩展视频序列中维护对象状态、计数变化和时间顺序的运行心理模型。

VSTAT (Visual State Tracking) is a benchmark dataset for evaluating the capability of multimodal large language models to track fine-grained visual state changes in long-form videos. Unlike other benchmarks that test static scene understanding or simple event recognition, VSTAT requires models to maintain an online mental model of object states, count changes, and temporal order across extended video sequences sourced from YouTube.

创建时间:
2026-05-31
原始信息汇总

VSTAT:多模态视频理解中的视觉状态跟踪基准

VSTAT (Visual STAte Tracking) 是一个用于评估多模态大语言模型在长视频中跟踪细粒度视觉状态变化能力的基准。与测试静态场景理解或简单事件识别的基准不同,VSTAT 要求模型维护一个关于物体状态的动态心理模型,并能在来自 YouTube 的长视频序列中计数变化和追踪时间顺序。

发布状态: 2026年5月,VSTAT基准和评估代码已发布。

关键结果

  • 最强专有模型(Gemini-3.1 Pro)平均得分仅为 44.4,远低于人类表现(90.5),凸显了当前多模态大语言模型在视觉状态跟踪上的挑战。
  • 模型在零样本设置下进行基准测试,使用贪婪解码。
  • 问题按状态元素(计数、位置、属性)和状态结构(原子、序列、集合、字典)进行标注。
  • 多项选择题通过准确率评分;数值任务通过平均相对准确率评分。

基准与安装

  • 数据集托管: 在HuggingFace上的 nyu-visionx/VSTAT 集合中。
  • 安装步骤:
    1. 创建并激活 conda 环境:conda create --name vstat python=3.10 / conda activate vstat
    2. 克隆代码库:git clone https://github.com/vision-x-nyu/vstat.git 并进入目录。
    3. 初始化子模块并安装:git submodule update --init --recursive && pip install -e ".[video]"
  • 下载数据:
    1. 下载数据集到 data/ 文件夹:huggingface-cli download nyu-visionx/VSTAT --repo-type=dataset --local-dir data/vstat
    2. 运行视频下载和编辑脚本:依次执行 cd data/vstatpython scripts/download_youtube.py --resolution-map youtube_resolutions.jsonbash scripts/redact.shcd ../..
    3. 确保评估前 vstat_qa_clean.json 中引用的每个视频都存在于 data/vstat/ 下。
  • 自定义路径: 可通过环境变量 VSTAT_QA_PATHVSTAT_VIDEO_ROOT 设置。

评估

评估任务名为 vstat

  • 开源模型(单进程): 使用 python -m lmms_eval 命令,指定 --model--model_args(例如 Qwen/Qwen3-VL-8B-Instruct)。
  • 开源模型(多GPU): 使用 python -m accelerate.commands.launch 命令进行多GPU分布式评估。
  • API模型(例如Gemini): 设置 API 密钥并运行 python -m lmms_eval,指定 --model gemini_api 和相应的 --model_args(例如 model_version=gemini-3.1-pro-preview)。
  • 环境变量:
    • VSTAT_QA_PATH:指向 QA JSON 文件,默认为 data/vstat/vstat_qa_clean.json
    • VSTAT_VIDEO_ROOT:视频文件根目录,默认为 data/vstat/
    • HF_HOME:HuggingFace缓存路径,默认为 ~/.cache/huggingface

许可

本项目基于 Apache License 2.0 许可。

引用

如需引用本基准和代码,请按以下格式:

bibtex @article{vstat2026, title={Benchmarking Visual State Tracking in Multimodal Video Understanding}, author={Sihyun Yu and Nanye Ma and Pinzhi Huang and Hyunseok Lee and Shusheng Yang and June Suk Choi and Ellis Brown and Oscar Michel and Boyang Zheng and Jinwoo Shin and Saining Xie}, year={2026}, journal={arXiv preprint arXiv:2606.03920}, }

搜集汇总
数据集介绍
VSTAT 数据集图片
构建方式
VSTAT(Visual State Tracking)是一项专门用于评估多模态大语言模型在长视频中追踪细粒度视觉状态变化能力的基准测试。该数据集从YouTube平台采集了涵盖多样化场景的长视频序列,并构建了包含物体状态变化的系统化标注体系。具体而言,VSTAT围绕三大状态元素(计数、位置、属性)与四种状态结构(原子型、序列型、集合型、字典型)进行组织,每个问题均带有明确的标签,从而精准刻画视频中物体状态的动态演变。数据集的完整标注信息以JSON格式提供,便于研究者解析与使用。视频文件通过公开API下载,并经过脚本化的裁剪与脱敏处理,确保数据的合规性与可复现性。
使用方法
研究者可通过HuggingFace平台直接下载VSTAT基准数据集,并将其置于本地data/目录下。随后需运行配套的脚本完成YouTube视频的下载与脱敏处理,确保每个视频文件与标注JSON中的引用一一对应。评估工作基于lmms-eval框架,支持多种模型后端,包括开放权重的Qwen3-VL等模型,以及Gemini等API模型。用户只需指定模型名称与参数,即可在零样本设置下执行贪心解码,并通过准确率与平均相对准确率等指标获取量化结果。对于分布式场景,系统支持通过Accelerate库实现多GPU并行推理,从而高效完成大规模评估任务。
背景与挑战
背景概述
VSTAT(Visual State Tracking)是一个聚焦于多模态视频理解中细粒度视觉状态追踪能力的基准数据集,由纽约大学(New York University)与韩国科学技术院(KAIST)的研究团队于2026年共同创建,核心研究人员包括Sihyun Yu、Nanye Ma、Pinzhi Huang等。该数据集旨在解决现有基准测试仅关注静态场景理解或简单事件识别的局限,核心研究问题在于评估多模态大语言模型(MLLMs)在长视频中追踪物体状态变化、计数状态变迁及维持时间顺序的能力。VSTAT通过对YouTube长视频序列的精细标注,揭示了当前最强模型(如Gemini-3.1 Pro)仅达到44.4的平均分数,远低于人类表现的90.5,凸显了该领域对视觉状态追踪理解的深层挑战,对推动多模态视频理解的纵深发展具有重要影响力。
当前挑战
VSTAT所面临的领域挑战集中在要求MLLMs维持对物体状态的动态心理模型,并精准计数状态变化及时序关系,这与传统图像分类或动作识别任务难度显著不同,需要模型具备持久记忆与细粒度的视觉推理能力。在构建过程中,挑战包括从YouTube海量视频中筛选包含复杂状态变化序列的长片段,确保标注的状态元素(计数、位置、属性)与状态结构(原子、序列、集合、字典)具有明确的语义边界,同时协调多轮状态变迁的标注一致性。此外,视频的下载、剪辑与脱敏处理需应对版权与隐私合规问题,而评估设计需兼容不同模型架构的零样本推理策略,确保评测的公平性与可复现性。
常用场景
经典使用场景
在视频理解领域,VSTAT基准评测集被广泛用于评估多模态大语言模型在长视频中追踪物体精细视觉状态变化的能力。与仅关注静态场景理解或简单事件识别的数据集不同,VSTAT要求模型对视频中对象的属性、位置和计数等状态元素进行动态追踪,并理解原子、序列、集合和字典等不同状态结构的时序关系。研究者通常利用该数据集对模型进行零样本测试,通过多选题准确率和数值任务的平均相对准确率来量化模型的状态跟踪性能。
解决学术问题
VSTAT有效填补了当前多模态视频理解研究中对于细粒度视觉状态追踪能力系统性评测的空白。现有基准大多聚焦于静态图像描述或粗粒度事件分类,难以揭示模型在持续跟踪物体状态变化、计数变化及维持时序记忆方面的深层缺陷。该数据集通过引入多维度的状态元素与结构标签,使得研究者能够精准定位模型在视频理解中的薄弱环节,推动了视频理解从简单感知向复杂推理的范式转变。其发布证明了当前最先进的专有模型(如Gemini-3.1 Pro)平均得分仅44.4,远低于人类90.5的水平,深刻揭示了该领域的巨大挑战与研究价值。
实际应用
在实际应用中,VSTAT所评测的视觉状态追踪能力对于视频监控、自动驾驶、体育赛事分析以及人机交互等场景具有关键意义。例如,在视频监控中,系统需要持续追踪行人的位置变化、物品的状态切换(如门开关);在自动驾驶中,需要准确计数交叉路口的车辆数量和追踪交通信号灯的状态序列;在体育分析中,则需要记录运动员的动作顺序和计分变化。VSTAT的评测结果能够帮助开发者筛选和优化适用于这些真实场景的模型,提升其在复杂动态环境中的可靠性与准确性。
数据集最近研究
最新研究方向
VSTAT基准测试聚焦于多模态大语言模型在长视频中追踪细粒度视觉状态变化的能力,这是当前视频理解领域的前沿挑战。随着YouTube等平台超长视频内容的爆炸式增长,模型需超越静态场景理解,实时维护对象状态的动态心理模型,精准计数变化次数并把握时间顺序。实验揭示,即使顶尖闭源模型(如Gemini-3.1 Pro)平均得分仅44.4,远低于人类90.5的水平,凸显了现有MLLMs在状态追踪上的显著短板。该基准通过划分状态要素(计数、位置、属性)与结构(原子、序列、集合、字典),系统性评估模型在零样本条件下的表现,为开发具备持续推理能力的下一代视频理解系统树立了关键标尺,推动多模态AI向更精细、更动态的感知进化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务