VSI-Super-Wild
收藏官方服务:
资源简介:
VSI-Super-Wild是一个针对真实世界视频的基准数据集,包含442个跨8个场景类别的视频,最长达4小时以上,以及6,980个人工验证的问答对,用于评估多模态模型在空间超感知方面的世界建模能力。
VSI-Super-Wild is a benchmark dataset for real-world videos. It includes 442 video samples spanning 8 scene categories with a maximum duration exceeding 4 hours, and features 6,980 manually verified question-answer pairs, which are designed to evaluate the world modeling capability of multimodal models in spatial super-perception.
创建时间:
2026-07-03
原始信息汇总
数据集概述:VSI-Super-Wild
VSI-Super-Wild 是一个面向真实世界场景的空间超感知(Spatial Supersensing)视频基准数据集,旨在评估多模态大模型(MLLMs)在空间推理和世界建模方面的能力,超越了传统以合成、家居和物体为中心的基准。
核心亮点
- 真实世界视频基准:包含 442 个真实世界视频,覆盖 8 个场景类别,最长视频超过 4 小时,并配有 6,980 个人工验证的问答对。
- 多锚点任务套件:设计了四项认知驱动的任务,从主体(Agent)、物体(Object) 和环境(Environment) 三个锚点全面评估模型对空间和时间的隐式世界状态建模。
- 诊断性洞见:通过任务和时域分析主流 MLLMs,揭示了在真实世界中进行空间超感知时反复出现的失败模式和开放挑战。
数据集规模与构成
视频与问答数据来源于半自动流水线(含人工验证环节),统计如下:
- 总问答数:6,980 条
- 总独立视频数:442 个
- 任务分布:
VOC(连续物体计数):1,113 条VMR(运动方向回忆):1,215 条VPO(地点时间顺序):1,302 条VOO(物体时间顺序):3,350 条
任务套件详解
该基准评估主体-物体-环境三元组上的四项任务:
| 任务 | 名称 | 锚点 | 测试内容 |
|---|---|---|---|
VMR |
运动方向回忆 | 主体 | 推断查询时刻的摄像机/人物相对于视角方向的运动方向。 |
VPO |
地点时间顺序 | 环境 | 在偏航旋转视角下对地点帧进行排序,需要不受方向影响的地点表示。 |
VOO |
物体时间顺序 | 物体 | 根据物体首次或末次出现进行排序,测试物体状态随时间的变化。 |
VOC |
连续物体计数 | 物体 | 从完整视频流中预测唯一实例的数量,需要维护计数状态。 |
诊断性发现:典型失败模式
当前主流多模态大模型在该基准上表现不佳,主要存在四种典型失败模式:
- 空间坍塌:模型未能维持跨视角的连贯空间世界状态,而是依赖特定视角的二维帧匹配。
- 语义捷径:模型利用语义捷径,而非从时空证据中推断运动并更新以主体为中心的世界状态。
- 更新不足:模型能较好保留早期世界状态,但难以根据新证据充分更新。
- 实例混淆:在真实世界的视觉复杂性(如运动模糊、部分遮挡、视角变化)下,模型无法稳健追踪物体身份。
数据获取与准备
- 下载地址:视频文件来自 Hugging Face 数据集。
- 目录结构:将视频放置于仓库根目录下的
data/文件夹中,问答文件位于tasks/vsi_super_wild/data/vsi_super_wild_qa.jsonl。 - 视频根路径:默认路径为
./data,可通过环境变量VSI_SUPER_WILD_VIDEO_ROOT自定义。
评估配置与指标
- 评估框架:基于
lmms-eval。 - 运行脚本:使用
scripts/run_vsi_super_wild_eval.py进行快速评估,或直接调用lmms-eval命令。 - 指标:报告五项分数:
vmr_accuracy、vpo_accuracy、voo_accuracy(三项选择题准确率)。voc_mra(计数任务的平均相对误差)。overall(所有任务的总体聚合分数)。
搜集汇总
数据集介绍

构建方式
VSI-Super-Wild数据集的构建依托于一套半自动流水线,并辅以人工在环校验机制。首先从YouTube广泛采集涵盖8种场景类别的全景视频,经过筛选与投影变换处理,将其转换为透视视图。随后,系统提取时间与空间元数据,结合预设规则自动生成问答对。整个过程融入人工审核环节,当元数据或问答质量不达标时,可回滚至前序步骤进行修正,最终形成包含442段真实世界视频与6980个经人工验证问答对的高质量基准。
特点
该数据集的核心亮点在于其“野外”真实性与认知导向的多锚点任务设计。视频时长跨度极大,最长超过4小时,远超现有合成或室内截取基准。任务体系围绕“主体—对象—环境”三元组构建了四项认知任务:运动方向回忆、地点时间排序、对象时间排序与持续对象计数,全面探查模型在时间与空间维度上对隐式世界状态的建模与更新能力。通过诊断分析,该基准揭示了当前多模态大模型在空间坍缩、语义捷径、更新不足与实例混淆等方面的共性失败模式。
使用方法
使用VSI-Super-Wild数据集时,需先从Hugging Face下载视频文件,并统一放置于仓库根目录下的data文件夹中,也可通过设置VSI_SUPER_WILD_VIDEO_ROOT环境变量自定义路径。问答文件以JSONL格式提供,记录仅包含视频文件名。评估流程支持通过lmms-eval框架运行,安装依赖后,可直接调用脚本运行单模型评估,支持指定模型、参数与样本限制。系统会报告各任务的准确率与计数任务的相对误差均值,并提供整体聚合分数,便于全面比较模型性能。
背景与挑战
背景概述
空间超感知(Spatial Supersensing)旨在赋予多模态模型类似于人类的隐式世界状态建模能力,使其能够从连续的感官流中推理并预测空间关系。然而,现有基准测试多局限于合成的、以家庭为中心且以物体为中心的场景,缺乏真实世界复杂性的检验。VSI-Super-Wild数据集由清华大学THUSI-Lab团队于2026年创建,发表于ECCV 2026,包含442段涵盖8种场景类别的野外真实视频,最长拍摄时长超过4小时,并附带6980对人类验证的问答对。该数据集创新性地引入了多锚点任务套件,从代理(Agent)、物体(Object)和环境(Environment)三个维度系统评估隐式世界模型在时空上的推理能力,为探索多模态大模型在非受控环境下的空间理解边界提供了关键资源,显著推动了该领域从实验室到现实世界的范式转变。
当前挑战
该数据集所解决的领域挑战在于现有空间超感知任务未能覆盖真实世界连续性和更广泛的世界状态。构建过程中面临的首要挑战是视觉复杂性:野外视频中存在运动模糊、部分遮挡和视角变化,使得物体身份追踪极为困难。第二个挑战是时空连续性:面对超过4小时的长视频流,模型需有效维持和更新隐式世界状态,但现有模型常表现出空间坍塌(依赖二维帧匹配而非隐式三维建模)和语义捷径(利用语义线索而非时空证据推理运动)等失效模式。第三个挑战源于任务设计本身:连续对象计数(VOC)和时序排序(VPO/VOO)要求模型在剧烈视角变化下保持视角不变性表征,并准确更新对象出现与消失的动态信息。最终,数据集的半自动化构建流程需人工循环验证,确保合成问答的元数据准确性与场景覆盖率,进一步增加了整体开发难度。
常用场景
经典使用场景
VSI-Super-Wild数据集专为评估多模态大模型在真实世界视频中的空间超感知能力而设计,其经典使用场景聚焦于认知导向的四项任务:运动方向回忆(VMR)、场景时序排序(VPO)、物体时序排序(VOO)以及连续物体计数(VOC)。这些任务分别锚定智能体、环境与物体三大维度,要求模型在长达数小时的野外视频流中推断摄像机或人物的运动方向、基于旋转视角对场景帧进行排序、根据物体出现顺序进行时序推理,并持续维护计数状态。研究者通常利用该数据集来检验模型是否能从单帧视觉线索中提取空间信息,进而在连续时域中构建并更新隐式世界状态。
实际应用
在真实应用层面,VSI-Super-Wild所评估的能力直接映射至多个高需求场景:自动驾驶系统需持续追踪周围环境中行人、车辆的运动方向并预测其轨迹;智能机器人需要在复杂户外环境中维持对物体位置和数量的动态记忆;视频监控系统则要求对跨视角的目标进行长时跟踪和时序推断。该数据集构建的野外视频评测范式,为这些需要稳健空间推理和持续性状态更新的工业系统提供了从实验室走向真实部署的可行性验证基准,并可作为下一代具身智能体感知模块的评估标准。
衍生相关工作
VSI-Super-Wild的发布催生了一系列围绕空间超感知与隐式世界建模的后续研究。在模型层面,研究者基于其暴露的缺陷提出了增强空间记忆更新的时序注意力机制和抗语义捷径的对抗训练策略;在任务设计上,衍生出融合多智能体交互与动态环境变化的新型评测任务。此外,该数据集的半自动流水线与人类监督验证框架被借鉴用于构建更大规模的野外视频理解基准。经典后续工作包括利用其失败模式诊断来指导新型多模态架构的改进,以及将VMR与VOC任务的思想整合进统一的世界状态预测模型之中。
以上内容由遇见数据集搜集并总结生成




