遇见数据集

SpaVoBench

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

SpaVoBench 是一个时间戳标注的图像-指令数据集,源自 WorldModelBench 中经人工审核保留的 keep 记录。每个数据条目包含一张 JPEG 图像和一条对应的英文指令,所有图像均以 annotation_id 命名。数据集包含注释文件(JSONL 和 JSON 格式)、文件清单、时间戳约定说明以及源视频策略。时间戳采用简洁编码:一位或两位数字表示秒,三位或四位数字中前几位表示分钟、最后两位表示秒,同时提供原始值和解码后的秒数。每条记录还保留了原始 WorldModelBench 中的文件路径、公共 URL、英文指令、审核通过的提示字段(包括视角、场景上下文、运动主体、相机约束和干预)以及由视角、相机约束和干预组成的流畅公开说明。该数据集适用于空间推理、视频理解和世界模型等任务,不包含原始 MP4 视频文件,视频资产仍归属于源数据集。

SpaVoBench is a timestamp-annotated image-instruction dataset derived from the keep records of WorldModelBench after manual review. Each data entry contains a JPEG image and a corresponding English instruction, with all images named by annotation_id. The dataset includes annotation files (JSONL and JSON), a file manifest, timestamp convention description, and source video strategy. Timestamps use a concise encoding: one or two digits for seconds, three or four digits where the first digits represent minutes and the last two represent seconds, along with original values and decoded seconds. Each record retains the original WorldModelBench fields: file path, public URL, English instruction, reviewed prompt fields (viewpoint, scene context, motion subject, camera constraint, intervention), and a fluent public description composed of viewpoint, camera constraint, and intervention. This dataset is suitable for tasks such as spatial reasoning, video understanding, and world models. It does not include original MP4 video files; video assets belong to the source dataset.

创建时间:
2026-08-08
原始信息汇总

SpaVoBench 数据集详情

数据集概述

SpaVoBench是一个面向空间推理和视频理解任务的图像-指令数据集,其数据源自WorldModelBench中经过人工审核的keep记录。每个JSONL行对应一张图像和一条英文标注说明。

数据文件结构

  • data/annotations.jsonl:发布记录,每个提取帧对应一条记录
  • data/annotations.json:仅包含保留记录的标注数据,以标准JSON数组格式存储
  • data/manifest.json:包含发布数量、来源策略和时间戳约定信息
  • images/:以annotation_id命名的JPEG帧图像
  • source-videos/README.mdsource-videos/manifest.jsonl:包含源视频规范和分组的源链接;完整MP4文件保留在Xinyun-Liu/WorldModelBench中,此处不重复存储

时间戳约定

  • 1-2位数字:表示秒数
  • 3-4位数字:最后两位为秒数,前导数字为分钟数
    • 示例:515 表示5分15秒(315秒),0158 表示1分58秒(118秒)
  • timestamp_raw 字段保留原始提交值,timestamp_seconds 字段包含解码后的提取时间

数据溯源与标注

每个记录包含以下信息:

  • 原始WorldModelBench文件路径和公开URL
  • text_caption:从原始标注中保留的英文指令
  • prompt_fields:分别存储审核批准的视角、场景上下文、运动主体、相机约束和干预信息
  • model_prompt:仅由视角、相机约束和干预信息组成的流畅公开描述

由于发布版本不复制源MP4文件,源数据集的条款和溯源信息仍归属于原始视频资产。

搜集汇总
数据集介绍
SpaVoBench 数据集图片
构建方式
SpaVoBench数据集源自对人类审查通过的WorldModelBench记录进行精细提炼,每行JSONL数据对应一帧图像及一条英文描述。其构建过程严谨,包括时间戳规范(如515表示5分15秒)以确保帧提取的精确性,同时保留原始文件路径与公共URL以追踪来源。数据集中每项记录均包含原始注释中的英文指令,并将视角、场景上下文、运动主体、摄像机约束及干预措施等要素结构化存储于prompt_fields中,而model_prompt则仅由视角、摄像机约束和干预措施组成,形成流畅的公开描述。此外,数据集附带清单文件(manifest)明确发布计数、源政策及时间戳约定,确保构建流程的透明性与可复现性。
特点
SpaVoBench的显著特色在于其专为空间推理与视频理解而设计,提供带时间戳的图像-指令对,每对数据皆源自人工评审的可靠记录。其时间戳约定富有创新性,通过位数区分分钟与秒,增强了解析效率。数据来源清晰,每项均关联至WorldModelBench的原始视频路径与URL,便于追溯。同时,prompt_fields与model_prompt的分离设计,既保留了评论批准的丰富上下文,又提供了简洁的公开提示,兼顾了研究灵活性与易用性。该数据集不重复存储视频文件,仅聚焦于图像与标注,有效减少了冗余,同时通过清单与政策文件维护了使用规范。
使用方法
使用SpaVoBench时,研究者可加载data/annotations.jsonl或annotations.json获取标注数据,并依据annotation_id从images/目录中匹配对应JPEG帧。通过manifest.json可了解发布细节,而source-videos/中的清单与README指导如何访问原始视频。时间戳可通过timestamp_seconds直接使用,或依据约定解码timestamp_raw。模型训练或评估可将图像与model_prompt作为输入,以预测空间关系或生成描述,也可利用prompt_fields进行精细化的条件控制。由于未包含视频文件,需依赖WorldModelBench获取完整视频资源,以进行时间维度的分析。
背景与挑战
背景概述
SpaVoBench数据集诞生于2025年,由刘欣运等研究者在世界模型与空间推理的交叉领域构建,旨在弥补现有视频理解基准在精细化空间动态推理上的不足。该数据集从WorldModelBench中筛选出经人工审核的'keep'记录,提取关键帧并配以英文指令,形成时间戳对齐的图像-指令对。其核心研究问题在于评估模型对视频中空间关系、运动主体与相机约束的联合理解能力,推动世界模型从静态感知向动态因果推理的演进。作为首个聚焦于空间推理的轻量级基准,SpaVoBench有望为多模态大模型的空间认知研究提供标准化测试平台,促进相关领域的可复现性进步。
当前挑战
SpaVoBench所应对的领域挑战在于,现有视频基准多侧重动作或事件分类,鲜少考验模型对场景内元素空间关系及时间变化的精准解析,导致世界模型的空间动态推断能力难以量化评估。在数据集构建过程中,挑战尤为显著:从WorldModelBench的海量视频中筛选出符合空间推理语义的片段需依赖人工审核,工作量庞大且主观性强;时间戳的规范化与转换(如将非标准格式'515'解析为5分15秒)易引入误差;同时,需在不复制原始MP4文件的前提下,确保数据溯源与授权信息完整,维持原数据集的法律条款完整性,这要求精密的元数据设计。此外,指令生成需在保留空间、运动及相机约束的同时,摒弃场景无关的冗余信息,平衡表述的简洁性与语义的丰富性,亦是构建中的难点。
常用场景
经典使用场景
SpaVoBench作为基于WorldModelBench人工审核数据构建的时间戳图像-指令基准,其经典使用场景聚焦于空间推理与视频理解任务的定量评估。研究者利用其细粒度的时间戳标注(如515表示5分15秒)和结构化的提示字段,可针对模型在动态场景中的空间关系理解、运动主体追踪及摄像机约束遵循能力进行标准化测试。该数据集特别适用于评测视觉语言模型在给定静态帧与自然语言指令时,能否准确推断场景的空间布局与时间演进逻辑,从而为视频世界模型的时空感知能力提供可复现的度量基准。
实际应用
在实际应用中,SpaVoBench可服务于多模态AI系统的开发与调试,尤其在自动驾驶、机器人导航与增强现实等依赖空间理解的领域。开发人员可利用该数据集验证视觉问答模型在复杂动态环境中的可靠性,例如检查模型能否根据车辆前方某一帧的指令“左转避开行人”而正确生成响应。此外,其时间戳约定与图像-指令配对形式,便于行业团队在模型部署前进行场景化压力测试,优化从视频流到实时决策的推理链路,从而提升实际系统中空间推理模块的安全性与可解释性。
衍生相关工作
该数据集的发布催生了多项相关研究工作。围绕其时间戳标注与提示结构,研究者衍生出时间感知的视觉-语言模型微调策略,旨在增强模型对时间上下文的敏感性。另一类衍生工作聚焦于世界模型的动态一致性评估,利用SpaVoBench的成对帧指令开展跨时间步的预测一致性测试。此外,其来源视频的公共路径与提示字段分离设计,启发了可追溯数据集的构建规范,促进了视频理解基准的透明化与标准化研究。这些衍生工作共同拓展了空间推理评测的边界,并为多模态基础模型的迭代提供了关键支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务