遇见数据集

OVO-S-Bench

收藏
github2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

OVO-S-Bench是一个完全由人类标注的流式空间智能基准,包含在348个源视频上的1,680个问题。标注工作由12名训练有素的标注人员完成,进行了多轮质量保证,总计约804人时。每个问题都带有一个查询时间戳和一个证据区间,在评估时,模型只能看到查询之前的前缀。问题涵盖四个递增的抽象层次:瞬时自我中心感知、时空上下文跟踪、空间模拟与推理以及异中心映射。

OVO-S-Bench is a fully human-annotated benchmark for streaming spatial intelligence, comprising 1,680 questions across 348 source videos. The annotation work was completed by 12 well-trained annotators with multiple rounds of quality assurance, totaling approximately 804 person-hours. Each question is paired with a query timestamp and an evidence interval; during evaluation, models can only access the video prefix prior to the query timestamp. The questions cover four hierarchical abstraction levels: egocentric instantaneous perception, spatiotemporal contextual tracking, spatial simulation and reasoning, and allocentric mapping.

创建时间:
2026-05-28
原始信息汇总

数据集概述:OVO-S-Bench

OVO-S-Bench是一个用于评估多模态大语言模型(MLLMs)流式空间智能层次化基准测试。该基准测试由清华大学、上海人工智能实验室和北京航空航天大学的研究团队提出,所有数据均经过完全人工标注

核心构成

  • 数据规模:包含1,680道问题,来源于348个源视频
  • 数据来源:视频源自9个公开数据集,涵盖五个领域:室内漫游(RoomTour3D)、自我中心活动(Ego4D)、户外/世界场景(Sekai, OmniWorld, YouTube walking tours)、驾驶视频(CODa, Honda HDD)以及带空间注释的3D环境(ARKitScenes, VSI-Bench)。
  • 标注过程:由12名经过训练的标注员完成,总耗时约804人小时,涉及多轮质量保证和盲交叉审查。

评估协议:流式评估

每个视频在查询时间戳处被截断,模型在评估时只能看到该时间戳之前的视频前缀。模型通常接收从前缀中均匀采样的128帧,并结合问题和选项进行回答。所有评估均遵循此统一的流式协议。

层次化评估体系

OVO-S-Bench将问题组织为四个递进的能力层级

层级 能力描述 任务类别示例
L1 — 即时自我中心感知 仅依据查询时间附近的帧即可回答,无需回忆过去观察。 自我中心度量感知、局部空间关系、动态空间感知。
L2 — 时空上下文追踪 证据出现在前缀中,但在查询时已不可见。 场景再识别、视野外空间记忆、时序空间记忆。
L3 — 空间模拟与推理 需对空间结构进行操作,而非仅检索观察结果。 空间模拟、时空一致性验证、空间路径规划。
L4 — 异中心空间映射 需将自我中心流整合为异中心表征并查询其全局结构。 异中心方向推理、拓扑结构推理、轨迹-地图匹配。

各层级的证据跨度中位数差异显著(L1为2.0秒,L4为278.7秒),反映了所需的空间持久性梯度。

主要发现(基于38个评估系统)

  • 人类与模型的显著差距:最强系统Gemini-3.1-Pro达到59.2分,远低于人类专家在流式协议下的86.6分。
  • 异中心映射是主要瓶颈:对于34个系统中的28个,L4(异中心映射)是得分最低的层级。
  • 闭源优势窄而不均:闭源模型的整体领先优势仅为5.6分,且在L3层级上,最佳开源模型的表现超过了Gemini-3.1-Pro。
  • 专门化损害性能:15个流式架构或空间微调模型中有13个未超过其通用骨干模型,在整体准确率上中位数下降2.0分。
  • 思维链的双刃剑效应:显式推理在L2上持续有帮助(平均提升3.9分),但可能导致L1性能小幅下降(平均降低1.0分)。
  • 记忆保留并非瓶颈:证据召回与正确性之间的相关性接近零,表明性能差距并非简单的检索问题。

排行榜亮点

  • 第一名:Gemini-3.1-Pro(总体得分59.2%)。
  • 最佳开源模型:Qwen3-VL-235B-A22B(总体得分53.6%)。
  • 人类表现:在流式协议下总体得分为86.6%,离线无限制条件下得分为92.2%。

如何获取与使用

数据获取

数据集可通过以下平台下载:

  • Hugging Face: https://huggingface.co/datasets/JoeLeelyf/OVO-S-Bench
  • ModelScope: https://modelscope.cn/datasets/JoeLeelyf/OVO-S-Bench/

快速使用

  1. 克隆代码库并安装依赖。
  2. 使用脚本scripts/eval_api.sh评估API模型,或使用scripts/eval_vllm.sh评估开源模型。
  3. 评估结果会自动保存,支持中断后恢复。

自定义模型

用户可以通过实现BaseModel.inference接口来添加新的评估模型,并在配置文件中注册。

  • 详细指南见:docs/adding_models.md

评估与计分

  • inference.py:主要评估入口。
  • score.py:按类别聚合准确率。
搜集汇总
数据集介绍
OVO-S-Bench 数据集图片
构建方式
OVO-S-Bench的构建依托于九个公开视频数据集,涵盖室内漫游、第一人称活动、户外街景、驾驶记录及三维注释环境等五大场景。整个构建过程由12名具备三维视觉背景的标注人员历经约804人时完成,每位标注员独立撰写题目后还需接受盲审交叉复核。每个问题均指定查询时间戳与证据区间,且答案必须仅从视频前缀中推导,确保符合流式设定。标注员需标记最短证据区间,并设计在视觉上下文中具备迷惑性但基于证据错误的干扰项。为杜绝捷径,系统使用纯文本大模型探测题目是否通过措辞或选项不对称泄露答案,未通过者会被剔除或修订。最终构成包含1,680道题目、横跨四大抽象层级的流式空间智能基准。
特点
该数据集的核心特色在于其四层渐进式空间智能分类体系,从瞬时自我中心感知、时空上下文追踪、空间模拟与推理,直至异我中心拓扑映射,完整勾勒了多模态大模型在流式视觉中的空间认知梯度。每道题目附带的证据区间长度按层级递增,L1仅需数秒,而L4则要求模型整合跨越约4.6分钟的全局空间证据,精确量化了不同层级的记忆持久性与抽象需求。此外,数据集包含30种规范性任务类型,并创新性地在L4.3轨迹匹配任务中将选项图像以Base64编码内嵌于数据列,无需额外下载,极大简化了使用流程。评估发现,最强模型Gemini-3.1-Pro与人类专家在流式协议下仍存在27分的显著差距,异我中心映射成为普遍瓶颈。
使用方法
使用者首先需通过Git克隆项目仓库并安装依赖,可选基础API提供者模式或使用vLLM支持的开源模型。数据集可从ModelScope或Hugging Face下载,压缩包内含约35MB的注释Parquet文件与源视频目录。评估时采用统一流式协议:每个视频被截断至查询时间戳之前,模型仅接收从前缀中均匀采样的128帧图像,配合问题与选项。对于具备原生流式架构的模型,则按其公布的流率逐帧输入并查询压缩状态。运行评估脚本可指定模型与数据路径,对于分片多GPU运行,系统提供自动合并与恢复机制。最终结果通过评分脚本按主类别与子类别汇总准确率,支持详细分类查看。数据集还预留了模型扩展接口,便于研究者注册新模型进行对比。
背景与挑战
背景概述
OVO-S-Bench是一项由清华大学、上海人工智能实验室和北京航空航天大学的研究人员于2026年提出的层级化流式空间智能基准评测。该基准针对多模态大语言模型在连续第一人称视角流中理解空间结构的能力,解决了现有评测仅关注离线全视频或事件理解而忽视空间结构的问题。包含来自9个数据源的348个视频的1680个人工标注问题,覆盖从瞬时自我中心感知到异中心空间映射的四个递进层级。评估结果表明,最强模型Gemini-3.1-Pro仅达59.2分,远低于人类水平(86.6分),揭示了当前模型与人类流式空间智能之间的显著鸿沟。这一基准对推动机器人、增强现实和自动驾驶等领域的具身智能研究具有重要价值。
当前挑战
流式空间智能面临的主要挑战是模型需要在连续观测中整合跨视角的空间证据,完成从当前视觉感知到全局拓扑映射的抽象推理。具体而言,数据集的构建过程需要确保每个问题仅依赖于查询时间戳之前的视频前缀,证据区间从L1的2秒到L4的278.7秒不等,这对标注者的专业性和一致性提出了极高要求。此外,评估结果显示异中心空间映射是模型表现的主要瓶颈,34个系统中28个系统的L4得分最低,平均比L1-L3低9.3%。流式架构和空间微调专用模型甚至劣于其通用骨干网络,而思维链推理在缺乏视觉依据时反而会放大空间错误,表明问题不仅限于证据检索,而是源于更深层的空间表征与推理缺陷。
常用场景
经典使用场景
OVO-S-Bench作为一个层级化的流式空间智能基准,专为评估多模态大语言模型在连续自我中心视频流中的空间理解能力而设计。其最经典的使用场景聚焦于四层递进式空间推理任务:从瞬时自我中心感知(如距离、尺度与遮挡关系的判断),到时空语境追踪(如场景重识别与超出视野的空间记忆),再到空间模拟与推理(如重新定向、物理可行性检验与路径规划),最终升维至异中心全局地图构建(如拓扑结构推理与轨迹-地图对齐)。这一系统性框架为研究者提供了统一的评测协议——模型仅能访问查询时间戳之前的视频前缀,从而严格检验其对局部观察与全局空间结构的整合能力。
实际应用
在实际应用层面,OVO-S-Bench为多个高动态空间智能场景提供了关键的评测基准。在机器人自主导航中,模型需持续跟踪周围环境布局并规划可行路径,该基准的流式协议可有效评估其在非完全观测条件下的鲁棒性;在增强现实领域,模型需实时感知用户视角变化并维持空间记忆以进行即时交互;在自动驾驶场景中,车辆需从连续自我中心视觉流中推断异中心地图与拓扑结构。该基准构建的30个规范任务类型覆盖了从室内漫游、日常行为记录到户外驾驶的五个典型域,使其成为连接实验室研究与工业落地的重要桥梁。
衍生相关工作
OVO-S-Bench的提出已催生了一系列富有启发性的衍生工作。其评测发现深刻影响了流式架构与空间微调模型的设计方向:实验表明,专为流式或空间优化设计的模型变体在总体准确率上反而不及通用骨干网络,尤其是在异中心映射层面平均下降6.1个百分点。此外,思维链推理被证明在缺乏流式视觉依据时会放大空间错误。这些发现促使研究者重新审视记忆保留机制与帧选择策略,例如基于HERMES、FluxMem等记忆压缩方法的实验揭示,检索效果与空间推理正确性之间几乎零相关,从而引导社区将关注点从简单扩大帧缓存转向更根本的空间表征学习问题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务