OVO-S-Bench
收藏资源简介:
OVO-S-Bench是一个完全由人类标注的流式空间智能基准,包含在348个源视频上的1,680个问题。标注工作由12名训练有素的标注人员完成,进行了多轮质量保证,总计约804人时。每个问题都带有一个查询时间戳和一个证据区间,在评估时,模型只能看到查询之前的前缀。问题涵盖四个递增的抽象层次:瞬时自我中心感知、时空上下文跟踪、空间模拟与推理以及异中心映射。
OVO-S-Bench is a fully human-annotated benchmark for streaming spatial intelligence, comprising 1,680 questions across 348 source videos. The annotation work was completed by 12 well-trained annotators with multiple rounds of quality assurance, totaling approximately 804 person-hours. Each question is paired with a query timestamp and an evidence interval; during evaluation, models can only access the video prefix prior to the query timestamp. The questions cover four hierarchical abstraction levels: egocentric instantaneous perception, spatiotemporal contextual tracking, spatial simulation and reasoning, and allocentric mapping.
数据集概述:OVO-S-Bench
OVO-S-Bench是一个用于评估多模态大语言模型(MLLMs)流式空间智能的层次化基准测试。该基准测试由清华大学、上海人工智能实验室和北京航空航天大学的研究团队提出,所有数据均经过完全人工标注。
核心构成
- 数据规模:包含1,680道问题,来源于348个源视频。
- 数据来源:视频源自9个公开数据集,涵盖五个领域:室内漫游(RoomTour3D)、自我中心活动(Ego4D)、户外/世界场景(Sekai, OmniWorld, YouTube walking tours)、驾驶视频(CODa, Honda HDD)以及带空间注释的3D环境(ARKitScenes, VSI-Bench)。
- 标注过程:由12名经过训练的标注员完成,总耗时约804人小时,涉及多轮质量保证和盲交叉审查。
评估协议:流式评估
每个视频在查询时间戳处被截断,模型在评估时只能看到该时间戳之前的视频前缀。模型通常接收从前缀中均匀采样的128帧,并结合问题和选项进行回答。所有评估均遵循此统一的流式协议。
层次化评估体系
OVO-S-Bench将问题组织为四个递进的能力层级:
| 层级 | 能力描述 | 任务类别示例 |
|---|---|---|
| L1 — 即时自我中心感知 | 仅依据查询时间附近的帧即可回答,无需回忆过去观察。 | 自我中心度量感知、局部空间关系、动态空间感知。 |
| L2 — 时空上下文追踪 | 证据出现在前缀中,但在查询时已不可见。 | 场景再识别、视野外空间记忆、时序空间记忆。 |
| L3 — 空间模拟与推理 | 需对空间结构进行操作,而非仅检索观察结果。 | 空间模拟、时空一致性验证、空间路径规划。 |
| L4 — 异中心空间映射 | 需将自我中心流整合为异中心表征并查询其全局结构。 | 异中心方向推理、拓扑结构推理、轨迹-地图匹配。 |
各层级的证据跨度中位数差异显著(L1为2.0秒,L4为278.7秒),反映了所需的空间持久性梯度。
主要发现(基于38个评估系统)
- 人类与模型的显著差距:最强系统Gemini-3.1-Pro达到59.2分,远低于人类专家在流式协议下的86.6分。
- 异中心映射是主要瓶颈:对于34个系统中的28个,L4(异中心映射)是得分最低的层级。
- 闭源优势窄而不均:闭源模型的整体领先优势仅为5.6分,且在L3层级上,最佳开源模型的表现超过了Gemini-3.1-Pro。
- 专门化损害性能:15个流式架构或空间微调模型中有13个未超过其通用骨干模型,在整体准确率上中位数下降2.0分。
- 思维链的双刃剑效应:显式推理在L2上持续有帮助(平均提升3.9分),但可能导致L1性能小幅下降(平均降低1.0分)。
- 记忆保留并非瓶颈:证据召回与正确性之间的相关性接近零,表明性能差距并非简单的检索问题。
排行榜亮点
- 第一名:Gemini-3.1-Pro(总体得分59.2%)。
- 最佳开源模型:Qwen3-VL-235B-A22B(总体得分53.6%)。
- 人类表现:在流式协议下总体得分为86.6%,离线无限制条件下得分为92.2%。
如何获取与使用
数据获取
数据集可通过以下平台下载:
- Hugging Face:
https://huggingface.co/datasets/JoeLeelyf/OVO-S-Bench - ModelScope:
https://modelscope.cn/datasets/JoeLeelyf/OVO-S-Bench/
快速使用
- 克隆代码库并安装依赖。
- 使用脚本
scripts/eval_api.sh评估API模型,或使用scripts/eval_vllm.sh评估开源模型。 - 评估结果会自动保存,支持中断后恢复。
自定义模型
用户可以通过实现BaseModel.inference接口来添加新的评估模型,并在配置文件中注册。
- 详细指南见:
docs/adding_models.md
评估与计分
inference.py:主要评估入口。score.py:按类别聚合准确率。





