MMSI-Video-Bench
收藏资源简介:
MMSI-Video-Bench是一个全面人工标注的基准测试,用于评估多模态大语言模型中的视频空间智能。它通过1,106个问题实现了一个四级框架——感知、规划、预测和跨视频推理,这些问题基于来自25个公共数据集和内部录制的1,278个视频片段。数据集具有高质量、挑战性、多样化的视频来源和全面的任务覆盖范围。
MMSI-Video-Bench is a comprehensively manually annotated benchmark for evaluating video spatial intelligence in multimodal large language models. It establishes a four-level framework—perception, planning, prediction, and cross-video reasoning—with 1,106 questions, which are grounded in 1,278 video clips sourced from 25 public datasets and internally recorded materials. The dataset features high quality, high challenge, diverse video sources, and comprehensive task coverage.
MMSI-Video-Bench 数据集概述
数据集基本信息
- 数据集名称:MMSI-Video-Bench
- 核心定位:一个用于评估多模态大语言模型视频空间智能的全人工标注基准
- 发布日期:2025年12月
- 官方主页:https://rbler1234.github.io/MMSI-VIdeo-Bench.github.io/
- 论文地址:https://arxiv.org/abs/2512.10863
- 数据集地址:https://huggingface.co/datasets/rbler/MMSI-Video-Bench
- 许可证:Creative Commons Attribution-NonCommercial 4.0 International License (CC BY-NC 4.0)
数据集构成与规模
- 问题数量:1,106 个问题
- 视频片段数量:1,278 个视频片段
- 视频来源:来自25个公开数据集及1个内部采集数据
- 标注人员:11位3D视觉领域的专家
- 数据质量:所有数据均经过人工标注,并遵循严格的审核与验收流程以确保准确性和可靠性
核心特征
- 高质量:全人工标注,专家审核。
- 挑战性:评估显示存在显著的人机差距,最佳推理模型性能仍落后人类近60%。
- 视频来源多样:涵盖桌面录制、室内及多层环境、户外场景、体育和电影素材。
- 任务覆盖全面:涵盖空间布局推理、运动理解、决策制定和跨视频推理,提供对视频空间智能的更全面评估。
任务分类与框架
数据集通过一个四级框架组织问题:
- 感知
- 规划
- 预测
- 跨视频推理
具体包含以下5个主要问题类别:
- 空间构建:关注实例与场景的空间属性,以及实例、场景与相机之间的空间关系(共6个子类型)。
- 运动理解:包括理解相机运动、实例运动以及实例间的交互运动。
- 规划:基于时空视频信息进行规划。
- 预测:评估模型基于观察视频预测、预期或想象未来状态的能力。
- 跨视频推理:涉及跨时间分离视频片段的记忆更新,以及跨不同视角拍摄视频的多视图整合。
数据内容与获取
数据集在Hugging Face上提供,包含以下文件:
- 标注文件:
mmsivideo.json - 问题参考图像:
ref_images.zip - 视频帧:
frames.zip - (可选)原始视频文件:
videos.zip
评估设置
提供两种评估设置:
- Uniform-50:由于部分模型存在输入长度限制而提供。
- Sufficient-Coverage:确保所有视频信息完全保留,推荐使用此设置进行评估。
基准测试结果摘要
评估了25个强大的开源和专有MLLMs。
主基准排名(Sufficient-Coverage设置前三名)
- O3:平均得分37.34%(专有模型)
- Gemini 2.5 Flash (Thinking):平均得分36.71%(专有模型)
- Gemini 2.5 Flash:平均得分36.62%(专有模型)
人类基线表现
- Human:平均得分96.4%
- Random Guessing:平均得分24.1%
子基准表现最佳模型
- 机器人子基准:Gemini 3 Pro (40.20%)
- 室内场景感知子基准:GPT-5 (41.68%)
- Grounding子基准:Gemini 2.5 Flash (38.81%)
致谢
MMSI-Video-Bench使用了来自25个开源数据集的数据,包括Roomtour3d, ScanNet, ScanNet++, 3RScan, ARKitScenes, RealEstate10k, DL3DV, Waymo, NuScenes, OVIS, TrackingNet, LaSOT, UAV123, Ego4D, EPIC-KITCHENS, EgoExoLearn, MultiSports, charades, LEMMA, TF2023, CVMHT, AVA, DROID, RH20T, DTU。




