Video-MME-Logical
收藏官方服务:
资源简介:
Video-MME-Logical是一个用于视频时序逻辑推理的受控诊断基准数据集。
Video-MME-Logical is a controlled diagnostic benchmark dataset for video temporal logical reasoning.
创建时间:
2026-06-19
原始信息汇总
数据集概述
Video-MME-Logical 是一个用于视频时序逻辑推理的控制性诊断基准数据集。该数据集旨在评估多模态大模型在视频时序逻辑推理任务上的能力,并提供了不同难度级别的性能指标。
核心特性
- 全称:Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning
- 任务类型:视频时序逻辑推理
- 难度分级:数据集包含 Easy(简单)、Medium(中等)、Hard(困难) 三个难度级别。
数据集组成
该基准提供两个子集:
- Video-MME-Logical:主要基准,包含全面难度划分。
- Video-MME-Logical-S:一个增强版或子集,在相同难度分级下,多数模型在此子集上表现更差,凸显了更大的挑战性。
排行榜性能摘要
以下是部分模型在数据集上的总体准确率(%)表现:
Video-MME-Logical
| 模型类别 | 模型 | 总体 | 简单 | 中等 | 困难 |
|---|---|---|---|---|---|
| 人类 | 人类水平 | 95.9 | 98.4 | 95.9 | 93.4 |
| 闭源模型 | Gemini-3.1 Pro | 28.6 | 33.1 | 24.1 | 20.6 |
| 闭源模型 | GPT-5.4 | 22.7 | 31.7 | 20.3 | 16.1 |
| 开源指令模型 | Qwen2.5-VL-72B-Instruct | 12.5 | 15.2 | 13.1 | 9.1 |
| 开源推理模型 | Qwen3-VL-30B-A3B-Think | 10.3 | 16.0 | 8.7 | 6.1 |
Video-MME-Logical-S
| 模型类别 | 模型 | 总体 | 简单 | 中等 | 困难 |
|---|---|---|---|---|---|
| 人类 | 人类水平 | 96.1 | 98.5 | 96.0 | 93.8 |
| 闭源模型 | GPT-5.4 | 17.4 | 30.8 | 13.7 | 7.7 |
| 闭源模型 | Gemini-3.1 Pro | 10.8 | 18.7 | 8.5 | 5.2 |
| 开源推理模型 | Qwen3-VL-30B-A3B-Think | 3.6 | 9.0 | 1.3 | 0.3 |
| 开源指令模型 | Qwen3-VL-8B-Instruct | 0.0 | 0.0 | 0.0 | 0.0 |
获取与使用
- 项目页面:https://mrakas.github.io/video-mme-logical/
- 论文:https://arxiv.org/pdf/2606.27828
- 数据集下载:https://huggingface.co/datasets/marcuskwan/video-mme-logical
- 评估方法:项目提供了评估脚本(
eval.py),支持通过API进行评测,运行前需安装google-genai并设置GEMINI_API_KEY。
引用信息
bibtex @article{kwan2026video, title={Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning}, author={Kwan, Hohin and Li, Hongyu and Zhang, Ray and Zhang, Manyuan and Kong, Xianghao and Rao, Anyi and Xie, Jiahao and Liu, Si}, journal={arXiv preprint arXiv:2606.27828}, year={2026} }
许可协议
本项目采用 MIT 许可证。
搜集汇总
数据集介绍

构建方式
在视频理解领域中,时序推理与逻辑推理能力的评估一直是前沿挑战。Video-MME-Logical数据集通过一种受控的诊断性构建管道精心打造,旨在填补现有视频基准测试难以精准衡量模型时间逻辑推理能力的空白。该数据集从原始视频素材出发,经专家团队设计包含不同难度层级(简单、中等、困难)的多项选择题,并确保每道题目均围绕视频中的时间顺序与逻辑关系展开,从而实现对模型能力的细粒度剖析。所有样本均经过人工验证与质量控制,最终形成一套具备明确难度划分与高可信度的评测集合。
特点
该数据集的核心特色在于其刻意的诊断性设计,能够精准暴露当前多模态大模型在时间逻辑推理上的短板。两大子集Video-MME-Logical与Video-MME-Logical-S提供了从普遍到严苛的评测尺度,其中后者对几乎所有公开模型的零准确率表现揭示了现有技术的重大局限。数据集的难度分层机制(Easy/Medium/Hard)允许研究者深入分析模型在不同复杂度场景下的表现差异,而人类基准(超过95%准确率)与模型表现(最高不到30%)之间的巨大鸿沟,为领域发展提供了清晰的目标导向。
使用方法
使用者可通过Hugging Face平台直接下载完整数据集,并参照官方提供的Python评估脚本进行高效评测。首先需通过pip安装依赖库google-genai,并配置Gemini API密钥,随后运行评估脚本指向数据文件夹即可自动生成JSONL格式的预测文件并输出最终准确率。为简化操作流程,项目还提供了面向Codex智能体的端到端工作指南,覆盖从数据集下载到API调用的全链路实现。开源镜像站点与论文中的详尽说明进一步确保了可复现性,使研究者能够便捷地验证并对比各类模型的推理能力。
背景与挑战
背景概述
Video-MME-Logical是由Kwan等研究者于2026年推出的一个旨在评估视频时序逻辑推理能力的诊断性基准数据集。该工作由多个机构的研究人员共同完成,核心研究问题聚焦于多模态大模型在理解视频中时间顺序与逻辑关系时的局限性。随着视频理解技术的迅猛发展,现有基准难以精确衡量模型是否真正具备时序逻辑推理能力,而非仅依赖视觉或语言的表面线索。Video-MME-Logical通过精心设计的题目,区分了简单、中等和困难三个难度等级,为领域内提供了一套系统化的评估工具,推动了对多模态智能中逻辑推理能力的深入理解。
当前挑战
该数据集面临的核心挑战在于当前最先进的多模态模型在时序逻辑推理任务上表现显著不足,从结果看,人类准确率达95.9%,而最强开源模型仅12.5%,甚至闭源模型Gemini-3.1 Pro也仅28.6%,凸显了模型在理解事件序列、因果关系和时间约束方面的根本缺陷。构建过程的挑战在于如何生成既具有诊断性又避免数据集污染的问题,确保模型无法通过简单的模式匹配或记忆来解答。此外,控制题目难度类别、消除视觉感知之外的偏见,以及平衡不同逻辑关系类型的覆盖范围,均是构建该基准时需克服的难题。
常用场景
经典使用场景
Video-MME-Logical是一个专门用于诊断视频时序逻辑推理能力的受控基准测试集。其经典使用场景在于评估多模态大模型对视频事件在时间维度上的因果、顺序与条件逻辑进行理解与推理的能力。研究人员借助该基准,通过精心设计的视频片段与逻辑性问题,系统性地测试模型在简单、中等及困难三个难度层级上的表现。该基准尤为强调对模型是否真正掌握时序逻辑关系进行诊断,而非仅仅依赖视觉模式或语言先验,从而为多模态推理能力的细致评估提供了标准化的测试平台。
实际应用
在实际应用层面,Video-MME-Logical所诊断的时序逻辑推理能力对于诸多领域至关重要。例如,在智能视频监控中,系统需根据事件发生的前后顺序因果关系判断异常行为;在自动驾驶场景中,车辆需要理解交通参与者的时序动作以预测意图;在智能教育与问诊系统中,模型必须能够正确推理视频中的步骤流程与逻辑约束。该基准的高难度子集Video-MME-Logical-S甚至让多数模型准确率趋近于零,清晰地刻画了当前技术在实际部署中的瓶颈,引导产业界优先改善这一核心能力短板。
衍生相关工作
Video-MME-Logical的发布催生了一系列相关工作的涌现。首先,研究者们开始针对该基准暴露出的问题,提出专门增强时序逻辑推理能力的新方法与模型架构,例如引入显式事件关系图或时序注意力机制的改进。其次,该基准的受控构造策略启发了更多方向性诊断基准的诞生,如空间逻辑推理与因果推理基准。此外,基于其开源数据集和标准化评估脚本,社区得以进行公平且深入的横向对比,涌现出大量关于模型推理缺陷的细致分析工作,进一步推动了多模态人工智能从“感知走向认知”的研究浪潮。
以上内容由遇见数据集搜集并总结生成




