MME-COF
收藏资源简介:
MME-COF是一个紧凑的基准数据集,用于评估视频模型的Chain-of-Frame (CoF)推理能力。它涵盖了12个推理维度,包括空间、几何、物理、时间和身体逻辑等。数据集由来自不同基准的推理任务组成,并通过精心设计的视频提示进行评估。该数据集旨在标准化视频模型的推理评估,并揭示当前视频模型在推理方面的优势和局限性。
MME-COF is a compact benchmark dataset designed to evaluate the Chain-of-Frame (CoF) reasoning capabilities of video models. It covers 12 reasoning dimensions, including spatial, geometric, physical, temporal, bodily logic, and other relevant categories. The dataset comprises reasoning tasks sourced from various benchmarks and is evaluated via meticulously designed video prompts. This dataset aims to standardize the evaluation of reasoning performance for video models, while revealing the current strengths and limitations of existing video models in terms of reasoning abilities.
MME-COF 数据集概述
数据集基本信息
- 数据集名称: MME-COF
- 研究主题: 视频模型作为零样本推理器的实证研究
- 研究对象: Veo-3视频模型
- 评估维度: 12个推理维度
评估维度分析
空间推理能力
- 短时空间一致性: 表现良好
- 复杂空间理解: 能力不足
- 长时因果推理: 存在局限
几何推理能力
- 2D几何推理: 具备初步能力但缺乏一致性
- 3D几何推理: 基础变换表现良好,复杂几何易出错
- 旋转推理: 仅能处理小角度平面旋转
物理推理能力
- 短期动态: 视觉上合理
- 物理约束: 无法保持定量约束(能量、动量)
- 因果顺序: 系统性失败
专业领域推理
- 医学推理: 处理能力有限
- GUI推理: 仅具备有限交互意识
- 结构化视觉理解: 具备初步能力
其他推理能力
- 物体计数: 具备基础能力但缺乏空间控制
- 视觉追踪: 简单场景表现良好
- 具身推理: 仅限于基础物体识别
基准特征
- 评估标准: 提供标准化分类和评估协议
- 评估重点: 超越表面视觉保真度的类别化评估
- 评估方式: 与链式帧推理对齐
总体结论
当前视频模型在短时空间一致性、细粒度定位和局部一致动态方面表现出潜力,但在长时因果推理、严格几何约束和抽象逻辑方面仍存在局限,尚不能作为独立的零样本推理器,但可作为专用推理模型的补充视觉引擎。

- 1Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark香港中文大学, 清华大学, 北京大学, 东北大学 · 2025年



