TOMATO
收藏资源简介:
TOMATO是一个用于评估多模态基础模型在视频理解中时间推理能力的新型基准数据集。它包含1,484个精心策划的人工标注问题,涵盖6个任务,应用于1,417个视频,包括805个自录和自生成的视频,涉及3个视频场景。
TOMATO is a novel benchmark dataset for evaluating the temporal reasoning capabilities of multimodal foundation models in video understanding. It comprises 1,484 carefully curated manually annotated questions across 6 tasks, applied to 1,417 videos, 805 of which are self-recorded and self-generated, spanning 3 video scenarios.
TOMATO 数据集概述
数据集简介
TOMATO 是一个用于评估多模态基础模型(MFMs)视觉时间推理能力的新型基准数据集。该数据集包含 1,484 个精心策划的人工标注问题,涵盖 6 个任务(即动作计数、方向、旋转、形状与趋势、速度与频率、视觉线索),应用于 1,417 个视频,其中包括 805 个自录和自生成的视频,涵盖 3 个视频场景(即以人为中心、现实世界和模拟场景)。在 805 个自创视频中,应用了编辑技术以纳入反事实场景、复合运动和放大视图,旨在研究这些特征对 MFM 性能的影响。
任务示例
- 旋转任务:询问乒乓球旋转的方向。
- 加速度任务:询问物体在视频中的速度模式。
- 人类手势任务:询问视频中人物对相机的指示。
- 合成人类任务:询问视频中人物在空中绘制的三角形数量。
数据集结构
- 视频文件:包含 1,417 个视频,分为三个类别:human、object 和 simulated。
- 预训练模型:支持多种开源和专有模型的评估。
评估方法
- 评估脚本:提供
evaluate.py脚本用于模型评估。 - 结果解析:使用
parse_result.py脚本解析模型响应。 - 分类得分显示:使用
get_categorized_score.py脚本显示分类得分。
实验结果
- 多帧增益:评估任务是否可通过单帧解决。
- 帧顺序敏感性:评估任务对帧顺序的依赖程度。
- 帧信息奇偶性:评估信息在帧间的分布均匀性。
- 排行榜:展示各模型在 TOMATO 数据集上的零样本设置下的准确率。
引用
bibtex @misc{shangguan2024tomatoassessingvisualtemporal, title={TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models}, author={Ziyao Shangguan and Chuhan Li and Yuxuan Ding and Yanan Zheng and Yilun Zhao and Tesca Fitzgerald and Arman Cohan}, year={2024}, eprint={2410.23266}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2410.23266}, }




