Video Thinking Test (Video-TT)
收藏资源简介:
Video Thinking Test (Video-TT) 是一个用于评估视频LLMs在理解视频方面的正确性和鲁棒性的基准数据集。它由1000个YouTube Shorts视频组成,每个视频都有一个开放式问题和四个相关的对抗性问题,这些问题基于八个视觉或叙事复杂性因素。该数据集旨在确保任何模型响应中的错误都是由于模型缺乏理解,而不是因为选择关键帧的错误。
Video Thinking Test (Video-TT) is a benchmark dataset designed to evaluate the correctness and robustness of video large language models (LLMs) in video understanding tasks. It comprises 1000 YouTube Shorts videos, with each video paired with one open-ended question and four relevant adversarial questions, all of which are grounded in eight visual or narrative complexity factors. This dataset aims to ensure that any errors in model responses stem from the model's lack of understanding, rather than errors in keyframe selection.
Video Thinking Test (Video-TT) 数据集概述
基本信息
- 数据集名称: Video Thinking Test (Video-TT)
- 发布会议: ICCV 2025
- 作者: Yuanhan Zhang*, Yunice Chew*, Yuhao Dong, Aria Leo, Bo Hu, Ziwei Liu (*Equal contribution)
- 数据集地址: https://zhangyuanhan-ai.github.io/video-tt/
数据集简介
Video-TT 是一个用于评估视频大语言模型(video LLMs)是否能够像人类一样有效理解真实世界视频的基准测试。其主要特点包括:
- 区分因帧采样不足导致的错误与真实理解复杂视觉叙事能力的不足。
- 评估模型对自然对抗性问题的鲁棒性。
数据集构成
- 视频数量: 1,000 个 YouTube Shorts 视频
- 问题类型: 每个视频包含 1 个开放式问题和 4 个对抗性问题
- 问题总数: 5,000 个问答对
- 问题分类: 18 种不同类型,基于推理层级(元素、事件、情节)和查询类型(属性、定位等)
数据标注流程
- 确保复杂性:
- 视觉复杂性: 包括不清晰或异常内容、快速运动、复杂物体排列、视觉错觉等。
- 叙事复杂性: 包括情节转折、蒙太奇式剪辑、微妙的技术操作、依赖世界知识等。
- 主要问题标注: 标注者创建需要视觉或叙事复杂性的问答对,仅保留至少一个顶级模型无法正确回答的问题。
- 答案与理由: 提供正确答案、详细推理过程和对错误模型响应的批评。
- 采样检查: 问题必须可从 80 个均匀采样的帧中回答。
- 对抗性问题扩展: 基于模型失败创建每个主要问题的四个挑战性变体。
- 一致性检查: 三位标注者共识确保一致性,未达成一致的问题被丢弃。
性能评估
- 开源模型表现:
- InternVL-2.5-8B: 在直接问题上表现良好(65.7% Correctly-Led),但在误导性提示上表现不佳(24.5% Wrongly-Led)。
- LLaVA-Video-72B: 最强的开源模型,接近 GPT-4o 的多选准确率。
- 专有模型表现:
- GPT-4o: 在误导性提示上表现最鲁棒(67.5% Correctly-Led, 39.8% Wrongly-Led)。
- Gemini Pro: 优于大多数开源模型。
- 人类表现: 64.4% 准确率,显著高于所有模型。
- 对抗性鲁棒性: GPT-4o 最高(36.0%),但仍远低于人类;开源模型表现较差(如 InternVL-2.5-7B 为 10.9%)。
致谢
本研究由新加坡教育部支持(MOE-T2EP20221-0012, MOE-T2EP20223-0002),以及 RIE2020 Industry Alignment Fund – Industry Collaboration Projects (IAF-ICP) Funding Initiative 和行业合作伙伴的现金和实物贡献。

- 1Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding南洋理工大学S-Lab, 独立研究者 · 2025年



