TUMTraffic-VideoQA
收藏资源简介:
TUMTraffic-VideoQA是一个针对复杂路边交通场景的时空视频理解的新型数据集和基准。该数据集由慕尼黑工业大学提供,包含1000个视频,涵盖85,000个多项选择题问答对、2,300个对象字幕和5,700个时空对象定位注释,涵盖各种真实世界条件,如恶劣天气和交通异常。数据集采用基于元组的时空对象表达方式,统一了视频问答、指代对象字幕和时空对象定位三项任务,为智能交通系统研究提供了坚实的基础。
TUMTraffic-VideoQA is a novel dataset and benchmark for spatio-temporal video understanding targeting complex roadside traffic scenarios. Provided by Technische Universität München, it comprises 1,000 videos, 85,000 multiple-choice question-answer pairs, 2,300 object captions, and 5,700 spatio-temporal object localization annotations. The dataset covers diverse real-world scenarios including severe weather and traffic anomalies, and adopts a tuple-based spatio-temporal object representation that unifies three core tasks: video question answering, referring object captioning, and spatio-temporal object localization, thereby establishing a solid foundation for intelligent transportation system research.

- 1TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes慕尼黑工业大学(Technische Universität München) · 2025年



