VideoMathQA
收藏资源简介:
VideoMathQA是一个旨在评估现实世界教育视频中数学推理能力的基准数据集。它要求模型从视觉、音频和文本三种模态中跨时间解释和整合信息。该基准解决了‘多模态干草堆中的针’问题,其中关键信息稀疏且分布在不同的模态和视频时刻。
VideoMathQA is a benchmark dataset designed to evaluate the mathematical reasoning ability in real-world educational videos. It necessitates models to interpret and integrate information across visual, auditory, and textual modalities over time. This benchmark addresses the 'needle in a multi-modal haystack' problem, where critical information is sparse and distributed across different modalities and video moments.
VideoMathQA 数据集概述
基本信息
- 数据集名称: VideoMathQA
- 开发团队: MBZUAI, University of California Merced, Google Research, Australian National University, Linköping University
- 主要贡献者: Hanoona Rasheed, Abdelrahman Shaker, Anqi Tang, Muhammad Maaz, Ming-Hsuan Yang, Salman Khan, Fahad Khan
- 论文链接: https://arxiv.org/abs/2506.05349
- 项目网站: https://mbzuai-oryx.github.io/VideoMathQA
- 数据集访问: https://huggingface.co/datasets/MBZUAI/VideoMathQA
- 官方评估框架:
lmms-eval
数据集简介
VideoMathQA 是一个用于评估真实世界教育视频中数学推理能力的基准测试。它要求模型从视觉、音频和文本三种模态中跨时间解释和整合信息。该基准测试解决了多模态海量信息中的关键信息提取问题,其中关键信息稀疏且分布在不同的模态和时间点。
主要特点
- 多模态推理: 关键信息稀疏分布在视觉、文本和音频中,需要模型具备细粒度视觉理解、多模态整合和推理能力。
- 三种推理类型:
- 问题聚焦型: 问题明确,可通过直接观察和推理解决。
- 概念迁移型: 将演示的方法或原理应用于新问题。
- 深度教学理解型: 需要理解长篇幅教学内容,解释部分解决步骤并完成解答。
- 多样化评估维度:
- 数学概念: 涵盖几何、统计、算术和图表等10个领域。
- 视频时长: 从10秒到1小时不等,分为短、中、长三类。
- 难度级别: 分为不同难度等级。
- 推理类型: 涵盖多种推理方式。
- 高质量人工标注: 包含420个专家精心设计的问题,每个问题有五个选项、正确答案和详细的思维链(CoT)步骤。总计2,945个推理步骤,反映了920+小时的专家标注工作。
数据集统计与分析
- 数学概念分布: 涵盖10个数学领域,显示多模态模型在数学推理上的显著差距。
- 视频时长分布: 从10秒到1小时不等。
- 标注流程: 采用三阶段标注流程,由科学专业毕业生执行,每个阶段严格质量控制。
模型性能分析
- 视频长度影响: 模型在中等长度视频上表现最佳。
- 字幕影响: 包含字幕时整体准确率提高。
- 帧数影响: 输入帧数增加时性能提升。
- 模型局限性分析:
- 视频级理解对成功至关重要。
- 难度与模型性能呈相关性。
- 大多数错误源于问题误解或关键多模态线索缺失。
引用
bibtex @article{rasheed2025videomathqa, title={VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos}, author={Rasheed, Hanoona and Shaker, Abdelrahman and Tang, Anqi and Maaz, Muhammad and Yang, Ming-Hsuan and Khan, Salman and Khan, Fahad S.}, journal={arXiv preprint arXiv:2506.05349}, year={2025} }
致谢
感谢 LMMs-Lab 的开源贡献,特别是 LMMs-Eval,用于模型评估并作为官方工具包。




