MathVision-Wild
收藏资源简介:
MathVision-Wild数据集是一个专门用于测试视觉语言模型泛化能力的数据集。它通过在不同环境和设备上拍摄MathVision-testmini数据集中的数学问题图片来构建,旨在模拟真实世界中的多样化场景,以评估模型在处理现实世界数据时的表现。
MathVision-Wild is a dataset specifically developed to test the generalization capabilities of vision-language models. It is constructed by capturing images of mathematical problems from the MathVision-testmini dataset across diverse environments and devices, aiming to simulate various real-world scenarios for evaluating model performance when processing real-world data.
MathVision-Wild 数据集概述
数据集基本信息
- 许可证: Apache-2.0
- 任务类别: 视觉问答
- 语言: 英语
- 数据规模: 小于1K
数据集描述
MathVision-Wild 是基于 MathVision-testmini 数据创建的,通过在多种物理环境(如不同光照条件)和设备(包括打印纸、iPad、笔记本电脑和投影仪)上拍摄数据而构建。该数据集更贴近真实用户场景,能够更好地测试先进视觉语言模型的泛化能力。
性能对比
与原始 MathVision 相比,大多数开源和闭源视觉语言模型在 MathVision-Wild 上的准确率显著下降。但推理模型 o4-mini 在 MathVision-Wild 上的表现相比 MathVision 提升了 2.33%。
引用信息
如果使用该基准测试,请引用以下 BibTex:
@inproceedings{ wang2024measuring, title={Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset}, author={Ke Wang and Junting Pan and Weikang Shi and Zimu Lu and Houxing Ren and Aojun Zhou and Mingjie Zhan and Hongsheng Li}, booktitle={The Thirty-eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track}, year={2024}, url={https://openreview.net/forum?id=QWTCcxMpPA} }




