JMMMU-Pro
收藏资源简介:
JMMMU-Pro是由东京大学团队开发的基于图像的多学科多模态理解基准数据集,旨在评估模型对日语视觉-文本信息的整合理解能力。该数据集包含1320个问题,源自JMMMU基准,通过先进图像生成模型Nano Banana Pro将问题和对应图像融合为单一复合图像,覆盖多样化背景和布局设计。数据集构建采用创新的Vibe Benchmark Construction方法,以生成模型为主导、人工校验为辅,显著提升构建效率。其核心应用领域为评估大型多模态模型在日语环境下的视觉感知与复杂推理能力,尤其关注开源模型的性能瓶颈,为日语LMM发展提供重要基准工具。
JMMMU-Pro is an image-based multidisciplinary multimodal understanding benchmark dataset developed by the University of Tokyo team, designed to assess models' ability to integratively comprehend Japanese visual-textual information. This dataset includes 1,320 questions sourced from the JMMMU benchmark, where the questions and their corresponding images are fused into a single composite image via the state-of-the-art image generation model Nano Banana Pro, covering diverse backgrounds and layout designs. The dataset is constructed using the innovative Vibe Benchmark Construction method, which is generative model-led and supplemented by manual validation, substantially enhancing construction efficiency. Its core application lies in evaluating the visual perception and complex reasoning capabilities of large multimodal models (LMMs) in Japanese-language contexts, with particular emphasis on the performance bottlenecks of open-source models, thus serving as a critical benchmark tool for the advancement of Japanese LMMs.
JMMMU-Pro 数据集概述
数据集基本信息
- 数据集名称:JMMMU-Pro (Japanese MMMU-Pro)
- 简介:一个基于图像的日语多学科多模态理解基准,通过将每个问题的图像和文本嵌入到单个图像中构建而成,旨在评估模型通过视觉感知进行视觉-文本整合理解的能力。
- 构建方法:采用Vibe Benchmark Construction方法,利用图像生成模型(如Nano Banana Pro)生成候选视觉问题,并由人类进行验证和提示词调整以确保质量。
- 相关论文:JMMMU-Pro: Vibe Benchmark Construction of Image-based Japanese Multi-discipline Multimodal Understanding Benchmark (arXiv:2512.14620)
- 作者机构:The University of Tokyo (Atsuyuki Miyai, Shota Onohara, Jeonghun Baek, Kiyoharu Aizawa)
数据集特点与构建
- 核心特点:将问题图像和问题文本合成为单一图像,要求模型进行整合的视觉-文本理解。
- 构建优势:利用Nano Banana Pro模型高度逼真的图像生成和清晰的日语文本渲染能力,以低成本构建高质量基准,覆盖广泛的背景和布局设计。
- 构建范式:图像生成模型主导整个视觉问答(VQA)问题图像的创建过程,人类仅负责验证和提示词优化,特别适用于基于图像的VQA任务。
实验结果与发现
主要发现
- 开源模型表现:所有开源大型多模态模型(LMM)在JMMMU-Pro上均表现不佳,最佳模型Qwen3-VL-8B的得分仅为45.83,表明存在巨大改进空间。
- 性能下降:与JMMMU相比,大多数开源LMM(除Qwen2.5-VL-7B外)在JMMMU-Pro上的准确率显著下降。
- 闭源模型优势:闭源LMM在JMMMU-Pro上取得了显著更高的分数,揭示了其与开源模型之间的严重差距。
- 挑战性:JMMMU-Pro为评估和推进开源LMM的发展提供了一个具有挑战性且有价值的基准。
链式思维(CoT)提示分析
- 有效性差异:链式思维提示的有效性因模型和评估设置(JMMMU-Pro vs. JMMMU)而异。
- 模型偏好:部分模型在JMMMU和JMMMU-Pro上表现出不同的提示策略偏好,表明最优提示策略需针对每个模型和任务进行定制。
OCR性能分析
- 相关性:日语光学字符识别(OCR)性能与JMMMU-Pro准确率之间存在正相关(相关系数0.593)。
- 能力要求:解决JMMMU-Pro不仅需要强大的OCR能力,还需要通过视觉感知对语言和视觉信息进行整合解释和推理的能力。
样本与内容
- 样本多样性:JMMMU-Pro包含具有各种背景的图像,反映了真实场景的多样性。
价值与意义
- 评估工具:为评估LMM的日语能力提供了一个更严格的评估工具。
- 指导作用:作为指导开源社区未来工作的重要基准。
- 方法论贡献:Vibe Benchmark Construction为未来基于图像的VQA基准开发提供了高效的指导方针。




