遇见数据集

GAP-mmmu-pro-vision

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

该数据集包含多个配置,每个配置对应由Gemma系列模型(如gemma-4-26b-a4b-it和gemma-4-e4b-it)生成的指令跟随数据。数据集中每个样本包含一个多模态指令(问题question和图像images),以及对应的参考答案ref_answer和模型生成的文本generated_texts。数据集旨在用于视觉语言模型的训练或评估,特别是针对指令跟随和思考推理任务。每个样本还记录了输入token长度、生成token长度、预填充token数、完成原因、种子、标签、图像指纹、图像处理器配置、视觉token统计等信息。数据规模方面,每个配置的训练集样本数在50到500之间,总大小从约38MB到434MB不等。配置名称中的“ins-gen”表示指令生成模式,“think-gen”表示思考推理生成模式,视觉token数(vt140/vt280/vt560)表示图像编码后的视觉token数量,最大生成token数(2048/4096)表示文本生成上限。该数据集适用于多模态指令微调、视觉问答、图像描述生成等任务。

This dataset contains multiple configurations, each corresponding to instruction-following data generated by Gemma series models (e.g., gemma-4-26b-a4b-it and gemma-4-e4b-it). Each sample in the dataset includes a multimodal instruction (question and images), along with the corresponding reference answer (ref_answer) and model-generated text (generated_texts). The dataset is designed for training or evaluating vision-language models, particularly for instruction-following and reasoning tasks. Each sample also records information such as input token length, generation token length, prefilled token count, completion reason, seed, label, image fingerprint, image processor configuration, and visual token statistics. In terms of data scale, the number of training samples per configuration ranges from 50 to 500, with total sizes ranging from approximately 38MB to 434MB. In the configuration names, ins-gen indicates instruction generation mode, think-gen indicates reasoning generation mode, the visual token count (vt140/vt280/vt560) represents the number of visual tokens after image encoding, and the maximum generation token count (2048/4096) indicates the upper limit of text generation. This dataset is suitable for tasks such as multimodal instruction fine-tuning, visual question answering, and image caption generation.

创建时间:
2026-08-25
原始信息汇总

数据集详情总结

数据集名称

GAP-mmmu-pro-vision

数据集地址

https://huggingface.co/datasets/elichen-skymizer/GAP-mmmu-pro-vision

数据集概述

该数据集包含多个配置(config),每个配置对应不同的模型生成设置和子采样规模。数据集主要针对视觉问答(VQA)任务,包含问答、图片、模型生成文本及相关元数据。

配置详情

配置列表及其规模

配置名称 训练集样本数 数据集大小(Bytes) 下载大小(Bytes)
gemma-4-26b-a4b-it-ins-gen-2048-vt280 498 415,110,812 414,160,911
gemma-4-26b-a4b-it-ins-gen-2048-vt280-subsample-50 50 51,202,321 50,073,025
gemma-4-26b-a4b-it-ins-gen-2048-vt280-subsample-100 100 90,042,001 87,773,610
gemma-4-26b-a4b-it-think-gen-4096-vt280 493 433,979,526 430,987,218
gemma-4-26b-a4b-it-think-gen-4096-vt280-subsample-50 50 42,164,194 39,128,500
gemma-4-26b-a4b-it-think-gen-4096-vt280-subsample-100 100 98,337,544 92,408,822
gemma-4-e4b-it-ins-gen-2048-vt140 500 417,042,336 415,987,693
gemma-4-e4b-it-ins-gen-2048-vt140-subsample-50 50 53,257,276 52,265,522
gemma-4-e4b-it-ins-gen-2048-vt140-subsample-100 100 96,524,053 94,355,753
gemma-4-e4b-it-ins-gen-2048-vt280 496 417,993,830 416,816,230
gemma-4-e4b-it-ins-gen-2048-vt280-subsample-50 50 45,958,100 44,714,186
gemma-4-e4b-it-ins-gen-2048-vt280-subsample-100 100 93,940,761 91,212,346
gemma-4-e4b-it-ins-gen-2048-vt560 499 420,543,048 419,338,979
gemma-4-e4b-it-ins-gen-2048-vt560-subsample-50 50 38,316,919 36,828,399
gemma-4-e4b-it-ins-gen-2048-vt560-subsample-100 100 74,593,773 71,488,325
gemma-4-e4b-it-think-gen-4096-vt140 - - -

(注:最后一个配置的 splits 信息在提供内容中不完整。)

数据字段(所有配置通用)

  • source (string):数据来源
  • item_id (string):项目ID
  • origin_id (int64):原始ID
  • sample_seed (int64):采样种子
  • question (string):问题文本
  • images (list of image):图像列表
  • num_images (int32):图像数量
  • ref_answer (string):参考答案
  • category (string):类别
  • input_ids (list of int64):输入token IDs
  • input_tokens_len (int64):输入token长度
  • generated_texts (string):模型生成的文本
  • generated_tokens_len (int64):生成token长度
  • n_prefill_tokens (int64):预填充token数
  • finish_reason (string):生成结束原因
  • seed (int64):随机种子
  • labels (list of int64):标签
  • image_fingerprint (string):图像指纹
  • image_processor_config (string):图像处理器配置
  • image_processor_config_hash (string):图像处理器配置哈希
  • sum_vision_tokens (int64):视觉token总数
  • max_vision_tokens (int64):最大视觉token数
  • id (string):唯一标识
  • truncated_by_cap (bool):是否被截断
  • generation_model_name_or_path (string):生成模型名称或路径
  • enable_thinking (bool):是否启用思考模式

主要特征

  • 数据集围绕视觉问答(VQA)构建,包含问题、参考回答和模型生成文本。
  • 每个样本包含图像数据及图像处理相关信息。
  • 配置名称反映了生成模型(如gemma-4-26b-a4b-it、gemma-4-e4b-it)、生成模式(ins/think)、生成长度(2048/4096)以及视觉token数(vt140/vt280/vt560)。
  • 提供全量训练集和子采样(50、100样本)版本,便于快速实验。
搜集汇总
数据集介绍
GAP-mmmu-pro-vision 数据集图片
构建方式
GAP-mmmu-pro-vision数据集基于MMMU-Pro视觉问答基准构建,利用多个Gemma系列多模态大语言模型(如26b与e4b参数规模的指令跟随及思考变体)对原始问题进行深入生成与扩展。每条样本涵盖原始问题、参考答案、类别、图像输入、模型生成的文本、输入/生成令牌数、预填充令牌数、视觉令牌统计等元数据,并附带模型路径与思考模式配置,从而系统性地捕捉不同生成策略下的响应特征。
使用方法
此数据集适用于训练与评估多模态推理模型的生成质量与效率。研究者可借助其丰富的令牌级元数据,深入剖析模型在视觉问答中的信息处理瓶颈,或用于对比不同模型架构与思考策略的性能差异。数据格式兼容HuggingFace加载方式,可直接应用于Transformer等深度学习框架,支持模型微调、性能基准测试及推理过程的可视化分析,为提升视觉语言模型的可靠性与可解释性提供坚实的数据基石。
背景与挑战
背景概述
GAP-mmmu-pro-vision数据集是在多模态大语言模型(MLLMs)快速发展的背景下,由相关研究团队于2024年创建的一个专门用于视觉问答(VQA)任务的高质量基准数据集。该数据集基于MMMU-Pro基准,通过Gemma系列模型(包括gemma-4-26b-a4b-it和gemma-4-e4b-it)在指令跟随和思维链模式下生成,覆盖了多个视觉问答类别,旨在评估和提升多模态模型在复杂视觉推理任务上的表现。数据集的构建涉及精细的采样和扩展配置,如不同视觉token数量(vt140, vt280, vt560)和样本子集(50, 100),体现了对模型输入规模和推理深度影响的系统性探究。该数据集的出现为多模态模型的训练与评测提供了更贴近实际应用的高难度语料,对推动视觉-语言理解研究具有显著价值。
当前挑战
该数据集所面临的挑战主要分为两个层面。在领域问题层面,多模态模型在处理需要细致视觉感知与多步逻辑推理的复杂VQA任务时,常面临视觉信息与文本语义对齐困难、推理链不完整、以及在不同视觉token预算下性能波动等问题,这要求模型具备跨模态协同理解和稳健的推理能力。在数据构建层面,挑战在于确保生成答案的质量与多样性,以及如何有效控制生成过程中的噪声和偏差,例如不同模型配置下(如指令模式与思维链模式)输出的一致性和准确性。此外,数据的采样策略(如50、100样本子集)需平衡代表性、计算成本与信息完整性,同时保证数据集的规模足以支持泛化性能的评估,这些都是构建过程中需要精心权衡的难题。
常用场景
经典使用场景
GAP-mmmu-pro-vision 数据集作为大规模多模态语言模型(LMM)在视觉理解领域的关键基准,其核心应用场景涵盖模型训练、性能评估与跨模态推理能力测试。研究者常利用该数据集丰富的问题样本与图像对应关系,对模型进行指令微调或零样本评估,尤其侧重于挑战模型在复杂视觉问答中的感知、推理与生成能力。数据集中预设的 generation_model_name_or_path 和 enable_thinking 等参数,为探究不同推理模式对视觉任务表现的影响提供了标准化测试平台,使其成为检验 LMM 视觉常识与知识迁移能力的重要工具。
解决学术问题
该数据集有效回应了多模态大模型在视觉推理评测中缺乏细粒度、多源异构数据支撑的学术困境。传统基准往往聚焦于简单图像识别或单一模态任务,而 GAP-mmmu-pro-vision 通过融合多样化的视觉问题、标准答案及生成文本,能够全面剖析模型在视觉感知、语言生成与跨模态对齐方面的性能短板。其精细化的字段设计,如视觉令牌统计、图像指纹与截断标识,为研究者提供了诊断模型推理瓶颈的量化途径,从而推动了多模态模型在复杂场景下理解能力与鲁棒性的理论探索。
实际应用
在工业界的实际应用中,该数据集可用于自动化内容审核、视觉辅助导航及智能教育等场景,例如为视障用户提供图像转述服务,或在医疗影像辅助诊断中生成初步的影像描述。由于数据集涵盖了从问题到多轮响应的完整链路,并包含多种模型生成的变体,它也能支撑智能客服系统对用户上传图片的实时理解与反馈优化,同时可用于开发面向电商产品识别的多模态搜索排序算法,提升人机交互的自然度与准确性。
数据集最近研究
最新研究方向
GAP-mmmu-pro-vision数据集聚焦于多模态大语言模型(MLLM)在视觉推理任务中的性能评估与优化,其最新研究方向围绕两个核心维度展开:一是通过大规模生成式视觉指令数据,深入探究模型在复杂视觉问答(VQA)中的推理能力与思维链(Chain-of-Thought)机制,其中gemma-4-26b-a4b-it-think-gen-4096-vt280配置专为增强thinking模式设计,反映出对模型内在推理过程的重视;二是系统性地分析不同视觉令牌(vision token)数量(vt140、vt280、vt560)对生成质量与效率的影响,这一方向与多模态模型部署中的计算资源优化紧密相关。此外,该数据集提供了从原始数据到子采样(50、100条样本)的多规模配置,为研究小样本学习与数据效率提供了基准。随着Gemma系列模型的开源与迭代,该数据集成为评测和推动多模态推理前沿的关键资源,尤其在跨模态对齐、幻觉抑制与长上下文视觉理解等热点议题上具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务