遇见数据集

GAP-mmmu-pro-standard-10

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

该数据集包含多个配置(config_name),每个配置对应不同的生成模型或参数设置。所有配置共享相同的字段结构,包括:来源(source)、项目ID(item_id)、原始ID(origin_id)、样本种子(sample_seed)、问题(question)、图像(images)、图像数量(num_images)、参考答案(ref_answer)、类别(category)、输入ID(input_ids)、输入token长度(input_tokens_len)、生成文本(generated_texts)、生成token长度(generated_tokens_len)、预填充token数(n_prefill_tokens)、完成原因(finish_reason)、种子(seed)、标签(labels)、图像指纹(image_fingerprint)、图像处理器配置(image_processor_config)及其哈希(image_processor_config_hash)、总视觉token数(sum_vision_tokens)、最大视觉token数(max_vision_tokens)、唯一ID(id)、是否被截断(truncated_by_cap)、生成模型路径(generation_model_name_or_path)、是否启用思考(enable_thinking)。每个配置仅包含训练集(train),样本规模从50到500不等,总大小在数十MB到数百MB之间。该数据集可用于多模态指令生成任务的训练与评估,涵盖图像理解与文本生成,支持是否启用思考过程。

This dataset contains multiple configurations (config_name), each corresponding to different generation models or parameter settings. All configurations share the same field structure, including: source, item_id, origin_id, sample_seed, question, images, num_images, ref_answer, category, input_ids, input_tokens_len, generated_texts, generated_tokens_len, n_prefill_tokens, finish_reason, seed, labels, image_fingerprint, image_processor_config and its hash (image_processor_config_hash), sum_vision_tokens, max_vision_tokens, id, truncated_by_cap, generation_model_name_or_path, enable_thinking. Each configuration contains only training set (train), with sample sizes ranging from 50 to 500, and total size ranging from tens of MB to hundreds of MB. This dataset can be used for training and evaluation of multimodal instruction generation tasks, covering image understanding and text generation, with support for enabling or disabling the thinking process.

创建时间:
2026-08-25
原始信息汇总

数据集详情:GAP-mmmu-pro-standard-10

数据集概述

该数据集基于 MMMU-Pro 标准数据集构建,包含多模态(图像+文本)问答数据,由不同配置的 Gemma 系列模型生成回答,用于评估和训练多模态大模型。

数据配置(共17个config)

数据集包含 3种模型 × 2种生成模式 × 3种视觉Token配置 的组合,并附有子采样版本:

1. 模型类型

  • gemma-4-26b-a4b-it:26B参数模型
  • gemma-4-e4b-it:4B参数模型

2. 生成模式

  • ins-gen-2048:指令生成模式,最大生成长度2048
  • think-gen-4096:思考生成模式,最大生成长度4096(启用思维链)

3. 视觉Token配置(vt)

  • vt280:视觉Token数280
  • vt140:视觉Token数140
  • vt560:视觉Token数560

4. 子采样版本

  • subsample-50:50条子集
  • subsample-100:100条子集

数据规模

配置 样本数 大小
完整配置(如26b-ins-vt280) ~500条 ~188MB
subsample-50 50条 ~13-35MB
subsample-100 100条 ~27-49MB

所有配置均包含 train 分割,无验证/测试集。

字段说明(共26个特征)

  • 基础信息source(来源)、item_idorigin_idid
  • 内容question(问题)、images(图像列表)、num_imagesref_answer(参考答案)、category(类别)
  • Token信息input_idsinput_tokens_lengenerated_textsgenerated_tokens_lenn_prefill_tokenssum_vision_tokensmax_vision_tokens
  • 生成信息finish_reasongeneration_model_name_or_pathenable_thinking
  • 处理信息sample_seedseedlabelsimage_fingerprintimage_processor_configimage_processor_config_hashtruncated_by_cap

用途

适用于多模态大模型的 推理评估微调训练生成质量分析,涵盖视觉问答任务。

搜集汇总
数据集介绍
GAP-mmmu-pro-standard-10 数据集图片
构建方式
该数据集基于MMMU-Pro基准中的标准问题构建,通过多种Gemma系列模型(如gemma-4-26b-a4b-it和gemma-4-e4b-it)生成回答,并记录生成过程中的详细元数据。每个配置包含约500个样本,涵盖不同生成设置(如思考模式、最大生成令牌数、视觉令牌数等),并提供子采样版本(50、100个样本)以支持不同规模的实验需求。数据字段丰富,包括问题文本、图像、参考答案、输入输出令牌数、生成文本、视觉令牌统计等,为多模态推理研究提供了细粒度的信息。
特点
数据集的特点在于其多维度信息整合:不仅包含图像与问题对,还提供了生成模型标识、推理配置(如是否启用思考)、生成文本及令牌级统计(如预填充令牌数、视觉令牌总和与最大值)。此外,数据覆盖不同生成长度(2048/4096)和视觉令牌上限(140/280/560),以探讨生成约束对模型性能的影响。每个样本均带有唯一标识和种子,便于复现实验,而子采样配置则为模型调试与快速验证提供了高效选项。
使用方法
该数据集适用于多模态大语言模型的评估与训练。研究者可根据需要选择合适的配置,例如使用完整训练集进行性能基准测试,或采用子采样集进行快速迭代。数据中的生成文本、令牌统计和类别标签可支持监督式微调、偏好对齐或推理行为分析。通过比较不同配置下的输出质量,可研究生成长度、思考模式等超参数对模型表现的影响。此外,图像指纹与处理器配置哈希有助于确保数据一致性和可复现性。
背景与挑战
背景概述
GAP-mmmu-pro-standard-10数据集是在大规模多模态语言模型(LMM)快速发展的背景下,由研究团队为评估和优化模型在复杂视觉问答任务中的表现而构建的。该数据集基于MMMU-Pro基准,精选标准子集,并通过Gemma系列模型(如gemma-4-26b-a4b-it和gemma-4-e4b-it)生成高质量指令数据,涵盖多种视觉令牌配置(如vt140、vt280、vt560)和推理模式(指令生成与思考生成)。其核心研究问题在于探究不同模型规模、视觉令牌数量及生成策略对多模态推理能力的影响,为模型性能分析和数据增强提供标准化测试平台。该数据集提供包含500个样本的完整版本及50/100个样本的子采样版本,便于不同计算资源下的实验,对多模态模型的可复现研究具有重要推动作用。
当前挑战
数据集面临的首要挑战是解决多模态模型在复杂视觉问答中的泛化能力不足问题,MMMU-pro标准题集涉及跨学科知识整合与精细视觉理解,模型需在有限样本上展现鲁棒推理,而现有模型常因视觉噪声或逻辑缺失导致性能瓶颈。构建过程中,挑战在于高效生成高质量指令:需确保Gemma系列模型生成的文本与标准答案一致,同时控制视觉令牌长度(如vt140至vt560)对计算资源的消耗,并处理生成中断(finish_reason)与截断问题。此外,不同配置(如ins-gen与think-gen)需平衡指令多样性与可学习性,子采样需维持类别均衡,避免数据偏差。数据集的图像指纹与处理器配置的哈希管理也增加了工程复杂度,要求严格的版本控制以保证可复现性。
常用场景
经典使用场景
GAP-mmmu-pro-standard-10 数据集源于多模态大语言模型(MLLM)在复杂视觉推理任务中的评估需求,其设计聚焦于标准化的多选题设置,每个样本包含问题、图像、参考答案及模型生成文本,并附带详细的token级元数据。该数据集常被用于评测MLLM在跨模态理解、知识整合与逻辑推断上的综合能力,尤其在需要融合图像细节与文本语义的场景中,能够精准定位模型在视觉感知与推理层面的薄弱环节。其标准化的数据结构和参考答案体系,为研究者提供了可复现的基准测试环境,成为探索多模态模型能力边界的重要工具。
实际应用
在实际应用中,该数据集可用于多模态大模型的开发与迭代流程,作为模型发布前的标准验证集,帮助工程师快速评估模型在视觉问答任务上的性能基线。其子采样配置(如50、100样本)支持低成本快速测试,适合在资源受限的环境下进行模型调优。此外,数据集中的生成文本和token元数据可服务于推理服务中的性能监控,例如通过分析finish_reason分布识别超时或截断问题,或依据视觉token用量优化计算资源配置,从而提升部署效率与用户体验。
衍生相关工作
基于该数据集,研究者已衍生出多项经典工作,涉及多模态模型压缩与高效推理策略的验证,例如利用视觉token统计信息设计动态token剪枝算法;也催生了针对复杂视觉推理任务的提示工程研究,通过分析生成文本的思考模式(think vs. ins)改进Chain-of-Thought引导方法;此外,该数据集的细粒度标签结构还助力了多模态模型幻觉检测与修正技术的开发,以及跨模型能力对比研究,为构建更强健的通用多模态智能体提供了实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务