GAP-mmmu-pro-standard-10
收藏资源简介:
该数据集包含多个配置(config_name),每个配置对应不同的生成模型或参数设置。所有配置共享相同的字段结构,包括:来源(source)、项目ID(item_id)、原始ID(origin_id)、样本种子(sample_seed)、问题(question)、图像(images)、图像数量(num_images)、参考答案(ref_answer)、类别(category)、输入ID(input_ids)、输入token长度(input_tokens_len)、生成文本(generated_texts)、生成token长度(generated_tokens_len)、预填充token数(n_prefill_tokens)、完成原因(finish_reason)、种子(seed)、标签(labels)、图像指纹(image_fingerprint)、图像处理器配置(image_processor_config)及其哈希(image_processor_config_hash)、总视觉token数(sum_vision_tokens)、最大视觉token数(max_vision_tokens)、唯一ID(id)、是否被截断(truncated_by_cap)、生成模型路径(generation_model_name_or_path)、是否启用思考(enable_thinking)。每个配置仅包含训练集(train),样本规模从50到500不等,总大小在数十MB到数百MB之间。该数据集可用于多模态指令生成任务的训练与评估,涵盖图像理解与文本生成,支持是否启用思考过程。
This dataset contains multiple configurations (config_name), each corresponding to different generation models or parameter settings. All configurations share the same field structure, including: source, item_id, origin_id, sample_seed, question, images, num_images, ref_answer, category, input_ids, input_tokens_len, generated_texts, generated_tokens_len, n_prefill_tokens, finish_reason, seed, labels, image_fingerprint, image_processor_config and its hash (image_processor_config_hash), sum_vision_tokens, max_vision_tokens, id, truncated_by_cap, generation_model_name_or_path, enable_thinking. Each configuration contains only training set (train), with sample sizes ranging from 50 to 500, and total size ranging from tens of MB to hundreds of MB. This dataset can be used for training and evaluation of multimodal instruction generation tasks, covering image understanding and text generation, with support for enabling or disabling the thinking process.
数据集详情:GAP-mmmu-pro-standard-10
数据集概述
该数据集基于 MMMU-Pro 标准数据集构建,包含多模态(图像+文本)问答数据,由不同配置的 Gemma 系列模型生成回答,用于评估和训练多模态大模型。
数据配置(共17个config)
数据集包含 3种模型 × 2种生成模式 × 3种视觉Token配置 的组合,并附有子采样版本:
1. 模型类型
- gemma-4-26b-a4b-it:26B参数模型
- gemma-4-e4b-it:4B参数模型
2. 生成模式
- ins-gen-2048:指令生成模式,最大生成长度2048
- think-gen-4096:思考生成模式,最大生成长度4096(启用思维链)
3. 视觉Token配置(vt)
- vt280:视觉Token数280
- vt140:视觉Token数140
- vt560:视觉Token数560
4. 子采样版本
- subsample-50:50条子集
- subsample-100:100条子集
数据规模
| 配置 | 样本数 | 大小 |
|---|---|---|
| 完整配置(如26b-ins-vt280) | ~500条 | ~188MB |
| subsample-50 | 50条 | ~13-35MB |
| subsample-100 | 100条 | ~27-49MB |
所有配置均包含 train 分割,无验证/测试集。
字段说明(共26个特征)
- 基础信息:
source(来源)、item_id、origin_id、id - 内容:
question(问题)、images(图像列表)、num_images、ref_answer(参考答案)、category(类别) - Token信息:
input_ids、input_tokens_len、generated_texts、generated_tokens_len、n_prefill_tokens、sum_vision_tokens、max_vision_tokens - 生成信息:
finish_reason、generation_model_name_or_path、enable_thinking - 处理信息:
sample_seed、seed、labels、image_fingerprint、image_processor_config、image_processor_config_hash、truncated_by_cap
用途
适用于多模态大模型的 推理评估、微调训练 和 生成质量分析,涵盖视觉问答任务。




