skymizer/ground-truth-mmmu-pro-vision-sampling-500
收藏资源简介:
该数据集是一个多模态视觉语言数据集,包含两个配置:Qwen3-VL-2B-Instruct和Qwen3-VL-30B-A3B-Instruct。每个配置包括训练数据,特征字段涉及源信息(source)、项目ID(item_id)、原始ID(origin_id)、样本种子(sample_seed)、问题(question)、图像列表(images)、图像数量(num_images)、参考答案(ref_answer)、类别(category)、输入ID列表(input_ids)、输入令牌长度(input_tokens_len)、生成文本(generated_texts)、生成令牌长度(generated_tokens_len)、预填充令牌数(n_prefill_tokens)、种子(seed)、标签列表(labels)、图像指纹(image_fingerprint)、图像处理器配置(image_processor_config)、图像处理器配置哈希(image_processor_config_hash)、总视觉令牌数(sum_vision_tokens)、最大视觉令牌数(max_vision_tokens)、生成模型名称或路径(generation_model_name_or_path)和生成启用思考(generation_enable_thinking,通常为null)。数据集用于视觉语言模型的训练或评估,包含文本和图像输入,以及对应的参考输出和生成输出,支持多模态任务如问答、图像理解等。Qwen3-VL-2B-Instruct配置有300个训练样本,Qwen3-VL-30B-A3B-Instruct配置有404个训练样本。
This dataset is a multimodal vision-language dataset with two configurations: Qwen3-VL-2B-Instruct and Qwen3-VL-30B-A3B-Instruct. Each configuration includes training data, featuring fields such as source, item_id, origin_id, sample_seed, question, list of images, num_images, ref_answer, category, input_ids list, input_tokens_len, generated_texts, generated_tokens_len, n_prefill_tokens, seed, labels list, image_fingerprint, image_processor_config, image_processor_config_hash, sum_vision_tokens, max_vision_tokens, generation_model_name_or_path, and generation_enable_thinking (typically null). The dataset is designed for training or evaluating vision-language models, incorporating text and image inputs along with corresponding reference outputs and generated outputs, supporting multimodal tasks like question answering and image understanding. The Qwen3-VL-2B-Instruct configuration has 300 training examples, and the Qwen3-VL-30B-A3B-Instruct configuration has 404 training examples.




