skymizer/ground-truth-mmmu-pro-standard-10-sampling-500
收藏资源简介:
该数据集是一个多模态视觉语言数据集,包含两个配置:Qwen3-VL-2B-Instruct和Qwen3-VL-30B-A3B-Instruct。每个配置的特征包括问题(question)、图像(images)、参考答案(ref_answer)、生成文本(generated_texts)、类别(category)等,用于支持视觉问答或图像相关文本生成任务。数据集还包含模型生成相关的元数据,如输入标记长度、生成标记长度、图像处理器配置和视觉标记统计信息,适用于训练或评估大型视觉语言模型。
This dataset is a multimodal vision-language dataset with two configurations: Qwen3-VL-2B-Instruct and Qwen3-VL-30B-A3B-Instruct. Each configuration includes features such as question, images, reference answer (ref_answer), generated texts (generated_texts), category, etc., designed for visual question answering or image-related text generation tasks. The dataset also contains metadata related to model generation, such as input token length, generated token length, image processor configuration, and vision token statistics, suitable for training or evaluating large vision-language models.




