YiYang109/MMMU_trial2
收藏资源简介:
MMMU_trial2是一个基于论文的多模态多选题基准数据集,遵循MMMU-Pro风格。它包含50个自动从arXiv论文生成的多模态多选题(10个选项,A–J),覆盖所有6个MMMU-Pro学科(如技术与工程、科学、健康与医学等)。每个问题都基于图像视觉内容(如曲线趋势、箭头方向、颜色图例、数字注释等)或源论文文本,无需外部世界知识。数据集分为三个子集:standard(经典MMMU-Pro风格,包含图像和文本)、vision(仅视觉输入,问题和选项嵌入图像中)和augmented_prompt(用于测试提示敏感性,包含直接和思维链提示)。每个问题包含id、问题文本、选项、答案、图像、解释、学科等字段,答案字母分布均匀(A–J各5个)。数据集构建过程包括爬取论文、提取图像、视觉过滤、生成问题、平衡答案和验证基于论文内容。
许可证:CC BY 4.0 语言: - 英语 样本规模类别: - 样本量小于1000 任务类别: - 视觉问答(Visual Question Answering,VQA) - 多项选择 标签: - 多模态(multimodal) - VQA - MMMU - MMMU-Pro - 基准数据集(benchmark) 配置项: - 配置名称:standard 数据文件: - 拆分集:test - 路径:standard/test-*.parquet - 配置名称:vision 数据文件: - 拆分集:test - 路径:vision/test-*.parquet - 配置名称:augmented_prompt 数据文件: - 拆分集:test - 路径:augmented_prompt/test-*.parquet # MMMU_trial2 — 基于论文的MMMU-Pro风格基准数据集 50道多模态(multimodal)多项选择题(10个选项,A至J),由arXiv论文自动生成,覆盖MMMU-Pro的全部6个学科范畴。每道题目均基于图表的视觉内容或源论文文本,无需借助外部世界知识。 本数据集遵循**MMMU-Pro 架构**,包含三个子集:`standard`、`vision`与`augmented_prompt`。 ## 快速入门 python from datasets import load_dataset ds_std = load_dataset("YiYang109/MMMU_trial2", "standard", split="test") ds_vis = load_dataset("YiYang109/MMMU_trial2", "vision", split="test") ds_aug = load_dataset("YiYang109/MMMU_trial2", "augmented_prompt", split="test") example = ds_std[0] print(example["question"]) print(example["options"]) # 10个字符串 print(example["answer"]) # 单个字母A–J example["image_1"] # PIL图像 ## 子集 ### `standard`(10选项,附带图像) 经典的MMMU-Pro风格10选项多项选择题。模型可获取问题文本与原始图表。 | 字段名 | 类型 | 描述 | |---|---|---| | `id` | 字符串 | 格式为`q_xxxxxxxxxx` | | `question` | 字符串 | 英文问题题干 | | `options` | 字符串列表 | 恰好包含10个元素 | | `explanation` | 字符串 | 解题原理说明 | | `image_1` | PIL图像 | 论文中的源图表 | | `image_type` | 字符串 | 固定为`figure` | | `answer` | 字符串 | 单个字母A至J | | `topic_difficulty` | 字符串 | 固定为`research` | | `subject` | 字符串 | 例如`Computer_Science` | | `discipline` | 字符串 | MMMU-Pro的6个顶级学科之一 | | `paper_id` | 字符串 | arXiv标识符 | | `figure_id` | 字符串 | 图表唯一标识符 | | `source_caption` | 字符串 | 原始图表标题 | | `source_context` | 字符串 | 图表邻近的段落文本 | ### `vision`(纯视觉输入型) 问题题干与10个选项均嵌入至复合图像中,模型的唯一输入为该复合图像。 | 字段名 | 类型 | 描述 | |---|---|---| | `id` | 字符串 | 无额外说明 | | `image` | PIL图像 | 嵌入了问题与选项的复合图像 | | `options` | 字符串列表 | 同时以原始形式提供 | | `answer` | 字符串 | 单个字母A至J | | `subject` | 字符串 | 无额外说明 | | `discipline` | 字符串 | 无额外说明 | ### `augmented_prompt`(直接提示+思维链提示) 用于测试提示词敏感性。每条样本均包含两个现成的评估提示词。 | 字段名 | 类型 | 描述 | |---|---|---| | `id` | 字符串 | 无额外说明 | | `question`, `options`, `answer`, `subject`, `discipline` | — | 与`standard`子集一致 | | `image_1` | PIL图像 | 原始图表 | | `prompt_direct` | 字符串 | “仅输出答案字母”格式的提示词 | | `prompt_cot` | 字符串 | “先逐步思考,再以`Answer: X`格式输出”格式的提示词 | | `explanation` | 字符串 | 解题原理说明 | ## 样本分布 | 一级学科 | 二级学科 | 题目数量 | |---|---|---| | 技术与工程 | 计算机科学 | 12 | | 科学 | 物理学 | 9 | | 健康与医学 | 诊断与检验医学 | 9 | | 艺术与设计 | 设计学 | 8 | | 人文与社会科学 | 社会学 | 7 | | 商学 | 经济学 | 5 | | **总计** | | **50** | 答案字母分布完全均匀:A至J各5道题目。 ## 数据集构建流程 1. 爬取覆盖6个学科的arXiv论文。 2. 使用紧密边界框(tight-bounding-box)算法(基于PyMuPDF,灵感源自PDFFigures2)提取论文图表。 3. 视觉二次过滤(采用gpt-5.5)剔除误提取的非图表或纯文本图表。 4. 使用多模态大语言模型(multimodal large language model,gpt-5.5)为每张图表生成一道10选项的多项选择题,强制问题依赖视觉证据(如曲线趋势、箭头方向、色标、数值标注等),而非仅复述图表标题文本。 5. 轮询平衡答案字母的位置分布。 6. 接地性校验:验证大语言模型将被提供图表标题、邻近段落、完整论文正文、图表、问题及答案,若某道题的答案需要依赖外部世界知识,则拒绝该样本。 ## 许可证 采用CC BY 4.0协议。底层arXiv论文及图表保留其原始授权。 ## 引用格式 bibtex @misc{mmmu_trial2_2026, title = {MMMU\_trial2: A Paper-Grounded MMMU-Pro-Style Benchmark}, author = {YiYang109}, year = {2026}, url = {https://huggingface.co/datasets/YiYang109/MMMU_trial2} }



