Diagram-MMU
收藏资源简介:
Diagram-MMU是一个多模态基准数据集,由南京理工大学、百度等机构联合构建,旨在评估多模态大语言模型在科学图表解析、编辑和问答方面的能力。数据集包含3,744张精选TikZ图表和18,305个问题,覆盖图表、平面几何、三维形状、图结构、化学式和电路六大领域,数据来源于官方手册和社区资源。通过代码简化、编译验证、去重、分类和人工审核等流程创建。该数据集旨在解决现有基准在图表类型和任务覆盖上的不足,支持vibe写作工作空间中的图表处理。
Diagram-MMU is a multimodal benchmark dataset jointly constructed by institutions including Nanjing University of Science and Technology and Baidu, aiming to evaluate the capabilities of multimodal large language models in scientific diagram parsing, editing, and question answering. The dataset contains 3,744 curated TikZ diagrams and 18,305 questions, covering six domains: diagrams, plane geometry, 3D shapes, graph structures, chemical formulas, and circuits. Its data originates from official manuals and community resources, and is developed through workflows such as code simplification, compilation verification, deduplication, classification, and manual review. This dataset is designed to address the shortcomings of existing benchmarks in terms of diagram types and task coverage, and supports diagram processing in the Vibe writing workspace.
Diagram-MMU:科学图表多模态基准数据集
一、数据集简介
Diagram-MMU 是一个用于评估多模态大语言模型(MLLMs)在科学图表解析与理解方面能力的多模态基准,主要针对科学写作与协作场景(如将图表直接转换为 LaTeX TikZ 代码)设计。
二、数据规模与构成
- 图表总量:3,744个唯一图表
- 评估样本:18,305个人工验证的评估样本
- 验证方式:由13名研究生交叉验证
三、覆盖领域
数据集涵盖 六种科学图表类型:
| 领域 | D2C-P 题目数 | TikZ 包 | DQA 题目数 |
|---|---|---|---|
| 图表 (Charts) | 959 | pgfplots |
1,834 |
| 平面几何 (Planar Geometry) | 598 | tikz/tkz-euclide |
1,118 |
| 3D 形状 | 236 | pgfplots |
455 |
| 图论 (Graph) | 1,356 | tikz |
2,679 |
| 化学 | 187 | chemfig |
366 |
| 电路 | 403 | circuitikz |
694 |
亮点:首次在图表到代码任务中覆盖了化学和电路两类图表。
四、任务设计
数据集围绕科学写作工作流设计了三个核心任务:
- 图表到代码解析 (D2C-P):将输入图表解析为可编辑的 TikZ 代码
- 图表到代码编辑 (D2C-E):根据修改要求(包括文本、颜色、范围、布局四个编辑维度)生成 TikZ 代码
- 图表问答 (DQA):回答关于图表的描述性和推理问题(包括假设性问题)
此外,还提供 16个可控评估设置(3个基础能力设置 + 13个智能体能力设置),智能体能力分为四个层级:上下文利用、工具使用、状态管理、规划。
五、评估指标
采用多层级评估指标:
- 对象级:基于语义对象模型计算类型、文本、颜色、边界框四个维度的 F1 分数
- 代码级:使用 CrystalBLEU 评估 TikZ 语法正确性
- 图像级:使用 SSIM、CLIP Score、LPIPS、FID 评估渲染输出的视觉相似度
- 答案准确率:DQA 由 LLM 评委进行二元评分
六、主要实验结果
对12个 MLLM 的评估显示:
- 最佳表现模型:
- 基础能力方面,Kimi-K2.5 在 D2C-P 上表现最佳(F1avg 57.48),Qwen3-VL-235B-A22B 紧随其后
- Gemini-3.0 Pro 在 D2C-E(F1avg 65.12/40.24)和 DQA(准确率 86.46%)上均为最佳
- 发现:图表到代码任务比图表问答更具挑战性;模型在推理图表方面表现良好,但在解析和编辑代码方面存在困难
- 智能体设置:多数模型在解析和编辑任务上有提升,但在问答任务上性能下降;Claude-4.6 Opus 是唯一在三个任务上均持续改进的模型
七、关键发现
- 推理与编码能力差距:DQA 准确率最高可达86%,而 D2C-P 的对象级 F1 仅31–57%
- 感知限制:空间定位(bbox)是最弱的感知维度
- 规划能力最弱:没有任何模型能可靠地组合多种能力应对复杂任务
- 工具使用差异:只有 Claude-4.6 Opus 能从 MCP 服务器工具中持续获益
八、数据来源
TikZ 代码来源包括官方包手册(PGFPlots、CircuiTikZ、TKZ-Euclide、ChemFig、TikZ-Network)和社区资源(texample.net、TeX Stack Exchange、GitHub tikz_favorites),共收集 6,849 个候选代码片段,经化简、编译渲染验证、去重和分类后形成最终数据集。

- 1Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams南京理工大学; 百度; 阿德莱德大学·机器学习研究所; 新加坡科技设计大学; 东南大学; 华东师范大学; 牛津大学; NetMind.ai · 2026年



