遇见数据集

Diagram-MMU

收藏
arXiv2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

Diagram-MMU是一个多模态基准数据集,由南京理工大学、百度等机构联合构建,旨在评估多模态大语言模型在科学图表解析、编辑和问答方面的能力。数据集包含3,744张精选TikZ图表和18,305个问题,覆盖图表、平面几何、三维形状、图结构、化学式和电路六大领域,数据来源于官方手册和社区资源。通过代码简化、编译验证、去重、分类和人工审核等流程创建。该数据集旨在解决现有基准在图表类型和任务覆盖上的不足,支持vibe写作工作空间中的图表处理。

Diagram-MMU is a multimodal benchmark dataset jointly constructed by institutions including Nanjing University of Science and Technology and Baidu, aiming to evaluate the capabilities of multimodal large language models in scientific diagram parsing, editing, and question answering. The dataset contains 3,744 curated TikZ diagrams and 18,305 questions, covering six domains: diagrams, plane geometry, 3D shapes, graph structures, chemical formulas, and circuits. Its data originates from official manuals and community resources, and is developed through workflows such as code simplification, compilation verification, deduplication, classification, and manual review. This dataset is designed to address the shortcomings of existing benchmarks in terms of diagram types and task coverage, and supports diagram processing in the Vibe writing workspace.

创建时间:
2026-08-13
原始信息汇总

Diagram-MMU:科学图表多模态基准数据集

一、数据集简介

Diagram-MMU 是一个用于评估多模态大语言模型(MLLMs)在科学图表解析与理解方面能力的多模态基准,主要针对科学写作与协作场景(如将图表直接转换为 LaTeX TikZ 代码)设计。

二、数据规模与构成

  • 图表总量:3,744个唯一图表
  • 评估样本:18,305个人工验证的评估样本
  • 验证方式:由13名研究生交叉验证

三、覆盖领域

数据集涵盖 六种科学图表类型

领域 D2C-P 题目数 TikZ 包 DQA 题目数
图表 (Charts) 959 pgfplots 1,834
平面几何 (Planar Geometry) 598 tikz/tkz-euclide 1,118
3D 形状 236 pgfplots 455
图论 (Graph) 1,356 tikz 2,679
化学 187 chemfig 366
电路 403 circuitikz 694

亮点:首次在图表到代码任务中覆盖了化学和电路两类图表。

四、任务设计

数据集围绕科学写作工作流设计了三个核心任务

  1. 图表到代码解析 (D2C-P):将输入图表解析为可编辑的 TikZ 代码
  2. 图表到代码编辑 (D2C-E):根据修改要求(包括文本、颜色、范围、布局四个编辑维度)生成 TikZ 代码
  3. 图表问答 (DQA):回答关于图表的描述性和推理问题(包括假设性问题)

此外,还提供 16个可控评估设置(3个基础能力设置 + 13个智能体能力设置),智能体能力分为四个层级:上下文利用、工具使用、状态管理、规划。

五、评估指标

采用多层级评估指标

  • 对象级:基于语义对象模型计算类型、文本、颜色、边界框四个维度的 F1 分数
  • 代码级:使用 CrystalBLEU 评估 TikZ 语法正确性
  • 图像级:使用 SSIM、CLIP Score、LPIPS、FID 评估渲染输出的视觉相似度
  • 答案准确率:DQA 由 LLM 评委进行二元评分

六、主要实验结果

对12个 MLLM 的评估显示:

  • 最佳表现模型
    • 基础能力方面,Kimi-K2.5 在 D2C-P 上表现最佳(F1avg 57.48),Qwen3-VL-235B-A22B 紧随其后
    • Gemini-3.0 Pro 在 D2C-E(F1avg 65.12/40.24)和 DQA(准确率 86.46%)上均为最佳
  • 发现:图表到代码任务比图表问答更具挑战性;模型在推理图表方面表现良好,但在解析和编辑代码方面存在困难
  • 智能体设置:多数模型在解析和编辑任务上有提升,但在问答任务上性能下降;Claude-4.6 Opus 是唯一在三个任务上均持续改进的模型

七、关键发现

  1. 推理与编码能力差距:DQA 准确率最高可达86%,而 D2C-P 的对象级 F1 仅31–57%
  2. 感知限制:空间定位(bbox)是最弱的感知维度
  3. 规划能力最弱:没有任何模型能可靠地组合多种能力应对复杂任务
  4. 工具使用差异:只有 Claude-4.6 Opus 能从 MCP 服务器工具中持续获益

八、数据来源

TikZ 代码来源包括官方包手册(PGFPlots、CircuiTikZ、TKZ-Euclide、ChemFig、TikZ-Network)和社区资源(texample.net、TeX Stack Exchange、GitHub tikz_favorites),共收集 6,849 个候选代码片段,经化简、编译渲染验证、去重和分类后形成最终数据集。

搜集汇总
数据集介绍
Diagram-MMU 数据集图片
构建方式
Diagram-MMU数据集的构建汲取了TikZ/LATEX生态系统的丰富资源,从官方包手册(如PGFPlots、CircuiTikZ、TKZ-Euclide、ChemFig等)及社区资源(如texample.net、TeX Stack Exchange)中搜集了6,849份TikZ源代码。经过冗余去除、编译验证及视觉比较的简化与过滤流程,剔除了无法编译或渲染不一致的样本,并进一步手动排除重复及琐碎图示。随后,借助多模态大模型进行初步分类,并由专家进行人工校正,最终精选出3,744幅涵盖图表、平面几何、3D形状、图结构、化学与电路六大领域的科学示意图。每幅图配以1个解析、2个编辑及2个问答任务,共生成18,305个评估样本,经由13位研究生双重交叉验证,确保数据质量与标注准确性。
使用方法
Diagram-MMU面向多模态大语言模型,用于评估其在科学图示的解析、编辑与问答三大任务上的表现。研究者可直接使用公开数据集,按提示要求模型解析图示生成TikZ代码、依据编辑指令修改代码或回答图示相关问题。基准支持基础能力评估,即直接进行任务,也支持智能体评估,即通过工具调用(如TikZ搜索)、上下文利用及多步骤规划完成任务。详细评估协议、提示模板与代码见项目主页,便于复现与拓展。
背景与挑战
背景概述
随着多模态大语言模型(MLLMs)在视觉-语言任务中的迅猛发展,其在科学写作与协作领域的应用也日益广泛,例如OpenAI Prism等平台可将科学图表直接转化为LATEX TikZ代码。然而,现有基准多聚焦于图表类型单一、代码表示以Python或SVG为主,且缺乏对智能体能力的评估。为弥补这一空白,由南京理工大学、百度、阿德莱德大学等机构于2026年联合构建了Diagram-MMU基准,旨在系统评估MLLMs在科学图表解析、编辑及问答三大任务上的基础与智能体能力,并首次引入TikZ代码与覆盖六类科学图表的全面评测。
当前挑战
Diagram-MMU所面临的挑战涵盖多个层面。在领域问题层面,现有MLLMs在图表解析与代码生成任务上表现显著弱于图表问答,模型难以将视觉对象准确映射为TikZ代码,尤其在三维形状等复杂结构上成绩偏低,揭示了感知与编码能力的瓶颈。在构建过程中,数据筛选需从6,849份TikZ代码中精简至3,744份,涉及代码编译验证、图像比对及人工交叉复核,工作量大且需保证质量;同时任务生成依赖智能体流水线,需处理编辑指令的精确性、答案的逻辑一致性,并设计多粒度评估指标,这些都构成了显著的实现挑战。
常用场景
经典使用场景
Diagram-MMU作为科学图表多模态理解与生成领域的标杆性基准,其经典使用场景聚焦于评估多模态大语言模型在科研写作工作流中的核心能力。具体而言,该基准通过精心设计的图到代码解析任务,要求模型将科学图表(涵盖图表、平面几何、三维形状、图结构、化学式及电路图六大学科领域)精准转化为可编译的LaTeX TikZ代码。同时,基准包含代码编辑任务,考验模型根据自然语言指令对已生成代码进行局部或全局修改的能力,以及图表问答任务,评估模型对图表深层次语义的理解与推理。这三类任务共同模拟了科研人员在撰写论文时对图表的真实操作需求,为衡量MLLMs在科学图表处理方面的综合素养提供了标准化的评测平台。
解决学术问题
Diagram-MMU的提出有效填补了现有科学图表基准在研究覆盖广度与评估深度上的双重空白。此前的相关工作或局限于单一图表类型(如柱状图、折线图),或以Python、SVG等非LaTeX原生代码作为目标表示,难以嵌入学术论文撰写环境,且普遍未涵盖代码编辑与智能体协作等关键维度。Diagram-MMU通过引入覆盖六大学科领域的TikZ代码基准,首次实现了对图表解析、代码编辑及问答推理的一体化评测,并创新性地提出对象级F1指标,从元素类型、文本、颜色、空间位置四个维度精细评估生成代码与真实代码的语义一致性。该基准还构建了基于MCP协议的TikZ文档检索工具,实现了对模型工具调用、上下文利用与规划等智能体能力的标准化评测,为多模态模型在科学图表理解与生成方向的性能提升提供了关键的评测依据与研究方向。
实际应用
Diagram-MMU的实际应用场景紧密贴合现代科研写作的智能化转型趋势,尤其是在类似OpenAI Prism的Vibe Writing工作空间中。科研人员可借助该基准所评测的模型能力,将手绘或已有图表自动转化为可直接嵌入LaTeX文稿的TikZ代码,免去繁琐的手动绘制过程;同时,通过自然语言描述修改需求,如调整配色、重排布局或变更图表类型,模型可智能完成代码的相应编辑,从而大幅提升论文撰写效率。此外,模型对图表的深度理解能力,能够辅助科研人员快速获取图表中的关键信息,进行数据对比与趋势分析,甚至在假设性修改下预判结果,为科学交流与研究决策提供有力支持。该基准的构建与评估方法论也为自动化科研工具的发展提供了可复用的评测框架。
数据集最近研究
最新研究方向
Diagram-MMU基准的发布标志着科学图表多模态理解研究迈入了一个全新阶段,其聚焦于多模态大语言模型(MLLMs)在图表解析、编辑与问答任务上的范式转换。前沿研究不仅关注模型的感知与推理能力,更将研究视角拓展至主体性(agentic)能力评估,涵盖上下文利用、工具调用、状态管理和规划等维度。通过引入基于MCP服务器的TikZ搜索工具,该基准推动了模型在真实科研写作工作流中的交互式应用,揭示了模型在图表到代码生成上的显著短板,并强调了提升空间定位准确性、代码合成效率及多步骤规划能力的关键研究方向。
相关研究论文
  • 1
    Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams南京理工大学; 百度; 阿德莱德大学·机器学习研究所; 新加坡科技设计大学; 东南大学; 华东师范大学; 牛津大学; NetMind.ai · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务