遇见数据集

Diagram2Code

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

Diagram2Code Benchmark 是一个用于多模态大语言模型(MLLM)图表识别任务的基准测试数据集。该数据集旨在评估模型将各种类型的图表图像转换为结构化代码表示的能力。数据内容包含多种图表类型,具体包括:流程图(flowchart)、序列图(sequence_diagram)、电路图(circuit_diagram)、状态图(state_diagram)和网络拓扑图(network_topology)。每个数据样本由图表图像和对应的模型识别输出组成。核心数据字段包括:图像路径(image)、图表类型(type)、生成输出的模型名称(model),以及模型识别出的多种代码表示形式及其编译验证结果,具体涵盖 Mermaid 代码、PlantUML 代码、XML 代码、DOT (Graphviz) 代码和 SVG 代码,并分别附有对应的编译结果字段(例如 `mermaid_compilation_result`)。数据集提供了多个配置视图,除了默认配置外,还包括用于图对象评估的样本级和模型级配置,以及一个面向研究者的紧凑型有效实验总结表(effective_experiment_summary),该总结表筛选了在 FlowGen、FlowVQA 和 FlowDiagBench 等基准上可用的实验数据行。数据集规模属于小规模(n<1K),适用于图像到文本、视觉问答等任务,特别是图表理解与代码生成相关的研究与评估。

Diagram2Code Benchmark is a benchmark dataset for multimodal large language model (MLLM) chart recognition tasks. It aims to evaluate the ability of models to convert various types of chart images into structured code representations. The data includes multiple chart types: flowchart, sequence diagram, circuit diagram, state diagram, and network topology. Each data sample consists of a chart image and the corresponding model recognition output. Key data fields include image path (image), chart type (type), model name generating the output (model), and multiple code representation forms identified by the model along with their compilation verification results, specifically covering Mermaid code, PlantUML code, XML code, DOT (Graphviz) code, and SVG code, each accompanied by corresponding compilation result fields (e.g., `mermaid_compilation_result`). The dataset provides multiple configuration views, including default configuration, sample-level and model-level configurations for graph object evaluation, and a compact effective experiment summary table (effective_experiment_summary) for researchers, which filters experimental data rows available on benchmarks such as FlowGen, FlowVQA, and FlowDiagBench. The dataset is small-scale (n<1K) and suitable for tasks like image-to-text and visual question answering, particularly for research and evaluation related to chart understanding and code generation.

创建时间:
2026-05-25
原始信息汇总

数据集概述:Diagram2Code Benchmark

  • 名称:Diagram2Code Benchmark
  • 语言:中文、英文
  • 许可证:CC-BY-4.0
  • 任务类别:图像到文本
  • 具体任务:视觉问答
  • 数据集大小:少于1000个样本

数据集标签

  • 图像
  • 表格
  • 数据集
  • 图表
  • 流程图
  • 序列图
  • 电路图

数据集配置

数据集包含以下四个配置:

配置名称 数据文件路径
default data/*.parquet
graph_object_eval_sample_level graph_object_eval_sample_level/*.parquet
graph_object_eval_model_level graph_object_eval_model_level/*.parquet
effective_experiment_summary effective_experiment_summary/*.parquet

图表类型 (type 字段)

支持以下图表类型(均使用小写):

  • flowchart:流程/决策流程图
  • sequence_diagram:交互序列图
  • circuit_diagram:电气/电子电路图
  • state_diagram:状态转换图
  • network_topology:逻辑网络拓扑图

数据集模式 (Schema)

每条记录包含以下字段:

  • image:图表图像文件(推荐存储为图像路径)
  • type:图表类型
  • model:生成结构化输出的模型名称(例如 gpt-4o
  • mermaid:识别的 Mermaid 代码
  • mermaid_compilation_result:Mermaid 编译结果(success / fail / 错误信息)
  • plantuml:识别的 PlantUML 代码
  • plantuml_compilation_result:PlantUML 编译结果
  • xml:识别的 XML 代码
  • xml_compilation_result:XML 编译结果
  • dot:识别的 DOT (Graphviz) 代码
  • dot_compilation_result:DOT 编译结果
  • svg:识别的 SVG 代码
  • svg_compilation_result:SVG 编译结果

样本输出

运行 dataset.ipynb 会生成单行样本文件,位于:

  • data/benchmark_sample/benchmark_sample.csv
  • data/benchmark_sample/benchmark_sample.jsonl
  • data/benchmark_sample/images/sample_flowchart.png

有效实验总结

effective_experiment_summary 配置提供了一个紧凑的、面向顾问的总结表格,其中包含来自 FlowGen 官方1080、FlowVQA 衍生953 和 FlowDiagBench 的当前选定可用实验行。

搜集汇总
数据集介绍
Diagram2Code 数据集图片
构建方式
Diagram2Code数据集专为多模态大语言模型(MLLM)图表识别能力评估而设计,涵盖流程图、时序图、电路图、状态图及网络拓扑图五类典型图表。该数据集以Parquet格式存储,每条记录包含图表图像、类型标签、模型来源信息,并针对每张图表提供Mermaid、PlantUML、XML、DOT及SVG五种结构化编码形式的识别结果及其编译状态,从而构建了一个多视角、多格式的图表理解基准。
使用方法
用户可通过加载Parquet文件访问各配置下的数据,并借助dataset.ipynb脚本生成单行样本示例,含CSV、JSONL格式及示例图像。数据字段中,image作为图像特征需在加载时转换,而type、model等文本字段可直接使用。编译结果字段如mermaid_compilation_result等以成功或错误信息形式提供,便于量化模型识别性能。此外,三种评估配置分别适用于样本级与模型级的图表对象分析,以及有效实验的汇总查看。
背景与挑战
背景概述
Diagram2Code基准数据集由多模态大语言模型(MLLM)领域的研究人员于近期构建,旨在推动图表识别与代码生成任务的自动化进程。该数据集聚焦于将流程图、序列图、电路图等结构化图表转化为多种形式化描述语言(如Mermaid、PlantUML、XML、DOT、SVG),核心研究问题在于评估MLLM对视觉化逻辑结构的理解与转译能力。通过整合FlowGen、FlowVQA及FlowDiagBench等来源的样本,Diagram2Code为细粒度图表解析提供了标准化测试平台,其影响力体现在弥合了图像语义与结构化代码之间的鸿沟,对自动化文档生成、教育与工程建模等领域具有重要推动意义。
当前挑战
Diagram2Code所面临的挑战首先源自图表解析领域的固有问题:不同图表类型(如电路图与网络拓扑图)在符号语义、布局逻辑上存在本质差异,对MLLM的视觉-语言对齐能力提出极高要求。构建过程中,研究人员需克服多源数据标注不一致的难题,例如确保同一流程图在不同标注者视角下生成一致的形式化代码。此外,编译结果的有效性校验(如Mermaid语法错误检出)需设计自动化评估流水线,以防止因编译容错性差异导致模型性能误判。数据集规模不足10³样本,亦加剧了模型泛化能力的验证困难,需进一步扩展以覆盖更广泛的图表变异。
常用场景
经典使用场景
Diagram2Code基准数据集旨在评估和推动多模态大语言模型在图表理解与结构化代码生成方面的能力。该数据集涵盖了流程图、时序图、电路图、状态转移图与网络拓扑图等五种常见图表类型,要求模型将视觉输入的图表精准转化为Mermaid、PlantUML、XML、DOT或SVG等多种结构化描述语言。这一任务不仅检验了模型对图表中空间关系、逻辑流程与符号语义的感知能力,更考验其跨模态对齐与符号化输出的准确度。研究者通常将其作为视觉问答与图像到文本生成的典型基准,用于衡量模型在复杂图表理解任务上的综合表现。
解决学术问题
该数据集的核心学术价值在于解决了多模态大语言模型在结构化图表理解领域缺乏统一评测标准的问题。过往工作多集中于自然图像或简单文本理解,而对含有丰富逻辑关系的技术图表关注不足。Diagram2Code提供了一套多类型、多输出格式的标准化测试样例,使得研究者能够系统评估模型在图表语义解析、符号规则生成与跨平台代码转换等方面的能力。该数据集的构建推动了图表理解从定性描述向定量可复现评测的转变,为模型在技术文档自动生成、电路设计辅助与软件架构可视化等领域的性能优化奠定了数据基础。
实际应用
在实际应用层面,Diagram2Code所涉及的图表转代码技术可广泛赋能自动化软件工程与文档智能化场景。例如,在技术文档撰写过程中,工程师绘制的流程图可被模型自动转换为可执行的Mermaid或PlantUML代码,从而实现图表与代码的同步更新。在电子设计自动化领域,电路图的识别与DOT或SVG格式输出能够辅助设计验证与仿真流程。此外,网络拓扑图的自动解析与代码化还有助于网络配置的自动化管理与故障排查。这些应用场景显著降低了人工编码与校对的工作强度,提升了工程开发的效率与一致性。
数据集最近研究
最新研究方向
Diagram2Code数据集聚焦于多模态大语言模型(MLLM)对图表的结构化理解与代码化转译,涵盖流程图、序列图、电路图等五类技术图示。其在代码生成层面支持Mermaid、PlantUML、XML、DOT及SVG等多种主流描述语言的编译验证,标志着图表理解从简单语义识别迈向可执行代码转化的关键跃迁。结合FlowGen、FlowVQA与FlowDiagBench等评估框架,该数据集为自动化技术文档生成、智能教育辅助及工程可视化领域的前沿探索提供了坚实基准,有力推动了图表逻辑解析与多格式对齐的交叉研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务