遇见数据集

ERUnderstand

收藏
arXiv2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

ERUnderstand是由天普大学团队构建的首个大规模实体关系图结构化理解基准,包含2960个图表,涵盖教育资料、真实数据库模式及合成生成的多样化示例。数据集总计包含约17,415个实体、15,305个关系和66,856个属性,每个图表均配有标准化的JSON表示以支持细粒度评估。其创建过程综合了人工标注真实图表与基于LLM辅助的Graphviz流水线合成生成,旨在系统评估视觉语言模型在数据库工程中对概念模式的结构化推理能力,解决从图像中恢复可执行数据库模式的关键瓶颈问题。

ERUnderstand is the first large-scale structured understanding benchmark for entity-relationship diagrams (ERDs), developed by the Temple University team. It consists of 2960 diagrams covering educational materials, real database schemas, and diverse synthetically generated examples. In total, the dataset contains approximately 17,415 entities, 15,305 relationships, and 66,856 attributes. Each diagram is paired with a standardized JSON representation to enable fine-grained evaluation. The construction of this benchmark integrates manually annotated real diagrams and LLM-aided Graphviz pipeline-based synthetic generation. Its core goal is to systematically assess the structured reasoning abilities of vision-language models for conceptual schemas in database engineering, thereby addressing the critical bottleneck of recovering executable database schemas from images.

创建时间:
2026-07-28
原始信息汇总

数据集概述:ERUnderstand

ERUnderstand 是一个用于评估视觉语言模型在结构化 ER 图上理解能力的基准与评估代码库,覆盖 Web、Instructional、Schema 以及合成 ER 图的理解任务,并提供了统一的评估管线(F1、BLEU、GED)。

基准共包含以下层级(按论文命名):

层级 来源 / 路径 图数量 标记法
Web 100 个模式 → 500 个渲染图 500 Chen / Silberschatz (Web-S) / 原始
Instructional 48 个模式 → 240 个渲染图 240 Chen / Silberschatz (Instr.-S) / 原始
Schema 179 个图(Graphviz 格式) 179 Graphviz
Easy / Medium / Hard 合成数据,每个难度 199 个图 199 每个 Graphviz
High IS-A 合成数据 32 Graphviz

Schema 层级来源:来自 Spider (164)、经典 SQL 样本 (9)、Cypher 图模板 (5)、BIRD (1)。其真值仅包含平面关系结构,不包含弱实体、ISA、复合/多值/派生属性或 n 元关系。


数据格式

所有层级共享同一个 JSON 真值格式:

json { "entities": { "EntityName": { "attributes": ["attr1", "attr2"], "primary_keys": ["attr1"], "weak": false } }, "relationships": [ { "entities": ["A", "B"], "cardinality": ["1", "N"], "name": "rel_name", "weak": false } ] }

Web 和 Instructional 层级的数据还包含 compositemultivaluedderived 以及 ISA 条目(subclasses / superclass)。


数据集规模与统计

  • 聚合计数(实体、关系、EER 结构):存储在 ERUnderstand/stats/aggregated_sums.csv
  • 每个层级的逐图统计:存储在 sorted_stats_{tier}.csv
  • 完整统计文档:ERUnderstand/stats/schema_sources.md(含 Schema 来源、聚合数据、10 个模型的 F1/BLEU/GED 得分及复杂度分析)

数据集标注与质量控制

  • 标注格式:统一 JSON 架构
  • 标注对象:Web + Instructional 层级各 15 张图,共 30 张图进行双重标注试点
  • 标注一致性
    • 30 张图中,21 张因标记法差异或低质量图像需要联合修正
    • 平均宏 F1 一致性约为 0.897(与模型评估使用相同 F1 管线)
  • 最终审定真值:Web 层级 Internet-JSON/ 和 Instructional 层级 Books-JSON/,共 148 张图

评估管线

所有评估脚本位于 Codes/Evaluation/

步骤 脚本 输出
1. 真值与预测标准化与比较 compare.py {model}/{tier}.txt 差异日志
2. 按类别统计错误 measure.py {model}/{tier}.csv
3. F1(对错连给予部分学分) f1score.py {model}/f1_scores_{tier}.csvtotal_f1_scores.csv
4. BLEU(JSON 的词元重叠) bleu.py {model}/bleu_{tier}.csvtotal_bleu_scores.csv
5. GED(结构图距离) ged.py {model}/ged_{tier}.csvtotal_ged_scores.csv
6. 标注者间一致性 compute_inter_annotator_agreement.py 逐层级 IAA CSV

统一运行入口:Codes/Evaluation/evaluation.py


模型实验

  • 视觉模型实验脚本Codes/Exp_API.py,通过 OpenRouter 调用视觉模型进行 ER 图 → JSON 提取
  • 10 个评估模型(论文表 tab:final_scores):Claude-4.6-sonnet、GPT-5-chat、Gemini-2.0-flash、Grok-2-vision、Qwen-3.6、Llama-3.2、Gemma-3、GPT-5、Gemini-3-pro、GLM-4.5
  • 预测输出路径Experiments/Real-world/{tier}/{model}/Experiments/Graphviz/{model}/

相关论文

论文标题:《ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams》

搜集汇总
数据集介绍
ERUnderstand 数据集图片
构建方式
ERUnderstand数据集通过三个互补的渠道构建而成:其一,从权威教材与在线资源中精心筛选148幅高质量概念性ER图,并采用多种图形样式渲染,最终生成740幅实例;其二,从Spider、BIRD等主流数据库基准测试与真实系统中自动提取179个生产环境数据库模式,统一转换为JSON表示并标准化渲染;其三,借助LLM辅助的Graphviz流水线,四阶段自动生成2041幅合成ER图,涵盖从简单到极难的复杂层级与扩展实体-关系(EER)结构。每幅图均配有标准化JSON格式的精细标注,精确编码实体、关系、属性、键、弱实体、继承层次等结构化要素。
特点
该数据集以2,960幅ER图的庞大规模、跨越教育与生产场景及合成数据的多元来源、包含Chen与Silberschatz等多种表示法,以及全面覆盖弱实体、多值属性、n元关系与继承层次等高级EER构造为显著特色。其核心创新在于提供机器可读的标准JSON表示,允许在实体、关系、属性、主键等细粒度组件级别上进行结构感知的精确评估,而不仅是表面的文本匹配。这一设计使得研究者能够深入剖析视觉-语言模型在恢复概念数据库模式时,是成功理解还是陷入错误的模式匹配。
使用方法
使用时,研究者需将ER图图像与对应标准化JSON模式的描述作为输入,通过统一的提示模板调用视觉-语言模型,并约束模型仅输出符合给定JSON格式的结构化结果。评估过程采用结构感知的分数F1指标,对部分正确的预测给予0.5权重,通过贪心匹配将预测元素与真实标注对齐,分别计算实体、关系、属性等各类组件的F1分数并求宏平均。此外,BLEU分数提供序列层面的补充评估。公开可用的评估工具包支持重现整个评测流程,便于在统一框架下比较不同模型的视觉-结构推理能力。
背景与挑战
背景概述
实体关系图(ERD)作为概念性数据库设计的基石,长期以来在数据库工程中扮演着核心角色,但其通常以渲染图像的形式存在,而非机器可读的模式,这为人工智能辅助的数据库工程任务(如模式理解、迁移、文档生成和智能设计辅助)造成了瓶颈。为填补这一空白,由坦普尔大学计算机与信息科学系的Ali Ansari、Yasmin Mohammadi、Farnoush Nili、Parsa Esmaeilkhani、Longin Jan Latecki和Eduard Dragut等研究人员于近期创建了ERUnderstand数据集。该数据集是首个用于评估视觉语言模型对结构化ER图理解能力的大规模基准,囊括了来自教育资料、真实数据库模式及合成生成的2,960张图表,覆盖多种ER标记法(如Chen和Silberschatz风格)及扩展实体关系(EER)结构,为下游工具提供了标准化的可执行模式表示。
当前挑战
ERUnderstand数据集所应对的核心领域挑战在于,当前视觉语言模型在处理ER图时面临独特的视觉-结构推理难题。具体挑战包括:1) 模型在恢复高级EER元素(如弱实体F1低至0.28、多值属性F1仅0.14、N元关系F1仅0.07)时表现显著退化,尤其是在视觉标记解读上存在系统性缺陷,如对空间布局的偏见和语言先验的过度依赖;2) 构建过程中遇到的挑战涉及从异构来源(包括低分辨率扫描件和多样化的标记法)中收集、标准化并精确注释大量ER图,需通过双重注释协议确保质量(达成0.897的Macro-F1一致性),并设计合成生成流水线以可控方式模拟结构复杂度和高级构造的稀缺分布。
常用场景
经典使用场景
在数据库工程与人工智能的交叉领域,ERUnderstand数据集的核心价值在于评估多模态大模型对实体-关系图的结构化理解能力。该数据集包含从教材、真实生产系统与合成生成三大来源收集的2960张ER图,覆盖Chen与Silberschatz两种主流表示法。研究者利用这一基准系统地检验模型从图像中恢复可执行符号数据库模式的能力,而非仅仅完成视觉问答或文本识别。具体而言,经典使用场景包括:让模型从ER图图像完整提取实体集、属性集、关系集、主键、弱实体、继承层次等结构化信息,并通过标准化的JSON表示与精确的分数F1指标进行量化评估,从而推动视觉-语言模型在概念数据建模这一特定领域的推理能力研究。
解决学术问题
该数据集精准回应了现有多模态基准中缺乏结构化数据库模式理解评估的空白。传统图像理解基准侧重于图表、流程图或自然文档,而ERUnderstand则聚焦于从视觉化符号图中恢复可执行的逻辑模式,这要求模型具备超越物体识别与文本阅读的深层推理能力。通过系统评估十个顶尖视觉-语言模型,该数据集揭示了当前模型在弱实体(F1低至0.28)、多值属性(0.14)与多元关系(0.07)上的显著退化,并首次量化了空间邻近性偏见、语言先验依赖与复杂度崩塌三大系统性问题。这一发现为数据库工程中AI辅助模式理解、自动文档生成、遗留系统现代化等学术方向提供了关键的评测工具与理论基础。
衍生相关工作
ERUnderstand的发布催生了一系列系统性的后续研究工作。一方面,它推动了推理增强型视觉-语言模型的发展,实验表明结合链式推理策略可将整体Macro-F1提升15–25%,促使研究者探索更有效的空间注意力机制与符号推理模块。另一方面,其揭示的失败模式——如模型难以区分普通属性与多值属性、在复杂布局中丢失远距离关系——直接启发了针对视觉结构引导的专项模型架构改进,例如引入显式的图拓扑编码层。此外,该数据集所配套的标准化JSON评估框架已被后续工作采纳,用于评估其他领域如UML类图、属性图模式的结构化理解,从而将视觉-结构协同推理的范式推广至更广泛的工程符号语言。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务