遇见数据集

ENGINUITY

收藏
arXiv2026-06-02 更新2026-06-05 收录
官方服务:

资源简介:

ENGINUITY是由Predii和橡树岭国家实验室联合创建的首个开放工程图表视觉语言理解数据集,旨在填补该领域公共基准的空白。该数据集包含2056个图表-零件表配对,源自美国军事维修手册,涵盖6种图表类型和18个车辆子系统,数据量总计3011个配对,并附带60个专家编写的问答对。数据集通过自动化流水线构建,包括文档布局分析、图表-表格页面映射、页面栅格化以及基于前沿VLM的表格提取,确保了高质量的结构化标注。该数据集主要应用于评估视觉语言模型在复杂工程图表中的解析能力,支持结构化零件提取和图表问答任务,以解决维修、设计和培训材料生成中的信息提取难题。

ENGINUITY is the first open engineering diagram visual-language understanding dataset jointly created by Predii and Oak Ridge National Laboratory, which aims to fill the gap of public benchmarks in this field. This dataset contains 2056 diagram-part table pairs sourced from U.S. military maintenance manuals, covering 6 types of diagrams and 18 vehicle subsystems, with a total of 3011 pairs, and is accompanied by 60 expert-written question-answer pairs. Constructed via an automated pipeline that includes document layout analysis, diagram-table page mapping, page rasterization, and cutting-edge VLM-based table extraction, the dataset ensures high-quality structured annotations. It is mainly used to evaluate the parsing capabilities of visual-language models in complex engineering diagrams, supporting structured part extraction and diagram-based question-answering tasks to solve information extraction challenges in maintenance, design and training material generation.

创建时间:
2026-06-02
搜集汇总
数据集介绍
ENGINUITY 数据集图片
构建方式
在工程图理解领域,现有基准多聚焦于流程图或科学图表,而缺乏针对工业复杂工程图的评估资源。为填补这一空白,ENGINUITY数据集基于10份美国军用维修手册构建,涵盖地面车辆、飞机发动机与重型设备等多元场景。其构建采用五阶段流水线:首先通过Unstructured库对PDF进行版面分析,识别图像与表格区域;随后建立图-表配对映射,处理多页表格与多子装配视图等复杂结构;接着将识别页面渲染为200 DPI的PNG格式图像;再借助Claude Sonnet 4.5进行表格结构化提取,生成含项目编号、零件号、描述、UOC与数量的TSV文件;最后经后处理与人工校验确保数据质量。最终形成2056对图-表配对,其中494张图用于部件提取任务基准测试,另由领域专家标注60组问答对构成自由形式图问答任务。
特点
ENGINUITY数据集的核心独特性在于其真实反映工程图解的复杂挑战。首先,图-表紧密耦合:每个零件图均配有正式结构化的零件表,模型需同时解析图中的数字标注与表中的领域特定代码(如NSN、CAGEC、SMR),而非仅依赖单一模态。其次,标注源于原始手册自身零件表而非众包,保证了事实性。第三,覆盖18个车辆子系统与6种图解类型(零件图、爆炸图、电气图、液压图、装备图与剖视图),零件数量均值23、中位数17,真实反映工业文档的复杂度分布。此外,该数据集专门设计了凸显视觉-文本交叉引用的任务:部件提取任务要求模型从图中定位标注并匹配表格描述,问答任务则测试在图文结合下的多步推理能力。这种跨模态、领域密集的设计使其成为评估前沿视觉语言模型的严苛试金石。
使用方法
使用ENGINUITY数据集时,研究者可针对两项互补任务评估模型。任务1为结构化部件提取:输入零件图图像,需输出JSON格式的部件列表(含序号、零件号、描述与数量)。评估采用基于召回率、Token F1pen与语义相似性pen的综合指标。任务2为自由形式图解问答:输入由主图与相关零件表垂直拼接的复合图像,要求模型回答领域专家撰写的自然语言问题(从直接查询如'部件14的零件号是什么'到应用推理如'识别装配程序所需硬件的类型')。评估结合Token F1、语义相似性与LLM-as-Judge评分(分5级,采用交叉评判设计避免自利偏差)。数据集附带完整评估框架、提示模板及逐样本输出,支持零样本与思维链两种设置下的可复现研究。
背景与挑战
背景概述
工程图纸作为技术文档中信息密度极高的载体,以其独特的空间布局、领域特定符号以及视觉标注与结构化零件表之间的交叉引用,构成了视觉-语言模型理解的严峻考验。为填补该领域公开基准的空白,由Predii公司与橡树岭国家实验室的研究人员于2026年共同发布了ENGINUITY数据集,该数据集基于美国军用服务与维修手册构建,包含2,056对图纸-零件表样本及60对领域专家撰写的问答对,旨在系统评估前沿视觉-语言模型在结构化零件提取与自由形式图纸问答两大任务上的表现,其发布为工程文档的智能解析研究提供了关键的评估基石。
当前挑战
当前面临的挑战主要体现在双重维度:首先,工程图纸理解的核心难题在于图纸中密集排列的微小数字标注需要与邻接零件表中的对应条目进行精确定位与语义匹配,且领域特有的编码体系(如NSN、CAGEC)及字母数字编号在通用预训练语料中极度稀缺,同时图纸与零件表构成相互依存的耦合信息体,任一模态均无法独立传达完整语义;其次,数据集构建过程亦充满技术挑战,包括从格式不一的军用手册中精准识别图纸页与对应表格页的跨页关联,以及通过视觉-语言模型从复杂布局的表格中提取结构化信息时,需克服传统OCR在多行单元格、列合并及领域缩写上下文理解方面的局限性。
常用场景
经典使用场景
工程图纸作为技术文档中的核心视觉载体,承载着密集的空间布局、领域专用符号以及视觉标注与结构化零件表之间的交叉引用信息。ENGINUITY数据集正是为评估视觉语言模型在此类复杂工程图解上的理解能力而设计,其经典使用场景聚焦于两大任务:结构化零件表提取与自由形式的图解视觉问答。前者要求模型从爆炸视图中精准识别每个编号组件并输出包含编号、零件号、描述和数量的结构化表格;后者则评估模型在给定图解与零件表后,回答涉及事实查阅与多步推理的工程问题。这两个任务共同构成了衡量VLM在工程领域视觉语言理解能力的首个标准化基准。
衍生相关工作
ENGINUITY的发布催生了一系列富有启发的衍生研究方向。在其基础上,研究者可开发针对工程图纸的高分辨率图像处理策略、设计领域适配的提示工程方法,或构建面向工程图解的专用微调数据集。该数据集还推动了少样本学习与硬件效率优化的探索,例如采用链式思维提示提升GPT-5.2 Chat的召回率近21个百分点,揭示了推理过程对结构化提取的关键作用。此外,ENGINUITY所揭示的评估指标偏差催生了LLM-as-Judge交叉评判协议的发展,为领域特定评估提供更可靠的校准方案。未来,基于该数据集的预训练模型微调、多领域泛化能力研究及安全部署边界探讨,将成为工程AI落地的重要基石。
数据集最近研究
最新研究方向
当前,工程图表理解成为视觉语言模型(VLM)研究的前沿挑战,ENGINUITY数据集的问世填补了这一领域的公开基准空白。该数据集聚焦于美军维修手册中的复杂工程图解,定义了结构化零件表提取与自由形式视觉问答两项任务,系统评估了GPT-5.2 Chat、Claude Opus 4.7等模型的零样本与思维链推理能力。研究表明,前沿VLM虽能高召回率定位零件(0.61–0.87),但描述保真度(Token F1pen仅0.03–0.18)与事实推理仍存显著短板,揭示了零件识别与描述准确性之间的系统性差距。这一成果不仅为多模态模型在工业文档理解领域提供了标准化评测平台,更推动了符号空间布局与领域词汇对齐的深层研究,对减少维护手册误读、提升系统可靠性具有关键意义。
相关研究论文
  • 1
    Enginuity: A Dataset and Benchmark for Vision-Language Understanding of Engineering DiagramsPredii; 橡树岭国家实验室 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务