遇见数据集

PCBnet

收藏
github2026-08-09 更新2026-08-23 收录
数据链接:
官方服务:

资源简介:

PCBnet是一个大规模数据集和基准,用于PCB原理图理解和自动原理图到SPICE网表构建。

PCBnet is a large-scale dataset and benchmark for PCB schematic understanding and automatic schematic-to-SPICE netlist construction.

创建时间:
2026-08-03
原始信息汇总

PCBnet 数据集概述

数据集简介

PCBnet 是一个大规模数据集和基准,专注于 PCB 原理图理解以及从原理图图像自动构建 SPICE 网表。该项目提供了一种面向拓扑结构的处理流程,结合视觉元素识别、电路结构构建和多智能体校正,从 PCB 原理图图像中恢复结构化电路连接关系。

数据集规模与获取

  • 完整数据集包含超过 50,000 条数据实例,当前仓库中随机选取 300 个样本用于演示
  • 数据集通过以下渠道获取:
  • 由于知识产权限制,目前暂未发布源代码

支持的任务

PCBnet 支持以下三个主要任务:

  1. 元件检测 (Component Detection):从原理图图像中检测并分类电路元件,评估指标为 mAP
  2. 文本识别 (Text Recognition):识别元件标识符、信号名称、数值及其他文本标签,评估指标包括字符错误率 (CER)、词错误率 (WER) 和识别准确率
  3. 原理图到网表构建 (Schematic-to-Netlist Construction):恢复元件引脚连接关系并生成结构化 SPICE 网表,评估指标为基于正确恢复电气连接的连接准确率

方法框架

原理图到网表的处理流程包含三个主要阶段:

第一阶段:视觉元素提取

  • 使用 YOLO 进行元件检测
  • 文本区域检测后使用 PaddleOCR 进行文本识别
  • 使用 U-Net 进行导线分割
  • 导线骨架化用于拓扑重建

第二阶段:电路结构构建

  • 元件特定引脚估计
  • 引脚到导线的连接性推断
  • 文本与元件的匹配
  • 类别一致性约束、几何对齐约束、局部唯一性约束

第三阶段:多智能体校正

  • 置信度引导的错误过滤
  • 知识引导的大语言模型 (LLM) 校正
  • 多模态图像基础校正
  • 元件感知的文本配对
  • 检索增强的 PCB 领域知识

主要实验结果

任务 结果
元件检测 mAP 94.54%
导线提取 IoU 93.70%
文本识别准确率 98.57%
文本识别 CER 1.43%
文本识别 WER 3.59%
连接准确率 84.47%

实验结果表明,显式视觉解析和拓扑构建方法在细粒度 PCB 原理图理解任务上显著优于通用多模态大语言模型的直接端到端推理。

数据目录结构

数据集预期结构如下:

data/ ├── images/ ├── components/ ├── pins/ ├── wires/ ├── texts/ ├── netlists/ └── splits/

相关说明

  • 论文发表于 IEEE LAD 2026,会议于 2026 年 7 月 29 日至 31 日在美国加利福尼亚州斯坦福举行
  • 数据集仍在准备公开释出阶段,相关下载链接、目录结构、标注格式和预处理说明将在发布后提供
  • 代码和数据集许可证将在相应资源发布时公布
  • 联系邮箱:zhenhuang@mail.ustc.edu.cn (黄振)
搜集汇总
数据集介绍
PCBnet 数据集图片
构建方式
PCBnet数据集面向印刷电路板(PCB)原理图理解与自动化SPICE网表构建任务,其构建过程融合了领域知识与数据驱动方法。数据集包含超过50,000个数据实例,涵盖原理图图像、元器件标注、引脚信息、导线分割、文本标注及对应SPICE网表等多元异构数据。构建流程首先通过视觉元素提取技术(如YOLO元器件检测、PaddleOCR文本识别、U-Net导线分割)对原理图进行解析,进而利用电路结构构建算法(包括引脚估计、引脚-导线连接推断、文本-元器件匹配以及类别一致性、几何对齐和局部唯一性约束)生成电路图,最终转化为结构化SPICE网表。此外,采用多智能体校正机制,结合置信度过滤、知识引导的LLM校正、多模态图像修正及检索增强的PCB领域知识,对识别误差与结构歧义进行精细优化,确保数据质量与标注准确性。
特点
PCBnet数据集具有显著的规模性、多样性与专业性。其包含逾五万实例的庞大规模,为深度学习模型提供了充足的训练样本,且覆盖多种原理图风格与复杂度,增强了模型的泛化能力。数据集的构建采用拓扑导向流水线,融合视觉识别与电路结构恢复,实现了从像素级特征到电路级语义的跨越。在内容上,PCBnet不仅提供基础的元器件检测与文本识别标注,更关联了引脚连接关系和完整SPICE网表,支持端到端的原理图到网表生成任务。其多智能体校正机制引入领域知识与多模态信息,显著提升了标注的准确性和鲁棒性。官方实验显示,元器件检测mAP达94.54%,导线提取IoU为93.70%,连通性准确率84.47%,表明该数据集在推动电路原理图自动分析技术方面具有优越的基准价值。
使用方法
PCBnet数据集的使用流程遵循其提供的标准流水线。用户可通过Google Drive或阿里云盘下载数据集,并参照仓库中的目录结构(包括images、components、pins、wires、texts、netlists、splits等子目录)进行数据组织与预处理。使用过程中,可按照官方提供的示例命令(如`python scripts/run_pipeline.py --image examples/example_schematic.png --output outputs/example_netlist.sp`)调用完整流水线,该流水线依次执行元器件、文本与导线识别,引脚估计与连通性构建,以及多智能体校正,最终输出结构化SPICE网表。此外,数据集支持三个核心子任务:元器件检测(评估指标mAP)、文本识别(评估指标CER/WER/准确率)以及原理图到网表构建(评估指标连通性准确率),用户可根据研究需求选择合适的任务模块进行训练与评估。详细的安装说明与配置要求需参考后续代码发布版本,当前数据集提供300个精选示例样本用于演示。
背景与挑战
背景概述
PCBnet数据集由Lei He教授团队于2026年提出,旨在解决印刷电路板(PCB)原理图自动解析与SPICE网表构建的领域难题。随着电子设计自动化(EDA)对高精度电路还原的需求日益增长,传统人工转录原理图效率低下且易出错。该数据集包含超过50,000个数据实例,覆盖元件检测、文本识别及原理图到网表的生成三大任务,为电路拓扑结构的智能化重建提供了标准化基准。其研究推动了计算机视觉在EDA领域的交叉应用,为高效电路验证与逆向工程奠定了重要基础。
当前挑战
PCBnet面临的挑战主要包括:原理图图像中元件与导线的高度重叠、文本标注的多样性与干扰,以及电路连接关系的复杂推断。构建过程中,需应对元件、引脚与导线之间的精细匹配,并处理OCR识别结果的不确定性。此外,数据集包含大量真实场景图像,其清晰度、光照和噪声差异显著,增加了视觉解析的难度。当前管线虽结合了多智能体修正,但连通性准确率仅达84.47%,仍存在优化空间,故推进更高精度的自动化网表构建仍是核心挑战。
常用场景
经典使用场景
该数据集最经典的使用场景在于电路原理图解析与电路结构恢复。基于PCBnet,研究者能够对电路原理图图像中的元器件、文本标签及导线连接进行精细的视觉解析,进而重构出包含元器件引脚连接关系的电路图,并自动生成SPICE网表。这一过程涵盖了从图像输入到结构化电路描述的完整链路,为电子设计自动化领域提供了一种从视觉信息到电路语义的桥梁,尤其适用于大规模、复杂电路图的自动化理解。
解决学术问题
PCBnet有效解决了电路原理图自动解析中数据匮乏与语义结构重建困难等核心学术问题。传统方法多依赖人工标注或单一识别任务,难以应对复杂电路图中元器件重叠、导线交叉及文字干扰等挑战。PCBnet通过提供超过五万规模的实例数据集,支持元器件检测、文本识别及网表生成三类任务,并构建了从视觉元素提取、电路图构建到多智能体校正的完整方法论,显著提升了电路连接恢复的准确性,为电子设计自动化与计算机视觉交叉领域的研究提供了坚实的数据基础与评测基准。
衍生相关工作
基于PCBnet,一系列衍生工作得以展开:一方面,研究者可基于其多任务标注设计更精细的视觉识别模型,如图形神经网络驱动的拓扑重建、基于Transformer的端到端网表生成等;另一方面,多智能体校正机制启发了将大语言模型与领域知识检索结合的新型纠错范式,推动了多模态理解在专业领域的发展。此外,该数据集有望促进跨学科合作,例如结合强化学习的布局优化、基于深度学习的电路错误诊断,以及面向大规模集成电路的自动化设计流程研究,后续工作可进一步探索弱监督学习与跨数据集泛化等问题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务