遇见数据集

ElectraAI-Dataset-v4

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

ElectraAI Dataset v4 是一个专为电子与计算机工程(ECE)领域设计的大规模开源数据集,包含超过100万条记录,旨在用于微调大型语言模型(LLMs)和视觉模型。数据集涵盖多个子领域,包括VLSI、模拟电路、嵌入式系统、信号处理等,覆盖500多种电路拓扑结构。具体由四个数据流构成:A流提供10万条NGSpice网表记录,包含SPICE电路网表及其分析;B流包含10万条带标签的电路图像,格式为PNG原理图及对应的JSON标签;C流包含70万条以上的问答对(基于ShareGPT格式),涉及多轮电子工程指令交互;D流提供10万条YOLO标注数据,包括PNG图像和YOLO TXT文件,用于目标检测任务。领域覆盖广泛,包括模拟电子(100种拓扑)、模拟VLSI(100种拓扑)、网络理论(100种拓扑)、数字VLSI与静态时序分析(60种拓扑)、嵌入式系统、信号处理、通信(各50种拓扑)、微处理器、电力电子、AI+VLSI(各50种拓扑)。该数据集适用于文本生成、图像分类和对象检测等多种机器学习任务,由ElectraAI v4工具生成,以促进电子工程教育、研究和自动化应用。

ElectraAI Dataset v4 is a large-scale open-source dataset specifically designed for the field of Electrical and Computer Engineering (ECE), containing over 1 million records, aimed at fine-tuning large language models (LLMs) and vision models. The dataset covers multiple subfields, including VLSI, analog circuits, embedded systems, signal processing, etc., encompassing over 500 circuit topologies. It is structured into four data streams: Stream A provides 100,000 NGSpice netlist records, including SPICE circuit netlists and their analyses; Stream B contains 100,000 labeled circuit images in PNG schematic format with corresponding JSON labels; Stream C includes over 700,000 question-answer pairs (based on ShareGPT format) involving multi-turn electronic engineering instruction interactions; Stream D offers 100,000 YOLO annotated data, comprising PNG images and YOLO TXT files for object detection tasks. The coverage spans various domains, including analog electronics (100 topologies), analog VLSI (100 topologies), network theory (100 topologies), digital VLSI and static timing analysis (60 topologies), embedded systems, signal processing, communications (50 topologies each), microprocessors, power electronics, and AI+VLSI (50 topologies each). This dataset is suitable for multiple machine learning tasks such as text generation, image classification, and object detection, generated by the ElectraAI v4 tool to promote electronic engineering education, research, and automation applications.

创建时间:
2026-06-27
原始信息汇总

数据集概述:ElectraAI Dataset v4

该数据集是一个面向电子工程、计算机工程、超大规模集成电路、模拟电路和嵌入式系统领域的大型多模态数据集,总计包含 1,000,000 条记录,专为大型语言模型(LLM)和视觉模型微调设计。

数据集构成(四大数据流)

数据流 记录数 描述
A: NGSpice Netlists 100,000 SPICE 网表与分析数据
B: Labeled Circuit Images 100,000 电路原理图图像(PNG)及其 JSON 标注(使用 schemdraw 生成)
C: QA Pairs (ShareGPT) 700,000 多轮电子工程领域指令问答对
D: YOLO Annotations 100,000 电路图像(PNG)及其 YOLO 格式标注(包含 20 个类别)

数据集特性

  • 语言: 英语
  • 许可协议: Apache-2.0
  • 规模: 1M < n < 10M
  • 任务类型: 文本生成、图像分类、目标检测
  • 标签: 电子学、ECE、VLSI、模拟电路、嵌入式、信号处理、电路

目录结构

图像和标注文件被分片存放,每个子文件夹包含不超过 5,000 个文件,以符合 Hugging Face 的存储限制。例如:stream_B_circuit_images/images/shard_0000/shard_0001/

拓扑覆盖范围

数据集覆盖 500 多种拓扑结构,分布于 10 个领域,并提供对应的 QA 记录:

领域 拓扑数量 QA 记录数
模拟电子学 100 95,000
模拟 VLSI 100 85,000
网络理论 100 95,000
数字 VLSI + STA 60 80,000
嵌入式系统 50 70,000
信号处理 50 60,000
通信 50 60,000
微处理器 50 50,000
电力电子 50 65,000
AI + VLSI 40 40,000

YOLO 类别定义(数据流 D)

共 20 个组件类别:电阻、电容、电感、二极管、齐纳二极管、BJT NPN、BJT PNP、NMOS、PMOS、运算放大器、电压源、电流源、地、导线节点、变压器、开关、电压探针、电流探针、IC 块、逻辑门。

使用示例

python from datasets import load_dataset

加载问答对用于 LLM 微调

ds = load_dataset("Abhisheksvnit/ElectraAI-Dataset-v4", data_files="stream_C_qa_pairs/*.jsonl")

搜集汇总
数据集介绍
ElectraAI-Dataset-v4 数据集图片
构建方式
该数据集由ElectraAI v4管道自动生成,涵盖电子工程与计算机工程领域,总计包含百万条记录。其构建采用多流并行的方式:流A包含十万条NGSpice网表及分析结果;流B提供十万张由Schemdraw生成的电路原理图图像及其JSON标注;流C收集了七十万条遵循ShareGPT格式的多轮电子工程指令对话;流D则包含十万张带有YOLO格式标注的电路元件图像,涵盖二十种常见元器件类别。所有图像与标签按每子目录不超过五千文件进行分片存储,以符合存储库的文件数限制。
特点
该数据集特色在于其横跨模拟电子、模拟VLSI、网络理论、数字VLSI、嵌入式系统、信号处理、通信、微处理器、电力电子及AI与VLSI融合等十个专业领域,涵盖了超过五百种电路拓扑结构,每个领域均配有针对性的问答记录。数据规模方面,流C的问答数量达到七十万条,尤其适合大型语言模型的指令微调。流D的YOLO标注支持二十种常见的电子元器件类别,包括电阻、电容、电感、各类二极管、晶体管、运算放大器、电源、开关以及逻辑门等,为电路图的目标检测任务提供了高质量监督信号。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集。对于语言模型的微调,可直接调用load_dataset函数读取流C的JSONL格式问答对文件。视觉模型的训练则可借助流B的PNG与JSON配对数据进行电路图理解,或使用流D的YOLO TXT标注文件训练目标检测模型。流A的SPICE网表数据适用于电路仿真与自动化设计相关的任务。所有数据均以Apache-2.0许可开源,便于学术研究与工业应用。
背景与挑战
背景概述
在电子设计自动化(EDA)与人工智能交叉领域,大规模、高质量标注数据集的匮乏长期制约着专用大语言模型(LLM)和视觉模型的性能突破。由研究机构ElectraAI于近期发布的ElectraAI-Dataset-v4数据集,以百万级规模覆盖电气与电子工程(ECE)、超大规模集成电路(VLSI)、模拟电路及嵌入式系统等十大核心领域。该数据集融合了SPICE网表、电路原理图图像、多轮问答对及YOLO标注等多种模态,为电路分析与设计智能化的研究提供了关键训练资源。其影响力已延伸至LLM微调、目标检测及图像分类等多任务场景,成为连接硬件设计与人工智能的重要桥梁。
当前挑战
该数据集所应对的领域挑战在于,传统电路分析与设计高度依赖专家经验,缺乏统一的自动化数据支撑,导致AI模型在网表理解、电路拓扑识别及元件定位等任务上泛化能力不足。构建过程中,研究团队面临多源数据异构性强、标注一致性难以保障的难题,尤其在500余种拓扑结构与20类元件标签的协同标注中,需兼顾精细度与可扩展性。此外,千万级文件的存储与分发亦受限于平台目录配额,迫使采用分片策略管理图像与标签,增加了工程实现的复杂度。
常用场景
经典使用场景
ElectraAI-Dataset-v4是专为电子工程与集成电路领域设计的多模态数据集,其经典使用场景聚焦于大规模预训练模型的领域微调与下游任务适配。具体而言,研究人员可利用该数据集中的SPICE网表与电路图像,对语言模型进行电子设计自动化(EDA)知识的注入训练,或基于YOLO格式的标注图像训练目标检测模型,实现电路元器件的智能识别与定位。
解决学术问题
该数据集着力破解电子工程领域数据稀缺与模型泛化性不足的双重困境。其百万级规模覆盖模拟/数字VLSI、嵌入式系统、信号处理等十个核心子域,为学术研究提供了从基础电路理论到先进VLSI设计的系统性训练样本,有效支撑了LLM在EDA辅助设计、电路拓扑理解等任务中的性能跃升,推动了人工智能与电子工程交叉研究的边界拓展。
衍生相关工作
该数据集已催生多项衍生性研究工作,包括基于电路拓扑的图神经网络预训练方法、融合SPICE仿真与大语言模型的对话式EDA工具,以及多模态视觉-语言模型在电子设计文档自动化生成中的应用。此外,其公开的20类元器件YOLO标注标准,为研究者构建统一评估基准提供了重要参考,进一步推动了计算机视觉与电子自动化设计领域的深度融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务