遇见数据集

OpenABC-D

收藏
arXiv2025-09-30 收录
官方服务:

资源简介:

该数据集是一个大规模的标注数据集,它通过结合开源设计与一款领先的开源逻辑综合工具合成而成,包含了87万个And-Inverter-Graphs(AIGs),这些AIGs源自1500次综合运行。数据集的生成流程包括三个阶段:寄存器传输级(RTL)综合、图级别处理以及为机器学习进行的预处理。这一流程不仅能够实现自动化综合脚本生成,还允许用户定义综合脚本。该数据集的规模达到了87万个AIGs,来自1500次综合运行,其任务是利用机器学习进行逻辑综合优化。

This is a large-scale labeled dataset synthesized by combining open-source designs with a leading open-source logic synthesis tool. It contains 870,000 And-Inverter-Graphs (AIGs) derived from 1500 synthesis runs. The dataset generation workflow comprises three stages: Register-Transfer Level (RTL) synthesis, graph-level processing, and preprocessing tailored for machine learning. This workflow supports automated synthesis script generation and allows users to define custom synthesis scripts. With a corpus of 870,000 AIGs from 1500 synthesis runs, this dataset is designed for logic synthesis optimization using machine learning techniques.

提供机构:
NYU-MLDA
搜集汇总
数据集介绍
OpenABC-D 数据集图片
构建方式
在集成电路设计领域,逻辑综合是将硬件描述语言转化为优化数字电路网表的关键步骤。OpenABC-D数据集基于29个开源硬件IP,利用开源逻辑综合工具Yosys与ABC,生成了1500种不同的综合配方,每种配方包含20个转换步骤,从而获得870,000个与逆变图(AIG)样本。每个AIG样本以BENCH格式保存,并通过自定义解析器转换为GRAPHML格式,保留节点类型、入边反相数量等特征。数据生成过程耗时超过20万计算小时,确保了数据集的规模与多样性。
特点
该数据集的核心特点在于其规模与功能多样性。涵盖通信协议、处理器、数字信号处理、加密加速器及系统控制器等多种功能类别的IP,AIG结构呈现树状、平衡与偏斜等丰富形态。综合配方间的相似度低于30%,保证了数据样本的差异性。每个样本包含图结构特征、综合配方编码及节点数、延迟等标签,为机器学习模型提供了多维度的学习信号,尤其适用于图神经网络的研究与基准测试。
使用方法
OpenABC-D为机器学习驱动的逻辑综合研究提供了标准化基准。使用者可通过PyTorch Geometric框架加载数据,利用自定义数据加载器进行预处理、标签划分与变换。典型任务包括预测综合配方的优化质量,例如基于图卷积网络对AIG嵌入与配方编码进行联合学习,以回归归一化节点数。数据集支持配方、IP以及配方-IP组合的三种未见样本预测任务,便于评估模型的泛化能力,并促进可复现的ML-EDA研究流程。
背景与挑战
背景概述
在集成电路设计的复杂流程中,逻辑综合作为将高级硬件描述语言转化为优化数字电路网表的关键步骤,其本质是一个Σ2P-难组合优化问题。随着机器学习在组合优化与图问题领域的成功应用,学术界与工业界对ML引导的逻辑综合工具产生了浓厚兴趣。然而,该领域长期缺乏标准化的基准数据集与原型学习任务,阻碍了可复现的研究进展与公平的算法比较。2021年,纽约大学的Animesh Basak Chowdhury、Benjamin Tan、Ramesh Karri与Siddharth Garg联合发布了OpenABC-D数据集,通过对29个开源硬件IP执行1500种综合配方、保留87万个与-逆变图数据样本,填补了这一空白。该数据集不仅涵盖通信协议、处理器、数字信号处理、加密加速器及系统控制器等功能多样的IP,还提供了优化节点数、延迟等标签,为ML驱动的逻辑综合研究奠定了坚实的数据基础,显著推动了电子设计自动化领域的标准化进程。
当前挑战
OpenABC-D所应对的核心领域挑战源于逻辑综合的固有复杂性:综合配方的选择对最终电路面积、功耗与延迟具有决定性影响,而最优配方的搜索空间极其庞大且缺乏通用规则。具体而言,不同功能IP的图结构差异显著,导致单一综合配方无法普适有效;同时,综合运行的计算成本高昂(数据集生成耗时超20万计算小时),使得穷举搜索不切实际。在数据集构建过程中,挑战亦十分严峻:需从零开始筛选并处理29个开源IP,确保其功能多样性与工业规模代表性;设计1500个随机采样的综合配方并保存每个中间步骤的AIG图,涉及大规模并行计算与存储管理;此外,将BENCH格式网表转换为适配机器学习框架的GRAPHML格式,并提取节点类型、入边反转数等图特征,需精细的预处理管线。最终,数据集还需支持多种学习任务(如未见配方质量预测、跨IP泛化评估),对标签一致性与数据划分策略提出了高标准要求。
常用场景
经典使用场景
在集成电路设计领域,逻辑综合是电子设计自动化流程中的关键环节,其目标是将硬件描述语言转化为优化的门级网表。OpenABC-D数据集为机器学习引导的逻辑综合研究提供了大规模、标准化的基准平台。该数据集包含来自29个开源硬件IP的87万个与逆变器图样本,涵盖通信协议、处理器、数字信号处理核心和加密加速器等多种功能类型。经典使用场景包括利用图卷积网络等深度学习模型,对给定IP和综合配方后的网表质量进行预测,如优化后的节点数、面积和延迟等关键指标,从而评估不同综合策略的有效性。
实际应用
在实际工业场景中,集成电路设计复杂度日益攀升,传统手工调优综合配方的方式耗时且难以规模化。OpenABC-D数据集赋能了智能化电子设计自动化工具的开发,使设计工程师能够借助预训练的机器学习模型快速预测未知综合配方的效果,从而在短时间内筛选出最优综合策略。这一能力显著缩短了从寄存器传输级描述到最终版图的设计周期,降低了试错成本。此外,该数据集还可用于开发针对特定功能模块的自适应综合引擎,实现跨IP的知识迁移,提升大型芯片设计项目中整体设计流程的自动化水平和效率。
衍生相关工作
OpenABC-D数据集的发布催生了一系列具有影响力的衍生研究工作。基于该数据集,研究者提出了多种图神经网络架构用于网表嵌入学习,例如利用图卷积网络进行IP功能分类,在35个训练周期内达到了98.05%的准确率。此外,该数据集支撑了强化学习框架如DRiLLS和FlowTune的基准测试,推动了基于马尔可夫决策过程的综合配方优化研究。它还促进了迁移学习在电子设计自动化中的应用,例如通过自监督预训练学习网表的结构特征,再微调用于延迟预测等下游任务,为构建更通用的机器学习辅助综合工具奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务