遇见数据集

Rule2DRC

收藏
github2026-06-06 更新2026-06-07 收录
数据链接:
官方服务:

资源简介:

Rule2DRC是一个用于评估LLM代理从自然语言设计规则规范生成可运行KLayout DRC Ruby脚本的基准测试数据集。该数据集包含1000个问题和13,921个标记的GDS测试用例,每个问题包括自然语言规则、层定义、黄金DRC脚本和标记的GDS测试用例。数据集托管在Hugging Face上,分为tasks和testcases两个配置。

Rule2DRC is a benchmark dataset for evaluating LLM Agents that generate executable KLayout DRC Ruby scripts from natural-language design rule specifications. This dataset contains 1,000 tasks and 13,921 annotated GDS test cases. Each task includes natural-language rules, layer definitions, golden DRC scripts, and annotated GDS test cases. The dataset is hosted on Hugging Face and is split into two configurations: tasks and testcases.

创建时间:
2026-05-13
原始信息汇总

数据集概述

Rule2DRC 是一个用于评估大语言模型(LLM)代理能否根据自然语言设计规则规范生成可运行的设计规则检查(DRC)脚本的基准测试。

核心任务

  • 每个问题包含一条自然语言设计规则、层定义、标准答案的 DRC 脚本以及带标签的 GDS 测试用例。
  • 生成的脚本需要能通过编译,并且与问题的所有测试用例标签匹配,才算成功。

数据集规模

  • 1000 个问题(任务)
  • 13,921 个带标签的 GDS 测试用例

数据托管

数据集托管在 Hugging Face 上,包含两个配置:

  • tasks:每个基准问题一行,包含 problem_idpromptspec_yamlgold_drc 及元数据。
  • testcases:每个 GDS 测试用例一行,包含 problem_idgds_pathlabellabels_json 及二进制 gds 数据。

数据格式

通过脚本将 Hugging Face 数据集物化为以下目录结构:

problems/{problem_id}/spec.yaml problems/{problem_id}/gold/{problem_id}.drc problems/{problem_id}/data/gds/labels.csv problems/{problem_id}/data/gds/{pass,fail}/*.gds

评估方法

  • 生成候选脚本(Best-of-N,BoN),使用不同的候选池大小(Bon10、Bon15、Bon20,每个设置运行 3 次)。
  • 通过自我生成的 GDS 测试或多种测试选择器(SplitTester (Ours)、S* 基线、CodeMonkey 风格基线、LLM 评判基线)对候选脚本进行评分和选择。
  • 最终通过聚合脚本得到评估结果,输出为 JSON 文件。

相关论文与引用

发表于 ICML 2026,arXiv 论文 ID:2605.15669。引用格式如下:

bibtex @InProceedings{kim2026rule2drc, title = {{Rule2DRC: Benchmarking LLM Agents for DRC Script Synthesis with Execution-Guided Test Generation}}, author = {Kim, Jinuk and Byun, Junsoo and Hwang, Donghwi and Park, Seong-Jin and Song, Hyun Oh}, booktitle = {Proceedings of the 43rd International Conference on Machine Learning}, year = {2026}, volume = {306}, series = {Proceedings of Machine Learning Research}, publisher = {PMLR} }

许可证

MIT

搜集汇总
数据集介绍
Rule2DRC 数据集图片
构建方式
Rule2DRC数据集旨在评估大语言模型从自然语言设计规则规格说明中生成可执行设计规则检查(DRC)脚本的能力。该数据集从芯片制造领域出发,聚焦于几何约束的自动化检查。在构建过程中,每个问题包含一段自然语言描述的规则、层定义、标准答案的KLayout DRC Ruby脚本以及标注好的GDS测试用例。数据集共整合了1000个问题,并配备了13921个带有精准标注的GDS测试用例。所有数据托管于Hugging Face平台,通过加载'tasks'与'testcases'两个配置项获取,并需通过专用脚本将数据物化为标准目录结构,以支持后续的评估流程。
特点
Rule2DRC数据集的特点在于其高度的专业性与严格的评估标准。每个问题均要求生成的DRC脚本不仅能够通过编译,还必须在所有测试用例上完全匹配标准标签,才算成功。这种二值化评估方式消除了模糊性,确保了评判的客观性。数据集中涵盖了多种实际问题场景,包括宽度、间距、包围和重叠等典型设计规则检查任务。此外,数据集支持灵活的实验配置,如Best-of-N策略中的候选池划分,以及多种基线方法(如S*基线、CodeMonkey风格选择器和LLM评判器)的对比,为深入研究LLM在EDA领域的应用提供了坚实基础。
使用方法
使用Rule2DRC数据集需先通过Hugging Face加载数据并执行物化脚本,以构建标准问题目录。随后,可根据需要渲染提示词或直接运行评估脚本。评估支持并行处理,通过指定问题编号或一次性处理所有问题。对于模型输出的生成与评估,需启动兼容OpenAI API的vLLM服务,并利用提供的Bash脚本完成候选脚本生成、自生GDS测试、评分及聚合。不同评估设置(如Bon10、Bon15、Bon20)可通过修改候选池参数实现。最终,聚合得分以JSON文件形式保存,便于后续分析与模型对比。
背景与挑战
背景概述
在现代芯片设计流程中,为确保可制造性,芯片版图须严格遵循数以千计的几何设计规则,这一验证过程被称为设计规则检查(DRC)。然而,将自然语言表述的规则高效转化为可执行的DRC脚本,长期以来高度依赖资深电子设计自动化工程师的领域知识,成为自动化设计流程中的瓶颈。为攻克此壁垒,Jinuk Kim及其合作者于2026年发布了Rule2DRC基准数据集,该成果发表于ICML 2026。该数据集包含1,000个问题及13,921个标注的GDS测试用例,旨在系统性评估大语言模型代理能否从自然语言规则说明中综合生成可运行的KLayout DRC Ruby脚本,为探究语言模型在专用工程领域的代码生成能力提供了关键测试平台。
当前挑战
Rule2DRC核心挑战在于解决LLM代理在专用领域脚本综合任务中的贫瘠能力问题,具体表现为:自然语言规则描述的高歧义性与DRC脚本语法严苛性之间存在巨大鸿沟,脚本即使微小语法错误亦会导致编译失败,同时还需满足所有测试用例的精确标签匹配,这远超传统代码生成任务的复杂程度。此外,数据集构建过程中亦面临显著挑战:如何设计出既能覆盖真实设计规则多样性、又能在物理版图层面确保可验证性的1,000个问题集;如何高效生成并标注13,921个反映真实DRC场景的GDS测试用例,并设计出计算成本可控的自动化评估流水线,以支持后续对多类模型的最佳N选策略与测试生成方法的公平比较。
常用场景
经典使用场景
在集成电路设计自动化领域中,Rule2DRC作为一个专为评估大语言模型智能体生成设计规则检查脚本能力而构建的基准测试集,其最经典的使用场景在于衡量LLM能否将自然语言描述的设计规则规范自动转化为可执行的KLayout DRC Ruby脚本。该数据集包含1,000个问题实例与13,921个带有标注的GDS版图测试用例,每个问题均提供自然语言规则、层次定义、标准答案DRC脚本及标注版图,从而为模型输出提供严格的编译与标签匹配双重验证机制。研究者通常利用此基准来系统性地测试LLM在特定领域编程任务中的表现,尤其是在需要理解复杂几何约束并生成领域特定语言代码的电子设计自动化场景中,Rule2DRC成为评估模型从非结构化文本到可执行脚本端到端转换能力的权威标准。
衍生相关工作
围绕Rule2DRC数据集,学术界已衍生出多项具有影响力的相关工作。这些工作主要沿两条技术路径展开:一是探索更高效的候选脚本生成策略,如基于检索增强的少样本学习框架,通过从规则库中检索相似案例辅助LLM生成更准确的DRC代码;二是发展智能化的测试驱动验证方法,例如SplitTester智能体策略,利用生成的测试版图对候选脚本进行差异检测与回溯修正。此外,该基准还催生了将自生成测试与代码评分相结合的选择机制研究,如CodeMonkey风格的选择器以及基于LLM法官的评分范式,这些工作共同推动了LLM在专业领域代码合成中从单次生成向迭代验证的范式转变,并为后续构建更复杂的多步推理与反馈循环系统奠定了方法论基础。
数据集最近研究
最新研究方向
在电子设计自动化(EDA)领域,设计规则检查(DRC)脚本的自动生成一直是降低人工成本与提升芯片制造良率的关键瓶颈。随着大语言模型(LLM)在代码合成任务中展现出惊人潜力,Rule2DRC应运而生,为评估LLM智能体从自然语言设计规则规格说明生成可执行KLayout DRC Ruby脚本的能力提供了首个系统性基准。该数据集包含1,000个问题和近14,000个已标注GDS测试用例,仅当生成脚本通过编译且完全匹配所有测试标签时才判定为成功,严格的标准推动了模型在真实物理验证场景中的实用化转型。结合执行引导的测试生成(SplitTester)与最佳N选(BoN)采样策略,最新研究通过自生成GDS测试与多轮筛选机制显著提升了脚本合成的鲁棒性,揭示了将LLM从代码补全工具升级为自主EDA智能体的可行路径。该工作已被ICML 2026接收,标志着机器学习与芯片设计自动化交叉领域的深度交融,有望催生更智能的设计规则合规性验证方案,加速先进制程节点的开发周期。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务