LLM Verilog Benchmark
收藏官方服务:
资源简介:
这是一个用于基于大语言模型的Verilog修复和切割实验的Verilog评估数据集。
This is a Verilog evaluation dataset dedicated to LLM-based Verilog repair and slicing experiments.
创建时间:
2026-07-23
原始信息汇总
LLM Verilog Benchmark 数据集概述
基本信息
- 数据集名称: LLM Verilog Benchmark
- 来源地址: https://github.com/YUHUI-YUHUI/llm-verilog-benchmark
- 用途: 用于基于LLM的Verilog修复和切割实验的评估数据集
数据集内容
- tests/ 目录: 包含110个测试目录,每个目录内有Verilog/SystemVerilog设计文件和对应的testbench文件
- module_summary.txt: 包含单行元数据,记录了设计文件、用例数量和模块名称等信息,供实验运行器使用
- SHA256SUMS: 提供已发布快照的校验和
- 数据规模: 快照包含405个数据集文件(在添加文档和校验和之前)
目录结构说明
每个 tests/testN/ 目录包含:
testbench.v: 测试平台文件- 一个或多个设计文件
部分目录还额外包含:
source.json: 记录上游仓库、许可证标识、被测设备(DUT)、依赖模块、模式及原始路径changed_output.txt: 原始本地测试框架所需的辅助预期输出数据
许可证与来源信息
- 该数据集为多来源研究基准,未设置覆盖所有设计文件的统一软件许可证
- 在110个测试目录中,59个包含
source.json记录,其声明的上游许可证分布如下:- MIT: 30个目录
- Apache-2.0: 15个目录
- BSD-3-Clause: 7个目录
- BSD-2-Clause: 5个目录
- CC0-1.0: 2个目录
- 剩余51个目录暂无逐测试的来源记录,其第三方设计文件的权利归原作者所有
- 测试台和衍生基准元数据的来源可能与设计文件不同,使用者需自行审查适用条款
使用方法与注意事项
- 使用
module_summary.txt作为实验运行器的权威索引 - 发布快照在Git提交时不可变,引用时需注明确切的提交哈希,以确保实验输入不变
- 该仓库仅包含隔离的基准快照,不含模型API密钥、生成答案、实验日志或私人研究工作区
搜集汇总
数据集介绍

构建方式
该数据集源自LLM在Verilog修复与裁剪实验中的评估需求,以公开快照形式发布,涵盖了110个测试目录,每个目录内含设计文件与testbench.v测试平台。构建过程注重元数据记录,部分目录附有source.json,详细标注了上游仓库、许可类型、DUT模块及依赖关系,同时提供module_summary.txt作为权威索引,包含设计文件、用例计数及模块名称。数据集的快照在Git提交时固化,确保实验可复现性,并通过SHA256SUMS校验文件完整性,严格排除模型密钥、实验日志等无关内容,保障数据纯净性。
特点
该基准数据集具有典型的混合来源特性,其许可结构错综复杂,59个目录声明了MIT、Apache-2.0等五种上游许可,其余51个目录暂缺溯源信息,这警示使用者在复用前必须细致核查各项条款。文本旨在模拟真实硬件验证场景,涵盖多种设计模式,且testbench与设计文件的来源可能迥异,凸显了其作为科研基准的严谨性与多样性。数据集不设统一软件许可证,而是尊重各自上游权利,这一设计既保障了原始作者权益,也要求使用者具备高度的法律合规意识,为评估LLM在硬件描述语言领域的应用提供了独特且审慎的测试平台。
使用方法
使用方法上,研究者应首先以module_summary.txt为权威索引,依据其记录的设计文件、用例数及模块名,驱动本地实验运行器。数据集快照已锁定于特定Git提交,用户需引用精确的commit哈希以固定评估输入,确保实验结果的可重复性。在涉及数据重分发或独立文件复用前,务必完善各测试目录的来源记录,并逐一审查适用许可证条款。该基准设计的初衷是支持LLM修复与裁剪实验,故建议用户聚焦于testbench与设计文件的配对关系,结合changed_output.txt中的辅助期望输出,开展系统性评估。
背景与挑战
背景概述
随着大型语言模型(LLM)在代码生成与修复领域的迅猛发展,硬件描述语言(如Verilog)的自动化设计成为电子设计自动化(EDA)领域的前沿研究方向。LLM Verilog Benchmark数据集由研究团队于近期创建,旨在系统评估LLM在Verilog代码修复与裁剪任务中的性能。该数据集汇聚了110个测试目录,涵盖多种设计文件与测试平台,并记录了上游来源与许可证信息,为复现实验提供了严谨的基准。其发布填补了硬件描述语言领域缺乏标准化LLM评估基准的空白,对推动LLM在芯片设计自动化中的应用具有重要参考价值,吸引了学术界与工业界的广泛关注。
当前挑战
该数据集所解决的领域问题在于,LLM生成的Verilog代码常存在功能性缺陷或冗余,需精确修复与优化,而现有基准多集中于软件代码,缺乏对硬件描述语言特性的针对性评估。构建过程中,团队面临多重挑战:混合来源的设计文件需妥善处理许可证合规性,避免版权风险;部分目录缺乏完整的来源记录,增加了数据溯源难度;测试环境依赖特定元数据与辅助文件,需保证可复现性;同时,数据集需保持不可变性,以支持精确的实验对比,这些均对数据集的构建与长期维护提出了严苛要求。
常用场景
经典使用场景
该数据集作为硬件描述语言(HDL)生成与修复任务的评测基准,广泛用于评估大型语言模型在Verilog代码自动生成、语法纠错及功能验证方面的能力。研究者通常利用其结构化的测试目录,将模型生成的代码与配套的testbench进行联合仿真,以客观衡量模型输出在功能正确性与时序约束下的表现,从而推动自动化芯片设计流程中代码生成技术的迭代与优化。
实际应用
在实际应用中,该数据集支撑了电子设计自动化(EDA)工具链的智能化发展,尤其是在设计验证阶段,它可作为自动化测试套件,帮助工程师快速验证由AI辅助生成的RTL代码。此外,其许可信息的详细标注便于工业界合规地集成这些数据,用于训练定制化的代码生成模型,从而缩短芯片设计周期并降低人工审查成本。
衍生相关工作
该数据集的发布催生了多个后续研究方向,包括基于上下文的Verilog代码修复策略、针对硬件描述语言的预训练模型优化,以及跨项目代码迁移的评估框架。其提供的可复现评估协议及模块摘要,已被后续工作引用为基准,用于探索LLM在复杂数字系统设计中的局限性与潜力,进而推动了一系列关于代码质量度量与安全性的实证研究。
以上内容由遇见数据集搜集并总结生成




