NL2SQL-BUGs
收藏资源简介:
NL2SQL-BUGs是一个专门用于检测和分类自然语言到SQL(NL2SQL)翻译中语义错误的基准。该基准旨在支持语义错误检测的研究,这是任何后续错误纠正的前提。数据集包含2,018个实例,其中1,019个是正确的示例,999个是语义错误的示例。每个错误示例都详细注释了特定的错误类型。
NL2SQL-BUGs is a benchmark specifically designed for detecting and classifying semantic errors in natural language to SQL (NL2SQL) translation. This benchmark aims to support research on semantic error detection, which is a prerequisite for any subsequent error correction. The dataset contains 2,018 instances, among which 1,019 are correct examples and 999 are examples with semantic errors. Each erroneous example is comprehensively annotated with a specific error type.
NL2SQL-BUGs 数据集概述
数据集简介
NL2SQL-BUGs 是一个专门用于检测和分类自然语言到SQL(NL2SQL)翻译中语义错误的基准数据集。该数据集旨在支持语义错误检测的研究,这是任何后续错误纠正的前提。
数据集特点
- 两级分类系统:包含9个主要类别和31个子类别的语义错误分类系统。
- 专家标注数据集:包含2,018个实例,其中1,019个为正确示例,999个为语义错误的示例。
- 详细的错误标注:每个错误示例都详细标注了具体的错误类型。
数据统计
- 总实例数:2,018
- 正确示例数:1,019
- 错误示例数:999
- 主要错误类别数:9
- 错误子类别数:31
数据集下载
数据集与BIRD基准一致,可通过以下方式下载:
NL2SQL-BUGs 的标签和错误类型可在 ./data/ 目录下找到。
评估指标
语义错误检测性能的评估指标包括:
- 总体准确率:正确识别的实例(正确或错误)的百分比。
- 负例精确率(NP):预测为错误的实例中实际为错误的比例。
- 负例召回率(NR):实际为错误的实例中被正确预测为错误的比例。
- 正例精确率(PP):预测为正确的实例中实际为正确的比例。
- 正例召回率(PR):实际为正确的实例中被正确预测为正确的比例。
- 类型特定准确率(TSA):每种特定错误类型的准确率。
引用
如果您在研究中使用了NL2SQL-BUGs,请引用以下论文: bibtex @misc{liu2025nl2sqlbugsbenchmarkdetectingsemantic, title={NL2SQL-BUGs: A Benchmark for Detecting Semantic Errors in NL2SQL Translation}, author={Xinyu Liu and Shuyu Shen and Boyan Li and Nan Tang and Yuyu Luo}, year={2025}, eprint={2503.11984}, archivePrefix={arXiv}, primaryClass={cs.DB}, url={https://arxiv.org/abs/2503.11984}, }




