aherntech/spider-syn
收藏资源简介:
Spider-Syn是一个基于Spider文本到SQL数据库的人工策划变体,旨在测试文本到SQL模型在替换同义词时的鲁棒性。该数据集通过手动选择反映现实世界问题改写的同义词来修改Spider中的自然语言问题,从而消除自然语言问题与表模式之间的显式对应关系。研究表明,即使同义词不是对抗性选择的,模型的准确性也会显著下降。此外,提出了两种提高模型鲁棒性的方法:一种是利用额外的同义词注释修改模型输入,另一种是基于对抗训练。这两种方法都显著优于没有防御的对应方法,且第一种方法更为有效。
Spider-Syn是一个基于Spider文本到SQL数据库的人工策划变体,旨在测试文本到SQL模型在替换同义词时的鲁棒性。该数据集通过手动选择反映现实世界问题改写的同义词来修改Spider中的自然语言问题,从而消除自然语言问题与表模式之间的显式对应关系。研究表明,即使同义词不是对抗性选择的,模型的准确性也会显著下降。此外,提出了两种提高模型鲁棒性的方法:一种是利用额外的同义词注释修改模型输入,另一种是基于对抗训练。这两种方法都显著优于没有防御的对应方法,且第一种方法更为有效。
数据集概述
基本信息
- 许可证:MIT
- 任务类别:文本到文本生成
- 语言:英语
- 标签:文本到SQL
- 美观名称:Spider-Syn
- 数据集大小:1K<n<10K
数据集描述
- 名称:Spider-Syn
- 来源:人类策划的Spider Text-to-SQL数据库变体
- 目的:测试文本到SQL模型对同义词替换的鲁棒性
论文摘要
- 研究背景:尽管在某些公共基准上取得了良好的性能,但现有的文本到SQL模型通常依赖于自然语言问题中的词汇与表模式中的标记之间的词汇匹配,这可能使模型容易受到破坏模式链接机制的攻击。
- 研究内容:研究文本到SQL模型对同义词替换的鲁棒性。
- 数据集介绍:Spider-Syn是一个基于Spider基准的人工策划数据集,通过将Spider中的模式相关词汇替换为手动选择的同义词来修改自然语言问题。
- 实验结果:消除自然语言问题与表模式之间的显式对应关系会导致准确性大幅下降,即使同义词不是为了进行最坏情况下的对抗性攻击而选择的。
- 改进方法:提出了两种提高模型鲁棒性的方法,一种是利用表模式的额外同义词注释修改模型输入,另一种是基于对抗性训练。实验表明,这两种方法都显著优于没有防御措施的对应方法,且第一种方法更有效。
引用信息
@inproceedings{gan-etal-2021-towards, title = "Towards Robustness of Text-to-{SQL} Models against Synonym Substitution", author = "Gan, Yujian and Chen, Xinyun and Huang, Qiuping and Purver, Matthew and Woodward, John R. and Xie, Jinxia and Huang, Pengsheng", month = aug, year = "2021", address = "Online", publisher = "Association for Computational Linguistics", url = "https://aclanthology.org/2021.acl-long.195", doi = "10.18653/v1/2021.acl-long.195", pages = "2505--2515", }




