首届中文NL2SQL挑战赛数据集
收藏资源简介:
赛题提供了约40,000条有标签数据作为训练集,5,000条数据作为验证集,10,000条无标签数据作为测试集。数据包括train.json、train.tables.json及train.db等文件,用于自然语言问句到SQL查询的转换训练和测试。
The competition provides approximately 40,000 labeled data entries as the training set, 5,000 data entries as the validation set, and 10,000 unlabeled data entries as the test set. The data includes files such as train.json, train.tables.json, and train.db, which are used for training and testing the conversion from natural language queries to SQL queries.
数据集概述
数据集名称
首届中文NL2SQL挑战赛数据集
数据集组成
- 训练集:约40,000条有标签数据,包含文件:
- train.json:每行一条数据样本,包含字段:
table_id:表格IDquestion:自然语言问句sql:SQL查询结构,包括选择列(sel)、聚合函数(agg)、条件连接操作(cond_conn_op)和条件(conds)
- train.tables.json:每行一张表格数据,包含字段:
id:表格IDname:表格名称title:表格标题header:列名types:列类型rows:行数据
- train.db:SQLite格式的数据库文件,表名为train.tables.json中的
name字段
- train.json:每行一条数据样本,包含字段:
- 验证集:5,000条数据
- 测试集:10,000条数据,分为初赛和复赛两部分,各5,000条
数据字典
- op_sql_dict:SQL操作符字典
- agg_sql_dict:SQL聚合函数字典
- conn_sql_dict:SQL条件连接字典
数据使用
-
开源给学术界,严禁商业使用与未授权公开转发
-
引用格式:
@misc{sun2020tableqa, title={TableQA: a Large-Scale Chinese Text-to-SQL Dataset for Table-Aware SQL Generation}, author={Ningyuan Sun and Xuefeng Yang and Yunfeng Liu}, year={2020}, eprint={2006.06434}, archivePrefix={arXiv}, primaryClass={cs.DB} }




