CSpider|Text-to-SQL数据集|自然语言处理数据集
收藏CSpider 数据集概述
基本信息
- 名称:CSpider
- 类型:大规模中文数据集
- 用途:复杂跨领域语义解析和文本到SQL任务(自然语言关系数据库接口)
- 发布年份:2019年
- 相关论文:A Pilot Study for Chinese SQL Semantic Parsing
数据集特点
- 语言:中文
- 规模:大规模
- 复杂性:复杂跨领域
- 来源:基于英文数据集Spider翻译而来
数据内容
- 训练数据:
train.json
- 开发数据:
dev.json
- 测试数据:未公开(需通过任务网站提交)
- 数据库:包含多个数据库文件
- 词嵌入:提供字符级和词级嵌入文件
下载链接
- 完整数据集:Google Drive 或 百度网盘(提取码:cgh1)
- 论文数据集:Google Drive
任务网站
引用信息
bibtex @inproceedings{min2019pilot, title={A Pilot Study for Chinese SQL Semantic Parsing}, author={Min, Qingkai and Shi, Yuefeng and Zhang, Yue}, booktitle={Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP)}, pages={3643--3649}, year={2019} }
基线模型
- 环境要求:
- Python 2.7
- Pytorch 0.2.0 GPU
- 依赖安装:
pip install -r requirements.txt
- 数据准备:
- 下载数据、嵌入和数据库
- 可选下载预训练Glove嵌入
- 训练:使用
train_all.sh
脚本 - 测试:使用
test_gen.sh
脚本生成SQL查询 - 评估:使用
evaluation.sh
脚本评估生成的SQL查询
致谢
- 基于Spider数据集
- 实现基于SyntaxSQLNet

The MaizeGDB
The MaizeGDB(Maize Genetics and Genomics Database)是一个专门为玉米(Zea mays)基因组学研究提供数据和工具的在线资源。该数据库包含了玉米的基因组序列、基因注释、遗传图谱、突变体信息、表达数据、以及与玉米相关的文献和研究工具。MaizeGDB旨在支持玉米遗传学和基因组学的研究,为科学家提供了一个集成的平台来访问和分析玉米的遗传和基因组数据。
www.maizegdb.org 收录
FinEval
FinEval数据集由上海财经大学创建,包含4661个高质量的多项选择题,覆盖金融、经济、会计和证书四大领域,共涉及34个不同的学术科目。数据主要来源于公开渠道的模拟考试题目,旨在评估大型语言模型在金融领域的知识和应用能力。该数据集适用于金融领域知识评估,特别是在中国语境下的应用,如金融虚拟助手和金融犯罪检测等。
arXiv 收录
中国1km分辨率逐月降水量数据集(1901-2024)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2024.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
Subway Dataset
该数据集包含了全球多个城市的地铁系统数据,包括车站信息、线路图、列车时刻表、乘客流量等。数据集旨在帮助研究人员和开发者分析和模拟城市交通系统,优化地铁运营和乘客体验。
www.kaggle.com 收录
United Nations Comtrade Database
联合国商品贸易统计数据库(UN Comtrade)是一个全球性的贸易数据资源,提供了超过170个国家和地区的商品贸易数据。该数据库涵盖了从1962年至今的进出口数据,包括商品的详细描述、数量、价值等信息。数据按月更新,用户可以查询和下载特定国家、商品类别和时间段的贸易数据。
comtrade.un.org 收录