遇见数据集

Awesome-Text2SQL-Dataset

收藏
github2026-05-23 更新2026-06-04 收录
官方服务:

资源简介:

Awesome-Text2SQL-Dataset 是一个专门为Text-to-SQL任务策划的数据集集合,该任务涉及将自然语言问题转换为SQL查询。该合集旨在为研究人员、开发者和从业者提供全面的数据集列表,以支持和评估Text2SQL模型,涵盖模式链接、复杂SQL生成、跨领域泛化和对话查询生成等领域。它包含最新的数据集资源(如2026年和2025年的条目),并持续更新以服务社区。

Awesome-Text2SQL-Dataset is a curated dataset collection specifically designed for the Text-to-SQL task, which involves converting natural language questions into SQL queries. This collection aims to provide researchers, developers and practitioners with a comprehensive list of datasets to support and evaluate Text2SQL models, covering fields such as schema linking, complex SQL generation, cross-domain generalization and conversational query generation. It includes the latest dataset resources (such as entries from 2025 and 2026) and is continuously updated to serve the community.

创建时间:
2025-05-15
原始信息汇总

Awesome-Text2SQL-Dataset 数据集详情总结

该仓库是一个精心整理的 Text-to-SQL 数据集集合,旨在为将自然语言问题转换为 SQL 查询的任务提供支持,涵盖模式链接、复杂 SQL 生成、跨领域泛化及对话式查询生成等多个方向。

最新数据集(2026年)

  • SQL Injection Dataset(2026/01)

    • 描述:评估大语言模型生成 SQL 的注入风险,覆盖 14 个模型、3 种数据库类型(SQLite、MySQL、PostgreSQL)及 4 种检测技术。研究发现网页版模型拒绝恶意提示的比例远高于 API 模型;MySQL 最易受攻击,PostgreSQL 保护最佳;现有检测器性能普遍下降,深度学习模型甚至失效。
    • 链接论文数据集
  • BIRDTurk(2026/01)

    • 描述:首个土耳其语的 BIRD 基准,通过受控翻译流程保留原基准逻辑,同时本地化自然语言问题和模式标识符,填补了跨语言、低资源语言评估的空白。
    • 链接论文数据集

2025年数据集

  • DAComp(2025/12)

    • 描述:全面评估数据自主智能体(AI Agent)在整个数据智能生命周期性能的基准,包含 210 个任务。评估范围覆盖端到端流程(数据获取、清洗、探索、建模、可视化及决策建议),超越传统 NL2SQL 的单一查询生成。
    • 链接论文排行榜
  • DP-Bench(2025/12)

    • 描述:首个专门用于评估生成“数据产品”系统的基准,模拟预测客户服务取消等真实场景,关注将原始数据库转换为满足业务需求的标准数据表(附带来源和元数据)。
    • 链接论文数据集
  • DLBench(2025/11)

    • 描述:全面评估大语言模型跨不同 SQL 方言翻译能力的基准,覆盖 7 种数据库管理系统、9320 个 SQL 方言变体,共 6402 个翻译任务。
    • 链接论文排行榜
  • BibSQL(2025/11)

    • 描述:首个面向文献检索的中文 Text-to-SQL 数据集,包含 1190 个问题-SQL 对。基于该数据集构建的系统结合语义检索、思考过程提示策略和大语言模型,提升了文献检索的准确性和智能性。
    • 链接论文数据集
  • DySQL-Bench(2025/11)

    • 描述:动态、多轮次的 Text-to-SQL 基准套件,核心是构建包含模拟用户、待评估智能体和可执行数据库的三方交互环境。用于评估大语言模型在涉及 CRUD 完整操作的多轮对话中理解、执行和动态修正 SQL 任务的能力。
    • 链接论文排行榜
  • DeKeyNLU(2025/11)

    • 描述:通过三层人工交叉验证实现任务分解与关键词提取的联合细粒度标注。基于此提出的 DeKeySQL 框架将专用理解模块集成到结果生成过程中,建立了优先准确语义解析的新范式。
    • 链接论文数据集
  • GeoSQL-Bench(2025/11)

    • 描述:首个面向 PostGIS 环境的端到端自动评估框架,用于衡量大语言模型在地理空间数据库查询生成(GeoSQL)上的性能。包含 14178 个实例、340 个 PostGIS 函数和 82 个主题数据库。
    • 链接论文排行榜
  • DBASQL(2025/10)

    • 描述:针对当前 NL2SQL 系统忽略数据库管理操作的局限,基于 T5-Large 模型微调,专门处理数据库管理员日常任务(包括数据定义、数据控制、数据操作),构建专用数据集以从自然语言命令中自动生成复杂管理 SQL 语句。
    • 链接论文数据集
  • CORGI(2025/10)

    • 描述:专为咨询领域设计的高难度 Text-to-SQL 基准套件,模拟顶级咨询公司的真实分析场景,涵盖 10 个垂直行业,强调模型在极复杂数据库架构下处理深层业务逻辑的能力。
    • 链接论文排行榜
  • Payment-SQL(2025/09)

    • 描述:源自真实金融支付的行业级数据集,专用于评估大语言模型处理高度复杂在线分析处理查询的能力。
    • 链接论文数据集
  • Arabic WikiTableQA(2025/09)

    • 描述:首个大规模阿拉伯语非 SQL 表格问答基准,填补了非英语语言表格问答领域的空白。
    • 链接论文数据集
  • LLMSQL(2025/09)

    • 描述:对经典 WikiSQL 数据集的系统性重构与升级,将其组织为标准 SQL 格式,旨在解决大语言模型时代生成任务的适应性问题。
    • 链接论文数据集
  • text2SQL4PM(2025/08)

    • 描述:面向流程挖掘领域的双语(葡萄牙语-英语)Text-to-SQL 基准数据集,包含 1655 条自然语言语句、205 个 SQL 查询和 10 个限定符,结合专家策划、专业翻译和详细标注,涵盖领域特定术语和单表关系结构。
    • 链接论文数据集
  • REEF(2025/08)

    • 描述:包含 18 个相互关联的表(如产品、订单、用户),具有编码变量间因果关系的注释数据分布,用于评估大模型在端到端因果分析任务中的能力。
    • 链接论文数据集
  • CogniSQL(2025/07)

    • 描述:发布两类策展数据集,推动与执行对齐的可扩展 Text-to-SQL 生成研究。开源资源使社区即使在计算资源有限的情况下,也能获得高精度 SQL 样本和清晰推理路径,从而支持轻量级强化学习和推理增强的 Text-to-SQL 模型训练。
    • 链接论文数据集
  • SQLStorm(2025/07)

    • 描述:使用大语言模型生成用于数据库性能测试的 SQL 语句,解决传统数据集(如 TPC-H)在 SQL 特性覆盖上的局限。兼容 PostgreSQL、Umbra 和 DuckDB 等主流数据库系统,部分数据基于 StackOverflow 提供的真实数据库。
    • 链接论文数据集
  • BIRD-Critic(2025/06)

    • 描述:首个 SQL 诊断基准,旨在回答大语言模型能否修复真实数据库应用中的用户问题。包含 600 个开发任务和 200 个分布外测试,涵盖 MySQL、PostgreSQL、SQL Server 和 Oracle 四种 SQL 方言,扩展超出简单 SELECT 查询,包含更广泛的 SQL 操作。
    • 链接论文排行榜
  • BiomedSQL(2025/05)

    • 描述:专为评估大语言模型在科学表格推理任务上的 Text-to-SQL 基准,包含精心策划的问题-SQL 查询-答案三元组,覆盖多种生物医学和 SQL 推理类型,挑战模型应用隐含科学标准的能力。
    • 链接论文数据集
  • LogicCat(2025/05)

    • 描述:为测试复杂推理(物理、算术、常识及假设推理)而设计的高难度 Text-to-SQL 数据集,包含 4038 个英文问题及对应的 SQL 查询,以及在 45 个不同数据库上的 12114 个逐步推理注释。实验表明最先进模型仅达 14.96% 准确率,但结合思维链注释后提升至 33.96%。
    • 链接论文数据集
  • TINYSQL(2025/03)

    • 描述:结构化的 Text-to-SQL 数据集,通过可控复杂度连接玩具示例与真实任务,支持可解释性研究。
    • 链接论文数据集
  • NL2SQL-Bugs(2025/03)

    • 描述:专用于检测和分类自然语言到 SQL 翻译中语义错误的基准,专注于虽然执行成功但产生错误结果的语义错误查询,旨在支持语义错误检测研究。
    • 链接论文数据集
  • OmniSQL / SynSQL-2.5M(2025/03)

    • 描述:截至 2025 年 3 月,是最大且最多样化的合成 Text-to-SQL 数据集,具有里程碑意义。
    • 链接论文数据集

其他重要数据集

  • WikiSQL(2017/09)

    • 描述:Salesforce 提出的大规模 Text-to-SQL 数据集,来自 Wikipedia,单领域,包含 80654 个自然语言问题和 77840 个 SQL 语句,但 SQL 形式较简单,不含排序、分组和子查询等复杂操作。
    • 链接论文数据集
  • Spider 1.0(2018/09)

    • 描述:耶鲁大学提出的多数据库、多表、单轮查询 Text-to-SQL 数据集,被公认为业界最难的大规模跨域评估排行榜,包含 10181 个自然语言问题和 5693 个 SQL 语句。
    • 链接论文排行榜
  • SParC(2019/06)

    • 描述:耶鲁大学提出的复杂、跨域、上下文依赖(多轮)语义解析和 Text-to-SQL 大型数据集,由 14 名耶鲁学生标注,包含 4298 个连贯问题序列(超过 12000 个独立问题)及对应 SQL 查询,覆盖 138 个领域的 200 个复杂数据库。
    • 链接论文排行榜
  • CSpider(2019/09)

    • 描述:西湖大学提出的复杂跨域语义解析和 Text-to-SQL 中文数据集,由 Spider 翻译而来,包含 10181 个问题和 5693 个独特复杂 SQL 查询,覆盖 138 个领域的 200 个多表数据库。
    • 链接论文排行榜
  • CoSQL(2019/09)

    • 描述:耶鲁大学和 Salesforce Research 提出的跨域数据库,包含超过 30000 轮对话和超过 10000 个带标注的 SQL 查询,通过 Wizard-of-Oz 收集,涉及 138 个领域的 200 个复杂数据库的 3000 次对话。
    • 链接论文排行榜
  • KaggleDBQA(2021/06)

    • 描述:具有挑战性的跨域复杂评估数据集,基于真实网络数据库,包含领域特定的数据类型、原始格式和无限制问题。
    • 链接论文数据集
  • Spider-Syn(2021/06)

    • 描述:基于原始 Spider 数据集的基准,用于评估和增强 Text-to-SQL 模型对自然语言问题中同义词替换的鲁棒性。
    • 链接论文数据集
  • SEDE(2021/06)

    • 描述:基于 Stack Exchange Data Explorer 平台真实用户数据的 Text-to-SQL 数据集,包含超过 12000 个 SQL 查询及其自然语言描述,涉及复杂嵌套、日期和数字操作、参数化及未说明假设等前所未有的复杂挑战。
    • 链接论文数据集
  • CHASE(2021/08)

    • 描述:大规模、实用的跨数据库上下文相关 Text-to-SQL 中文数据集。
    • 链接论文数据集
  • Spider-DK(2021/09)

    • 描述:基于 Spider 数据集的基准,专注于评估模型处理领域知识推理的能力。
    • 链接论文数据集
二维码
社区交流群
二维码
科研交流群
商业服务