遇见数据集

text-to-sql-dataset

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

English Text-to-SQL with Optional Schema 是一个用于英文文本到SQL转换任务的数据集,旨在将自然语言问题映射为对应的SQL查询。其独特之处在于支持可选的数据模式:当提供模式时,它以紧凑、人类可读的格式呈现,即用逗号分隔的表名列表,后跟括号内的列名(不包含数据类型);当不提供模式时,模型需要推断表结构或生成通用SQL。数据集包含三个核心字段:text(英文用户请求)、schema(可选的简洁模式定义)和query(回答text的SQL查询)。数据规模约为2,000个样本,涵盖图书馆、电子商务、人力资源等多个领域。该数据集通过结合使用DeepSeek、ChatGPT、Gemini和Claude Sonnet等多种大型语言模型合成生成,并经过过滤和格式化以确保基本语法正确性。主要适用于微调语言模型进行文本到SQL任务、在有/无显式模式上下文的情况下进行SQL生成的基准测试,以及构建需要简洁传达数据库模式的自然语言接口。数据集采用MIT许可证,但用户需注意其合成性质可能包含错误或不一致,且规模相对较小,可能需要增强以进行大规模训练。

English Text-to-SQL with Optional Schema is a dataset for text-to-SQL conversion tasks, specifically designed to map English natural language questions to corresponding SQL queries. Its unique feature is the support for optional schema: when provided, the schema is presented in a compact, human-readable format, which is a comma-separated list of table names followed by column names in parentheses (without data types); when not provided, the model needs to infer the table structure or generate generic SQL. The dataset includes three core fields: text (English user request), schema (optional concise schema definition), and query (SQL query answering the text). The data scale is approximately 2,000 samples, covering multiple domains such as libraries, e-commerce, and human resources. The dataset is synthetically generated using a combination of large language models including DeepSeek, ChatGPT, Gemini, and Claude Sonnet, and has been filtered and formatted to ensure basic grammatical correctness. It is primarily suitable for fine-tuning language models for text-to-SQL tasks, benchmarking SQL generation with/without explicit schema context, and building natural language interfaces that require concise communication of database schemas. The dataset is under the MIT license, but users should note its synthetic nature may contain errors or inconsistencies, and its relatively small scale may require augmentation for large-scale training.

创建时间:
2026-07-22
原始信息汇总

Text-to-SQL 数据集概述

该数据集为英文 Text-to-SQL 任务设计,将用户输入的英文问题映射为对应的 SQL 查询语句。数据集的核心特点是提供可选的数据库模式(Schema),让模型可以在带或不带显式模式信息的条件下进行 SQL 生成。

数据集结构

列名 类型 描述
text 字符串 用户提出的英文请求。
schema 字符串(可选) 精简的数据库模式定义,格式如 books(id, name, price, author_id), author(id, name)。若未提供,则为空字符串或 null
query 字符串 对应上述 text 的 SQL 查询语句,在给定模式(或当 schema 缺失时默认的隐含模式)下有效。

关键特性

  • 语言:所有 text 为英文。
  • Schema 格式:紧凑、易读、易解析,采用 表名(列1, 列2, ...), ... 格式,聚焦于列名与表关系。
  • 可选 Schema:许多样本不提供 Schema,训练模型推断表结构或生成通用 SQL。
  • 规模:约 2,000 条样本(仍在扩展中)。

示例

text schema query
"List all books with their author names" books(id, name, price, author_id), author(id, name) SELECT books.name, author.name FROM books JOIN author ON books.author_id = author.id;
"Show me books priced above 20" books(id, name, price, author_id) SELECT * FROM books WHERE price > 20;
"Count how many authors we have" (空) SELECT COUNT(*) FROM authors;

预期用途

  • 微调语言模型以完成 Text-to-SQL 任务。
  • 在带/不带显式 Schema 语境下,基准测试 SQL 生成性能。
  • 构建能够简洁传达数据库模式的自然语言接口。

数据集创建

该数据集通过合成方式生成,使用了多个开源大语言模型(包括 DeepSeek、ChatGPT、Gemini、Claude Sonnet)。通过多样化的提示词生成跨领域(如图书馆、电商、人力资源)的问题-SQL 对,经筛选与格式化保证基本语法正确性。数据可能反映底层模型的偏差与局限。

许可

遵循 MIT 许可证,可自由使用、复制、修改、合并、发布、分发、再许可或销售。需附带版权声明与许可声明。注意:数据集由第三方 LLM 生成,使用者应核查各模型服务条款(OpenAI、Google、Anthropic、DeepSeek),确保商业用途合规。

局限

  • 仅英文:仅包含英文自然语言查询。
  • 简单模式:Schema 紧凑,可能未完整表示外键、数据类型、索引等复杂约束。
  • 合成性质:AI 生成,可能包含错误、不一致或非真实查询,不可替代人工标注或真实数据。
  • 规模有限:样本不足 3,000 条,大规模训练可能需要扩充。
  • 隐含模式歧义:缺失 schema 时,正确 SQL 基于未提供的隐含模式,限制该类样本的训练效用。
搜集汇总
数据集介绍
text-to-sql-dataset 数据集图片
构建方式
本数据集采用合成生成策略,借助DeepSeek、ChatGPT、Gemini及Claude Sonnet等多种开源大语言模型,通过多样化提示词在图书馆、电商、人力资源等多个领域产出丰富的自然语言问句与对应SQL查询对。生成后的数据经过基础语法正确性过滤与统一格式整理,最终形成约2000条样本的集合。数据集以简洁的逗号分隔格式呈现可选的数据库模式,例如'books(id, name, price, author_id)',该设计使输入保持紧凑,便于模型聚焦于表名与列间关系。
使用方法
使用者可通过Hugging Face Datasets库便捷加载,执行'from datasets import load_dataset; dataset = load_dataset("sirunchained/text-to-sql")'即可获取训练数据,其中每个样本包含text、schema与query三个字段。该数据集适用于文本到SQL任务的模型微调、有无显式模式条件下的SQL生成性能基准测试,以及构建利用精简模式通信的自然语言数据库接口。鉴于数据规模较小,大规模训练时建议配合数据增强策略使用。
背景与挑战
背景概述
文本到SQL(Text-to-SQL)任务旨在将自然语言问题自动转化为可执行的SQL查询语句,是实现智能数据库交互的关键技术。近年来,随着大规模语言模型的兴起,Text-to-SQL领域取得了显著进展,然而高质量、多样化的训练数据集仍是制约模型性能提升的瓶颈。该数据集由研究人员利用DeepSeek、ChatGPT、Gemini和Claude Sonnet等多种大型语言模型合成生成,覆盖图书馆、电子商务、人力资源等多个领域,创建于近期,采用MIT许可证发布。核心研究问题在于探究如何利用合成数据提升模型在有无显式数据库模式下的SQL生成能力。作为该领域的新兴资源,该数据集为评估和微调语言模型提供了轻量化的基准,尤其关注紧凑模式表示对查询生成的影响。
当前挑战
该数据集面临的挑战首要是领域问题层面的,即解决模型在缺乏完整数据库模式约束时的SQL生成歧义性,当模式缺失时,模型需推断隐含的表结构,这增加了推理难度并可能产生不合语法的查询。其次,构建过程中遭遇多重困难:合成数据来源于多个第三方语言模型,导致数据集可能继承各模型固有的偏见与错误,且依赖人工筛选保证基本语法正确性,效率较低;数据集规模有限(约2000样本),难以支撑大规模模型训练;模式表示采用紧凑格式,省略了数据类型、外键等关键约束,可能无法反映真实数据库的复杂性;此外,部分样本在空模式场景下的隐含模式假设不一致,削弱了训练实例的实用性。这些挑战共同限制了数据集在复杂现实场景中的泛化能力。
常用场景
经典使用场景
在自然语言处理与数据库的交汇领域,Text-to-SQL任务致力于将用户的自然语言查询自动转化为可执行的SQL语句。该数据集为这一经典任务提供了精心构造的训练与评估资源,其最典型的应用场景是微调预训练语言模型,使其能够理解用户以英文提出的数据查询需求,并生成结构化的SQL代码。数据集的设计独具匠心,不仅包含了完整的自然语言问题与对应SQL查询对,还引入了可选的简洁数据库模式(schema)信息。这种设置使得模型能够在有显式模式指导时学习精准的列名与表关系映射,而在无模式提供时则需依赖上下文推断表结构,从而锻炼模型在不同信息完备度下的泛化能力。这对于构建真正鲁棒、适应复杂真实环境的自然语言数据库查询接口至关重要。
解决学术问题
该数据集聚焦于解决Text-to-SQL领域两个核心的学术挑战:一是模型对数据库结构信息的依赖与利用问题,二是在信息缺失条件下的推理能力。传统数据集往往假定固定且完整的模式信息,而本数据集通过提供可选的、简洁的模式描述,使得研究者能够系统性地探索模式信息对SQL生成质量的影响。这为理解语言模型如何编码和利用结构化知识提供了独特的实验范式。此外,数据集中相当比例的样本完全不提供模式,迫使模型仅凭常识和语言理解推断隐含的表与列,这对于研究零样本或少样本下的SQL生成、以及模型对弱监督信号的利用机制具有重要学术价值。数据集的多领域覆盖(如图书馆、电商、HR)也为跨领域迁移学习研究提供了基准。
实际应用
在实际应用层面,该数据集的核心价值在于赋能非技术用户与数据库的直观交互。基于此数据训练的模型可以嵌入到商业智能工具、企业数据平台或智能客服系统中,让分析师、管理者甚至普通员工能够用日常英语直接查询数据库,无需掌握SQL语法。这种自然语言查询接口极大地降低了数据访问门槛,加速了从数据到洞察的转化。例如在电商场景中,运营人员可以询问“展示上月销量前十的商品”,系统即刻生成并执行对应SQL,返回结果。数据集的可选模式设计还特别贴合真实部署需求:当数据库结构频繁变动或无法公开时,模型仍可基于隐式知识工作;而在可控环境下,显式模式则能提升查询准确性。这种灵活性使得该数据集对产品级NL2SQL系统的开发极具指导意义。
数据集最近研究
最新研究方向
该数据集聚焦于文本到SQL生成任务的前沿探索,尤其在无显式模式或仅有小规模模式的信息下,推动语言模型在自然语言接口中的动态模式推理能力。随着大语言模型在多领域对话系统与数据库交互中的广泛应用,该数据集通过提供跨领域的合成样本和可选的紧凑模式,成为研究模型在稀疏或隐含数据库结构下生成合理SQL查询的热点资源。其合成生成方式反映了当前依赖多方大模型协同产出训练数据的趋势,有助于评估模型对模式信息的敏感度与泛化能力,对构建更鲁棒的类人数据库查询系统具有重要推动意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务