遇见数据集

Snowflake/SQL-Schema-Retrieval

收藏
Hugging Face2026-07-11 更新2026-07-22 收录
官方服务:

资源简介:

SQL模式检索基准数据集,用于评估在给定数据库的自然语言问题时检索相关模式元素(如表或列)的任务。该数据集基于五个文本到SQL数据集(Spider、BIRD、BEAVER、LiveSQLBench)构建,支持表级和列级粒度检索,旨在模拟真实场景中从大型数据库模式中定位所需元素的挑战。数据集包含多个子集,每个子集提供模式元素文档、查询和相关判断,采用BEIR/MTEB检索格式,适用于信息检索和自然语言处理研究。

SQL Schema Retrieval Benchmark Dataset: A benchmark dataset for evaluating the task of retrieving relevant schema elements (such as tables or columns) given natural language queries about databases. This dataset is built upon five existing text-to-SQL datasets including Spider, BIRD, BEAVER, and LiveSQLBench, supports retrieval at both table-level and column-level granularity, and aims to simulate the challenges of locating required schema elements from large-scale database schemas in real-world scenarios. The dataset comprises multiple subsets, each containing schema element documents, queries and corresponding relevance judgments, and follows the BEIR/MTEB retrieval format, making it suitable for research in information retrieval and natural language processing.

提供机构:
Snowflake
搜集汇总
数据集介绍
Snowflake/SQL-Schema-Retrieval 数据集图片
构建方式
SQL-Schema-Retrieval数据集旨在评估自然语言查询到数据库模式的检索能力,其构建基于五个公开的文本到SQL数据集,包括Spider、BIRD、BEAVER以及LiveSQLBench(基础版与大型版)。通过将原始SQL任务重构为检索任务,该数据集将每个数据库的模式元素(如表或列)作为文档单元,并以Markdown格式呈现表结构(含列类型和示例行)。相关性标注通过解析黄金SQL语句中引用的表和列来生成,形成查询-文档对的评判依据。检索过程按数据库组独立进行,确保模型在给定数据库范围内对模式元素进行排序。
特点
该数据集的显著特点在于其多层次粒度设计,同时支持表级别和列级别的模式检索,覆盖了从学术基准(如Spider)到企业级仓库(如BEAVER)及大规模在线模式(如LiveSQLBench-Large)的多样化场景。文档规模从75到17,709不等,查询数量最高达2,147条,评判对丰富度超过3,000。其独特之处在于将模式链接问题明确定义为检索任务,弥补了传统文本到SQL评估忽视全模式上下文限制的不足,并提供了标准化格式(基于BEIR/MTEB布局),便于直接应用于现有检索系统。
使用方法
数据集采用BEIR和MTEB标准的检索格式组织,每个子集包含corpus.jsonl(文档)、queries.jsonl(查询)和qrels/test.tsv(相关性评判)三个文件。文档ID编码了模式元素来源,如'db__table'表示表级,'db__table__column'表示列级。使用时可加载文档和查询,基于每个数据库组进行排序,并采用nDCG@10和recall@10作为评估指标。研究者可直接应用此数据集训练或评估模式检索模型,或基于其发布的两个文档表示方案(元数据或仅值)进行对比实验,以优化跨域模式链接性能。
背景与挑战
背景概述
在文本到SQL(Text-to-SQL)解析任务中,模型常需将整个数据库模式作为上下文输入,这在实际应用中因模式规模庞大而不可行。为解决此问题,模式链接(Schema Linking)作为检索任务被提出,旨在从复杂数据库模式中精准定位与自然语言查询相关的关系和列。2025年,Zeng、Yu、Mehta、Zhao和Samdani等研究者构建了SQL-Schema-Retrieval数据集,该数据集基于Spider、BIRD、BEAVER及LiveSQLBench五个典型文本到SQL基准,将模式元素检索形式化为标准检索问题,覆盖学术、企业及大规模在线场景。数据集包含表级和列级粒度,总计逾万条查询与数十万模式元素,显著推动了跨领域模式检索研究的发展。
当前挑战
该数据集所解决的领域核心挑战在于:现有文本到SQL方法依赖完整模式在模型上下文中的显式呈现,当模式扩展至成百上千张表与列时,上下文窗口限制与效率问题凸显。模式检索需在庞大候选空间中精确选择相关模式元素,且需适应不同数据库的语义和结构差异,如BEAVER中的企业级仓库与LiveSQLBench的大规模在线模式。构建过程中,研究者面临多重挑战:首先,从五个异构文本到SQL数据集中提取模式引用需精确解析SQL中的表/列引用;其次,需统一不同来源的模式表示(如元数据与样本值),并处理不同粒度(表级与列级)下的检索度量权衡;最后,确保评估指标nDCG@10与Recall@10能公平反映检索性能,尤其在多种数据库规模下保持一致性。
常用场景
经典使用场景
SQL-Schema-Retrieval数据集的核心用途是将自然语言问题与数据库中的模式元素进行精准匹配,从而构建高效的检索系统。该数据集将五个著名的文本到SQL数据集重新构架为检索任务,涵盖从学术基准(如Spider)到企业级仓库(如BEAVER)再到大规模实时模式(如LiveSQLBench-Large)的多元场景。在表粒度和列粒度上,研究人员可以评估模型在限定数据库分组内,从众多候选模式中召回相关表或列的能力。经典评测指标包括nDCG@10和recall@10,这直接反映了检索系统在有限上下文窗口下定位关键模式元素的性能优劣。
解决学术问题
该数据集精准解决了文本到SQL任务中一个长期被忽视的学术瓶颈:模式链接(schema linking)的检索前置问题。传统文本到SQL方法通常假设整个数据库模式能够完整放入模型上下文,但在实际大规模多库场景中这一假设往往失效。SQL-Schema-Retrieval首次提出将模式链接形式化为检索问题,并提供了涵盖学术、企业和大规模实时模式的系统化基准。它揭示了从纯文本到SQL准确率到检索召回能力之间的鸿沟,推动了学术界对模式感知检索机制的深入理解,并促使研究者重新审视大语言模型在结构化数据环境中的局限性。
衍生相关工作
该数据集衍生了一系列关于模式感知嵌入和检索增强生成(RAG)在结构化数据领域的重要工作。其开创性论文《Finding the Right Tables and Columns》提出了语料自适应嵌入方法,能够根据数据集的统计特性动态调整表与列的表征。后续工作进一步探索了基于对比学习的模式元素蒸馏、多模态融合的混合检索策略,以及将检索结果作为提示注入大语言模型以提升跨领域泛化能力。此外,该基准也被用作评估最新嵌入模型(如MTEB榜单中的BGE和E5系列)在结构化数据检索场景下的效果,成为文本到SQL预处理环节不可或缺的验证平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务