遇见数据集

sqlcopilot-data

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

SQL Copilot 提示包与原始模型生成数据集是 SQL Copilot 项目的中间产物,旨在通过测量而非主观偏好来选择数据库模式在提示中的表示方式。该数据集基于 Spider 1.0 数据集(CC BY-SA 4.0 许可证),包含从 Spider 数据库模式、问题以及采样的数据库值渲染而成的提示包,以及多个模型(如 Qwen2.5-Coder-1.5B/7B、OmniSQL-7B)对这些提示的原始生成结果。提示包涵盖五种格式:完整 DDL、紧凑格式、M-Schema 精简版、无值的 M-Schema 以及值增强型 DDL,每个格式均在一个固定的 200 项分层切片上渲染。数据集结构包括 bundles/ 目录下的 prompts.jsonl(渲染后的提示)和 manifest.json(包含序列化版本、提示模板哈希等元数据),以及 completions/ 目录下的模型原始输出 JSONL 文件。该数据集并非评测集或训练数据,而是用于分析提示格式对文本到 SQL 任务性能影响的工具。所有内容均基于 Apache-2.0 许可证的模型检查点生成,且原始模型输出未经过解析,确保可追溯性。

The SQL Copilot Prompt Package and Raw Model Generation Dataset is an intermediate artifact of the SQL Copilot project, designed to select the optimal representation of database schemas within prompts via quantitative measurement rather than subjective preferences. This dataset is built upon the Spider 1.0 dataset (licensed under CC BY-SA 4.0), and comprises prompt packages rendered from Spider database schemas, natural language questions, and sampled database values, alongside the raw generation outputs of these prompts from multiple models including Qwen2.5-Coder-1.5B/7B and OmniSQL-7B. The prompt packages cover five formats: Full DDL, Compact Format, M-Schema Lite, Value-free M-Schema, and Value-enhanced DDL, with each format rendered on a fixed stratified slice of 200 items. The dataset structure includes the bundles/ directory housing prompts.jsonl (rendered prompts) and manifest.json (metadata such as serialized version, prompt template hash, and other relevant details), as well as the completions/ directory containing the raw model output JSONL files. This dataset is neither a benchmark nor training data, but rather a tool for analyzing the impact of prompt formats on the performance of text-to-SQL tasks. All content is generated using model checkpoints licensed under the Apache-2.0 License, and the raw model outputs remain unparsed to ensure full traceability.

创建时间:
2026-08-03
原始信息汇总

SQL Copilot 数据集详情

数据集概述

名称:SQL Copilot — prompt bundles and raw model generations
许可协议:CC BY-SA 4.0
语言:英语(en)
任务类别:文本生成(text-generation)
标签:text-to-sql、spider、evaluation

数据集内容与用途

该数据集是 SQL Copilot 项目的中间工作产物,包含两部分核心内容:

  • 提示词包(prompt bundles):在 GPU 运行前渲染完成的提示词,每个提示词包含 Spider 数据库模式、问题以及从 Spider 数据库中采样的值。
  • 原始模型生成结果(raw model generations):模型对提示词生成的原始补全内容,完全保留模型输出未经过解析处理。

数据集并非基准测试集,而是用于评估五种不同的数据库模式提示格式(完整 DDL、紧凑格式、M-Schema-lite、无值 M-Schema、值增强 DDL)在固定 200 项分层切片上的效果。其作用是通过测量而非偏好来确定如何将数据库模式写入提示词,而非用于模型训练或排行榜发布。

数据来源与版权

数据集中的提示词包衍生自 Spider 1.0 数据集(CC BY-SA 4.0 许可),每个包都包含 Spider 数据库模式、问题和采样值,属于衍生作品,因此在相同许可下重新分发。模型生成结果由 Apache-2.0 许可的检查点(Qwen/Qwen2.5-Coder-{1.5B,7B}-Instructseeklhy/OmniSQL-7B)生成,每个运行记录中记录了固定版本。

文件结构与格式

数据集目录结构如下:

  • bundles/<name>/prompts.jsonl:每个(arm, item)对应一个渲染提示词
  • bundles/<name>/manifest.json:记录生成提示词的产品信息及固定哈希值
  • completions/<name>/*.jsonl:每个提示词对应的原始模型输出

manifest.json 包含序列化器版本、提示词模板 SHA、值采样策略版本、prompts.jsonl 的 SHA-256 以及渲染代码的 git SHA,确保可重现性。

隐私保护措施

采样入提示词的值经过预定义策略过滤:与 PII 相关的列名通过子串进行黑名单过滤,高基数和主要唯一列会被跳过,每次拒绝都会记录原因。Spider 数据库是合成数据,因此不涉及敏感信息。

非内容说明

  • 非评估集:问题和金标准 SQL 属于 Spider,请使用 Spider 进行评测
  • 非训练数据:策划的 SFT 数据是独立的工件,具有自己的 manifest
  • 非排行榜声明:由这些补全内容衍生的数值与生成它们的代码及来源标题文件一起保存
搜集汇总
数据集介绍
sqlcopilot-data 数据集图片
构建方式
在自然语言处理与数据库交叉领域,文本到SQL生成任务对模型性能的评估依赖于高质量的提示与生成数据。sqlcopilot-data数据集为此而生,其构建过程严谨且可复现:提示束从Spider 1.0数据集衍生,包含数据库模式、问题及采样值,并采用五种不同的模式描述格式(完整DDL、紧凑型、M-Schema精简版、无值M-Schema以及值增强DDL)进行渲染,每一束均附带清单文件,记录序列化器版本、提示模板哈希、采样策略版本及代码哈希,确保每一步骤的可验证性。原始生成结果由固定版本的模型在Kaggle T4×2上以贪婪解码方式产生,未经过任何解析处理,保证了数据的原始性与完整性。
特点
该数据集的核心特质在于其作为传输工具有别于基准或训练集,强调提示的多样化与生成的可复现性。其特色在于,五种提示格式针对同一固定的200条分层样本进行渲染,旨在通过实验测量而非主观偏好来选择最佳模式呈现方式。每个提示束携带丰富元数据,包括生成代码的Git哈希,确保任何偏差都能被追溯。此外,隐私保护策略被内建:对可能涉及个人身份的列名进行黑名单过滤,跳过基数高或接近唯一的列,并记录每次拒绝的原因,展现了构建者在数据伦理上的审慎态度。模型生成部分源自Apache-2.0许可的检查点,遵循原始许可,继承CC BY-SA 4.0,体现了开源精神的传承。
使用方法
使用本数据集时,研究者应首先查阅bundles目录下的manifest.json以核验数据束的完整性,该文件记录了关于生成环境与版本的详细信息。随后,可通过加载prompts.jsonl文件获取渲染后的提示,以及从completions目录读取与各提示对应的原始模型输出。值得注意的是,本数据集不适宜直接作为评估集或训练集,其原始生成内容需自行进行SQL提取与执行评分。对于需要高效利用GPU预算的团队,该数据集提供了一种在笔记本电脑端离线渲染、在GPU端生成、再回到本地处理的模式,有助于减少可重复性Bug带来的时间成本。所有使用行为需遵循CC BY-SA 4.0许可,并需注明对Spider数据集的署名。
背景与挑战
背景概述
随着自然语言处理与数据库交互的深度融合,文本到SQL(Text-to-SQL)任务成为智能数据查询的关键技术,其性能评估依赖于高质量数据集。在此背景下,SQL Copilot项目于2025年前后由致力于提升SQL生成鲁棒性的研究团队构建了sqlcopilot-data数据集。该数据集由Spider 1.0衍生而来,旨在通过系统比较不同数据库模式表示格式(如完整DDL、紧凑格式、M-Schema等)对模型生成性能的影响,以实证方式取代主观偏好。其核心研究问题在于如何优化提示构建策略,提升模型在复杂跨域查询上的准确性与稳定性。作为项目的中转工件,该数据集承载了精确的提示束与原始模型输出,强调可复现性与许可证合规性,对提示工程与模型评估领域具有方法论层面的参考价值,为后续研究提供了可审计的基准流程。
当前挑战
该数据集所应对的挑战源于Text-to-SQL领域固有的复杂性,包括跨域模式泛化、语义歧义消解及多样化查询结构的准确转换,这些均对模型与提示构造提出严苛要求。此外,构建过程面临多重实际操作困境:其一,受限于Kaggle免费GPU环境的API缺失,模型推理无法命令行启动,导致任务调度需人工介入,迫使工作流严格分段,以确保确定性步骤与GPU执行的可分离性;其二,模型原始输出需未经任何解析直接保存,以避免因提取错误引发昂贵的重解析,从而优化有限的GPU小时预算;其三,数据集的派生性质强制继承CC BY-SA 4.0许可,要求作者审慎管理衍生品的合规性与版权归属;其四,数据采样需执行严格的隐私过滤策略,以防敏感信息泄露,尽管源数据为合成,仍需预设防护机制。这些挑战共同塑造了数据集的设计逻辑与工程实施。
常用场景
经典使用场景
sqlcopilot-data数据集的核心用途在于为Text-to-SQL任务提供高度可复现的提示词模板与原始模型生成结果。其设计初衷是作为研究中间产物,使研究者能够在不依赖特定GPU环境的情况下,对模型输入输出进行精细分析。该数据集在经典使用场景中扮演着实验脚手架的角色,支持对Spider基准测试上的不同数据库模式表示进行受控比较。通过严格记录提示词渲染管线、模型版本及生成参数,它成为验证文本到SQL模型鲁棒性和可重复性的关键工具。研究者可利用这些数据快速定位提取错误或生成偏差,从而将宝贵计算资源集中于模型优化而非调试流程。
衍生相关工作
该数据集衍生了一系列相关工作。它直接支持了关于提示词工程对Text-to-SQL性能影响的深入研究,例如探索数据库模式表示法的变换如何影响模型在跨域泛化上的表现。此外,它与Spider基准的紧密关联催生了对模型生成结果进行细粒度错误分析的扩展研究,促进了针对提示词注入、值泄露等问题的探究。数据集所体现的可复现性实践与严格的内容追溯机制,也为后续发布的交互式评估工具集、模型生成日志标准化格式等领域奠定了基础。其许可模式与共享理念鼓励了社区在共享算法、prompt模板及生成日志方面的合作,推动了Text-to-SQL领域透明度与协作精神的进程。
数据集最近研究
最新研究方向
在文本到SQL转换的前沿探索中,数据集sqlcopilot-data聚焦于通过精准的提示设计与模型生成的原始输出,系统评估不同数据库模式表示对SQL生成质量的影响。该数据集基于Spider基准构建,遵循CC BY-SA 4.0许可,为跨领域复杂语义解析提供了可复现的实体设定。其核心创新在于将生成过程解耦为可验证的提示渲染与原始解码,从而支持对模式紧凑性、M-Schema变体及值增强DDL等策略的量化对比,推动了LLM在数据库交互中的透明化与可靠性研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务