遇见数据集

rupal02/text2sql

收藏
Hugging Face2026-04-08 更新2026-04-12 收录
官方服务:

资源简介:

--- license: apache-2.0 task_categories: - text-to-sql language: - en tags: - text2sql - sft - fine-tuning size_categories: - 100K<n<1M --- # Text2SQL SFT Dataset This dataset is a combined and cleaned version of Spider, BIRD, and Gretel datasets, formatted specifically for Instruction Fine-Tuning of Small Language Models (SLMs). ## Dataset Structure Each record contains: - **instruction**: The task description. - **input**: The Database Schema and the Natural Language Question. - **output**: The canonicalized SQL query. - **metadata**: A dictionary containing `dataset` source and `db_id`. ## Usage ```python from datasets import load_dataset dataset = load_dataset("anuj6316/text2sql") ```

许可证:Apache-2.0 任务类别:文本转SQL(text-to-sql) 语言:英语 标签:text2sql、监督微调(Supervised Fine-Tuning,SFT)、微调(fine-tuning) 数据规模:100K < n < 1M # 文本转SQL监督微调数据集 本数据集为Spider、BIRD与Gretel三个数据集的合并清洗版本,专门针对小语言模型(Small Language Models,SLMs)的指令微调(Instruction Fine-Tuning)任务进行格式优化。 ## 数据集结构 每条数据记录包含以下字段: - **指令(instruction)**:任务描述 - **输入(input)**:数据库模式与自然语言问题 - **输出(output)**:规范化SQL查询语句 - **元数据(metadata)**:包含数据集来源(`dataset`)与数据库ID(`db_id`)的字典 ## 使用方法 python from datasets import load_dataset dataset = load_dataset("anuj6316/text2sql")

提供机构:
rupal02
二维码
社区交流群
二维码
科研交流群
商业服务