遇见数据集

goendalf666/sql-context-instructions

收藏
Hugging Face2023-07-01 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: phase dtype: int32 - name: question dtype: string - name: sql struct: - name: agg dtype: int64 - name: conds struct: - name: column_index sequence: int32 - name: condition sequence: string - name: operator_index sequence: int32 - name: human_readable dtype: string - name: sel dtype: int64 - name: header sequence: string - name: page_title dtype: string - name: page_id dtype: string - name: types sequence: string - name: id dtype: string - name: section_title dtype: string - name: caption dtype: string - name: rows sequence: sequence: string - name: name dtype: string - name: human_readable dtype: string - name: sel dtype: int64 - name: agg dtype: int64 - name: conds struct: - name: column_index sequence: int32 - name: condition sequence: string - name: operator_index sequence: int32 - name: sql_table dtype: string - name: sql_alpaca_format_one_table dtype: string - name: sql_alpaca_format dtype: string - name: __index_level_0__ dtype: int64 splits: - name: train num_bytes: 212908519 num_examples: 52305 download_size: 52888459 dataset_size: 212908519 --- # Dataset Card for "sql-context-instructions" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征字段: - 字段名:phase,数据类型:int32 - 字段名:question,数据类型:字符串 - 字段名:sql(结构化SQL): - 字段名:agg,数据类型:int64 - 字段名:conds(结构化查询条件): - 字段名:column_index(列索引),序列类型:int32 - 字段名:condition(条件值),序列类型:字符串 - 字段名:operator_index(操作符索引),序列类型:int32 - 字段名:human_readable(人类可读SQL描述),数据类型:字符串 - 字段名:sel(选中列索引),数据类型:int64 - 字段名:header(表头),序列类型:字符串 - 字段名:page_title(页面标题),数据类型:字符串 - 字段名:page_id(页面ID),数据类型:字符串 - 字段名:types(列数据类型),序列类型:字符串 - 字段名:id(数据样本ID),数据类型:字符串 - 字段名:section_title(章节标题),数据类型:字符串 - 字段名:caption(表格说明),数据类型:字符串 - 字段名:rows(数据行):序列类型为二维字符串序列 - 字段名:name(表名/数据集标识),数据类型:字符串 - 字段名:human_readable(人类可读描述),数据类型:字符串 - 字段名:sel(选中列索引),数据类型:int64 - 字段名:agg(聚合操作索引),数据类型:int64 - 字段名:conds(结构化查询条件): - 字段名:column_index(列索引),序列类型:int32 - 字段名:condition(条件值),序列类型:字符串 - 字段名:operator_index(操作符索引),序列类型:int32 - 字段名:sql_table(SQL表名),数据类型:字符串 - 字段名:sql_alpaca_format_one_table(单表SQL Alpaca 格式提示文本),数据类型:字符串 - 字段名:sql_alpaca_format(SQL Alpaca 格式提示文本),数据类型:字符串 - 字段名:__index_level_0__(索引层级0),数据类型:int64 数据集划分: - 划分名称:train(训练集),字节大小:212908519,样本数量:52305 下载大小:52888459 数据集总大小:212908519 --- # 数据集卡片:"sql-context-instructions" [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
goendalf666
原始信息汇总

数据集概述

数据集特征

  • phase: 数据类型为 int32。
  • question: 数据类型为 string。
  • sql: 结构化数据类型,包含以下子特征:
    • agg: 数据类型为 int64。
    • conds: 结构化数据类型,包含以下子特征:
      • column_index: 序列类型,数据类型为 int32。
      • condition: 序列类型,数据类型为 string。
      • operator_index: 序列类型,数据类型为 int32。
    • human_readable: 数据类型为 string。
    • sel: 数据类型为 int64。
  • header: 序列类型,数据类型为 string。
  • page_title: 数据类型为 string。
  • page_id: 数据类型为 string。
  • types: 序列类型,数据类型为 string。
  • id: 数据类型为 string。
  • section_title: 数据类型为 string。
  • caption: 数据类型为 string。
  • rows: 序列类型,包含序列类型,数据类型为 string。
  • name: 数据类型为 string。
  • human_readable: 数据类型为 string。
  • sel: 数据类型为 int64。
  • agg: 数据类型为 int64。
  • conds: 结构化数据类型,包含以下子特征:
    • column_index: 序列类型,数据类型为 int32。
    • condition: 序列类型,数据类型为 string。
    • operator_index: 序列类型,数据类型为 int32。
  • sql_table: 数据类型为 string。
  • sql_alpaca_format_one_table: 数据类型为 string。
  • sql_alpaca_format: 数据类型为 string。
  • index_level_0: 数据类型为 int64。

数据集分割

  • train: 数据集大小为 212908519 字节,包含 52305 个示例。

数据集大小

  • 下载大小: 52888459 字节。
  • 数据集大小: 212908519 字节。
搜集汇总
数据集介绍
goendalf666/sql-context-instructions 数据集图片
构建方式
在自然语言处理与数据库交汇的领域中,结构化查询语言(SQL)的语义理解一直是研究热点。goendalf666/sql-context-instructions数据集的构建,旨在弥合自然语言问题与SQL查询之间的鸿沟。该数据集源自对维基百科表格数据的深度挖掘,通过将表格上下文、表头信息、行数据及标题等结构化元素与自然语言问题配对,形成丰富的训练样本。构建过程中,每个样本不仅包含原始的自然语言问题,还精心设计了对应的SQL查询结构,包括聚合函数、选择列、条件子句等组件,并以人类可读的SQL语句形式呈现。此外,数据还提供了Alpaca格式的指令微调版本,便于直接用于序列到序列模型的训练。整个数据集包含52,305个训练样本,覆盖多种表格类型与查询复杂度,为模型学习从上下文到SQL的映射提供了坚实基础。
使用方法
在使用该数据集时,研究者可将其作为监督学习任务的数据源,专注于从自然语言问题与表格上下文生成SQL查询。典型应用场景包括微调预训练语言模型以执行文本到SQL的转换。数据集的加载可通过HuggingFace Datasets库轻松实现,利用load_dataset函数直接获取训练拆分。每个样本的字段如question、sql(含human_readable子字段)、header、rows等可直接用于构建输入序列。对于需要指令微调的流程,sql_alpaca_format字段提供了格式化后的文本,可直接作为模型输入。建议将表格上下文与问题拼接作为编码器输入,以结构化的SQL表示或纯文本SQL作为解码目标。此外,数据集中丰富的条件与聚合标注允许研究者探索细粒度的SQL解析任务,或用于评估模型在复杂多条件查询上的泛化能力。
背景与挑战
背景概述
在自然语言处理与数据库交互的交叉领域,将非结构化的人类语言精准转化为结构化查询语言(SQL)始终是语义解析研究的核心命题。goendalf666/sql-context-instructions数据集由研究人员于近年创建,旨在弥合复杂表格语境与自然语言查询之间的鸿沟。该数据集整合了维基百科页面中的表格数据、标题及描述性文本,构建了超过五万条覆盖多领域知识的训练样本,其核心研究问题聚焦于提升模型在真实世界表格环境中理解上下文并生成准确SQL语句的能力。通过提供包含表头、行数据、页面标题等丰富元信息的结构化输入,该数据集为开发更具鲁棒性的文本到SQL系统奠定了重要基础,对推动智能问答、数据分析自动化等应用具有显著影响力。
当前挑战
当前该数据集面临的核心挑战在于处理表格语境与自然语言查询之间的语义复杂性。首先,真实表格数据常包含歧义列名、缺失值或非标准化格式,导致模型难以精准映射查询意图到具体列操作,例如区分同义词列或处理跨表关联查询。其次,构建过程中需确保SQL标注的绝对准确性,但人工生成的多条件查询(如嵌套WHERE子句与聚合函数组合)极易引入逻辑错误,而自动校验机制尚不完善,这限制了数据集的规模扩展与质量保障。此外,如何有效利用页面标题、章节标题等上下文信息来消解查询中的指代模糊性,仍是提升模型泛化能力的关键技术瓶颈。
常用场景
经典使用场景
该数据集以自然语言问题与结构化SQL查询的配对为核心,构建了涵盖多表关联、聚合操作与条件过滤的复杂查询场景。其经典用途在于训练和评估文本到SQL(Text-to-SQL)模型,通过提供表格上下文、列类型及标题信息,使模型能够学习从非结构化问题中精准解析语义,并生成符合数据库模式的正确SQL语句。这一应用场景在语义解析与数据库交互领域具有里程碑意义,为提升人机协作效率奠定了数据基础。
解决学术问题
在学术研究中,该数据集主要解决了跨领域自然语言接口的泛化性难题。传统模型常因缺乏多样化的表格结构与查询逻辑而陷入过拟合,而该数据集通过引入多表联合、条件嵌套及聚合函数等复杂模式,显著提升了模型对未见数据库的适应能力。其意义在于推动了语义解析从简单单表查询向复杂多表推理的跨越,为构建可迁移的通用查询系统提供了关键基准,并深刻影响了跨模态语义对齐与结构化知识抽取的研究方向。
实际应用
在实际应用中,该数据集赋能了商业智能与数据查询的民主化进程。例如,非技术用户可通过自然语言直接向企业数据库提问,系统自动生成SQL并返回分析结果,大幅降低了数据获取门槛。此外,在智能客服、教育问答和自动化报表生成等领域,该数据集支撑的模型能够实时解析用户意图,从海量表格中提取精准信息,显著提升了决策支持系统的响应速度与准确性。
数据集最近研究
最新研究方向
随着大语言模型在自然语言处理领域的迅猛发展,将非结构化文本精准转化为可执行的结构化查询语句成为研究热点。sql-context-instructions数据集应运而生,其核心价值在于构建了包含表格上下文、自然语言问题与对应SQL语句的指令微调样本,为模型在复杂表格数据上的语义解析能力提供了关键训练资源。当前前沿方向聚焦于利用该数据集提升模型对多表关联、聚合函数及条件筛选的泛化理解,尤其在WikiSQL等经典基准测试之外,探索更贴近真实业务场景的零样本与少样本SQL生成。该数据集的发布推动了Text-to-SQL任务从静态模板向动态上下文感知的演进,为智能数据分析、自动化报表生成等应用奠定了数据基础,具有显著的学术与工业双重意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务