遇见数据集

jellyChiru/SParC

收藏
Hugging Face2023-04-17 更新2024-05-25 收录
官方服务:

资源简介:

--- license: cc-by-sa-4.0 --- @InProceedings{Yu&al.19, title = {SParC: Cross-Domain Semantic Parsing in Context}, author = {Tao Yu and Rui Zhang and Michihiro Yasunaga and Yi Chern Tan and Xi Victoria Lin and Suyi Li and Heyang Er, Irene Li and Bo Pang and Tao Chen and Emily Ji and Shreya Dixit and David Proctor and Sungrok Shim and Jonathan Kraft, Vincent Zhang and Caiming Xiong and Richard Socher and Dragomir Radev}, booktitle = {Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics}, year = {2019}, address = {Florence, Italy}, publisher = {Association for Computational Linguistics} } @inproceedings{Yu&al.18c, title = {Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task}, author = {Tao Yu and Rui Zhang and Kai Yang and Michihiro Yasunaga and Dongxu Wang and Zifan Li and James Ma and Irene Li and Qingning Yao and Shanelle Roman and Zilin Zhang and Dragomir Radev} booktitle = "Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing", address = "Brussels, Belgium", publisher = "Association for Computational Linguistics", year = 2018 } Reference links SParC task link: https://yale-lily.github.io/sparc SParC Github page: https://github.com/taoyds/sparc Spider task link: https://yale-lily.github.io/spider Spider Github page: https://github.com/taoyds/spider

--- 许可证:知识共享署名-相同方式共享4.0(CC BY-SA 4.0) --- @InProceedings{Yu&al.19, title = {SParC:上下文跨领域语义解析}, author = {Tao Yu and Rui Zhang and Michihiro Yasunaga and Yi Chern Tan and Xi Victoria Lin and Suyi Li and Heyang Er, Irene Li and Bo Pang and Tao Chen and Emily Ji and Shreya Dixit and David Proctor and Sungrok Shim and Jonathan Kraft, Vincent Zhang and Caiming Xiong and Richard Socher and Dragomir Radev}, booktitle = {第57届国际计算语言学协会(Association for Computational Linguistics)年会论文集}, year = {2019}, address = {意大利佛罗伦萨}, publisher = {国际计算语言学协会} } @inproceedings{Yu&al.18c, title = {Spider:面向复杂跨领域语义解析与文本到SQL(Text-to-SQL)任务的大规模人工标注数据集}, author = {Tao Yu and Rui Zhang and Kai Yang and Michihiro Yasunaga and Dongxu Wang and Zifan Li and James Ma and Irene Li and Qingning Yao and Shanelle Roman and Zilin Zhang and Dragomir Radev} booktitle = {2018年经验方法自然语言处理会议论文集}, address = {比利时布鲁塞尔}, publisher = {国际计算语言学协会}, year = {2018} } 参考链接 SParC任务页面:https://yale-lily.github.io/sparc SParC GitHub仓库页面:https://github.com/taoyds/sparc Spider任务页面:https://yale-lily.github.io/spider Spider GitHub仓库页面:https://github.com/taoyds/spider

提供机构:
jellyChiru
原始信息汇总

数据集概述

SParC数据集

  • 标题: SParC: Cross-Domain Semantic Parsing in Context
  • 作者: Tao Yu, Rui Zhang, Michihiro Yasunaga, Yi Chern Tan, Xi Victoria Lin, Suyi Li, Heyang Er, Irene Li, Bo Pang, Tao Chen, Emily Ji, Shreya Dixit, David Proctor, Sungrok Shim, Jonathan Kraft, Vincent Zhang, Caiming Xiong, Richard Socher, Dragomir Radev
  • 出版信息:
    • 会议: Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics
    • 年份: 2019
    • 地点: Florence, Italy
    • 出版社: Association for Computational Linguistics

Spider数据集

  • 标题: Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task
  • 作者: Tao Yu, Rui Zhang, Kai Yang, Michihiro Yasunaga, Dongxu Wang, Zifan Li, James Ma, Irene Li, Qingning Yao, Shanelle Roman, Zilin Zhang, Dragomir Radev
  • 出版信息:
    • 会议: Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing
    • 年份: 2018
    • 地点: Brussels, Belgium
    • 出版社: Association for Computational Linguistics
搜集汇总
数据集介绍
构建方式
SParC数据集是由耶鲁大学LILY实验室联合多家研究机构共同构建的跨领域上下文语义解析基准。该数据集以Spider为基础,通过人工标注的方式扩展了对话式文本到SQL任务,涵盖了多个领域的数据库查询场景。构建过程遵循严格的标注规范,确保每个上下文相关的自然语言问题对应正确的SQL查询语句,并包含多轮交互中的语义演化信息。
特点
SParC数据集的核心特点在于其跨领域与上下文依赖性,覆盖了200多个复杂数据库及数千条多轮对话查询。数据集中每个问题均与先前的对话历史紧密关联,要求模型具备理解上下文并生成准确SQL的能力。此外,该数据集提供了细粒度的难度划分,从简单查询到嵌套子查询,全面评估语义解析模型的泛化性能。
使用方法
SParC数据集适用于训练和评估对话式语义解析模型,特别是跨领域上下文敏感的文本到SQL系统。研究人员可直接使用HuggingFace上的预划分训练集、验证集和测试集,通过加载JSON格式的对话序列与对应SQL标签进行模型微调。推荐结合Spider数据集进行联合训练,以增强模型对单轮与多轮查询的兼容性,并利用官方评估脚本计算精确匹配准确率。
背景与挑战
背景概述
SParC(Cross-Domain Semantic Parsing in Context)数据集由耶鲁大学Tao Yu团队于2019年提出,旨在推动跨领域上下文语义解析研究。该数据集基于Spider框架构建,收录了约4,298条多轮对话形式的自然语言查询及其对应的SQL标注,覆盖138个独立领域。作为首个面向上下文关联的跨领域语义解析基准,SParC填补了多轮交互场景下结构化查询语言生成的数据空白,为对话式数据库查询系统的发展提供了关键支撑。其发布直接催生了后续CoSQL等数据集的涌现,并在ACL 2019等顶级会议中成为评估模型上下文理解能力的重要标杆,显著推动了自然语言处理与数据库交互领域的交叉融合。
当前挑战
SParC数据集面临的核心挑战在于多轮对话中的语义消歧与历史依赖建模。领域问题层面,模型需在跨领域场景中准确解析省略、指代修正及上下文延续等复杂语言现象,这对传统单轮语义解析架构构成根本性挑战。构建过程中,研究者需人工设计跨越138个领域的对话流程,确保每轮查询与历史交互的逻辑连贯性,同时维护SQL标注的跨领域一致性。此外,如何平衡对话的自然性与查询的精确性、避免领域偏移导致的性能衰减,以及设计可泛化的上下文编码策略,仍是当前制约模型在真实对话式数据库查询系统中落地的关键瓶颈。
常用场景
经典使用场景
SParC数据集是跨领域上下文语义解析领域的标志性资源,专为多轮交互式文本到SQL任务设计。其经典使用场景聚焦于模拟真实用户与数据库进行多轮对话以完成复杂查询的过程,例如在旅游预订、学术数据库检索等跨领域场景中,模型需结合历史对话状态解析用户递增或修正的查询意图,并生成精准的SQL语句。该数据集包含约4,300个多轮对话及12,000余条带注释的SQL查询,覆盖138个独立领域,为评估模型在上下文依赖、领域迁移及错误恢复等挑战性场景下的鲁棒性提供了标准化基准。
衍生相关工作
SParC数据集催生了大量经典后续研究,最典型包括基于其框架扩展的CoSQL数据集(引入交互式反馈机制)和Sparc-to-SQL任务的多种基线模型优化工作。其中,微软研究院提出的EditSQL模型通过显式维护对话状态并利用门控机制修正历史预测,在SParC上取得了突破性表现;而IBM的RAT-SQL模型则通过关系感知的图注意力网络强化了模式链接与上下文对齐能力。此外,该数据集还与Spider、WikiSQL等共同构成了跨领域语义解析的黄金基准,推动了如T5-Picard等预训练模型在该任务上的应用。这些衍生工作不仅深化了对多轮语义交互的理解,还促进了自然语言接口在数据库系统中的工业化落地。
数据集最近研究
最新研究方向
在自然语言处理领域,跨领域上下文语义解析是构建智能数据库交互系统的核心挑战之一。SParC数据集作为Spider的上下文扩展版本,聚焦于多轮对话场景下的Text-to-SQL任务,其研究前沿正围绕动态语境建模与跨领域泛化能力展开。近期热点包括利用预训练语言模型(如T5、GPT系列)进行序列到序列的上下文感知解析,以及引入强化学习或对比学习策略以增强模型对用户意图演变的追踪能力。该数据集的重要意义在于推动了从单句查询到多轮交互的范式转变,为构建更接近真实人机对话的数据库查询助手提供了关键基准,同时其跨领域设计促进了模型在未见数据库上的鲁棒性研究,对工业级智能客服与数据分析工具的研发具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务