遇见数据集

lmqg/qa_squadshifts_synthetic

收藏
Hugging Face2023-01-15 更新2024-03-04 收录
官方服务:

资源简介:

--- license: cc-by-4.0 pretty_name: Synthetic QA dataset on SQuADShifts. language: en multilinguality: monolingual size_categories: 10K<n<100K source_datasets: - extended|wikipedia task_categories: - question-answering task_ids: - extractive-qa --- # Dataset Card for "lmqg/qa_squadshifts_synthetic" ## Dataset Description - **Repository:** [https://github.com/asahi417/lm-question-generation](https://github.com/asahi417/lm-question-generation) - **Paper:** [https://arxiv.org/abs/2210.03992](https://arxiv.org/abs/2210.03992) - **Point of Contact:** [Asahi Ushio](http://asahiushio.com/) ### Dataset Summary This is a synthetic QA dataset generated with fine-tuned QG models over [`lmqg/qa_squadshifts`](https://huggingface.co/datasets/lmqg/qa_squadshifts), made for question-answering based evaluation (QAE) for question generation model proposed by [Zhang and Bansal, 2019](https://aclanthology.org/D19-1253/). The test split is the original validation set of [`lmqg/qa_squadshifts`](https://huggingface.co/datasets/lmqg/qa_squadshifts), where the model should be evaluate on. ### Supported Tasks and Leaderboards * `question-answering` ### Languages English (en) ## Dataset Structure ### Data Fields The data fields are the same among all splits. #### plain_text - `id`: a `string` feature of id - `title`: a `string` feature of title of the paragraph - `context`: a `string` feature of paragraph - `question`: a `string` feature of question - `answers`: a `json` feature of answers ### Data Splits TBA ## Citation Information ``` @inproceedings{ushio-etal-2022-generative, title = "{G}enerative {L}anguage {M}odels for {P}aragraph-{L}evel {Q}uestion {G}eneration", author = "Ushio, Asahi and Alva-Manchego, Fernando and Camacho-Collados, Jose", booktitle = "Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing", month = dec, year = "2022", address = "Abu Dhabi, U.A.E.", publisher = "Association for Computational Linguistics", } ```

--- 许可证:CC BY 4.0 规范名称:基于SQuADShifts的合成问答(QA)数据集 语言:英语 多语言属性:单语种 规模区间:1万至10万条数据 源数据集: - 扩展维基百科数据集 任务类别: - 问答(Question Answering) 任务子类型: - 抽取式问答(Extractive QA) --- # 「lmqg/qa_squadshifts_synthetic」数据集卡片 ## 数据集描述 - **仓库地址**:[https://github.com/asahi417/lm-question-generation](https://github.com/asahi417/lm-question-generation) - **论文地址**:[https://arxiv.org/abs/2210.03992](https://arxiv.org/abs/2210.03992) - **联络人**:[Asahi Ushio](http://asahiushio.com/) ### 数据集概述 本数据集基于 [`lmqg/qa_squadshifts`](https://huggingface.co/datasets/lmqg/qa_squadshifts) 微调后的问答生成(Question Generation, QG)模型生成,专为Zhang与Bansal于2019年提出的问答生成模型的基于问答的评估(Question-Answering based Evaluation, QAE)任务打造。 该数据集的测试划分集即为 [`lmqg/qa_squadshifts`](https://huggingface.co/datasets/lmqg/qa_squadshifts) 的原始验证集,模型应在此划分集上完成评估。 ### 支持任务与排行榜 * `问答(Question Answering)` ### 语言 英语(en) ## 数据集结构 ### 数据字段 所有数据划分的字段格式均保持一致。 #### 纯文本字段 - `id`:字符串类型的数据集唯一标识 - `title`:字符串类型的段落标题 - `context`:字符串类型的段落正文 - `question`:字符串类型的问题文本 - `answers`:存储答案的JSON格式字段 ### 数据划分 待公布 ## 引用信息 @inproceedings{ushio-etal-2022-generative, title = "{G}enerative {L}anguage {M}odels for {P}aragraph-{L}evel {Q}uestion {G}eneration", author = "Ushio, Asahi and Alva-Manchego, Fernando and Camacho-Collados, Jose", booktitle = "Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing", month = dec, year = "2022", address = "Abu Dhabi, U.A.E.", publisher = "Association for Computational Linguistics", }

提供机构:
lmqg
原始信息汇总

数据集概述

基本信息

  • 名称: Synthetic QA dataset on SQuADShifts
  • 许可证: cc-by-4.0
  • 语言: 英语 (en)
  • 多语言性: 单语种
  • 规模: 10K<n<100K

数据来源

  • 源数据集: 扩展自wikipedia

任务类型

  • 任务类别: 问答
  • 任务ID: extractive-qa

数据集结构

  • 数据字段:
    • id: 字符串类型,标识符
    • title: 字符串类型,段落标题
    • context: 字符串类型,段落内容
    • question: 字符串类型,问题
    • answers: JSON格式,答案

数据分割

  • 分割详情: 待定 (TBA)

引用信息

@inproceedings{ushio-etal-2022-generative, title = "{G}enerative {L}anguage {M}odels for {P}aragraph-{L}evel {Q}uestion {G}eneration", author = "Ushio, Asahi and Alva-Manchego, Fernando and Camacho-Collados, Jose", booktitle = "Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing", month = dec, year = "2022", address = "Abu Dhabi, U.A.E.", publisher = "Association for Computational Linguistics", }

搜集汇总
数据集介绍
构建方式
在自然语言处理领域,问答系统的鲁棒性评估至关重要,而高质量合成数据集的构建为此提供了关键支撑。该数据集基于lmqg/qa_squadshifts原始数据,利用经过微调的问题生成模型,采用Zhang和Bansal(2019)提出的基于问答评估方法,通过合成方式生成问题-答案对。具体而言,模型以原始数据集中的段落为上下文,自动生成对应问题,并保留原始答案字段,从而构建出规模介于1万至10万样本之间的合成问答数据集。测试集沿用原始验证集,确保评估的公平性与可比性。
特点
该数据集的核心特点在于其合成性与评估导向性。作为专为问题生成模型评估而设计的资源,它通过自动化生成流程,在保留原始段落与答案结构的基础上,实现了问题多样性的扩展。数据字段包含标识符、标题、段落、问题及答案,其中答案以JSON格式存储,便于灵活解析。语言为英文单语,来源为维基百科,确保了背景知识的丰富性与权威性。此外,数据集采用CC-BY-4.0许可,支持广泛的研究与再分发。
使用方法
该数据集主要用于基于问答的问题生成模型性能评估。用户可将其加载至Hugging Face的datasets库中,通过标准接口访问训练、验证与测试分片。推荐将测试集作为基准,利用问答任务指标(如精确匹配和F1分数)衡量模型生成问题的质量。具体使用时,需解析answers字段中的JSON结构以获取答案文本,并配合context字段进行上下文关联。研究者亦可结合原始squadshifts数据集进行对比实验,以验证合成数据的有效性。
背景与挑战
背景概述
在自然语言处理领域,问题生成与问答系统的协同发展已成为提升机器阅读理解能力的关键路径。由Asahi Ushio等人于2022年创建的lmqg/qa_squadshifts_synthetic数据集,源自其发表于EMNLP 2022的生成式语言模型研究,旨在为基于问答评估的问题生成模型提供标准化测试基准。该数据集基于SQuADShifts原始语料,通过微调的问题生成模型合成构建,聚焦于抽取式问答任务,其核心研究问题在于评估生成式语言模型在段落层面生成高质量问题的能力。作为cc-by-4.0许可下的英文单语数据集,其规模介于1万至10万样本之间,依托维基百科的广泛知识源,为领域内模型鲁棒性与泛化性的对比提供了重要支撑,对推动问答系统与问题生成技术的交叉研究产生了显著影响。
当前挑战
该数据集所解决的领域挑战主要源于自然语言分布偏移对问答系统性能的侵蚀。在现实应用中,问答模型常因训练与测试数据在主题、句式或上下文上的分布差异而性能骤降,SQuADShifts系列数据集正是为了量化这种脆弱性而设计,而lmqg/qa_squadshifts_synthetic则进一步要求模型在合成生成的多样化问题下保持稳定表现。构建过程中,挑战集中于问题生成模型的质量控制:如何确保合成问题既忠实于原始上下文又具备语义多样性,同时避免引入噪声或伪影干扰评估。此外,数据集的规模与平衡性亦需审慎考量,以保证测试集能有效反映模型在不同偏移场景下的真实能力差异。
常用场景
经典使用场景
该数据集作为合成问答数据集,由微调的问题生成模型在SQuADShifts数据基础上生成,广泛应用于评估和验证抽取式问答系统的鲁棒性与泛化能力。其经典使用场景聚焦于跨领域分布偏移条件下的问答性能测试,通过引入合成变体来模拟真实世界中文本表述多样性的挑战,从而为模型在未见数据上的表现提供可量化的基准。研究者常借助此数据集对预训练语言模型进行压力测试,以揭示其在上下文语义漂移时的脆弱性,并推动更稳健的问答架构设计。
衍生相关工作
该数据集衍生了一系列关于问题生成与问答联合优化的经典工作,例如Ushio等人提出的段落级问题生成方法,其通过生成式语言模型实现上下文感知的合成样本构造,为后续研究奠定了基础。在此基础上,学术界进一步发展了基于对比学习的分布偏移检测技术,以及融合数据增强策略的问答训练框架,显著提升了模型在低资源场景下的泛化能力。这些衍生工作不仅深化了对问答系统失效模式的理解,还催生了诸如SQuADShifts变体等基准数据集,形成了从评估到改进的闭环研究链条。
数据集最近研究
最新研究方向
在自然语言处理领域,随着生成式语言模型在段落级问题生成中的突破性进展,lmqg/qa_squadshifts_synthetic数据集应运而生,聚焦于利用微调的问题生成模型构建合成问答数据,以应对真实场景中标注数据稀缺的挑战。该数据集与SQuADShifts紧密关联,旨在评估模型在分布偏移下的泛化能力,当前前沿方向集中于结合对比学习与对抗训练,提升问答系统对领域漂移的鲁棒性。此外,围绕大语言模型在零样本和少样本场景下的迁移表现,该数据集成为验证生成式预训练模型能否有效捕捉上下文语义的关键基准,其合成数据的可控性为探索知识蒸馏与数据增强策略提供了新路径,对推动低资源问答系统的实际部署具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务