projecte-aina/viquiquad
收藏官方服务:
资源简介:
ViquiQuAD是一个从加泰罗尼亚维基百科中提取的提取式问答数据集。该数据集包含从597篇高质量原创文章中提取的3111个上下文片段,每个片段有1到5个问题及其答案。数据集可用于微调和评估提取式问答和语言模型。
ViquiQuAD is an extractive question answering (QA) dataset extracted from the Catalan Wikipedia. This dataset contains 3,111 context segments extracted from 597 high-quality original articles, with each segment paired with 1 to 5 questions and their corresponding answers. This dataset can be used for fine-tuning and evaluating extractive QA systems and language models.
提供机构:
projecte-aina原始信息汇总
数据集概述
数据集名称: ViquiQuAD
数据集类型: 抽取式问答(Extractive QA)
语言: 加泰罗尼亚语(ca)
许可证: CC-BY-SA-4.0
数据集大小: 10K<n<100K
数据来源: 原始数据,来源于加泰罗尼亚语维基百科
任务类别: 问答
数据集详细信息
数据集摘要
ViquiQuAD是一个专为加泰罗尼亚语设计的抽取式问答数据集,数据来源于加泰罗尼亚语维基百科。该数据集包含从597篇高质量原始文章中提取的3111个上下文,每个上下文对应1至5个问题及其答案。这些文章均使用CC-by-sa许可证。
支持的任务和排行榜
- 抽取式问答(Extractive-QA)
- 语言模型(Language Model)
数据集结构
- 数据实例: 每个实例包含唯一ID、文章标题、上下文、问题及答案。
- 数据字段: 包括ID、标题、上下文、问题和答案列表,其中答案列表包含文本和起始偏移量。
- 数据分割: 训练集11259例,开发集1493例,测试集1428例。
数据集创建
- 数据收集与规范化: 数据来源于随机选择的597篇加泰罗尼亚语维基百科文章,从中提取了3111个上下文,并为每个上下文创建了1至5个问题。
- 注释过程: 注释工作由专业公司负责,雇佣了母语为加泰罗尼亚语的团队进行。
使用数据集的考虑因素
- 社会影响: 旨在促进加泰罗尼亚语语言模型的发展。
- 偏见讨论: 未提供详细信息。
- 其他已知限制: 未提供详细信息。
附加信息
- 数据集管理员: 巴塞罗那超级计算中心文本挖掘单元(TeMU)
- 许可证信息: 本作品采用<a rel="license" href="https://creativecommons.org/licenses/by-sa/4.0/">Attribution-ShareAlike 4.0 International License</a>。
- 引用信息: 请参考提供的引用格式。
搜集汇总
数据集介绍
构建方式
在自然语言处理领域,抽取式问答任务长期依赖高资源语言数据集,而低资源语言如加泰罗尼亚语则面临数据匮乏的困境。ViquiQuAD数据集正是为填补这一空白而构建。其数据源自维基百科加泰罗尼亚语版本,精心筛选了597篇高质量且非翻译的原创文章,从中提取出3111个长度为5至8句的文本段落。针对每个段落,专业标注人员遵循SQuAD 1.0的标注规范,手工生成1至5个问题及其对应的答案片段,最终形成了15153个问答对。整个构建过程由巴塞罗那超级计算中心的文本挖掘单元主导,并委托拥有母语级加泰罗尼亚语能力的专业公司完成标注,确保了数据的专业性与语言地道性。
特点
ViquiQuAD数据集具有鲜明的结构特征与技术价值。其数据格式严格遵循SQuAD v1.0标准,每条记录包含唯一标识符、文章标题、上下文文本、问题以及答案列表,其中答案以文本片段及其在上下文中的字符起始位置进行标注,便于模型进行精确的跨度预测。数据集划分为训练集(11259例)、开发集(1493例)和测试集(1428例),为模型训练与评估提供了清晰的基准。作为加泰罗尼亚语首个大规模抽取式问答数据集,它有效缓解了该语言在信息检索与机器阅读理解领域的资源稀缺问题,并能为多语言模型在中等低资源语言上的性能评估提供关键支撑。
使用方法
ViquiQuAD数据集的使用方式直接而高效。开发者可将其直接用于微调各类抽取式问答模型,例如基于Transformer架构的BERT、RoBERTa及其多语言变体。在使用时,需将数据加载为SQuAD格式,利用HuggingFace的datasets库或自定义数据加载器读取JSON结构中的上下文、问题与答案起始位置。模型训练过程中,通常以交叉熵损失函数优化答案跨度起止位置的预测。此外,该数据集也可作为加泰罗尼亚语语言模型的评估基准,通过计算精确匹配率与F1分数来衡量模型的语义理解与抽取能力。鉴于其数据来源于维基百科,使用时应注意模型可能继承的领域偏差,并适当结合外部语料以提升泛化性能。
背景与挑战
背景概述
在自然语言处理领域,抽取式问答作为机器理解文本的核心任务之一,长期以来受限于高质量数据集的稀缺性,尤其是对于加泰罗尼亚语等中低资源语言而言。ViquiQuAD数据集由巴塞罗那超级计算中心(BSC)的文本挖掘单元于2021年创建,旨在填补这一空白。该数据集从维基百科的加泰罗尼亚语版本中精选597篇高质量原创文章,提取3111个上下文片段,并由专业母语标注员遵循SQuAD 1.0规范生成15153个问答对。其核心研究问题在于评估多语言模型对加泰罗尼亚语的适用性,并为该语言提供首个大规模抽取式问答基准。作为Projecte AINA项目的一部分,ViquiQuAD不仅推动了加泰罗尼亚语自然语言处理技术的发展,也为其他中低资源语言的数据集构建提供了可借鉴的范式,在相关研究中产生了广泛影响。
当前挑战
ViquiQuAD所面临的挑战涵盖领域问题与构建过程两个层面。在领域问题方面,加泰罗尼亚语作为中低资源语言,长期缺乏大规模、高质量的抽取式问答数据集,导致现有模型在泛化能力上存在显著局限,难以应对真实场景中的复杂语言现象。构建过程中,团队需从维基百科海量条目中筛选非翻译的原创高质量文章,以确保语言的自然性与文化代表性;同时,专业标注员需遵循严格的SQuAD指导原则,在有限的上下文内设计问题并精确定位答案跨度,这对标注一致性提出了极高要求。此外,数据来源的单一性(仅限维基百科)可能引入覆盖偏差,限制了模型在跨领域应用中的鲁棒性,而标注成本与时间投入也构成了可持续发展的瓶颈。
常用场景
经典使用场景
ViquiQuAD作为加泰罗尼亚语首个抽取式问答数据集,其经典使用场景在于微调和评估面向低资源语言的抽取式问答模型。研究者可基于其15,153个高质量问答对,训练模型从维基百科段落中精准定位答案片段,该过程严格遵循SQuAD v1.0范式,为加泰罗尼亚语自然语言处理提供了标准化的基准测试平台。
解决学术问题
该数据集核心解决了加泰罗尼亚语等中等低资源语言在抽取式问答任务中缺乏高质量标注数据的学术困境。通过构建非翻译原创文章语料,ViquiQuAD有效规避了机器翻译引入的噪声偏差,为评估多语言模型在低资源场景下的泛化能力提供了可靠基准,推动了多语言与单语言模型性能对比研究的深入。
衍生相关工作
ViquiQuAD衍生了一系列重要工作,包括Armengol-Estapé等人基于该数据集对多语言模型(如mBERT、XLM-R)与单语言模型(如BERTa)在加泰罗尼亚语上的全面评估,揭示了多语言模型在中等低资源语言中的优劣。此外,该数据集被用于加泰罗尼亚语语言模型微调与跨语言迁移学习研究,成为低资源NLP领域的关键评估资源。
以上内容由遇见数据集搜集并总结生成



