遇见数据集

TheTung/squad_es_v2

收藏
Hugging Face2024-01-23 更新2024-03-04 收录
官方服务:

资源简介:

SQuAD-es数据集是斯坦福问答数据集(SQuAD)v2的自动翻译版本,目标语言为西班牙语。该数据集包含训练集和验证集,分别有87595和10570个样本。数据字段包括id、title、context、question和answers,其中answers包含text和answer_start两个子字段。数据集的大小为39.29 MB(下载文件)和94.63 MB(生成数据集),总磁盘使用量为133.92 MB。数据集采用CC BY 4.0许可证。

SQuAD-es数据集是斯坦福问答数据集(SQuAD)v2的自动翻译版本,目标语言为西班牙语。该数据集包含训练集和验证集,分别有87595和10570个样本。数据字段包括id、title、context、question和answers,其中answers包含text和answer_start两个子字段。数据集的大小为39.29 MB(下载文件)和94.63 MB(生成数据集),总磁盘使用量为133.92 MB。数据集采用CC BY 4.0许可证。

提供机构:
TheTung
原始信息汇总

数据集概述

数据集摘要

自动翻译的斯坦福问答数据集(SQuAD)v2到西班牙语。

支持的任务和排行榜

  • 任务类别: 问答
  • 任务ID: 抽取式问答

语言

  • 语言: 西班牙语

数据集结构

数据实例

v1.1.0

  • 下载的数据文件大小: 39.29 MB
  • 生成的数据集大小: 94.63 MB
  • 总磁盘使用量: 133.92 MB

训练集示例: json { "answers": { "answer_start": [404, 356, 356], "text": ["Santa Clara, California", "Levi s Stadium", "Levi s Stadium en la Bahía de San Francisco en Santa Clara, California."] }, "context": ""El Super Bowl 50 fue un partido de fútbol americano para determinar al campeón de la NFL para la temporada 2015. El campeón de ...", "id": "56be4db0acb8001400a502ee", "question": "¿Dónde tuvo lugar el Super Bowl 50?", "title": "Super Bowl _ 50" }

数据字段

v1.1.0

  • id: 字符串特征。
  • title: 字符串特征。
  • context: 字符串特征。
  • question: 字符串特征。
  • answers: 字典特征,包含:
    • text: 字符串特征。
    • answer_start: 整数特征。

数据分割

名称 训练集 验证集
v1.1.0 87595 10570

数据集创建

数据集策划理由

更多信息需补充

源数据

初始数据收集和规范化

更多信息需补充

源语言生产者

更多信息需补充

标注

标注过程

更多信息需补充

标注者

更多信息需补充

个人和敏感信息

更多信息需补充

使用数据的注意事项

数据集的社会影响

更多信息需补充

偏见的讨论

更多信息需补充

其他已知限制

更多信息需补充

附加信息

数据集策展人

更多信息需补充

许可信息

SQuAD-es数据集在CC BY 4.0许可下发布。

引用信息

bibtex @article{2016arXiv160605250R, author = {Casimiro Pio , Carrino and Marta R. , Costa-jussa and Jose A. R. , Fonollosa}, title = "{Automatic Spanish Translation of the SQuAD Dataset for Multilingual Question Answering}", journal = {arXiv e-prints}, year = 2019, eid = {arXiv:1912.05200v1}, pages = {arXiv:1912.05200v1}, archivePrefix = {arXiv}, eprint = {1912.05200v2}, }

搜集汇总
数据集介绍
TheTung/squad_es_v2 数据集图片
构建方式
在自然语言处理领域,高质量的多语言问答数据集对推动跨语言理解研究至关重要。SQuAD-es v2 数据集正是基于这一需求,通过对广为人知的英文斯坦福问答数据集(SQuAD v2)进行全自动机器翻译而构建。具体而言,该数据集沿用了原始 SQuAD 的结构,利用翻译与对齐技术将英文的上下文、问题及答案文本整体转化为西班牙语,同时保留了答案在上下文中的起始位置索引,从而确保了抽取式问答任务所需的精确标注。整个构建过程无需人工干预,属于机器生成范畴,最终生成了一个包含约 87,595 条训练样本和 10,570 条验证样本的西班牙语单语问答语料库,数据规模介于 10K 至 100K 之间。
特点
该数据集的核心特点在于其作为西班牙语抽取式问答基准的高效性与可复现性。每个样本均由上下文、问题、答案文本及起始位置构成,格式清晰统一,便于模型直接进行跨度抽取。数据集的规模适中,训练与验证集的划分科学,兼顾了模型训练的效率与评估的可靠性。此外,SQuAD-es 继承了原始 SQuAD 的丰富主题多样性,覆盖了历史、科学、文化等多个领域的知识,为评估模型在西班牙语上的泛化能力提供了坚实的测试基础。其采用 CC-BY 4.0 许可协议发布,进一步降低了学术研究与工业应用的门槛。
使用方法
使用该数据集时,研究者可通过 Hugging Face Datasets 库直接加载,无需额外下载与预处理。加载后,数据以字典形式呈现,包含 'id'、'title'、'context'、'question' 和 'answers' 字段,其中 'answers' 为嵌套字典,内含文本列表和对应的起始索引列表。在训练抽取式问答模型时,通常以 'context' 和 'question' 作为输入,以 'answers' 中的起始位置和文本作为监督信号。该数据集与 Transformers 库中的 AutoModelForQuestionAnswering 等模型高度兼容,支持快速微调与评估,尤其适合在西班牙语环境下进行问答系统的研发与基准测试。
背景与挑战
背景概述
在自然语言处理领域,机器阅读理解与问答系统的发展长期受限于高质量标注数据的匮乏,尤其是非英语语种资源极为稀缺。SQuAD-es数据集应运而生,它由Casimiro Pio Carrino、Marta R. Costa-jussa和Jose A. R. Fonollosa等研究人员于2019年创建,通过对斯坦福问答数据集(SQuAD v2)进行自动翻译、对齐与检索,构建了西班牙语的抽取式问答基准。该数据集包含约8.7万条训练样本与1万条验证样本,覆盖多样化的上下文与问题,旨在推动西班牙语问答模型的评估与进步。作为首个大规模西班牙语SQuAD衍生数据集,它填补了该语种在抽取式问答领域的空白,为多语言自然语言理解研究提供了关键资源,并促进了跨语言迁移学习与机器翻译技术在问答任务中的应用。
当前挑战
SQuAD-es数据集面临的核心挑战体现在两个层面。在领域问题层面,自动翻译引入的噪声与语义错位导致答案边界不精确,影响了抽取式问答的准确性,同时西班牙语丰富的形态变化与句法结构对模型的理解能力提出了更高要求。在构建过程层面,机器生成的标注缺乏人工验证,翻译对齐错误可能产生错误样本,且原始SQuAD v2中无答案问题的处理在跨语言场景下更加复杂。此外,数据集规模有限(不足10万条),难以覆盖西班牙语中多样的地域变体与领域术语,可能造成模型泛化能力不足。这些挑战共同制约了SQuAD-es在实际应用中的鲁棒性与可靠性。
常用场景
经典使用场景
在自然语言处理领域,SQuAD-es数据集作为斯坦福问答数据集(SQuAD)的西班牙语机器翻译版本,为跨语言抽取式阅读理解研究提供了关键资源。其经典使用场景聚焦于训练和评估西班牙语抽取式问答模型,模型需从给定段落中定位并提取出问题对应的答案片段。该数据集包含超过八万条训练样本与一万条验证样本,覆盖广泛的主题领域,使得研究者能够系统性地探索西班牙语语境下的语义理解与信息定位能力,成为西语问答系统基准测试的基石。
衍生相关工作
SQuAD-es衍生了一系列重要学术工作,其中最具代表性的是基于机器翻译增强的多语言问答研究。研究者通过对比SQuAD-es与原始SQuAD上的模型表现,揭示了翻译噪声对阅读理解质量的影响规律,进而提出了对齐鲁棒性训练策略。此外,该数据集被用于构建跨语言问答迁移学习的基准,催生了如XLM-R等模型的西班牙语微调方案。在数据增强领域,SQuAD-es与人工标注的西语问答集(如Spanish MLQA)结合使用,推动了混合语料训练方法的创新,为低资源语言问答系统的发展奠定了方法论基础。
数据集最近研究
最新研究方向
在跨语言自然语言处理领域,SQuAD-es v2作为斯坦福问答数据集(SQuAD)的西班牙语自动翻译版本,为低资源语言抽取式问答研究提供了关键基准。当前前沿方向聚焦于利用该数据集评估多语言预训练模型(如XLM-R、mBERT)的零样本迁移能力,以及探索机器翻译噪声对问答性能的影响。随着西班牙语在全球数字生态中的重要性攀升,该数据集在推动拉丁美洲地区智能客服、教育问答系统等应用落地中扮演着核心角色。其CC-BY 4.0许可协议进一步降低了研究门槛,促进了西班牙语问答技术的民主化发展,成为连接英语主导的NLP研究与西班牙语社区需求的重要桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务