遇见数据集

sartajekram/BanglaRQA

收藏
Hugging Face2023-05-06 更新2024-03-04 收录
官方服务:

资源简介:

BanglaRQA是一个人工标注的孟加拉语问答数据集,包含多种问答类型。该数据集旨在解决孟加拉语在阅读理解问答数据集方面的不足,特别是针对资源匮乏的语言。数据集包含3,000个上下文段落和14,889个问答对,涵盖了可回答和不可回答的问题,以及四种独特的问题类别和三种答案类型。数据集的使用受限于非商业研究目的,遵循CC BY-NC-SA 4.0许可。

BanglaRQA is a manually annotated Bengali question answering (QA) dataset encompassing diverse QA types. It is designed to alleviate the scarcity of Bengali reading comprehension QA datasets, particularly for low-resource languages. The dataset consists of 3,000 context paragraphs and 14,889 QA pairs, covering both answerable and unanswerable questions, alongside four unique question categories and three answer types. Its use is limited to non-commercial research purposes, and it is released under the CC BY-NC-SA 4.0 license.

提供机构:
sartajekram
原始信息汇总

数据集概述

数据集名称

BanglaRQA

数据集摘要

这是一个由人类标注的孟加拉语问答(QA)数据集,包含多种问题-答案类型。

语言

  • Bangla

使用示例

python from datasets import load_dataset dataset = load_dataset("sartajekram/BanglaRQA")

数据集结构

  • 数据实例:提供了一个JSON格式的示例,包含文章ID、标题、上下文、问题ID、问题文本、是否可回答、问题类型和答案。
  • 数据字段:包括文章ID、标题、上下文、问题ID、问题文本、是否可回答、问题类型和答案。
  • 数据分割
    • train: 11,912
    • validation: 1,484
    • test: 1,493

许可信息

本数据集内容仅限于非商业研究目的使用,遵循Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License (CC BY-NC-SA 4.0)。数据集内容的版权属于原始版权持有者。

引用信息

如果您使用此数据集,请引用以下论文:

@inproceedings{ekram-etal-2022-banglarqa, title = "{B}angla{RQA}: A Benchmark Dataset for Under-resourced {B}angla Language Reading Comprehension-based Question Answering with Diverse Question-Answer Types", author = "Ekram, Syed Mohammed Sartaj and Rahman, Adham Arik and Altaf, Md. Sajid and Islam, Mohammed Saidul and Rahman, Mehrab Mustafy and Rahman, Md Mezbaur and Hossain, Md Azam and Kamal, Abu Raihan Mostofa", booktitle = "Findings of the Association for Computational Linguistics: EMNLP 2022", month = dec, year = "2022", address = "Abu Dhabi, United Arab Emirates", publisher = "Association for Computational Linguistics", url = "https://aclanthology.org/2022.findings-emnlp.186", pages = "2518--2532", abstract = "High-resource languages, such as English, have access to a plethora of datasets with various question-answer types resembling real-world reading comprehension. However, there is a severe lack of diverse and comprehensive question-answering datasets in under-resourced languages like Bangla. The ones available are either translated versions of English datasets with a niche answer format or created by human annotations focusing on a specific domain, question type, or answer type. To address these limitations, this paper introduces BanglaRQA, a reading comprehension-based Bangla question-answering dataset with various question-answer types. BanglaRQA consists of 3,000 context passages and 14,889 question-answer pairs created from those passages. The dataset comprises answerable and unanswerable questions covering four unique categories of questions and three types of answers. In addition, this paper also implemented four different Transformer models for question-answering on the proposed dataset. The best-performing model achieved an overall 62.42{%} EM and 78.11{%} F1 score. However, detailed analyses showed that the performance varies across question-answer types, leaving room for substantial improvement of the model performance. Furthermore, we demonstrated the effectiveness of BanglaRQA as a training resource by showing strong results on the bn{_}squad dataset. Therefore, BanglaRQA has the potential to contribute to the advancement of future research by enhancing the capability of language models. The dataset and codes are available at https://github.com/sartajekram419/BanglaRQA", }

搜集汇总
数据集介绍
sartajekram/BanglaRQA 数据集图片
构建方式
在自然语言处理领域,低资源语言的阅读理解数据集稀缺,尤其是孟加拉语。为此,研究者构建了BanglaRQA,这是一个基于阅读理解的孟加拉语问答数据集。该数据集由人工标注完成,包含3,000个上下文段落和14,889个问答对。标注过程涵盖了可回答与不可回答的问题,并设计了四种独特的问题类别和三种答案类型,以确保数据集的多样性和全面性。数据集从孟加拉语维基百科等来源提取段落,并经过严格的人工审核,保证了标注质量。
使用方法
使用BanglaRQA数据集十分便捷,通过Hugging Face的datasets库即可一键加载。用户只需运行`from datasets import load_dataset`并指定数据集名称`sartajekram/BanglaRQA`,即可获取包含训练、验证和测试分片的数据集。数据实例以JSON格式呈现,包含段落ID、标题、上下文、问题文本、可回答性标签、问题类型以及答案列表等字段。研究者可基于此进行抽取式问答模型的训练与评估,或进一步探索不同问答类型对模型性能的影响。
背景与挑战
背景概述
BanglaRQA数据集由Syed Mohammed Sartaj Ekram等研究人员于2022年在EMNLP会议上发布,旨在填补孟加拉语作为低资源语言在阅读理解问答领域的空白。该数据集包含3000个上下文段落和14889个问答对,涵盖可回答与不可回答问题,并涉及四种问题类型与三种答案类型。其核心研究问题在于构建一个多样化、人工标注的孟加拉语阅读理解基准,以推动低资源语言的自然语言处理研究。该数据集的影响力体现在为孟加拉语问答任务提供了首个全面基准,促进了多类型问答能力的评估与发展。
当前挑战
BanglaRQA面临的挑战包括:1) 领域问题层面,孟加拉语作为低资源语言,缺乏大规模、多样化的问答数据集,现有资源多为英文数据集翻译或单一类型标注,难以反映真实阅读理解的复杂性,BanglaRQA需解决这一问题以提升模型泛化能力;2) 构建过程中,人工标注的难度较高,需确保问答对的准确性与多样性,同时平衡可回答与不可回答问题的比例,避免数据偏差,此外,不同问答类型的性能差异显著,最佳模型仅达到62.42%的精确匹配和78.11%的F1分数,表明模型在低资源场景下仍有显著提升空间。
常用场景
经典使用场景
BanglaRQA数据集专为孟加拉语阅读理解与问答任务而设计,其经典使用场景聚焦于开放域抽取式问答。该数据集包含3000个上下文段落和14889个问答对,涵盖可回答与不可回答两类问题,并细分为四种问题类型(如确认型、事实型等)及三种答案类型(如是否类、片段抽取类等)。研究者可利用该数据集训练和评估模型在孟加拉语低资源环境下的文本理解能力,尤其适用于检验模型对复杂语境中信息定位与逻辑推理的鲁棒性。其结构化的数据划分(训练集11912条、验证集1484条、测试集1493条)为标准化基准测试提供了可靠支撑。
解决学术问题
该数据集旨在解决孟加拉语等低资源语言在阅读理解问答领域长期面临的数据匮乏与多样性不足问题。此前,孟加拉语问答数据集多为英文数据集的机械翻译版本,或局限于特定领域与单一答案格式,难以反映真实问答场景的复杂性。BanglaRQA通过人工标注构建了包含多种问答类型的原生语料,填补了该语言在多样化问答基准上的空白。其引入的不可回答问题与多类型答案设计,为研究模型在不确定性推理、否定检测及答案类型判别等学术难题提供了关键资源,推动了低资源语言自然语言处理领域的理论发展。
实际应用
在实际应用中,BanglaRQA可赋能孟加拉语智能信息检索系统、教育辅助平台及多语言客服机器人。例如,在孟加拉语数字图书馆或在线百科中,该数据集训练的模型能精准回答用户关于历史、文化或科学知识的提问,如识别“法齐尔考试是否在孟加拉国和印度的阿里亚宗教学校举行”这类确认型问题。此外,其支持不可回答问题的特性有助于构建诚实型AI系统——当查询缺乏上下文依据时,模型可明确拒绝回答,避免错误信息传播。该数据集还可用于孟加拉语新闻摘要与事实核查工具的底层推理模块,提升低资源语言场景下的信息可信度。
数据集最近研究
最新研究方向
在低资源语言自然语言处理领域,孟加拉语阅读理解与问答系统的构建正成为前沿热点。BanglaRQA数据集的发布,填补了孟加拉语在多样化问答类型上的空白,其包含可回答与不可回答问题、四类提问方式和三种答案形态,为多任务学习与鲁棒性评估提供了宝贵资源。当前研究聚焦于利用Transformer架构在该数据集上进行迁移学习与微调,探索模型在不同问答类型上的性能差异与提升空间。该数据集不仅推动了孟加拉语NLP的基准测试发展,也为其他低资源语言的类似研究提供了可复现的方法论与评估范式,具有重要的学术意义与应用前景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务