ArQuAD
收藏资源简介:
ArQuAD是一个由语言专家注释的阿拉伯语机器阅读理解数据集,包含16,020个问题,这些问题是基于最常访问的阿拉伯语维基百科文章提出的。每个问题的答案都是从相应的阅读文章中提取的文本片段。数据集涵盖了广泛的领域,包括体育、政治、技术、宗教等,旨在全面测试机器阅读理解模型的能力。
ArQuAD is an Arabic machine reading comprehension dataset annotated by linguistic experts, comprising 16,020 questions based on the most frequently accessed articles from Arabic Wikipedia. Each question's answer is a text segment extracted from the corresponding reading passage. The dataset spans a wide range of domains, including sports, politics, technology, religion, etc., designed to comprehensively test the capabilities of machine reading comprehension models.
ArQuAD: An Expert-Annotated Arabic Machine Reading Comprehension Dataset
概述
ArQuAD是一个由语言专家标注的阿拉伯语机器阅读理解(MRC)数据集,包含16,020个问题,这些问题是基于最常访问的阿拉伯语维基百科文章提出的。每个问题的答案都是相应阅读文章中的文本片段。
数据集描述
结构
数据集提供CSV和SQuAD JSON两种格式,包含以下列:
passage: 来自维基百科的原始文章。question: 标注者提出的问题。answer: 文章中回答问题的最小文本片段。
统计信息
- 总对数:16,020
- 文章数:4,005
- 覆盖领域:多样(体育、政治、技术等)
关键特点
- 专家标注:问题和答案由语言专家创建,确保高质量和相关性。
- 多样性:涵盖广泛的主题,确保MRC模型的全面测试,包括事实性和非事实性问题。
使用方法
从仓库下载CSV文件,将其加载到您首选的数据分析工具中使用。




