AmazonScience/mintaka
收藏资源简介:
Mintaka是一个复杂、自然且多语言的问答数据集,包含20,000个问答对,这些问题由MTurk工作者提出,并使用Wikidata的问答实体进行注释。数据集涵盖了8种复杂类型的问题和8个类别的内容,包括电影、音乐、体育、书籍、地理、政治、视频游戏和历史。问题最初以英语编写,并被翻译成阿拉伯语、法语、德语、印地语、意大利语、日语、葡萄牙语和西班牙语。Mintaka是首批可用于端到端问答模型的大规模复杂、自然且多语言的数据集之一。
Mintaka is a complex, natural and multilingual question answering (QA) dataset containing 20,000 QA pairs, which are proposed by MTurk workers and annotated with question entities from Wikidata. The dataset covers 8 types of complex questions and 8 content categories, including film, music, sports, books, geography, politics, video games and history. The questions were originally written in English and translated into Arabic, French, German, Hindi, Italian, Japanese, Portuguese and Spanish. Mintaka is one of the first large-scale complex, natural and multilingual datasets available for end-to-end QA models.
数据集概述
名称: Mintaka
描述: Mintaka是一个复杂、自然、多语言的问答(QA)数据集,包含20,000个问题-答案对,由MTurk工人从Wikidata中提取的问题和答案实体进行标注。
语言: 英语,以及其他8种语言(阿拉伯语、法语、德语、印地语、意大利语、日语、葡萄牙语、西班牙语)。
数据集大小: 100K<n<1M
许可: CC-BY-4.0
任务类别: 问答(QA)
任务ID: open-domain-qa
数据集结构:
- 数据实例: 每个实例包括ID、语言、问题、答案文本、类别、复杂性类型、问题实体和答案实体。
- 数据字段: 包括ID、语言、问题、答案文本、类别、复杂性类型、问题实体和答案实体。
- 数据分割: 每种语言分为训练集(14,000样本)、开发集(2,000样本)和测试集(4,000样本)。
数据集创建:
- 来源数据: 原始数据,由MTurk工人收集。
- 标注: 由专家生成。
- 个人和敏感信息: 数据集不含个人或敏感信息。
使用考虑:
- 社会影响: 待补充。
- 偏见讨论: 待补充。
- 其他已知限制: 待补充。
附加信息:
- 数据集管理员: Amazon Alexa AI。
- 贡献者: 感谢@afaji添加此数据集。




