TYDI QA–WANA
收藏资源简介:
TYDI QA–WANA 是一个包含 28K 个例子的问答数据集,涵盖西亚和北非的 10 种语言变体。数据收集过程旨在引发信息寻求问题,其中提问者真正好奇答案。每个问题都与一整篇文章配对,这篇文章可能包含也可能不包含答案。由于文章的相对较大规模,因此这个任务适合评估模型利用大文本上下文来回答问题的能力。此外,数据是在每种语言变体中直接收集的,没有使用翻译,以避免文化相关性问题。我们展示了两个基线模型的表现,并发布了我们的代码和数据,以促进研究社区的进一步改进。
TYDI QA–WANA is a question answering dataset consisting of 28K examples, spanning 10 language varieties from West Asia and North Africa. The data collection process was designed to elicit authentic information-seeking questions, where the questioner holds genuine curiosity about the answers. Each question is paired with a full-length article, which may or may not contain the corresponding answer. Given the relatively large scale of the articles, this task is well-suited for evaluating a model's capability to leverage large-scale text contexts for question answering. Moreover, the data was collected directly within each target language variety without relying on machine translation, to avoid issues related to cultural relevance. We present the performance of two baseline models, and release our code and dataset to foster further advancements in the research community.
TyDi QA - WANA 数据集概述
数据集简介
- 名称:TyDi QA - WANA
- 类型:问答数据集
- 语言覆盖:10种西亚和北非地区的语言变体
- 数据规模:52K 问答对
- 扩展来源:原始 TyDi QA 数据集的扩展
任务描述
- 任务类型:Minimal answer span (MinSpan)
- 输入:完整的维基百科文章文本
- 输出要求:
- 返回最小答案跨度的起始和结束字节索引
- 对于是非问题,返回 YES 或 NO
- 无法回答时返回 NULL
数据统计
| 语言变体 | 平均字符数 | 平均词数(空格分隔) |
|---|---|---|
| Algerian Arabic | 33.8K | 5.5K |
| Egyptian Arabic | 36.1K | 5.9K |
| Iraqi Arabic | 31.5K | 5.1K |
| Jordanian Arabic | 32.6K | 5.3K |
| Armenian | 48.8K | 6.0K |
| Azerbaijani | 28.3K | 3.6K |
| Farsi | 25.3K | 4.6K |
| Hebrew | 22.7K | 3.8K |
| Tajik | 17.5K | 2.6K |
| Turkish | 17.4K | 2.2K |
| 宏观平均 | 29.4K | 4.5K |
数据下载
- 训练集(所有变体):https://storage.googleapis.com/tydiqa/wana/v1.0/train.all.jsonl
- 训练集(按变体分类):https://storage.googleapis.com/tydiqa/wana/v1.0/train.by_variety.jsonl.tar.gz
- 开发集(所有变体):https://storage.googleapis.com/tydiqa/wana/v1.0/dev.all.jsonl
- 开发集(按变体分类):https://storage.googleapis.com/tydiqa/wana/v1.0/dev.by_variety.jsonl.tar.gz
- 测试集(所有变体):https://storage.googleapis.com/tydiqa/wana/v1.0/test.all.jsonl
- 测试集(按变体分类):https://storage.googleapis.com/tydiqa/wana/v1.0/test.by_variety.jsonl.tar.gz
数据格式
- JSONL 文件结构:
language:语言变体article_plaintext:维基百科文章文本question:问题answer_types:答案类型列表answer_start_byte_indices:答案起始字节索引列表answer_end_byte_indices:答案结束字节索引列表answer_texts:答案文本列表
评估方法
- 评估指标:F1 和 Exact Match
- 评估工具:WANA_Metrics.ipynb 笔记本
- 模型输出要求:
generated_answer:模型的答案generated_answer_byte_start_index:预测答案的起始字节索引(可选)generated_answer_byte_end_index:预测答案的结束字节索引(可选)
数据来源
- 来源:2023年2月1日的维基百科快照
- 快照下载模板:
https://dumps.wikimedia.org/${LANG}wiki/latest/${LANG}wiki-latest-pages-articles-multistream.xml.bz2
联系方式
- 问题反馈:通过 GitHub 仓库提交 issue




