AkshitaS/google_xquad_plus
收藏资源简介:
--- license: cc-by-nc-sa-4.0 task_categories: - question-answering language: - en - hi - ar - de - el - es - ro - ru - th - tr - vi - zh configs: - config_name: ara_Arab data_files: - split: validation path: data/ara_Arab/validation* - config_name: deu_Latn data_files: - split: validation path: data/deu_Latn/validation* - config_name: ell_Grek data_files: - split: validation path: data/ell_Grek/validation* - config_name: eng_Latn data_files: - split: validation path: data/eng_Latn/validation* - config_name: hin_Deva data_files: - split: validation path: data/hin_Deva/validation* - config_name: hin_Latn data_files: - split: validation path: data/hin_Latn/validation* - config_name: ron_Latn data_files: - split: validation path: data/ron_Latn/validation* - config_name: rus_Cyrl data_files: - split: validation path: data/rus_Cyrl/validation* - config_name: spa_Latn data_files: - split: validation path: data/spa_Latn/validation* - config_name: tha_Thai data_files: - split: validation path: data/tha_Thai/validation* - config_name: tur_Latn data_files: - split: validation path: data/tur_Latn/validation* - config_name: vie_Latn data_files: - split: validation path: data/vie_Latn/validation* - config_name: zho_Hans data_files: - split: validation path: data/zho_Hans/validation* --- **Source dataset**: - Link: [google/xquad](https://huggingface.co/datasets/google/xquad) - Revision: `51adfef1c1287aab1d2d91b5bead9bcfb9c68583` **XQuAD**: XQuAD (Cross-lingual Question Answering Dataset) is a benchmark dataset for evaluating cross-lingual question answering performance. The dataset consists of a subset of 240 paragraphs and 1190 question-answer pairs from the development set of SQuAD v1.1 (Rajpurkar et al., 2016) together with their professional translations into ten languages: Spanish, German, Greek, Russian, Turkish, Arabic, Vietnamese, Thai, Chinese, and Hindi. Consequently, the dataset is entirely parallel across 11 languages. **XQuAD Plus** XQuAD Plus additionally has hin_Latn data generated using indictrans library.
许可证:CC BY-NC-SA 4.0 任务类别: - 问答任务 涉及语言: - en(英语) - hi(印地语) - ar(阿拉伯语) - de(德语) - el(希腊语) - es(西班牙语) - ro(罗马尼亚语) - ru(俄语) - th(泰语) - tr(土耳其语) - vi(越南语) - zh(中文) 配置项: - 配置名称:ara_Arab(阿拉伯语阿拉伯文) 数据文件: - 拆分集:验证集(validation) 路径:data/ara_Arab/validation* - 配置名称:deu_Latn(德语拉丁文) 数据文件: - 拆分集:验证集(validation) 路径:data/deu_Latn/validation* - 配置名称:ell_Grek(希腊语希腊文) 数据文件: - 拆分集:验证集(validation) 路径:data/ell_Grek/validation* - 配置名称:eng_Latn(英语拉丁文) 数据文件: - 拆分集:验证集(validation) 路径:data/eng_Latn/validation* - 配置名称:hin_Deva(印地语天城文) 数据文件: - 拆分集:验证集(validation) 路径:data/hin_Deva/validation* - 配置名称:hin_Latn(印地语拉丁转写) 数据文件: - 拆分集:验证集(validation) 路径:data/hin_Latn/validation* - 配置名称:ron_Latn(罗马尼亚语拉丁文) 数据文件: - 拆分集:验证集(validation) 路径:data/ron_Latn/validation* - 配置名称:rus_Cyrl(俄语西里尔文) 数据文件: - 拆分集:验证集(validation) 路径:data/rus_Cyrl/validation* - 配置名称:spa_Latn(西班牙语拉丁文) 数据文件: - 拆分集:验证集(validation) 路径:data/spa_Latn/validation* - 配置名称:tha_Thai(泰语泰文) 数据文件: - 拆分集:验证集(validation) 路径:data/tha_Thai/validation* - 配置名称:tur_Latn(土耳其语拉丁文) 数据文件: - 拆分集:验证集(validation) 路径:data/tur_Latn/validation* - 配置名称:vie_Latn(越南语拉丁文) 数据文件: - 拆分集:验证集(validation) 路径:data/vie_Latn/validation* - 配置名称:zho_Hans(简体中文) 数据文件: - 拆分集:验证集(validation) 路径:data/zho_Hans/validation* **源数据集**: - 链接:[google/xquad](https://huggingface.co/datasets/google/xquad) - 修订版本:`51adfef1c1287aab1d2d91b5bead9bcfb9c68583` **XQuAD**: XQuAD(跨语言问答数据集,Cross-lingual Question Answering Dataset)是用于评估跨语言问答性能的基准数据集。该数据集从SQuAD v1.1(Rajpurkar等人,2016)的开发集中选取了240段文本与1190组问答对,并将其专业翻译为十种语言:西班牙语、德语、希腊语、俄语、土耳其语、阿拉伯语、越南语、泰语、中文与印地语。因此,该数据集在11种语言间完全对齐。 **XQuAD Plus**: XQuAD Plus额外包含了使用indictrans库生成的印地语拉丁转写(hin_Latn)数据。
数据集概述
基本信息
- 许可证: cc-by-nc-sa-4.0
- 任务类别: 问答
- 语言:
- 英语 (en)
- 印地语 (hi)
- 阿拉伯语 (ar)
- 德语 (de)
- 希腊语 (el)
- 西班牙语 (es)
- 罗马尼亚语 (ro)
- 俄语 (ru)
- 泰语 (th)
- 土耳其语 (tr)
- 越南语 (vi)
- 中文 (zh)
数据配置
- config_name: ara_Arab
- 数据文件:
- split: validation
- path: data/ara_Arab/validation*
- 数据文件:
- config_name: deu_Latn
- 数据文件:
- split: validation
- path: data/deu_Latn/validation*
- 数据文件:
- config_name: ell_Grek
- 数据文件:
- split: validation
- path: data/ell_Grek/validation*
- 数据文件:
- config_name: eng_Latn
- 数据文件:
- split: validation
- path: data/eng_Latn/validation*
- 数据文件:
- config_name: hin_Deva
- 数据文件:
- split: validation
- path: data/hin_Deva/validation*
- 数据文件:
- config_name: hin_Latn
- 数据文件:
- split: validation
- path: data/hin_Latn/validation*
- 数据文件:
- config_name: ron_Latn
- 数据文件:
- split: validation
- path: data/ron_Latn/validation*
- 数据文件:
- config_name: rus_Cyrl
- 数据文件:
- split: validation
- path: data/rus_Cyrl/validation*
- 数据文件:
- config_name: spa_Latn
- 数据文件:
- split: validation
- path: data/spa_Latn/validation*
- 数据文件:
- config_name: tha_Thai
- 数据文件:
- split: validation
- path: data/tha_Thai/validation*
- 数据文件:
- config_name: tur_Latn
- 数据文件:
- split: validation
- path: data/tur_Latn/validation*
- 数据文件:
- config_name: vie_Latn
- 数据文件:
- split: validation
- path: data/vie_Latn/validation*
- 数据文件:
- config_name: zho_Hans
- 数据文件:
- split: validation
- path: data/zho_Hans/validation*
- 数据文件:
数据集描述
- XQuAD:
- 一个用于评估跨语言问答性能的基准数据集。
- 包含240个段落和1190个问答对,来自SQuAD v1.1的开发集。
- 数据集包含10种语言的专业翻译,完全平行于11种语言。
- XQuAD Plus:
- 额外包含使用indictrans库生成的hin_Latn数据。




