SIB-200
收藏资源简介:
SIB-200是一个大型开源基准数据集,用于200多种语言和方言的主题分类,旨在解决自然语言理解评估数据集的缺乏问题。该数据集基于Flores-200机器翻译语料库,首次为许多覆盖的语言提供了公开可用的NLU评估数据集。
SIB-200 is a large-scale open-source benchmark dataset for topic classification across over 200 languages and dialects, designed to address the scarcity of natural language understanding (NLU) evaluation datasets. Built on the Flores-200 machine translation corpus, it is the first to provide publicly available NLU evaluation datasets for many of the covered languages.
SIB-200 数据集概述
数据集描述
SIB-200 是一个用于主题分类的评估数据集,支持超过200种语言和方言。该数据集包含标注的英语数据集、扩展标注到其他语言的脚本以及运行基线文本分类模型的代码。
数据集内容
- 标注的英语数据集:位于
data/eng目录下。 - 扩展标注脚本:
get_flores_and_annotate.sh脚本用于将标注扩展到其他语言。 - 基线模型代码:位于
code目录下,包含运行基线文本分类模型的代码。
依赖项
- Python库:
transformerssklearnevaluatedatasetspandas
数据集创建
-
运行脚本: bash sh get_flores_and_annotate.sh
-
或从 Hugging Face 下载:
Davlan/sib200
运行基线模型
- 使用 XLM-R 模型: bash cd code/ sh xlmr_all.sh
引用信息
@misc{adelani2023sib200, title={SIB-200: A Simple, Inclusive, and Big Evaluation Dataset for Topic Classification in 200+ Languages and Dialects}, author={David Ifeoluwa Adelani and Hannah Liu and Xiaoyu Shen and Nikita Vassilyev and Jesujoba O. Alabi and Yanke Mao and Haonan Gao and Annie En-Shiun Lee}, year={2023}, eprint={2309.07445}, archivePrefix={arXiv}, primaryClass={cs.CL} }




