ARASTEM-corpus
收藏资源简介:
ARASTEM是一个专门用于阿拉伯语词干提取领域的语料库,其中包含多个文档,这些文档中的单词在语义和形态上相互关联。该语料库由母语为阿拉伯语的人士手动构建,收集自不同的阿拉伯讨论论坛。此外,它包含了标准阿拉伯语、方言阿拉伯语和现代伪阿拉伯语的词汇。
ARASTEM is a specialized corpus dedicated to the field of Arabic stemming, encompassing multiple documents where words are semantically and morphologically interconnected. This corpus was manually constructed by native Arabic speakers and collected from various Arabic discussion forums. Furthermore, it includes vocabulary from Standard Arabic, dialectal Arabic, and modern pseudo-Arabic.
AraStem-corpus 概述
数据集描述
- 名称: AraStem-corpus
- 目的: 专为阿拉伯语词干提取领域设计,包含多个文档,这些文档中的单词根据语义和形态学特征进行分组。
- 构建方式: 由母语为阿拉伯语的专家手动构建,数据来源于多个阿拉伯语讨论论坛。
- 语言覆盖: 包含标准阿拉伯语、方言阿拉伯语和现代伪阿拉伯语。
贡献者
- Ibtissem Abainia
- Ahmed Kedaya
- Chouaib Fellah
- Otman Bordjiba
- 审核者: Taha Zerrouki
数据集结构
- 部分一: 根导向数据 - 单词根据其根进行分组。
- 部分二: 词干导向数据 - 单词根据其词形进行分组。
数据集用途
用于评估 ARLStem 词干提取器,该提取器已集成于 NLTK 框架中。
引用信息
bibtex @article{abainia2017novel, title={A novel robust Arabic light stemmer}, author={Abainia, Kheireddine and Ouamour, Siham and Sayoud, Halim}, journal={Journal of Experimental & Theoretical Artificial Intelligence}, volume={29}, number={3}, pages={557--573}, year={2017}, publisher={Taylor & Francis} }




