AI4Bharat-IndicNLP Dataset
收藏资源简介:
AI4Bharat-IndicNLP数据集是一个持续努力创建的,针对印度语言的大规模、通用领域语料库集合。目前,它包含来自两个语系10种印度语言的27亿个单词。该数据集提供预训练的词嵌入,并创建了9种语言的新闻文章分类数据集以评估这些嵌入。
The AI4Bharat-IndicNLP dataset is a continuous effort to create a large-scale, general-domain corpus collection for Indian languages. Currently, it encompasses 2.7 billion words from 10 Indian languages across two language families. The dataset provides pre-trained word embeddings and has established news article classification datasets in 9 languages to evaluate these embeddings.
数据集概述
数据集名称
AI4Bharat-IndicNLP Dataset
数据集描述
AI4Bharat-IndicNLP数据集是一个持续更新的项目,旨在为印度语言创建大规模、通用领域的语料库。目前,该数据集包含10种印度语言的2.7亿个词汇,涵盖两个语言家族。此外,数据集提供了在这些语料库上预训练的词嵌入,并针对9种语言创建了新闻文章分类数据集以评估这些嵌入。
数据集内容
文本语料库
包含12种语言的文本数据,每种语言的数据包括新闻文章数量、句子数、词汇量及下载链接。
词嵌入
提供10种语言的词向量和模型下载链接,用于支持多种印度语言任务。
IndicNLP新闻文章分类数据集
基于IndicNLP文本语料库创建,包含9种语言的新闻文章及其分类,数据集平衡分布于各个类别。
公开可用的分类数据集
评估IndicNLP嵌入的多个公开可用分类数据集,包括ACTSA Corpus、BBC新闻文章、IIT Patna产品评论等。
形态分析器
提供10种语言的形态分析器下载链接,这些分析器是使用morfessor训练的无监督形态分析器。
数据集使用
数据集可用于多种印度语言的自然语言处理任务,包括文本分类、词相似性和词类比任务等。
许可证
数据集根据Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License授权使用。
贡献者
数据集的开发由Anoop Kunchukuttan、Divyanshu Kakwani、Satish Golla等志愿者共同完成,作为AI4Bharat倡议的一部分。




