Awesome_Bangla_Datasets
收藏资源简介:
这是一个孟加拉语(Bangla)数据集的精选集合,旨在为人工智能和深度学习应用提供更新、全面的孟加拉语数据资源。该合集覆盖了自然语言处理(包括文本分类、命名实体识别、翻译、对话、文本摘要、问答、词形还原等任务)、自动语音识别、文本转语音、光学字符识别等多个领域。它整理了来自Kaggle、Hugging Face等平台的数据集链接和简要描述,以帮助研究人员和开发者更容易地访问和利用孟加拉语数据集。
This is a curated collection of Bangla language datasets, developed to provide up-to-date and comprehensive Bangla language data resources for artificial intelligence and deep learning applications. This collection covers multiple domains including Natural Language Processing (NLP) tasks such as text classification, Named Entity Recognition (NER), translation, dialogue, text summarization, question answering (QA), lemmatization, as well as Automatic Speech Recognition (ASR), Text-to-Speech (TTS) and Optical Character Recognition (OCR). It compiles dataset links and brief descriptions from platforms including Kaggle, Hugging Face and other platforms, to help researchers and developers more easily access and utilize Bangla language datasets.
Awesome Bangla Datasets 概览
该仓库汇集了孟加拉语(Bangla)在深度学习不同领域的多种数据集,涵盖自然语言处理(NLP)、语音识别(ASR)、语音合成(TTS)和光学字符识别(OCR)等任务。
孟加拉语 NLP 数据集
任务无关的 NLP 数据集
- 词表与停用词:Bangla Word List、Bangla Stop Words
- 大规模语料库:CC-100、Googles C4 dataset(孟加拉语部分)、Wikipedia Dump Dataset
- OSCAR 语料库:官方网站和 Hugging Face 版本
- 新闻语料库:Potrika(8个主题5个属性的大规模新闻数据集)、Bangladesh Protidin News Dataset、Bangla Newspaper dataset for topic modeling、Prothom-alo/Jugantor/Ittefaq News Dataset、bdNews24 Dataset、Indian News Dataset、Old Newspapers
- 其他语料:Samanantar、Indic Corp、Bangla Poetry Dataset、Bangla Medical Dataset、BanglaLM、Pralekha
孟加拉语大语言模型(LLM)数据集
- 预训练任务:所有任务无关的 NLP 数据集 + Sangraha
- 微调任务:Indic Instruct、Indic Align
文本分类任务数据集
- 多标签分类:Multilebel Text Classification
- 新闻标题分类:News Headline Classification
- 情感/情绪分析:BanglaBook、SentiGOLD、SentNoB、EmoNoBa、Emotion Corpus、Social Media Comments、Toxic Comments、YouTube Comments、Facebook Comments、Restaurant Reviews、E-Commerce Sentiment、EBLICT
- 其他分类:Complain Classification、Sarcasm Detection (BanglaSarc)、Book Genre Classification、Movie Genre Classification、Scientific Topic Classification、Song Lyrics Classification、Fake News Detection、Spam SMS Detection
命名实体识别(NER)任务数据集
- 词性标注:Bangla Pos Tagging
- 命名实体识别:B-NER(最大孟加拉语命名实体识别数据集)、Bangla Complex Named Entity Recognition Dataset、Naamapadam、Math Entity Recognition Dataset、Bangla Person Name Extraction Dataset、Amazon Massive Dataset
翻译任务数据集
- 平行语料库:Bangla Open Subtitle Parallel Corpus
- 英语-孟加拉语:Samanantar、Bilingual Sentence Pairs、Bharat Parallel Corpus Collection (BPCC)
对话数据集
- 日常对话:Daily Dialogue
文本摘要数据集
- 单文档摘要:BenSum
- 多文档摘要:BUSUM-BNLP Dataset
- 新闻摘要:Bangla News Summarization
- 句子级摘要:Indic Sentence Summarization
问答数据集
- 阅读理解:Bangla Q/A (SQuAD 2.0 翻译)、Bangla Short Question Answer Dataset、Long Question Answer Dataset、BanglaRQA
- 问句生成:Indic Q/A
词形还原数据集
- 孟加拉语词形还原:Bangla Lemmatization
身份偏见评估数据集
- 偏见评估:BIBED (Bengali Identity Bias Evaluation Dataset)
孟加拉语语音识别(ASR)数据集
- Open SLR、Bangla Speech Recognition OOD Dataset、Benglai Regional Dialect Dataset
- Shrutilipi、Kathbath、Kathbath Hard
- FLEURS、IndicTTS、ULCA
- MADASR、BhasaAnuvaad、Lahaja、Vistaar
孟加拉语语音合成(TTS)数据集
- Open SLR Dataset、Rasa
- Indic Voices、BhasaAnuvaad
孟加拉语光学字符识别(OCR)数据集
- 手写字符:Ekush (Bangla Handwritten Characters)、Bongabdo (Bangla Handwritten script Dataset)
- 文本检测与识别:PDF Text Detection、Bangla Handwritten Grapheme Classification
- 文档级手写识别:BN-HTRd (Benchmark Dataset for Document Level Offline Bangla Handwritten Text Recognition)
- 车牌识别:Bangla synthetic license plates




