PritomBangla Regional Dataset
收藏资源简介:
The PritomBangla dataset is a curated collection of 20,232 Bangla lexical items annotated with translations, 5 Bangla POS, and regional speech variants. It is designed to support research in natural language processing (NLP), computational linguistics, and regional language studies. This dataset captures the diversity of spoken Bangla across different regions of Bangladesh, making it a valuable resource for dialectal analysis, speech recognition, machine learning, and educational research. Dataset Overview Total Entries: 3372 Columns (9): General – Standard Bangla word English Translation – English meaning পদ (Google API) – Part-of-speech tags from Google API পদ (Human)—Human-verified part-of-speech Barishal_bangla_speech – Regional variant from Barishal Sylhet_bangla_speech – Regional variant from Sylhet Chittagong_bangla_speech – Regional variant from Chittagong Mymensingh_bangla_speech – Regional variant from Mymensingh Noakhali_bangla_speech – Regional variant from Noakhali Purpose This dataset is intended for: Training Bangla NLP models (lexical, semantic, and syntactic tasks) Studying dialectal variations within Bangla Supporting machine translation between Bangla, English, and the region Enabling linguistic and educational research Format File Type: CSV Encoding: UTF-8 (Bangla script included) Size: 3372 rows × 9 columns



