Multi-Dialectal Parallel Corpus for Bangla
收藏资源简介:
该数据集是由锡尔赫特工程学院构建的孟加拉语多方言平行语料库,整合了七个现有数据集并新增了五个未覆盖方言的专家验证句对,总计51,531条平行句对,覆盖12种孟加拉语地域方言。数据创建过程包括源语料整合、Unicode规范化、去重与对齐,最终形成支持多方向翻译的统一资源。该数据集旨在解决孟加拉语方言间的神经机器翻译难题,为低资源方言提供训练数据,促进数字包容性,尤其服务于方言社群的语言技术需求。
This is a Bengali multi-dialect parallel corpus constructed by the Sylhet Engineering College. It integrates seven existing datasets and adds 5 expert-validated sentence pairs for previously uncovered dialects, resulting in a total of 51,531 parallel sentence pairs covering 12 regional Bengali dialects. The data creation pipeline includes source corpus integration, Unicode normalization, deduplication and alignment, ultimately forming a unified resource that supports multi-directional translation. This dataset is designed to tackle the challenges of neural machine translation between Bengali dialects, provide training data for low-resource dialects, advance digital inclusion, and specifically cater to the language technology requirements of dialect-speaking communities.

- 1Poly-Dialectal Neural Machine Translation System for Bangla Regional Dialects锡尔赫特工程学院 · 2026年



