Pakistan Multilingual Speech Corpus
收藏官方服务:
资源简介:
The dataset consists of ~35,000 audio clips spanning seven major Pakistani languages: Urdu, Punjabi, Pashto, Sindhi, Saraiki, Balochi, and Kashmiri. The dataset combines publicly available sources with manually collected data to address the scarcity of resources for low-resource languages. It serves as a foundational corpus for spoken language identification in Pakistan’s linguistically diverse setting.
提供机构:
Zenodo创建时间:
2026-03-30



