ghananlpcommunity/ghana-speech
收藏资源简介:
这是一个多语言音频数据集,包含多种非洲语言,如Akuapem Twi、Anyin、Asante Twi、Avatime、Bassar Ntcham、Bimoba、Birifor Southern、Bissa、Buli、Chumburung、Dagaare、Dagbani、Dangme、Deg、Ewe、Fante、Fulfulde Maasina、Gikyode、Gonja、Hausa、Kabiye、Kasem、Konkomba、Konni、Kusaal、Lelemi、Mampruli、Nawuri、Ninkare、Nkonya、Ntrubo、Nzema、Paasaal、Sehwi、Sekpele、Selee、Sisaala Tumulung、Siwu、Tampulma、Tem、Tuwuli和Vagla。每个语言配置包含音频(采样率为16000Hz)和对应的文本转录,用于训练任务,支持语音识别或语音合成等NLP应用。
This is a multilingual audio dataset containing various African languages, such as Akuapem Twi, Anyin, Asante Twi, Avatime, Bassar Ntcham, Bimoba, Birifor Southern, Bissa, Buli, Chumburung, Dagaare, Dagbani, Dangme, Deg, Ewe, Fante, Fulfulde Maasina, Gikyode, Gonja, Hausa, Kabiye, Kasem, Konkomba, Konni, Kusaal, Lelemi, Mampruli, Nawuri, Ninkare, Nkonya, Ntrubo, Nzema, Paasaal, Sehwi, Sekpele, Selee, Sisaala Tumulung, Siwu, Tampulma, Tem, Tuwuli, and Vagla. Each language configuration includes audio (sampled at 16000 Hz) and corresponding text transcriptions, designed for training tasks, supporting NLP applications like speech recognition or speech synthesis.
数据集概述:ghana-speech
基本信息
- 数据集名称:ghana-speech
- 发布机构:Ghana NLP Community
- 许可协议:CC BY-NC 4.0(仅限非商业研究与教育用途,需注明出处)
- 数据类型:音频与文本
- 数据格式:Parquet、Optimized Parquet
- 数据量:约 1,411,467 行,总文件大小 222 GB
- 数据拆分:仅包含训练集(
train) - 近月下载量:2,023 次
语言覆盖
数据集覆盖 42 个加纳语言子集,包括 Akuapem Twi、Asante Twi、Ewe、Hausa、Fante、Dagbani、Kasem 等。完整列表见下方统计。
数据统计(摘录)
| 语言 | 子集 | 片段数 | 时长 |
|---|---|---|---|
| Akuapem_Twi | Akuapem_Twi_twi |
52,650 | 63.25 小时 |
| Asante_Twi | Asante_Twi_twi |
143,383 | 200.02 小时 |
| Ewe | Ewe_ewe |
108,240 | 160.87 小时 |
| Hausa | Hausa_hau |
92,082 | 152.77 小时 |
| Fante | Fante_fat |
60,933 | 122.03 小时 |
| 数据集总计 | - | 1,411,467 | 2,246.89 小时 |
数据样例(Akuapem Twi)
| 字段 | 示例值 |
|---|---|
id |
Akuapem_Twi_twi_00000001 |
language |
Akuapem_Twi |
text |
1 BERESOSƐM 1. |
duration (秒) |
5.96 |
source_file |
1CH.1.1631 |
audio |
(音频数据) |
适用库与工具
- Datasets
- Dask
- Polars




