jw-african-speech
收藏资源简介:
该数据集是一个大规模多语言音频-文本配对数据集,涵盖44种非洲语言和方言变体,包括阿比语(abbey_aba)、阿汉塔语(ahanta_aha)、阿贾语(aja_ajg)、阿姆哈拉语(amharic_amh)、阿提语(atti_ati)、巴乌莱语(baoule_bci)、喀麦隆巴萨语(bassa_cameroon_bas)、利比里亚巴萨语(bassa_liberia_bsq)、几内亚比绍克里奥尔语(bissau_guinean_creole_pov)、布卢语(boulou_bum)、莫桑比克尚加纳语(changana_mozambique_tso)、奇切瓦语(chichewa_nya)、马拉维奇通加语(chitonga_malawi_tog)、奇通加语(chitonga_toi)、津巴布韦奇通加语(chitonga_zimbabwe_toi)、奇图姆布卡语(chitumbuka_tum)、奇尧语(chiyao_yao)、乔奎语(chokwe_cjk)、乔皮语(chopi_cce)、楚阿博语(chuabo_chw)、奇本巴语(cibemba_bem)、奇纳姆万加语(cinamwanga_mwn)、奇尼扬贾语(cinyanja_nya)、达加雷语(dagaare_dga)、达马拉语(damara_naq)、丹格梅语(dangme_ada)、丁卡语(dinka_din)、杜阿拉语(douala_dua)、埃多语(edo_bin)、埃桑语(esan_ish)、埃维语(ewe_ewe)、埃翁多语(ewondo_ewo)、芳语(fang_fan)、芳蒂语(fante_fat)、丰语(fon_fon)、契维语(twi_twi)等。每个样本包含音频文件及其对应的转录文本,并附带元数据:唯一标识符(id)、音频时长(duration,以秒为单位)、数据来源(source)、语言代码(jw_code和iso639_3)。数据集已预先分割为训练集、验证集和测试集,各语言配置的样本规模差异较大,从数百到上万个样本不等(例如,契维语训练集包含15,794个样本,而乔奎语训练集仅169个样本)。该数据集适用于自动语音识别、语音合成、低资源语言语音建模、多语言语音表示学习等任务。
This dataset is a large-scale multilingual audio-text paired dataset covering 44 African languages and dialect variants, including Abbey Aba (abbey_aba), Ahanta (ahanta_aha), Aja (aja_ajg), Amharic (amharic_amh), Atti (atti_ati), Baoule (baoule_bci), Cameroonian Bassa (bassa_cameroon_bas), Liberian Bassa (bassa_liberia_bsq), Guinea-Bissau Creole (bissau_guinean_creole_pov), Boulou (boulou_bum), Mozambican Changana (changana_mozambique_tso), Chichewa (chichewa_nya), Malawian Chitonga (chitonga_malawi_tog), Chitonga (chitonga_toi), Zimbabwean Chitonga (chitonga_zimbabwe_toi), Chitumbuka (chitumbuka_tum), Chiyao (chiyao_yao), Chokwe (chokwe_cjk), Chopi (chopi_cce), Chuabo (chuabo_chw), Cibemba (cibemba_bem), Cinamwanga (cinamwanga_mwn), Cinyanja (cinyanja_nya), Dagaare (dagaare_dga), Damara (damara_naq), Dangme Ada (dangme_ada), Dinka (dinka_din), Douala (douala_dua), Edo (edo_bin), Esan (esan_ish), Ewe (ewe_ewe), Ewondo (ewondo_ewo), Fang (fang_fan), Fante (fante_fat), Fon (fon_fon), Twi (twi_twi), etc. Each sample contains the audio file and its corresponding transcribed text, along with metadata: unique identifier (id), audio duration (in seconds), data source, and language codes (jw_code and iso639_3). The dataset has been pre-split into training, validation, and test sets. The sample sizes vary greatly across different languages, ranging from hundreds to tens of thousands of samples. For example, the Twi training set contains 15,794 samples, while the Chokwe training set only has 169 samples. This dataset is applicable to tasks such as automatic speech recognition, speech synthesis, low-resource language speech modeling, and multilingual speech representation learning.
数据集概述:jw-african-speech
该数据集是一个大规模、多语种的非洲语言语音数据集,主要用于语音识别等相关任务。数据来源于 JW.org(耶和华见证人官方网站)上的朗读音频与对应文本。
数据集结构
数据集包含多个子集(config_name),每个子集代表一种非洲语言或方言。每个实例包含以下字段:
- id (string):样本的唯一标识符。
- audio (audio):音频文件数据。
- text (string):音频对应的文本转录。
- duration (float64):音频时长(单位:秒)。
- source (string):数据来源。
- jw_code (string):该语言在 JW.org 上的代码。
- iso639_3 (string):该语言的 ISO 639-3 三字母代码。
数据划分
数据集的每个子集都划分为三个部分:
- train:训练集,用于模型训练。
- validation:验证集,用于模型调优和参数选择。
- test:测试集,用于最终评估模型性能。
注意:部分子集(如 atti_ati、chitonga_zimbabwe_toi、chokwe_cjk、chuabo_chw、cinamwanga_mwn、gitonga_toh)可能缺少 validation 或 test 集。
语言列表与统计信息
以下是数据集中包含的部分语言子集及其基本信息:
| 子集名称 (config_name) | 语言 (ISO 639-3) | 样本总数 | 大小 (Bytes) |
|---|---|---|---|
abbey_aba |
aba | 1776 | 147,733,617 |
ahanta_aha |
aha | 6908 | 585,343,165 |
aja_ajg |
ajg | 1942 | 253,493,696 |
amharic_amh |
amh | 11415 | 1,021,590,807 |
atti_ati |
ati | 482 | 38,864,835 |
baoule_bci |
bci | 2657 | 230,854,648 |
bassa_cameroon_bas |
bas | 16269 | 1,430,225,635 |
bassa_liberia_bsq |
bsq | 2284 | 175,973,197 |
bissau_guinean_creole_pov |
pov | 6573 | 556,933,381 |
boulou_bum |
bum | 5692 | 400,059,359 |
changana_mozambique_tso |
tso | 12394 | 1,169,426,360 |
chichewa_nya |
nya | 3884 | 350,548,984 |
chitonga_malawi_tog |
tog | 1480 | 122,283,839 |
chitonga_toi |
toi | 2487 | 193,652,784 |
chitonga_zimbabwe_toi |
toi | 486 | 40,911,284 |
chitumbuka_tum |
tum | 10365 | 827,991,271 |
chiyao_yao |
yao | 1647 | 130,060,278 |
chokwe_cjk |
cjk | 177 | 16,435,137 |
chopi_cce |
cce | 3789 | 292,319,031 |
chuabo_chw |
chw | 390 | 29,918,924 |
cibemba_bem |
bem | 3823 | 298,351,538 |
cinamwanga_mwn |
mwn | 553 | 47,705,968 |
cinyanja_nya |
nya | 1883 | 167,557,588 |
dagaare_dga |
dga | 7477 | 609,952,385 |
damara_naq |
naq | 789 | 55,880,738 |
dangme_ada |
ada | 1177 | 86,311,767 |
dinka_din |
din | 2496 | 199,975,562 |
douala_dua |
dua | 6521 | 593,155,207 |
edo_bin |
bin | 9028 | 752,787,118 |
esan_ish |
ish | 8499 | 693,796,536 |
ewe_ewe |
ewe | 9760 | 667,253,028 |
ewondo_ewo |
ewo | 1305 | 104,604,279 |
fang_fan |
fan | 3969 | 331,583,769 |
fante_fat |
fat | 7631 | 640,124,412 |
fon_fon |
fon | 10912 | 753,533,837 |
frafra_gur |
gur | 7960 | 684,666,023 |
ga_gaa |
gaa | 11939 | 776,960,199 |
gitonga_toh |
toh | 1319 | 117,962,503 |
(注意:上表仅列出README文件中展示的部分语言,完整语言列表请参考数据集发布页面。)
数据规模
- 总样本数(已知语言):超过 20万 个音频-文本对。
- 总数据量(已知语言):超过 20 GB。




