equal-ai/fleurs_south_asia_mini
收藏资源简介:
--- dataset_info: features: - name: id dtype: int32 - name: num_samples dtype: int32 - name: path dtype: string - name: audio dtype: audio: sampling_rate: 16000 - name: transcription dtype: string - name: raw_transcription dtype: string - name: gender dtype: class_label: names: '0': male '1': female '2': other - name: lang_id dtype: class_label: names: '0': af_za '1': am_et '2': ar_eg '3': as_in '4': ast_es '5': az_az '6': be_by '7': bg_bg '8': bn_in '9': bs_ba '10': ca_es '11': ceb_ph '12': ckb_iq '13': cmn_hans_cn '14': cs_cz '15': cy_gb '16': da_dk '17': de_de '18': el_gr '19': en_us '20': es_419 '21': et_ee '22': fa_ir '23': ff_sn '24': fi_fi '25': fil_ph '26': fr_fr '27': ga_ie '28': gl_es '29': gu_in '30': ha_ng '31': he_il '32': hi_in '33': hr_hr '34': hu_hu '35': hy_am '36': id_id '37': ig_ng '38': is_is '39': it_it '40': ja_jp '41': jv_id '42': ka_ge '43': kam_ke '44': kea_cv '45': kk_kz '46': km_kh '47': kn_in '48': ko_kr '49': ky_kg '50': lb_lu '51': lg_ug '52': ln_cd '53': lo_la '54': lt_lt '55': luo_ke '56': lv_lv '57': mi_nz '58': mk_mk '59': ml_in '60': mn_mn '61': mr_in '62': ms_my '63': mt_mt '64': my_mm '65': nb_no '66': ne_np '67': nl_nl '68': nso_za '69': ny_mw '70': oc_fr '71': om_et '72': or_in '73': pa_in '74': pl_pl '75': ps_af '76': pt_br '77': ro_ro '78': ru_ru '79': sd_in '80': sk_sk '81': sl_si '82': sn_zw '83': so_so '84': sr_rs '85': sv_se '86': sw_ke '87': ta_in '88': te_in '89': tg_tj '90': th_th '91': tr_tr '92': uk_ua '93': umb_ao '94': ur_pk '95': uz_uz '96': vi_vn '97': wo_sn '98': xh_za '99': yo_ng '100': yue_hant_hk '101': zu_za '102': all - name: language dtype: string - name: lang_group_id dtype: class_label: names: '0': western_european_we '1': eastern_european_ee '2': central_asia_middle_north_african_cmn '3': sub_saharan_african_ssa '4': south_asian_sa '5': south_east_asian_sea '6': chinese_japanase_korean_cjk splits: - name: train num_bytes: 9593315086.65 num_examples: 12115 - name: validation num_bytes: 1347809764.522 num_examples: 1713 - name: test num_bytes: 2770147416.758 num_examples: 3277 download_size: 13611036377 dataset_size: 13711272267.929998 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* ---
数据集信息: 1. 特征字段: - `id`:数据唯一标识,数据类型为32位整数(int32) - `num_samples`:样本总数,数据类型为32位整数(int32) - `path`:数据文件路径,数据类型为字符串(string) - `audio`:音频数据,其参数为:采样率(sampling_rate)16000Hz - `transcription`:标准化转录文本,数据类型为字符串(string) - `raw_transcription`:原始转录文本,数据类型为字符串(string) - `gender`:性别类别标签(class_label),类别映射为:`0`:男性(male),`1`:女性(female),`2`:其他(other) - `lang_id`:语言ID类别标签(class_label),类别编号与对应语言标识如下: `0`: 南非荷兰语(af_za),`1`: 阿姆哈拉语(am_et),`2`: 埃及阿拉伯语(ar_eg),`3`: 阿萨姆语(as_in),`4`: 阿斯图里亚斯语(ast_es),`5`: 阿塞拜疆语(az_az),`6`: 白俄罗斯语(be_by),`7`: 保加利亚语(bg_bg),`8`: 孟加拉语(bn_in),`9`: 波斯尼亚语(bs_ba),`10`: 加泰罗尼亚语(ca_es),`11`: 宿务语(ceb_ph),`12`: 索拉尼库尔德语(ckb_iq),`13`: 简体中文普通话(cmn_hans_cn),`14`: 捷克语(cs_cz),`15`: 威尔士语(cy_gb),`16`: 丹麦语(da_dk),`17`: 德语(de_de),`18`: 希腊语(el_gr),`19`: 美式英语(en_us),`20`: 拉丁美洲西班牙语(es_419),`21`: 爱沙尼亚语(et_ee),`22`: 波斯语(fa_ir),`23`: 富拉语(ff_sn),`24`: 芬兰语(fi_fi),`25`: 他加禄语(fil_ph),`26`: 法语(fr_fr),`27`: 爱尔兰语(ga_ie),`28`: 加利西亚语(gl_es),`29`: 古吉拉特语(gu_in),`30`: 豪萨语(ha_ng),`31`: 希伯来语(he_il),`32`: 印地语(hi_in),`33`: 克罗地亚语(hr_hr),`34`: 匈牙利语(hu_hu),`35`: 亚美尼亚语(hy_am),`36`: 印尼语(id_id),`37`: 伊博语(ig_ng),`38`: 冰岛语(is_is),`39`: 意大利语(it_it),`40`: 日语(ja_jp),`41`: 爪哇语(jv_id),`42`: 格鲁吉亚语(ka_ge),`43`: 卡姆巴语(kam_ke),`44`: 卡布列语(kea_cv),`45`: 哈萨克语(kk_kz),`46`: 高棉语(km_kh),`47`: 卡纳达语(kn_in),`48`: 韩语(ko_kr),`49`: 吉尔吉斯语(ky_kg),`50`: 卢森堡语(lb_lu),`51`: 卢干达语(lg_ug),`52`: 林加拉语(ln_cd),`53`: 老挝语(lo_la),`54`: 立陶宛语(lt_lt),`55`: 卢奥语(luo_ke),`56`: 拉脱维亚语(lv_lv),`57`: 毛利语(mi_nz),`58`: 马其顿语(mk_mk),`59`: 马拉雅拉姆语(ml_in),`60`: 蒙古语(mn_mn),`61`: 马拉地语(mr_in),`62`: 马来语(ms_my),`63`: 马耳他语(mt_mt),`64`: 缅甸语(my_mm),`65`: 挪威博克马尔语(nb_no),`66`: 尼泊尔语(ne_np),`67`: 荷兰语(nl_nl),`68`: 北索托语(nso_za),`69`: 齐切瓦语(ny_mw),`70`: 奥克西坦语(oc_fr),`71`: 奥罗莫语(om_et),`72`: 奥里亚语(or_in),`73`: 旁遮普语(pa_in),`74`: 波兰语(pl_pl),`75`: 普什图语(ps_af),`76`: 巴西葡萄牙语(pt_br),`77`: 罗马尼亚语(ro_ro),`78`: 俄语(ru_ru),`79`: 信德语(sd_in),`80`: 斯洛伐克语(sk_sk),`81`: 斯洛文尼亚语(sl_si),`82`: 修纳语(sn_zw),`83`: 索马里语(so_so),`84`: 塞尔维亚语(sr_rs),`85`: 瑞典语(sv_se),`86`: 斯瓦希里语(sw_ke),`87`: 泰米尔语(ta_in),`88`: 泰卢固语(te_in),`89`: 塔吉克语(tg_tj),`90`: 泰语(th_th),`91`: 土耳其语(tr_tr),`92`: 乌克兰语(uk_ua),`93`: 翁本杜语(umb_ao),`94`: 乌尔都语(ur_pk),`95`: 乌兹别克语(uz_uz),`96`: 越南语(vi_vn),`97`: 沃洛夫语(wo_sn),`98`: 科萨语(xh_za),`99`: 约鲁巴语(yo_ng),`100`: 香港繁体粤语(yue_hant_hk),`101`: 祖鲁语(zu_za),`102`: 全语言(all) - `language`:语言名称,数据类型为字符串(string) - `lang_group_id`:语言组ID类别标签(class_label),类别映射为: `0`: 西欧语系(western_european_we),`1`: 东欧语系(eastern_european_ee),`2`: 中亚、中东及北非与普通话语系(central_asia_middle_north_african_cmn),`3`: 撒哈拉以南非洲语系(sub_saharan_african_ssa),`4`: 南亚语系(south_asian_sa),`5`: 东南亚语系(south_east_asian_sea),`6`: 中日韩语系(chinese_japanase_korean_cjk) 2. 数据集划分: - 训练集(train):数据体量为9593315086.65字节,共包含12115条样本 - 验证集(validation):数据体量为1347809764.522字节,共包含1713条样本 - 测试集(test):数据体量为2770147416.758字节,共包含3277条样本 本次数据集的下载总大小为13611036377字节,总存储大小为13711272267.929998字节。 3. 数据集配置: 默认配置(default)对应的数据文件路径如下: - 训练集:匹配`data/train-*`路径下的所有数据文件 - 验证集:匹配`data/validation-*`路径下的所有数据文件 - 测试集:匹配`data/test-*`路径下的所有数据文件



