CL-MASR
收藏资源简介:
<strong>CL-MASR Dataset</strong> This is the dataset used in the continual learning for multilingual ASR (CL-MASR) benchmark. It is composed of speech recordings from 20 languages selected from the Common Voice 13 dataset. For each language, it includes up to 10/1/1 hours for train/dev/test, respectively. The CL-MASR benchmark platform is available in the SpeechBrain toolkit (see recipes/CommonVoice):<br> https://github.com/speechbrain/speechbrain The original Common Voice 13 data are available at:<br> https://commonvoice.mozilla.org/en/datasets <strong>List of Languages</strong> - English (en)<br> - Chinese (zh-CN)<br> - German (de)<br> - Spanish (es)<br> - Russian (ru)<br> - French (fr)<br> - Portuguese (pt)<br> - Japanese (ja)<br> - Turkish (tr)<br> - Polish (pl)<br> - Kinyarwanda (rw)<br> - Esperanto (eo)<br> - Kabyle (kab)<br> - Luganda (lg)<br> - Meadow Mari (mhr)<br> - Central Kurdish (ckb)<br> - Abkhaz (ab)<br> - Kurmanji Kurdish (kmr)<br> - Frisian (fy-NL)<br> - Interlingua (ia)
<strong>CL-MASR 数据集</strong> 本数据集为面向多语言自动语音识别(Automatic Speech Recognition, ASR)的持续学习基准测试(CL-MASR 基准测试)所用数据集。其语音录音源自 Common Voice 13 数据集,共涵盖20种语言。针对每种语言,该数据集分别提供至多10小时的训练集、1小时的开发集与1小时的测试集。CL-MASR 基准测试平台已集成于 SpeechBrain 工具包中(详见 recipes/CommonVoice 路径):<br> https://github.com/speechbrain/speechbrain 原始 Common Voice 13 数据集可通过以下地址获取:<br> https://commonvoice.mozilla.org/en/datasets <strong>语言列表</strong> - 英语(en) - 简体中文(zh-CN) - 德语(de) - 西班牙语(es) - 俄语(ru) - 法语(fr) - 葡萄牙语(pt) - 日语(ja) - 土耳其语(tr) - 波兰语(pl) - 卢旺达语(rw) - 世界语(eo) - 卡拜尔语(kab) - 卢干达语(lg) - 草原马里语(mhr) - 中库尔德语(ckb) - 阿布哈兹语(ab) - 库尔曼吉库尔德语(kmr) - 荷兰弗里西语(fy-NL) - 因特林瓜语(ia)



