遇见数据集

CL-MASR

收藏
Zenodo2023-06-28 更新2026-05-29 收录
数据链接:
官方服务:

资源简介:

<strong>CL-MASR Dataset</strong> This is the dataset used in the continual learning for multilingual ASR (CL-MASR) benchmark. It is composed of speech recordings from 20 languages selected from the Common Voice 13 dataset. For each language, it includes up to 10/1/1 hours for train/dev/test, respectively. The CL-MASR benchmark platform is available in the SpeechBrain toolkit (see recipes/CommonVoice):<br> https://github.com/speechbrain/speechbrain The original Common Voice 13 data are available at:<br> https://commonvoice.mozilla.org/en/datasets <strong>List of Languages</strong> - English (en)<br> - Chinese (zh-CN)<br> - German (de)<br> - Spanish (es)<br> - Russian (ru)<br> - French (fr)<br> - Portuguese (pt)<br> - Japanese (ja)<br> - Turkish (tr)<br> - Polish (pl)<br> - Kinyarwanda (rw)<br> - Esperanto (eo)<br> - Kabyle (kab)<br> - Luganda (lg)<br> - Meadow Mari (mhr)<br> - Central Kurdish (ckb)<br> - Abkhaz (ab)<br> - Kurmanji Kurdish (kmr)<br> - Frisian (fy-NL)<br> - Interlingua (ia)

**CL-MASR 数据集** 本数据集用于多语言自动语音识别(Automatic Speech Recognition,ASR)的持续学习基准评测(CL-MASR)。该数据集由从通用语音13(Common Voice 13)数据集中遴选的20种语言的语音录音构成。针对每种语言,其训练集、开发集、测试集的最大时长分别为10小时、1小时、1小时。CL-MASR基准评测平台可在SpeechBrain工具包中获取(详见recipes/CommonVoice路径): https://github.com/speechbrain/speechbrain 原始通用语音13数据集可通过以下地址获取: https://commonvoice.mozilla.org/en/datasets **语言列表** - 英语(en) - 简体中文(zh-CN) - 德语(de) - 西班牙语(es) - 俄语(ru) - 法语(fr) - 葡萄牙语(pt) - 日语(ja) - 土耳其语(tr) - 波兰语(pl) - 金亚凡瓦语(rw) - 世界语(eo) - 卡拜尔语(kab) - 卢干达语(lg) - 草原马里语(mhr) - 中库尔德语(ckb) - 阿布哈兹语(ab) - 库尔曼吉库尔德语(kmr) - 弗里西语(fy-NL) - 国际语(ia)

提供机构:
Zenodo
创建时间:
2023-06-22
二维码
社区交流群
二维码
科研交流群
商业服务