anton-l/common_language
收藏资源简介:
Common Language数据集是从CommonVoice数据库中精心挑选的语音录音组成,总时长为45.1小时,每种语言包含1小时的录音材料。数据集用于训练语言识别系统。数据集包含多种语言,如阿拉伯语、巴斯克语、布列塔尼语、加泰罗尼亚语、中文(中国大陆、香港、台湾)、楚瓦什语、捷克语、迪维希语、荷兰语、英语、世界语、爱沙尼亚语、法语、弗里斯兰语、格鲁吉亚语、德语、希腊语、哈卡钦语、印度尼西亚语、国际语、意大利语、日语、卡拜尔语、基尼亚卢旺达语、吉尔吉斯语、拉脱维亚语、马耳他语、蒙古语、波斯语、波兰语、葡萄牙语、罗马尼亚语、罗曼什语、俄语、萨哈语、斯洛文尼亚语、西班牙语、瑞典语、泰米尔语、鞑靼语、土耳其语、乌克兰语和威尔士语。数据集已经平衡并分为训练集、开发集(验证集)和测试集。每个数据点包括音频文件的路径和其语言标签,以及年龄、客户端ID、性别和句子等附加字段。数据集由在线捐赠语音的人组成,用户同意不尝试确定Common Voice数据集中说话者的身份。
The Common Language Dataset is curated from the CommonVoice database, comprising speech recordings with a total duration of 45.1 hours, with 1 hour of material per language. It is used for training language recognition systems. The dataset includes a diverse range of languages, such as Arabic, Basque, Breton, Catalan, Chinese (Mainland China, Hong Kong, Taiwan), Chuvash, Czech, Divehi, Dutch, English, Esperanto, Estonian, French, Frisian, Georgian, German, Greek, Hakha Chin, Indonesian, Interlingua, Italian, Japanese, Kabyle, Kinyarwanda, Kyrgyz, Latvian, Maltese, Mongolian, Persian, Polish, Portuguese, Romanian, Romansh, Russian, Sakha, Slovenian, Spanish, Swedish, Tamil, Tatar, Turkish, Ukrainian, and Welsh. The dataset is balanced and split into training, development (validation), and test sets. Each data point includes the path to the audio file and its language label, along with additional fields such as age, client ID, gender, and the transcribed sentence. The dataset consists of online volunteers who donated their speech, and users agree not to attempt to identify the speakers in the Common Voice dataset.
数据集概述
数据集名称
- 名称: Common Language
数据集创建
- 标注创建者: 众包
- 语言创建者: 众包
语言多样性
- 支持语言: 包含37种语言,如阿拉伯语、巴斯克语、布列塔尼语、加泰罗尼亚语、中文(中国大陆、香港、台湾)、楚瓦什语、捷克语、迪维希语、荷兰语、英语、世界语、爱沙尼亚语、法语、弗里斯兰语、格鲁吉亚语、德语、希腊语、哈卡钦语、印度尼西亚语、国际语、意大利语、日语、卡拜尔语、基尼亚卢旺达语、吉尔吉斯语、拉脱维亚语、马耳他语、蒙古语、波斯语、波兰语、葡萄牙语、罗马尼亚语、罗曼什语、俄语、萨哈语、斯洛文尼亚语、西班牙语、瑞典语、泰米尔语、塔塔尔语、土耳其语、乌克兰语、威尔士语。
数据集规模
- 规模: 数据集大小介于10万至100万之间。
数据集来源
- 来源: 扩展自Common Voice数据库。
任务类别
- 任务类别: 语音处理
- 任务ID: 语音分类
数据集结构
- 数据实例: 每个数据点包含音频文件路径和语言标签,以及其他字段如年龄、客户端ID、性别和句子。
- 数据字段: 包括客户端ID、路径、语言、句子、年龄和性别。
- 数据分割: 已平衡并分为训练、验证和测试集。
数据集创建注意事项
- 个人信息和敏感信息: 数据集包含在线捐赠声音的人,用户同意不尝试确定Common Voice数据集中说话者的身份。
- 已知限制: 蒙古语和乌克兰语在本版本数据集中被拼写为"Mangolian"和"Ukranian"。
许可证
- 许可证: cc-by-nc-4.0
引用信息
@dataset{ganesh_sinisetty_2021_5036977, author = {Ganesh Sinisetty and Pavlo Ruban and Oleksandr Dymov and Mirco Ravanelli}, title = {CommonLanguage}, month = jun, year = 2021, publisher = {Zenodo}, version = {0.1}, doi = {10.5281/zenodo.5036977}, url = {https://doi.org/10.5281/zenodo.5036977} }




