abdusah/masc
收藏资源简介:
MASC(大规模阿拉伯语语音语料库)是一个包含1000小时语音数据的数据集,采样率为16kHz,数据来自700多个YouTube频道。该数据集是多地区、多类型、多方言的,旨在推动阿拉伯语语音技术的研究和开发,特别是阿拉伯语语音识别。
MASC (Massive Arabic Speech Corpus) is a dataset containing 1,000 hours of speech data with a sampling rate of 16 kHz, collected from over 700 YouTube channels. This corpus is characterized by multi-regional, multi-genre, and multi-dialectal content, and is designed to advance research and development of Arabic speech technologies, particularly Arabic speech recognition.
数据集概述
数据集名称
MASC: MASSIVE ARABIC SPEECH CORPUS
数据集描述
数据集摘要
MASC是一个包含1,000小时16 kHz采样率的语音数据集,从超过700个YouTube频道收集而来。该数据集旨在推动阿拉伯语音技术,特别是阿拉伯语音识别的研究和发展。
支持的任务和排行榜
[信息待补充]
语言
多口音阿拉伯语
数据集结构
数据实例
[信息待补充]
数据字段
- masc_dev
- speech
- sampling_rate
- target_text (label)
数据分割
- masc_dev
- train: 100
- test: 40
数据集创建
来源数据
初始数据收集和标准化
[信息待补充]
源语言生产者
[信息待补充]
注释
注释过程
[信息待补充]
注释者
[信息待补充]
使用数据的考虑
数据集的社会影响
[信息待补充]
偏见的讨论
[信息待补充]
其他已知限制
[信息待补充]
附加信息
数据集管理者
[信息待补充]
许可证信息
CC 4.0
引用信息
Mohammad Al-Fetyani, Muhammad Al-Barham, Gheith Abandah, Adham Alsharkawi, Maha Dawas, August 18, 2021, "MASC: Massive Arabic Speech Corpus", IEEE Dataport, doi: https://dx.doi.org/10.21227/e1qb-jv46.




