遇见数据集

Massive Arabic Speech Corpus (MASC)

收藏
OpenXLab2026-04-18 收录
官方服务:

资源简介:

本文介绍了大规模阿拉伯语语音语料库 (MASC) 的创建。MASC是一个数据集,包含以16 kHz采样的1,000小时语音,并从700多个YouTube频道中抓取。该数据集是多区域,多流派和多方言的,旨在促进阿拉伯语语音技术的研究和开发,特别强调阿拉伯语语音识别。除了MASC之外,还开发了预训练的3-gram语言模型和预训练的自动语音识别模型,并将其提供给感兴趣的研究人员。为了增强语言模型,需要新的和包容性的阿拉伯语语音语料库,因此,还创建并发布了最初从Twitter抓取的12 m独特阿拉伯语单词的数据集。

提供机构:
OpenDataLab
创建时间:
2023-10-20
二维码
社区交流群
二维码
科研交流群
商业服务