该数据集是从Common Voice Arabic Corpus 12.0派生而来的,包含了自动添加音标的转录和音素表示。数据集中的录音是由用户朗读的阿拉伯语文本,这些文本最初没有音标,可能导致阅读错误。音标和音素是自动生成的,因此数据集对于语音识别任务有价值,但存在固有的噪声。数据集创建于SDAIA冬季学校,适用于对现代标准阿拉伯语的音标化语音数据和语音转换音频感兴趣的研究人员和从业者。音频文件
This dataset portfolio consists of 632 hours of transcribed Singaporean English scripted speech focusing on daily use sentences contributed by 996 speakers.