african-speech-ipa
收藏资源简介:
该数据集是一个面向自动语音识别(ASR)任务的多语言非洲语言语音数据集。数据集中包含来自多种非洲语言的音频录音,每个样本均提供对应的文字转录(transcript)和IPA音标(ipa)标注。音频采样率为16000 Hz。每个子集对应一种特定语言,以ISO 639-3代码标识。字段包括:audio(音频)、transcript(转录文本)、ipa(国际音标)、duration(音频时长,浮点数)、language(语言名称)、iso639_3(语言ISO代码)。该数据集适用于训练和评估多语言或低资源语言的自动语音识别系统,特别是针对非洲语言。
This dataset is a multilingual African language speech dataset for automatic speech recognition (ASR) tasks. It contains audio recordings from multiple African languages, each sample providing corresponding text transcript and IPA phonetic annotation. The audio sample rate is 16000 Hz. Each subset corresponds to a specific language identified by its ISO 639-3 code. Fields include: audio, transcript, ipa (International Phonetic Alphabet), duration (float), language (language name), and iso639_3 (ISO code of the language). The dataset is suitable for training and evaluating ASR systems for multilingual or low-resource languages, particularly those focused on African languages.
数据集详情总结
数据集名称
african-speech-ipa(由 AfriSpeech 组织发布)
数据集简介
这是一个专注于非洲语言语音识别的数据集,包含语音音频、文本转录和国际音标(IPA)标注。数据集覆盖了大量非洲语言,每个语言都有独立的配置(config),方便用户按需使用。
许可协议
- cc-by-4.0(知识共享署名4.0国际许可)
任务类型
- 自动语音识别(Automatic Speech Recognition, ASR)
支持的语言
该数据集覆盖了超过100种非洲语言(以ISO 639-3代码列出),包括但不限于:
- 阿姆哈拉语(amh)
- 豪萨语(hau)
- 伊博语(ibo)
- 约鲁巴语(yor)
- 斯瓦希里语(swa)
- 祖鲁语(zul)
- 绍纳语(sna)
- 以及大量其他非洲本土语言
数据标签
- phonemes (音素)
- ipa (国际音标)
- african-languages (非洲语言)
- speech (语音)
数据集结构
数据集包含多个配置(config),每个配置对应一种语言或方言。每个配置包含相同的字段结构:
字段说明
| 字段名 | 数据类型 | 说明 |
|---|---|---|
audio |
音频(采样率:16000 Hz) | 语音音频文件 |
transcript |
字符串 | 文本转录 |
ipa |
字符串 | 国际音标标注 |
duration |
浮点数(float32) | 音频时长 |
language |
字符串 | 语言名称 |
iso639_3 |
字符串 | ISO 639-3 语言代码 |
配置示例
abbey_abaahanta_ahaaja_ajgamharic_amhatti_atibaoule_bci- ... (以此类推,每个语言一个配置)
数据用途
该数据集适用于训练和评估非洲语言语音识别系统,特别是针对多语言、低资源场景,同时支持基于国际音标的语音建模研究。
数据规模
虽然README中未明确给出总样本量,但每个配置均包含音频文件、文本转录和IPA标注,适合用于监督学习任务。




