leyu-amharic-speech-team-qal
收藏资源简介:
Leyu Ethiopian Languages Speech Dataset 是一个面向埃塞俄比亚两种语言的语音数据集,涵盖阿姆哈拉语(Amharic)和阿法安奥罗莫语(Afaan Oromo)。数据集包含528条音频-文本对,音频格式为M4A,时长在10至60秒之间。所有录音均通过Leyu数据收集平台由真人志愿者录制,并经过人工审核批准,确保数据质量。每条记录包含提示文本、音频文件、语言代码、方言名称、匿名说话人ID和性别。该数据集适用于自动语音识别(ASR)和文本转语音(TTS)任务。数据按方言分布:阿姆哈拉语的Shewa方言(480条)和Wollo方言(24条),阿法安奥罗莫语的East/Western (Hararghe)方言(24条),总时长约3.65小时,共有7位说话人。数据集以CC-BY-4.0许可证发布,数据收集仍在进行中(截至2026-08-21),后续将随更多音频审核通过而更新。
Leyu Ethiopian Languages Speech Dataset is a speech dataset for two Ethiopian languages, covering Amharic and Afaan Oromo. The dataset contains 528 audio-text pairs in M4A format, with durations ranging from 10 to 60 seconds. All recordings are made by real volunteers through the Leyu data collection platform and manually reviewed for quality assurance. Each record includes prompt text, audio file, language code, dialect name, anonymized speaker ID, and gender. The dataset is suitable for automatic speech recognition (ASR) and text-to-speech (TTS) tasks. Data distribution by dialect: Shewa (480) and Wollo (24) dialects of Amharic, East/Western (Hararghe) dialect (24) of Afaan Oromo, total duration approximately 3.65 hours, with 7 speakers. The dataset is released under the CC-BY-4.0 license, and data collection is ongoing (as of 2026-08-21), with updates as more audio passes review.
Leyu 埃塞俄比亚语言语音数据集
数据集概述
该数据集收录了与文本转写对应的音频录音,通过 Leyu 数据采集平台(一个开源众包语音数据采集平台)为 Leyu 平台竞赛收集,覆盖两种语言:阿姆哈拉语和阿法安奥罗莫语。
基本信息
- 语言: 阿姆哈拉语(
am)、阿法安奥罗莫语(om) - 总样本数: 696
- 许可证: CC-BY-4.0
- 任务类别: 自动语音识别(ASR)、文本转语音(TTS)
- 音频格式: M4A,每段 10–60 秒
- 数据来源: 通过 Leyu 移动应用进行真人实时录音,不含合成或外部来源的音频
按语言和方言分布
| 语言 | 方言 | 片段数 | 时长(小时) | 说话人数 | 男性 | 女性 |
|---|---|---|---|---|---|---|
| 阿法安奥罗莫语 | 东部/西部(哈拉尔) | 24 | 0.24 | 1 | 24 | 0 |
| 阿姆哈拉语 | 谢瓦方言 | 624 | 4.21 | 6 | 444 | 180 |
| 阿姆哈拉语 | 沃洛方言 | 48 | 0.29 | 2 | 0 | 48 |
| 合计 | 696 | 4.74 |
数据结构
每行对应一段朗读录音,包含以下字段:
| 列名 | 类型 | 描述 |
|---|---|---|
text |
字符串 | 说话者朗读的提示文本 |
audio |
音频 | 录制的音频片段(10–60 秒) |
language |
字符串 | 语言的 ISO 639 代码(am、om、ti、sid) |
dialect |
字符串 | 录音的具名方言 |
speaker_id |
字符串 | 匿名化的贡献者标识符 |
gender |
字符串 | 说话者报告的性别(Male / Female) |
数据来源与质量控制
- 提示文本由团队撰写(非抓取或摘自受版权保护的第三方文本),由志愿者通过 Leyu 移动应用录制。
- 每条提交均经过贡献者录音、人工审核/项目经理批准后才被纳入本数据集。
- 本仓库仅包含 Leyu 平台数据库中
status = Approved的条目,与平台自身的审计日志一致。
注意事项
- 数据采集仍在进行中(持续至 2026-08-21),随着更多音频获批,数据集会持续更新。
- 方言和说话人的覆盖范围仍在增长中,当前各语言的代表性详见上方分布表。
许可与归属
数据集以 CC-BY-4.0 许可证发布,为 Leyu 平台竞赛而收集,由 gheero(Leyu 平台团队)主办,位于埃塞俄比亚亚的斯亚贝巴。




