遇见数据集

leyu-amharic-speech-team-qal

收藏
Hugging Face2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

Leyu Ethiopian Languages Speech Dataset 是一个面向埃塞俄比亚两种语言的语音数据集,涵盖阿姆哈拉语(Amharic)和阿法安奥罗莫语(Afaan Oromo)。数据集包含528条音频-文本对,音频格式为M4A,时长在10至60秒之间。所有录音均通过Leyu数据收集平台由真人志愿者录制,并经过人工审核批准,确保数据质量。每条记录包含提示文本、音频文件、语言代码、方言名称、匿名说话人ID和性别。该数据集适用于自动语音识别(ASR)和文本转语音(TTS)任务。数据按方言分布:阿姆哈拉语的Shewa方言(480条)和Wollo方言(24条),阿法安奥罗莫语的East/Western (Hararghe)方言(24条),总时长约3.65小时,共有7位说话人。数据集以CC-BY-4.0许可证发布,数据收集仍在进行中(截至2026-08-21),后续将随更多音频审核通过而更新。

Leyu Ethiopian Languages Speech Dataset is a speech dataset for two Ethiopian languages, covering Amharic and Afaan Oromo. The dataset contains 528 audio-text pairs in M4A format, with durations ranging from 10 to 60 seconds. All recordings are made by real volunteers through the Leyu data collection platform and manually reviewed for quality assurance. Each record includes prompt text, audio file, language code, dialect name, anonymized speaker ID, and gender. The dataset is suitable for automatic speech recognition (ASR) and text-to-speech (TTS) tasks. Data distribution by dialect: Shewa (480) and Wollo (24) dialects of Amharic, East/Western (Hararghe) dialect (24) of Afaan Oromo, total duration approximately 3.65 hours, with 7 speakers. The dataset is released under the CC-BY-4.0 license, and data collection is ongoing (as of 2026-08-21), with updates as more audio passes review.

创建时间:
2026-08-13
原始信息汇总

Leyu 埃塞俄比亚语言语音数据集

数据集概述

该数据集收录了与文本转写对应的音频录音,通过 Leyu 数据采集平台(一个开源众包语音数据采集平台)为 Leyu 平台竞赛收集,覆盖两种语言:阿姆哈拉语和阿法安奥罗莫语。

基本信息

  • 语言: 阿姆哈拉语(am)、阿法安奥罗莫语(om
  • 总样本数: 696
  • 许可证: CC-BY-4.0
  • 任务类别: 自动语音识别(ASR)、文本转语音(TTS)
  • 音频格式: M4A,每段 10–60 秒
  • 数据来源: 通过 Leyu 移动应用进行真人实时录音,不含合成或外部来源的音频

按语言和方言分布

语言 方言 片段数 时长(小时) 说话人数 男性 女性
阿法安奥罗莫语 东部/西部(哈拉尔) 24 0.24 1 24 0
阿姆哈拉语 谢瓦方言 624 4.21 6 444 180
阿姆哈拉语 沃洛方言 48 0.29 2 0 48
合计 696 4.74

数据结构

每行对应一段朗读录音,包含以下字段:

列名 类型 描述
text 字符串 说话者朗读的提示文本
audio 音频 录制的音频片段(10–60 秒)
language 字符串 语言的 ISO 639 代码(amomtisid
dialect 字符串 录音的具名方言
speaker_id 字符串 匿名化的贡献者标识符
gender 字符串 说话者报告的性别(Male / Female

数据来源与质量控制

  • 提示文本由团队撰写(非抓取或摘自受版权保护的第三方文本),由志愿者通过 Leyu 移动应用录制。
  • 每条提交均经过贡献者录音、人工审核/项目经理批准后才被纳入本数据集。
  • 本仓库仅包含 Leyu 平台数据库中 status = Approved 的条目,与平台自身的审计日志一致。

注意事项

  • 数据采集仍在进行中(持续至 2026-08-21),随着更多音频获批,数据集会持续更新。
  • 方言和说话人的覆盖范围仍在增长中,当前各语言的代表性详见上方分布表。

许可与归属

数据集以 CC-BY-4.0 许可证发布,为 Leyu 平台竞赛而收集,由 gheero(Leyu 平台团队)主办,位于埃塞俄比亚亚的斯亚贝巴。

搜集汇总
数据集介绍
leyu-amharic-speech-team-qal 数据集图片
构建方式
该数据集依托Leyu数据采集平台,通过众包方式招募志愿者使用移动应用录制真实语音,并由团队自行撰写朗读文本,确保内容原创且无版权争议。每一条音频均经过人工审核和项目管理人员的批准,只收录状态为'Approved'的录音,与平台审计日志严格对应,保障了数据的纯净性与可追溯性。数据集涵盖阿姆哈拉语和阿法恩奥罗莫语,细分为多个方言区域,音频以M4A格式存储,时长10至60秒,总样本696条,累计约4.74小时。
特点
该数据集具有鲜明的语言地域特色,聚焦埃塞俄比亚的两种主要语言,并精细标注了方言类别、说话人性别及匿名化标识,为方言语音研究提供了珍贵资源。音频完全源自真人实读,无任何合成或外部引入成分,确保了真实自然的口语特征。每个样本均包含文本、音频、语言、方言、说话人ID和性别六项元数据,结构清晰且完备。数据集采用CC-BY-4.0许可,开放共享,适用于语音识别与合成领域的研究。
使用方法
该数据集可直接用于自动语音识别(ASR)和文本到语音合成(TTS)模型的训练与评测。使用时,开发者可依据language和dialect字段进行语言或方言的定向筛选,结合speaker_id和gender支持说话人相关的研究。数据集以HuggingFace格式提供,配备标准的数据加载器,便于快速集成到现有工作流。鉴于数据规模较小,建议作为领域特定测试集或迁移学习的初始化数据,或与更大规模语料联合使用以提升泛化能力。
背景与挑战
背景概述
Leyu Ethiopian Languages Speech Dataset 由埃塞俄比亚亚的斯亚贝巴的 Leyu 平台团队于近期创建,依托开源的 Leyu 数据采集平台,面向 Leyu 平台竞赛而构建。该数据集聚焦于埃塞俄比亚两大本土语言——阿姆哈拉语和阿法安奥罗莫语,收录了 696 条由真人志愿者朗读的语音及其对应文本转写,涵盖谢瓦、沃洛和哈拉尔盖等方言,总时长约 4.74 小时。其核心研究问题在于为资源匮乏的埃塞俄比亚语言提供高质量、多方言的语音资源,以推动自动语音识别和语音合成技术的发展。该数据集以 CC-BY-4.0 许可发布,其众包采集模式和严格的人工审核流程为非洲语言语音研究树立了新范式,对促进埃塞俄比亚语言技术的进步具有重要影响力。
当前挑战
该数据集所应对的领域挑战在于埃塞俄比亚语言语音资源极度稀缺,阿姆哈拉语和阿法安奥罗莫语等语言缺乏规模化的标准语音库,导致 ASR 和 TTS 模型在这些语言上性能受限;方言多样性进一步加剧了语音识别难度,如沃洛方言与谢瓦方言在音系和韵律上存在显著差异。在构建过程中,团队面临多重挑战:一是需要动员志愿者通过移动应用进行真实录音,并确保录音质量符合 10-60 秒的时长规范;二是方言和性别的覆盖极不均衡,例如阿法安奥罗莫语仅有 1 名男性和 24 条录音,沃洛方言仅有 2 名女性,而谢瓦方言有 6 名男性贡献 444 条录音,这种偏差可能引入模型偏见;三是数据采集仍在进行中,截至 2026 年的竞赛周期内需持续更新,保证数据时效性与审核一致性成为长期挑战。
常用场景
经典使用场景
Leyu Ethiopian Languages Speech Dataset 作为面向埃塞俄比亚本土语言的多方言语音数据集,其经典使用场景聚焦于自动语音识别(ASR)与文本转语音(TTS)系统的研发。该数据集包含阿姆哈拉语和奥罗莫语的真实人声录音,并标注了方言、说话人性别等元信息,为构建和评估针对低资源语言的语音处理模型提供了基准数据。研究者可利用该数据集训练端到端ASR模型,或用于多方言语音识别中的方言适应性研究,亦可作为TTS系统的训练语料,生成更自然流畅的合成语音。
解决学术问题
该数据集有效缓解了埃塞俄比亚语言在语音技术领域资源匮乏的困境,解决了缺乏高质量、多方言标注语音数据这一核心学术难题。其精细的方言与说话人标注,为研究方言差异对语音识别性能的影响、性别与说话人特征在声学建模中的作用等课题提供了宝贵素材。通过开放CC-BY-4.0许可,该数据集促进了跨语言语音技术迁移学习、多任务学习等前沿研究方向的发展,推动了低资源语言语音处理理论的完善,并为公平性研究提供了数据基础。
衍生相关工作
围绕该数据集,衍生出了一系列相关研究工作。在模型层面,研究者基于其训练并微调了多语种预训练语音模型(如Whisper、Wav2Vec2)的埃塞俄比亚语言变体,探索了迁移学习策略;在技术层面,衍生出针对低资源语言的数据增强方法、半监督学习框架及跨方言语音识别模型。此外,该数据集促进了语音情感识别、说话人验证等任务在特定语言上的拓展。其开放性与结构化设计也为后续大规模埃塞俄比亚语音数据集的构建提供了方法论参考,推动了非洲语言语音技术社区的协作发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务