遇见数据集

ghana-speech-eval

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

ghana-speech-eval是一个用于加纳语言的多源自动语音识别(ASR)评估基准数据集,旨在为加纳及周边地区使用的多种语言提供标准化的语音识别测试集。所有音频样本为16 kHz单声道格式,遵循统一标准化模式。数据集包含四个主要来源组:JW.org语音(AfriSpeech v1)、圣经音频对齐数据、联合国儿童基金会健康主题录音和金融领域语音,每个来源组对样本长度和每种语言的样本数量上限有不同规定,样本长度从3秒到60秒不等。数据集共包含57个配置,覆盖了阿坎语系的Twi(合并了Asante和Akuapem方言)、埃维语、达格巴尼语、芳蒂语、加语等广泛语言,其中圣经组覆盖了多达41种语言。每个数据样本包含音频波形、参考文本转录、语言标签、国家代码(ISO 3166-1 alpha-2)、片段时长(秒)、语言ISO 639-3代码以及标识来源和配置的子集名称。该数据集适用于多语言语音识别模型的评估、加纳及非洲语言语音技术研究,以及低资源语言ASR系统的基准测试。

ghana-speech-eval is a multi-source automatic speech recognition (ASR) evaluation benchmark dataset for Ghanaian languages, designed to provide standardized speech recognition test sets for multiple languages used in Ghana and surrounding regions. All audio samples are in 16 kHz mono format and follow a unified standardization pattern. The dataset includes four main source groups: JW.org speech (AfriSpeech v1), Bible audio alignment data, UNICEF health topic recordings, and financial domain speech, with each group having different regulations on sample length and the maximum number of samples per language, ranging from 3 seconds to 60 seconds. The dataset consists of 57 configurations, covering a wide range of languages including Twi from the Akan language family (combining Asante and Akuapem dialects), Ewe, Dagbani, Fante, Ga, among others, with the Bible group covering up to 41 languages. Each data sample includes the following fields: audio waveform, reference text transcription, language label, country code (ISO 3166-1 alpha-2), segment duration in seconds, language ISO 639-3 code, and subset name identifying the source and configuration. This dataset is suitable for evaluating multilingual speech recognition models, researching speech technology for Ghanaian and African languages, and benchmarking low-resource language ASR systems.

创建时间:
2026-07-22
原始信息汇总

数据集概述:ghana-speech-eval

描述
一个多源自动语音识别(ASR)评估基准,专注于加纳语言。所有子集均为16 kHz单声道音频,并采用标准化模式(包含audiotextlanguagecountrylengthisosubset字段)。

数据来源与分组
数据集包含四个来源组,每个组有各自的片段长度和每种语言的容量上限:

组别 描述 片段长度 每语言上限
jw_* 来自JW.org的语音(AfriSpeech v1) 3–15秒 1,000
bible_* 圣经音频对齐数据(ghana-speech) 3–15秒 1,000
unicef_* 联合国儿童基金会健康录音 3–60秒 全部可用(约195–200)
finance_* 金融领域语音 0–60秒 1,000

Twi说明: bible_twi_twi 合并了阿散蒂特威语(Asante)和阿夸皮姆特威语(Akuapem Twi)(各500条,平衡)。finance_twi 同理合并(各500条,平衡)。

配置(共57个)

  • JW组(jw_*:10个配置,涵盖阿汉塔语、达加雷语、丹格贝语、埃维语、芳蒂语、弗拉弗拉语、加语、恩泽马语、塞维语、特威语。
  • 圣经组(bible_*:41个配置,涵盖特威语、芳蒂语、埃维语、达格巴尼语、丹格贝语、恩泽马语、塞维语、库萨尔语、马姆普鲁利语、富尔富尔德语、比萨语、豪萨语、卡比耶语、纳武里语、孔科姆巴语、贡贾语、卡塞姆语、孔尼语、恩特鲁博语、比莫巴语、布里语、春布鲁古语、达加雷语、德格语、吉科德语、莱莱米语、恩科尼亚语、帕萨阿尔语、塞克佩莱语、塞莱语、西萨阿拉语、西乌语、坦普尔马语、泰姆语、图武利语、瓦格拉语、阿尼语、阿瓦蒂梅语、巴萨尔语、比里福尔语、宁卡雷语。
  • 联合国儿童基金会组(unicef_*:3个配置,涵盖埃维语、达格巴尼语、特威语。
  • 金融组(finance_*:3个配置,涵盖加语、芳蒂语、特威语。

加载方式
使用Hugging Face Datasets库加载特定配置或所有配置: python from datasets import load_dataset

加载特定配置

ds = load_dataset("ghananlpcommunity/ghana-speech-eval", "finance_twi", split="train")

加载所有配置

ds = load_dataset("ghananlpcommunity/ghana-speech-eval")

模式(Schema)

列名 类型 描述
audio Audio 解码后的波形(16 kHz单声道)
text string 参考转写文本
language string 语言标签
country string ISO 3166-1 alpha-2国家代码
length float64 片段时长(秒)
iso string ISO 639-3语言代码
subset string 格式为 <前缀>_<配置>

许可证
CC-BY-4.0。使用时需遵守每个源数据集的条款。

搜集汇总
数据集介绍
ghana-speech-eval 数据集图片
构建方式
该数据集构建自四大语音来源:JW.org宗教演讲(源自AfriSpeech v1语料库)、圣经录音与文本对齐、联合国儿童基金会健康领域录音,以及金融领域语音数据。每个来源均按语言与领域划分,形成57个子配置,涵盖加纳境内及周边地区47种语言。所有音频统一为16kHz单声道,并采用标准化字段结构,确保跨源数据的一致性与可比性。部分配置如Twi语在圣经与金融子集中平衡整合了Asante与Akuapem两种方言,每方言各500条,以提升代表性。
特点
该评测基准的核心特点在于多源异构数据的系统融合:既有宗教与健康领域的自然语音,又有专业金融场景的录音,覆盖时长从3秒至60秒不等。各语言子集设置每人上限(通常1000条),兼顾评测的全面性与计算可行性。统一的数据模式包含音频、文本、语言代码、国家、时长等字段,便于直接用于自动化语音识别系统的评估。特别设计Twi语的方言平衡策略,增强了对语言变体的评估能力。
使用方法
研究者可通过HuggingFace Datasets库直接加载,支持按需选择单一子配置(如`finance_twi`)或一次性加载全部57个配置进行多语言评测。返回的数据集采用标准化Schema,包含16kHz单声道音频及对应转录文本,可直接输入ASR模型。使用前需遵守各来源数据的CC-BY-4.0许可条款,确保在商业或学术场景中合规应用。该基准特别适合评估多语言语音识别系统在低资源加纳语系上的泛化表现。
背景与挑战
背景概述
加纳语种语音评估基准数据集ghana-speech-eval由加纳NLP社区于2023年创建,旨在填补非洲语言语音识别系统中评估资源匮乏的空白。该数据集整合了来自JW.org宗教演讲、圣经音频对齐、联合国儿童基金会健康录音及金融领域语料四大来源的语音数据,涵盖57种配置、跨越40余种加纳本土语言,包括阿坎语、埃维语、豪萨语等。其标准化模式(16kHz单声道音频、统一元数据字段)为多源语音评估提供了可复用的基础设施,显著推动了低资源语言语音技术的研究进展。
当前挑战
该数据集面临多重挑战:首先,语音识别领域长期被高资源语言主导,加纳语言因缺乏大规模标注语料而难以训练鲁棒的端到端模型,且多语言混合场景加剧了声学建模的复杂性。其次,数据集构建中需协调来源迥异的音频质量差异,如联合国儿童基金会录音时长跨度达3至60秒,而圣经与JW.org语料需处理录音环境噪声与口音变异。此外,部分语言仅有数小时标注数据,跨语言迁移学习的有效性需进一步验证,而金融领域语料的专业术语也提升了转录一致性维护的难度。
常用场景
经典使用场景
在自动语音识别(ASR)领域,ghana-speech-eval数据集被设计为一项涵盖加纳多种本土语言的多源评估基准。该数据集整合了来自宗教文本、圣经音频对齐、联合国儿童基金会健康录音以及金融领域语音等四种截然不同的语料来源,每个来源均设定了每语言最多1000条的剪辑上限,从而确保评估的均衡性与多样性。经典使用场景聚焦于对预训练或自研ASR模型在低资源语言上的性能进行标准化评估,尤其适用于测试模型在跨领域(如宗教与金融)、跨方言(如阿散蒂特维语与阿夸佩姆特维语)以及不同录音环境下的鲁棒性。研究者可通过加载该数据集的57种配置,系统性地测评词错误率(WER)与字符错误率(CER),从而为加纳语系乃至更广泛的非洲语言语音技术发展提供可靠的对比基线。
实际应用
在现实应用层面,ghana-speech-eval数据集助力于推动加纳及西非地区智能语音服务的落地与优化。例如,基于该数据集的评估结果,开发者可以筛选出在金融领域语音(如银行业务咨询)中表现优异的ASR模型,并将其部署于移动支付或客户服务系统,从而跨越语言障碍,服务以本地语言为主要交流方式的用户群体。同时,联合国儿童基金会来源的健康录音语料使该基准在公共卫生领域具有独特价值,可用于构建语音驱动的健康信息查询系统,帮助农村地区的社区健康工作者通过语音交互快速获取疫苗接种、母婴保健等知识。此外,该数据集的多语言覆盖特性还支撑着教育科技应用,如开发能够自动转录并翻译加纳本土语言教学内容的工具,从而促进教育资源的本地化普及与数字包容性。
衍生相关工作
ghana-speech-eval数据集的发布催生了一系列相关研究工作,尤其是在低资源ASR模型的跨语言迁移学习与领域自适应领域。例如,有研究利用该基准对比了基于wav2vec 2.0与Whisper等预训练模型在加纳语言上的微调效果,揭示了预训练语料中是否包含相关语言家族数据对最终性能的关键影响。此外,该数据集也被用于评估端到端语音识别系统在极度低资源条件下的收敛策略,如数据增强、自训练(self-training)或结合语言模型的后处理优化。在语言学交叉研究方面,学者们借助该数据集探讨了语系相似性(如大西洋-刚果语系内部各语言间的声学距离)对ASR迁移效率的作用。这些衍生工作不仅验证了ghana-speech-eval作为评估平台的有效性,也进一步彰显了其在推动非洲多语言语音技术从实验室走向实际应用中的桥梁作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务