遇见数据集

ASR-Train-Processed

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集包含六个子配置,分别来自 Google FLEURS 和 Naija Voices 项目,涵盖豪萨语(Hausa)、伊博语(Igbo)和约鲁巴语(Yoruba)三种语言。每个样本包含两个字段:input_features(float32 类型的列表,表示音频特征)和 labels(int64 类型的列表,表示标签)。所有数据均以训练集分片形式提供,无验证或测试集。各子集样本规模如下:google_fleurs_hausa 共 1000 个样本(5 分片,每片 200 个);google_fleurs_igbo 共 1000 个样本(10 分片,每片 100 个);google_fleurs_yoruba 共 2339 个样本(12 分片,前 11 片每片 200 个,最后一片 139 个);naijavoices_hausa、naijavoices_igbo 和 naijavoices_yoruba 各 15000 个样本(每片 500 个,共 30 分片)。数据集可用于语音识别、语音分类或相关任务。

This dataset contains six sub-configurations from the Google FLEURS and Naija Voices projects, covering three languages: Hausa, Igbo, and Yoruba. Each sample includes two fields: input_features (a list of float32 representing audio features) and labels (a list of int64 representing labels). All data are provided as training splits with no validation or test sets. The sample sizes for each subset are as follows: google_fleurs_hausa has 1000 samples (5 shards, 200 each); google_fleurs_igbo has 1000 samples (10 shards, 100 each); google_fleurs_yoruba has 2339 samples (12 shards, first 11 shards of 200 each, last shard of 139); naijavoices_hausa, naijavoices_igbo, and naijavoices_yoruba each have 15000 samples (30 shards of 500 each). The dataset can be used for speech recognition, speech classification, or related tasks.

创建时间:
2026-09-08
原始信息汇总

数据集 ASR-Train-Processed 详情总结

概述

该数据集是一个面向自动语音识别(ASR)任务训练的预处理数据集,包含尼日利亚三种主要语言:豪萨语(Hausa)伊博语(Igbo)约鲁巴语(Yoruba)。数据来源于两个语音语料库:Google FLEURSNaijaVices

数据配置(Configs)

数据集共包含 6 个配置,按来源和语言划分:

  • google_fleurs_hausa
  • google_fleurs_igbo
  • google_fleurs_yoruba
  • naijavoices_hausa
  • naijavoices_igbo
  • naijavoices_yoruba

特征(Features)

每个配置均包含两个特征(字段):

  • input_features: 类型为 list<float32>,存储语音的输入特征(音频特征表示)
  • labels: 类型为 list<int64>,存储对应的标签(文本转录标签)

数据划分与规模

Google FLEURS 子集

配置 分片数 样本总数 数据集大小
google_fleurs_hausa 5(train_shard_0-4) 1,000 ~960.75 MB
google_fleurs_igbo 10(train_shard_0-9) 1,000 ~960.85 MB
google_fleurs_yoruba 12(train_shard_0-11) 2,139 ~2.25 GB

NaijaVices 子集

配置 分片数 样本总数 数据集大小
naijavoices_hausa 30(train_shard_0-29) 15,000 ~14.41 GB
naijavoices_igbo 30(train_shard_0-29) 15,000 ~14.41 GB
naijavoices_yoruba 30(train_shard_0-29) 15,000 ~14.41 GB
  • FLEURS 来源的豪萨语每分片 200 个样本,伊博语每分片 100 个样本
  • NaijaVices 来源的每个分片均为 500 个样本
  • 约鲁巴语(FLEURS)最后一个分片(shard_11)仅有 139 个样本,其余分片为 200 个

下载与总规模

  • 各配置下载大小:FLEURS 豪萨语约 984.5 MB、FLEURS 伊博语约 540.3 MB、FLEURS 约鲁巴语约 1.2 GB;NaijaVices 各语言约 1.8-2.0 GB
  • 数据集整体总量约 49,139 个样本,总数据规模逾 36 GB(处理后)
搜集汇总
数据集介绍
ASR-Train-Processed 数据集图片
构建方式
ASR-Train-Processed 数据集是针对尼日利亚地区三种主要语言(豪萨语、伊博语和约鲁巴语)构建的语音识别训练资源。该数据集整合了 Google FLEURS 与 NaijaVoices 两大公开语音语料库,经过特征提取与标签映射的预处理流程,将原始音频转换为统一的浮点型特征序列及对应的整数标签,并按照固定样本量进行分片存储,形成结构清晰的训练分片。数据集涵盖六个配置,其中 Google FLEURS 子集提供 100 至 200 条样本的分片,NaijaVoices 子集则以 500 条样本为单位进行切分,确保了数据规模的可扩展性与加载效率。
特点
该数据集的核心特点在于其多源融合与标准化处理。通过将不同来源的语音数据统一为 input_features 和 labels 两种特征格式,降低了模型训练的预处理复杂度。分片设计兼顾了数据均衡性与分布式训练需求,各分片数据大小近似,有利于批处理与负载平衡。此外,数据集覆盖三种语言,为跨语言语音识别研究提供了宝贵的资源,尤其有助于提升低资源语言在语音识别任务中的表现。
使用方法
使用时,研究者可通过 HuggingFace Datasets 库按需加载特定语言的配置与分片,例如选择 google_fleurs_hausa 或 naijavoices_yoruba。数据集设计适用于序列到序列的自动语音识别模型的监督训练,其中 input_features 可直接作为模型输入,labels 则对应文本 token 序列。建议结合预训练语音模型进行微调,并根据任务需求对分片进行整批读取或自定义采样,以充分利用其大规模、多语言数据特性优化模型性能。
背景与挑战
背景概述
ASR-Train-Processed数据集由多个语音识别语料库整合而成,旨在推动尼日利亚及西非地区低资源语言的自动语音识别(ASR)研究。该数据集创建于语音技术快速发展的背景下,主要研究者关注于解决豪萨语、伊博语和约鲁巴语等本地语言的语音识别资源匮乏问题。其核心融合了Google FLEURS和NaiVoices两大数据源,经预处理后以分片形式存储,每个样本包含浮点型的输入特征与整数标签,便于深度学习模型直接训练。该数据集的出现填补了这些语言在公开语音语料上的空白,为跨语言ASR模型提供了宝贵的基准,对促进非洲语言的技术包容性和语音交互应用具有重要意义,也推动了多语种语音处理领域的公平性研究。
当前挑战
该数据集所面临的首要挑战是其覆盖语言大多属于低资源语言,缺乏足够的原始语音数据与标注,给模型训练带来的领域难题是语音特征多样性不足、噪声干扰强以及口音差异大,严重制约了ASR系统的泛化能力与鲁棒性。在构建过程中,研究者需整合来自不同来源的语音数据,面临采样率不一致、录音环境多样以及标注体系不统一等问题,需精心设计预处理流程以保证特征的一致性。此外,数据规模的庞大与分片存储方式也给数据的加载、传输与批量处理带来工程挑战,存储在HuggingFace上的多分片结构要求高效的内存管理和并行读取策略,以确保模型训练过程中的数据吞吐量。
常用场景
经典使用场景
在语音识别与自然语言处理的交叉领域,ASR-Train-Processed数据集为低资源语言的声学建模与语言建模提供了宝贵的训练资源。它汇集了Google FLEURS和NaiJa Voices两大项目中豪萨语、伊博语和约鲁巴语的规范化语音特征及其对应文本标签,并经过预处理与切分,形成结构化、分片的训练数据。研究者常利用该数据集训练端到端自动语音识别模型,如基于Transformer的架构,以及预训练语音表征模型如wav2vec 2.0或HuBERT,从而在数据稀缺条件下探索多语言迁移学习、领域自适应和鲁棒性提升等课题。其分片设计亦便于分布式训练和快速迭代,成为语音技术研究的可靠基准。
解决学术问题
该数据集直面低资源语言语音识别研究中标注数据匮乏的长期桎梏,为豪萨语、伊博语和约鲁巴语等非洲语言提供了成规模的训练样本,从而支撑了跨语言声学模型泛化能力、语言特定音系特征捕捉及数据增强策略的实证检验。通过统一多来源数据的特征表示与标签格式,它亦解决了跨语料不匹配问题,促进了可复现研究流程的构建。其公开可及性显著降低了学术门槛,推动了全球研究者对语言多样性、语音技术公平性的深入探讨,并为低资源场景下的模型压缩与知识蒸馏等前沿方向提供了坚实的数据基础。
衍生相关工作
基于ASR-Train-Processed数据集,研究者已衍生出多项具有影响力工作。一方面,数据集常被用于微调预训练多语言模型,以检验其在下游低资源语种上的适应性改进,例如端到端ASR的跨语言微调策略设计与评测。另一方面,它催生了针对非洲语言的语音识别基准测试,促使后续工作探索元学习、自监督预训练与多任务联合建模等方法提升性能。此外,该数据集的发布也鼓励了对分割清洗、特征规范化等预处理流程的标准化讨论,推进了面向低资源语音语料的可重复使用最佳实践。这些衍生工作共同构成了一个良性生态,持续驱动着对低资源语音技术的深入研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务