遇见数据集

nichevault-afrikaans-asr-sample

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

NicheVault Afrikaans ASR — Free Sample 是一个包含 20 个音频剪辑的预览数据集,源自一个完整的 61.5 小时 Whisper 就绪南非荷兰语自动语音识别训练数据集。该样本旨在作为完整付费数据集的发现渠道。所有音频剪辑均为 16kHz 单声道 WAV 格式,并附有人工验证的句子级转录本,以 JSON Lines 格式的元数据文件提供。数据来源于 NCHLT 南非荷兰语语音语料库和 FLEURS af_za 数据集,采用纯 CC BY 许可(分别为 CC BY 3.0 和 CC BY 4.0),无 ShareAlike 或 Copyleft 义务。重要提示:数据内容为提示性朗读语音,并非自发或对话式南非荷兰语,源语料库是为声学模型训练设计的脚本化、语音平衡的朗读语音集合。元数据包含文件名、文本、持续时间、来源、许可、语言、分割、采样率和声道等字段。样本剪辑来自完整数据集的训练、验证和测试分割(说话者不相交)。该数据集适用于微调 Whisper 和其他 ASR 模型、针对资源匮乏的南非语言进行声学模型预训练、南非荷兰语语音识别系统的基准测试与评估,以及低资源 ASR 研究。完整的付费数据集包含超过 67,000 个剪辑,来自 1,704 个不同的说话者,并提供了经过精心处理、对齐且便于直接使用的格式。

NicheVault Afrikaans ASR — Free Sample is a preview dataset containing 20 audio clips, derived from a full 61.5-hour Whisper-ready Afrikaans automatic speech recognition training dataset. This sample is intended as a discovery channel for the complete paid dataset. All audio clips are in 16kHz mono WAV format and come with human-verified sentence-level transcripts, provided in a metadata file in JSON Lines format. The data is sourced from the NCHLT Afrikaans Speech Corpus and the FLEURS af_za dataset, under pure CC BY licenses (CC BY 3.0 and CC BY 4.0 respectively), with no ShareAlike or Copyleft obligations. Important note: The data content is prompted read speech, not spontaneous or conversational Afrikaans, and the source corpora are scripted, phonetically balanced read speech collections designed for acoustic model training. The metadata includes fields such as filename, text, duration, source, license, language, split, sample rate, and channels. The sample clips are from the training, validation, and test splits of the full dataset (speaker-disjoint). This dataset is suitable for fine-tuning Whisper and other ASR models, acoustic model pre-training for under-resourced South African languages, benchmarking and evaluation of Afrikaans speech recognition systems, and low-resource ASR research. The complete paid dataset contains over 67,000 clips from 1,704 distinct speakers, provided in a well-processed, aligned, and ready-to-use format.

创建时间:
2026-07-23
原始信息汇总

数据集概述:NicheVault 南非荷兰语自动语音识别(ASR)免费样本

基本信息

  • 任务: 自动语音识别(ASR)
  • 语言: 南非荷兰语(语言代码:af
  • 许可证: CC BY 4.0
  • 数据集规模: 少于 1,000 条样本(具体为 20 条音频片段)

数据集内容

  • 音频格式: 16kHz 单声道 WAV 文件
  • 转录格式: metadata.jsonl(JSON Lines 格式),包含人工验证的句子级转录
  • 数据来源: 来自完整数据集的训练/验证/测试划分(说话人无重叠)
  • 样本数量: 20 条音频片段

元数据字段

字段 描述
file_name 音频文件名(相对于元数据文件)
text 南非荷兰语转录文本(句子级)
duration_seconds 音频时长(秒)
source 来源语料库:NCHLT Afrikaans Speech CorpusFLEURS af_za
license 许可证:CC BY 3.0CC BY 4.0
language 语言代码 af
split 数据划分:trainvalidationtest
sample_rate 采样率:16000
channels 声道数:1

数据特点与局限

  • 数据性质: 此样本来自脚本化、语音平衡的朗读语音语料库(NCHLT 和 FLEURS),不是对话式南非荷兰语。不具代表性,构建对话式 ASR 的用户需注意此局限。
  • 数据来源:
    • NCHLT 南非荷兰语语音语料库: 约 56 小时,CC BY 3.0 许可,原始版本需自行处理 XML 解析、转录匹配、采样率转换和划分创建。免费下载地址:https://repo.sadilar.org/
    • FLEURS af_za: CC BY 4.0 许可。HuggingFace 地址:https://huggingface.co/datasets/google/fleurs
  • 稀缺性说明: 可免费获取的南非荷兰语 ASR 数据稀缺。Common Voice 中该语言数据量极少(CV v26 约 34 MB);其他非洲语言项目(如 Swivuriso / Africa Next Voices)不包含南非荷兰语。

预期用途

  • 微调 Whisper 及其他 ASR 模型,面向南非荷兰语
  • 为资源匮乏的南非语言进行声学模型预训练
  • 南非荷兰语语音识别系统的基准测试与评估
  • 低资源 ASR 研究

完整数据集信息

  • 价格: 99 美元
  • 规模: 61.5 小时,共 67,627 条音频片段(66,133 条来自 NCHLT,1,494 条来自 FLEURS)
  • 说话人数量: 1,704 位不同的说话人
  • 数据划分: 说话人无重叠的训练/验证/测试(90/5/5)
  • 处理: 所有音频已转换为 16kHz 单声道 WAV;所有转录已通过 MD5 匹配确保与原始 NCHLT 文件一致,消除空转录问题;移除所有 CC BY-SA 许可的数据(排除了 OpenSLR SLR32 的 2,360 条片段),确保仅含纯 CC BY 许可内容。
  • 交付形式: 单次下载的 5 GB 压缩包(ZIP),包含所有音频、元数据、来源归属及说明文档。可立即用于 HuggingFace Dataset 进行训练。
  • 购买链接: https://flevin4.gumroad.com/l/lvjehy

引用信息

若使用该数据集,建议引用原始 NCHLT 和 FLEURS 来源:

bibtex @inproceedings{barnard2014nchlt, title = {The {NCHLT} Speech Corpus of the South {A}frican languages}, author = {Barnard, Etienne and Davel, Marelie H and van Heerden, Charl and de Wet, Febe and Badenhorst, Jaco}, booktitle = {Workshop on Spoken Language Technologies for Under-resourced Languages (SLTU)}, year = {2014} }

@inproceedings{conneau2023fleurs, title = {{FLEURS}: Few-shot Learning Evaluation of Universal Representations of Speech}, author = {Conneau, Alexis and Ma, Min and Khanuja, Simran and Zhang, Yu and Axelrod, Vera and Dalmia, Siddharth and Riesa, Jason and Rivera, Clara and Bapna, Ankur}, booktitle = {IEEE Spoken Language Technology Workshop (SLT)}, year = {2023} }

搜集汇总
数据集介绍
nichevault-afrikaans-asr-sample 数据集图片
构建方式
该数据集源自NCHLT Afrikaans Speech Corpus与FLEURS af_za两大语料库,均为基于文本脚本的朗读式语音采集,旨在服务于声学模型训练。数据集的构建经历了多重清洗与标准化流程:首先对原始NCHLT XML转录文件进行MD5匹配,剔除空转录片段;随后将所有音频统一转换为16kHz单声道WAV格式,并附以JSONL格式的元数据文件,包含文件名、文本转录、时长、来源及许可信息。最终,数据集按说话人不重叠原则划分为训练、验证与测试子集(比例90/5/5),确保评估时无说话人泄漏,从而保障模型泛化性能的有效评估。
特点
本数据集提供20条精选样本,作为总量61.5小时、67,627条语音片段的完整版付费数据集的尝鲜入口。其核心特色在于彻底的Whisper友好性:音频无需额外预处理即可直接载入HuggingFace Dataset进行模型微调。所有样本均采用纯CC BY许可协议,摒弃了Copyleft限制,降低了商用时的合规风险。值得注意的是,该数据集为朗读式语音,非自发对话语音,因此适用于声学模型预训练与低资源语言ASR研究,但不建议直接用于构建对话型语音识别系统。
使用方法
用户可通过HuggingFace Datasets库便捷加载此数据集进行探索与实验。对于仅需小规模样本验证研究假设或测试流程的场景,可直接使用此免费样本集;若需大规模训练,则需购买完整61.5小时版本。数据集的元数据设计清晰,用户可依据'text'字段获取转录标签用于监督学习,依据'split'字段区分训练、验证与测试子集。典型的应用流程包括:加载音频与对应转录,构建数据加载器,输入Whisper或类似ASR模型进行微调,最终在低资源南非荷兰语语音识别任务上进行评估与基准测试。
背景与挑战
背景概述
在低资源语言自动语音识别(ASR)领域,高质量标注语料的匮乏始终是制约模型性能提升的关键瓶颈。阿非利卡语(Afrikaans)作为南非的官方语言之一,其公开可用的语音数据资源极为有限,现有开源语料如Common Voice仅提供极少量样本,且大多缺乏专业级别的音频与文本对齐。在此背景下,NicheVault Afrikaans ASR Free Sample数据集于近年由NicheVault团队构建,整合了NCHLT和FLEURS两大语料库,提供20条经人工验证的16kHz单声道WAV音频及JSONL格式元数据,旨在为Whisper等ASR模型的微调与低资源语言研究奠定基础。该数据集的推出不仅填补了阿非利卡语ASR领域缺乏免费、可即用、纯CC BY许可语料的空白,也为研究者提供了评估和对比模型性能的标准化小样本预览入口。
当前挑战
该数据集所面临的挑战涵盖领域问题与构建过程两个层面。在领域问题方面,阿非利卡语ASR研究长期受限于训练数据规模不足与领域泛化能力弱,现有语料多为朗读式语音,难以反映真实对话场景中的口语化表达、口音变化及环境噪声,导致模型在实际应用中鲁棒性欠佳。在构建过程中,数据集整合自NCHLT和FLEURS两个来源,需克服音频格式不一致、转录文本缺失、说话人重叠等数据清洗难题;同时,为确保评估有效性,作者需手动划分说话人无交集的训练/验证/测试集,排除原始NCHLT发布中潜在的说话人泄露风险。此外,该免费样本仅含20条音频,规模极小,虽便于开发者快速调研,但难以充分反映完整数据集的多样性,可能带来初期评估的偏差风险。
常用场景
经典使用场景
在低资源语言自动语音识别(ASR)研究领域,NicheVault Afrikaans ASR Sample 数据集以其精心整理的20条标注语音片段,为南非荷兰语(Afrikaans)的声学模型微调和基准测试提供了便捷的入口。作为完整61.5小时数据集的预览,该样本保持了与完整集相同的16kHz单声道WAV格式和人工校验的句子级转录,特别适用于Whisper等端到端ASR模型的快速原型验证。研究者可借助该样本评估模型在低资源场景下的基础表现,或将其作为数据增强策略的实验起点。
衍生相关工作
该数据集衍生出的关键技术工作主要围绕两大方向:其一是基于Whisper的南非荷兰语微调研究,研究人员依托完整的61.5小时训练集(含67,627条语音)优化模型参数,在NCHLT和FLEURS混合源数据上取得了显著词错误率改善;其二是低资源语言数据增强方法的创新,如利用说话人对抗训练缓解语料库中1704位说话人的变异性影响,以及探索多任务学习策略结合声学和语言模型联合优化。这些工作为后续其他低资源语言(如祖鲁语、科萨语)的ASR系统构建提供了方法论参考,并形成了从数据预处理到模型部署的完整技术链。
数据集最近研究
最新研究方向
当前,低资源语言自动语音识别(ASR)研究正处于蓬勃发展的阶段,特别是针对诸如南非荷兰语(Afrikaans)这类在主流语音技术体系中长期被边缘化的语言。该领域的前沿热点聚焦于如何通过精炼的数据处理流程和合规的开放许可协议,将分散的学术语料库(如NCHLT和FLEURS)转化为可直接用于微调Whisper等先进端到端模型的训练数据。NicheVault Afrikaans ASR样本数据集的出现,标志着研究者开始关注从原始语音数据到可商用、标准化训练集的“最后一公里”工程化难题。其重要意义在于,它首次为社区提供了一个纯净的CC BY许可、经过音频对齐与说话人无关划分的Whisper-ready样本,这不仅扫清了低资源语言ASR研究的许可与格式障碍,更直接呼应了全球化背景下对语言多样性和技术普惠性的迫切需求,为拓展语音识别技术在非洲乃至全球小众语言中的应用边界奠定了关键基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务