遇见数据集

BaltiVoice

收藏
arXiv2026-06-02 更新2026-06-05 收录
官方服务:

资源简介:

BaltiVoice是由独立研究者Muhammad Ali创建的首个巴尔蒂语公开语音语料库,旨在填补该低资源语言在自动语音识别领域的空白。该数据集包含10,060条经过验证的语音片段,总时长达16.8小时,平均每条语音时长6秒,词汇量约10.12词,数据源自Mozilla Common Voice社区贡献的朗读语音。其创建过程通过志愿者朗读句子并经过社区验证,采用说话人分离划分得到9,519条训练数据和538条验证数据。该数据集主要应用于低资源语言ASR系统开发,通过微调Whisper-small模型将词错误率从182.18%降至30.07%,为巴尔蒂语语音技术研究提供了重要基线。

BaltiVoice is the first publicly available Balti language speech corpus created by independent researcher Muhammad Ali, designed to address the research gap of this low-resource language in the field of automatic speech recognition (ASR). This dataset comprises 10,060 validated speech segments, with a total duration of 16.8 hours, an average duration of 6 seconds per segment, and an average vocabulary size of approximately 10.12 words per utterance. The data is sourced from read speech contributions submitted to the Mozilla Common Voice community. During its development, volunteers read target sentences followed by community-based validation, and the corpus was split into 9,519 training samples and 538 validation samples via speaker diarization. This dataset is primarily applied to the development of low-resource language ASR systems. As a demonstration, fine-tuning the Whisper-small model on this corpus reduced the word error rate (WER) from 182.18% to 30.07%, providing an important baseline for Balti language speech technology research.

创建时间:
2026-06-02
原始信息汇总

数据集概要

BaltiVoice ASR 是首个公开的巴尔蒂语(Balti)自动语音识别(ASR)数据集。巴尔蒂语(ISO 639-3: bft)是一种极度低资源的藏语支语言,主要使用于巴基斯坦吉尔吉特-巴尔蒂斯坦地区和印度拉达克部分地区。

语言信息

属性 详情
语言 巴尔蒂语 (بلتی)
ISO 代码 bft
语系 汉藏语系 → 藏缅语族 → 藏语支
文字 纳斯塔利克体(基于阿拉伯字母)
区域 巴基斯坦吉尔吉特-巴尔蒂斯坦、印度拉达克
使用人口 约400,000(估计)
资源水平 极度低资源

数据集统计

划分 样本数 说话人数 估计时长
训练集 9,519 122 ~15.9小时
验证集 538 14 ~0.9小时
总计 10,060 136 ~16.8小时
  • 训练集和验证集严格说话人无重叠(经验证,重叠数为0)。

说话人人口统计

属性 数值
总独立说话人 136
性别(女性) 1,246条话语
性别(未公开) 1,030条话语
年龄(二十多岁) 3,758条话语
年龄(三十多岁) 3,697条话语
年龄(十几岁) 97条话语

音频属性

属性 数值
格式 WAV(16kHz,单声道)
平均时长 ~6.0秒
最短时长 ~1.0秒
最长时长 ~15.0秒
采样率 16,000 Hz

文本属性

属性 数值
平均单词/句 10.12
平均字符数 48.80
文字 纳斯塔利克体(从右向左)

数据集结构

每条样本包含:

  • audio:16kHz单声道WAV音频数组
  • sentence:巴尔蒂语纳斯塔利克体转录文本

python { "audio": { "array": [...], # numpy数组 "sampling_rate": 16000 }, "sentence": "بوا لہ سلام بے اِنپا سلام سہ مہ بیاس" }

数据来源与收集

  • 基础数据源自 Mozilla Common Voice 巴尔蒂语(bft)贡献项目
  • 仅使用了经验证的录音(共10,547个片段中选取10,060个)
  • 使用说话人无重叠采样(基于client_id元数据的GroupShuffleSplit,种子为42)创建划分

基于该数据集训练的模型

基于BaltiVoice微调的Whisper模型可在此获取:https://huggingface.co/mohdali1/whisper-small-balti

模型 词错误率 (WER)
Whisper-small(零样本) 182.18%
Whisper-small(微调后) 30.07%

零样本WER超过100%表示模型产生幻觉——生成了参考文本中不存在的单词。微调后在说话人无重叠验证集上将该值降至30.07%。

相关论文

该数据集在以下论文中有详细描述:

BaltiVoice: A Speech Corpus and Fine-tuned Whisper ASR System for the Balti Language Mohammad Ali, Independent Researcher, Gilgit-Baltistan, Pakistan arXiv: https://arxiv.org/abs/2606.03504

社会影响

  • 数字保护巴尔蒂语
  • 为巴尔蒂语使用者提供语音技术
  • 支持低资源藏语支语言的NLP研究
  • 为未来的巴尔蒂语TTS、NER和MT系统提供基础

局限性

  • 音频由志愿者贡献者收集,录音质量存在差异
  • 词汇限于朗读语音领域,对话场景的词错误率可能更高
  • 使用乌尔都语分词器作为代理进行微调(Whisper中支持的最接近纳斯塔利克体的语言)
  • 未应用Unicode规范化,阿拉伯语/波斯语Yeh歧义可能影响词错误率计算

许可协议

知识共享署名4.0 (CC-BY-4.0)

引用

bibtex @dataset{baltivoice2025, author = {Mohammad Ali}, title = {BaltiVoice: A Speech Corpus and Fine-tuned Whisper ASR System for the Balti Language}, year = {2025}, publisher = {HuggingFace}, url = {https://huggingface.co/datasets/mohdali1/baltivoice-asr} }

搜集汇总
数据集介绍
BaltiVoice 数据集图片
构建方式
BaltiVoice语料库源自Mozilla Common Voice平台上的巴尔蒂语语音数据,志愿者朗读巴尔蒂语句子并由其他志愿者进行验证。研究团队仅采用通过验证的录音,共获取10,060条有效话语,总时长16.8小时。所有音频从原始MP3格式转换为16 kHz单声道WAV格式,以适应Whisper特征提取器的输入要求。剔除字数少于2的样本后,采用基于说话者不重叠的分组随机拆分方法,按90/10比例划分为训练集和验证集,分别包含9,519条和538条话语,确保说话者不跨集出现,从而保证评估的公正性。
特点
该数据集具有鲜明的低资源语言特征,是首个公开发布的巴尔蒂语音语料库。巴尔蒂语属于藏缅语族,使用纳斯塔利克文书写,在语音和语法上具有独特性。数据集包含136位说话者的录音,话语时长集中在3至10秒之间,平均每句约10个单词,与朗读语音语料库的典型分布一致。此外,数据集保留了原生的纳斯塔利克标注,未进行文本归一化处理,但已知存在Unicode编码歧义问题,为后续研究提供了明确的改进方向。
使用方法
研究者可直接从HuggingFace平台下载BaltiVoice数据集,用于训练和评估巴尔蒂语自动语音识别模型。论文中提供了基于OpenAI Whisper-small模型的微调范例,通过将分词器语言设置为乌尔都语(urdu)并指定转录任务,成功实现了对巴尔蒂语文本的正确编码。研究人员可参照论文公开的代码、Colab笔记本及训练管线,使用该数据集对Whisper系列模型进行微调,并在验证集上以词错误率(WER)作为评估指标。此外,HuggingFace上还部署了在线转录演示系统,便于直观测试模型效果。
背景与挑战
背景概述
BaltiVoice数据集由独立研究员Muhammad Ali于2026年创建,旨在填补巴尔蒂语在自动语音识别领域的空白。巴尔蒂语是一种藏缅语系语言,使用纳斯塔里克文字书写,约有40万使用者分布于巴基斯坦吉尔吉特-巴尔蒂斯坦地区和印度拉达克部分地区。然而,由于缺乏公开可用的语音资源,该语言在自然语言处理和语音研究中几乎毫无存在感。该数据集基于Mozilla Common Voice平台的社区贡献,精选了16.8小时、10060条经过验证的朗读语音,并以纳斯塔里克文字转录。其核心研究问题是为巴尔蒂语建立首个语音识别基线,并为后续研究提供可复现的起点。通过微调Whisper-small模型,研究团队在验证集上获得了30.07%的词错误率,尽管这一结果尚不足以满足实时听写需求,但标志着巴尔蒂语语音研究从零到一的突破,对低资源语言语音技术的发展具有重要推动作用。
当前挑战
BaltiVoice数据集面临的核心挑战在于低资源语言的语音识别困境:巴尔蒂语既无公开语音语料库,又缺乏现成的语言模型和文本规范化资源,导致零样本场景下Whisper模型词错误率高达182.18%,完全无法进行有效转录。构建过程中遇到的挑战包括:数据采集严重依赖社区志愿者,总时长仅16.8小时,且均为朗读语音而非自然对话,限制了模型对口语化表达的泛化能力;纳斯塔里克文字的Unicode编码歧义性增加了文本预处理的复杂性,例如视觉相同的字符可能对应不同码位;微调计算资源受限,仅能在NVIDIA T4 GPU上使用Whisper-small变体,无法尝试更大规模的模型架构。此外,30.07%的词错误率意味着每三个词中约有一个错误,对于听写和辅助技术而言仍不实用,未来需通过数据增强、文本规范化以及扩展对话语音等方向持续优化。
常用场景
经典使用场景
BaltiVoice数据集的核心应用在于为巴尔蒂语这一此前缺乏公开语音资源的藏缅语支语言,构建首个自动语音识别(ASR)系统的训练基础。研究者利用该16.8小时的朗读语音语料库,结合10,060条经过验证的纳斯塔利克脚本转录文本,对OpenAI Whisper-small模型进行微调,从而在零样本基线(WER高达182.18%)的基础上,实现了30.07%的词错误率。这一场景不仅验证了在极端低资源条件下通过迁移学习激活语音识别能力的可行性,也为巴尔蒂语的自然语言处理研究提供了可复现的基准,填补了该语言在主流多语种评测基准中的空白。
实际应用
在实际应用层面,BaltiVoice数据集与微调模型为巴尔蒂语社区带来了直接可用的技术产品。目前,团队已在HuggingFace上部署了实时转录演示(Gradio demo),允许用户测试基于Whisper的巴尔蒂语语音识别效果。虽然30.07%的WER尚不足以支持高精度的听写或无障碍工具,但对于关键词检测、话题分类或语音搜索等对逐字精确度要求较低的任务,模型输出已具备实用价值。此外,该语音引擎可集成至移动应用或网页端,服务于吉尔吉特-巴尔蒂斯坦地区的教育、信息检索与语言存档场景,帮助弥合巴尔蒂语在数字世界中的‘语音鸿沟’。
衍生相关工作
BaltiVoice的发布催生了一系列后续探索方向。首先,它提供了一个可复现的训练管线(含代码、Colab笔记与HuggingFace模型),使其他研究者能够在此基础上尝试更长的训练步数、文本规范化或数据增强策略以降低WER。其次,该工作启发了对巴尔蒂语形态学与纳斯塔利克脚本Unicode模糊性问题的系统研究,为后续文本标准化工具的开发奠定基础。此外,该数据集可与邻近语言(如乌尔都语、藏语拉萨方言)的语音资源联合使用,推动跨语言迁移学习方法的优化。最后,基于此基线,学界可进一步收集自发性对话语音、扩充语料规模,并尝试Whisper-medium等更大模型,从而推动低资源藏缅语族语音技术的整体进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务