遇见数据集

BrahuiSpeech-70H

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

BrahuiSpeech-70H 是一个大规模自动语音识别语料库,包含超过70小时的已转录真实布拉灰语(Brahui,亦称Brahvi)语音。该数据集包含15,000多个语音-文本对,音频统一为16 kHz单声道格式,转录采用布拉灰语常用的波斯-阿拉伯字母。数据来源广泛,涵盖自然发生的真实语音场景,包括对话、访谈、讨论、故事、教育材料、娱乐节目、播客、新闻频道、广播、非正式讲话、叙述性语音及在线语音媒体等,旨在为语音识别系统提供比传统脚本语料库更丰富的语音分布。该数据集是首个公开可用的大规模布拉灰语ASR语料库,超过70小时,适用于ASR训练、多语言ASR微调、低资源语音研究、语音表示学习、语言识别、声学建模、基准测试、迁移学习等任务。 ⚠️ 重要提示:该数据集已被弃用,不推荐用于新项目的研究或模型开发。后续审查发现部分样本存在转录质量问题,包括不准确或不可靠的音频-文本对齐和转录错误。此仓库因已分配DOI并作为学术记录永久保留。用户应使用更正后的改进版本。

BrahuiSpeech-70H is a large-scale automatic speech recognition corpus containing over 70 hours of transcribed real Brahui (also known as Brahvi) speech. The dataset includes more than 15,000 speech-text pairs, with audio uniformly formatted as 16 kHz mono, and transcriptions using the Perso-Arabic script commonly used for Brahui. Data sources are diverse, covering naturally occurring real speech scenarios, including conversations, interviews, discussions, stories, educational materials, entertainment programs, podcasts, news channels, radio, informal speech, narrative speech, and online voice media, aiming to provide a richer speech distribution for speech recognition systems than traditional scripted corpora. This dataset is the first publicly available large-scale Brahui ASR corpus, exceeding 70 hours, suitable for ASR training, multilingual ASR fine-tuning, low-resource speech research, speech representation learning, language identification, acoustic modeling, benchmarking, transfer learning, and other tasks. ⚠️ Important Note: This dataset has been deprecated and is not recommended for new research or model development. Subsequent review found that some samples have transcription quality issues, including inaccurate or unreliable audio-text alignment and transcription errors. This repository is permanently retained as an academic record because it has been assigned a DOI. Users should use the corrected improved version.

创建时间:
2026-08-17
原始信息汇总

BrahuiSpeech-70H 数据集概述

⚠️ 重要状态警告

该数据集已废弃,不建议用于模型训练或评估。 后续审查发现部分数据存在转录质量问题,包括音频-文本对齐不准确及转录错误。由于这些问题可能对ASR训练、微调、基准测试和评估产生负面影响,用户不应在新研究或模型开发中使用此版本。该仓库因已分配DOI而保留,属于学术记录的一部分。一个已修正且大幅改进的Brahui语音数据集版本将取代此版本。

数据集简介

BrahuiSpeech-70H 是一个包含 70+ 小时 转录的真实世界 Brahvi 语音的大型自动语音识别(ASR)语料库,包含超过 15,000 个语音-文本对

Brahui(也常写作 Brahvi)是一种低资源达罗毗荼语系语言,主要在巴基斯坦俾路支省使用。尽管使用人口众多,但公开可用的 Brahui 语音资源极为有限。该数据集据发布时了解,是首个公开的、超过70小时转录语音并面向研究和商业模型开发发布的大规模 Brahui ASR 语料库。

数据特点

  • 70+ 小时 转录的 Brahui 语音
  • 15,000+ 个 音频-文本对
  • 聚焦自然发生的真实世界语音,而非纯脚本录制语料
  • 涵盖多样的说话人、说话风格、领域和录音条件
  • 音频标准化为 16 kHz 单声道
  • 转录文本使用 Brahui 波斯-阿拉伯文字
  • 适用于 ASR 训练、微调、评估及低资源语音研究
  • 面向研究和商业模型开发设计

数据规模与结构

  • 规模类别:10K < n < 100K
  • 每个样本包含一个音频片段及其对应的 Brahui 转录文本
  • 典型结构:audio(音频)、text(字符串)
  • 可使用 Hugging Face Datasets 库加载:

python from datasets import load_dataset dataset = load_dataset("TBOGamer22/BrahuiSpeech-70H")

音频信息

  • 采样率:16 kHz
  • 声道:单声道
  • 单个样本为适合监督式 ASR 训练的短语音片段

语音领域

数据集涵盖广泛的真实世界媒体和说话情境,包括:

  • 对话、访谈、讨论
  • 故事、教育材料、娱乐内容
  • 播客、新闻频道、广播类语音
  • 非正式语音、叙述性语音、在线口语媒体

转录信息

  • 使用巴基斯坦 Brahui 书面语常用的波斯-阿拉伯文字系统
  • 语料构建经过多阶段转录处理和质控,包括:转录清理、文本规范化、音频-文本一致性检查、语音存在性验证、静音过滤、畸形样本移除、人工审查

语言信息

字段
语言 Brahui
别名 Brahvi, Brohi
ISO 639-3 brh
主要区域 巴基斯坦俾路支省
文字系统 波斯-阿拉伯文字
语系 达罗毗荼语系

Brahui 在达罗毗荼语系中较为特殊,因其主要语言社区与南亚主要达罗毗荼语区在地理上分离,且数字资源代表性有限。

预期用途

可用于:

  • 自动语音识别(ASR)
  • 多语言 ASR 模型微调
  • Brahui 语音识别系统训练
  • 低资源语音研究
  • 语音表示学习
  • 多语言语音建模
  • 语言识别
  • 声学建模
  • 语音基准测试
  • 迁移学习
  • Brahui 语言技术研究

质量控制

语料在发布前经过自动和人工质量控制阶段,质量检查包括:音频验证、转录规范化、语音存在性检测、静音过滤、音频-文本一致性检查、畸形样本过滤、转录审查。在底层语音适合语音识别训练的前提下,保留了自然发生的声学变化。

局限性

  • 录音条件不统一,样本可能存在背景噪声、录音设备差异、麦克风质量、说话人距离、区域发音、语速、非正式语言、代码转换、领域特定词汇等变化
  • 不应将数据集解读为同等代表所有 Brahui 方言、地理区域、人口群体或说话风格

知识产权与引用

  • 许可证:MIT
  • 数据集面向研究和商业模型开发发布,用户需确保使用符合适用的许可条款
  • 引用信息:

bibtex @dataset{binomar2026brahuispeech70h, author = {Talha Bin Omar}, title = {BrahuiSpeech-70H: A Large-Scale Real-World Brahui Speech Recognition Corpus}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/TBOGamer22/BrahuiSpeech-70H}, language = {Brahui} }

发布仓库

Hugging Face: TBOGamer22/BrahuiSpeech-70H

现有 Brahui 语音资源对比

Brahui 历史上公开可用的语音数据极为有限。现有资源包括较小的 Brahui 语料(如 Mozilla Common Voice)以及大型多语言语音计划(如 Meta 的 Omnilingual ASR 语料库)中包含的 Brahui 样本。BrahuiSpeech-70H 的主要区别在于其规模及其对多样化真实世界 Brahui 语音的聚焦,70+ 小时的转录音频使研究者无需自行构建大型 Brahui 语音语料库即可进行实质性 ASR 微调和实验。

搜集汇总
数据集介绍
BrahuiSpeech-70H 数据集图片
构建方式
针对布拉灰语(Brahui)这一低资源达罗毗荼语系语言公开语音资源匮乏的现状,BrahuiSpeech-70H的构建立足于真实世界语音的广泛采集,而非依赖脚本化朗读。语料源自对话、访谈、讨论、故事、教育材料、娱乐节目、播客、新闻广播及网络口语媒体等多元领域,覆盖不同说话人、语速、口音与录音条件。全部音频统一重采样为16 kHz单声道,每段语音配以布拉灰语波斯-阿拉伯文转写。构建过程历经转写清理、文本归一化、音频-文本一致性校验、语音存在性检测、静音过滤、畸形样本剔除及人工复核等阶段,最终保留通过质量筛选的15,000余条语音-文本对,总量逾70小时。
特点
该数据集的核心特征体现为规模与真实性的双重突破。作为首个公开的、超过70小时转写语音的布拉灰语ASR语料库,其体量数倍于既往公开的布拉灰语语音资源总和。语音材料源自自然发生的真实场景,在发音、语速、录音质量、词汇、说话人特征、声学条件及话语领域等维度呈现丰富变异,突破了纯净演播室或朗读语音的局限。所有音频标准化为16 kHz单声道,转写采用巴基斯坦通用的布拉灰语波斯-阿拉伯书写系统。数据集适用于研究及商业模型开发,并在Hugging Face平台以MIT许可发布,但需注意该版本因部分转写质量问题已被标记为弃用,仅作存档与DOI保存之用。
使用方法
该数据集通过Hugging Face Datasets库便捷加载,用户仅需调用load_dataset("TBOGamer22/BrahuiSpeech-70H")即可获取完整数据。加载后,每条样本包含audio与text两个字段,分别对应语音片段及其布拉灰语转写。研究者可将其用于自动语音识别系统的训练、微调与评测,亦可支撑多语言ASR模型迁移、低资源语音表征学习、语言辨识、声学建模、语音基准测试及布拉灰语技术研究等任务。鉴于官方已明确标注该版本为弃用状态,并指出其转写质量存在音频-文本对齐不准确或转写错误等已知问题,建议用户在新项目与模型开发中避免使用本版本,转而关注即将发布的校正与改进版本。使用时须遵守数据集许可条款,并在研究成果中按指定格式引用。
背景与挑战
背景概述
布拉灰语作为达罗毗荼语系中地理分布最为孤立的语言,主要通行于巴基斯坦俾路支省,其数字资源长期匮乏,自动语音识别技术发展严重滞后。2026年,研究者Talha Bin Omar发布BrahuiSpeech-70H数据集,首次公开提供了超过70小时、15000余条真实场景下的布拉灰语语音-文本对,采用波斯-阿拉伯书写系统标注,音频统一为16 kHz单声道。该数据集突破了以往公开语料规模狭小的瓶颈,将可用转录语音量提升数倍,为低资源语言语音识别、迁移学习及多语言建模提供了关键数据基础,对推动布拉灰语语言技术研究具有里程碑意义。
当前挑战
布拉灰语语音识别面临的核心领域挑战在于:该语言书写系统复杂、方言变异显著、口音与语速差异大,且真实场景录音常伴随背景噪声、设备异质、说话人距离变化及语码转换等现象,导致声学与语言建模困难。在数据集构建过程中,则需克服音频-文本对齐不精确、转录错误、静音与无效样本剔除、文本规范化及质量控制等难题。尽管BrahuiSpeech-70H在规模上实现突破,后续审查仍发现部分样本存在转录可靠性问题,凸显了低资源语言语料构建中质量保障的严峻挑战,也促使该版本被标记为弃用并待改进。
常用场景
经典使用场景
在低资源语言语音技术研究的背景下,BrahuiSpeech-70H数据集最经典的使用场景是作为自动语音识别(ASR)系统的训练与微调语料,尤其针对布拉灰语这一达罗毗荼语系的低资源语言。该数据集包含超过70小时、15000余条真实场景语音文本对,覆盖对话、采访、新闻、播客等多种域,使得研究者能够在非纯净录音条件下开展声学建模与语言模型适配,从而推动布拉灰语语音识别从实验室走向实际应用。
衍生相关工作
围绕BrahuiSpeech-70H,后续研究可能衍生出若干经典工作方向:一是基于该语料微调多语言ASR模型(如Whisper、MMS)以提升布拉灰语识别性能;二是利用其真实场景特性开展噪声鲁棒性声学建模与域适应研究;三是结合其他低资源语言语料进行跨语言迁移学习与语言识别。尽管该版本因转写质量问题已被弃用,但其作为首个大规模布拉灰语ASR语料的公开实践,仍为后续修正版数据集及相关语音技术研究奠定了重要基础。
数据集最近研究
最新研究方向
在低资源语言语音技术亟待突破的背景下,BrahuiSpeech-70H作为首个公开的超过70小时布拉灰语真实场景语音识别语料库,曾为达罗毗荼语系中这一濒危数字资源的语言开辟了大规模声学建模与迁移学习的可能。然而,该数据集当前已被官方标记为弃用版本,原因在于后续审查发现部分样本存在转录质量缺陷,包括音频与文本对齐失准及转写错误,这些问题可能对模型训练、微调与基准评测产生负面影响。尽管如此,该资源因已获DOI并构成永久学术记录而得以存档保留。当下相关前沿研究正聚焦于构建经过严格质量校正的改进版本,并以此为基础探索真实场景下低资源语音识别的鲁棒性提升、跨语言迁移学习以及多语言声学建模的可靠性评估,这对推动布拉灰语乃至巴基斯坦弱势语言 speech technology 的可持续发展具有关键意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务