遇见数据集

sulabhkatiyar/ne-asr-mjw-aug

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

这是一个针对Karbi语言(ISO 639-3代码:mjw)的增强自动语音识别(ASR)数据集。Karbi是一种在印度阿萨姆邦使用的藏缅语系有声调语言。数据集基于原始Vaani项目录音,通过速度扰动增强(0.9倍和1.1倍速度)将训练样本从508个扩展到1,524个(3倍增强),但未应用音高偏移以保留声调语言的词汇意义。数据集包含训练、验证和测试分割,音频为16kHz单声道WAV格式,存储为Parquet文件,并包含音频、文本、语言和增强标签等特征。许可证为CC-BY-NC 4.0。

Augmented automatic speech recognition dataset for Karbi (mjw), a Tibeto-Burman tonal language spoken in Assam, India. The dataset is enhanced from original Vaani project recordings via speed perturbation (0.9x and 1.1x speed) to expand training samples from 508 to 1,524 (3x augmentation), without pitch shift to preserve lexical tone contrasts. It includes train, validation, and test splits, with audio in 16kHz mono WAV format stored as Parquet files, featuring audio, text, language, and augmentation labels. Licensed under CC-BY-NC 4.0.

提供机构:
sulabhkatiyar
搜集汇总
数据集介绍
sulabhkatiyar/ne-asr-mjw-aug 数据集图片
构建方式
该数据集源自ARTPARK-IISc Vaani项目录制的Karbi语语音数据,原始语料由508条训练样本构成,时长约0.6小时。为提升低资源语音识别系统的鲁棒性,研究者采用速度扰动策略对训练集进行三倍扩增,即对每条原始样本分别生成0.9倍与1.1倍速的变体,结合原始样本共得到1,524条增强训练样本。需特别指出的是,鉴于Karbi语为声调语言(存在高中低三种对立声调),构建过程明确禁用了音高偏移增强,以防破坏词汇声调对立关系。验证集与测试集则保持原始状态未经处理。
特点
该数据集的显著特点在于针对声调低资源语言的增强策略设计。所有音频以16kHz单声道WAV格式存储于Parquet文件中,每条样本均包含音频字节、文本转录、语言标签及增强类型标注(原始/速度0.9/速度1.1)。增强配置严格遵循声调语言保护原则,仅应用速度扰动而禁用音高变换,为同类语言的数据增强提供了方法论参考。数据集采用CC-BY-NC 4.0许可协议,覆盖约1.9小时的增强后语音数据。
使用方法
数据集可通过HuggingFace Datasets库便捷加载,支持按划分(训练/验证/测试)或增强类型进行精细筛选。用户可直接使用`load_dataset("sulabhkatiyar/ne-asr-mjw-aug")`加载完整数据,或通过指定`split`参数获取特定划分。利用`filter`函数可提取原始样本或特定速度变体,例如`train.filter(lambda x: x["augmentation"] == "original")`获取非增强数据。训练时建议结合SpecAugment策略(掩码时间概率0.05、掩码特征概率0.03等)进一步优化模型泛化能力。
背景与挑战
背景概述
NE ASR Augmented Dataset — Karbi (mjw) 是一个面向低资源藏缅语系语言Karbi的自动语音识别增强数据集,由研究者Sulabh Katiyar基于ARTPARK-IISc Vaani项目的原始录音构建,于2026年5月发布。Karbi语使用于印度阿萨姆邦,具有三种对比声调,原始可用数据仅约0.63小时,属于典型的极低资源语言。该数据集的核心研究问题在于,如何通过合理的数据增强策略提升ASR模型在语言多样性极高、标注数据稀缺的印度东北部地区的泛化能力。该数据集的发布为低资源语音识别领域提供了重要基准,尤其突显了声调语言在数据增强中需要谨慎处理,对于推动声调语言ASR技术的发展具有显著影响力。
当前挑战
该数据集面临的核心挑战包括:1) 低资源语言ASR的根本难题——Karbi语仅有508条训练样本,约0.6小时有效语音,远不足以支撑深度模型训练,数据稀缺导致模型易过拟合且泛化能力差;2) 声调语言的增强困境——Karbi语为声调语言(高中低三阶对立),早期v1.0版本错误地应用音高偏移增强,破坏了声调的词汇区分功能,这一构建过程中的失误警示了在增强策略中须严格区分类别;3) 许可证兼容性问题——原始录音为CC-BY-4.0,但与下游MMS-1B模型产物结合后需改用更严格的CC-BY-NC-4.0非商业许可,限制了部分研究者的使用场景。
常用场景
经典使用场景
在低资源自动语音识别(ASR)研究领域,ne-asr-mjw-aug数据集专为卡比语(Karbi,ISO 639-3: mjw)这一印度阿萨姆邦的藏缅语族声调语言而构建。其最经典的使用场景是作为训练集微调端到端语音识别模型,如基于MMS-1B的架构。通过速度扰动(0.9x、1.0x、1.1x)实现3倍数据扩增,将原始约0.6小时的训练音频扩展至约1.9小时,有效缓解了低资源场景下的数据稀疏问题,为卡比语的语音识别模型提供了基础训练语料。
衍生相关工作
该数据集衍生了多项相关研究工作。首先,其构建方案直接服务于NE ASR项目下的低资源印地语东北部语言语音识别管线,为后续阿萨姆语、曼尼普尔语等同区域语言的扩增策略提供了可复用的配置与代码(如configs/augmentation_config.yaml与scripts/augment_data.py)。其次,数据集中对声调语言扩增边界条件的明确记录(如tonal_audit.md)启发了后续对语音扩增中语言类型学约束的系统性评估。此外,结合MMS-1B的微调实验也为跨语言迁移学习在极低资源场景下的表现提供了基准对比数据。
数据集最近研究
最新研究方向
该数据集聚焦于印度东北部低资源语言卡比语(Karbi)的语音识别增强,通过速度扰动技术实现了3倍数据扩充,同时严格规避了音高偏移对声调语言的破坏性影响。这一设计响应了当前低资源语言ASR研究中对数据增强策略与语言特性兼容性的迫切需求,特别是在声调语言处理领域。该数据集不仅为卡比语的自动语音识别基准测试提供了验证集与测试集,更通过开源发布推动了印度次大陆濒危语言数字化保护的进程,其版本迭代中体现的声调语言处理规范亦为同类研究树立了方法论标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务