遇见数据集

sulabhkatiyar/ne-asr-ccp-aug

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

NE ASR增强数据集——Chakma(ccp)是一个用于自动语音识别(ASR)的增强数据集,专门针对Chakma语言(ISO 639-3代码:ccp)。Chakma是一种在印度米佐拉姆邦使用的印度-雅利安语,属于有声调语言。该数据集基于原始数据sulabhkatiyar/ne-asr-ccp进行增强,原始数据来自ARTPARK-IISc Vaani项目。增强过程仅应用速度扰动(0.9倍和1.1倍),未应用音高偏移(以保留声调语言的词汇意义),训练样本从32,807个原始样本增加到98,421个(3倍增强)。数据集包含训练、验证和测试分割,音频为16kHz单声道WAV格式(以Parquet文件存储字节),并包括文本转录、语言和增强标签等信息。数据集许可证为CC-BY-NC 4.0,适用于低资源语音处理研究。

NE ASR Augmented Dataset -- Chakma (ccp) is an augmented automatic speech recognition dataset for the Chakma language (ISO 639-3: ccp), an Indo-Aryan tonal language spoken in Mizoram, India. It is augmented from the original dataset sulabhkatiyar/ne-asr-ccp, which contains transcribed speech data from the ARTPARK-IISc Vaani project. The augmentation applies only speed perturbation (factors 0.9 and 1.1) without pitch shift to preserve lexical tone contrasts, expanding the training samples from 32,807 original samples to 98,421 (3x augmentation). The dataset includes train, validation, and test splits, with audio stored as 16kHz mono WAV in Parquet format, along with text transcriptions, language, and augmentation labels. It is licensed under CC-BY-NC 4.0 and is designed for low-resource speech processing.

提供机构:
sulabhkatiyar
搜集汇总
数据集介绍
sulabhkatiyar/ne-asr-ccp-aug 数据集图片
构建方式
该数据集基于印度东北部低资源语言Chakma的原始语音识别数据进行扩增构建。原始语料源自ARTPARK-IISc Vaani项目,包含约49.8小时的录音。为保证声调语言的音位对比不受破坏,构建流程仅采用速度扰动策略,以0.9和1.1两种速度因子对每条训练样本进行三倍扩增,严格禁用音高偏移与噪声叠加,最终生成98,421条扩增后的训练样本,并保留原始验证集与测试集的纯净数据。
特点
该数据集专为低资源声调语言自动语音识别设计,具有鲜明且严谨的领域适配性。其音频统一为16kHz单声道WAV格式并存储于Parquet文件中,每条记录包含音频、转录文本、语言标签及扩增类型标识。扩增策略去除了对声调语言具有破坏性的音高变换,仅以速度扰动实现数据增强,同时所有音频长度保持与原素材一致,避免因时长剪裁引入信息偏差,确保模型训练数据自然有效。
使用方法
用户可通过HuggingFace Datasets库便捷加载使用,调用`load_dataset("sulabhkatiyar/ne-asr-ccp-aug")`即可获取完整数据集。训练、验证和测试三部分可从返回的DatasetDict中分别提取。利用`augmentation`字段可灵活过滤数据,如筛选出原始非扩增样本或特定速度扰动的样本。音频数据自动解码为array形式,直接接入下游ASR模型进行微调与评估,操作流程简洁高效。
背景与挑战
背景概述
在自动语音识别(ASR)领域,低资源语言的语料库匮乏长期制约着相关技术的发展。Chakma(ccp)作为印度米佐拉姆邦使用的印度-雅利安语系声调语言,其语音数据尤为稀缺。为此,研究者于2026年基于ARTPARK-IISc Vaani项目的原始录音,构建了ne-asr-ccp-aug数据集。该数据集由Sulabh Katiyar等人创建,旨在通过数据增强技术弥补Chakma语言ASR数据的不足,为下游模型微调提供充足且符合语言特性的训练样本。其在声调语言数据增强策略上的严谨探索,对类似低资源语种的ASR研究具有重要参考价值。
当前挑战
该数据集面临的核心挑战在于声调语言的特殊性。Chakma作为声调语言,音高变化直接关联词汇意义,传统的音高偏移增强会破坏声调对立,导致语义混淆,这在v1.0版本中已造成严重问题,迫使版本重建。此外,低资源环境下的原始数据量仅约49.8小时,远不足以训练鲁棒的ASR模型,需依赖速度扰动等非破坏性增强手段扩大样本规模。构建过程中还需平衡增强倍数与数据真实性,避免过度扩充引入噪声。最终,数据集需保证增强策略的合规性(如CC-BY-NC 4.0许可兼容),并确保版本追溯的透明度,以维护学术规范。
常用场景
经典使用场景
在低资源语言语音识别研究领域,该数据集专为查克马语(Chakma,ISO 639-3代码ccp)这一声调语言提供经过速度扰动增强的语音与文本对齐数据,是训练端到端自动语音识别(ASR)模型的首选资源之一。研究者常利用其精心设计的3倍扩增策略(原始语速及0.9倍、1.1倍速度扰动),在不引入音高变化破坏声调对立的前提下,有效扩充训练样本至98,421条,覆盖约149.4小时语音时长。该数据集采用16kHz单声道WAV格式并存储为Parquet文件,便于高效加载与处理,常用于构建或微调基于Transformer的ASR架构,尤其适合探索声调语言鲁棒性建模与数据增强策略的科学问题。
衍生相关工作
该数据集的发布直接衍生了一系列围绕低资源声调语言ASR的经典工作,包括开发以此为训练数据的查克马语专用端到端ASR基线系统,以及基于MMS-1B模型的微调适配器(Tier-1 ccp adapter),其v2.0版本修正了早期增强缺陷,成为后续研究者重训声调语言模型的黄金参照。衍生工作中还包括探索对比学习、语音与文本联合预训练策略在声调区分任务上的效益研究,以及将该数据集纳入多语言ASR基准评估套件,用以量化声调语言在跨语言泛化中的性能差距。此外,数据增强配置文件和开源处理脚本被社区复用并扩展至其他语言,形成了关于速度扰动与音高变换对声调语言影响的最新实验证据链,推动了数据增强方法论在语音领域的精细化发展。
数据集最近研究
最新研究方向
该数据集聚焦于低资源濒危语言查克玛语的语音识别增强研究,针对其声调特性谨慎设计数据扩充策略。最新研究放弃使用音高偏移等可能破坏声调对比的传统增强手段,仅采用速度扰动(0.9倍和1.1倍)实现3倍扩增,并在v2.0版本中纠正了此前7倍错误扩增的问题。该工作与印度东北部低资源语言保护及ARTPARK-IISc Vaani项目的语音数字人文倡议紧密相关,为声调语言的ASR数据增强树立了方法论标杆,推动了濒危语言语音技术的可信发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务