遇见数据集

MizoSpeech

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

MizoSpeech是一个专为无监督预训练和语言学研究设计的音频语料库,涵盖米佐语及其相关方言。该数据集包含来自 Tibeto-Burman 语系 Kuki-Chin-Mizo 分支的10种不同方言的761,053个.wav音频录音,分别为Falam、Gangte、Hmar、Lai、Lushai、Mara、Paite、Ralte、Vaiphei和Zou。数据以Parquet格式存储,分为约500 MB的分片,每个分片嵌入原始音频字节和元数据,便于高效流式加载。数据集包含以下字段:audio(包含解码后的音频波形、路径和采样率)、path(原始文件路径)、language(方言标签)、duration(音频时长,单位秒)。总音频时长约为1855.88小时,其中Lushai方言占比最大(425,794条,1048.34小时),Zou方言最少(215条,0.51小时)。音频规格为16,000 Hz采样率、单声道、16位深度。该数据集适用于自动语音识别、无监督预训练及方言语言学研究。

MizoSpeech is an audio corpus designed for unsupervised pre-training and linguistic research, covering the Mizo language and its related dialects. The dataset contains 761,053 .wav audio recordings from 10 different dialects of the Kuki-Chin-Mizo branch of the Tibeto-Burman language family: Falam, Gangte, Hmar, Lai, Lushai, Mara, Paite, Ralte, Vaiphei, and Zou. Data is stored in Parquet format, partitioned into approximately 500 MB shards, each embedding raw audio bytes and metadata for efficient streaming loading. The dataset includes the following fields: audio (containing decoded audio waveform, path, and sample rate), path (original file path), language (dialect label), and duration (audio duration in seconds). The total audio duration is approximately 1855.88 hours, with the Lushai dialect having the largest share (425,794 recordings, 1048.34 hours) and the Zou dialect the smallest (215 recordings, 0.51 hours). Audio specifications are 16,000 Hz sample rate, mono channel, and 16-bit depth. This dataset is suitable for automatic speech recognition, unsupervised pre-training, and dialectological linguistic research.

创建时间:
2026-07-23
原始信息汇总

MizoSpeech 数据集概述

MizoSpeech 是一个为米佐语及其相关方言的无监督预训练和语言学研究而设计的音频语料库。

基本信息

  • 语言: 涵盖 Tibeto-Burman 语系 Kuki-Chin-Mizo 分支下的 10 种方言,包括 Falam、Gangte、Hmar、Lai、Lushai、Mara、Paite、Ralte、Vaiphei 和 Zou。
  • 许可协议: cc-by-nc-4.0
  • 任务类别: 自动语音识别 (Automatic Speech Recognition)
  • 数据规模: 共包含 761,053.wav 格式的音频录音,总时长约 1,855.88 小时
  • 数据格式: 数据集以 Parquet 格式分发,整个数据集被划分为约 500 MB 的分片(shards)。
  • 大小类别: 100K < n < 1M

数据结构

数据集的每个条目包含以下字段:

字段名 类型 描述
audio AudioFeature 一个字典,包含解码后的音频波形,其中有内部的文件 path 字符串、解码后的数值 array 以及 sampling_rate(采样率)。
path string 映射到原始文件结构的显式目录路径(例如,data/Falam_00001.wav)。
language string 音频录音中使用的具体米佐方言(Falam, Gangte, Hmar, Lai, Lushai, Mara, Paite, Ralte, Vaiphei, Zou)。
duration float32 音频片段的持续时间(秒),用于训练时过滤过长或过短的片段。

数据集统计

方言 话语数量 总音频时长(小时)
Lushai 425,794 1,048.34
Hmar 118,833 276.43
Lai 107,289 264.37
Paite 53,162 126.89
Falam 24,923 62.02
Vaiphei 15,806 39.66
Mara 9,111 22.73
Gangte 5,428 13.71
Ralte 492 1.22
Zou 215 0.51
总计 761,053 1,855.88

音频规格

  • 格式: .wav(嵌入在 Parquet 文件中)
  • 采样率: 16,000 Hz
  • 声道: 单声道 (Mono, 1)
  • 位深度: 16-bit

使用方式

用户可以通过 datasets 库直接加载数据集,例如:

python from datasets import load_dataset

dataset = load_dataset("andrewbawitlung/MizoSpeech", split="mizospeech")

数据集的主要优势在于其将原始音频字节安全地嵌入到 Parquet 分片中,免去了管理大量本地原始 .wav 文件的麻烦,同时便于高吞吐量的流式加载。

搜集汇总
数据集介绍
MizoSpeech 数据集图片
构建方式
MizoSpeech数据集是针对藏缅语族库基-钦-米佐语支下米佐语言及其方言构建的大规模音频语料库,涵盖Falam、Gangte、Hmar等10种方言,总计761,053条录音,时长约1,855.88小时。数据以Parquet格式分片存储,每个分片约500 MB,将原始音频字节与元数据(包括路径、语言标签、时长)安全嵌入,既缓解了本地管理大量.wav文件的负担,又促进了高效的数据流式加载。音频统一为16 kHz采样率、单声道、16位深度的.wav格式,确保处理一致性与数据质量。
特点
该数据集最显著的特点在于其方言多样性与规模宏大。10种方言的分布呈现明显长尾,Lushai方言占比最高(425,794条,约56%),而Zou方言仅215条,这种不平衡为方言识别、低资源语音识别及领域自适应研究提供了独特场景。同时,数据集的构建充分利用Parquet格式的列式存储优势,每个样本附带语言标签与时长字段,便于灵活过滤和采样,特别适合无监督预训练任务,有助于挖掘跨方言的共性语音表征。
使用方法
使用MizoSpeech数据集十分便捷,用户可通过HuggingFace的datasets库直接加载,如load_dataset("andrewbawitlung/MizoSpeech", split="mizospeech"),即刻获得音频数据和关联元数据。数据集的字段设计简洁明了,包含解码后的音频波形、原始路径、方言标签及时长,研究者可按需进行时长筛选或按语言划分子集,适用于语音识别模型的训练、验证及语言学分析,尤其便于端到端系统的快速迭代与评估。
背景与挑战
背景概述
MizoSpeech数据集由Andrew Bawitlung等人于近年创建,旨在推动米佐语及其方言的语音处理和语言学研究。米佐语属于藏缅语族库基-钦-米佐语支,拥有丰富的方言变体,但长期以来缺乏大规模、标准化的语音资源,严重制约了该语言的自动语音识别(ASR)、语音合成及语言学研究的进展。该数据集汇集了761,053条来自10个方言的.wav音频,总时长超过1,855小时,以Parquet格式存储,便于高效加载。其创建填补了低资源藏缅语系语音数据集的空白,为无监督预训练和多方言语音研究提供了宝贵资源,对保护濒危语言和促进语言技术公平性具有重要意义。
当前挑战
MizoSpeech数据集面临的挑战涵盖多个层面。在领域问题层面,米佐语及其方言的低资源特性使得训练鲁棒的ASR模型异常困难,同时方言间显著的语音和词汇差异对跨方言模型泛化构成严峻考验,背景噪声和录音环境非可控性进一步加剧了识别难度。在构建过程中,团队需克服数据采集的不均衡性,例如Lushai方言占比超半数而Zou方言仅有215条录音,这可能导致模型存在严重偏差;此外,音频的标准化处理、元数据对齐、多方言标注一致性以及确保数据的合法性和伦理合规性亦为构建环节的显著挑战。这些难题共同凸显了在低资源语言语音数据集建设中维护质量、代表性和实用性的复杂性。
常用场景
经典使用场景
MizoSpeech数据集作为针对米佐语及其方言的大规模音频语料库,其核心应用场景聚焦于无监督预训练与语音识别模型的基准测试。该数据集涵盖了库基-钦-米佐语支下十个代表性方言的逾七十六万条录音,总时长超过一千八百小时,为多方言语音识别系统的研发提供了丰富的训练资源。研究者可借助其统一的16kHz采样率与单声道格式,直接应用于端到端声学模型的预训练,亦可利用其方言标签开展跨方言迁移学习实验,探索低资源语言声学建模的鲁棒性策略。
衍生相关工作
基于该数据集,研究者已衍生出一系列相关工作,其中包括构建多方言语音识别基线系统,探讨在Lushai、Hmar等主要方言上的词错误率表现;利用该语料进行自监督表示学习,对比wav2vec 2.0与HuBERT等模型在跨方言场景下的特征迁移能力;以及结合方言标签进行语言识别与方言辨识的分类任务。这些工作不仅验证了MizoSpeech的实用价值,还推动了低资源语言语音技术的理论进展,为后续的语音合成和语音翻译研究奠定了数据与模型基础。
数据集最近研究
最新研究方向
MizoSpeech数据集聚焦于低资源藏缅语系下库基-钦-米佐语支的语音自监督预训练与方言学前沿探索。该语料库涵盖10种方言的76万余条音频,为跨方言语音表征学习、方言识别及语音合成提供大规模基准,尤其在方言多样性建模与多任务迁移学习方面开启新径。其16kHz采样率与统一格式设计,契合端到端语音模型高效训练需求,推动濒危语言保护与语音技术民主化进程,对计算语言学和区域文化数字化传承具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务