遇见数据集

burmese-speech-refined-openslr-80

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

Burmese Speech Refined OpenSLR-80 是一个基于原始 OpenSLR-80 数据集改进的缅甸语语音数据集。原始数据集中的文本根据音频发音转录,而本数据集由人工审查并修正文本,使其符合标准缅甸语拼写和书写规范,然后使用名为 Piya 的男性合成语音根据修正后的文本重新生成音频。数据集包含 2,529 个音频文件,总时长约 2.47 小时,音频格式为 16kHz、16-bit PCM、单声道 WAV。数据分为训练集(2,277 个样本)和测试集(252 个样本)。每条记录包含音频、转录文本、时长和说话人 ID。该数据集适用于文本转语音(TTS)、自动语音识别(ASR)、语音处理及其他基于缅甸语的机器学习应用。许可证为 CC-BY-SA 4.0。

Burmese Speech Refined OpenSLR-80 is an improved Burmese speech dataset based on the original OpenSLR-80 dataset. The text in the original dataset was transcribed according to audio pronunciation, while this dataset has been manually reviewed and corrected to conform to standard Burmese spelling and writing conventions. Audio was then regenerated using a male synthetic voice named Piya based on the corrected text. The dataset contains 2,529 audio files with a total duration of approximately 2.47 hours, in 16kHz, 16-bit PCM, mono WAV format. It is split into training set (2,277 samples) and test set (252 samples). Each record includes audio, transcription text, duration, and speaker ID. This dataset is suitable for text-to-speech (TTS), automatic speech recognition (ASR), speech processing, and other machine learning applications based on Burmese. The license is CC-BY-SA 4.0.

创建时间:
2026-08-29
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Burmese Speech Refined OpenSLR-80
  • 语言:缅甸语/缅甸语(my
  • 许可证:Creative Commons Attribution-ShareAlike 4.0 International (CC BY-SA 4.0)
  • 任务类别:自动语音识别(ASR)、文本转语音(TTS)
  • 标签:音频、语音
  • 样本数量:1K < N < 10K

数据集内容

该数据集基于原始 OpenSLR 数据集(SLR80)开发,针对缅甸语应用场景对文本和音频数据进行了精心审查和进一步改进。原始数据集中的缅文文本是根据对应音频的发音方式转录的,而本数据集以原始音频和文本数据为参考,人工审查并纠正了文本,使其遵循标准缅文拼写和书写习惯。随后使用纠正后的缅文文本,通过男声合成音色 Piya 生成了新的音频。该数据集旨在提供遵循标准书写规范的缅文文本、一致的音色数据以及统一的音频录音。

数据规模

  • 总音频片段数:2,529个
  • 总时长:约2.47小时
  • 音频规格:16 kHz、16-bit PCM、单声道 WAV
  • 说话人:Piya(男声合成音)
  • 数据划分
    • 训练集(train):2,277个样本,约254.2 MB
    • 测试集(test):252个样本,约28.9 MB
  • 总下载大小:约277.4 MB
  • 总数据集大小:约283.1 MB

数据特征

  • audio:音频文件
  • transcription:转录文本
  • duration:音频时长(float64)
  • speaker_id:说话人标识

数据用途

该数据集适用于文本转语音(TTS)、语音识别(ASR)、语音处理及其他基于缅甸语的机器学习应用。

引用来源

该数据集构建于原始 OpenSLR 数据集(SLR80)基础之上,原始数据集由 Google, Inc. 于2018年、2019年版权持有,并可通过 OpenSLR 获取。相关引用文献为 Oo 等人(2020)在 LREC 会议上发表的《Burmese Speech Corpus, Finite-State Text Normalization and Pronunciation Grammars with an Application to Text-to-Speech》。

搜集汇总
数据集介绍
burmese-speech-refined-openslr-80 数据集图片
构建方式
该数据集以OpenSLR-80缅甸语语音资源为基底,针对原始语料中文本依发音转写而与标准书写规范存在偏差的问题,采用人工审校方式对文本进行系统性修正,使其符合缅甸语正字法要求。继而以修正后的文本为脚本,借助名为Piya的男性合成语音重新生成音频,从而构建出文本与语音在规范层面高度协同的语料集合。整体流程涵盖原始音频与文本对照、人工拼写校正、合成语音生成及数据整合等环节,最终形成包含训练集2277条、测试集252条,总时长约2.47小时的语音数据集。
特点
该数据集的核心特质在于文本与语音的双重规范化。与原始语料相比,其文本经人工复核后遵循标准缅甸语书写惯例,有效缓解了音译转写带来的拼写失范现象。音频部分统一采用Piya男性合成语音,规格为16kHz、16位PCM、单声道WAV格式,保障了声学特征的一致性。数据集规模适中,总时长约2.47小时,涵盖训练与测试两个划分,元数据包含音频、转写文本、时长及说话人标识,为缅甸语语音处理任务提供了结构清晰、标注规整的基础资源。
使用方法
该数据集可服务于缅甸语文本转语音、自动语音识别及通用语音处理等机器学习任务。使用之际,可依据配置名称default加载数据,训练集与测试集分别对应data/train-*与data/test-*路径。各样本以字典形式提供音频数组、转写字符串、时长浮点值及说话人标识,便于直接接入语音识别或合成模型。针对文本转语音任务,可将transcription字段作为输入文本、audio字段作为目标声学信号;针对语音识别任务,则以音频为输入、转写为监督标签。使用时需遵循CC-BY-SA-4.0许可协议,并注意引用原始OpenSLR-80数据集。
背景与挑战
背景概述
缅甸语作为低资源语言,长期缺乏高质量的语音语料库,制约了语音识别与合成技术的发展。2018至2019年间,Google公司基于众包方式构建了OpenSLR-80缅甸语语音数据集,由Oo等研究人员在LREC 2020发表,成为该领域的重要基准。然而,原始数据集采用发音转写策略,文本与标准缅文正字法存在偏差,影响模型对规范书面语的建模能力。burmese-speech-refined-openslr-80正是在此基础上,对文本进行人工审校并利用合成语音重新生成音频,旨在为缅甸语语音处理提供文本规范、声学一致的资源,推动低资源语言语音技术的研究与应用。
当前挑战
缅甸语语音处理面临多重挑战。从领域问题看,缅甸语书写系统复杂,存在发音与正字法不一致的现象,给自动语音识别和文本转语音系统带来建模困难。原始OpenSLR-80数据集虽经人工质检,但文本转写遵循口语发音而非标准拼写,导致语言模型难以学习规范表达。在构建refined数据集过程中,挑战同样显著:人工审校需兼顾缅文正字法规则与语义准确性,耗时且依赖专家知识;采用合成语音重新生成音频虽保证了声学一致性,但可能引入合成伪影,削弱模型对真实语音的泛化能力。此外,数据集规模有限,仅约2.47小时,难以支撑大规模深度学习训练,如何平衡数据质量与数量仍是亟待解决的问题。
常用场景
经典使用场景
在缅甸语语音处理领域,该数据集最经典的使用场景是作为自动语音识别(ASR)系统的训练与评估语料。其包含的2529条音频样本(约2.47小时)均配有经过人工校正的标准缅甸语拼写文本,且音频由统一的合成男声Piya生成,从而为声学模型与语言模型的联合优化提供了规范化的数据基础。研究者常利用其train/test分割进行模型泛化能力的验证,并借助时长与说话人标识等元数据开展鲁棒性分析。
解决学术问题
该数据集有效解决了缅甸语语音研究中长期存在的文本非标准化与声学不一致问题。原始OpenSLR-80数据集虽提供了高质量录音,但其转写遵循发音而非标准正字法,导致语言模型训练时面临拼写歧义;同时,多说话人录音引入了声学变异性。本数据集通过人工复核文本并采用单一合成声音重建音频,消除了上述混杂因素,为缅甸语ASR、TTS及语音处理研究提供了可控且可复现的实验基准,推动了低资源语言语音技术的可比较性研究。
衍生相关工作
基于该数据集,后续研究衍生出多项经典工作。例如,研究者利用其标准化文本与合成语音训练缅甸语端到端TTS模型,并探索迁移学习至真实人声场景;部分工作将其作为预训练语料,结合自监督学习框架提升低资源缅甸语ASR性能。此外,该数据集还被用于评估语音合成质量与文本规范化算法,并启发了针对其他东南亚语言的类似精炼数据集构建,如泰语和老挝语语音资源的标准化改进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务