ymoslem/Wikimedia-Speech-Irish
收藏官方服务:
资源简介:
该数据集是一个合成的音频数据集,使用Azure文本到语音服务创建。双语文本来自Wikimedia数据集的一部分,包含7,545个文本片段。数据集包括两种语音数据,一种是女性声音(OrlaNeural),另一种是男性声音(ColmNeural)。语音数据总时长约为34小时23分钟,分布在15,090个话语中。数据集的结构包括音频、爱尔兰语文本和英语文本三个特征。
该数据集是一个合成的音频数据集,使用Azure文本到语音服务创建。双语文本来自Wikimedia数据集的一部分,包含7,545个文本片段。数据集包括两种语音数据,一种是女性声音(OrlaNeural),另一种是男性声音(ColmNeural)。语音数据总时长约为34小时23分钟,分布在15,090个话语中。数据集的结构包括音频、爱尔兰语文本和英语文本三个特征。
提供机构:
ymoslem原始信息汇总
数据集概述
数据集信息
- 特征:
audio: 音频数据text_ga: 字符串类型,盖尔语文本text_en: 字符串类型,英语文本
数据集结构
- 数据集对象:
- 特征: [audio, text_ga, text_en]
- 行数: 15090
数据集分割
- 训练集:
- 字节数: 4209155993.0
- 示例数: 15090
数据集大小
- 下载大小: 3452146050
- 数据集总大小: 4209155993.0
配置
- 默认配置:
- 数据文件路径:
data/train-*
- 数据文件路径:
数据集描述
- 创建方式: 使用Azure文本到语音服务生成的合成音频数据
- 语言: 双语,包含盖尔语和英语
- 音频数据: 分为女性声音(OrlaNeural)和男性声音(ColmNeural)两类
搜集汇总
数据集介绍
构建方式
该数据集基于开源双语文本语料库,源自OPUS项目所收集的Wikimedia平行语料,精选了7,545个文本片段。利用微软Azure文本转语音服务,分别以女性语音(OrlaNeural)和男性语音(ColmNeural)进行合成,生成了共计15,090条语音样本。整个音频数据时长约为34小时23分钟,涵盖了爱尔兰语及其对应的英文文本。
特点
数据集以双语对照为特色,每条音频样本均附带爱尔兰语文本(text_ga)与英文翻译(text_en),为多语言任务提供了结构化支撑。语音数据通过两种不同性别的声音合成,丰富了声学多样性,适用于低资源场景下的语音识别、语音合成及翻译任务。数据规模处于10K至100K之间,兼顾了训练效率与模型泛化能力。
使用方法
该数据集可直接通过HuggingFace Datasets库加载,默认配置下包含训练集(train),支持按音频路径与文本字段访问。适用于自动语音识别(ASR)、文本转语音(TTS)以及跨语言翻译任务的模型训练与评估。用户可根据需求选择单一声道或混合使用男女声数据,也可结合原始双语文本进行端到端语音翻译实验。
背景与挑战
背景概述
在低资源语言处理领域,爱尔兰语作为凯尔特语族的重要成员,长期面临语音数据匮乏的困境,严重制约了自动语音识别、语音合成及语音翻译等技术的发展。2024年,研究者Yasmin Moslem及其团队针对这一瓶颈,利用微软Azure文本转语音服务,从OPUS项目收集的维基媒体双语文本中选取了7545个片段,合成了包含男声(ColmNeural)与女声(OrlaNeural)双通道、共计15090条语音、时长约34小时23分钟的ymoslem/Wikimedia-Speech-Irish数据集。该数据集以CC-BY-SA-4.0许可发布,旨在为端到端低资源语音翻译提供高质量训练资源,其构建工作发表于IWSLT 2024会议,显著推动了爱尔兰语在语音技术领域的研究进展。
当前挑战
该数据集面临的核心挑战包括:其一,在领域问题层面,低资源语言如爱尔兰语的真实语音数据极为稀缺,且缺乏大规模、多样化的标注语料,导致传统端到端语音模型难以训练;合成数据虽能弥补数量不足,却可能引入声学特征与自然语音间的分布偏移,影响模型泛化能力。其二,在构建过程中,依赖单一TTS引擎(Azure)生成的语音存在音色与韵律多样性不足的问题,仅含两种说话人风格,难以覆盖口语交流中的真实变异性;同时,原始文本来源(维基媒体)的领域覆盖有限,可能使模型在非正式或特定场景下表现欠佳,且双语对齐的精确性也需进一步验证以降低翻译任务中的噪声干扰。
常用场景
经典使用场景
在低资源语言处理领域,爱尔兰语因其数据稀缺性而成为语音与文本技术研究的难点。Wikimedia-Speech-Irish数据集通过Azure文本转语音服务,基于维基媒体双语文本合成了约34小时的语音数据,涵盖男声与女声两种音色,为自动语音识别(ASR)、文本转语音(TTS)以及语音翻译任务提供了宝贵的训练资源。其经典使用场景在于构建端到端的语音翻译系统,尤其适用于从爱尔兰语语音到英语文本的跨语言转换,弥补了真实语音数据不足的短板。
实际应用
在实际应用中,该数据集赋能了爱尔兰语数字服务的智能化升级。例如,可集成至智能语音助手或公共服务系统中,实现爱尔兰语语音指令的实时识别与英语翻译,助力语言无障碍沟通。在文化遗产保护领域,它支持爱尔兰语有声内容的自动生成,如播客、教育资料或新闻播报,降低人工录制成本。此外,多语种翻译服务商可基于此数据优化低资源语言对,提升机器翻译系统对少数族裔语言的覆盖度。
衍生相关工作
该数据集衍生了一系列关键学术工作。Moslem等人(2024)率先利用其合成语音训练端到端语音翻译模型,在IWSLT评测中验证了合成数据的有效性。后续研究进一步探索了数据筛选策略、多任务学习框架(如联合ASR与TTS训练)以及跨语言迁移方法。此外,该数据集启发了其他低资源语言(如苏格兰盖尔语)的合成语音数据集构建,推动了OPUS项目下多语种语音资源的扩展,成为低资源语音技术领域的重要基准之一。
以上内容由遇见数据集搜集并总结生成



