LIEE Filipino Singing Corpus for Singing Voice Synthesis
收藏数据链接:
官方服务:
资源简介:
菲律宾语歌唱语料库,用于歌唱语音合成
Filipino singing speech corpus for singing voice synthesis
创建时间:
2026-08-08
原始信息汇总
LIEE 菲律宾语歌声合成语料库
作者: julieraptor
时长: 17:40(HH:MM:SS)
内容格式: .wav、.lab、.ds
录音设备: Rode NT1
数据集概述
这是一个公开发布的LIEE菲律宾语歌声数据语料库,于2025年录制。音频数据以16-bit、44.1kHz规格录制,适用于歌声合成(Singing Voice Synthesis)任务。
制作人员
- 演唱者: Julilyn Ng (julieraptor)
- 录音: julieraptor
- 标注: julieraptor
- 标志设计: gardanana
使用条款
免费分发声明: 该语料库免费分发。如付费获得,则视为被骗,应要求退款。
允许的使用
- 在Diffsinger多说话人训练中作为并行学习材料使用(需注明来源)。
- 基于该语料库创建的歌声合成数据库可商业化分发(作为并行学习材料)。
- 在Diffsinger多说话人训练中,用于扩展LIEE语言能力(超越现有训练范围)。
- 用于其他歌声合成数据库(如NNSVS、ENUNU等)的并行训练材料(需注明来源)。
禁止的使用
- 重新分发语料库原始文件。
- 未经作者明确书面许可,使用语料库创建和分发自定义版本的LIEE(公开演示可接受)。
- 将数据用于Diff-SVC、RVC或其他变声器。
- 使用数据冒充作者/演唱者。
语音特点与标注
- 演唱者为英语和菲律宾语母语者;可使用西班牙语进行对话,日语为初学者水平。
- 标签以前缀标注语言,例如:
[en/ah] [fil/a] [ja/a] [es/a]。 - 提供合并的音素文件,兼容其他语言,用户可按需编辑以适应训练需求。
- julieraptor开发的Diffsinger菲律宾语音素器已于2025年11月合并入OpenUTAU主分支。使用及语言学相关信息,请参考:https://github.com/julieraptor/Diffsinger-Filipino-Phonemizer
联系方式
- 邮箱: liee.immortal.idol@gmail.com
- 网站: http://immortal-idol.carrd.co
搜集汇总
数据集介绍

构建方式
该数据集由原生英语及菲律宾语使用者Julilyn Ng于2025年录制,采用Rode NT1麦克风,以16-bit、44.1kHz的规格采集,总时长达17分40秒。语料包含.wav音频文件、.lab标注文件及.ds数据文件,覆盖英语、菲律宾语、西班牙语及日语四种语言。标注文件以语言前缀(如[en/ah])标记音素,并附有合并音素文件以便跨语言训练适配。
特点
该语料库专为歌唱语音合成设计,具备多语言特性,支持Diffsinger多说话人训练及NNSVS、ENUNU等语音合成系统。其特色在于提供精细的音素级标注,且包含语言兼容性处理。版权条款明确允许用于并行学习材料的商业分发,但严格禁止用于变声器或身份模仿,保障了数据使用的伦理边界。
使用方法
使用者可将其作为并行训练语料,用于Diffsinger等歌唱合成模型的开发,需在成果中标注“LIEE”来源。数据中的合并音素文件需根据训练需求调整兼容性。此外,已集成的Diffsinger菲律宾语注音器(见OpenUTAU主分支)可辅助处理语言学细节,提升多语言合成效果。
背景与挑战
背景概述
LIEE Filipino Singing Corpus for Singing Voice Synthesis 是由 julieraptor 于2025年创建并公开的非商业性数据集,旨在支持基于神经网络的歌声合成(Singing Voice Synthesis, SVS)研究。该语料库以菲律宾语为核心,同时涵盖英语、西班牙语和日语的多语言标注,由母语者 Julilyn Ng 录制,采用 Rode NT1 麦克风以16位、44.1kHz 的高保真规格采集,总时长约17分40秒。该数据集的主要研究问题在于为低资源语言(如菲律宾语)的歌声合成提供高质量、多语言的平行训练材料,以弥补现有合成系统在语种覆盖上的不足。其影响力体现在与 OpenUTAU 的集成,以及为 Diffsinger、NNSVS 等系统提供多说话人训练的语料支持,推动了多语言歌声合成技术的发展。
当前挑战
该数据集面临的挑战集中于多语言歌声合成的复杂性。首先,菲律宾语作为低资源语言,缺乏现成的音素标注和规范化工具,构建过程中需手工进行精确的语音标注,且必须设计跨语言音素映射以兼容英语、西班牙语和日语,这要求对多语言音系有深入理解。其次,歌声合成对音高、时长和动态细节的敏感性要求高,语料库必须兼顾自然演唱的韵律变化,而当前数据量(17:40)相对有限,可能限制模型泛化能力。此外,使用条款明确规定禁止用于语音转换(如 Diff-SVC、RVC),这限制了数据在变声领域的应用,但为合成研究提供了伦理边界。数据集构建还面临录音环境控制、说话人一致性维持等工程挑战,以及如何在多说话人训练中有效利用平行语料,实现跨语言韵律特征的迁移,是后续研究的关键难点。
常用场景
经典使用场景
LIEE菲律宾歌唱语料库作为首个公开的菲律宾语歌唱语音数据集,其核心应用场景在于歌声合成(Singing Voice Synthesis, SVS)模型的训练与评估。该语料库包含17分40秒的高保真录音(16-bit/44.1kHz),由母语为菲律宾语的歌手录制,并提供精细的音素标注(.lab)及乐谱对应文件(.ds),适合用于端到端歌声合成系统的开发。研究者可借助此语料库,在Diffsinger、NNSVS、ENUNU等主流框架中开展多说话人并行训练,从而探索多语言歌声合成中菲律宾语的建模策略,填补了该语种在歌声合成研究中的空白。
解决学术问题
该数据集解决了低资源语种(菲律宾语)在歌声合成研究中缺乏高质量、公开可用的标注语音数据的关键问题。在学术层面,它促进了多语言歌声合成模型的泛化能力研究,使研究者能够验证跨语言音素映射与声学特征迁移的有效性。此数据集的发布也为韵律建模、音高预测及发音准确性评估提供了标准化的评价基准,推动了歌声合成领域在语种覆盖广度上的拓展,并加深了对南岛语系语言在歌声中语音学特性的理解。
衍生相关工作
围绕该数据集衍生的经典工作主要包括基于多说话人并行训练的菲律宾语歌声合成模型开发,以及跨语种声学特征共享的研究。例如,利用该语料库与日语、英语等语种数据联合训练,可实现零样本或小样本的菲律宾语歌声合成,这为多语种说话人嵌入技术提供了实验基础。此外,其标注规范(如多语言音素前缀)启发了后续类似低资源语种数据集的构建,而OpenUTAU中的菲律宾语音素器设计则成为开源歌声合成社区中语种扩展的参考范例,促进了社区驱动的语种适配工具的发展。
以上内容由遇见数据集搜集并总结生成



