遇见数据集

tiny-tagalog-dataset

收藏
github2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

一个公开的、使用男性声音的他加禄语歌唱数据集,包含详细的音素系统(基于他加禄语正字法)、音频处理(降噪、去混响等)和标注信息,歌曲列表涵盖多首他加禄语流行歌曲。

A publicly available Tagalog singing dataset featuring male vocals. It includes a detailed phoneme system based on Tagalog orthography, incorporates audio processing techniques such as noise reduction and dereverberation, and provides comprehensive annotation information, with its song list covering multiple popular Tagalog songs.

创建时间:
2026-07-25
原始信息汇总

数据集概述

名称:tiny-tagalog-dataset
类型:公共他加禄语(Tagalog)歌唱数据集
语言:他加禄语
声音特征:男性嗓音


音素系统

元音

音素 X-SAMPA
a a
e e
i i
o o
u u

辅音

音素 X-SAMPA
b b
d d
dy dZ
g g
h h
k k
l l
m m
n n
ng N
p p
r 4
s s
sy S
t t
ty tS
w w
W w (coda)
y j
Y j (coda)
cl ?

其他音素

音素 描述
SP 纯静音
AP 呼吸声
exh 呼气声
vf 声带摩擦音

数据处理

  • 录音环境:非专业环境,但尽力保证质量
  • 压缩处理:通过 LALA 压缩器大致均衡动态
  • 降噪与去混响:由 PixPrucer 使用以下工具完成
  • 静音切除:自动切除长静音段
  • 音频格式:44.1kHz,16-bit,WAV

录音与处理工具

  • 录音:Audacity / REAPER
  • 压缩:LALA by Analog Obsession

标注方法

  • 初始标注:使用 SOFA 生成基础标签
  • 手动修正:所有标签均由人工校正

歌曲列表

文件名 歌曲
TGL_core_001 Kitchie Nadal - Huwag Na Huwag Mong Sasabihin
TGL_core_002 MYMP - Kailan
TGL_core_003 MYMP - Kailan
TGL_core_004 Eraserheads - Spoliarium
TGL_core_005 Eraserheads - Spoliarium
TGL_core_006 IV of Spades - Mundo
TGL_core_007 IV of Spades - Mundo
TGL_core_008 IV of Spades - Mundo
TGL_core_009 Moonstar88 - Torete
TGL_core_010 Up Dharma Down - Tadhana
TGL_core_011 Up Dharma Down - Tadhana
TGL_core_012 Moonstar88 - Migraine
TGL_core_013 Maldita - Porque
TGL_core_014 Up Dharma Down - OO
TGL_core_015 Paramita - Hiling
TGL_core_016 Paramita - Hiling
TGL_core_017 Paramita - Hiling
TGL_core_018 Aneka Abarrientos - Bakit (Pag Pinahiwatig)
TGL_core_019 Zack Tabudlo - Habang Buhay

许可协议

  • 许可证:CC BY-NC 4.0(署名-非商业使用)
  • 许可证链接:https://creativecommons.org/licenses/by-nc/4.0/
搜集汇总
数据集介绍
tiny-tagalog-dataset 数据集图片
构建方式
本数据集聚焦于他加禄语演唱语音的标准化采集与标注。所有音频由单一男性歌手录制,虽未采用专业录音环境,但通过压缩器均衡动态后,利用melband-roformer-denoise与dereverb_bs_roformer模型进行去噪与去混响处理,并自动切除冗长静音段,最终以44.1kHz、16-bit的WAV格式保存。音素体系基于他加禄语正字法设计,涵盖5个元音与23个辅音(含腭化音、声门塞音等),并引入静音、呼吸、气声及气泡音等辅助标记。标注工作借助SOFA工具生成初始标签,再经人工逐条校正,确保音素边界与发音类型的精确性。
特点
该数据集以男性歌手演唱他加禄语流行歌曲为核心特色,涵盖Kitchie Nadal、Eraserheads、IV of Spades等艺术家的19首作品,部分曲目存在多版本录制以捕捉演唱变异性。音素系统在正字法基础上扩展了X-SAMPA映射,尤其对边缘音位(如韵尾/w/、/j/的变体标记)及发声态(呼吸声、气泡音)进行细致区分,有利于处理非模态发声现象。所有音频经降噪与混响抑制处理,降低了环境干扰对声学特征的影响,同时保留了自然演唱的连贯性与情感表达。
使用方法
数据集以标准WAV音频文件与手工校正的标注文件形式提供,可直接用于他加禄语演唱合成(SVS)系统的训练。用户需将音频与对应的音素序列标签对齐,构建输入特征(如梅尔频谱)与目标标签的映射关系。推荐采用序列到序列模型或基于Transformer的语音合成架构,利用其丰富的发声态标记(如SP、AP、exh、vf)提升合成语音的自然度。由于采用CC BY-NC 4.0许可协议,研究用途需遵守非商业限制,并署名数据集的原始创建者。
背景与挑战
背景概述
语音合成与歌声合成技术近年来蓬勃发展,但主流研究多聚焦于英语、中文等广泛使用的语言,诸如他加禄语等小语种资源极为匮乏。在此背景下,由研究者UtaUtaUtau于2026年创建了tiny-tagalog-dataset,这是一个公开的他加禄语歌声数据集,以男性嗓音录制,收录了19首涵盖菲律宾流行与独立音乐风格的歌曲片段。数据集基于他加禄语正字法设计了音素系统,包含5个元音与一系列辅音、特殊发音符号,为多语种歌声合成研究提供了稀缺的基础资源。该数据集对推动低资源语言在语音合成领域的发展具有开创性意义,尤其为非英语地区的文化与语言技术融合提供了重要支撑。
当前挑战
该数据集面临的挑战在于多维度:首先,他加禄语作为小语种,音素系统与韵律特征与英语差异显著,现有模型难以直接迁移,且缺乏大规模标注语音库,制约了歌声合成模型的泛化性能。其次,数据采集环境非专业录音室,虽经压缩、降噪与去混响处理,但音频质量仍受背景噪声与房间声学特性影响,可能引入伪影。此外,手工修正标签过程耗时且易出错,仅覆盖单一男性嗓音与有限曲目,导致数据集规模小、多样性不足,难以支撑对多歌手、多风格及语音细微变化的鲁棒学习。
常用场景
经典使用场景
在语音合成与声学建模领域,Tiny Tagalog Dataset为基于他加禄语的歌唱声音合成提供了稀缺的标注语料。该数据集收录了19首菲律宾流行歌曲片段,由单一男性歌手演唱,并经过精细的手工音素标注与降噪反射处理,尤其适用于训练端到端的歌唱合成模型,如SVS(Singing Voice Synthesis)系统中的时长预测、音高轮廓生成与音素对齐任务。研究者可借此构建首个针对他加禄语的歌唱声学模型,填补该语种在非英语歌唱语料库中的空白。
解决学术问题
该数据集有效缓解了低资源语种——他加禄语——在歌唱语音研究中的语料匮乏问题。尽管他加禄语拥有庞大使用人口,但其语音资源长期集中于口语领域,缺乏高质量、带音素标注的歌唱录音。该数据集通过提供系统性音素体系(涵盖元音、辅音及SP、AP、vf等特殊发音事件)和经过压缩均衡的专业前处理流程,为研究音色变异、发音人特性与跨语种歌唱迁移学习奠定了基础。此外,其开源许可(CC BY-NC 4.0)促进了可重复性研究与跨语种比较。
衍生相关工作
围绕Tiny Tagalog Dataset,衍生工作可能聚焦于多语言歌唱合成模型的跨语种适应与微调策略。例如,利用多任务学习框架将该数据与英语、汉语等大规模歌唱数据集联合训练,探索音素映射与韵律迁移机制。此外,基于其标注体系,研究者可扩展构建更大规模的他加禄语歌唱语料库,或开发针对非专业录音环境(如移动端、居家场景)的鲁棒性前处理流水线。在方法论层面,该数据已催生对低资源语种音素集设计与手工标注效率优化的探讨,如结合预训练声学模型进行半自动标注校正。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务