pld
收藏资源简介:
菲律宾语言数据集(Philippine Language Dataset,简称PLD)是由菲律宾大学迪利曼分校数字信号处理实验室收集的一个大规模多语言语音数据集,旨在填补菲律宾低资源语言在自动语音识别(ASR)和文本转语音(TTS)领域的空白。该数据集覆盖了10种菲律宾语言,包括比科尔语、宿务语、卡潘潘甘语、希利盖农语、伊洛卡诺语、瓦瑞语、邦阿西楠语、陶苏格语,以及菲律宾语和英语,共计980名说话人、448.2小时、334,268条录音。所有音频均为16kHz单声道,以FLAC格式存储,并预先分割为短句,无需额外对齐。数据集包含多种语音类型:朗读(read,完整句子,适合TTS)、孤立词(isolated,单词和短语)、自发言语(spontaneous,自由对话,但文本为提示问题而非转录)和数字串(digits)。其中自发言语部分(约32小时)的文本并非转录,而是提示问题,训练时需注意过滤。数据集提供了丰富的元数据字段,包括音频、句子文本、时长、词数、语言代码、语言名称、语料库语言、语音类型、提示类别、提示来源、文本是否为提示、说话人ID、性别、年龄、方言(含父母方言)、职业、会话环境等。预设划分为训练集(300,842条)和测试集(33,426条),但说话人可能重叠,建议按speaker_id重新划分以获得说话人无关的评估。该数据集适用于ASR、TTS、语音转换、方言分析等任务,并已基于此训练了多种基线模型。需要注意的是,文本为提示文本而非人工验证的转录,部分数据存在编码修复问题,且语言覆盖不平衡(比科尔语95.8小时,陶苏格语仅5.9小时)。
The Philippine Language Dataset (PLD) is a large-scale multilingual speech dataset collected by the Digital Signal Processing Laboratory of the University of the Philippines Diliman, aimed at filling the gap of low-resource Philippine languages in automatic speech recognition (ASR) and text-to-speech (TTS) domains. It covers 10 Philippine languages, including Bikol, Cebuano, Kapampangan, Hiligaynon, Ilocano, Waray, Pangasinan, Tausug, as well as Filipino and English, totaling 980 speakers, 448.2 hours, and 334,268 recordings. All audio is 16kHz mono, stored in FLAC format, and pre-segmented into short utterances without additional alignment. The dataset includes multiple speech types: read (full sentences, suitable for TTS), isolated (words and phrases), spontaneous (free conversation, but text is prompt questions rather than transcriptions), and digits. The spontaneous part (about 32 hours) has text as prompts, not transcriptions, requiring filtering during training. Rich metadata fields are provided, including audio, sentence text, duration, word count, language code, language name, corpus language, speech type, prompt category, prompt source, whether text is prompt, speaker ID, gender, age, dialect (including parental dialect), occupation, recording environment, etc. The default split is training set (300,842) and test set (33,426), but speakers may overlap; it is recommended to re-split by speaker_id for speaker-independent evaluation. The dataset is suitable for ASR, TTS, voice conversion, dialect analysis, and other tasks, and various baseline models have been trained on it. Note that the text is prompt text rather than human-verified transcriptions, some data may have encoding repair issues, and language coverage is imbalanced (Bikol 95.8 hours, Tausug only 5.9 hours).
菲律宾语言数据集 (Philippine Language Dataset, PLD)
数据集概览
该数据集由菲律宾大学迪利曼分校数字信号处理实验室收集,是最大的多语言菲律宾语音数据集之一,以 Parquet 格式提供。数据集包含10种菲律宾语言、980位说话人、448小时的提示语音,共计334,268条话语,覆盖了低资源语言场景。
- 规模: 334,268条话语 · 448.2小时 · 980位说话人 · 10种语言 · 16kHz单声道
- 语言: 比科尔语、宿务语、英语、菲律宾语、希利盖农语、伊洛卡诺语、邦阿西楠语、邦板牙语、陶苏格语、瓦瑞语
- 任务: 自动语音识别 (ASR)、文本转语音 (TTS)
- 许可: 其他 (UP-DSP研究许可)
数据划分
| 划分 | 行数 |
|---|---|
train |
300,842 |
test |
33,426 |
语言分布
| 语言代码 | 语言 | 话语数 | 小时数 |
|---|---|---|---|
bcl |
比科尔语 | 62,488 | 95.8 |
pam |
邦板牙语 | 57,595 | 84.1 |
ceb |
宿务语 | 56,928 | 58.5 |
fil |
菲律宾语 | 50,993 | 52.1 |
ilo |
伊洛卡诺语 | 29,688 | 51.1 |
hil |
希利盖农语 | 30,965 | 39.8 |
war |
瓦瑞语 | 21,526 | 31.4 |
eng |
英语 | 14,024 | 20.8 |
pag |
邦阿西楠语 | 5,566 | 8.7 |
tsg |
陶苏格语 | 4,495 | 5.9 |
语音类型分布
| 类型 | 话语数 | 小时数 | 平均时长 | 说明 |
|---|---|---|---|---|
read (朗读) |
158,121 | 302.9 | 6.9秒 | 完整提示句子(新闻、医疗、文学、教育、旅游),最适合TTS |
isolated (孤立词) |
164,447 | 107.3 | 2.3秒 | 单词和短语 |
spontaneous (自发语音) |
2,586 | 32.2 | 44.8秒 | 自由语音,仅含提示文本 |
digits (数字) |
9,114 | 5.9 | 2.3秒 | 口语数字串 |
数据模式 (Schema)
每个样本包含以下字段:audio (16kHz单声道,FLAC压缩)、sentence (提示文本)、duration (时长,秒)、num_words (字数)、language (ISO 639-3代码)、language_name (语言名称)、corpus_language (所属语言集合)、speech_type (语音类型)、prompt_category (提示类别)、prompt_source (提示来源文件名)、text_is_prompt (文本是否是提示问题)、speaker_id (说话人ID)、gender (性别)、age (年龄)、speaker_dialect (说话人方言)、mother_dialect/father_dialect (父母方言)、profession (职业)、session_id (录音会话ID)、session_environment (录音环境)、source_file (原始WAV文件名)。
重要注意事项
- 文本是提示而非转录: 2,586行的
speech_type == "spontaneous"不包含转录,其音频是对提示问题的自发回答(20–90秒),训练前需要过滤:ds.filter(lambda x: not x["text_is_prompt"]) - 弱监督特性: 文本是要求说话人朗读的内容,未经核实是否完全一致,需视为弱监督数据
- 说话人重叠: 默认划分基于话语随机90/10分割,说话人可能同时出现在训练和测试集,需使用
speaker_id重新划分以进行说话人无关评估 - 英语非母语:
eng标签的英语是菲律宾L2说话人朗读的英语单词/句子列表,需使用corpus_language字段区分来源 - 半数为单词: 约164k条
isolated行平均时长仅2.3秒,句子级任务需按speech_type过滤
方言字段丰富性
该语料库的方言字段尤为丰富——说话人、母亲和父亲的方言均有记录,支持方言计量学和语言接触研究。
基于该数据的参考模型
- TTS模型: 每个语言一个基于
microsoft/speecht5_tts的微调模型(共10个),以及一个多语言语音转换模型speecht5_vc-pld支持跨语言任意到任意的语音转换 - ASR模型: 每个语言一个基于
openai/whisper-small的微调模型,以CER为选择指标(非WER),英文(菲律宾)CER最低为3.1%,邦板牙语CER最高为14.7% - 性能解读: 这些属于域内基准数据,实际应用中在自发或噪声语音上表现可能显著下降
构建方法
通过解析会话日志、分类语音类型(使用显式标记或基于单词数测量)、修复双编码UTF-8、重采样至16kHz单声道并编码FLAC、分片为Parquet格式。共1,943行(0.6%)因引用不存在的WAV文件被跳过。
局限性
- 提示性而非会话性: 除32小时自发语音外,均为朗读列表,韵律和词汇反映该特点
- 转录未经验证: 存在残余不匹配率
- 覆盖不均衡: 比科尔语95.8小时,陶苏格语仅5.9小时
- 录音条件不一: 各会话环境描述较为宽松
- 无默认说话人分离划分
相关数据集
属于 halohalo 菲律宾语音数据集家族,包括:
- pld (本数据集): 10种语言,334k话语 · 448小时
- filipinospeechcorpus: 菲律宾语录音室朗读+自发,305k片段 · 65小时
- halo-livestream: 他加禄语-英语代码混合直播语音(种子版)
使用与贡献
- 数据来源于UP迪利曼数字信号处理实验室,此为研究用途的重新包装,请注明原始收集者,研究以外用途需联系UP-DSP
- 可通过GitHub仓库(sapinsapin/halohalo)改进处理流程,通过Hugging Face讨论区报告错误行,并鼓励基于任一语言训练基线模型并标记本数据集




