遇见数据集
官方服务:

资源简介:

菲律宾语言数据集(Philippine Language Dataset,简称PLD)是由菲律宾大学迪利曼分校数字信号处理实验室收集的一个大规模多语言语音数据集,旨在填补菲律宾低资源语言在自动语音识别(ASR)和文本转语音(TTS)领域的空白。该数据集覆盖了10种菲律宾语言,包括比科尔语、宿务语、卡潘潘甘语、希利盖农语、伊洛卡诺语、瓦瑞语、邦阿西楠语、陶苏格语,以及菲律宾语和英语,共计980名说话人、448.2小时、334,268条录音。所有音频均为16kHz单声道,以FLAC格式存储,并预先分割为短句,无需额外对齐。数据集包含多种语音类型:朗读(read,完整句子,适合TTS)、孤立词(isolated,单词和短语)、自发言语(spontaneous,自由对话,但文本为提示问题而非转录)和数字串(digits)。其中自发言语部分(约32小时)的文本并非转录,而是提示问题,训练时需注意过滤。数据集提供了丰富的元数据字段,包括音频、句子文本、时长、词数、语言代码、语言名称、语料库语言、语音类型、提示类别、提示来源、文本是否为提示、说话人ID、性别、年龄、方言(含父母方言)、职业、会话环境等。预设划分为训练集(300,842条)和测试集(33,426条),但说话人可能重叠,建议按speaker_id重新划分以获得说话人无关的评估。该数据集适用于ASR、TTS、语音转换、方言分析等任务,并已基于此训练了多种基线模型。需要注意的是,文本为提示文本而非人工验证的转录,部分数据存在编码修复问题,且语言覆盖不平衡(比科尔语95.8小时,陶苏格语仅5.9小时)。

The Philippine Language Dataset (PLD) is a large-scale multilingual speech dataset collected by the Digital Signal Processing Laboratory of the University of the Philippines Diliman, aimed at filling the gap of low-resource Philippine languages in automatic speech recognition (ASR) and text-to-speech (TTS) domains. It covers 10 Philippine languages, including Bikol, Cebuano, Kapampangan, Hiligaynon, Ilocano, Waray, Pangasinan, Tausug, as well as Filipino and English, totaling 980 speakers, 448.2 hours, and 334,268 recordings. All audio is 16kHz mono, stored in FLAC format, and pre-segmented into short utterances without additional alignment. The dataset includes multiple speech types: read (full sentences, suitable for TTS), isolated (words and phrases), spontaneous (free conversation, but text is prompt questions rather than transcriptions), and digits. The spontaneous part (about 32 hours) has text as prompts, not transcriptions, requiring filtering during training. Rich metadata fields are provided, including audio, sentence text, duration, word count, language code, language name, corpus language, speech type, prompt category, prompt source, whether text is prompt, speaker ID, gender, age, dialect (including parental dialect), occupation, recording environment, etc. The default split is training set (300,842) and test set (33,426), but speakers may overlap; it is recommended to re-split by speaker_id for speaker-independent evaluation. The dataset is suitable for ASR, TTS, voice conversion, dialect analysis, and other tasks, and various baseline models have been trained on it. Note that the text is prompt text rather than human-verified transcriptions, some data may have encoding repair issues, and language coverage is imbalanced (Bikol 95.8 hours, Tausug only 5.9 hours).

创建时间:
2026-08-08
原始信息汇总

菲律宾语言数据集 (Philippine Language Dataset, PLD)

数据集概览

该数据集由菲律宾大学迪利曼分校数字信号处理实验室收集,是最大的多语言菲律宾语音数据集之一,以 Parquet 格式提供。数据集包含10种菲律宾语言、980位说话人、448小时的提示语音,共计334,268条话语,覆盖了低资源语言场景。

  • 规模: 334,268条话语 · 448.2小时 · 980位说话人 · 10种语言 · 16kHz单声道
  • 语言: 比科尔语、宿务语、英语、菲律宾语、希利盖农语、伊洛卡诺语、邦阿西楠语、邦板牙语、陶苏格语、瓦瑞语
  • 任务: 自动语音识别 (ASR)、文本转语音 (TTS)
  • 许可: 其他 (UP-DSP研究许可)

数据划分

划分 行数
train 300,842
test 33,426

语言分布

语言代码 语言 话语数 小时数
bcl 比科尔语 62,488 95.8
pam 邦板牙语 57,595 84.1
ceb 宿务语 56,928 58.5
fil 菲律宾语 50,993 52.1
ilo 伊洛卡诺语 29,688 51.1
hil 希利盖农语 30,965 39.8
war 瓦瑞语 21,526 31.4
eng 英语 14,024 20.8
pag 邦阿西楠语 5,566 8.7
tsg 陶苏格语 4,495 5.9

语音类型分布

类型 话语数 小时数 平均时长 说明
read (朗读) 158,121 302.9 6.9秒 完整提示句子(新闻、医疗、文学、教育、旅游),最适合TTS
isolated (孤立词) 164,447 107.3 2.3秒 单词和短语
spontaneous (自发语音) 2,586 32.2 44.8秒 自由语音,仅含提示文本
digits (数字) 9,114 5.9 2.3秒 口语数字串

数据模式 (Schema)

每个样本包含以下字段:audio (16kHz单声道,FLAC压缩)、sentence (提示文本)、duration (时长,秒)、num_words (字数)、language (ISO 639-3代码)、language_name (语言名称)、corpus_language (所属语言集合)、speech_type (语音类型)、prompt_category (提示类别)、prompt_source (提示来源文件名)、text_is_prompt (文本是否是提示问题)、speaker_id (说话人ID)、gender (性别)、age (年龄)、speaker_dialect (说话人方言)、mother_dialect/father_dialect (父母方言)、profession (职业)、session_id (录音会话ID)、session_environment (录音环境)、source_file (原始WAV文件名)。

重要注意事项

  1. 文本是提示而非转录: 2,586行的speech_type == "spontaneous"不包含转录,其音频是对提示问题的自发回答(20–90秒),训练前需要过滤:ds.filter(lambda x: not x["text_is_prompt"])
  2. 弱监督特性: 文本是要求说话人朗读的内容,未经核实是否完全一致,需视为弱监督数据
  3. 说话人重叠: 默认划分基于话语随机90/10分割,说话人可能同时出现在训练和测试集,需使用speaker_id重新划分以进行说话人无关评估
  4. 英语非母语: eng标签的英语是菲律宾L2说话人朗读的英语单词/句子列表,需使用corpus_language字段区分来源
  5. 半数为单词: 约164k条isolated行平均时长仅2.3秒,句子级任务需按speech_type过滤

方言字段丰富性

该语料库的方言字段尤为丰富——说话人、母亲和父亲的方言均有记录,支持方言计量学和语言接触研究。

基于该数据的参考模型

  • TTS模型: 每个语言一个基于microsoft/speecht5_tts的微调模型(共10个),以及一个多语言语音转换模型speecht5_vc-pld支持跨语言任意到任意的语音转换
  • ASR模型: 每个语言一个基于openai/whisper-small的微调模型,以CER为选择指标(非WER),英文(菲律宾)CER最低为3.1%,邦板牙语CER最高为14.7%
  • 性能解读: 这些属于域内基准数据,实际应用中在自发或噪声语音上表现可能显著下降

构建方法

通过解析会话日志、分类语音类型(使用显式标记或基于单词数测量)、修复双编码UTF-8、重采样至16kHz单声道并编码FLAC、分片为Parquet格式。共1,943行(0.6%)因引用不存在的WAV文件被跳过。

局限性

  • 提示性而非会话性: 除32小时自发语音外,均为朗读列表,韵律和词汇反映该特点
  • 转录未经验证: 存在残余不匹配率
  • 覆盖不均衡: 比科尔语95.8小时,陶苏格语仅5.9小时
  • 录音条件不一: 各会话环境描述较为宽松
  • 无默认说话人分离划分

相关数据集

属于 halohalo 菲律宾语音数据集家族,包括:

  • pld (本数据集): 10种语言,334k话语 · 448小时
  • filipinospeechcorpus: 菲律宾语录音室朗读+自发,305k片段 · 65小时
  • halo-livestream: 他加禄语-英语代码混合直播语音(种子版)

使用与贡献

  • 数据来源于UP迪利曼数字信号处理实验室,此为研究用途的重新包装,请注明原始收集者,研究以外用途需联系UP-DSP
  • 可通过GitHub仓库(sapinsapin/halohalo)改进处理流程,通过Hugging Face讨论区报告错误行,并鼓励基于任一语言训练基线模型并标记本数据集
搜集汇总
数据集介绍
pld 数据集图片
构建方式
该数据集由菲律宾大学迪利曼分校数字信号处理实验室精心构建,汇聚了十种菲律宾语言的语音数据。构建过程遵循严谨的流程:首先遍历每个会话目录,解析包含说话者人口统计信息和每一条话语元数据的日志文件;随后依据显式标记或提示列表的词汇数中位数,对每条话语的语音类型进行细致分类;在转录文本的编码修复环节,采用针对性的双重UTF-8解码策略,以恢复正确的字符表示;最终将音频统一重采样至16kHz单声道,以FLAC格式压缩存储,并切分为Parquet分片,按照9:1的比例随机划分为训练集与测试集。该过程剔除了约0.6%因源文件缺失而无法关联的音频记录,确保了数据集的完整性与可复现性。
使用方法
数据集的使用极为便捷,可通过HuggingFace的datasets库轻松加载,支持流式读取以快速预览数据。用户可使用单行过滤器排除`text_is_prompt`为真的样本,并依据时长范围筛选有效语音,从而构建适合监督训练的语料。针对特定语言,可基于语言代码进行子集提取,便于开展单语种任务。此外,数据集提供了多种预训练模型的微调脚本,支持语音识别、语音合成及语音转换等任务的快速复现。建议在评估时依据说话者ID重新划分数据集,以避免说话者重叠导致的性能高估,从而获得更可靠、更具泛化性的模型性能指标。
背景与挑战
背景概述
菲律宾语系涵盖众多语言,但长期以来,其语音数据资源极度匮乏,多数语言甚至缺乏公开的语音识别与合成基准。为填补这一空白,菲律宾大学迪利曼分校数字信号处理实验室于近年构建了菲律宾语言数据集(PLD),该系统性地收录了比科尔语、宿务语、邦板牙语等十种语言,涵盖980位发音人,总计448小时的提示语音,包含超过33万条话语。该数据集的核心研究问题在于为低资源语言提供大规模、多语种的语音资源,以推动自动语音识别(ASR)与文本转语音(TTS)技术的发展。PLD的发布显著缓解了菲律宾语系语音数据稀缺的困境,为相关领域的研究提供了宝贵的基础数据,并催生了多种语言模型与语音转换模型的训练,对低资源语音技术的研究产生了深远影响。
当前挑战
PLD数据集在构建与应用中面临多重挑战。在领域问题层面,菲律宾语系语言众多,且多数为低资源语言,缺乏足够的标注语音数据,这严重制约了ASR与TTS系统的性能。PLD虽提供了大规模数据,但各语言覆盖不均衡,如比科尔语有95.8小时,而陶苏格语仅5.9小时,这导致模型在低资源语言上性能显著下降。在构建过程中,团队需处理多种录音环境、多样的命名规则,并修复双重编码的UTF-8文本。此外,部分语料仅包含问题提示而非文本转录,属于自发语音,需谨慎处理以避免污染监督训练。同时,训练数据中的说话人重叠问题也需在评估时加以考虑。这些挑战共同构成了PLD数据集在促进多语种语音技术发展中所面临的复杂局面。
常用场景
经典使用场景
菲律宾语言数据集(PLD)作为大规模多语言语音语料库,在低资源语言语音处理领域具有独特的应用价值。该数据集汇集了十种菲律宾语言,覆盖了从比科尔语到陶苏格语的广泛语言谱系,总计448小时的提示语音,为自动语音识别和文本转语音系统的研发提供了宝贵的数据基础。研究者常利用该数据集进行跨语言语音模型的训练与评估,尤其在那些缺乏公开语音资源的语言上,PLD填补了重要的空白。数据集的精细标注,包括语音类型、说话人人口统计信息和方言背景,极大地方便了多样化的音频处理实验,推动了多语言语音技术的进步。
解决学术问题
该数据集从根本上解决了菲律宾语言在语音技术研究中数据稀缺的困境,特别是针对除他加禄语之外的八种语言,它们拥有数千万的使用者,却此前几乎没有公开的语音数据。PLD的发布使得学术界能够探索多语言语音识别和合成的新挑战,诸如低资源条件下的模型泛化、跨语言迁移学习以及方言变异的影响。数据集中丰富的说话人元数据和提示文本,促使研究者深入探讨语音与语言接触问题,为计算语言学和方言计量学提供了实证基础。通过提供大规模、多说话人的监督数据,PLD显著推进了对这些语言韵律特征和音系结构的科学理解。
实际应用
在实际应用层面,PLD数据集催生了多种可直接部署的语音技术工具,如针对每种语言的语音合成模型和多语言语音转换系统。这些模型能够在浏览器中运行,使用户可以实时转录、合成或转换十种语言中的任意一种声音,极大地方便了语言教育、无障碍通讯和文化遗产保护等场景。此外,该数据集的语音识别模型为构建面向菲律宾本土语言的智能助理、语音搜索和自动字幕服务提供了技术支撑,促进了信息技术在多元语言环境中的包容性发展。对于资源受限的环境,数据集还展示了在单块GPU上训练有效模型的可行性,降低了技术应用的门槛。
数据集最近研究
最新研究方向
菲律宾语数据集(PLD)的发布标志着低资源语言语音技术研究迈入新纪元,其覆盖十种语言、448小时语料,为学界提供了史上最大规模的多语言菲律宾语语音资源。该数据集的前沿研究方向聚焦于多语言自动语音识别(ASR)与语音合成(TTS)的跨语言泛化能力,尤其针对Whisper等预训练模型在缺乏语言token的低资源语种上的微调策略;同时,语料中丰富的方言元数据(如母语、父语)为方言测量与语言接触研究开辟了崭新路径。PLD的诞生恰逢全球对语言多样性保护与AI包容性发展的关注浪潮,其发布不仅填补了菲律宾语系在公共语音数据集上的空白,更为构建公平、普惠的多语言技术生态提供了关键基石,对推动低资源语言技术落地具有里程碑式意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务