遇见数据集

phoible-voxangeles-formants-aggregated

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

PHOIBLE × VoxAngeles 音位清单与共振峰(聚合版)数据集是一个跨语言的表格数据集,核心目标是将世界语言的音位清单信息与真实语音录音的声学特征相结合。它整合了来自PHOIBLE数据库的音位清单及其区别性特征矩阵,以及来自VoxAngeles语料库(基于UCLA语音实验室档案)的经过语音学审核和音段对齐的共振峰数据(F1-F5)。数据集以“一个语言清单中的一个音位”为基本单位(每一行),提供语言元数据(如语言名称、ISO 639-3代码、Glottocode、地理区域、经纬度)、音位信息(IPA符号、音段类别:辅音、元音或声调)、以及约37个区别性特征(如feat_syllabic、feat_nasal等,值为+, -, 0)。对于VoxAngeles语料库覆盖的语言(约95种),数据集通过(语言,IPA符号)匹配,附上基于所有可用录音计算的平均共振峰频率(F1-F5),并通过has_audio布尔标志和n_segments计数标识有音频数据的音位;无匹配音频的音位共振峰列显示为NA。此外,数据集包含指向“实现版”配套数据集的realization_ids字段,后者存储每个单独录音的详细数据。数据集适用于语音学、音系学类型学研究,以及需要结合音系特征和声学特征的机器学习任务(如表格分类或特征提取),但需注意其局限性:音频覆盖不完整、共振峰值是对具体语音实现的平均、匹配基于精确音标、以及测量设置的影响。数据集基于PHOIBLE(CC-BY-SA)和VoxAngeles(CC-BY-NC 4.0)构建,并以CC-BY-SA-4.0许可发布。

创建时间:
2026-05-26
原始信息汇总

数据集概述:PHOIBLE × VoxAngeles — 聚合音素清单与共振峰数据

这是一个跨语言的表格数据集,将世界语言的音素清单(来自 PHOIBLE)与真实音频录制的声学共振峰测量值(F1–F5,来自 VoxAngeles 语料库)进行配对。每一行对应一种语言清单中的一个音素,并标注了 PHOIBLE 的完整区别性特征集,以及(在存在匹配音频的情况下)该音素的平均共振峰频率。

构建逻辑

  1. 基础数据:PHOIBLE 提供纯符号的音素清单和区别性特征;VoxAngeles 提供带有音段级别标注的音频及其预计算的 F1–F3 共振峰测量(由 Praat 用 Burg 方法测量)。
  2. 匹配与聚合:通过(语言代码,IPA 符号)对将 VoxAngeles 中的每个发音实现(realization)与 PHOIBLE 音素条目链接。在聚合数据集中,同一音素的所有发音实现的共振峰值被平均。
  3. 处理缺失:使用左连接保留所有 PHOIBLE 音素。对于 VoxAngeles 未覆盖的音素,共振峰字段设为 NA,并通过 has_audio 标志明确记录。

数据字段

字段名 类型 描述
language_name 字符串 语言名称(来自 Glottolog)
iso639_3 字符串 ISO 639-3 语言代码
glottocode 字符串 Glottolog 语言代码
macroarea 字符串 宏观区域(如 Eurasia, Africa 等)
latitude 字符串 语言纬度
longitude 字符串 语言经度
inventory_id 字符串 PHOIBLE 清单标识符
phoneme_ipa 字符串 音素的 IPA 符号
segment_class 字符串 音段类别:consonantvoweltone
has_audio 布尔值 在 VoxAngeles 中是否存在匹配音频
n_segments 整数 用于计算共振峰均值的音频实现数量(无音频时为 0
F1F5 浮点数 平均共振峰频率(Hz),若缺失则为 NA
feat_* 字符串 PHOIBLE 区别性特征(约 37 列,如 feat_tonefeat_syllabic 等,取值 +-0
realization_ids 字符串列表 在配套实现数据集中对应单个实现记录的 ID

NA 规则

  • 若音素无匹配音频:F1F5 全部为 NAhas_audio = falsen_segments = 0)。
  • 若音频存在但仅测得 k 个共振峰(k < 5):保留 k 个数值,其余 5 - k 个为 NA
  • CSV 导出中 NA 以文本 NA 表示;Parquet/Hugging Face 版本中为真正的空值。

使用示例

python from datasets import load_dataset ds = load_dataset("Mikimi/phoible-voxangeles-formants-aggregated", split="train")

仅筛选有共振峰数据的音素

with_audio = ds.filter(lambda r: r["has_audio"])

仅筛选元音

vowels = ds.filter(lambda r: r["segment_class"] == "vowel")

主要局限

  • 音频覆盖不完整:仅 VoxAngeles 覆盖的约 95 种语言拥有共振峰数据。
  • 共振峰是实现的属性:数值基于可用发音实现的平均值,不应被视为音素的规范属性。
  • 匹配基于符号:通过精确的(语言,IPA 符号)对匹配,转写差异可能导致匹配遗漏。
  • 测量设置影响:Praat 的固定上限频率设置无法对所有说话者最优。

数据规模

  • 行数范围:100,000 < n < 1,000,000。
  • 任务类别:表格分类、特征提取。

许可与来源

  • PHOIBLE 2.0:CC-BY-SA 许可。
  • VoxAngeles(基于 UCLA 语音学实验室档案):CC-BY-NC 4.0 许可。
  • 本数据集:CC-BY-SA-4.0 许可(注意:底层音频受 CC-BY-NC 4.0 约束,非商业用途)。
搜集汇总
数据集介绍
phoible-voxangeles-formants-aggregated 数据集图片
构建方式
该数据集通过精巧的跨库整合策略构建而成。首先,系统提取PHOIBLE数据库中收录的全球语言音位清单,涵盖语言元数据与约37项区别性特征。随后,从VoxAngeles语料库中获取经Praat软件(Burg算法)测量的原始共振峰数据(F1-F3),并依据语音时长四分位点进行归一化处理。在此基础上,以语言代码与IPA符号为匹配键,将两项资源进行左连接:保留PHOIBLE的全部音位条目,仅为存在匹配音频的条目附加平均共振峰频率。未匹配条目的共振峰列填充为NA,并通过has_audio标志明确标识。
特点
该数据集的核心特点在于首次实现了大规模音位清单与声学共振峰测量值的系统关联。其涵盖约95种语言的可听读音位,提供F1至F5共五个共振峰频率的均值,每行还包含n_segments字段反映平均统计所依赖的录音样本量。数据沿用PHOIBLE完整的区别性特征体系,便于音系类型学分析。同时,行文明确区分抽象音位与具体实现音,指出共振峰数值仅为可用录音样本的统计摘要,而非音位的典范属性。匹配策略基于精确的音标符号,揭示了跨来源转录差异可能带来的局限性。
使用方法
研究者可通过Hugging Face datasets库便捷加载该数据。核心操作包括筛选含有音频的条目(filter has_audio为true的行)以聚焦声学分析,或按segment_class字段筛选特定音类(如元音)。数据集支持表格分类与特征提取任务,其结构设计便于与PHOIBLE原库及VoxAngeles衍生配套数据集联动使用。需注意,音频覆盖范围仅限于VoxAngeles语料库所含语言,大量PHOIBLE音位缺乏声学数据;共振峰反映的是具体发音人的录音实现,且测量依赖Praat的预设上限频率,使用时建议结合源数据集共同引用。
背景与挑战
背景概述
在语音学与音系类型学领域,跨语言的音位库存与声学特征之间的系统关联一直是研究焦点,而传统资源往往将音位符号(如IPA)与声学实测数据割裂开来。2019年,由Steven Moran和Daniel McCloy主导的PHOIBLE 2.0项目于马克斯·普朗克人类历史科学研究所发布,汇集了全球数百种语言的音位库存与区别特征矩阵,却缺乏对应音频。同期,基于加州大学洛杉矶分校语音学实验室档案构建的VoxAngeles语料库(涵盖约95种语言)提供了经人工校验的语音分段音频。为弥合符号与声学间的鸿沟,本研究团队构建了该聚合数据集,将PHOIBLE的抽象音位清单与VoxAngeles的共振峰测量(F1-F5)一一对应,为音系类型学、语音识别及低资源语言研究提供了首个大规模、可量化的跨语言声学-音位桥梁,显著推动了经验语音学与计算语言学的交叉探索。
当前挑战
该数据集面临的核心挑战首先在于领域问题:音位库存研究长期依赖符号描述,缺乏与真实声学特征的系统关联,导致音系类型学分析难以触及语音实现的物理细节,尤其对低资源语言而言,声学数据的匮乏限制了自动语音处理技术的适用性。构建过程中,挑战尤为突出:其一,音频覆盖范围有限,仅约95种语言拥有匹配声学记录,绝大多数PHOIBLE音位因无对应音频而被迫标记为缺失值;其二,共振峰测量依赖于Praat的Burg算法与全局参数设定,而不同说话人的声道差异使得单一频率上限难以同时适配所有样本,引入系统性偏差;其三,匹配机制基于精确的(语言、IPA符号)配对,转录差异或音位变体的存在常导致遗漏;其四,共振峰值反映的是具体发音实例的统计平均,而非音位的抽象属性,其解释需谨慎避免本质化解读。
常用场景
经典使用场景
该数据集PHOIBLE × VoxAngeles将全球语言音位库(PHOIBLE)与真实录音声学共振峰测量值(VoxAngeles)精妙结合,为跨语言语音学研究提供了空前丰富的结构化资源。经典用法在于利用该表格数据,对特定语言的音位库进行声学特征标注,使无音频的音位库获得带有共振峰特征的语言学描述。研究者可借此筛选出具有音频数据的音位,集中分析某类音段(如元音)在不同语言中的共振峰模式,进而探索语音实现与抽象音位表征之间的映射关系。这一融合数据集的独特价值在于,它维系了语言学符号描述与声学物理测量之间的桥梁,为计算语言学和语音学提供了高质量、多语言、可复现的数据基础。
实际应用
在实际应用层面,该数据集为多语言语音工程提供了宝贵资源。语音合成与语音识别系统在面向低资源语言时,常常缺乏充足的声学数据来训练鲁棒模型。该数据集将PHOIBLE覆盖的2000多种语言的音位信息与VoxAngeles近百种语言的真实共振峰测量值相结合,使开发者能够利用这些标注数据,构建跨语言的语音特征表示。例如,可通过音位特征预测共振峰模式,从而辅助面向低资源语言的语音合成系统设计,或为语音识别中的声学模型初始化提供语言学先验知识。此外,该数据集对比较语音学教学与语言遗产记录亦有所裨益,为分析语言音韵系统的声学特征提供了可重复利用的标准化数据。
衍生相关工作
该数据集催生了一系列重要的衍生研究,主要围绕语音表征的跨语言比较与计算方法展开。最直接的工作是利用该集合中带有音频的音位条目,训练音位到声学特征映射的神经网络模型,探索从抽象特征集合到实际共振峰值的回归任务。另外,研究者基于该数据与配套的逐次实现数据集,开发了语音变异建模方法,分析了同一音位在不同语境、不同说话人下的共振峰分布特性。此外,该数据集也被用于验证自动音位标注系统的有效性,通过将系统生成的共振峰预测与真实测量值比对,评估音位识别算法的准确度。还有工作将其与深度语音生成模型结合,生成基于真实声学分布的合成语音,推动低资源语言的语音技术发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务