遇见数据集

Mikimi/phoible-voxangeles-formants-aggregated

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

PHOIBLE x VoxAngeles — 带共振峰的音位库存(聚合版)是一个跨语言的表格数据集,它将来自PHOIBLE的世界语言音位库存与来自VoxAngeles语料库的真实音频录音中提取的声学共振峰测量值(F1-F5)配对。每一行代表一个语言库存中的一个音位,并标注了PHOIBLE的完整区别性特征,如果存在匹配的音频,还会附加平均共振峰频率。该聚合数据集为每个音位库存条目提供了所有可用音位实现的平均共振峰值,其中大多数PHOIBLE音位没有匹配的音频,共振峰列显示为NA。数据字段包括语言元数据、音位信息、共振峰值、说话者归一化值以及PHOIBLE区别性特征。数据集基于CC-BY-SA-4.0许可,但VoxAngeles音频部分使用CC-BY-NC 4.0非商业许可。

PHOIBLE x VoxAngeles — Phoneme Inventories with Formants (Aggregated) is a cross-linguistic tabular dataset that pairs the phoneme inventories of the worlds languages from PHOIBLE with acoustic formant measurements (F1–F5) derived from real audio recordings in the VoxAngeles corpus. Each row represents one phoneme of one language inventory, annotated with the full set of PHOIBLE distinctive features and, where matching audio exists, with averaged formant frequencies. This aggregated dataset reports, per phoneme inventory entry, the formant values averaged over all available realizations of that phoneme, with the majority of PHOIBLE phonemes having no matching audio and formant columns as NA. Data fields include language metadata, phoneme information, formant values, speaker-normalized formants, and PHOIBLE distinctive features. The dataset is released under CC-BY-SA-4.0, but the underlying VoxAngeles audio is under CC-BY-NC 4.0 non-commercial license.

提供机构:
Mikimi
搜集汇总
数据集介绍
Mikimi/phoible-voxangeles-formants-aggregated 数据集图片
构建方式
该数据集通过整合PHOIBLE音位清单数据库与VoxAngeles声学语料库构建而成。首先,从PHOIBLE中提取语言、音位参数及音位清单等信息,形成包含语言元数据和所有区别特征的表结构,每条记录对应一种语言的一个音位。其次,利用VoxAngeles预计算的共振峰测量数据,采用Praat软件通过Burg方法对音频片段进行F1至F3的测量,并对其在时长四分位点上的数值进行平均化处理。随后,以语言代码和IPA符号为键,将测量结果与PHOIBLE音位进行左连接,保留所有音位,缺失音频的音位共振峰列设为空值。最后,基于共振峰几何计算了三个发音努力代理指标,并通过Lobanov和Nearey方法对共振峰进行说话人归一化处理,最终按音位聚合得到平均值。
特点
本数据集的核心特色在于首次将大规模跨语言音位清单与真实音频的声学测量数据相结合,为约95种语言提供了共振峰F1至F3的实测值,并辅以F4和F5的占位空值。数据集中明确记录了是否有匹配音频的标识,以及聚合所用的音频片段数量,确保了数据透明性。基于共振峰距离计算的发音努力代理指标——包括Hz和Bark尺度上的欧氏距离,以及结合时长的累积努力度量——为研究发音生理差异提供了量化工具。此外,经说话人归一化的共振峰数值(Lobanov z分数和Nearey对数均值)消除了个体差异,使得跨语言比较更为可靠。这些特点使本数据集成为语音学、音系类型学和低资源语言研究的宝贵资源。
使用方法
本数据集可通过HuggingFace的datasets库便捷加载,使用代码`load_dataset("Mikimi/phoible-voxangeles-formants-aggregated", split="train")`即可获取训练集。用户可以通过`filter`方法筛选出含有实测共振峰的音位(`has_audio == true`),或专注于特定音位类别(如元音:`segment_class == "vowel"`)。数据集中的每一行代表一个语言音位清单中的音位,包含语言名称、ISO 639-3代码、Glottolog代码、宏观区域等元数据,以及完整的PHOIBLE区别特征(约37个以`feat_`开头的列)。分析时,用户可结合`formant_distance_hz`、`effort_proxy`等派生指标探究发音模式,或利用归一化共振峰进行跨语言对比。对于需要原始逐次数据的研究者,本数据集另有配套的逐次实现版本可供使用。
背景与挑战
背景概述
在语音学和音系学领域,跨语言对比研究长期受困于音系描述与声学数据之间的割裂。传统音系数据库如PHOIBLE(2019年由Moran和McCloy等学者在马克斯·普朗克人类历史科学研究所创建)系统记录了全球语言的音位清单,却缺乏对应的音频数据;而语音声学资源如VoxAngeles语料库虽提供了经校正的录音和共振峰测量,但覆盖语言数量有限。为弥合这一鸿沟,本数据集于近年应运而生,由研究者将两者通过(语言、IPA符号)精确匹配,整合为包含音位特征与声学参数的表格式资源。该数据集的核心贡献在于为计算语言学和类型学分析提供了首个大规模、可量化的桥梁,使得研究者得以在声学维度上检验音系特征的分布规律,对理解人类语音的生理产出与音系系统的关联具有重要推动意义。
当前挑战
本数据集面临的核心挑战在于领域问题的复杂性与构建过程的技术壁垒。在领域层面,跨语言语音声学分析的主要障碍是如何在音位抽象性与实际发音变异之间建立可靠对应——共振峰本质上是具体发音人的声学产出,与音系学中的‘音位’概念存在本质差异,简单求均值可能掩盖重要变异。构建过程中,挑战首先来自数据覆盖的严重不均衡:PHOIBLE涵盖数千种语言,而VoxAngeles仅提供约95种语言的音频,导致大部分音位缺失声学数据,形成稀疏矩阵。其次,共振峰测量依赖于Praat参数设置(如频谱上限),单一全局参数无法适配所有语言和发音人的声道特性,测量结果可能引入系统误差。此外,音位匹配依赖精确的(语言、IPA符号)配对,不同数据库间的转写差异容易导致匹配遗漏。最后,发音努力代理变量的构建基于共振峰几何偏离中性元音的假设,并非物理声学能量,其生理解释力有限;说话人归一化方法(如Lobanov和Nearey变换)在单说话人假设下难以处理语言内多说话人情况,且稀疏采样会导致归一化值不可靠。
常用场景
经典使用场景
在语音学与音系学交叉研究中,该数据集最经典的应用在于将全球语言的音位清单与声学共振峰数据相关联,构建跨语言的音位-声学映射关系。研究者可通过该数据集检索特定语言中每个音位的平均共振峰频率(F1-F5),并利用声学特征解释音位对立、元音空间分布及发音策略差异。其独特的聚合格式尤其适用于大规模类型学比较,例如分析不同语言元音系统的声学密度、辅音-元音协同发音模式,或探究地理区域(如非洲vs欧亚大陆)对音位声学实现的影响。
衍生相关工作
基于此数据集,学界已衍生出多项突破性工作:一是利用共振峰距离指标构建发音努力预测模型,验证了音系经济原则(如元音系统大小与声学离散度的统计相关性);二是开发跨语言元音归一化算法评估框架,比较Lobanov、Nearey与Nearey2等方法的性能;三是生成了附带声学锚点的低资源语言音位清单,助力濒危语言文档中的自动语音识别系统训练。此外,该数据集的实时化版本(per-realization子集)已被用于探究语速对共振峰实现的微观影响,间接推动了言语产生的动态模型修正。
数据集最近研究
最新研究方向
该数据集通过将PHOIBLE的音系清单与VoxAngeles的声学共振峰测量值相融合,开创了跨语言音系-声学匹配研究的新范式。当前前沿方向聚焦于利用该数据集构建低资源语言的声学特征预测模型,结合说话人归一化技术(如Lobanov与Nearey变换)移除声道差异,从而在全局音系空间中量化发音努力(如formant_distance_bark与effort_proxy指标)。这一资源为探索音系特征与声学实现之间的复杂映射关系提供了实证基础,尤其推动了对濒危语言音系多样性的计算建模,为语音类型学与发音生理学交叉领域注入了可复现的数理根基。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务