遇见数据集

Mikimi/phoible-voxangeles-formants

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个多语言语音音素数据集,包含音素级别的声学特征和音系特征标注。数据涵盖多种语言,每个样本包括音素标识(如realization_id、phoneme_ipa)、语言信息(如language_code、language_name、language_family)、声学特征(如基频F0、共振峰F1-F4及其归一化值、分位数统计)、语音段信息(如segment_start、segment_end、word)、音系特征(如feat_nasal、feat_labial等发音特征)以及地理信息(如latitude、longitude)。数据集用于语音学研究和音素分析,支持训练和评估模型。

This dataset is a multilingual speech phoneme dataset containing acoustic and phonological feature annotations at the phoneme level. It covers multiple languages, with each sample including phoneme identifiers (e.g., realization_id, phoneme_ipa), language information (e.g., language_code, language_name, language_family), acoustic features (e.g., fundamental frequency F0, formants F1-F4 and their normalized values, quartile statistics), speech segment information (e.g., segment_start, segment_end, word), phonological features (e.g., feat_nasal, feat_labial for articulation), and geographic information (e.g., latitude, longitude). The dataset is designed for phonetics research and phoneme analysis, supporting model training and evaluation.

提供机构:
Mikimi
搜集汇总
数据集介绍
Mikimi/phoible-voxangeles-formants 数据集图片
构建方式
该数据集由VoxAngeles语料库与PHOIBLE音位清单数据库交叉整合而成。构建过程中,首先从VoxAngeles语料库中提取包含录音片段、音段切分时间及元音共振峰(F1–F3)等声学特征的语音实现数据。随后,通过语音片段的国际音标标注与PHOIBLE数据库中的音位特征信息进行精确匹配,为每个实现条目补充了音位类别、区别性特征、发音器官参数及语系归属等语言学元数据。最终形成一条包含从底层音位到表层声学实现的完整数据链路,涵盖了共振峰原始值、Lobanov与Nearey归一化值、基频四分位数及动态衰减曲线等多维度声学变量。
使用方法
该数据集适用于语音学、音系学及计算语言学领域的多项研究任务。研究者可直接利用共振峰与基频列进行元音空间分析、发音策略对比或语音合成模型的参数训练;结合音位特征列可开展跨语言音系格局的机器学习分类实验。归一化后的声学特征(如Lobanov与Nearey变换值)特别适用于消除说话人个体差异的群体研究。此外,通过语言家族与宏观区域标签,用户可方便地筛选特定语系或地理区域的子集,从事语言类型学或演化语音学方向的专项分析。数据集以Hugging Face Datasets标准格式发布,支持直接加载与下游数据处理流水线的无缝对接。
背景与挑战
背景概述
该数据集名为phoible-voxangeles-formants,由VoxAngeles团队联合PHOIBLE数据库于近年创建,旨在弥合语音学理论与实际声学数据之间的鸿沟。其核心研究问题聚焦于跨语言音段在真实语流中的共振峰特征,通过整合多语种语料库中的基频(F0)、第一至第三共振峰(F1–F3)及多种归一化变换值,为音系学普遍性假说提供量化验证基础。数据集涵盖来自数十种语言的高质量语音片段,每条记录均关联音位类型、语境信息及声学参数,显著推动了语言类型学与计算语音学在跨语言音系模式分析中的交叉应用,成为语音科学领域验证音段分布与发音生理约束关系的重要基准。
当前挑战
该数据集所解决的领域挑战在于传统音系学研究多依赖离散符号描述,难以捕捉语音连续体中的细微声学变异性,而该数据集通过结构化共振峰数据填补了跨语言音段动态分析的空白。构建过程中面临的挑战包括:需从多个异构语料库中筛选声学质量一致的录音片段,并确保音段切分与标识的跨库兼容性;共振峰提取易受噪声、说话人差异及发音协同影响,需采用归一化算法(如Lobanov、Nearey变换)来平衡声学空间偏差;此外,部分语种缺乏标准化音位清单,匹配PHOIBLE库存时需手动校对音类映射,以降低标注不一致性对后续分析的影响。
常用场景
经典使用场景
在语音学与语言类型学的交叉研究中,phoible-voxangeles-formants数据集为跨语言音系系统的声学实现提供了宝贵的标注资源。该数据集整合了PHOIBLE音库与VoxAngeles语料库中多语言发音的共振峰参数,使得研究者能够将抽象的音位类别与具体的声学测量值精准对应。经典的使用场景涵盖基于共振峰数据的元音空间映射、辅音发音特征分析,以及跨语言声学-音系关联规律的探索。数据集内含的F1至F3共振峰及其归一化后变体,为元音系统的量化比较确立了科学标准。
解决学术问题
该数据集系统性地解决了两大核心学术问题:其一,填补了大规模多语言音系清单与其对应声学实现之间缺乏结构化对齐数据库的空白,使得学界得以告别零散、小样本的个案对比;其二,通过提供共振峰距离、声学努力代理指标等衍生参数,为量化评估不同语言的语音产出差异提供了统一框架。这些数据支撑了关于语音产出中双语者语音融合模式、语言接触导致的声学趋同现象,以及元音库藏规模与声学空间利用关系等前沿假说的实证检验。
实际应用
在应用层面,该数据集展现出跨学科的实用价值。面向言语工程领域,其丰富的基频与共振峰特征可服务于多语种语音合成系统,增强合成语音的自然度和音色准确性,尤其有利于低资源语言的声学建模。在第二语言教学与临床语言病理研究中,数据集中精确的F2拐点、F0动态变化等时间序列量度,可辅助教师或治疗师定位发音偏差,制定个性化的纠音方案。此外,精细化的音位特征标注为计算语言学中的形态-音系建模提供了干净的对齐数据。
数据集最近研究
最新研究方向
基于大规模跨语言声学特征库的语音演变与发音机理研究。该数据集融合了PHOIBLE音系数据库与VoxAngeles语料库的共振峰数据,精细刻画了从基频F0至第五共振峰的语音声学参数,并引入Lobanov与Nearey两类归一化处理,为探究语音产出中的发音努力、声学距离与语言类型学规律提供了量化工具。当前前沿方向聚焦于利用此类高维声学特征,结合机器学习模型,揭示跨语言元音空间的演化动力学、音位对立中的声学线索权重,以及言语障碍者声学模式的异常检测,对推动计算语言学和临床语言病理学具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务