five

WiDESPREaD

收藏
arXiv2020-10-08 更新2024-06-21 收录
下载链接:
https://www.sofacoustics.org/data/database/widespread
下载链接
链接失效反馈
官方服务:
资源简介:
WiDESPREaD数据集由法国雷恩中央理工学院创建,包含1005对耳形和相关的pinna-related transfer functions(PRTFs)。该数据集通过随机耳形绘制和声学模拟生成,用于增强和降低头相关传递函数(HRTF)的维度。数据集的创建旨在解决HRTF个性化问题,特别是在双耳合成中的应用,通过提供多样化的耳形和PRTFs,帮助研究者更好地理解和模拟个体间的差异。

The WiDESPREaD dataset was developed by École Centrale de Rennes, France, which contains 1005 pairs of ear shapes and their corresponding pinna-related transfer functions (PRTFs). This dataset is generated through random ear shape generation and acoustic simulation, and is utilized for dimensionality enhancement and reduction of head-related transfer functions (HRTFs). The dataset was created to address the HRTF personalization problem, particularly for applications in binaural synthesis. By providing diverse ear shapes and PRTFs, it helps researchers better understand and simulate inter-individual differences.
创建时间:
2020-10-08
搜集汇总
数据集介绍
main_image_url
构建方式
WiDESPREaD数据集基于119例真实人体左耳三维扫描构建统计形状模型,通过主成分分析(PCA)对耳形进行降维与概率建模。研究者在耳形主成分空间中独立抽样生成1005个合成耳形点云,经网格闭合、分级重采样等预处理后,利用快速多极边界元法(FM-BEM)在0.1至16 kHz频段内计算对应的耳廓相关传输函数(PRTF)。最终形成包含1005组耳形网格与PRTF数据的配对合成数据库。
特点
该数据集具有显著的大规模与多样性优势,是目前首个超过千例的PRTF与注册耳形配对数据库。耳形数据通过PCA线性建模生成,保留了真实耳廓的几何变异规律;PRTF数据采用高分辨率球面网格(2562个方向)与频域精细采样(160个频率点),并经过扩散场均衡处理。数据集在耳形空间中的生成方式确保了合成样本的形态真实性,同时为非线性机器学习方法提供了充足训练样本。
使用方法
研究者可通过Sofacoustics平台获取WiDESPREaD数据集,用于双耳合成中的HRTF个性化研究。数据以注册耳形点云及对应PRTF矩阵形式提供,支持直接进行主成分分析、流形学习或神经网络建模。耳形网格可提取耳廓形态测量特征,PRTF数据适用于空间插值、维度约简及个性化滤波器设计。数据集生成方法具有可扩展性,允许按需增加样本数量以支持更复杂的计算模型训练。
背景与挑战
背景概述
双耳合成技术中,头相关传输函数(HRTF)的个性化是实现逼真虚拟听觉环境的核心挑战。然而,现有HRTF数据库受限于样本规模,难以支撑高维数据的建模需求。在此背景下,Corentin Guezenoc与Renaud Séguier于2020年基于法国中央理工-高等电力学院FAST研究团队的工作,构建了WiDESPREaD(Wide Dataset of Ear Shapes and Pinna-Related Transfer Functions Obtained by Random Ear Drawings)数据集。该数据集通过快速多极边界元法(FM-BEM)对119例三维耳廓扫描进行声学仿真,并利用主成分分析(PCA)揭示耳廓形态与耳廓相关传输函数(PRTF)的几何结构差异,最终采用随机耳廓生成方法扩展至1005组合成样本。WiDESPREaD作为首个公开超过千例PRTF及对应注册耳廓网格的数据集,为HRTF建模、降维及空间插值研究提供了关键资源,显著推动了听觉个性化领域的发展。
当前挑战
该数据集面临多重挑战:首先,HRTF个性化领域长期受限于数据库规模与数据高维性之间的矛盾,现有最大实测数据库(如ARI)仅含120名受试者,而典型高分辨率HRTF数据维度高达1.2×10^6,线性降维技术(如PCA)在PRTF集上表现不佳,仅能解释有限方差,需探索非线性流形学习或神经网络等复杂方法。其次,数据构建过程存在技术瓶颈:耳廓网格需经过封闭、分级重采样及FM-BEM计算,模拟单个PRTF集耗时巨大(1005例需40天计算),且24%的随机生成耳廓因网格自相交被剔除;同时,仿真中采用通用头部与躯干网格替代个体化模型,导致头影效应等频谱特征偏差,限制了PRTF向完整HRTF的泛化能力。
常用场景
经典使用场景
在双耳合成与空间音频领域,个体化头相关传输函数(HRTF)的获取一直是核心难题。WiDESPREaD数据集通过结合主成分分析(PCA)与快速多极边界元法(FM-BEM),首次构建了包含1005个合成耳廓形状及其对应耳廓相关传输函数(PRTF)的大规模资源库。该数据集最经典的使用场景在于为HRTF个体化研究提供足量的训练样本,利用耳廓形状空间的线性可建模性,生成任意规模的PRTF数据,从而突破传统实测数据库规模受限的瓶颈,为后续非线性建模与深度学习方法的探索奠定数据基础。
解决学术问题
WiDESPREaD有效解决了当前HRTF数据库规模与数据高维性之间严重不匹配的学术困境。传统实测数据库如ARI仅包含120个受试者,而高分辨率HRTF的维度高达约1.2×10⁶,导致机器学习模型极易过拟合。该数据集通过验证PCA在耳廓形状上优于PRTF的降维能力,提出在耳廓形状空间随机生成新样本并计算PRTF的策略,使得数据量提升至原先的八倍以上。这显著促进了对PRTF复杂流形结构的理解,并为HRTF建模、降维分析及空间插值等方向提供了可靠的大规模基准。
衍生相关工作
WiDESPREaD的发布催生了一系列衍生研究工作。其核心方法论——利用耳廓形状空间的线性统计模型生成大规模PRTF数据——启发了后续将概率PCA、变分自编码器等非线性技术引入HRTF个体化的尝试。数据集本身也被用于验证空间音频中稀疏测量HRTF的插值算法,以及基于深度神经网络的端到端HRTF预测模型。此外,从注册耳廓网格中提取的形态学特征,为基于人体测量学的个性化研究提供了标准化对比基准,推动了该领域从少量样本到数据驱动的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务