遇见数据集

nisr-dataset

收藏
Hugging Face2026-06-21 更新2026-06-22 收录
官方服务:

资源简介:

NISR(神经逆向声音渲染)数据集用于训练从敲击声录音和3D物体网格预测物体固有频率和3D模态形状的模型。数据集基于ObjectFolder-Real(包含100个日常物体)和ObjectFolder 2.0(包含1000个物体),共1100个独特3D物体。每个物体通过有限元法(FEM)模态分析模拟了8种不同材料配置(如陶瓷、玻璃、木材、塑料、铁、聚碳酸酯、钢、锡),总计8800个样本,数据总大小约为22GB。每个样本包含一个32x32x32的体素化3D网格、物体尺寸L、材料参数(杨氏模量E、密度ρ、泊松比ν)、最多20个模态的固有频率(Hz)和3D模态形状,以及两种敲击声录音:一种是在固定边界体素点敲击产生的单次撞击声(对所有1100个物体可用),另一种是通过PyBullet物理模拟物体掉落产生的多接触点、力加权的模态合成声音(更真实,对1092个物体可用,有8个物体因网格几何退化无法生成)。该数据集专为逆向声音渲染任务设计,即从声音和几何输入推断物体的物理模态属性,适用于计算声学、物理感知的机器学习以及3D音频合成等领域的研究。数据集目前未划分训练/验证/测试集,所有样本均未标记划分。

The NISR (Neural Inverse Sound Rendering) dataset is designed for training models to predict the natural frequencies and 3D mode shapes of objects from tapping sound recordings and 3D object meshes. It is derived from ObjectFolder-Real (100 everyday objects) and ObjectFolder 2.0 (1000 objects), totaling 1100 unique 3D objects. Each object is simulated with 8 different material configurations (e.g., ceramic, glass, wood, plastic, iron, polycarbonate, steel, tin) using finite element method (FEM) modal analysis, resulting in 8800 samples with a total size of approximately 22GB. Each sample includes: a 32x32x32 voxelized 3D mesh, object dimensions L, material parameters (Youngs modulus E, density ρ, Poissons ratio ν), up to 20 modes of natural frequencies (Hz) and 3D mode shapes, and two types of tapping sound recordings: one is a single-impact sound generated by tapping at a fixed boundary voxel point (available for all 1100 objects), and the other is a multi-contact, force-weighted modal synthesized sound produced via PyBullet physics simulation of object dropping (more realistic, available for 1092 objects, with 8 objects unable to generate due to mesh geometry degradation). The dataset is specifically designed for inverse sound rendering tasks, which involve inferring physical modal properties of objects from acoustic and geometric inputs, and is suitable for research in computational acoustics, physics-aware machine learning, and 3D audio synthesis. The dataset is currently not split into training/validation/test sets, with all samples unlabeled for partitioning.

创建时间:
2026-06-14
原始信息汇总

数据集概述

NISR(Neural Inverse Sound Rendering)数据集 是一个用于训练神经逆声学渲染模型的数据集,旨在从撞击声录音和3D网格中预测物体的固有频率3D模态振型

任务描述

模型输入为撞击声波(.wav)、3D网格(体素化,32³)、物体尺寸(L)以及材料属性(杨氏模量E、密度ρ、泊松比ν),输出为固有频率(k维向量)和3D模态振型(B×3×k张量)。

数据集统计

属性 数值
物体数量 1100(ObjectFolder-Real: 100个日常物体 + ObjectFolder 2.0: 1000个物体)
每个物体的材料配置 8种
每个样本的模态数量 最多20个
音频时长与采样率 2.0秒 @ 44,100 Hz
总样本数 8800(1100物体 × 8材料)
总大小 约22 GB

数据版本与更新

版本 日期 物体数 说明
v1.0 2026-01 100 初始版本,源自ObjectFolder-Real
v2.0 2026-06-20 1100 扩展至ObjectFolder 2.0(增加1000个物体)
v3.0 2026-06-21 1100(当前版本) 新增基于物理仿真的撞击声(sim_*.wav),覆盖1092个物体

数据集结构

training_dataset/{obj_id}/ ├── voxel.npz # 3D体素网格 (32³),所有材料共享 ├── feat/feat_{mat}.npz # 训练标签:固有频率、模态振型 └── wav/ ├── sound_{mat}.wav # 固定撞击点的撞击声(v2) └── sim_{mat}.wav # 基于物理仿真的撞击声(v3,推荐)

音频文件说明

  • sound_{mat}.wav:使用固定撞击点(索引0),适用于全部1100个物体。
  • sim_{mat}.wav:使用PyBullet仿真物体下落,提取接触点与撞击时序,产生更真实的多弹跳撞击声。适用于1092个物体。

缺失物体列表sim_*.wav不可用,仅提供sound_*.wav):950, 1001, 1006, 1008, 1016, 1017, 1018, 1020(共8个物体因几何形状退化无法生成物理仿真撞击声)。

数据划分

当前版本未定义训练/验证/测试集划分,所有样本保持未拆分状态,将在未来版本中添加。

材料属性

材料 密度ρ (kg/m³) 杨氏模量E (Pa) 泊松比ν
Ceramic 2700 7.2×10¹⁰ 0.19
Glass 2600 6.2×10¹⁰ 0.20
Wood 750 1.1×10¹⁰ 0.25
Plastic 1070 1.4×10⁹ 0.35
Iron 8000 2.1×10¹¹ 0.28
Polycarbonate 1190 2.4×10⁹ 0.37
Steel 7850 2.0×10¹¹ 0.29
Tin 7265 5.0×10¹⁰ 0.325

数据生成方法

使用有限元方法(FEM)进行模态分析(LOBPCG求解器),提取模态特征,并合成模态声音。详细流程见生成文档

许可证

CC BY 4.0;源网格数据(ObjectFolder-Real)保留其原始许可证。

搜集汇总
数据集介绍
nisr-dataset 数据集图片
构建方式
NISR数据集基于多源物理仿真与有限元分析技术构建而成。数据源自ObjectFolder-Real(100个日常物体)与ObjectFolder 2.0(1000个物体)两大开源数据集。针对每个物体,通过有限元模态分析(LOBPCG算法)在8种不同材料配置下(包括陶瓷、玻璃、木材、塑料、铁、聚碳酸酯、钢、锡)计算其固有频率与三维模态振型。冲击声音信号通过两种方式生成:其一为固定撞击点合成,适用于全部1100个物体;其二为基于PyBullet物理引擎的跌落仿真驱动多触点力加权模态合成,生成更真实的复杂弹跳冲击声,覆盖1092个物体(8个因网格几何退化被跳过)。所有模态数据、三维体素网格及声音文件按照物体ID与材料类型组织为层级目录结构。
特点
该数据集的核心特点在于其多模态物理融合属性。每个样本包含四个输入通道:冲击声音(44.1kHz采样、2秒时长)、三维体素网格(32³分辨率)、物体尺寸参数以及材料属性(杨氏模量、密度、泊松比)。输出为固有频率向量与三维模态振型张量,每组样本最多输出20个模态。数据总量约22GB,共8800个样本。特别地,v3.0版本引入了物理仿真驱动的冲击声音变体,通过模拟物体真实跌落过程中的多点接触与时间演化,生成更具物理一致性的多弹跳声音信号,显著提升了数据集的真实性与挑战性。数据集中训练/验证/测试划分尚未定义,所有样本保持原始未拆分状态。
使用方法
研究人员可通过Hugging Face Hub便捷获取该数据集。推荐使用Python接口以snapshot_download函数完整下载至本地,也可通过git lfs或wget下载单个文件。加载流程简洁高效:使用SciPy读取WAV文件并归一化为float32格式;使用NumPy加载体素网格与特征标签文件。特征文件包含频率向量(freqs)、边界体素模态振型(feats_in)、坐标(coords)及表面法向编码(surface)。输入数据可直接用于训练神经逆向声学渲染网络,任务定义为从冲击声音与三维网格联合预测物体的振动模态参数,适用于物理感知的声学场景理解、虚拟声场重建等前沿研究领域。
背景与挑战
背景概述
NISR数据集由Bumsoo Kim等人于2026年创建,旨在解决神经逆向声学渲染这一前沿问题。该数据集源于斯坦福大学ObjectFolder项目,包含1100个日常物体的三维网格与冲击声记录,并融合有限元模态分析(LOBPCG)生成的固有频率与模态振型。其核心研究问题在于从冲击声与三维几何中逆向预测物体的振动特性,为计算机听觉与物理仿真交叉领域提供了标准化基准。该数据集已扩展至v3.0版本,新增基于物理仿真的多接触冲击声,显著提升了数据的真实性与多样性,对非刚性体声学建模、虚拟现实及机器人感知等领域产生深远影响。
当前挑战
该数据集面临的挑战包括:1)领域问题方面,逆向声学渲染需要从冲击声与三维网格中精确解耦材料属性与几何声学特性,传统方法难以处理复杂物体中的非线性振动模态与声学衰减,NISR通过构建多模态输入-输出映射关系助力神经网络学习该逆过程;2)构建过程中,基于PyBullet仿真的冲击声生成遇到8个物体因网格几何退化(如极度扁平或异常缩放)导致接触流形失效,虽通过固定命中点备份数据,但物理碰撞的鲁棒性仍是瓶颈;此外,每个物体需8种材料配置的有限元模拟,计算成本高昂,且训练/验证/测试划分尚未定义,限制了模型的标准化评估。
常用场景
经典使用场景
在声学感知与计算机视觉交叉的前沿领域,NISR数据集被广泛用于训练从撞击声与三维网格中同步预测物体固有频率与模态振型的神经网络模型。该数据集以1100个日常物体的高精度网格、多材料配置下的有限元分析结果及真实物理仿真撞击声波及固定撞击点声波为基石,构建了音频-几何多模态联合表征的学习范式。研究者可基于此数据集开展逆向声学渲染的核心实验,推动从一维时序声信号向三维振动场结构映射的技术突破。
实际应用
在工业与交互式多媒体开发领域,NISR数据集支撑了非接触式材料振动特性快速评估系统的构建。例如,结合便携式麦克风阵列与深度学习推理引擎,机器人可通过敲击物体表面即时推断其内部材料类型与振动模态,从而实现智能抓取力反馈与碰撞响应策略的优化。此外,在虚拟现实与数字孪生场景中,基于该数据集训练的模型能够从几秒的音频片段实时合成具有物理一致性的撞击声,为沉浸式交互提供高度逼真的声学触觉反馈体验。
衍生相关工作
NISR数据集的发布催生了一系列以物理嵌入为导向的逆向声学渲染经典工作。其中,基于隐式神经表示的多模态融合网络率先将体素网格与梅尔频谱图送入跨模态注意力模块,实现了对物体形状与材质联合解码的突破。后续研究进一步引入物理约束范式,如将模态振型的散度零约束作为辅助损失函数,提升了模型在非均匀采样空间下的泛化能力。也有学者基于该数据集的声学仿真元训练了参数化音色解码器,成功将其迁移至未见物体的音色空间插值任务,显著丰富了声学虚拟样本库构建的工程方法论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务