susanliang/RWAVS
收藏资源简介:
RWAVS(Real-World Audio-Visual Scene)数据集是一个用于真实世界音频-视觉场景合成的数据集。该数据集包含13个场景,每个场景中提供了训练和评估所需的相机姿态、视频帧、音频文件以及视觉和深度特征等。具体文件包括:`transforms_train.json`(训练相机姿态)、`transforms_val.json`(评估相机姿态)、`transforms_scale_train.json`(归一化训练相机姿态)、`transforms_scale_val.json`(归一化评估相机姿态)、`frames`(视频帧)、`source_syn_re.wav`(单声道音频)、`binaural_syn_re.wav`(双声道音频)、`feats_train.pkl`(训练视觉和深度特征)、`feats_val.pkl`(推理视觉和深度特征)以及`position.json`(声源归一化3D坐标)。数据集中的音频文件已同步并重采样至22050 Hz。需要注意的是,某些帧可能没有对应的相机姿态,因为COLMAP无法估计这些帧的相机参数。
RWAVS(Real-World Audio-Visual Scene)数据集是一个用于真实世界音频-视觉场景合成的数据集。该数据集包含13个场景,每个场景中提供了训练和评估所需的相机姿态、视频帧、音频文件以及视觉和深度特征等。具体文件包括:`transforms_train.json`(训练相机姿态)、`transforms_val.json`(评估相机姿态)、`transforms_scale_train.json`(归一化训练相机姿态)、`transforms_scale_val.json`(归一化评估相机姿态)、`frames`(视频帧)、`source_syn_re.wav`(单声道音频)、`binaural_syn_re.wav`(双声道音频)、`feats_train.pkl`(训练视觉和深度特征)、`feats_val.pkl`(推理视觉和深度特征)以及`position.json`(声源归一化3D坐标)。数据集中的音频文件已同步并重采样至22050 Hz。需要注意的是,某些帧可能没有对应的相机姿态,因为COLMAP无法估计这些帧的相机参数。
RWAVS 数据集
我们提供 Real-World Audio-Visual Scene (RWAVS) 数据集。
-
数据集可以从 Hugging Face 仓库下载。
-
下载数据集后,可以解压缩
RWAVS_Release.zip。unzip RWAVS_Release.zip cd release/
-
数据集的目录结构如下:
./release/ ├── 1 │ ├── binaural_syn_re.wav │ ├── feats_train.pkl │ ├── feats_val.pkl │ ├── frames │ │ ├── 00001.png | | ├── ... │ │ ├── 00616.png │ ├── source_syn_re.wav │ ├── transforms_scale_train.json │ ├── transforms_scale_val.json │ ├── transforms_train.json │ └── transforms_val.json ├── ... ├── 13 └── position.json
数据集包含 13 个场景,索引从 1 到 13。每个场景提供以下文件:
transforms_train.json:用于训练的相机姿态。transforms_val.json:用于评估的相机姿态。数据被分为train和val子集,其中 80% 用于训练,其余用于评估。transforms_scale_train.json:用于训练的归一化相机姿态。我们将 3D 坐标归一化到 $[-1, 1]^3$。transforms_scale_val.json:用于评估的归一化相机姿态。frames:每个相机姿态对应的视频帧。source_syn_re.wav:声源发出的单通道音频。binaural_syn_re.wav:双耳麦克风捕捉的双通道音频。我们将source_syn_re.wav和binaural_syn_re.wav同步并重采样到 22050 Hz。feats_train.pkl:每个相机姿态提取的视觉和深度特征,用于训练。我们依赖 V-NeRF 为每个相机姿态合成视觉和深度图像,然后使用预训练的编码器从渲染图像中提取特征。feats_val.pkl:每个相机姿态提取的视觉和深度特征,用于推理。position.json:声源的归一化 3D 坐标。
请注意,某些帧可能没有对应的相机姿态,因为 COLMAP 无法估计这些帧的相机参数。




