DnR-nonverbal
收藏资源简介:
DnR-nonverbal是一个电影音频源分离(CASS)数据集,特别处理非言语声音。与传统CASS数据集只包含阅读风格的语音不同,该数据集在语音干中包含了笑声、尖叫等非言语声音。数据集包含从FSD50K和FreeSound收集的非言语声音片段,并经过基于规则和大型语言模型(LLM)的筛选。数据集创建过程包括收集非言语声音、筛选和处理混合过程。该数据集旨在解决当前CASS模型在处理实际电影音频中非言语声音提取的问题,并通过实验验证了其有效性。
DnR-nonverbal is a movie audio source separation (CASS) dataset that specifically focuses on non-verbal sounds. Unlike conventional CASS datasets that only contain read-style speech, this dataset incorporates non-verbal sounds such as laughter and screams into its speech stems. The dataset comprises non-verbal audio clips collected from FSD50K and FreeSound, which have undergone rule-based and Large Language Model (LLM)-based filtering. The dataset creation workflow includes three main stages: non-verbal sound collection, filtering, and audio mixing processing. This dataset is developed to address the limitations of current CASS models when extracting non-verbal sounds from real-world movie audio, and its effectiveness has been verified through experimental validation.
DnR-nonverbal数据集概述
基本信息
- 标题: DnR-nonverbal dataset
- DOI: 10.5281/zenodo.15470640
- 版本: v1
- 发布日期: May 20, 2025
- 发布者: Zenodo
- 资源类型: Dataset
- 会议: Interspeech 2025
- 许可协议: Creative Commons Attribution 4.0 International
- 创建者:
- Takuya, Hasumi
- Yusuke, Fujita
数据集描述
DnR-nonverbal是一个基于Divide and Remaster (DnR)数据集的电影音频源分离(CASS)数据集。与常规数据集不同,该数据集包含如笑声和尖叫等非语言声音,类似于实际电影音频。该数据集使CASS模型能够将非语言声音分配到与语音相同的音轨中。
数据集结构
数据集结构基于DnR,但包含作为语音音轨一部分的非语言声音。
dnr-nonverbal ├── tr │ ├── 100009 │ │ ├── annots.csv │ │ ├── background.wav │ │ ├── foreground.wav │ │ ├── mix.wav │ │ ├── music.wav │ │ ├── nonverbal.wav │ │ ├── reading.wav │ │ ├── sfx.wav │ │ └── speech.wav │ ├── 100031 │ ... ├── cv └── tt
文件说明
- reading.wav: 从LibriSpeech提取的阅读风格语音。
- nonverbal.wav: 从FSD50K收集和新从FreeSound爬取的非语言声音。
- speech.wav: 阅读风格语音和非语言声音的混合。
- music.wav: 从FMA (medium)提取的背景音乐。
- foreground.wav: 从FSD50K收集的前景效果声音。
- background.wav: 从FSD50K收集的背景效果声音。
- sfx.wav: 前景和背景效果声音。
- annots.csv: 识别声音来源的元数据文件。
使用方法
- 从页面下载dnr-nonverbal.tar.gz。
- 使用
tar xvzf dnr-nonverval.tar.gz解压文件。 - (可选) 与DnR目录混合。样本ID的分配方式确保不与DnR重复。
文件信息
- 名称: dnr-nonverbal.tar.gz
- 大小: 22.7 GB
- MD5: c3d80ce875d8d408439a20b65d6c4405
统计信息
- 总浏览量: 31
- 总下载量: 7
- 总数据量: 340.4 GB
关键词
- audio source separation
- cinematic audio source separation
- non-verbal sound
引用格式
Takuya, H., & Yusuke, F. (2025). DnR-nonverbal dataset [Data set]. Interspeech 2025. Zenodo. https://doi.org/10.5281/zenodo.15470640

- 1DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal SoundsLY Corporation, Japan · 2025年



