Fhrozen/FSD50k
收藏资源简介:
Freesound Dataset 50k (FSD50K) 是一个开放的人类标注声音事件数据集,包含51,197个音频片段,分布在200个类别中,这些类别来自AudioSet Ontology。数据集由巴塞罗那庞培法布拉大学音乐技术组创建,主要用于多标签声音事件分类任务。音频片段由人类手动标注,长度从0.3秒到30秒不等,提供了开发集和评估集,分别包含40,966和10,231个音频片段。所有音频片段以未压缩的PCM 16位44.1 kHz单声道音频文件提供,并附有详细的元数据和标签信息。
Freesound Dataset 50k (FSD50K) is an open human-annotated sound event dataset containing 51,197 audio clips spanning 200 categories derived from the AudioSet Ontology. Developed by the Music Technology Group at Pompeu Fabra University in Barcelona, this dataset is primarily intended for multi-label sound event classification tasks. All audio clips are manually annotated by humans, with durations ranging from 0.3 seconds to 30 seconds. The dataset is split into a development set and an evaluation set, comprising 40,966 and 10,231 audio clips respectively. All audio clips are provided as uncompressed PCM 16-bit 44.1 kHz mono audio files, accompanied by detailed metadata and label information.
数据集概述
名称: Freesound Dataset 50k (FSD50K)
描述: FSD50K是一个包含51,197个人类标记的声音事件的开源数据集,这些事件不均匀地分布在200个类别中,这些类别是从AudioSet Ontology中抽取的。该数据集主要由物理声源和生产机制产生的声音事件组成,涵盖了人类声音、事物声音、动物、自然声音和音乐等主要家族。
基本特征:
- 包含51,197个音频片段,总计108.3小时音频。
- 音频内容由人类手动标记,使用Freesound Annotator平台进行数据标记。
- 音频片段长度从0.3秒到30秒不等,音频格式为未压缩的PCM 16位44.1 kHz单声道。
- 数据集主要是一个多标签声音事件分类问题,但也支持多种声音事件研究任务。
- 音频片段分为开发集(dev)和评估集(eval),确保两个集合中没有来自同一Freesound上传者的片段。
开发集(Dev Set):
- 包含40,966个音频片段,总计80.4小时音频。
- 平均每片段时长:7.1秒。
- 提供训练/验证分割。
评估集(Eval Set):
- 包含10,231个音频片段,总计27.9小时音频。
- 平均每片段时长:9.8秒。
- 评估集标签是详尽的,确保标签正确且完整。
许可证:
- 所有音频片段根据Freesound上传者定义的许可证发布,包括CC0, CC-BY, CC-BY-NC和CC Sampling+。
- 整个数据集FSD50K根据CC-BY许可证发布。
文件结构:
- 音频片段存储在
clips/目录下,分为dev/和eval/子目录。 - 标签文件存储在
labels/目录下,包括dev.csv和eval.csv。 - 词汇表文件
vocabulary.csv列出了200个声音类别。 - 元数据文件存储在
metadata/目录下,包括关于声音类别和音频片段的详细信息。
引用信息:
- 使用FSD50K数据集时,请引用论文:Eduardo Fonseca, Xavier Favory, Jordi Pons, Frederic Font, Xavier Serra. "FSD50K: an Open Dataset of Human-Labeled Sound Events", arXiv 2020.




