遇见数据集

FoleySet

收藏
arXiv2026-06-24 更新2026-06-26 收录
数据链接:
官方服务:

资源简介:

FoleySet是由佐治亚理工学院音乐信息学研究组创建的一个公开可用的拟音声音数据集,专门针对影视后期制作中的人类动作同步音效。该数据集包含10,000条经过人工标注的音频片段,总时长约9.5小时,数据来源于Freesound平台并采用两级分类体系,涵盖9个主要类别和73个子类别。数据集构建过程包括关键词搜索、人工筛选、音频标准化处理以及基于严格分类法的精细标注,所有音频均采用CC0许可确保可自由分发。该数据集旨在为数据驱动的拟音分类、检索和生成任务提供标准化资源,解决当前拟音研究领域高质量标注数据匮乏的问题,支持精细化的拟音分析与合成研究。

FoleySet is a publicly available Foley sound dataset developed by the Music Informatics Research Group at the Georgia Institute of Technology, specifically designed for human action-synchronized sound effects in film post-production. This dataset comprises 10,000 manually annotated audio clips with an aggregate duration of approximately 9.5 hours. Derived from the Freesound platform, it employs a two-tier classification system encompassing 9 primary categories and 73 sub-categories. The dataset construction workflow involves keyword searching, manual filtering, audio standardization, and fine-grained annotation based on a rigorous taxonomy. All audio materials are released under the CC0 license to enable free redistribution. This dataset aims to provide standardized resources for data-driven Foley sound classification, retrieval, and generation tasks, addressing the scarcity of high-quality annotated data in the current Foley research domain, and supporting fine-grained Foley analysis and synthesis research.

创建时间:
2026-06-24
原始信息汇总

数据集概述:FoleySet

基本信息

  • 数据集名称:FoleySet: A MultiI-Level Human-Annotated Foley Sound Dataset
  • 版本:v2(发布于 2026 年 6 月 17 日)
  • 资源类型:Dataset
  • 发布者:Zenodo
  • DOI:10.5281/zenodo.20735877
  • 许可证:Creative Commons Attribution 4.0 International

数据集描述

FoleySet 是一个公开可用的 Foley 音效数据集,旨在支持数据驱动的 Foley 音效分类、检索和生成研究。数据集由作者 Sunshiyu, Wang 和 Alexander, Lerch 创建,填补了高质量标注 Foley 数据集稀缺的空白。

  • 内容规模:包含 10,000 个音频片段。
  • 标注方式:采用两级 Foley 分类法进行人工标注。
  • 使用许可:采用 Creative Commons 许可,提供标准化资源。

文件与大小

  • 文件名称:FoleySet.zip
  • 总大小:2.2 GB
  • 校验码:md5: 9eb1b8230abf6741b9daa92fbd118cc5

统计信息(此版本)

  • 总浏览量:17
  • 总下载量:4
  • 总数据量:8.6 GB
搜集汇总
数据集介绍
FoleySet 数据集图片
构建方式
FoleySet的构建遵循了一条严谨的多阶段流水线。首先,研究团队通过分析七种商业Foley音效库的标签系统,提炼出119个核心关键词,并以此为基础设计了一个包含9个主类别与73个子类别的双层分类体系。随后,利用这些关键词从Freesound平台检索约23,500个候选音频片段,并严格筛选出CC0许可、采样率合规的WAV文件。经过人工筛查剔除损坏或无关片段后,对剩余约18,000个音频进行统一处理:重采样至44.1kHz、转换为16位单声道、进行响度归一化,并去除起始静音。对于超过5秒的录音,则依据静音点进行智能分割,确保每个片段时长可控。最终,由一名专业标注员参照预定分类标准对所有片段进行人工标注与质量审核,并额外赋予单次/多次事件标签,从而铸就了包含10,000个高质量音频剪辑的FoleySet。
特点
该数据集的核心特色在于其精细的双层分类体系与高度的领域针对性。与通用的音频数据集不同,FoleySet专门聚焦于由人类动作引发的拟音音效,涵盖脚步声、衣物摩擦、物体操作等九大类,每类下又细分出共计73个细致入微的子类别,例如将“脚步声”细分为“行走”、“单步”与“奔跑”。这种层级化的精细标注,为训练高精度、细粒度的拟音识别与生成模型提供了可能。此外,所有音频均来自Freesound的CC0许可素材,确保了数据的公开可重分发性与长期可用性。数据集还保留了用户原始标签、描述等元数据,并引入了单次/多次事件标记,为多模态检索、事件密度分析等任务提供了额外维度。即使存在一定的类别不均衡(如脚步声样本较多),也真实反映了拟音领域的实际分布,为后续研究提供了宝贵的基线挑战。
使用方法
FoleySet被设计为一个标准化的基准资源,主要服务于三类核心任务:拟音分类、检索与生成。在分类任务上,研究人员可直接利用预置的9主类别或73子类别标签,训练端到端的分类器或微调预训练模型。论文中已提供了基于PaSST音频Transformer的基线实验,其9类与73类分类任务分别达到了82%与64%的准确率,可作为方法性能的参照系。对于检索任务,数据集中附带的用户原始标签、文本描述及事件密度标记,为文本到音频的跨模态检索提供了天然的对齐数据。在生成领域,模型可以利用这些精细标注的、时长在5秒内的干净音频片段作为学习目标,生成与人类动作高度同步的高质量拟音。数据集已按8:1:1的比例划分为训练、验证和测试集,并确保来自同一原始录音的所有片段划入同一分区,有效防止了数据泄露,确保了实验评估的公平性。
背景与挑战
背景概述
在影视后期制作领域,拟音(Foley)作为同步再现人类动作声效的关键环节,长期以来依赖专业拟音师借助道具进行手工录制,过程耗时且成本高昂。为突破这一资源密集型工作流的瓶颈,数据驱动的拟音研究应运而生,但高质量、结构化的标注数据集却极为稀缺。在此背景下,Georgia Institute of Technology的Sunshiyu Wang与Alexander Lerch于2026年发布了FoleySet数据集,该数据集包含10,000段经由人工标注的音频片段,并创新性地提出了一种双层拟音分类体系,涵盖9个大类与73个子类。FoleySet以知识共享许可协议公开发布,不仅为拟音分类、检索与生成等任务提供了标准化基准,更填补了领域内缺乏统一拟音专用数据集的空白,对推动影视声效自动化生产具有里程碑式的学术与实践价值。
当前挑战
FoleySet所应对的核心挑战在于两层面:其一,拟音声效的细粒度分类与生成长期受制于缺乏统一的定界标准,现有音频数据集多基于宽泛语义类目而非拟音实践所需的动作-材质层级,难以支持对不同动作、材料及同步语境下微妙差异的精准区分。其二,数据集构建本身亦面临严峻挑战,包括从Freesound平台海量音频中筛选CC0许可且质量合格的素材,通过商采拟音库的关键词消歧与归一化凝练出119个候选术语,最终仅73个子类的精细标注,且需兼顾类别间约5:1的不均衡分布。同时,单标注者流程虽保证了一致性,却也引入了主观偏差风险,而子类分布的长尾特性(如子类StrawSip仅20条样本)进一步加剧了细粒度识别的难度。
常用场景
经典使用场景
在影视后期制作与音频计算领域,FoleySet被广泛用作标准化基准数据集,用于训练和评估基于深度学习的Foley音效分类与识别模型。研究者借助其双层分类体系(9个大类和73个子类),能够对脚步声、衣物摩擦、物体碰撞等人为动作相关音效进行细粒度的类别判定。该数据集尤其适合多分类任务的模型构建与性能对比,例如基于PaSST等预训练音频Transformer的特征提取与线性探测分类,已成为评估音频表征学习在Foley子域泛化能力的经典实验平台。
解决学术问题
FoleySet的提出首要解决了Foley音效领域长期缺乏高质量、结构化、细粒度标注公开数据集的困境。此前通用音频数据集如AudioSet或FSD50K虽涵盖部分Foley类别,但因其分类体系并非针对Foley定义设计,导致动作层次与材质层次的声学细节难以区分。FoleySet通过对10,000条音频进行九大类七十三子类的专业人工标注,并统一使用CC0许可确保可分发性,为Foley音效的自动分类、检索与生成三大核心学术任务提供了可复现、可扩展的研究基石,显著推动了该子领域从经验驱动向数据驱动范式的转变。
衍生相关工作
FoleySet的发布催生了一系列围绕细粒度Foley音效的基准建模与扩展工作。其双层分类体系被后续研究采纳作为Foley音效本体设计的参考范本,启发了如FoleyBench等多模态对齐评测集的构建。基于该数据集上PaSST基线分类结果,研究者进一步探索了度量学习与对比自监督策略以缓解长尾分布下稀有子类识别难题。在生成任务方向,T-Foley与MambaFoley等模型在类DCASE挑战框架基础上,迁移FoleySet的类别体系以提升可控时序音效合成质量,标志着Foley数据驱动研究从粗粒度分类向结构化生成与跨模态协调的深化演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务