Hive
收藏资源简介:
Hive是一个高质量合成数据集,包含2000小时的音频,用于基于查询的通用声音分离。该数据集通过消除共现噪声,从无约束的录音中挖掘高纯度的单事件片段,并通过语义一致的策略合成混合物。实验结果表明,尽管仅使用约0.2%的数据规模,但在Hive上训练的模型在分离准确性和感知质量上达到了与百万小时基线竞争的水平,并且在MUSDB18-HQ和USS-Bench等分布外评估基准上表现出显著的零样本泛化能力。
Hive is a high-quality synthetic dataset containing 2,000 hours of audio, designed for query-based universal sound separation. This dataset extracts high-purity single-event segments from unconstrained recordings by eliminating co-occurring noise, and synthesizes mixtures via a semantically consistent strategy. Experimental results demonstrate that models trained on Hive achieve competitive separation accuracy and perceptual quality compared to million-hour baseline benchmarks, despite using only ~0.2% of the data scale. Moreover, these models exhibit remarkable zero-shot generalization capabilities on out-of-distribution evaluation benchmarks such as MUSDB18-HQ and USS-Bench.
Hive 数据集概述
数据集基本信息
- 名称:Hive
- 核心目标:为基于查询的通用声音分离任务提供高质量、语义一致的数据,旨在解决复杂声学场景中现有方法存在的残留干扰问题。
- 数据规模:包含2,442小时的原始音频,生成了1,960万条混合音频。
- 数据性质:高质量合成数据集。
核心特性与内容
- 声音类别:涵盖AudioSet本体中的283个声音类别。
- 混合逻辑:采用语义一致的混合策略生成音频混合物。
- 音频质量:采样率为44.1kHz。
- 数据效率:实验表明,仅使用约0.2%的百万小时基线数据规模,在该数据集上训练的模型即可达到具有竞争力的分离准确率和感知质量。
数据收集与构建方法
- 核心问题应对:针对现有野外数据集中存在的弱标签和严重事件共现问题,提出了一个自动化数据收集流水线。
- 流水线目标:通过从无约束的录音中挖掘高纯度的单事件片段,并经由语义一致的策略合成混合物,以消除共现噪声。
- 流水线阶段:
- 音频分块:将长音频分割成片段。
- 单标签过滤:移除多标签样本。
- 单事件过滤:使用Qwen3-Omni验证声学纯度。
- AudioSet标签标注:使用AudioTag分配本体标签。
- 叶标签分类:使用Qwen3-Omni细化至叶节点。
- 音频超分辨率:使用Apollo上采样至44.1kHz。
评估与泛化性能
- 分离性能:在该数据集上训练的模型实现了具有竞争力的分离准确率和感知质量。
- 零样本泛化:在分布外评估基准(如MUSDB18-HQ和USS-Bench)上表现出显著的零样本泛化能力。
数据来源与合规性
- 主要数据源:数据集构建基于12个基础开源音频数据集。
- 核心高保真片段来源:
- BBC Sound Effects (369,603条片段,1,020.62小时)
- AudioSet (326,890条片段,896.61小时)
- VGGSound (115,191条片段,319.10小时)
- FreeSound (17,451条片段,46.90小时)
- 专业领域贡献者:包括MUSIC21、Voicebank-DEMAND、FSD50K、ClothoV2、AVE、SoundBible、DCASE、ESC50等数据集,提供了音乐、语音、环境及事件等领域的原始源音频。
- 许可合规:所有源数据均严格按照其各自许可(如CC BY、CC0、Remix License)进行处理。
- 发布内容:本仓库仅发布用于可复现性的元数据(包含混合参数和源引用的JSON文件),不重新分发源数据集中的原始音频文件。用户必须根据各自的许可和使用条款独立下载和准备源数据集。
项目信息
- 开发机构:清华大学、盛趣AI、约翰斯·霍普金斯大学。
- 项目许可:Apache License 2.0。
- 相关模型许可:
- Qwen3-Omni: Apache 2.0
- AudioTag: Apache 2.0
- Apollo: 请查阅模型仓库获取特定许可




