Hive
收藏资源简介:
Hive是一个高质量的合成音频数据集,用于基于查询的通用声音分离,通过自动化管道从无约束录音中挖掘高纯度单事件片段,并通过语义一致策略合成混合物,包含2k小时的音频数据,旨在解决现有方法在复杂声学场景中的性能限制。
Hive is a high-quality synthetic audio dataset for query-based general sound separation. It mines high-purity single-event audio clips from unconstrained recordings via an automated pipeline, and synthesizes mixtures using a semantically consistent strategy. Containing 2,000 hours of audio data, this dataset aims to address the performance limitations of existing methods in complex acoustic scenarios.
Hive 数据集概述
Hive 是一个面向查询式通用声音分离任务的高质量合成音频数据集,由清华大学、盛趣游戏人工智能实验室和约翰霍普金斯大学的研究团队共同构建。
核心特性
- 数据规模:包含 2,442 小时原始音频和 19.6M 条混合样本
- 声音类别:覆盖 AudioSet 本体论中的 283 个声音类别
- 采样率:44.1 kHz
- 混合逻辑:采用语义一致性混合策略,消除背景噪声与目标类别之间的虚假关联
- 数据效率:仅使用约 0.2% 的数据量即可达到与百万小时基线模型相媲美的分离精度和感知质量
数据集发布版本
| 版本 | 存储位置 | 格式 | 大小 | 说明 |
|---|---|---|---|---|
| Hive(元数据) | JusperLee/Hive | Parquet | ~1.24 GB | 仅包含元数据,需使用 mix_from_metadata.py 从 12 个原始数据源本地重新生成混合音频 |
| Hive-ALL(全音频) | JusperLee/Hive-ALL | WebDataset .tar 分片 |
285 GB | 预生成的双源混合音频,可直接流式加载训练,无需重新混合 |
数据收集流水线
采用 6 步自动化流水线从弱标签来源中挖掘高纯度单事件音频:
- 音频切分 - 将长音频分割为短片段
- 单标签过滤 - 移除多标签样本
- 单事件过滤 - 使用 Qwen3-Omni 验证声学纯净度
- AudioSet 标签标注 - 使用 AudioTag 分配本体论标签
- 叶节点分类 - 使用 Qwen3-Omni 细化至叶节点分类
- 音频超分辨率 - 使用 Apollo 将音频上采样至 44.1 kHz
基础数据源
数据集基于以下 12 个开放音频数据集,所有处理均严格遵守各数据集的许可协议:
核心大规模数据源
- BBC Sound Effects:369,603 个片段(1,020.62 小时),Remix License
- AudioSet:326,890 个片段(896.61 小时),CC BY(Google)
- VGGSound:115,191 个片段(319.10 小时),CC BY 4.0(牛津大学)
- FreeSound:17,451 个片段(46.90 小时),CC0/BY/BY-NC(MTG-UPF)
专业领域数据源
- MUSIC21:32,701 个片段(90.28 小时)- 乐器独奏与合奏
- Voicebank-DEMAND:12,376 个片段(9.94 小时)- 纯净语音
- FSD50K:636 个片段(0.80 小时)- 精细标注子集
- ClothoV2:14,759 个片段(38.19 小时)- 音频描述数据集
- AVE:3,054 个片段(6.91 小时)- 音视频事件定位
- SoundBible:2,501 个片段(5.78 小时)- 精炼短片段
- DCASE:1,969 个片段(5.46 小时)- 声学场景检测
- ESC50:1,433 个片段(1.99 小时)- 环境声音分类基准
模型推理
提供两个推理脚本,自动从 Hugging Face 下载配置和检查点:
- AudioSep-hive:
infer_audiosep.py,模型权重位于 JusperLee/AudioSep-hive - FlowSep-hive:
infer_flowsep.py,模型权重位于 JusperLee/FlowSep-hive
也提供 Gradio 交互式演示应用 app.py,支持两个模型统一界面。
零样本泛化能力
在 MUSDB18-HQ 和 USS-Bench 等分布外评估基准上,基于 Hive 训练的模型展现出显著的零样本泛化性能。
许可协议
- 项目许可:Apache License 2.0
- 模型许可:Qwen3-Omni(Apache 2.0)、AudioTag(Apache 2.0)、Apollo(参见仓库许可)
- 数据声明:仓库仅发布元数据,不重新分发原始音频文件,用户需自行根据相应许可下载源数据集




