JusperLee/Hive
收藏资源简介:
Hive是一个高质量的合成数据集,专为通用声音分离设计。与传统依赖弱标记野外数据的方法不同,Hive利用自动化数据收集流程从复杂声学环境中挖掘高纯度单事件片段,并合成具有语义一致约束的混合物。关键特征包括:纯度优先于规模(2.4千小时实现与百万小时基线的竞争性能,约0.2%数据规模);单标签清洁监督(严格的语义-声学对齐消除共现噪声);语义一致混合(基于逻辑的共现矩阵确保真实声学场景);高保真(44.1kHz采样率用于高质量音频)。数据集规模:训练集原始音频2442小时,验证测试集原始音频292小时,混合样本1960万,总混合时长约22400小时,标签类别283类,采样率44.1kHz,训练样本时长4秒,测试样本时长10秒。数据集划分:训练集1750万样本(4秒时长),验证集175万样本,测试集35万样本(10秒时长)。
Hive is a high-quality synthetic dataset designed for Universal Sound Separation (USS). Unlike traditional methods relying on weakly-labeled in-the-wild data, Hive leverages an automated data collection pipeline to mine high-purity single-event segments from complex acoustic environments and synthesizes mixtures with semantically consistent constraints. Key Features: Purity over Scale (2.4k hours achieving competitive performance with million-hour baselines, ~0.2% data scale); Single-label Clean Supervision (Rigorous semantic-acoustic alignment eliminating co-occurrence noise); Semantically Consistent Mixing (Logic-based co-occurrence matrix ensuring realistic acoustic scenes); High Fidelity (44.1kHz sample rate for high-quality audio). Dataset Scale: Training Set Raw Audio 2,442 hours; Val & Test Set Raw Audio 292 hours; Mixed Samples 19.6M mixtures; Total Mixed Duration ~22.4k hours; Label Categories 283 classes; Sample Rate 44.1 kHz; Training Sample Duration 4 seconds; Test Sample Duration 10 seconds. Dataset Splits: Train 17.5M samples (4s duration); Validation 1.75M samples; Test 350k samples (10s duration).



