audioset-opus-fbanks
收藏资源简介:
该数据集提供了 AudioSet 的预计算 Kaldi log-mel 滤波器组特征,并量化为 INT8 格式。它源自两个已按内容哈希去重的上游数据集:danjacobellis/audioset_opus_24kbps 和 danjacobellis/audioset_opus_24kbps_balanced。设计目的是在掩码自编码器训练过程中移除音频解码和滤波器组计算,从而加速训练循环。特征规范如下:采样率 16kHz(单声道,使用 soxr 重采样),帧移 10ms,帧长 25ms,64 个 mel 滤波器,每段音频包含 1008 帧(对应 10 秒音频,实际 998 帧,零填充至 1008)。特征以 int8 类型存储,形状为 (1008, 64),每段音频占用 64,512 字节。量化采用每样本仿射映射,每个样本记录独立的 scale 和 offset,以充分利用 8 位范围。去量化代码已提供。数据集包含三个拆分:训练集(1,912,024 行,来自不平衡训练集)、验证集(20,550 行,来自平衡训练集)、测试集(18,886 行,来自标准 AudioSet 评估集)。列包括 path(源路径)、label(AudioSet 类别索引列表)、fbank(二进制 INT8 数据)、scale(float32 去量化缩放因子)、offset(float32 去量化偏移量)、n_frames(int16 实际帧数)。保真度评估显示,与 float32 相比,RMS 误差为 0.0217,最大误差为 0.0494,信噪比为 45.7 dB。该数据集适用于音频分类、自监督学习(如掩码自编码器)等任务。许可证为 CC BY 4.0。
This dataset provides precomputed Kaldi log-mel filterbank features of AudioSet, quantized to INT8 format. It is derived from two upstream datasets deduplicated by content hash: danjacobellis/audioset_opus_24kbps and danjacobellis/audioset_opus_24kbps_balanced. The design goal is to remove audio decoding and filterbank computation during masked autoencoder training, thereby accelerating the training loop. Feature specifications: sample rate 16kHz (mono, resampled using soxr), frame shift 10ms, frame length 25ms, 64 mel filters, each audio segment contains 1008 frames (corresponding to 10 seconds of audio, actual 998 frames, zero-padded to 1008). Features are stored as int8 type with shape (1008, 64), occupying 64,512 bytes per audio segment. Quantization uses per-sample affine mapping, with each sample recording independent scale and offset to fully utilize the 8-bit range. Dequantization code is provided. The dataset includes three splits: training set (1,912,024 rows, from unbalanced training set), validation set (20,550 rows, from balanced training set), and test set (18,886 rows, from standard AudioSet evaluation set). Columns include path (source path), label (list of AudioSet category indices), fbank (binary INT8 data), scale (float32 dequantization scaling factor), offset (float32 dequantization offset), n_frames (int16 actual number of frames). Fidelity evaluation shows RMS error of 0.0217, maximum error of 0.0494, and signal-to-noise ratio of 45.7 dB compared to float32. This dataset is suitable for tasks such as audio classification and self-supervised learning (e.g., masked autoencoders). License: CC BY 4.0.
数据集概述
AudioSet Opus INT8 Log-Mel Filterbanks 是一个为音频分类任务预计算的音频特征数据集,基于 AudioSet 数据集,提供了量化为 INT8 格式的 Kaldi log-mel 滤波器组特征。
核心特性
- 任务类型:音频分类
- 语言:英语
- 许可协议:CC BY 4.0
- 数据规模:约 195 万个音频片段(1M < n < 10M)
- 设计目的:消除训练循环中的音频解码和滤波器组计算开销,特别适用于掩码自编码器(masked-autoencoder)等自监督学习场景
特征规格
| 项目 | 规格 |
|---|---|
| 前端 | Kaldi fbank(htk_compat=True, use_energy=False, window_type="hanning", dither=0.0) |
| 采样率 | 16,000 Hz(单声道,使用 soxr 重采样) |
| 帧移 / 帧长 | 10 ms / 25 ms |
| Mel 通道数 | 64 |
| 帧数 | 1008(10 秒音频 → 998 个真实帧,零填充至 1008) |
| 存储类型 | int8,形状 (1008, 64),C 顺序,每片段 64,512 字节 |
| 存储内容 | 原始 log-mel 特征,未做均值/标准差归一化 |
数据列说明
| 列名 | 类型 | 含义 |
|---|---|---|
path |
string |
源路径,可与上游数据集连接 |
label |
list<int64> |
AudioSet 类别索引 |
fbank |
binary |
64,512 个 int8 字节,重塑为 (1008, 64) |
scale |
float32 |
每个片段的去量化缩放因子 |
offset |
float32 |
每个片段的去量化偏移量 |
n_frames |
int16 |
零填充前的真实帧数 |
量化与去量化
量化采用逐片段仿射映射,每个片段根据其自身的最小/最大值获得独立的 scale 和 offset,充分利用 8 位整数的完整范围。去量化参考代码如下:
python import numpy as np
def dequantize(row): q = np.frombuffer(row["fbank"], dtype=np.int8).reshape(1008, 64) return (q.astype(np.float32) + 128.0) * row["scale"] + row["offset"]
保真度评估(基于 2,048 个片段,对比 float32):RMS 误差 0.0217,最大误差 0.0494,信噪比 45.7 dB。如需应用 EAT/AudioMAE 归一化,可使用以下公式:
python features = (dequantize(row) - (-4.268)) / (4.569 * 2.0)
数据划分
| 划分 | 行数 | 来源 | AudioSet 子集 |
|---|---|---|---|
train |
1,912,024 | audioset_opus_24kbps |
unbalanced_train |
validation |
20,550 | audioset_opus_24kbps_balanced (train) |
balanced_train |
test |
18,886 | audioset_opus_24kbps_balanced (validation) |
eval_segments |
test 为 AudioSet 官方评估集;validation 为 balanced_train 的留存集,用作固定的、与混合无关的评分集。任何片段不会出现在多个划分中。
数据来源与生成
- 源自 danjacobellis/audioset_opus_24kbps 和 danjacobellis/audioset_opus_24kbps_balanced,这两个数据集已按内容哈希去重。
- 使用
audio-mixture-scaling项目中的ams.model.fbank.KaldiFbank生成,解码采用torchcodec的AudioDecoder及soxr重采样。 - 全部 1,951,460 个片段零解码失败。
许可与引用
AudioSet 由 Google 以 CC BY 4.0 发布,底层音频来自 YouTube,须遵守其原始条款。本数据集为有损派生特征(64 维 log-mel,10 ms 帧移,INT8 量化),无法从中可理解地重建源音频。使用时请引用 AudioSet 及上游 Opus 数据集。





