遇见数据集

audioset-opus-fbanks

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

该数据集提供了 AudioSet 的预计算 Kaldi log-mel 滤波器组特征,并量化为 INT8 格式。它源自两个已按内容哈希去重的上游数据集:danjacobellis/audioset_opus_24kbps 和 danjacobellis/audioset_opus_24kbps_balanced。设计目的是在掩码自编码器训练过程中移除音频解码和滤波器组计算,从而加速训练循环。特征规范如下:采样率 16kHz(单声道,使用 soxr 重采样),帧移 10ms,帧长 25ms,64 个 mel 滤波器,每段音频包含 1008 帧(对应 10 秒音频,实际 998 帧,零填充至 1008)。特征以 int8 类型存储,形状为 (1008, 64),每段音频占用 64,512 字节。量化采用每样本仿射映射,每个样本记录独立的 scale 和 offset,以充分利用 8 位范围。去量化代码已提供。数据集包含三个拆分:训练集(1,912,024 行,来自不平衡训练集)、验证集(20,550 行,来自平衡训练集)、测试集(18,886 行,来自标准 AudioSet 评估集)。列包括 path(源路径)、label(AudioSet 类别索引列表)、fbank(二进制 INT8 数据)、scale(float32 去量化缩放因子)、offset(float32 去量化偏移量)、n_frames(int16 实际帧数)。保真度评估显示,与 float32 相比,RMS 误差为 0.0217,最大误差为 0.0494,信噪比为 45.7 dB。该数据集适用于音频分类、自监督学习(如掩码自编码器)等任务。许可证为 CC BY 4.0。

This dataset provides precomputed Kaldi log-mel filterbank features of AudioSet, quantized to INT8 format. It is derived from two upstream datasets deduplicated by content hash: danjacobellis/audioset_opus_24kbps and danjacobellis/audioset_opus_24kbps_balanced. The design goal is to remove audio decoding and filterbank computation during masked autoencoder training, thereby accelerating the training loop. Feature specifications: sample rate 16kHz (mono, resampled using soxr), frame shift 10ms, frame length 25ms, 64 mel filters, each audio segment contains 1008 frames (corresponding to 10 seconds of audio, actual 998 frames, zero-padded to 1008). Features are stored as int8 type with shape (1008, 64), occupying 64,512 bytes per audio segment. Quantization uses per-sample affine mapping, with each sample recording independent scale and offset to fully utilize the 8-bit range. Dequantization code is provided. The dataset includes three splits: training set (1,912,024 rows, from unbalanced training set), validation set (20,550 rows, from balanced training set), and test set (18,886 rows, from standard AudioSet evaluation set). Columns include path (source path), label (list of AudioSet category indices), fbank (binary INT8 data), scale (float32 dequantization scaling factor), offset (float32 dequantization offset), n_frames (int16 actual number of frames). Fidelity evaluation shows RMS error of 0.0217, maximum error of 0.0494, and signal-to-noise ratio of 45.7 dB compared to float32. This dataset is suitable for tasks such as audio classification and self-supervised learning (e.g., masked autoencoders). License: CC BY 4.0.

创建时间:
2026-07-31
原始信息汇总

数据集概述

AudioSet Opus INT8 Log-Mel Filterbanks 是一个为音频分类任务预计算的音频特征数据集,基于 AudioSet 数据集,提供了量化为 INT8 格式的 Kaldi log-mel 滤波器组特征。

核心特性

  • 任务类型:音频分类
  • 语言:英语
  • 许可协议:CC BY 4.0
  • 数据规模:约 195 万个音频片段(1M < n < 10M)
  • 设计目的:消除训练循环中的音频解码和滤波器组计算开销,特别适用于掩码自编码器(masked-autoencoder)等自监督学习场景

特征规格

项目 规格
前端 Kaldi fbank(htk_compat=True, use_energy=False, window_type="hanning", dither=0.0
采样率 16,000 Hz(单声道,使用 soxr 重采样)
帧移 / 帧长 10 ms / 25 ms
Mel 通道数 64
帧数 1008(10 秒音频 → 998 个真实帧,零填充至 1008)
存储类型 int8,形状 (1008, 64),C 顺序,每片段 64,512 字节
存储内容 原始 log-mel 特征,未做均值/标准差归一化

数据列说明

列名 类型 含义
path string 源路径,可与上游数据集连接
label list<int64> AudioSet 类别索引
fbank binary 64,512 个 int8 字节,重塑为 (1008, 64)
scale float32 每个片段的去量化缩放因子
offset float32 每个片段的去量化偏移量
n_frames int16 零填充前的真实帧数

量化与去量化

量化采用逐片段仿射映射,每个片段根据其自身的最小/最大值获得独立的 scale 和 offset,充分利用 8 位整数的完整范围。去量化参考代码如下:

python import numpy as np

def dequantize(row): q = np.frombuffer(row["fbank"], dtype=np.int8).reshape(1008, 64) return (q.astype(np.float32) + 128.0) * row["scale"] + row["offset"]

保真度评估(基于 2,048 个片段,对比 float32):RMS 误差 0.0217,最大误差 0.0494,信噪比 45.7 dB。如需应用 EAT/AudioMAE 归一化,可使用以下公式:

python features = (dequantize(row) - (-4.268)) / (4.569 * 2.0)

数据划分

划分 行数 来源 AudioSet 子集
train 1,912,024 audioset_opus_24kbps unbalanced_train
validation 20,550 audioset_opus_24kbps_balanced (train) balanced_train
test 18,886 audioset_opus_24kbps_balanced (validation) eval_segments

test 为 AudioSet 官方评估集;validation 为 balanced_train 的留存集,用作固定的、与混合无关的评分集。任何片段不会出现在多个划分中。

数据来源与生成

许可与引用

AudioSet 由 Google 以 CC BY 4.0 发布,底层音频来自 YouTube,须遵守其原始条款。本数据集为有损派生特征(64 维 log-mel,10 ms 帧移,INT8 量化),无法从中可理解地重建源音频。使用时请引用 AudioSet 及上游 Opus 数据集。

搜集汇总
数据集介绍
audioset-opus-fbanks 数据集图片
构建方式
该数据集源自经内容哈希去重的AudioSet Opus音频集合,通过Kaldi工具提取对数梅尔滤波器组特征。具体而言,波形先经直流偏移去除,随后以16 kHz采样率、10毫秒帧移和25毫秒窗长生成64维梅尔频带,每段音频截取10秒并零填充至1008帧。所获浮点特征经逐片段仿射量化转为INT8,每个片段依据自身最小值和最大值确定独立的缩放与偏移参数,从而充分利用8位动态范围,最终存储为二进制格式并附带反量化所需元数据。
特点
该数据集的核心特征在于以INT8精度存储的预计算Kaldi对数梅尔滤波器组,每片段固定为1008×64的二维结构,占用64,512字节,有效规避了训练循环中的音频解码与特征计算开销。逐片段仿射量化策略在2,048个片段上的实测信噪比达45.7 dB,均方根误差仅为0.0217,对信号保真度较高。数据集划分为训练集1,912,024条、验证集20,550条和测试集18,886条,三者互不重叠,且测试集对应AudioSet标准评估集,验证集为平衡训练集,便于模型进行公平且可复现的评估。
使用方法
使用该数据集时,首先从二进制列中读取INT8字节并重塑为(1008, 64)数组,然后依据每片段附带的缩放与偏移参数执行反量化:将整型值加128后乘以缩放因子并加上偏移,即可恢复浮点对数梅尔特征。若需适配EAT或AudioMAE等模型的输入规范,可进一步应用归一化公式,即减去-4.268后除以4.569与2.0的乘积。数据集各列包含源路径、标签、特征、缩放、偏移及有效帧数,便于与上游音频数据集进行连接和按帧截取。
背景与挑战
背景概述
音频自监督学习与声学事件分类长期依赖大规模标注语料,而AudioSet作为谷歌于2017年发布的大规模音频事件数据集,涵盖逾两百万条YouTube音频片段与六百余类声音事件,已成为该领域的基准资源。然而,原始音频解码与滤波器组前端计算在掩码自编码器训练中构成显著瓶颈。audioset-opus-fbanks数据集应运而生,由研究人员基于danjacobellis发布的Opus格式AudioSet衍生数据集构建,旨在将Kaldi对数梅尔滤波器组特征预计算并量化为INT8,从而彻底免除训练循环中的音频解码与特征提取开销。该数据集在百万参数规模下可节省约41%的训练墙钟时间,为大规模音频自监督预训练提供了高效的数据基础。
当前挑战
该数据集所应对的核心挑战在于音频分类与自监督学习领域对计算效率的迫切需求。传统训练流程中,音频解码与滤波器组计算占据大量计算资源,尤其在大规模预训练场景下成为不可忽视的性能瓶颈。构建过程中,研究团队需在保持特征保真度的前提下实现高效量化:采用逐片段仿射量化策略,将64维对数梅尔滤波器组特征压缩至INT8精度,同时确保每片段充分利用8位动态范围。经2048个片段实测,该方法均方根误差仅为0.0217,信噪比达45.7分贝,约为信号标准差的0.5%,在显著降低存储与计算成本的同时维持了特征质量。此外,数据来源经内容哈希去重,杜绝了片段跨划分泄漏,保障了评估的可靠性。
常用场景
经典使用场景
在音频自监督学习与声学事件分类的研究范式中,该数据集凭借其预计算的Kaldi对数梅尔滤波器组特征,成为训练掩码自编码器等模型的经典基石。研究者无需在训练循环中执行音频解码与滤波器组计算,便可直接载入INT8量化的(1008, 64)特征张量,从而将精力聚焦于模型架构的探索与表征学习效率的提升,广泛适用于音频分类、声学事件检测以及大规模预训练任务。
实际应用
在实际应用层面,该数据集为工业级音频理解系统提供了高效的数据供给方案。语音与音频分析平台可借助其INT8存储格式显著降低内存占用与磁盘吞吐压力,单片段仅占64512字节,便于在分布式训练框架中快速加载与批处理。内容审核、智能家居声学感知以及媒体检索等场景,均可受益于其去除解码依赖后所获得的训练加速与部署便捷性。
衍生相关工作
围绕该数据集,学术界已衍生出一系列具有影响力的经典工作。AudioMAE与EAT等掩码自编码器模型将其作为标准输入特征来源,推动了音频自监督预训练范式的演进;基于AudioSet本体构建的声学事件分类基准亦广泛采用其训练与评估划分。该数据集所提供的EAT/AudioMAE归一化接口,进一步促进了不同模型间特征处理流程的统一与公平比较。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务