davidscripka/openwakeword_features
收藏资源简介:
该数据集包含预计算的音频特征,设计用于与openWakeWord库一起使用。这些特征不是原始音频数据,而是由Google的预训练语音嵌入模型生成的低维音频特征,用于训练自定义的openWakeWord模型。数据集包括来自ACAV100M数据集的特征和一个假阳性验证集。ACAV100M数据集包含多语言语音、噪音和音乐等多样化的音频数据,假阳性验证集则包含来自DiPCo、Santa Barbara Corpus of Spoken American English和MUSDB Music Dataset的音频特征。
This dataset contains pre-computed audio features designed for use with the openWakeWord library. These features are not raw audio data, but low-dimensional audio features generated by Google's pre-trained speech embedding models, intended for training custom openWakeWord models. The dataset includes features from the ACAV100M dataset and a false positive validation set. The ACAV100M dataset contains diverse audio data including multilingual speech, noise and music, while the false positive validation set includes audio features sourced from DiPCo, the Santa Barbara Corpus of Spoken American English, and the MUSDB Music Dataset.
数据集概述
该数据集包含预计算的音频特征,专为与 openWakeWord 库 配合使用而设计。具体而言,这些特征旨在作为通用负数据(即不包含目标唤醒词/短语的数据),用于训练自定义 openWakeWord 模型。
数据集中的各个 .npy 文件并非原始音频数据,而是由预训练的 Google 语音嵌入模型 生成的低维音频特征。openWakeWord 使用这些特征作为自定义词/短语检测模型的输入。
数据集内容
ACAV100M
ACAV100M 数据集包含多语言语音、噪声、音乐等多样化音频数据,均在真实环境中录制。该数据集非常适用于训练自定义 openWakeWord 模型。
- 数据源: ACAV100M
- 大小: 形状为 (5625000, 16, 96) 的数组,对应约 2000 小时的音频。每行数组的时间维度为 16,每个时间步长为 80 毫秒,因此每行包含代表 1.28 秒音频的特征。
误报验证集
这是一个手工挑选的音频特征组合(代表约 11 小时总音频),用作训练自定义 openWakeWord 模型时的误报验证集。它旨在广泛代表 openWakeWord 模型可能部署的不同环境类型,从而有助于估计误报率。
贡献的音频数据集包括:
- 整个 DiPCo 数据集(约 5.3 小时)
- 从 Santa Barbara Corpus of Spoken American English 中挑选的片段(约 3.7 小时)
- 从 MUSDB Music Dataset 中挑选的片段(2 小时)
注意,MUSDB 音频数据首先通过 MIT 脉冲响应录音 进行混响处理,以使其更接近真实世界部署。




