遇见数据集

pollen-robotics/speech-commands-v0.02

收藏
Hugging Face2026-06-25 更新2026-07-22 收录
官方服务:

资源简介:

Speech Commands Dataset v0.02是一个用于有限词汇语音识别的数据集,包含一系列时长为一秒的.wav音频文件(16位PCM编码、16kHz采样率、单声道),每个文件包含一个单独的英语单词发音。总共有105,829个音频文件,按单词标签组织在文件夹中。数据集包含20个核心命令词:是、否、上、下、左、右、开、关、停、走、零、一、二、三、四、五、六、七、八、九;15个辅助词:床、鸟、猫、狗、快乐、房子、马文、希拉、树、哇、向后、向前、跟随、学习、视觉;以及一个背景噪声文件夹,包含环境噪声的较长音频片段。数据集按照原始存档中的官方validation_list.txt和testing_list.txt文件划分为训练集、验证集和测试集,确保同一发言者的所有话语被分配到同一分区。

A set of one-second .wav audio files (16-bit PCM, 16 kHz, mono), each containing a single spoken English word. 105,829 audio files organized into folders by word label. Words include 20 core command words: yes, no, up, down, left, right, on, off, stop, go, zero, one, two, three, four, five, six, seven, eight, nine; 15 auxiliary words: bed, bird, cat, dog, happy, house, marvin, sheila, tree, wow, backward, forward, follow, learn, visual; and background noise: the `_background_noise_` folder contains longer audio clips of environmental noise. The dataset is split into train/validation/test using the official `validation_list.txt` and `testing_list.txt` files included in the original archive, ensuring all utterances from a given speaker end up in the same partition.

提供机构:
pollen-robotics
搜集汇总
数据集介绍
pollen-robotics/speech-commands-v0.02 数据集图片
构建方式
Speech Commands v0.02数据集由Google的Pete Warden主导创建,依托众包方式采集而成。每个音频文件为时长1秒的单声道WAV格式,采样率为16kHz,16位PCM编码,内含一个单一的英文口语词汇。全部105,829条音频按单词标签组织成文件夹,并额外包含背景噪声片段。数据集依据官方提供的validation_list.txt和testing_list.txt文件,通过说话者ID的哈希值进行确定性划分,确保同一说话者的所有语音仅归属于训练、验证或测试集中的一个分区,从而避免了数据泄露。此版本以Parquet格式重新托管,便于与Hugging Face Dataset Viewer兼容,无需依赖自定义加载脚本即可直接加载和预览。
特点
该数据集聚焦于有限词汇的语音识别任务,涵盖20个核心命令词(如yes、no、up、down等)和15个辅助词汇(如bed、bird、cat等),外加环境背景噪声类别。音频数据采用统一的16kHz采样率,结构简洁,每一条样本均包含audio字段(含字节与路径)、字符串类型的标签、原始文件路径、匿名说话者标识符以及该说话者与该词组合的语句索引。数据集划分比例均衡,训练集84,849条、验证集9,981条、测试集11,005条,能够支持稳健的模型训练与评估。这些特性使其尤为适用于关键词唤醒与指令识别场景。
使用方法
使用该数据集时,用户可通过Hugging Face的datasets库,以一行代码`load_dataset('pollen-robotics/speech-commands-v0.02')`即可加载全部数据。加载后的数据集自动包含train、validation和test三个分割,每条样本以音频张量、标签文本及元信息的形式直接可用。由于音频列已作为原生Parquet列存储,用户无需额外解码即可进行模型输入。该数据集在训练关键词检测或语音指令分类模型时,通常将audio数据重采样或填充至统一长度,配合标签进行监督学习。同时,背景噪声片段可用于数据增强,提升模型在真实环境中的鲁棒性。
背景与挑战
背景概述
在语音识别与智能人机交互领域,关键词检测(Keyword Spotting)是一项基础而关键的任务,旨在从连续语音流中高效识别预设的有限词汇。2018年,由Pete Warden与Google团队创建的Speech Commands v0.02数据集应运而生,该数据集包含约10.6万个时长一秒的16kHz单声道WAV音频样本,涵盖20个核心指令词、15个辅助词汇及环境噪声。其核心研究问题聚焦于在资源受限设备上实现鲁棒的、低延迟的有限词汇语音识别,为嵌入式系统与移动端语音助手的发展奠定了基准数据基础,极大地推动了关键词检测算法的标准化研究与评估。
当前挑战
当前数据集面临的核心挑战源于现实应用场景的复杂性。领域问题方面,如何在嘈杂环境、不同口音及语速条件下保持高精度的关键词识别仍是关键难题,尤其是背景噪声干扰与词汇相似度导致的误检问题。数据集构建过程中,还需应对标注一致性挑战,众包采集的音频在语音清晰度、情感语调等方面存在显著差异,且哈希分发言人划分策略虽保证了说话者独立性,但训练、验证、测试集间的不均衡分布(84849/9981/11005)可能引入偏差。此外,原始音频的1秒定长限制了模型对部分音节较长词汇的完整性捕捉能力,亦构成构建挑战。
常用场景
经典使用场景
在智能语音交互领域,Speech Commands v0.02 数据集是经典的关键词唤醒(Keyword Spotting)与有限词汇语音识别研究的基石。该数据集收录了超过十万条时长为一秒的英文单词音频,涵盖20个核心指令词、15个辅助词汇以及背景噪声片段,并按照说话者身份进行了严格的分集划分。研究者常借助此数据集训练轻量级神经网络模型,以在资源受限的设备上精准识别诸如“yes”、“no”、“stop”等预设指令,从而实现对智能音箱、可穿戴设备及移动终端的高效唤醒与操控。其标准化的16kHz采样率和单声道PCM格式,为模型性能的公平对比提供了可靠平台。
实际应用
在实际部署层面,Speech Commands v0.02 数据集已广泛应用于多种嵌入式语音唤醒系统的开发流程。例如,智能家居设备中的“Hey, device”激活模块常基于该数据集训练紧凑型深度神经网络,以在树莓派、移动SoC甚至微控制器上实现毫秒级响应的离线语音指令解析。汽车语音助手利用该数据集迭代“increase”、“decrease”等操控指令的识别精度,确保驾驶环境中的交互安全。此外,该数据集还被用于构建听障人士辅助工具中的简易语音控制系统,以及玩具机器人、物联网传感器等场景下的免提操作接口,有效降低了产品对云端计算能力的依赖。
衍生相关工作
围绕Speech Commands v0.02数据集衍生出了一系列具有深远影响的学术工作。谷歌的Pete Warden团队在发布该数据集时配套发表了奠基性论文《Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition》,奠定了该领域的实验框架。随后,研究者提出了MatchboxNet与BC-ResNet等针对计算资源受限场景优化的紧凑型网络结构,在保持高准确率的同时将参数量压缩至数十万级别。基于该数据集,注意力机制被引入关键词检测任务,涌现出SNS-TimeStretch及RASR等数据增强方案,显著提升了模型对噪声和口音变化的鲁棒性。这些工作共同构筑了现代嵌入式语音识别技术的学术版图。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务