遇见数据集

infant-cry-detection

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

本数据集专为嘈杂家庭环境下的婴儿哭声检测任务而构建,旨在为机器学习模型(尤其是深度神经网络)的训练与评估提供一个多样化、具代表性且具备鲁棒性的音频样本集合。数据集通过整合多个公开数据集(包括CryCeleb2023、EnesBabyCries1、2020科大讯飞A.I.开发者大赛、VoxCeleb、ESC 50、Cat Meowing和DASEE)构建而成,确保样本的多样性和代表性。数据内容包含约39.6小时的音频记录,划分为哭声(正样本)和非哭声(负样本)两大类,并采用五折平衡划分以支持交叉验证。非哭声数据进一步细分为五个子类:语音、人类非语音、猫叫声、家庭噪音(涵盖家用电器、户外自然环境、城市交通等)和静音,其中特别包含了易与婴儿哭声混淆的声音(如猫叫声)以及典型的家庭环境噪声。所有音频样本均经过预处理:静音片段被移除,剩余片段被分割或拼接以形成统一长度,最终转换为单声道、16 kHz采样率、WAV PCM格式的音频文件,固定时长为5秒(足以捕获一个或多个哭声周期)。数据集的组织结构包括:audio/目录(包含positive/和negative/子目录分别存放正负样本音频文件)、metadata/目录(存储元数据及标签的CSV文件)以及rir/目录(存放用于数据增强中生成环境混响的房间冲激响应音频文件)。数据预处理流程中,样本可进一步转换为128维的对数梅尔频谱图作为深度神经网络的输入特征。为提升模型鲁棒性,数据集支持在训练时随机应用三种数据增强方法:速度扰动(以0.8至1.2的随机因子重采样,改变音高和共振峰)、环境噪声破坏(按指定信噪比添加加性噪声,并通过卷积引入真实测量的房间混响效果)以及时间与频率掩蔽(在时频域用零值随机掩蔽连续片段)。数据规模方面,哭声样本共13,330个;非哭声样本中,语音4,963个、家庭噪音4,506个、人类非语音2,076个、猫叫声1,953个、静音1,650个。该数据集适用于音频分类任务,特别是面向真实家庭噪声环境的婴儿哭声检测模型开发与评估。

This dataset is constructed specifically for infant cry detection tasks in noisy home environments, aiming to provide a diverse, representative, and robust audio corpus for the training and evaluation of machine learning models, especially deep neural networks. This dataset is compiled by integrating multiple public datasets, including CryCeleb2023, EnesBabyCries1, 2020 iFLYTEK A.I. Developer Contest, VoxCeleb, ESC 50, Cat Meowing, and DASEE, to ensure the diversity and representativeness of the samples. The dataset contains approximately 39.6 hours of audio recordings, which are categorized into two classes: cry sounds (positive samples) and non-cry sounds (negative samples), with a balanced 5-fold split to support cross-validation. The non-cry sound data is further divided into five subcategories: speech, human non-speech sounds, cat meows, household noises (covering household appliances, outdoor natural environments, urban traffic, etc.), and silence. Notably, it includes sounds that are easily confused with infant cries (such as cat meows) and typical home environmental noises. All audio samples undergo preprocessing: silent segments are removed, and the remaining segments are split or concatenated to achieve a uniform length. Finally, the samples are converted into audio files in mono, 16 kHz sampling rate, and WAV PCM format, with a fixed duration of 5 seconds, which is sufficient to capture one or multiple cry cycles. The organizational structure of the dataset includes: an audio/ directory (containing positive/ and negative/ subdirectories for storing positive and negative sample audio files respectively), a metadata/ directory (storing CSV files of metadata and labels), and a rir/ directory (storing room impulse response audio files used to generate environmental reverberation for data augmentation). During the preprocessing pipeline, samples can be further converted into 128-dimensional log-mel spectrograms as input features for deep neural networks. To improve model robustness, the dataset supports the random application of three data augmentation methods during training: 1) Speed perturbation: resampling with a random factor between 0.8 and 1.2, which alters the pitch and formants; 2) Environmental noise corruption: adding additive noise at a specified signal-to-noise ratio (SNR) and introducing real measured room reverberation effects via convolution; 3) Time and frequency masking: randomly masking continuous segments with zero values in the time-frequency domain. In terms of dataset scale, there are 13,330 cry samples; among the non-cry samples, there are 4,963 speech samples, 4,506 household noise samples, 2,076 human non-speech samples, 1,953 cat meow samples, and 1,650 silence samples. This dataset is applicable to audio classification tasks, especially the development and evaluation of infant cry detection models for real-world noisy home environments.

创建时间:
2026-05-26
原始信息汇总

数据集概要

  • 任务类别:音频分类(audio-classification)
  • 标签:婴儿哭声检测(infant-cry-detection)、医学(medical)、噪声鲁棒性(noise-robustness)
  • 语言:英语(en)、中文(zh)
  • 数据规模:10,000 < 样本数 < 100,000(10K<n<100K)

数据集描述

本数据集专门用于嘈杂家庭环境下的婴儿哭声检测,通过整合 CryCeleb2023、EnesBabyCries1、2020 科大讯飞 A.I. 开发者大赛、VoxCeleb、ESC 50、Cat Meowing 和 DASEE 等多个公开数据集构建,确保样本的多样性和代表性。数据集包含约 39.6 小时的音频记录,划分为婴儿哭声(正样本)和非哭声(负样本)两类,并分为五折用于交叉验证。

目录结构

  • audio/:包含所有音频样本文件,内部有 positive/(婴儿哭声正样本)和 negative/(非哭声负样本)子目录。
  • metadata/:包含 CSV 格式的元数据文件(如 all28479.csvnoise.csvnoise_val.csvrir.csv)。
  • rir/:包含用于数据增强中生成混响效果的房间冲激响应(RIR)音频文件。

样本构成

  • 正样本(婴儿哭声):共 13,330 个样本,来源于 CryCeleb2023、EnesBabyCries1 和 2020 科大讯飞 A.I. 开发者大赛。
  • 负样本(非哭声):包含五个子类,具体样本数量如下:
    • 语音(Speech):4,963 个
    • 家庭噪音(Household noise):4,506 个
    • 人类非语音(Human non-speech):2,076 个
    • 猫叫声(Cat Meows):1,953 个
    • 静音(Silences):1,650 个

数据预处理

  • 移除样本中的静音片段,将剩余片段分割或拼接为固定长度(5 秒)的音频样本。
  • 所有样本被转换为单声道 16 kHz WAV PCM 格式。
  • 可能的处理流程:对每个样本应用大小为 512 的汉宁窗,以 400 步长分帧;使用 128 个三角形滤波器组计算梅尔尺度短时傅里叶变换,得到 128 维对数梅尔频谱图。

数据增强

在每次迭代中随机执行以下三种增强方法:

  1. 速度扰动:以 0.8 至 1.2 的随机加速因子重采样音频。
  2. 环境噪声破坏:根据指定信噪比(SNR)添加加性噪声,并使用从真实声学测量中获得的房间冲激响应通过卷积引入混响。
  3. 时间与频率掩蔽:在时间和频率域中用零值随机替换连续片段。

引用信息

如需引用本数据集,请引用以下论文: H. Yu and Y. Li, "Infant Cry Detection In Noisy Environment Using Blueprint Separable Convolutions and Time-Frequency Recurrent Neural Network," 2025 IEEE International Workshop on Multimedia Signal Processing (MMSP), Beijing, China, 2025, pp. 1-6, doi: 10.1109/MMSP64401.2025.11324248.

相关链接

  • 代码仓库:https://github.com/fhfjsd1/ICD_MMSP
  • 论文 arXiv 版本:https://arxiv.org/abs/2508.19308
  • 论文 IEEE Xplore 版本:https://ieeexplore.ieee.org/document/11324248
搜集汇总
数据集介绍
infant-cry-detection 数据集图片
构建方式
该数据集专为嘈杂家庭环境下的婴儿哭声检测任务而构建。通过整合CryCeleb2023、EnesBabyCries1及2020年科大讯飞开发者大赛等多个公开数据集,选取13,330个婴儿哭声正样本;负样本则融合了VoxCeleb、ESC-50、Cat Meowing和DASEE数据集,涵盖语音、人类非语音、猫叫声、家庭噪音与静音五类共15,148个样本。所有音频经静音片段切除、分割或拼接后,统一重采样为长度5秒、单声道16kHz的WAV格式,以确保样本尺寸一致并完整捕获婴儿哭声周期。
特点
该数据集包含约39.6小时音频,划分为正负两类共28,479个样本,并预设五折交叉验证结构,便于模型评估与泛化性验证。负样本中特别纳入了猫叫声与各类家电、城市交通等家庭噪音,这些极易与婴儿哭声混淆的声响大大提升了分类任务的挑战性与鲁棒性。此外,数据集提供了房间冲激响应(RIR)及噪声文件以支持数据增强,可灵活合成不同混响和信噪比条件下的训练样本。
使用方法
使用时,用户可通过HuggingFace `datasets`库加载`infant-cry-detection`配置,自动获取组织好的音频路径与元数据。推荐的对数梅尔频谱图提取流程为:应用汉宁窗进行512点分帧,步长400;利用128个三角形滤波器组计算梅尔尺度STFT获取功率谱;经梅尔频带宽度归一化后取对数,生成128维特征。训练时,可在每次迭代中随机采用速度扰动、环境噪声破坏及时间-频率掩蔽三种增强策略,以增强模型对真实嘈杂场景的适应能力。
背景与挑战
背景概述
在智能家居与医疗监护领域,婴儿哭声的自动检测对于新生儿健康监测与父母辅助照护具有重要应用价值。然而,家庭环境中充斥着各种背景噪音与干扰声,使得传统的基于音频的婴儿哭闹检测面临严峻挑战。该数据集于2025年由H. Yu和Y. Li研究团队在IEEE MMSP会议上提出,旨在解决嘈杂家庭环境下的鲁棒性婴儿哭声检测问题。数据集整合了CryCeleb2023、EnesBabyCries1、科大讯飞2020开发者大赛等多个公开资源,涵盖13,330个正样本与约15,148个负样本,总时长约39.6小时,并采用五折交叉验证设计。这一工作通过构建高质量、多样化的音频集合,推动了鲁棒语音分析在医疗辅助与家庭监护领域的应用基础。
当前挑战
本数据集所应对的核心领域挑战在于:在家庭场景中,婴儿哭声信号常被语音、猫叫声、家用电器噪音、城市交通声乃至静音片段等严重干扰,这些声学干扰不仅降低特征区分度,还导致传统模型误判率居高不下。在数据集构建过程中,研究者需要应对以下具体挑战:首先,多源异构音频数据的分割与时长归一化问题,如何将来自不同数据集的不同长度音频统一为5秒单声道16kHz采样格式,并准确保留婴儿哭声的完整周期。其次,负样本的合理设计与类别平衡问题,包括需要纳入猫叫声这类易混淆信号以模拟真实干扰场景。此外,数据预处理中需要去除不含信息的静音段,并通过三种数据增强方法——速度扰动、环境噪声破坏(包括加性噪声与房间混响)、时间与频率掩蔽——来模拟真实环境中的各种变异。这些挑战要求在保持样本多样性的同时,确保模型能够从全局而非局部特征中学习鲁棒的判别能力,从而实现高精度的婴儿哭声检测。
常用场景
经典使用场景
在智能家居与婴儿监护领域,婴儿哭声检测是一项极具挑战性的声学分类任务。该数据集专为嘈杂家庭环境下的婴儿哭声识别而设计,包含约39.6小时的音频样本,涵盖正样本(婴儿哭声)与负样本(语音、家庭噪音、猫叫等易混淆声音)。数据经统一处理为16kHz单声道5秒WAV格式,并支持五折交叉验证,为深度神经网络模型提供了标准化、多样化的训练与评估基准。其经典使用场景包括:在真实家庭噪声背景下,利用对数梅尔频谱图作为输入特征,训练轻量级神经网络以实现高鲁棒性的婴儿哭声检测。
实际应用
在实际应用中,该数据集支撑了智能婴儿监护系统的核心算法开发,使设备能在电视声、厨房电器噪声或室外交通等复杂声学场景中精准识别婴儿哭声。例如,基于该数据集训练的模型可嵌入智能音箱、婴儿监视器或可穿戴设备,实现实时监测。此外,数据集对猫叫声等易混淆干扰的针对性设计,有效降低了家庭中宠物声引发的误检率。当前,该数据集的代码与预训练模型已开源,助力开发者快速部署至边缘计算平台,推动从实验室验证向消费级产品落地的转化。
衍生相关工作
围绕该数据集,衍生了一系列代表性研究工作。Yu等人提出了结合蓝图可分离卷积(Blueprint Separable Convolutions)与时频循环神经网络(TF-RNN)的轻量级架构,在IEEE MMSP 2025上发表了首个基于该数据集的基准论文,实现了在低计算量下的高检测精度。此外,数据集被用于评估多种数据增强策略的效能,如SpecAugment与RIR卷积混合方法的对比研究。其五折交叉验证设计也促进了噪声鲁棒性评估标准的建立,后续工作进一步探索了知识蒸馏与自监督学习范式在该任务中的迁移潜力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务