遇见数据集

hoyyu1/infant-cry-detection

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

本数据集专为嘈杂家庭环境下的婴儿哭声检测而设计,旨在提供一个多样化、具代表性且具备鲁棒性的音频样本集合,用于训练和评估机器学习模型,尤其是深度神经网络。数据集通过整合多个公开数据集构建,以确保样本的多样性和代表性。它包含约39.6小时的音频记录,划分为两类:婴儿哭声(正样本)和非哭声(负样本),并采用五折平衡划分供交叉验证。正样本数据来自CryCeleb2023、EnesBabyCries1和2020科大讯飞A.I.开发者大赛;负样本数据整合了VoxCeleb、ESC 50、Cat Meowing和DASEE数据集,并细分为语音、人类非语音、猫叫声、家庭噪音和静音五个子类。数据预处理包括移除静音片段、统一音频样本长度(5秒)和转换为单声道16 kHz WAV PCM格式。数据增强方法包括速度扰动、环境噪声破坏以及时间与频率掩蔽。数据集总计包含13,330个哭声样本和各类非哭声样本,具体数量为:语音4,963、家庭噪音4,506、人类非语音2,076、猫叫声1,953、静音1,650。

This dataset is designed for infant cry detection in noisy household environments. It aims to provide a diverse, representative, and robust collection of audio samples for training and evaluating machine learning models, particularly deep neural networks. The dataset was constructed by integrating multiple public datasets to ensure diversity and representativeness. It contains approximately 39.6 hours of audio recordings, partitioned into two classes: cry (positive) and non-cry (negative), with 5 balanced folds for cross-validation. The cry data subset consists of audio recordings from CryCeleb2023, EnesBabyCries1, and the 2020 iFLYTEK A.I. Developer Competition. The non-cry data integrates VoxCeleb, ESC 50, Cat Meowing, and DASEE datasets, and is divided into five subclasses: Speech, Human non-speech, Cat Meows, Household noise, and Silences. Data preprocessing includes removing silent segments, standardizing audio sample length to 5 seconds, and converting to single-channel 16 kHz WAV PCM format. Data augmentation methods include speed perturbation, environmental corruption, and time and frequency masking. The dataset consists of 13,330 cry samples and various non-cry samples, with specific counts: Speech 4,963, Household noise 4,506, Human non-speech 2,076, Cat Meows 1,953, and Silences 1,650.

提供机构:
hoyyu1
搜集汇总
数据集介绍
构建方式
本数据集专为嘈杂家庭环境下的婴儿哭声检测任务而构建,通过整合CryCeleb2023、EnesBabyCries1及2020科大讯飞AI开发者大赛中的哭声样本,以及VoxCeleb、ESC 50、Cat Meowing和DASEE等非哭声数据集,确保了样本的多样性和代表性。所有音频经过去除静音片段、统一分割或拼接为5秒长度,并重采样至单声道16 kHz WAV PCM格式。数据增强方面,随机应用速度扰动、环境噪声破坏(含加性噪声与房间冲激响应模拟的混响)以及时间和频率掩蔽三种策略,以提升模型的鲁棒性。
特点
该数据集包含约39.6小时音频,正样本(婴儿哭声)13,330个,负样本(非哭声)涵盖语音、人类非语音、猫叫声、家庭噪音和静音五个子类,共计15,148个。特别纳入了猫叫声等易混淆声音及多种家庭噪音,增强了分类挑战性。数据集被划分为五折用于交叉验证,支持鲁棒的模型评估。所有样本统一为5秒长度,可捕获完整哭声周期。其构建注重真实场景的噪声和混响模拟,使模型能适应多样化的家居环境干扰。
使用方法
数据集以目录结构组织,音频按正负样本分存于audio/positive与audio/negative文件夹,元数据及标签信息存于metadata/all28479.csv中,另含噪声文件noise.csv和房间冲激响应文件rir/。推荐的数据处理流程为:对样本应用512点汉宁窗、步长400进行分帧,通过128个滤波器组计算梅尔尺度STFT,经区域归一化后得到128维对数梅尔频谱图作为模型输入。用户可使用代码仓库https://github.com/fhfjsd1/ICD_MMSP中的预处理和加载脚本,直接读取CSV文件获取标签并加载对应音频文件进行训练和评估。
背景与挑战
背景概述
婴儿哭声是评估婴幼儿健康状态与情感需求的关键生物声学信号,然而在嘈杂的家庭环境中实现精准的哭声检测仍是一项极具挑战性的任务。2025年,研究者H. Yu与Y. Li在IEEE MMSP会议上提出了infant-cry-detection数据集,该数据集由多个公开音频资源整合而成,涵盖了来自CryCeleb2023、科大讯飞开发者大赛等来源的哭声样本,以及VoxCeleb、ESC 50等非哭声样本,总计约39.6小时的音频数据。通过精心划分为哭声与非哭声两类并采用五折交叉验证设计,该数据集为训练鲁棒的深度神经网络提供了丰富的多样性。其发布不仅弥补了家庭场景下婴儿哭声检测专用数据集的空白,更推动了音频分类技术在医疗监护与智能家居领域的应用,对提升婴幼儿看护自动化水平具有重要影响。
当前挑战
该数据集面临的挑战主要体现在两个层面。首先,家庭环境中的婴儿哭声检测需解决复杂的声学干扰问题,包括来自家用电器、宠物叫声(如猫叫)及人类语音的混淆,尤其是猫叫声与哭声在时频特征上高度相似,容易导致模型误判。其次,数据集构建过程中需要克服多源异构音频的标准化难题,包括统一采样率至16 kHz、去除静音片段并将样本裁剪为固定5秒时长,同时通过速度扰动、环境噪声注入及混响模拟等增强手段模拟真实声场,还需生成对数梅尔频谱图作为输入特征,这对保证跨域泛化能力提出了严峻挑战。
常用场景
经典使用场景
在智能家居与婴儿监护领域,精准识别婴儿哭声是提升设备智能化水平的关键挑战。infant-cry-detection数据集专为嘈杂家庭环境下的婴儿哭声检测而设计,整合了来自CryCeleb2023、科大讯飞等多源公开数据,并精心纳入猫叫声、家庭电器噪音等极易混淆的负样本。该数据集提供约39.6小时、固定5秒长度的双声道音频样本,并预划分为5折交叉验证结构,特别适用于训练和评估深度神经网络在复杂声学场景下的鲁棒性。其经典使用场景聚焦于构建轻量级、高精度的婴儿哭声检测模型,为后续的模型性能基准测试提供了标准化的数据基础。
衍生相关工作
该数据集衍生了一系列经典研究工作,其中最具代表性的是H. Yu和Y. Li在IEEE MMSP 2025上发表的论文,该工作提出了结合Blueprint可分离卷积与时频循环神经网络的轻量级检测架构,在嘈杂环境下展现了优越的噪声鲁棒性。该研究通过速度扰动、环境噪声破坏及时间-频率掩蔽三重数据增强策略,有效提升了模型对多径混响和各类家庭噪音的适应能力。此外,该数据集的出现激发了针对跨域泛化、少样本学习及模型压缩等方向的研究,例如探索将房间冲激响应(RIR)建模融入特征预训练,以及利用自监督学习从大规模未标注音频中提取婴儿哭声的通用表征,推动了婴儿声学分析领域的前沿发展。
数据集最近研究
最新研究方向
面向嘈杂家庭环境下的轻量化婴儿哭声检测,该数据集整合了CryCeleb2023、科大讯飞等多源数据,通过速度扰动、环境噪声破坏及时间频率掩蔽等增强策略构建了包含13,330个正样本和15,149个负样本的鲁棒音频集合。前沿研究聚焦于结合蓝图可分离卷积与时频循环神经网络实现自适应降噪,在保证模型轻量化的同时提升对猫叫声、家电噪音等混淆声源的辨别能力。该数据集提供五折交叉验证协议及房间冲激响应数据,为开发面向智能婴儿监护设备的高抗噪检测系统奠定了重要基准,尤其在家庭IoT场景下的实时哭声响应中具有关键应用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务