遇见数据集

vocal-bursts-clean

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

Vocal Bursts (Clean) 是一个大规模非语言声音爆发数据集,包含 2,285,651 个从自然表现性语音中裁剪出的孤立非语言爆发片段,总时长 284.77 小时,覆盖 68 个类别,数据大小约 20.7 GiB。每个样本包含一段 MP3 音频(160 kbps,单声道)和一个文本标签。该数据集是经过严格过滤的版本,剔除了分类器判定为“无爆发”的片段(50.41%)以及短于 250 毫秒的片段(7.36%),从原始 5,412,262 个检测中保留 42.23%。标签来自基于 VoiceCLAP 编码器和 MLP 分类器的 top-1 预测,而非人工标注。数据集按类别呈现长尾分布,前 5 个类别(如“Wistful Sigh”“Sharp Inhale”等)占总样本的 73.03%,仅有 27 个类别样本数超过 1000。已知限制包括:标签存在噪声(尤其是细粒度类别),建议聚合到粗粒度族级别;存在近重复类别名(如 Hiccup/Hiccups);未提供验证集划分,需基于样本键前缀分割以避免泄漏;领域为英语表现性语音,不直接迁移到对话或朗读语音。数据集以 WebDataset 格式存储,共 126 个分片,每个分片约 20,000 个样本。适用于音频分类、副语言研究等任务。

Vocal Bursts (Clean) is a large-scale dataset of non-verbal vocal bursts, containing 2,285,651 isolated non-verbal burst clips cropped from natural expressive speech, with a total duration of 284.77 hours, covering 68 categories, and a data size of approximately 20.7 GiB. Each sample consists of an MP3 audio file (160 kbps, mono) and a text label. This dataset is a strictly filtered version, removing clips classified as no burst by the classifier (50.41%) and clips shorter than 250 milliseconds (7.36%), retaining 42.23% of the original 5,412,262 detections. Labels are derived from top-1 predictions based on a VoiceCLAP encoder and MLP classifier, rather than human annotation. The dataset exhibits a long-tail distribution across categories, with the top 5 categories (e.g., Wistful Sigh, Sharp Inhale) accounting for 73.03% of total samples, and only 27 categories having more than 1,000 samples. Known limitations include: label noise (especially for fine-grained categories), suggesting aggregation to coarse-grained family levels; near-duplicate category names (e.g., Hiccup/Hiccups); no validation set split provided, requiring splitting based on sample key prefixes to avoid leakage; the domain is English expressive speech, not directly transferable to conversational or read speech. The dataset is stored in WebDataset format, with 126 shards, each containing approximately 20,000 samples. It is suitable for tasks such as audio classification and paralinguistic research.

提供机构:
LAION eV
创建时间:
2026-08-01
原始信息汇总

Vocal Bursts (Clean) 数据集详情

基本信息

  • 数据集名称:Vocal Bursts (Clean)
  • 许可证:Apache-2.0
  • 任务类型:音频分类(audio-classification)
  • 语言:英语
  • 数据集规模:1M~10M 样本
  • 标签格式:WebDataset

数据集内容

该数据集包含 2,285,651 个独立的非言语声音爆发片段(non-verbal vocal bursts),源自自然表达性语音,每个片段带有一个类别标签。数据集特性如下:

属性 数值
总时长 284.77 小时
类别数 68 类
平均时长 448 毫秒
最短时长 250 毫秒(构造上保证)
音频格式 MP3,160 kbps,单声道
数据大小 20.7 GiB
分片数 126 个分片(每片约 20,000 个样本)

数据列结构

数据仅包含两列:

列名 类型 内容
mp3 音频 声音爆发片段,160 kbps 单声道 MP3
txt 字符串 类别标签,如 Sharp Inhale

构建流程

  1. 检测:使用 CrisperWhisper v2.0 转录表达性语音,并标记非言语事件(如 [UH][laughter] 等),提供时间戳
  2. 切割:在标称边界 ±150 ms 范围内搜索窗口,将切割点放置在局部短时 RMS 最小值处(20 ms 窗口,5 ms 步进),编码为 160 kbps 单声道 MP3
  3. 分类:使用 laion/vocalburst-classifier-single 模型标记每个片段,该模型基于冻结的 laion/voiceclap-commercial 编码器(768 维)+ 3×1024 MLP,覆盖 83 个类别,取 Top-1 softmax
  4. 过滤:见下文说明

注意txt 中的标签是分类器的 Top-1 预测结果,不是 原始 ASR 标记,也 不是 人工标注。

过滤过程

5,412,262 个检测结果 出发:

步骤 丢弃数量 保留数量
输入 5,412,262
分类器判定"无声音爆发" 2,728,125 (50.41%) 2,684,137
短于 250 ms 398,486 (7.36%) 2,285,651
最终保留 2,285,651 (42.23%)

过滤原因说明

  • 无声音爆发过滤:ASR 模型标记的言语不流畅不等于存在可分类的声音爆发。超过半数的 CrisperWhisper 检测结果实际不含可分类的声音爆发(如低于底噪的呼吸声、爆破音、麦克风碰撞声或纯静音)
  • 分类体系修补:原始分类器训练时有 3 个 hand_and_body_sounds 家族类别(Hand Scratching HeadHand SlapsSlap Face)在生产环境中误报率过高,已被重新标记为 No burst 并排除出本数据集
  • 250 ms 时长下限:低于约四分之一秒的片段,编码器可用信息太少,Top-1 标签接近随机猜测

类别分布

  • 数据集呈现极端长尾分布
  • 前 5 个类别占所有样本的 73.03%
  • 仅有 27/68 个类别拥有 ≥1,000 个样本
  • 最常见的类别包括:
    • Wistful Sigh(21.07%)
    • Sharp Inhale(19.74%)
    • Nervous Gulp(16.06%)
    • Affirmative Grunt(8.16%)
    • Relief Sigh(8.00%)
  • 最稀有的类别(如 GrowlPleasure Moan 等)仅有 1 个样本,不适合单独用于训练

已知局限性

  1. 标签为模型预测而非真实标注:在留出干净单片段测试上,分类器宏平均 mAP 为 0.68(细粒度)/ 0.87(粗粒度家族级别),Top-1 精确率为 60%。家族内的细粒度标签应视为有噪声,按家族级别分组是更安全的目标
  2. 存在近重复类别名:如 Hiccup/HiccupsGulps/SwallowsClicks Tongue/Tongue ClickKissing Sounds/Kissing NoisesCough/Coughing,未做合并处理
  3. 未提供留出数据集划分:来自同一父片段的片段共享键前缀,随机划分会导致跨划分的声学泄漏,应基于键前缀进行划分
  4. 领域限制:数据来自表达性、表演风格的语音,以英语为主,类别先验可能不适用于会话或朗读语音
  5. 系统性偏差:源检测由 ASR 模型产生,ASR 未内联标记的事件会系统性欠代表

相关资源

引用

bibtex @misc{laion_vocal_bursts_clean, title = {Vocal Bursts (Clean): 2,285,651 labelled non-verbal vocal bursts}, author = {LAION}, year = {2026}, url = {https://huggingface.co/datasets/laion/vocal-bursts-clean} }

搜集汇总
数据集介绍
vocal-bursts-clean 数据集图片
构建方式
该数据集源自野外表达性语音,借助CrisperWhisper v2.0模型对语音中的非言语事件进行内联标记,获得时间戳。随后围绕标称边界在±150毫秒的搜索窗内,依据局部短时RMS最小值(20毫秒窗长,5毫秒帧移)精确切割,确保切割点不落入事件内部,并以160 kbps单声道MP3编码。每个切割片段经laion/vocalburst-classifier-single分类器(含冻结的voiceclap-commercial编码器与3×1024 MLP)赋予83类中的top-1标签。最终剔除分类器判定为“非爆发”的样本及短于250毫秒的片段,保留2,285,651个孤立非言语人声爆发。
使用方法
用户可通过HuggingFace datasets库以流式模式加载该数据集,或直接使用webdataset库读取tar分片。加载后,每条样本包含音频数组、采样率及文本标签。训练时需注意:应按父片段键前缀划分训练集与验证集,避免片段级声学泄漏;因标签为模型预测且细粒度类别噪声较高,建议聚合至家族层级作为目标。此外,由于样本分布长尾,稀有类别不宜单独训练,可视为完整性保留而非支持标签集。
背景与挑战
背景概述
非言语发声(如叹息、笑声、吸气)是人类情感交流与副语言信息传递的重要载体,然而长期以来,该领域缺乏大规模、细粒度标注的公开数据集。LAION于2026年发布的Vocal Bursts (Clean)数据集,从野外表达性语音中切分出2,285,651个孤立非言语发声片段,总时长284.77小时,涵盖68个类别,旨在推动音频分类与副语言学研究。该数据集由CrisperWhisper模型检测、基于RMS最小值的切割策略和专用分类器标注,并经严格过滤以确保标签可靠性。其庞大的规模与精细的类别划分为情感计算、人机交互及语音情感识别等领域提供了关键资源,有望促进非言语发声识别模型的泛化能力。
当前挑战
该数据集所应对的核心领域挑战在于非言语发声的类间相似性与类内变异,使得细粒度分类极易混淆。构建过程中,检测阶段面临ASR标记与真实发声事件的不匹配,导致超过半数检测被过滤;分类阶段受限于分类器在短时瞬态事件上的误判,尤以手部与身体声音类别为甚。数据集自身亦存在显著挑战:类别分布极度长尾,前五类占比逾七成,半数以上类别样本不足千例;标签源自模型预测而非人工标注,细粒度标签噪声显著;缺乏预置划分,需按父片段键前缀分割以避免数据泄露;领域局限于表达性、表演风格英语语音,跨域泛化能力有待验证。
常用场景
经典使用场景
在副语言信息处理与非言语发声研究领域,对孤立发声事件进行细粒度识别始终是一项基础而富有挑战的任务。vocal-bursts-clean数据集凭借逾二百二十八万条经清洗的非言语发声片段,以及涵盖叹息、吸气、吞咽、笑声等六十八个类别的单标签体系,为音频分类模型提供了规模可观的训练资源。其经典使用场景在于构建非言语发声分类器,借助WebDataset流式加载方式,研究者可在不占用过多存储资源的前提下开展端到端的音频分类训练,并利用类别家族分组策略缓解细粒度标签的噪声干扰,从而在粗粒度家族层面获得更为稳健的识别性能。
解决学术问题
该数据集的核心学术贡献在于回应了非言语发声研究中长期存在的标注资源匮乏与类别体系不统一问题。既往研究多依赖小规模、人工标注的语料,难以支撑深度模型对长尾分布的学习需求。此数据集通过自动检测、切割与分类流水线,将野外表达性语音中的非言语事件系统化地抽取并赋予统一分类标签,覆盖呼吸、喉音、笑声、反射动作等家族,为副语言声学特征建模、类别不平衡学习以及跨语料泛化研究提供了可复现的数据基础,推动了非言语发声识别从个案分析向大规模统计建模的范式转变。
实际应用
在实际应用层面,该数据集可服务于语音交互系统中副语言信息的感知与响应。例如,在智能客服或虚拟助手场景中,系统可借助基于该数据训练的分类器识别用户的叹息、笑声或吞咽声,进而推断其情绪状态或交互意图,优化对话策略。在心理健康监测领域,对叹息与吸气等发声模式的自动识别有助于辅助评估焦虑或压力水平。此外,该数据集亦可用于内容审核与多媒体检索,通过对非言语发声事件的自动标注提升音视频内容的可搜索性与可理解性。
数据集最近研究
最新研究方向
在副语言信息处理与情感计算日益交融的当下,非言语发声爆发(vocal bursts)因其跨越语言边界传递瞬时情感与生理状态的能力,正成为语音领域的前沿焦点。vocal-bursts-clean数据集以逾228万条经清洗的孤立发声样本、68类细粒度标签及284小时真实场景音频,为大规模副语言建模提供了关键资源,直接回应了现有语料在规模、标签可靠性及场景多样性上的结构性缺失。当前研究前沿聚焦于利用该数据训练鲁棒的发声分类器与自监督表征,探索其与情感维度(如唤醒度、效价)的映射关系,并借助voiceclap等音频编码器推动跨模态情感识别。该数据集的发布亦呼应了LAION社区对语音 taxonomy 标准化的持续投入,其长尾分布与模型标注特性为研究类别不平衡、标签噪声鲁棒学习及半监督方法提供了天然试验场,对构建更具情感感知能力的人机交互系统具有显著的推动意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务