遇见数据集

vocal-burst-classification-v2

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

Vocal Burst Classification V2(简称V2)是由LAION发布的数据集,用于训练Vocal Burst Classifier V2模型。该数据集是一个单标签分类数据集,包含83个类别(82种非语音人声爆发类别,加上一个“no_burst”类别,索引为82)。数据来源包括两个部分:一是通过合成文本到音频模型(如DramaBox)生成的音频片段,二是来自先前版本的vocal-bursts-clean音频。标签由两个标注器产生:Gemini Flash 2.5对improved_synthetic_vocal_burts片段进行验证,Gemini 3.6 Flash对vocal-bursts-clean进行盲重标注。数据集包含多个子集:train_existing.npz(70176个样本,768维VoiceCLAP嵌入)、train_gemini.npz(25245个样本,768维嵌入,包含src字段标识来源)、val.npz(验证集嵌入,包含pure和composite两种类型),以及clean_audio配置(18329个原始MP3音频,字段包括id、audio、gemini_36_label、original_noisy_label和source)。此外还提供了类列表(classes.json)、类描述(class_descriptions.json)、源计数(source_counts.json)以及训练、推理和特征提取脚本。注意,手/身体冲击类(如Finger Snaps、Hand Scratching Head等)虽保留在类列表中用于向后兼容,但已被折叠到no_burst类别,训练样本中计数为0。该数据集适用于音频分类任务,特别是人声爆发检测与分类。

Vocal Burst Classification V2 (V2) is a dataset released by LAION for training the Vocal Burst Classifier V2 model. It is a single-label classification dataset with 83 categories (82 non-speech vocal burst categories plus a no_burst category with index 82). The data sources include two parts: audio clips generated by synthetic text-to-audio models (such as DramaBox) and audio from the previous version of vocal-bursts-clean. Labels are produced by two annotators: Gemini Flash 2.5 validates the improved_synthetic_vocal_bursts clips, and Gemini 3.6 Flash performs blind re-labeling on vocal-bursts-clean. The dataset contains multiple subsets: train_existing.npz (70,176 samples with 768-dimensional VoiceCLAP embeddings), train_gemini.npz (25,245 samples with 768-dimensional embeddings and a src field indicating source), val.npz (validation set embeddings with pure and composite types), and a clean_audio configuration (18,329 original MP3 audios with fields including id, audio, gemini_36_label, original_noisy_label, and source). Additionally, class list (classes.json), class descriptions (class_descriptions.json), source counts (source_counts.json), and training, inference, and feature extraction scripts are provided. Note that hand/body impact classes (e.g., Finger Snaps, Hand Scratching Head) are retained in the class list for backward compatibility but have been folded into the no_burst category, with zero counts in training samples. This dataset is suitable for audio classification tasks, especially vocal burst detection and classification.

提供机构:
LAION eV
创建时间:
2026-08-01
原始信息汇总

Vocal Burst Classification V2 数据集概述

基本信息

  • 数据集名称laion/vocal-burst-classification-v2
  • 许可证:Apache-2.0
  • 任务类型:音频分类(audio-classification)
  • 配置:仅包含 clean_audio 配置,分为训练集(18,329 个样本)
  • 数据集大小:约 178.9 MB

数据集内容

该数据集是 Vocal Burst Classifier V2 的训练语料库,包含:

  • 83 类发声爆发分类(82 类非语音人类发声 + no_burst 类别)
  • 预计算的 VoiceCLAP-commercial 嵌入特征(768 维)
  • 原始音频文件vocal-bursts-clean,MP3 格式)

数据集结构

主要包含以下文件:

  • embeddings/train_existing.npz — 先前发布的训练嵌入特征
  • embeddings/train_gemini.npz — 新的 V2 Gemini 训练集(25,245 个样本)
  • embeddings/val.npz — 官方验证集嵌入特征
  • clean_audio 配置 — 18,329 个原始 MP3 音频文件
  • classes.jsonclass_descriptions.jsonsource_counts.json
  • inference.pytrain.pyextract_features.py

数据字段

每个样本包含:

  • id:字符串标识符
  • audio:音频数据
  • gemini_36_label:Gemini 3.6 标注的标签
  • original_noisy_label:原始标注(含噪声)
  • source:数据来源

标注来源

  1. Gemini Flash 2.5 — 验证改进的合成声音片段(src == "improved"
  2. Gemini 3.6 Flash — 对 vocal-bursts-clean 进行盲重新标注(src == "clean"),作为训练目标

关键特点

  • 原始标注噪声较大,Gemini 3.6 与原始标签一致率仅为 5.8%
  • 手部/身体冲击类声音(如手指弹响、拍手等)已合并到 no_burst 类别
  • 训练集中各类别样本数从 0 到 1,608 不等,分布不均衡

模型性能

模型 验证集准确率 纯集(1170) 混合集(770)
V2 混合 emb-MLP(发布版本) 58.1% 70.4% 39.4%
先前研究:混合 emb-MLP 58.61% 72.05% 38.18%

类别分布

类别涵盖笑声、哭泣、呼吸、叹气、喘息、呻吟、咕哝、喉咙声、哼唱、咳嗽、口哨、口唇声、舌头点击、饮食声、尖叫等 16 大类,各类别样本数量从 0 到 1,608 不等。

搜集汇总
数据集介绍
vocal-burst-classification-v2 数据集图片
构建方式
该数据集是针对非语言人声爆发音分类任务精心构建的V2版本训练语料库,其构建过程融合了先进合成技术与多阶段人工校验。具体而言,研究者利用DramaBox等文本到音频合成模型生成大量原始音频片段,随后通过Gemini Flash 2.5与Gemini 3.6 Flash两代大模型进行双重标注:前者对改进合成集进行验证性标注,后者对原始清洁音频执行盲审重标注,以纠正原始标签中高达94.2%的噪声。对于手部与身体撞击类非声音样本,则被严格剔除并归入'no_burst'类别,确保数据纯净性。最终形成覆盖83类精细标签(含82类真实人声爆发音及'no_burst')的单标签数据集,并额外提供预计算的VoiceCLAP嵌入表示,以支持多场景下游任务。
特点
该数据集的核心特色在于其高精度、多维度的标签体系与丰富的辅助资源。数据集覆盖了从笑声(如Breathy Giggle)、哭泣(如Convulsive Sob)、呼吸(如Deep Breath)到口部动作(如Kissing Sounds)等9大类非语言声音,每个类别均配有详尽的语义描述。尤为独特的是,数据集同时提供了原始音频(mp3格式)与768维预计算嵌入向量,便于研究者灵活选择输入形式。此外,数据集的标注来源多样,整合了Gemini Flash 2.5与Gemini 3.6 Flash的标注结果,并明确区分了'clean'与'improved'两种来源,为噪声鲁棒性研究提供了天然实验场。值得注意的是,数据集包含的三个子集(现有训练集、新增Gemini集、验证集)在类别与样本分布上各有侧重,验证集进一步细分为纯样本与复合样本,全面评估模型泛化能力。
使用方法
数据集的使用灵活便捷,支持多种加载与训练流程。研究者可直接通过HuggingFace的load_dataset接口获取原始音频数据,或使用随附的extract_features.py脚本自行提取VoiceCLAP特征。为加速开发,数据集提供了开箱即用的训练脚本train.py,该脚本会自动拼接现有训练集与新增Gemini集的嵌入向量,训练多层感知机分类头,并基于标准验证集评估性能。推理阶段,用户可调用inference.py中的VocalBurstClassifier类,只需输入音频文件路径,即可预测最可能的类别及置信度,并输出Top-5候选结果。对于需要自定义数据划分的研究,数据集的sharded parquet格式和丰富的JSON辅助文件(如classes.json、class_descriptions.json)为细致的类别分析提供了便利。
背景与挑战
背景概述
该数据集由LAION社区于近期发布,旨在推动非言语人类发声(vocal burst)自动识别这一前沿音频理解课题。研究团队基于83类细粒度发声分类体系,构建了包含逾2.5万条样本的V2训练语料,并通过多源合成音频生成与多阶段标注流程,探索大规模合成数据在情感与副语言声学建模中的潜力。该工作不仅为语音交互、情感计算及多媒体内容理解提供了标准化的基准资源,更以其创新的数据清洗与验证策略,为后续研究树立了可复现的范式。
当前挑战
该领域面临的核心挑战在于非言语发声类内差异显著、类间界限模糊,且自然采集成本高昂,导致传统监督学习性能受限。构建过程中,团队需应对合成音频质量参差不齐、原始标注噪声严重(Gemini 3.6盲注一致率仅5.8%)等问题,同时剔除手部/身体冲击声等非发声类别,并通过嵌入特征对比验证了轻量表征的性价比,最终在保留类别兼容性的前提下实现了数据质量与模型性能的平衡。
常用场景
经典使用场景
在音频内容理解与情感计算领域,vocal-burst-classification-v2数据集为研究者提供了一个全面且细粒度的非言语人声爆发音分类基准。其83类分类体系覆盖笑、哭、叹息、喘息、呻吟等丰富类别,并附带预计算的VoiceCLAP嵌入向量,便于直接用于训练与评估。该数据集常用于开发高精度的人声爆发音检测与分类模型,尤其在多模态学习、语音情感识别及人机交互系统中,作为核心的音频特征提取与语义理解工具。
衍生相关工作
该数据集衍生了一系列经典工作,包括基于VoiceCLAP嵌入的轻量级MLP分类器,其以紧凑的768维特征达到高效准确识别;后续研究探索了更大规模嵌入拼接、数据增强及半监督学习策略,以提升在复杂噪声环境下的鲁棒性。此外,该数据集推动了跨语料库泛化研究,为多模态大模型在非言语声音理解上的能力评估提供了新基准,并启发了将合成音频与真实录音结合的训练范式,促进了相关方法在情感识别、语音事件检测等领域的应用拓展。
数据集最近研究
最新研究方向
该数据集聚焦于非言语人类发声的精细分类与合成音频的质量提升,反映了当前语音合成与情感计算领域对非语言声学信号的高度关注。V2版本通过整合多源合成数据,并引入Gemini系列大模型进行自动标注与校验,显著提升了标签的准确度与数据集的规模,为构建更鲁棒的发声事件检测系统提供了坚实基础。其前沿方向包括利用多模态嵌入表征进行高效迁移学习,以及探索合成数据在少样本场景下的泛化能力,这对于人机交互、情感识别及虚拟角色的自然表现力具有重要推动意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务