遇见数据集

vocal-bursts-per-class

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集名为“Vocal bursts, per class”,是一个专注于非言语声音爆发(vocal bursts)的音频数据集,包含 45 个类别,总计 33,991 个音频片段。数据集旨在为文本转语音(TTS)和音频分类任务提供资源,特别是处理诸如笑声、叹气、咳嗽、尖叫等非言语声音。数据来源包括两部分:真实录音(real,共 3,314 个片段)和由 DramaBox TTS 系统生成的合成音频(dramabox,共 30,677 个片段)。每个音频片段都附带由 Gemini 模型生成的 burst 标注,包含时间戳、1-3 个按可能性排序的标签、置信度和自由文本描述,以及一个 rank 字段,指示该类别在标注中的排名(0 表示标注器的首选,1 表示提示与标注的联合声明,-1 表示真实录音)。数据集以 WebDataset 格式组织,每个配置对应一个类别,每个样本包含一个 MP3 文件(合成)或 OGG 文件(真实)以及一个 JSON 文件,元数据包括类别、来源、rank、burst 起止时间、标签、标注原始信息等。需要注意的是,所有标注均为模型输出,未经人工审核,且合成部分的许可证状态未评估,用户需谨慎使用。

This dataset, named Vocal bursts, per class, is an audio dataset focusing on non-verbal vocal bursts, containing 45 classes and a total of 33,991 audio clips. It is designed to provide resources for text-to-speech (TTS) and audio classification tasks, particularly for processing non-verbal sounds such as laughter, sighs, coughs, screams, etc. The data sources consist of two parts: real recordings (real, 3,314 clips) and synthetic audio generated by the DramaBox TTS system (dramabox, 30,677 clips). Each audio clip is accompanied by burst annotations generated by the Gemini model, including timestamps, 1-3 labels sorted by likelihood, confidence scores, free-text descriptions, and a rank field indicating the categorys ranking in the annotation (0 for annotators first choice, 1 for joint declaration of prompt and annotation, -1 for real recordings). The dataset is organized in WebDataset format, with each configuration corresponding to a class, and each sample containing an MP3 file (synthetic) or OGG file (real) along with a JSON file. Metadata includes class, source, rank, burst start and end times, labels, raw annotation information, etc. Note that all annotations are model outputs and have not been manually reviewed, and the license status of the synthetic part has not been evaluated; users should use with caution.

提供机构:
LAION eV
创建时间:
2026-09-04
原始信息汇总

数据集概述:laion/vocal-bursts-per-class

  • 数据集地址:https://huggingface.co/datasets/laion/vocal-bursts-per-class
  • 简介:该数据集包含33,991个音频片段,覆盖45个“人声突发”(vocal bursts)类别,如笑声、叹息、咳嗽、呼吸声等非语言发声。每个类别作为一个可独立加载的配置(config)提供。所有片段均携带由Gemini模型生成的标注,包括时间跨度、1-3个按可能性排序的标签、置信度及自由文本描述。
  • 主要用途:可支持文本转语音(text-to-speech)和音频分类(audio-classification)任务。

数据构成

  • 总数:33,991个片段,45个类别。
  • 两大组成部分
    • 真实音频(real):共3,314个片段,来自真实录制或真实说话人衍生音频,源自第58节发布的语料库。
    • 合成音频(Dramabox):共30,677个片段,由DramaBox TTS根据英文提示生成的合成音频,并由同一标注模型进行标注。
  • 来源分离:每个样本的元数据中都有 source 字段(“real”或“dramabox”),便于过滤。

数据格式与加载

  • 格式:WebDataset格式,按类别存放为tar文件(data/<类别>/<类别>-*.tar)。
  • 每个样本包含
    • 音频文件:DramaBox部分为mp3格式(160 kb/s 单声道 48 kHz,未重新编码);真实部分为ogg格式(48 kHz 单声道 OGG/Vorbis)。
    • 一个JSON文件,包含 classsourcerankqualified_byburst_startsburst_endsburst_labelsburst_labels_normgemini_eventsdur_s 等元数据,以及特定于各半部分的字段(如DramaBox的提示类别、性别、年龄段;真实部分的来源、验证级别等)。
  • 加载示例: python from datasets import load_dataset ds = load_dataset("laion/vocal-bursts-per-class", "scream")

重要提示

  • 无人工审核:所有标签均由AI模型生成,未经人工试听验证,不构成“真实标签”。
  • 许可证未评估:DramaBox合成部分的LTX-2社区许可证未评估,用户需谨慎使用;真实部分的许可证较清晰,遵循特定数据集的条款。
  • rank字段含义:并不代表质量,而是对标签源头的说明——rank 0代表标注者的首选标签;rank 1代表标注者的第二选择标签(提示词与标注者的联合声明);rank -1代表真实音频的标注。
  • 子集性质:本发布是一个子集,某些真实音频片段因不在发布许可范围内被剔除。

类别分布

数据集中每个类别的大小差异显著。部分类别完全由真实音频构成,例如 breathy_gigglechuckleexhausted_groan(无DramaBox数据);大多数类别以DramaBox合成音频为主,如 cacklechildlike_gigglecoughclears_throat 等。类别涵盖各种笑声(如giggle、chuckle、cackle、guffaw)、呼吸声(如deep_breath、panting、gasp)、叹息声(如sigh、groan)、及其他非语言发声(如咳嗽、打嗝、吞咽、哼哼、尖叫等)。

搜集汇总
数据集介绍
vocal-bursts-per-class 数据集图片
构建方式
该数据集名为vocal-bursts-per-class,由LAION团队构建,旨在提供丰富的非语言发声(vocal bursts)分类资源。其构建方式融合了真实录音与合成音频:真实部分源自经过标注的语料库,而合成部分则通过DramaBox TTS引擎依据英文提示生成,共计33,991个音频片段,覆盖45个类别。每个类别均独立配置,便于按需加载。所有音频均附带由Gemini模型生成的详细标注,包括时间跨度、标签及置信度,并依据其来源与排名进行区分。
特点
该数据集的核心特点在于其规模与细致标注的结合。合成片段占比超过九成,缓解了某些类别真实样本稀缺的问题,如'breathy_giggle'等纯真实类别则提供了无合成干预的基准。每个片段都携带'rank'字段,以区分标注者首选与次选标签,这反映了发声家族内的原型偏向。此外,所有标注均由模型自动完成,未经人工审核,因此数据中的每一条标签都体现了模型间的共识,而非绝对真实。
使用方法
使用该数据集时,研究者可通过HuggingFace的load_dataset函数按类别加载数据,例如'load_dataset("laion/vocal-bursts-per-class", "scream")'。每个样本含MP3或OGG音频及对应的JSON标注文件,JSON中包含了分类、来源、排名及突发事件的起点与终点等关键信息。鉴于合成部分的许可证未经评估,用户可依据'source'字段进行过滤,以仅使用真实数据。该数据集适用于文本转语音、音频分类及副语言学研究,特别适合那些关注非语言发声识别与生成的场景。
背景与挑战
背景概述
vocal-bursts-per-class数据集由LAION团队创建,旨在系统性地收集和标注非语言发声(如笑声、叹息、咳嗽等)的音频片段,以支持情感计算、语音合成和副语言学研究。该数据集于近年发布,包含33,991个音频片段,覆盖45种不同的发声类别,融合了真实录音与合成音频,并采用自动化模型进行标注。其核心研究问题在于如何为罕见或细粒度的发声类别提供充足且可用的训练数据,从而推动语音识别和生成模型对非言语信号的建模能力。该数据集的发布为探索非语言发声的声学特征、情感表达以及跨文化差异提供了宝贵资源,对推动人机交互中自然情感表达的研究具有潜在影响力。
当前挑战
该领域长期面临真实发声数据稀缺、类别不平衡和标注成本高昂等挑战,尤其对于如'尖叫'这类突发性强且语义模糊的发声,准确识别与分类尤为困难。在构建过程中,数据集引入了合成数据以扩充样本,但合成音频与真实音频之间存在领域间隙,且所有标注均依赖单一模型的自动化判断,缺乏人工审核,导致标签可靠性存疑。此外,部分类别(如'breathy_giggle')仅包含真实录音,样本量极小;而合成数据部分的版权许可状态未经评估,限制了其合法使用范围。数据中还需区分不同置信度的标注等级,以应对模型对原型发声的偏好偏差,确保数据集的科学有效性和实用性。
常用场景
经典使用场景
该数据集聚焦于人类非语言发声(vocal bursts)的精细分类与合成,涵盖了从咳嗽、笑声到叹息等45个类别,共计33,991个音频片段。其经典使用场景在于为语音情感识别与副语言学研究提供大规模、多类别的基准数据集。研究者可借助此数据集训练和评估音频分类模型,以识别各类非语言声音事件,进而推动人机交互中更为细腻的情感理解与表达。
解决学术问题
该数据集直面非语言发声在真实场景中数量稀缺与标注不一致的学术难题。通过结合真实录音与合成音频,并引入模型间标注一致性考量(如rank机制),它缓解了单一标注来源的偏差问题。此设计为副语言学研究提供了可复现的实验基础,有助于厘清发声类别边界模糊、原型效应等理论问题,推动对语音中情感与意图传递机制的深入探究。
衍生相关工作
该数据集的衍生研究已涉及多个前沿方向。其一,利用其分类标签探索模型对非语言声的感知边界,启发更鲁棒的情感识别架构。其二,该数据集的构建方式(如真实与合成数据的混合、模型自动标注流程)为后续多模态数据集提供了范式参考。另外,针对发声原型的探讨亦促进了对语音事件标注理论和评估方法的再思考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务