遇见数据集

more-synthetic-vocalbursts-raw

收藏
Hugging Face2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

该数据集名为More Synthetic Vocal Bursts (Raw),是一个包含合成人声爆发音频样本的集合。这些样本由三种不同的文本到音频和TTS模型(DramaBox、Stable Audio 3 Small SFX、MOSS SoundEffect v2.0)生成,基于一个涵盖202种人声爆发类型的分类法。每个样本是短时(3-10秒)的非语音人声,如笑声、哭声、喘息声、叹息声、咆哮声等,通过描述爆发类型、性别和年龄组的文本提示生成。数据集总样本量超过4781个,其中DramaBox和SA3各2000个,MOSS为781个。所有输出还提供了经过NVIDIA RE-USE(9.6M参数语音增强模型)处理的增强版本。数据以WebDataset的.tar格式组织,每个分片包含.wav音频文件和对应的.json元数据文件。元数据包括样本ID、提示词、时长、性别、年龄组、人声爆发类型键和详细描述。样本覆盖10个人口统计组(男/女,从幼儿到中年)。人声爆发分类法包含23个类别,如笑声、哭泣、呼吸、惊讶、厌恶、疼痛、努力、沟通信号等,其中包含22种NSFW类型。数据集适用于文本到音频生成研究、语音合成、声音效果生成、音频分类和情感计算等任务。数据集采用CC-BY-4.0许可证。

The dataset is named More Synthetic Vocal Bursts (Raw), a collection of synthetic vocal burst audio samples. These samples are generated by three different text-to-audio and TTS models (DramaBox, Stable Audio 3 Small SFX, MOSS SoundEffect v2.0) based on a taxonomy covering 202 vocal burst types. Each sample is a short (3-10 seconds) non-speech vocalization, such as laughter, crying, gasps, sighs, growls, etc., generated through text prompts describing the burst type, gender, and age group. The total sample size exceeds 4781, with 2000 each from DramaBox and SA3, and 781 from MOSS. All outputs also include enhanced versions processed by NVIDIA RE-USE (a 9.6M-parameter speech enhancement model). The data is organized in WebDataset .tar format, with each shard containing .wav audio files and corresponding .json metadata files. Metadata includes sample ID, prompt, duration, gender, age group, vocal burst type key, and detailed description. Samples cover 10 demographic groups (male/female, from toddlers to middle-aged). The vocal burst taxonomy includes 23 categories, such as laughter, crying, breathing, surprise, disgust, pain, exertion, communication signals, etc., with 22 NSFW types included. The dataset is suitable for tasks like text-to-audio generation research, speech synthesis, sound effect generation, audio classification, and affective computing. It is licensed under CC-BY-4.0.

提供机构:
LAION eV
创建时间:
2026-06-02
原始信息汇总

数据集概述:More Synthetic Vocal Bursts (Raw)

这是一个合成声音爆发(Vocal Burst)音频数据集,包含使用多种文本到音频(TTS/Text-to-Audio)模型生成的、涵盖202种类别的声音样本,如笑声、哭声、喘息、叹息、怒吼等非言语发声。

  • 许可协议:CC-BY-4.0
  • 任务类别:文本到音频、音频分类
  • 标签:vocal-bursts, sound-effects, speech-synthesis, webdataset, synthetic-data
  • 样本数量:1000到10000之间

生成模型

数据集样本由三种不同模型生成,并提供了经NVIDIA RE-USE增强的版本:

模型 类型 样本数 采样率 备注
DramaBox (ResembleAI/Dramabox) TTS DiT 2000 44.1 kHz cfg=2.5, stg=1.5, 30步
Stable Audio 3 Small SFX (cocktailpeanut/stable-audio-3-small-sfx) 文本到音频 2000 44.1 kHz 8步, cfg_scale=1.0
MOSS SoundEffect v2 (OpenMOSS-Team/MOSS-SoundEffect-v2.0) 文本到音频 DiT 1.3B 781 48 kHz 100步, cfg_scale=4.0

所有输出均提供经NVIDIA RE-USE(9.6M参数语音增强模型)处理后的增强版本,分别存放在 *-reuse 目录中。

数据集结构

数据以WebDataset .tar 格式存储,每个分片包含成对的 .wav(音频)和 .json(元数据)文件。目录结构如下:

  • dramabox/ (2000样本,4分片)
  • sa3/ (2000样本,4分片)
  • moss/ (781样本,2分片)
  • dramabox-reuse/ (2000样本,4分片)
  • sa3-reuse/ (2000样本,4分片)
  • moss-reuse/ (781样本,2分片)
  • nsfw/ (每模型变体78个样本,含原始与增强版本)

元数据格式

每个 .json 文件包含以下字段:

  • id: 样本编号
  • prompt: 生成提示文本
  • duration_s: 音频时长(秒)
  • gender: 性别(male/female)
  • age_group: 年龄组(如 teenage_girl、young adult man 等)
  • vocal_burst_key: 声音爆发类型键(如 belly_laugh)
  • vocal_burst_description: 声音爆发描述

分类体系(Taxonomy)

共涵盖202种声音爆发类型,按类别组织,主要类别包括:

  • 笑声(8种):如 belly laugh, chuckle, giggle
  • 哭泣与痛苦(10种):如 sobbing, whimpering, wailing
  • 呼吸与叹息(11种):如 heavy panting, exasperated sigh
  • 惊讶与震惊(6种):如 startled yelp, dramatic gasp
  • 厌恶与不赞同(8种):如 retching, scoff, tsk
  • 疼痛与不适(8种):如 sharp yelp, prolonged groan
  • 努力与用力(8种):如 heavy lifting grunt, battle cry
  • 交流信号(11种):如 shush, psst, wolf whistle
  • 吃喝(6种):如 slurping, lip smacking
  • 睡眠与无意识(5种):如 snoring, sleep talking
  • 动物模仿(6种):如 growling, purring, hissing
  • 音乐与节奏(7种):如 humming, beatboxing
  • 紧张与焦虑(7种):如 nervous laughter, teeth chattering
  • 年龄相关(6种):如 baby cooing, elderly wheeze
  • 身体功能(9种):如 hiccup, sneeze, burp
  • 口哨(6种):如 casual whistle, wolf whistle
  • 口腔/口音(8种):如 tongue click, teeth sucking
  • 喉咙音(7种):如 throat clearing, gargling
  • 鼻音(5种):如 sniffling, snorting
  • 发声抽搐与反射(6种):如 hiccup, involuntary yelp
  • 温度与环境(4种):如 shivering chatter, heat exhaustion panting
  • 表达性感叹(7种):如 eureka exclamation, frustrated argh
  • NSFW(22种):成人内容相关亲密发声

SFW版本(180种,已移除NSFW)可在 Voice-Acting-Pipeline 仓库 中找到。

人口统计学分布

样本覆盖10个年龄/性别组:

  • 女性:toddler girl, pre-puberty girl, teenage girl, young adult woman, middle-aged woman
  • 男性:toddler boy, pre-puberty boy, teenage boy, young adult man, middle-aged man

使用示例(Python)

使用WebDataset加载数据,通过 soundfileio 解析音频与元数据:

import webdataset as wds import soundfile as sf import io

dataset = wds.WebDataset("dramabox/shard-{0000..0003}.tar") for sample in dataset: audio_bytes = sample["wav"] metadata = json.loads(sample["json"]) audio, sr = sf.read(io.BytesIO(audio_bytes)) print(f"{metadata[vocal_burst_key]} - {metadata[gender]} - {sr}Hz - {len(audio)/sr:.1f}s")

相关资源

搜集汇总
数据集介绍
more-synthetic-vocalbursts-raw 数据集图片
构建方式
该数据集通过文本到音频与文本到语音模型,从涵盖202种发声类型的分类体系中生成非语言发声样本。具体利用DramaBox TTS DiT、Stable Audio 3 Small SFX及MOSS SoundEffect v2.0三种模型,分别产出2000、2000及781条长度为3至10秒的音频,并辅以指示性别与年龄组的文本提示。所有输出还经由NVIDIA RE-USE增强模型处理,形成原始与增强两个版本。数据以WebDataset的.tar格式存储,每个分片包含成对的.wav音频与.json元数据文件,元数据记录提示词、时长、性别、年龄组及发声类型键值等信息。
特点
该数据集涵盖202种发声类型,按情感与生理类别组织,包括笑声、哭泣、喘息、惊讶、厌恶、疼痛、用力、交流信号、进食、睡眠、动物模仿、音乐节奏、紧张、特定年龄、身体功能、口哨、口腔声音、喉咙声音、鼻音、发声抽搐、温度环境及表情感叹等,其中NSFW类别有22种。音频样本跨越10个年龄与性别组,从幼儿到中年男女。三种生成模型各具特性,且所有样本均提供经RE-USE增强的版本,便于对比原始与增强效果,为情感计算、声音合成及音频分类研究提供丰富的多模态资源。
使用方法
数据集的典型使用通过WebDataset库实现,以Python代码加载.tar分片文件。用户可迭代数据,从每个样本中提取.wav音频字节与.json元数据,利用soundfile等库将音频解码为数组,结合采样率进行后续处理。示例代码展示了如何遍历DramaBox分片,解析发声类型、性别及时长信息。此外,研究者可灵活访问其他模型子集或增强版本,通过调整分片路径探索不同生成器的差异,适用于文本到音频模型的训练评估、发声分类任务或多模态情感分析等场景。
背景与挑战
背景概述
在非语言发声(vocal bursts)研究领域,诸如笑声、哭泣、叹息等情感化声音信号是人机交互与情感计算中的关键要素。然而,现有数据集多集中于语言语音或有限的情感类别,缺乏细粒度、高多样性的非语言音频资源。为此,LAION研究团队于2024年发布了More Synthetic Vocal Bursts (Raw)数据集,利用DramaBox、Stable Audio 3 Small SFX及MOSS SoundEffect v2.0等前沿文本到音频与TTS模型,基于涵盖202种发声类型的分类体系,生成了涵盖笑声、哭泣、喘气、叹息等丰富类别的合成音频样本。该数据集包含近4800条样本,覆盖10个年龄与性别组,并经过NVIDIA RE-USE增强处理,为非语言情感识别、音频合成及语音交互研究提供了系统化、可复现的基准资源,推动了情感计算与数据驱动语音合成领域的边界。
当前挑战
该数据集所解决的领域核心挑战在于,传统情感音频研究长期受限于真实非语言发声数据获取成本高、类别稀疏且标注不一致的困境。数据集构建过程中也面临多重技术难题:首先,需确保合成音频在音质和情感表现力上逼近真实发声,而多模型生成的样本在采样率(44.1kHz与48kHz)、生成步长、声学质量上存在异质性,需通过RE-USE增强实现统一性;其次,202种发声类型的分类体系需兼顾文化普适性与粒度平衡,NSFW类别的加入则需在伦理合规与数据完整性间权衡;此外,元数据中性别与年龄分组的精细控制,要求模型在保持类别区分度的同时避免人口统计学偏差。这些挑战的解决不仅提升了数据集的可信度,也为未来合成情感音频的质量评估与标准化提供了方法论参考。
常用场景
经典使用场景
在语音合成与情感计算领域,该数据集为生成式模型提供了丰富的非言语发声训练素材。经典使用场景聚焦于利用其覆盖202种发声类型的精细分类体系,训练文本到音频或文本到语音模型,以生成包含笑声、哭泣、叹息等丰富情感色彩的拟人化声音效果。研究人员可依据元数据中的年龄、性别及发声关键词进行精准采样,从而提升模型在情感表达上的细腻度与多样性。
衍生相关工作
该数据集催生了多项衍生研究工作,包括发声分类器训练、多模态情感生成及语音增强算法的评估。基于其丰富的元数据结构,研究者构建了针对笑声、哽咽等特定类别的检测模型;同时,利用DramaBox、Stable Audio等生成模型输出的对比样本,探索了不同采样率与增强策略对合成自然度的影响。此外,其NSFW子集为非敏感场景下的安全过滤算法提供了基准测试数据。
数据集最近研究
最新研究方向
该数据集聚焦于合成式人声爆发音(vocal bursts)的生成与分类研究,涵盖笑声、哭泣、叹息等202种非言语发声类型,横跨文本到音频合成(如DramaBox、Stable Audio 3 Small SFX、MOSS SoundEffect v2)与语音增强技术(NVIDIA RE-USE)。当前前沿方向在于利用扩散变换器(DiT)与大规模声效模型,系统性地模拟不同年龄、性别群体的情感化发声,并结合NSFW子集探索成人内容在音频合成中的边界。这一工作为人机交互中的情感计算、虚拟角色配音、以及多模态情感数据集构建提供了丰富的基准资源,其细粒度分类与人口统计特征设计尤为契合社交媒体、游戏及辅助技术中对非言语声音多样性的迫切需求。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务