遇见数据集

dramabox-burst-audio

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

DramaBox vocal-burst scenes 是一个音频数据集,包含73,500个合成的语音爆发(vocal burst)场景片段,覆盖49个类别。每个类别由500个提示词生成,每个提示词使用3个随机种子,因此每个提示词出现三次,以便区分类别效果与采样偶然性。所有片段均使用Gemini 3.8 Flash模型进行标注,标注内容包括爆发事件的位置和类型,共识别出123,004个事件(平均每个片段1.674个事件),使用了97个不同的标签。数据集由DramaBox TTS在默认设置下生成,耗时1小时49分钟,使用32个GH200节点(128个rank),零失败。提示词单独发布在`laion/dramabox-burst-prompts`。 数据集以WebDataset格式组织,共74个分片(shard),每个分片包含1000个样本。每个样本包含一个MP3音频文件(160 kbps、单声道、48 kHz,未重新编码)、一个JSON元数据文件(key, cls, idx, seed, prompt, gender, age_band, spec)和一个Gemini标注JSON文件(no_burst, events, overall, usage, model, thinking_level)。此外,还提供一个`metadata.parquet`文件,包含所有73,500行的键、类别、种子、性别、年龄组、分片和提示词,便于过滤。 数据集在构造上保持平衡:男性和女性各36,750个片段;年龄组分布为年轻人24,696个,中年人和老年人各24,402个;每个类别1,500个片段(500个提示词×3个种子)。音频总大小为32.8 GB。 注意:标注是第二个模型的意见,并非经核实的地面真实值,未经过人工审核。生成音频的DramaBox TTS有其自己的许可证,训练前需检查。提示词、标注和打包部分使用Apache-2.0许可证。 此外,数据集还提供了`vocal_burst_groups.json`和`GROUPS.md`,包含一个23组的分组方案,覆盖117个爆发标签字符串,用于评估时合并相似声音。在训练时保留细粒度类别,在评估时使用分组。

DramaBox vocal-burst scenes is an audio dataset containing 73,500 synthetic vocal burst scene clips covering 49 categories. Each category is generated from 500 prompts, each with 3 random seeds, so each prompt appears three times to distinguish category effects from sampling randomness. All clips are annotated using the Gemini 3.8 Flash model, including the location and type of burst events, identifying 123,004 events (average 1.674 events per clip) using 97 different labels. The dataset is generated by DramaBox TTS under default settings, taking 1 hour and 49 minutes, using 32 GH200 nodes (128 ranks), with zero failures. Prompts are released separately at `laion/dramabox-burst-prompts`.

提供机构:
LAION eV
创建时间:
2026-09-04
原始信息汇总

数据集概述

DramaBox vocal-burst scenes — audio, annotated 是一个由 LAION 发布的合成音频数据集,专注于“人声爆发”(vocal bursts)场景的生成与标注。该数据集基于 DramaBox TTS 生成,并辅以 Gemini 模型进行自动化标注,旨在解决现有爆发检测器在特定类别上的不足。

核心特征

  • 规模:包含 73,500 个由 DramaBox TTS 生成的音频片段,横跨 49 个发声爆发类别
  • 类别覆盖:每个类别包含 500 个提示(prompt),每个提示使用 3 个随机种子(seeds)渲染,以便区分类别效应与采样噪声。
  • 标注信息:每个音频片段均附带由 Gemini 3.8 Flash 模型生成的标注,共识别出 123,004 个爆发事件(平均每个片段 1.674 个),并使用 97 个不同的标签
  • 数据形式:采用 WebDataset 格式,共 74 个 tar 分片(shard),每片含 1000 个样本。配套提供 metadata.parquet 文件,便于按类别、种子、性别、年龄段等条件进行过滤。

设计目的

该数据集的设计出发点源于对既有爆发检测器的审计结果:其有效词汇量较小,且对“尖叫”(Shriek)类别的检测率极低。本数据集从不同的生成器(DramaBox TTS)密集生成爆发音频,并由不同的标注模型(Gemini)进行标注,旨在提供一种多样化的、有意为之的爆发音频语料,以训练或评估更鲁棒的检测模型。

标注说明

  • 标注来源:所有标注均由 gemini-3.8-flash 模型生成(thinkingLevel: “low”, temperature 0),并非经过人工验证的“真值”。
  • 上下文依赖:每个完整音频片段被整体呈现给模型,而非预先裁剪,因模型对标注具有上下文依赖性。
  • 时间跨度:标注的事件包含起止时间(秒),若跨度超出音频结尾则被截断并标记为 out_of_range,不会被丢弃。
  • 常用标签:最常见的标签包括 Deep Breath(18,121 次)、Exasperated Sigh(17,771 次)、Humming(10,449 次)、Chuckle(9,893 次)等。

文件结构与格式

每个样本包含以下文件(以 <key> 为标识,规则为 <类别>__<提示索引>__s<种子>):

  • <key>.mp3:音频文件,160 kbit/s 单声道 48 kHz MP3 格式(由生成器直接输出,未经二次编码)。
  • <key>.json:元数据,包括类别、索引、种子、提示文本、性别、年龄段等信息。
  • <key>.gemini.json:Gemini 标注输出,包含无爆发标记、事件列表(起止时间、标签、置信度、描述)、总体判断、token 使用量等。

分片顺序为固定的种子化排列,因此单个分片已包含完整的分布,无需大型 shuffle buffer。

类别平衡性

数据集的平衡性由构造保证,而非事后调整:

  • 性别:男 / 女各 36,750 条。
  • 年龄段:青年(24,696)、中年(24,402)、老年(24,402)。
  • 每个类别:1,500 条(500 提示 × 3 种子)。
  • 总音频大小:32.8 GB。

许可与来源

  • 数据集的提示文本、标注及打包结构采用 Apache-2.0 许可证。
  • 音频由 DramaBox TTS 生成,使用前需查阅该模型的许可证条款。
  • 相关的提示文本数据集位于 laion/dramabox-burst-prompts,其他相关的真实语音爆发片段数据集及分类器也可在 LAION 组织下找到。

补充说明(数据集卡片更正)

数据卡片曾声明既定检测器仅在审计中使用了 8 个标签且未发出“Shriek”检测,这一结论基于 60 个片段的抽样审计,不具备泛化性。在实际全量语料(72,500 个 DramaBox 片段及 3,598 个真实语音)上,同一检测器发出了 41 个不同标签(DramaBox 部分)与 36 个标签(真实部分),并在 DramaBox 50 个片段及真实 49 个片段上检测到“Shriek”。但审计显示其标签分布高度集中(如 Contented Sigh 单一标签占 DramaBox 的 16,694 个),说明其有效词汇量较小而非绝对词汇量不足。

类别分组:数据集还提供了 vocal_burst_groups.jsonGROUPS.md,包含一个 23 组分组方案,覆盖 117 个爆发标签字符串,将同义或近义标签(如 snicker/chuckle)归组。按组别评分可将平均生成命中率从 0.302 提升至 0.537(随机分组仅达 0.355)。建议在训练分类器时保留细粒度类别,而在评估阶段进行分组,因为一旦分组无法逆向恢复。

搜集汇总
数据集介绍
dramabox-burst-audio 数据集图片
构建方式
该数据集源自DramaBox TTS生成器的合成语音,针对49种人声爆发类别精心设计,每类包含500个提示词,并以3种随机种子渲染,总计73,500条音频片段。为规避单一检测器的偏见,构建过程采用了双源策略:以不同生成器产出密集且目的明确的爆发音频,并由Gemini 3.8 Flash模型进行独立标注,确保类别效应与采样噪声可区分。音频以WebDataset格式封装,74个分片均匀分布,每个分片涵盖全量分布,便于高效流式加载。
特点
数据集具备高度结构化的平衡性:性别比例严格1:1,年龄组分布均衡,每类样本量固定为1,500条。每条音频附带详细元数据及Gemini标注,包含时间戳、置信度及描述,共标注出123,004个爆发事件,使用97种不同标签,中位事件时长1.27秒。音频为160 kbit/s单声道48 kHz MP3格式,未经再编码,完整性经校验。此外,数据集提供23组语义分组方案,提升评估粒度,并在TTS合成与后处理环节实现零失败。
使用方法
使用场景聚焦于语音爆发检测与分类模型的训练与评估。推荐基于WebDataset库进行流式读取,直接解码分片中的MP3与JSON文件。鉴于类别在单个分片内完整分布,训练时无需大型混洗缓冲区。评估阶段可结合附带的元数据Parquet文件,按需筛选子集,或借助23组分组方案在语义层面衡量模型性能。需注意,标注源于模型而非人工验证,使用时应审慎对待,并遵循DramaBox TTS的分许可条款。
背景与挑战
背景概述
DramaBox-burst-audio数据集由LAION机构于2026年创建,旨在应对语音合成领域中非言语声音(vocal bursts)生成与检测的挑战。该数据集包含73,500个生成的音频片段,覆盖49种爆发音类别,并借助Gemini 3.8 Flash模型进行密集标注,生成123,004个事件。其核心研究问题在于,现有爆发音检测器在细粒度分类上表现不佳,例如在60片段审计中仅发出0次'Shriek'标签,且有效词汇量有限。该数据集通过跨生成器、跨标注者的设计,为提升检测器的泛化能力和细粒度识别提供了关键资源,对文本到语音(TTS)和音频分类领域具有重要推动作用。
当前挑战
该数据集面临的挑战包括:领域问题方面,现有爆发音检测器对罕见或细微声音(如尖啸、叹息)的识别能力不足,且标注粒度粗糙,难以满足高质量语音合成中对情感表达的需求;构建过程中,需确保生成的音频在类别、性别、年龄上严格平衡,且通过多种子渲染区分类别效果与采样偶然性;同时,标注依赖第二模型的意见而非人工验证,存在标签不确定性,且需处理生成音频的边界校准和标注一致性等问题,这要求在数据规模和标注准确性之间找到平衡。
常用场景
经典使用场景
在语音与音频智能处理领域,DramaBox-burst-audio数据集开辟了全新的研究范式。该数据集精心构建了73,500段合成语音片段,系统覆盖49类人声爆发音(vocal bursts),每类以500条提示词结合3种随机种子进行渲染,确保了类内与类间分布的统计稳定性。其核心应用场景在于训练和评估语音情感识别、非语言声音事件检测以及语音合成中的拟声表现力模块。数据集的每个样本均携带由Gemini 3.8 Flash自动生成的细粒度时间戳注解,精确标记爆发音的出现起止时刻、语义标签及置信度,为序列标注、弱监督学习等任务提供了丰富的监督信号。这一设计使研究者能够深入探究非言语声音在人类交流中的作用机制,进而推动具身智能、虚拟现实等人机交互系统对情感化自然语音的细腻捕捉与回应。
衍生相关工作
身为其构建体系的重要一环,该数据集与LAION社区系列工作紧密耦合,衍生出多个具有深远影响的延伸成果。其提示文本集以姊妹数据集形式独立发布(laion/dramabox-burst-prompts),构建了可控合成的标准范式,而基于真实语音的片段数据集(laion/vocal-bursts-gemini-segments)及其训练的分类器(laion/vocal-burst-classifier-gemini)则共同构成多源验证的生态系统。该数据集的诞生直接催生了对自动标注系统自身偏差的反思,促使研究者从“标注即真理”向“标注为模型观点”的实验方法论转变。围绕类目归并的探讨衍生出利用定向提升(directed lift)而非原始混淆矩阵的评测改进思路,为后续声音事件识别研究提供了更具说服力的量化工具。此外,该语料库还启发了一系列关于合成数据与真实数据互补性的调查研究,推动了领域适应性训练与域泛化技术的进步,在语音生成的表达力研究版图上刻下了清晰的历史坐标。
数据集最近研究
最新研究方向
该数据集聚焦于语音合成与音频分类领域中非言语发声(vocal bursts)的精细建模与评估挑战,针对现有爆发音适配器对特定类别(如尖叫声)识别率低、标签分布高度集中的问题,通过生成73,500个覆盖49个类别的合成场景,并借助Gemini 3.8 Flash进行细粒度时间标注,构建了一个大规模、平衡化的基准语料库。研究前沿在于利用多生成器与多标注器之间的交叉验证,推动对非言语声学事件检测系统的鲁棒性评估,同时为文本到语音系统提供富含情感表达的合成音频数据,助力多模态情感计算与具身智能交互的发展。该数据集的出现回应了当前语音AI在细粒度声学事件理解上的瓶颈,具有推动模型泛化能力与评估范式革新的重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务