dramabox-burst-audio
收藏资源简介:
DramaBox vocal-burst scenes 是一个音频数据集,包含73,500个合成的语音爆发(vocal burst)场景片段,覆盖49个类别。每个类别由500个提示词生成,每个提示词使用3个随机种子,因此每个提示词出现三次,以便区分类别效果与采样偶然性。所有片段均使用Gemini 3.8 Flash模型进行标注,标注内容包括爆发事件的位置和类型,共识别出123,004个事件(平均每个片段1.674个事件),使用了97个不同的标签。数据集由DramaBox TTS在默认设置下生成,耗时1小时49分钟,使用32个GH200节点(128个rank),零失败。提示词单独发布在`laion/dramabox-burst-prompts`。 数据集以WebDataset格式组织,共74个分片(shard),每个分片包含1000个样本。每个样本包含一个MP3音频文件(160 kbps、单声道、48 kHz,未重新编码)、一个JSON元数据文件(key, cls, idx, seed, prompt, gender, age_band, spec)和一个Gemini标注JSON文件(no_burst, events, overall, usage, model, thinking_level)。此外,还提供一个`metadata.parquet`文件,包含所有73,500行的键、类别、种子、性别、年龄组、分片和提示词,便于过滤。 数据集在构造上保持平衡:男性和女性各36,750个片段;年龄组分布为年轻人24,696个,中年人和老年人各24,402个;每个类别1,500个片段(500个提示词×3个种子)。音频总大小为32.8 GB。 注意:标注是第二个模型的意见,并非经核实的地面真实值,未经过人工审核。生成音频的DramaBox TTS有其自己的许可证,训练前需检查。提示词、标注和打包部分使用Apache-2.0许可证。 此外,数据集还提供了`vocal_burst_groups.json`和`GROUPS.md`,包含一个23组的分组方案,覆盖117个爆发标签字符串,用于评估时合并相似声音。在训练时保留细粒度类别,在评估时使用分组。
DramaBox vocal-burst scenes is an audio dataset containing 73,500 synthetic vocal burst scene clips covering 49 categories. Each category is generated from 500 prompts, each with 3 random seeds, so each prompt appears three times to distinguish category effects from sampling randomness. All clips are annotated using the Gemini 3.8 Flash model, including the location and type of burst events, identifying 123,004 events (average 1.674 events per clip) using 97 different labels. The dataset is generated by DramaBox TTS under default settings, taking 1 hour and 49 minutes, using 32 GH200 nodes (128 ranks), with zero failures. Prompts are released separately at `laion/dramabox-burst-prompts`.
数据集概述
DramaBox vocal-burst scenes — audio, annotated 是一个由 LAION 发布的合成音频数据集,专注于“人声爆发”(vocal bursts)场景的生成与标注。该数据集基于 DramaBox TTS 生成,并辅以 Gemini 模型进行自动化标注,旨在解决现有爆发检测器在特定类别上的不足。
核心特征
- 规模:包含 73,500 个由 DramaBox TTS 生成的音频片段,横跨 49 个发声爆发类别。
- 类别覆盖:每个类别包含 500 个提示(prompt),每个提示使用 3 个随机种子(seeds)渲染,以便区分类别效应与采样噪声。
- 标注信息:每个音频片段均附带由 Gemini 3.8 Flash 模型生成的标注,共识别出 123,004 个爆发事件(平均每个片段 1.674 个),并使用 97 个不同的标签。
- 数据形式:采用 WebDataset 格式,共 74 个 tar 分片(shard),每片含 1000 个样本。配套提供
metadata.parquet文件,便于按类别、种子、性别、年龄段等条件进行过滤。
设计目的
该数据集的设计出发点源于对既有爆发检测器的审计结果:其有效词汇量较小,且对“尖叫”(Shriek)类别的检测率极低。本数据集从不同的生成器(DramaBox TTS)密集生成爆发音频,并由不同的标注模型(Gemini)进行标注,旨在提供一种多样化的、有意为之的爆发音频语料,以训练或评估更鲁棒的检测模型。
标注说明
- 标注来源:所有标注均由
gemini-3.8-flash模型生成(thinkingLevel: “low”, temperature 0),并非经过人工验证的“真值”。 - 上下文依赖:每个完整音频片段被整体呈现给模型,而非预先裁剪,因模型对标注具有上下文依赖性。
- 时间跨度:标注的事件包含起止时间(秒),若跨度超出音频结尾则被截断并标记为
out_of_range,不会被丢弃。 - 常用标签:最常见的标签包括 Deep Breath(18,121 次)、Exasperated Sigh(17,771 次)、Humming(10,449 次)、Chuckle(9,893 次)等。
文件结构与格式
每个样本包含以下文件(以 <key> 为标识,规则为 <类别>__<提示索引>__s<种子>):
<key>.mp3:音频文件,160 kbit/s 单声道 48 kHz MP3 格式(由生成器直接输出,未经二次编码)。<key>.json:元数据,包括类别、索引、种子、提示文本、性别、年龄段等信息。<key>.gemini.json:Gemini 标注输出,包含无爆发标记、事件列表(起止时间、标签、置信度、描述)、总体判断、token 使用量等。
分片顺序为固定的种子化排列,因此单个分片已包含完整的分布,无需大型 shuffle buffer。
类别平衡性
数据集的平衡性由构造保证,而非事后调整:
- 性别:男 / 女各 36,750 条。
- 年龄段:青年(24,696)、中年(24,402)、老年(24,402)。
- 每个类别:1,500 条(500 提示 × 3 种子)。
- 总音频大小:32.8 GB。
许可与来源
- 数据集的提示文本、标注及打包结构采用 Apache-2.0 许可证。
- 音频由 DramaBox TTS 生成,使用前需查阅该模型的许可证条款。
- 相关的提示文本数据集位于
laion/dramabox-burst-prompts,其他相关的真实语音爆发片段数据集及分类器也可在 LAION 组织下找到。
补充说明(数据集卡片更正)
数据卡片曾声明既定检测器仅在审计中使用了 8 个标签且未发出“Shriek”检测,这一结论基于 60 个片段的抽样审计,不具备泛化性。在实际全量语料(72,500 个 DramaBox 片段及 3,598 个真实语音)上,同一检测器发出了 41 个不同标签(DramaBox 部分)与 36 个标签(真实部分),并在 DramaBox 50 个片段及真实 49 个片段上检测到“Shriek”。但审计显示其标签分布高度集中(如 Contented Sigh 单一标签占 DramaBox 的 16,694 个),说明其有效词汇量较小而非绝对词汇量不足。
类别分组:数据集还提供了 vocal_burst_groups.json 及 GROUPS.md,包含一个 23 组分组方案,覆盖 117 个爆发标签字符串,将同义或近义标签(如 snicker/chuckle)归组。按组别评分可将平均生成命中率从 0.302 提升至 0.537(随机分组仅达 0.355)。建议在训练分类器时保留细粒度类别,而在评估阶段进行分组,因为一旦分组无法逆向恢复。




