遇见数据集

vocalburst-locator-synth-data

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

Vocal Burst Locator - Synthetic Training Data是一个用于训练音频事件检测模型的合成数据集,专门针对人声爆发(如笑声、咳嗽、喷嚏、叹息、喘息、哭泣、尖叫等)的定位任务。该数据集由LAION组织创建,用于训练基于Whisper的vocalburst-locator模型,以检测和定位音频中的人声爆发事件。数据集包含33,012个音频样本,总计约8.5GB,分为训练集(32,712个样本,~8.4GB)和验证集(300个样本,~79MB)。每个样本包括单声道MP3音频文件(44.1kHz采样率,96kbps比特率,持续时间3-30秒)和对应的JSON标签文件,标签文件包含人声爆发事件的时间戳、音频总时长、背景类型(音乐、音效、音乐+音效或静音)以及人声爆发数量。数据集设计平衡:50%的样本为负样本(无人声爆发),50%为正样本(包含至少一个人声爆发),人声爆发数量分布以1-2个爆发为主,整个数据集共包含31,360个人声爆发事件。背景音频类型分布均匀:音乐、音效和音乐+音效各占约31.7%,静音背景占5.0%。音频持续时间遵循贝塔分布,偏向较长的片段(20-30秒)。数据集通过合成方法生成,生成流程包括从源数据集获取素材、随机选择背景类型和持续时间、混合背景音频并放置人声爆发片段,以及应用数据增强(如低通滤波和加性噪声)。所有人声爆发源片段在数据集中恰好出现两次。数据集采用Apache 2.0许可证,适用于音频事件检测、声音场景分析和机器学习模型训练等任务。

Vocal Burst Locator - Synthetic Training Data is a synthetic dataset designed for training audio event detection models, specifically focusing on the localization task of vocal bursts such as laughter, coughing, sneezing, sighing, gasping, crying, and screaming. Created by the LAION organization, this dataset is intended for training the Whisper-based vocalburst-locator model to detect and localize vocal burst events in audio. The dataset consists of 33,012 audio samples totaling approximately 8.5GB, split into a training set (32,712 samples, ~8.4GB) and a validation set (300 samples, ~79MB). Each sample includes a monaural MP3 audio file with a 44.1kHz sampling rate, 96kbps bitrate, and duration ranging from 3 to 30 seconds, alongside a corresponding JSON label file. The label file contains the timestamps of vocal burst events, total audio duration, background type (music, sound effects, music + sound effects, or silence), and the number of vocal bursts. The dataset is balanced: 50% of the samples are negative samples (containing no vocal bursts) and 50% are positive samples (containing at least one vocal burst). The distribution of vocal burst counts is dominated by 1 or 2 bursts per sample, and the entire dataset contains a total of 31,360 vocal burst events. The background audio types are evenly distributed: music, sound effects, and music + sound effects each account for approximately 31.7% of the samples, while silent backgrounds make up 5.0%. The audio duration follows a beta distribution, with a bias towards longer segments (20–30 seconds). The dataset is generated through a synthetic pipeline that includes acquiring source materials from existing datasets, randomly selecting background types and durations, mixing background audio and inserting vocal burst segments, and applying data augmentation techniques such as low-pass filtering and additive noise. Notably, every vocal burst source segment appears exactly twice within the dataset. The dataset is licensed under Apache 2.0, and is suitable for applications including audio event detection, sound scene analysis, and machine learning model training.

提供机构:
LAION eV
创建时间:
2026-06-04
原始信息汇总

数据集概述

Vocal Burst Locator - Synthetic Training Data 是一个合成的音频数据集,专用于训练语音爆发事件检测与定位模型。数据集包含 33,012 个音频-标签对,总大小约 8.5 GB。

数据集规模与划分

划分 样本数 大小
训练集 32,712 ~8.4 GB
验证集 300 ~79 MB
总计 33,012 ~8.5 GB

数据格式

每个样本包含两个文件:

  • sample_XXXXX.mp3 — 单声道音频音景(3–30 秒,44.1 kHz,96 kbps MP3)
  • sample_XXXXX.json — 包含语音爆发时间戳和元数据的标签文件

标签文件 JSON 结构:

字段 类型 描述
events list 语音爆发片段,包含 start_timeend_time(秒)
duration_sec float 音频总时长(秒)
bg_type string 背景类型:"music""sfx""music+sfx""silence"
n_vocal_bursts int 该片段中的语音爆发数量

n_vocal_bursts: 0 时,events 列表为空(负样本)。

数据集构成

类别平衡

  • 50% 负样本(无语音爆发):16,506 个样本
  • 50% 正样本(至少 1 个语音爆发):16,506 个样本

每个片段中语音爆发数量分布:

语音爆发数 样本数
0 16,506
1 6,690
2 6,063
3 2,747
4 771
5 201
6+ 34

整个数据集共有 31,360 个语音爆发事件。

背景类型分布

背景类型 样本数 占比
音乐 10,464 31.7%
音效 10,465 31.7%
音乐 + 音效 10,433 31.6%
静音 1,650 5.0%

时长分布

片段时长由 Beta 分布生成:Beta(3.0, 1.2) * 27 + 3,范围为 3–30 秒,大部分片段集中在 20–30 秒。

数据生成方法

数据集通过将语音爆发音频片段混合到背景音频上合成生成。

1. 来源音频

来源 数据集 数量 描述
语音爆发 laion/improved_synthetic_vocal_burts 15,680 合成的语音爆发片段
音乐 laion/captioned-ai-music-snippets 5,000 AI 生成的音乐片段
音效 (AudioSet) mitermix/audioset-with-grounded-captions 5,000 AudioSet 音效
音效 (AudioSnippets) mitermix/audiosnippets_small_with_detailed_annotation 3,000 多样化的音频片段

2. 音景生成流程

  1. 从 Beta 分布中选取时长(3–30 秒)
  2. 根据目标分布选择背景类型
  3. 随机选择和混合来源音频创建背景
  4. 对于正样本(50%),在随机位置放置 1–5+ 个语音爆发片段,音量为 10–100%(25% 概率重叠)
  5. 可选增强(15% 样本):低通滤波和/或加性噪声
  6. 导出为单声道 MP3 和 JSON 标签文件

每个语音爆发源片段在整个数据集中恰好出现 两次

3. 训练/验证划分

  • 300 个样本用于验证
  • 剩余 32,712 个用于训练
  • 划分是确定性的(种子 = 2024)

文件结构

vocalburst-locator-synth-data/ train/ shard_00/ # 样本 00000–03999(4,000 个样本) shard_01/ # 样本 04000–07999 ... shard_08/ # 样本 32000–32711(712 个样本) val/ # 300 个样本(扁平目录) manifest.json # 数据集生成元数据

生成参数

参数
目标采样率 44,100 Hz
MP3 比特率 96 kbps
时长分布 Beta(3.0, 1.2) * 27 + 3
负样本比例 50%
VB 音量范围 10–100%
VB 重叠概率 25%
质量增强概率 15%
随机种子 2024

许可证

Apache 2.0

搜集汇总
数据集介绍
vocalburst-locator-synth-data 数据集图片
构建方式
Vocalburst-locator-synth-data 数据集通过合成音频声景的方式构建,旨在为语音爆发事件(如笑声、咳嗽、喷嚏、叹息、抽泣、哭喊、尖叫等)的检测和定位任务提供训练数据。其生成流程首先从多个来源收集音频素材,包括来自 laion/improved_synthetic_vocal_burts 的合成语音爆发片段、来自 laion/captioned-ai-music-snippets 的 AI 生成音乐、以及经过筛选的 AudioSet 和 AudioSnippets 音效。随后,生成器为每个样本随机选择背景类型(音乐、音效、音乐与音效混合,或静音)和持续时间(3至30秒),并以设定的分布混合背景音频。对于正样本(占比50%),随机将1至5个以上的语音爆发片段以随机音量(10–100%)放置于背景中,且允许部分片段重叠(概率25%)。最后,部分样本(15%)应用低通滤波或加性噪声进行质量增强,并输出为单声道 MP3 音频及对应的 JSON 标注文件。
特点
该数据集的一个显著特点是其平衡的类别设计,正负样本各占50%(共计16,506个),其中负样本为无语音爆发事件的样本,有效提升了模型对背景噪声的鲁棒性。语音爆发事件的总数达到31,360个,分布在正样本中,每个片段的事件数量从1到6个以上不等,覆盖了多种密集度场景。背景类型多样化,音乐、音效、音乐与音效混合各约占31.7%,静音背景占5%,模拟了真实环境中的不同声学条件。音频时长呈 Beta 分布,偏向较长片段(多数集中在20–30秒),符合实际应用中语音爆发事件可能在较长音频序列中出现的需求。此外,每个语音爆发源片段在数据集中恰好出现两次,确保了事件样本的充分复用。
使用方法
使用该数据集时,用户可通过 librosa 库加载 MP3 音频文件,并读取对应的 JSON 文件获取标注信息。JSON 文件中包含 events 列表(记录每个语音爆发事件的起止时间)、duration_sec(音频总时长)、bg_type(背景类型)和 n_vocal_bursts(事件数量)等字段。为适配基于 Whisper 的 vocalburst-locator 模型(其在30秒音频上以50 fps 生成1500个帧标签),用户可将事件时间戳转换为帧级二值标签:根据事件起止时间计算对应的起止帧索引,并将该区间内的帧标签置为1。训练数据按约4,000个样本为一个分片(shard)组织,便于在平台限制下分批次加载;验证集包含300个样本,存放于独立目录。用户可通过 glob 遍历所有分片目录中的 JSON 文件,并匹配对应的 MP3 文件进行批量处理。
背景与挑战
背景概述
语音事件检测与定位是人工智能听觉感知领域的核心任务,其目标是从连续音频流中精准识别并定位各类非语言发声事件。该类研究对于人机交互、医疗监护及多媒体内容分析具有重要应用价值。在此背景下,LAION研究团队于2024年创建了Vocal Burst Locator合成数据集,旨在解决传统语音事件检测任务中针对笑声、咳嗽、喷嚏、叹息等人类非语言发声(vocal bursts)的细粒度定位难题。该数据集由LAION机构主导开发,依托Whisper模型架构构建了端到端的发声事件定位系统。通过系统性地生成33012条包含帧级标注的合成音频场景,该数据集成功支撑了时间定位精度达50帧/秒的检测模型训练,在事件F1分数上达到0.752,为音频事件细粒度定位研究提供了标准化训练基准。
当前挑战
该数据集面临的核心挑战在于双重复杂性。其一,研究领域层面,人类非语言发声存在高度语义多样性(涵盖7类以上发声类型)、时间跨度差异大(短至数百毫秒)且常与背景噪音交织,传统基于梅尔频谱的语音端点检测方法难以实现亚秒级精确定位。其二,数据构建层面,真实场景中细粒度标注成本极高,音频事件边界的人工标注一致性较低;合成数据虽能提供精确标注,但面临声学环境多样性模拟不足(仅包含4类背景类型)以及发声事件与背景音在频谱域的自然融合难题。此外,数据分布中负样本占比达50%且发声事件密度呈现长尾分布(92.5%样本含0-2个事件),这对模型在稀疏事件场景下的鲁棒性构成严峻考验。
常用场景
经典使用场景
Vocalburst-locator-synth-data数据集为音频事件检测与定位任务提供了标准化的合成训练资源。其核心价值在于通过精心设计的管道生成3至30秒的多样音景,涵盖音乐、音效及静音背景,并在其中精准嵌入笑声、咳嗽、叹息等爆发性人声事件,附带帧级时间戳标注。研究者可利用该数据集训练能够同时识别并定位非言语人声事件的深度学习模型,例如基于Whisper架构的检测器,从而在嘈杂或复杂声学场景中实现高精度的事件边界划分与声学模式捕捉。
衍生相关工作
由该数据集衍生出的代表性工作包括基于Whisper微调的Vocalburst-locator模型,其性能验证了合成训练策略的有效性。后续研究可延伸至多语言爆发声事件检测、细粒度情感分类(如区分尖叫与大笑),以及跨模态融合(如结合视觉信息进行声音源定位)。该数据集预期的框架与代码亦促进了可复现的学术探索,启发研究者进一步优化合成数据生成算法,探索更复杂的背景干扰模拟与弱监督学习范式,从而推动声音事件定位技术向更开放、更鲁棒的演化。
数据集最近研究
最新研究方向
基于合成数据的人声爆发事件定位与检测研究正迈入精细化、规模化阶段。该数据集通过混合音乐、音效与静音背景,生成包含笑声、咳嗽、叹息等八类人声爆发的带帧级标注音频场景,共33,012条样本,充分覆盖了真实世界中声学背景的多样性与事件稀疏性。其训练出的Whisper架构模型vocalburst-locator在事件F1分数达0.752,为情感计算、人机交互及异常事件监控等前沿应用提供了坚实的数据基础与技术验证。此类合成数据策略有效解决了真实音频标注成本高昂、隐私敏感等问题,推动了弱监督学习在复杂声学事件理解中的产业化落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务