遇见数据集

vocal-bursts-gemini-segments

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

该数据集(burst_gemini_segments,数据集B)包含5161个突发音频片段,这些片段是从数据集A的完整话语中切出的,每个片段对应一个Gemini事件。数据以WebDataset格式存储,分为6个分片。每个样本包括:一个48kHz单声道OGG/Vorbis格式的音频片段(键值_eNN.ogg),一个包含主标签的文本文件(键值_eNN.txt,遵循laion/vocal-bursts-clean的.txt约定),以及一个包含所有1-3个标签、置信度、描述、父话语键、父语料库类别、源数据集、核起始/结束时间(秒)、语音重叠分数以及片段来源(gemini_as_is)的JSON文件(键值_eNN.json)。片段时长中位数为0.76秒,第10百分位0.47秒,第90百分位1.6秒,最大13.1秒。数据集的标注由Gemini-3.8-flash模型盲注完成,使用83类分类法,仅对完整话语进行标注,片段是后续从这些话语切出的。标注并未验证为真实标签,而是作为第二意见。数据集的主要用途是用于标签,不建议用于训练定位模型。来源数据集包括emolia、voice_profile/emolia、voice_profile/mediathek等,共8个来源,其中0行无法追溯。排除了播客(2094行)和人为制造的数据(3行)。验证等级分为严格(2727行)和族宽松(871行),每个样本都带有verification字段。音频格式选择OGG/Vorbis而非MP3,因为MP3会引入23毫秒的延迟,而OGG是样本精确的。

This dataset (burst_gemini_segments, dataset B) contains 5161 burst audio segments cut from full utterances of dataset A, each corresponding to a Gemini event. Data is stored in WebDataset format, split into 6 shards. Each sample includes: a 48kHz mono OGG/Vorbis audio segment (key _eNN.ogg), a text file containing the main label (key _eNN.txt, following the .txt convention of laion/vocal-bursts-clean), and a JSON file (key _eNN.json) containing all 1-3 labels, confidence, description, parent utterance key, parent corpus category, source dataset, onset/offset time (seconds), speech overlap score, and segment source (gemini_as_is). The median segment duration is 0.76 seconds, 10th percentile 0.47 seconds, 90th percentile 1.6 seconds, maximum 13.1 seconds. The annotations were performed by the Gemini-3.8-flash model in a blind manner using an 83-class taxonomy, only on complete utterances, from which segments were later cut. The annotations are not verified as ground truth but serve as a second opinion. The primary use of the dataset is for labels; it is not recommended for training localization models. Source datasets include emolia, voice_profile/emolia, voice_profile/mediathek, etc., totaling 8 sources, with 0 rows untraceable. Podcasts (2094 rows) and artificially manufactured data (3 rows) were excluded. Verification levels are strict (2727 rows) and family relaxed (871 rows), and each sample carries a verification field. The audio format is OGG/Vorbis instead of MP3 because MP3 introduces a 23-millisecond delay, while OGG is sample-accurate.

提供机构:
LAION eV
创建时间:
2026-09-03
原始信息汇总

数据集概述:laion/vocal-bursts-gemini-segments (Dataset B)

基本信息

  • 许可证: CC BY 4.0
  • 任务类型: 音频分类
  • 语言: 英语、德语
  • 数据量: 5,161 个声音爆发片段(vocal-burst segments),来源于 3,304 段真实语音话语
  • 总时长: 1.39 小时
  • 时长统计: 中位数 0.76 秒,平均 0.969 秒,范围 0.23 至 13.1 秒(p10: 0.47 秒,p90: 1.6 秒)
  • 音频格式: 48,000 Hz 单声道 OGG/Vorbis
  • 类别数量: 59 个不同标签,映射至 49 个语料库类别

数据内容

每个片段包含一个独立的声音爆发事件(如笑声、叹息、喘息等),不包含其他内容。文件格式为 WebDataset,共 6 个 shard,每个样本包含:

  • OGG 音频文件(48 kHz 单声道)
  • TXT 文件(主要标签)
  • JSON 文件(1-3 个标签、置信度、描述、父话语键、来源、语音重叠比例等元数据)

数据来源

来源 片段数 占比
emolia(开放语音语料库) 1,226 23.8%
voice_profile/emolia 1,200 23.3%
voice_profile/the_wild_audio 1,049 20.3%
voice_profile/kseries 951 18.4%
vocal_bursts_clean 370 7.2%
voice_profile/refvoice 195 3.8%
voice_profile/anime 138 2.7%
kartoffelphon 32 0.6%

所有片段均可溯源,0 行无法归属。无拼接、串联或声音转换的合成内容。

多标签分布

  • 英语片段: 2,900 个
  • 德语片段: 2,261 个

最常见标签(前 10)

标签 片段数
Chuckle 793
Exasperated Sigh 557
Deep Breath 533
Sharp Inhale 485
Panting 327
Humming 225
Yawn 190
Scream 184
Exhausted Groan 161
Heavy Breathing 159

模型性能基准(11 类、说话人分离划分)

  • 基于本数据集训练的模型: 56.1% ± 3.4 准确率
  • 原检测器(限制在相同 11 类): 39.0%
  • 原检测器(全部 83 类): 18.9%
  • 随机猜测: 9.1%

按类别最佳表现:Chuckle 89%、Exhausted Groan 76%、Humming 72%、Scream 71%、Panting 67%。

验证机制

每行包含两种验证级别之一:

  • strict(3,999 个片段): 目标片段在 1.5 秒内包含同类检测
  • family_relaxed(1,162 个片段): 允许同族爆发(不同标签但属同类)

设计目的

本数据集用于重新训练声音爆发分类器,改进原检测器仅使用 83 个标签中的 8 个且完全无法检测“Shriek”的问题。片段标签由 Gemini 3.8 Flash 在盲注条件下生成(不透露原语料库类别)。

使用注意事项

  • 标签是模型的第二意见,而非已验证的真实标注
  • 时间边界未经标注验证——不建议用于训练定位器;片段包含能量收紧窗口的元数据(nucleus_start_s/nucleus_end_s)及语音重叠比例(speech_overlap_frac)
  • 每个样本均标记 human_recording 字段,便于区分真人录音和合成语音
搜集汇总
数据集介绍
vocal-bursts-gemini-segments 数据集图片
构建方式
该数据集由3304段真实语音话语中切割出的5161个非言语发声片段构成,每个片段对应Gemini 3.8 Flash模型断言的一个独立事件,如笑声、叹息或倒吸气。切割过程严格基于浮点波形在编码前执行,确保无二次编码损失。每个片段附有详尽元数据,包括标签、置信度、描述、来源、时间边界及语音重叠比例。构建流程遵循盲注原则,模型在无提示情况下对完整话语进行标注,随后从标注的时间跨度内截取片段,以保证标签的上下文依赖性不受破坏。
特点
数据集涵盖59种不同的发声标签,音频总长约1.39小时,中位时长0.76秒。其独特之处在于提供了双重验证层级:'strict'与'family_relaxed',分别对应同类别及同族别的检测确认,增强了数据的可靠性。此外,所有片段均源于可溯源的公开语料库,如Emilia、The Wild Audio等,确保0行无法归属。数据集明确标注了未覆盖播客内容及合成样本,并详细记录了每段音频的语种(英语、德语)与验证等级,为使用者提供了清晰的筛选条件。
使用方法
数据以WebDataset格式存储于6个tar文件中,每样本包含音频(OGG格式)、顶级标签(txt)及完整元数据(json)。使用者可通过现有WebDataset加载器直接读取,如示例代码所示。该数据专为重新训练嗓音爆发分类器而设计,实测在11类分类任务上,基于此数据训练的MLP模型准确率达56.1%,显著优于旧检测器的39.0%。然而,需谨慎的是,这些标注仅视为第二意见,非银标准;使用时建议依据元数据中的能量收紧窗口(nucleus_start_s/end_s)与语音重叠比例进行必要的后处理,以优化定位精度。
背景与挑战
背景概述
该数据集由LAION机构于2026年创建,旨在解决非语言发声(vocal bursts)分类中的核心问题——即现有检测器在真实场景中表现不佳,例如在60个样本审计中,检测器对'尖叫'(Shriek)的检出次数为零,且仅使用了83个标签中的8个。数据集包含5,161个从3,304条真实语音中切割出的非语言发声片段,覆盖59种标签,总时长1.39小时。其构建基于Gemini 3.8 Flash模型对完整话语的自动标注,并采用严格的盲评流程。该数据集对情感计算和人机交互领域具有重要影响,为训练更鲁棒的突发性发声分类器提供了高质量训练材料。
当前挑战
面临的领域挑战包括:非语言发声的类别多样性极高(83类),且类间相似性大,如不同叹息、笑声等,使得精确分类尤为困难;现有检测器对关键类别(如尖叫)的感知能力严重不足,漏检率极高。构建过程中的挑战则涉及:验证标签的可靠性——Gemini的标注与原始语料库类别的吻合度有限(top-1仅19.0%),且标签为模型主观判断而非真实标注;边界切割的模糊性——模型对事件起止时间的定位不够精准,需计算并附带能量收紧窗口元数据;数据来源的合规性——排除了大量播客来源数据以及合成、拼接样本,确保了数据的纯净性。
常用场景
经典使用场景
该数据集专注于非语言发声(vocal bursts)的片段级分类,为音频情感计算与副语言学分析提供了珍贵的基准资源。其精确定位了笑声、叹息、尖叫等瞬时性、非言语声音事件,每个样本均附有细粒度的标签与丰富的元数据,适用于训练和评估高性能的发声事件分类器。典型的应用场景包括基于深度学习的音频嵌入表示学习,如利用小型MLP架构在说话人分离的数据划分下进行模型训练与性能验证,以精准识别各类情感性发声。
实际应用
在实际应用层面,该数据集展现出广泛的用途。它可以助力开发更富表现力的语音助手和交互系统,使之能感知用户情绪状态并作出富有同理心的回应。在数字娱乐与虚拟现实领域,可用于精细刻画人物或化身的情绪丰富度,提升沉浸式体验。此外,该数据集的片段特征适用于构建像健康监测(如识别压力下的叹息或呼吸模式)和内容审核(如检测尖叫或惊恐反应)等专业应用,其高精度和丰富的源数据信息为相应系统的研发提供了坚实的数据基础。
衍生相关工作
基于此数据集已催生出一系列值得瞩目的相关研究工作。其中,基线实验结果证明了利用其进行分段级训练的显著优势,对比原检测器在相同类别上的性能提升,指明了训练专用发声事件检测器的可行方向。该数据集标注了严格的领域信息,其构建流程和验证等级的细致划分,亦激发了关于弱监督标注策略、标签一致性验证以及模型偏差分析等方向的研究。此外,其与父级数据集(如laion/vocal-bursts-gemini-utterances)的关联设计,促进了针对发声事件上下游任务的联合建模与系统性探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务