遇见数据集

vocal-bursts-gemini-utterances

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

该数据集(burst_gemini_utterances)包含来自真实音频的3598个完整发声片段,每个片段均带有盲法Gemini 3.8 Flash模型生成的声音爆发注释。数据以WebDataset格式存储,分为4个分片,每个样本包含一个48000 Hz单声道OGG/Vorbis格式的音频文件和一个JSON格式的元数据文件。元数据包含:Gemini识别的事件(时间跨度、1-3个标签、置信度、自由文本描述)、语料库自身的类别和跨度、来源数据集、验证级别(strict或family_relaxed)以及转换后的“general”+“script”内容。音频片段时长中位数11.8秒,均值11.723秒,最大32.0秒。数据集来源包括emolia、voice_profile系列、vocal_bursts_clean和kartoffelphon等,其中voice_profile系列为合成语音,其余为真人录音。数据集排除了不可发布的podcast行和制造行。验证级别分为strict(2727行)和family_relaxed(871行)。数据采样的每类目标为:可用行≥200时取200行,100-199时取100行,少于100时取全部。数据集提供了49个类别的详细统计。注释方法为盲法,使用完整语句而非切片段,采用83类闭合分类法、结构化JSON响应、温度0,每个事件返回1-3个标签,允许返回“无内容”(8.2%的行)。音频格式选择OGG而非MP3。所有数据源自CC-BY-4.0许可的数据集。

This dataset (burst_gemini_utterances) contains 3598 complete vocal burst segments from real audio, each annotated with blind Gemini 3.8 Flash model sound burst annotations. The data is stored in WebDataset format, split into 4 shards, with each sample containing a 48000 Hz mono OGG/Vorbis audio file and a JSON metadata file. Metadata includes: Gemini-identified events (time span, 1-3 labels, confidence, free-text description), the corpuss own category and span, source dataset, verification level (strict or family_relaxed), and converted general+script content. Audio segment duration median 11.8 seconds, mean 11.723 seconds, max 32.0 seconds. Data sources include emolia, voice_profile series, vocal_bursts_clean, and kartoffelphon, among which voice_profile series are synthetic speech, others are real recordings. The dataset excludes non-publishable podcast rows and manufacturing rows. Verification levels are strict (2727 rows) and family_relaxed (871 rows). Sampling per class: take 200 rows if available ≥200, 100 rows if 100-199, all rows if less than 100. The dataset provides detailed statistics for 49 categories. Annotation method is blind, using full utterances rather than cut segments, with 83-class closed taxonomy, structured JSON response, temperature 0, each event returns 1-3 labels, and allows returning no content (8.2% of rows). Audio format chooses OGG over MP3. All data originates from CC-BY-4.0 licensed datasets.

提供机构:
LAION eV
创建时间:
2026-09-03
原始信息汇总

数据集概述:laion/vocal-bursts-gemini-utterances(Dataset A)

基本信息

  • 数据集名称:burst_gemini_utterances
  • 许可协议:按来源分别许可(per-source),非统一许可;Gemini 注解部分采用 CC BY 4.0
  • 任务类型:文本转语音(text-to-speech)、音频分类(audio-classification)
  • 语言:英语(en)、德语(de)
  • 数据规模:1,000 < N < 10,000(共 3598 条)
  • 数据格式:WebDataset,包含 4 个分片(data/vbg-utt-*.tar

数据内容与格式

  • 样本构成:每条样本包含一个完整的语音片段及对应的 JSON 注解文件
  • 音频格式:48000 Hz 单声道 OGG/Vorbis(<key>.ogg);选择 OGG 而非 MP3 是因为 MP3 解码存在 23 ms 的编码延迟偏差,而 OGG 可达到样本级精确
  • 时长统计:中位数 11.8 秒,平均值 11.723 秒,最大 32.0 秒
  • JSON 注解<key>.json):包含 Gemini 识别的事件(时间跨度、1-3 个标签、置信度、文本描述)、语料库自身的类别与跨度、来源数据集、验证级别及转换后的 generalscript 字段

标注方法与质量控制

  • 盲标注:Gemini 在请求时不知道语料库已有的分类标签,避免了先入为主的偏差
  • 完整话语:仅对完整话语进行标注,不对切分后的片段单独标注,以保证标签的上下文稳定性
  • 分类体系:封闭的 83 类分类法,结构化 JSON 输出,温度参数为 0,允许模型回答“无事件”(8.2% 的行如此回答)
  • 往返校验:每个生成的 script 都会用 GRPO 奖励所用的解析器重新解析,仅当标签顺序一致、跨度未超出音频、语音文本完整且时间数值总和误差在 0.50 秒以内时才保留
  • API 调用统计:3598 次调用,消耗 3,977,142 prompt + 577,683 output + 2,369,979 thinking tokens

验证等级

  • 严格验证(strict):2727 行,每个目标跨度需在 1.5 秒内有同类检测,且最低阈值 θ = 0.174
  • 家族放宽验证(family_relaxed):871 行,接受同一爆发家族(burst family)的检测;仅在严格行无法达到每类目标数量时才引入

分类覆盖阶梯

  • 目标策略:每类可用严格验证行 ≥ 200 则取 200;100-199 则取 100;< 100 则全部取用
  • 满额类(full-200):11 类,均因 200 上限截断
  • 降额类(reduced-100):1 类(childlike_giggle),因 100 上限截断
  • 不足百类(below-100):5 类(如 surprised_gasp、ahem、hiss 等),全部取用
  • 放宽补充类(below-100+relaxed):18 类(如 exasperated_sigh、cackle、purr 等)
  • 仅放宽类(relaxed-only):14 类(如 humming、snicker、panting 等),无严格行存在
  • 49 类中 23 类已穷尽,即包含该语料库所有可发布的已验证行

来源数据集

来源 行数 占比
emolia 1038 28.8%
voice_profile/emolia 835 23.2%
voice_profile/the_wild_audio 627 17.4%
voice_profile/kseries 523 14.5%
vocal_bursts_clean 352 9.8%
voice_profile/refvoice 118 3.3%
voice_profile/anime 77 2.1%
kartoffelphon 28 0.8%
  • 真人录音:emolia、kartoffelphon 和 vocal_bursts_clean 共 1418 行
  • 语音画像(voice_profile):合成语音(基于真实说话人构建),尽管爆发事件是脚本化的,但已在生成的音频中由检测器确认
  • 排除项:2094 行播客数据(因转录不公开)及 3 行合成数据未发布

Gemini 标注与语料库标签的一致性

  • 每行平均 1.434 个事件(共 5161 个事件)
  • top-1 标签与语料库类别一致:19.0%(整句范围)/ 17.0%(仅重叠事件)
  • 语料库类别在 1-3 个标签内:37.3% / 33.4%
  • 同一爆发家族:64.8% / 59.0%
  • Gemini 未返回任何爆发事件:8.2%
  • 使用了 70 个不同的分类法标签(其中 59 个作为 top-1),而检测器仅有 8 类;无任何超出分类法的标签

跨度宽度(本发布的主要弱点)

  • Gemini 事件持续时长:中位数 0.76 秒,平均值 0.969 秒,p90 1.6 秒
  • 语料库检测器跨度:中位数 0.36 秒,平均值 0.479 秒,p90 0.936 秒
  • Gemini 的跨度更宽,定位能力较弱;发布时未对跨度进行静默缩窄,而是提供 nucleus_start_snucleus_end_s 元数据供用户可逆地精确缩窄
  • 每条片段附带 speech_overlap_frac(跨度中被对齐单词覆盖的比例),中位数为 0.0,p90 为 0.595

注意事项

  • 标签定位:这些标签是模型间的“第二意见”,并非经过验证的 ground truth;本发布提供的是可测的更广泛意见(70 类对比检测器的 8 类)
  • 建议用途:应使用 Dataset B 获取标签,但不应使用它来训练定位器(locator)
搜集汇总
数据集介绍
vocal-bursts-gemini-utterances 数据集图片
构建方式
本数据集源自对真实语音中非言语发声片段的精细筛选与标注,构建过程融合了多源语料库的严格规整与前沿模型的盲评机制。具体而言,从LAION旗下多个公开语料中提取3,598条完整话语,每条均经由高速解码与半速金丝雀校验,确保音频采样率与帧数的严格对应。在此基础上,采用闭集83类别的分类体系,指令Gemini模型在不获知原始标签与文本的前提下,对每条话语进行时间跨度标注与标签指派,并通过结构化JSON输出回传。为保障标注质量,所有生成结果均经受与GRPO奖励函数同源的解析回验,凡标签顺序不符、超出音频边界或文本失真者即被剔除,最终形成兼具严格与家族宽松两级验证的精选集合。
特点
该数据集的核心特质在于其标签体系的广度与深度,以及构建过程的严谨透明度。其包含49类发声类别,覆盖从轻笑、叹息到咆哮等细微情绪表达,其中23类已穷尽语料库中所有可发布条目。数据集明确区分'严格'与'家族宽松'两种验证层级,所有样本均可溯源至具体来源语料,并附带人类录音与否的标记。尤为突出的是,每条样本均携带Gemini提供的多项时间标注、置信度与自由文本描述,其标签数量远超传统检测器所能达到的8类,且未越出预设分类体系。此外,音频采用OGG格式以规避MP3编码固有的23毫秒延迟,确保时间戳的样本级精确性。
使用方法
使用时,用户可直接从WebDataset格式的TAR归档中读取音频与JSON注释,根据'verification'字段过滤所需验证层级,或依据'source'字段遵从相应语料的许可协议。由于Gemini标注的边界宽度较宽,建议使用附带的'nucleus_start_s'与'nucleus_end_s'字段进行能量收紧,以精确锁定发声核心区间。此数据集特别适用于文本转语音中的情感控制、语音分类中的非言语事件识别等任务,但应明确其标签属于模型间的'第二意见',而非绝对真值,如需用于定位器训练建议优先依赖时间跨度更精确的配套数据集。
背景与挑战
背景概述
该数据集由LAION机构于2026年创建,旨在探索非语言发声(vocal bursts)的自动标注与语音合成应用。其核心研究问题在于利用大型语言模型Gemini 3.8 Flash对连续语音中的笑声、叹息、呼吸等情感性非语言事件进行盲标注,从而扩展传统语音情感识别与文本到语音合成的边界。数据集包含3598条完整语音片段,覆盖83类细粒度发声类别,并创新性地引入双重验证层级与模型间一致性评估。该资源为语音情感计算、人机交互及表现性语音合成提供了宝贵训练语料,推动了多模态生成模型在非语言声学事件理解上的发展。
当前挑战
数据集面临的核心挑战在于非语言发声的领域多样性与标注不确定性。传统语音数据集多聚焦于语言内容,而此类事件具有高度语境依赖性和声学模糊性,同一发声可归属多个相近类别(如'叹息'与'宽慰叹')。构建过程中,研究者需在严格与宽松验证标准间权衡,应对Podcast数据版权限制,并处理Gemini模型在时间定位上的劣势——其标注跨度中位值0.76秒,远宽于检测器0.36秒,导致与语音重叠率高。此外,模型间共享先验可能虚高一致性指标,且长尾类别(如口哨声仅1例)严重不足,影响类别平衡与模型泛化。
常用场景
经典使用场景
在语音与情感计算研究领域,该数据集‘vocal-bursts-gemini-utterances’以其对完整话语中非语言发声事件的精细标注而独树一帜,其典型应用场景在于训练与评估文本到语音(TTS)系统中的情感与副语言表达控制模块。研究者可借助数据集内带有时戳的爆发性发声标签(如笑声、叹息、呼吸声),为神经TTS模型构建韵律与情感嵌入的监督信号,从而提升合成语音的自然度与表现力。此外,它亦作为音频分类任务的基准,用于细粒度识别说话人意图或情感状态,特别是在需要处理真实录音中混杂的非语言信号场景下,呈现出比传统短片段数据集更为丰富和真实的声学上下文。
实际应用
在实际应用中,该数据集对于开发具有情感智能的语音交互系统至关重要,例如用于生成更具表现力的虚拟助手、有声读物旁白或游戏角色语音。其涵盖的49种细粒度发声类别(如咯咯笑、呻吟、吸气等)使开发者能精确控制合成语音的副语言特征,以提升用户体验的沉浸感。此外,该数据集所附带的音频片段生成策略(如能量收紧窗口)和原始OGG格式,便于直接集成至音频处理流水线,应用于语音健康监测(如检测呼吸困难模式)、情感陪伴机器人以及影视配音自动化等领域,其来源广泛且许可清晰的特点亦利于商业部署中的合规审查。
衍生相关工作
此数据集衍生了多项开创性工作,其中最为瞩目的成果是与配套的片段数据集(如‘vocal-bursts-gemini-segments’)共同构成的‘burst-gemini’系列,推动了基于大语言模型的多模态音频理解研究。相关经典工作包括:一是利用Gemini标注作为‘第二意见’,构建鲁棒的语音事件检测器,改进传统模型在真实场景中的泛化能力;二是探索时间边界模糊性下的标注一致性,催生了关于音频评估协议的新见解;三是基于其‘脚本+通用’格式,发展出将非语言事件融入TTS训练序列的模型架构,为语音韵律控制提供了具体实现路径。这些工作共同验证了在大尺度语音数据上利用前沿模型进行自动标注的可行性与局限,并引领了后续对模型偏见与验证严谨性的讨论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务