vocal-bursts-gemini-utterances
收藏资源简介:
该数据集(burst_gemini_utterances)包含来自真实音频的3598个完整发声片段,每个片段均带有盲法Gemini 3.8 Flash模型生成的声音爆发注释。数据以WebDataset格式存储,分为4个分片,每个样本包含一个48000 Hz单声道OGG/Vorbis格式的音频文件和一个JSON格式的元数据文件。元数据包含:Gemini识别的事件(时间跨度、1-3个标签、置信度、自由文本描述)、语料库自身的类别和跨度、来源数据集、验证级别(strict或family_relaxed)以及转换后的“general”+“script”内容。音频片段时长中位数11.8秒,均值11.723秒,最大32.0秒。数据集来源包括emolia、voice_profile系列、vocal_bursts_clean和kartoffelphon等,其中voice_profile系列为合成语音,其余为真人录音。数据集排除了不可发布的podcast行和制造行。验证级别分为strict(2727行)和family_relaxed(871行)。数据采样的每类目标为:可用行≥200时取200行,100-199时取100行,少于100时取全部。数据集提供了49个类别的详细统计。注释方法为盲法,使用完整语句而非切片段,采用83类闭合分类法、结构化JSON响应、温度0,每个事件返回1-3个标签,允许返回“无内容”(8.2%的行)。音频格式选择OGG而非MP3。所有数据源自CC-BY-4.0许可的数据集。
This dataset (burst_gemini_utterances) contains 3598 complete vocal burst segments from real audio, each annotated with blind Gemini 3.8 Flash model sound burst annotations. The data is stored in WebDataset format, split into 4 shards, with each sample containing a 48000 Hz mono OGG/Vorbis audio file and a JSON metadata file. Metadata includes: Gemini-identified events (time span, 1-3 labels, confidence, free-text description), the corpuss own category and span, source dataset, verification level (strict or family_relaxed), and converted general+script content. Audio segment duration median 11.8 seconds, mean 11.723 seconds, max 32.0 seconds. Data sources include emolia, voice_profile series, vocal_bursts_clean, and kartoffelphon, among which voice_profile series are synthetic speech, others are real recordings. The dataset excludes non-publishable podcast rows and manufacturing rows. Verification levels are strict (2727 rows) and family_relaxed (871 rows). Sampling per class: take 200 rows if available ≥200, 100 rows if 100-199, all rows if less than 100. The dataset provides detailed statistics for 49 categories. Annotation method is blind, using full utterances rather than cut segments, with 83-class closed taxonomy, structured JSON response, temperature 0, each event returns 1-3 labels, and allows returning no content (8.2% of rows). Audio format chooses OGG over MP3. All data originates from CC-BY-4.0 licensed datasets.
数据集概述:laion/vocal-bursts-gemini-utterances(Dataset A)
基本信息
- 数据集名称:burst_gemini_utterances
- 许可协议:按来源分别许可(per-source),非统一许可;Gemini 注解部分采用 CC BY 4.0
- 任务类型:文本转语音(text-to-speech)、音频分类(audio-classification)
- 语言:英语(en)、德语(de)
- 数据规模:1,000 < N < 10,000(共 3598 条)
- 数据格式:WebDataset,包含 4 个分片(
data/vbg-utt-*.tar)
数据内容与格式
- 样本构成:每条样本包含一个完整的语音片段及对应的 JSON 注解文件
- 音频格式:48000 Hz 单声道 OGG/Vorbis(
<key>.ogg);选择 OGG 而非 MP3 是因为 MP3 解码存在 23 ms 的编码延迟偏差,而 OGG 可达到样本级精确 - 时长统计:中位数 11.8 秒,平均值 11.723 秒,最大 32.0 秒
- JSON 注解(
<key>.json):包含 Gemini 识别的事件(时间跨度、1-3 个标签、置信度、文本描述)、语料库自身的类别与跨度、来源数据集、验证级别及转换后的general与script字段
标注方法与质量控制
- 盲标注:Gemini 在请求时不知道语料库已有的分类标签,避免了先入为主的偏差
- 完整话语:仅对完整话语进行标注,不对切分后的片段单独标注,以保证标签的上下文稳定性
- 分类体系:封闭的 83 类分类法,结构化 JSON 输出,温度参数为 0,允许模型回答“无事件”(8.2% 的行如此回答)
- 往返校验:每个生成的
script都会用 GRPO 奖励所用的解析器重新解析,仅当标签顺序一致、跨度未超出音频、语音文本完整且时间数值总和误差在 0.50 秒以内时才保留 - API 调用统计:3598 次调用,消耗 3,977,142 prompt + 577,683 output + 2,369,979 thinking tokens
验证等级
- 严格验证(strict):2727 行,每个目标跨度需在 1.5 秒内有同类检测,且最低阈值 θ = 0.174
- 家族放宽验证(family_relaxed):871 行,接受同一爆发家族(burst family)的检测;仅在严格行无法达到每类目标数量时才引入
分类覆盖阶梯
- 目标策略:每类可用严格验证行 ≥ 200 则取 200;100-199 则取 100;< 100 则全部取用
- 满额类(full-200):11 类,均因 200 上限截断
- 降额类(reduced-100):1 类(childlike_giggle),因 100 上限截断
- 不足百类(below-100):5 类(如 surprised_gasp、ahem、hiss 等),全部取用
- 放宽补充类(below-100+relaxed):18 类(如 exasperated_sigh、cackle、purr 等)
- 仅放宽类(relaxed-only):14 类(如 humming、snicker、panting 等),无严格行存在
- 49 类中 23 类已穷尽,即包含该语料库所有可发布的已验证行
来源数据集
| 来源 | 行数 | 占比 |
|---|---|---|
| emolia | 1038 | 28.8% |
| voice_profile/emolia | 835 | 23.2% |
| voice_profile/the_wild_audio | 627 | 17.4% |
| voice_profile/kseries | 523 | 14.5% |
| vocal_bursts_clean | 352 | 9.8% |
| voice_profile/refvoice | 118 | 3.3% |
| voice_profile/anime | 77 | 2.1% |
| kartoffelphon | 28 | 0.8% |
- 真人录音:emolia、kartoffelphon 和 vocal_bursts_clean 共 1418 行
- 语音画像(voice_profile):合成语音(基于真实说话人构建),尽管爆发事件是脚本化的,但已在生成的音频中由检测器确认
- 排除项:2094 行播客数据(因转录不公开)及 3 行合成数据未发布
Gemini 标注与语料库标签的一致性
- 每行平均 1.434 个事件(共 5161 个事件)
- top-1 标签与语料库类别一致:19.0%(整句范围)/ 17.0%(仅重叠事件)
- 语料库类别在 1-3 个标签内:37.3% / 33.4%
- 同一爆发家族:64.8% / 59.0%
- Gemini 未返回任何爆发事件:8.2%
- 使用了 70 个不同的分类法标签(其中 59 个作为 top-1),而检测器仅有 8 类;无任何超出分类法的标签
跨度宽度(本发布的主要弱点)
- Gemini 事件持续时长:中位数 0.76 秒,平均值 0.969 秒,p90 1.6 秒
- 语料库检测器跨度:中位数 0.36 秒,平均值 0.479 秒,p90 0.936 秒
- Gemini 的跨度更宽,定位能力较弱;发布时未对跨度进行静默缩窄,而是提供
nucleus_start_s、nucleus_end_s元数据供用户可逆地精确缩窄 - 每条片段附带
speech_overlap_frac(跨度中被对齐单词覆盖的比例),中位数为 0.0,p90 为 0.595
注意事项
- 标签定位:这些标签是模型间的“第二意见”,并非经过验证的 ground truth;本发布提供的是可测的更广泛意见(70 类对比检测器的 8 类)
- 建议用途:应使用 Dataset B 获取标签,但不应使用它来训练定位器(locator)




