遇见数据集

advanced-soundscapes-stage-1

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

Advanced Soundscapes Stage 1 — Raw Components (5M) 数据集是LAION通用音频标注流水线(UAAP)数据生成计划的第一阶段产出。该数据集旨在为合成复杂声景提供结构化的原始音频组件,适用于音频分类和自动语音识别等任务。数据集包含5,000个分片,总计5,000,000个声景配方,规模在100万到1000万之间。数据内容涵盖多语言语音、音乐、音效和人声爆发等多种音频类型。每个数据行(对应一个声景配方)包含一个完整的配方文件(recipe.json),其中详细记录了时间线、事件、响度、说话人ID、重叠/密度等设置;以及对应的原始音频组件文件:语音组件(.flac音频及.json元数据)、音乐组件(.flac音频及字幕)、音效组件(.flac音频及字幕)和人声爆发组件(.flac音频及元数据)。数据以WebDataset .tar分片格式组织,每个分片包含1000个片段。数据来源于多个公开数据集,包括多语言语音、带字幕的AI音乐片段、合成的音效事件以及合成的人声爆发。数据生成的第一阶段(CPU处理)包括配方采样、从源数据集中抽取原始音频片段、解码并重采样至16 kHz单声道FLAC、计算精确的混音计划(包含真实时间、响度、说话人ID)以及收集完整的源元数据。配方设计采用了10种不同的原型(如平衡三重奏、语音主导、音乐主导等),并设定了响度梯度(从“非常安静”到“非常响亮”)和时长波段(从5-10秒的“微短”到40-60秒的“长”),以覆盖多样化的声景场景。

Advanced Soundscapes Stage 1 — Raw Components (5M) dataset is the first-stage output of the LAION Universal Audio Annotation Pipeline (UAAP) data generation plan. This dataset aims to provide structured raw audio components for synthesizing complex soundscapes, suitable for tasks such as audio classification and automatic speech recognition. The dataset contains 5,000 shards, totaling 5,000,000 soundscape recipes, with a scale between 1 million and 10 million. The data content covers various audio types including multilingual speech, music, sound effects, and vocal bursts. Each data row (corresponding to a soundscape recipe) includes a complete recipe file (recipe.json), which details settings such as timeline, events, loudness, speaker ID, overlap/density, etc.; and corresponding raw audio component files: speech components (.flac audio and .json metadata), music components (.flac audio and captions), sound effect components (.flac audio and captions), and vocal burst components (.flac audio and metadata). The data is organized in WebDataset .tar shard format, with each shard containing 1,000 segments. The data is sourced from multiple public datasets, including multilingual speech, AI-generated music clips with captions, synthetic sound effect events, and synthetic vocal bursts. The first stage of data generation (CPU processing) involves recipe sampling, extracting raw audio segments from source datasets, decoding and resampling to 16 kHz mono FLAC, computing precise mixing plans (including real-time, loudness, speaker ID), and collecting complete source metadata. The recipe design employs 10 different prototypes (such as balanced trio, speech-dominant, music-dominant, etc.), and sets loudness gradients (from very quiet to very loud) and duration bands (from micro-short at 5-10 seconds to long at 40-60 seconds) to cover diverse soundscape scenarios.

创建时间:
2026-06-24
原始信息汇总

数据集概述:Advanced Soundscapes Stage 1 — Raw Components (5M)

  • 许可证:CC-BY-4.0
  • 任务类别:音频分类、自动语音识别
  • 语言:多语言(英语、德语、法语、西班牙语、中文、日语、韩语等)
  • 标签:声景、合成音频、语音、音乐、音效、UAAP
  • 规模:1M < 样本数 < 10M

该数据集是 LAION 通用音频注释管道(UAAP)数据生成计划的阶段 1 输出。

内容

  • 包含 5,000 个分片,总计 5,000,000 条声景配方,每条配方包含原始音频组件。
  • 每条声景行包含:
    • recipe.json:完整配方,含时间线、事件、响度、说话人 ID、重叠/密度设置。
    • spkN.flac / spkN.json:原始语音组件及完整源元数据。
    • musicN.flac / musicN.json:原始音乐组件及标题。
    • sfxN.flac / sfxN.json:原始音效组件及标题。
    • vbN.flac / vbN.json:原始人声爆发组件及元数据。

格式

  • 格式:WebDataset .tar 分片,每个分片含 1000 个片段。每条记录为以片段 ID 为键的 tar 内目录。

源数据集

类型 许可证
laion/majestrino-data 语音(约 50 种语言) CC0
laion/captioned-ai-music-snippets 音乐(3–30 秒) Apache-2.0
laion/generated-sound-events 音效(合成,1190 类) NC-verify
laion/synthetic_vocal_bursts 人声爆发 许可宽松

阶段 1 流程

阶段 1 仅为 CPU 处理,步骤包括:

  1. 采样配方(原型、时长、密度、重叠、说话人配置)。
  2. 从源数据集中提取原始音频片段(语言平衡、去重)。
  3. 解码并重采样为 16 kHz 单声道 FLAC。
  4. 计算精确混合计划(真实时间、响度、说话人 ID)。
  5. 收集完整源元数据。
  6. 写入 WebDataset 行。

阶段 2(GPU)将:为缺失字段生成标题,通过 Gemma-4-12B 融合,渲染最终混合 MP3。

配方原型

原型 权重 语音% 音乐% 音效%
平衡三重唱 14% 34% 33% 33%
语音主导 16% 70% 15% 15%
音乐主导 11% 12% 76% 12%
音效主导 11% 12% 12% 76%
仅语音 13% 100% 0% 0%
仅音乐 6% 0% 100% 0%
仅音效 8% 0% 0% 100%
语音+音乐 8% 55% 45% 0%
语音+音效 9% 55% 0% 45%
音乐+音效 4% 0% 50% 50%

响度等级

标签 RMS 增益
very_quiet 0.020
quiet 0.040
moderate 0.075
loud 0.120
very_loud 0.180

时长区间

区间 范围 权重
5–10 秒 18%
10–20 秒 32%
20–40 秒 32%
40–60 秒 18%
搜集汇总
数据集介绍
advanced-soundscapes-stage-1 数据集图片
构建方式
该数据集是LAION通用音频标注流水线(UAAP)数据生成计划的第一阶段产出,旨在为复杂声景合成提供结构化音频素材。构建过程完全依赖CPU运算,首先从预定义的原型模板中采样声景配方,涵盖持续时间、密度、重叠度及说话人配置等参数;随后从多个源数据集中抽取原始音频片段,确保语言平衡与去重;接着将音频解码并重采样至16 kHz单声道FLAC格式;最后计算精确的混音计划,记录真实时间轴、响度及说话人ID,并整合完整源元数据,以WebDataset格式打包为5000个tar分片,每个分片含1000条音频记录。
特点
数据集内含500万条声景配方及对应的原始音频组件,每个条目均包含完整的配方JSON文件及语音、音乐、音效、人声爆发等原始音轨及其元数据。其核心特点在于模块化设计,支持九种原型配方(如语音主导、音乐主导、平衡三元素等),并配备精细的响度阶梯(从极静至极响共五级)与时长分带(5至60秒四种长度),为下游混合与合成提供了高度可控的声学素材库。
使用方法
数据集以WebDataset的tar分片形式存储,每个分片内以剪辑ID为键的目录组织音频文件与元数据。使用者可直接基于recipes.json中的时间线、事件及响度信息进行自定义混合,或利用语音、音乐、音效等独立组件开展特定任务(如音频分类、语音识别)。值得注意的是,该阶段仅包含原始组件与配比计划,最终的合成混音文件需通过第二阶段GPU流水线生成,该阶段将利用Gemma-4-12B模型生成缺失标注并进行混合渲染。
背景与挑战
背景概述
在音频智能处理领域,复杂声学场景的建模与理解始终是一项极具挑战性的课题,尤其是当场景中同时包含语音、音乐、音效及人声爆发等多种声源时,传统的单源音频数据集已难以支撑多模态、多语种、多事件叠加的深度研究需求。为突破这一瓶颈,LAION(Large-scale Artificial Intelligence Open Network)团队于近期推出了Advanced Soundscapes Stage 1数据集,该数据集依托通用音频标注管道(UAAP)生成方案,汇聚了来自Majestrino、Captioned AI Music Snippets、Generated Sound Events及Synthetic Vocal Bursts等优质源数据,构建出包含500万条音频配方与5000个分片的庞大规模库。这些配方覆盖十种声源组合原型(如语音主导、音乐主导、平衡三要素等),并精细控制时长(5至60秒)、响度层级及重叠密度,为语音识别、音频分类、源分离及空间音频理解等任务提供了高度可控且真实可溯的生成数据基础。其开源策展与合成范式不仅弥合了自然录音中标签稀疏、场景受限的不足,更在多语言(涵盖英、德、法、西、中、日、韩等)及多类型声源融合领域树立了新的基准,对推动通用听觉模型的发展具有里程碑意义。
当前挑战
该数据集所面临的核心挑战首先源于领域问题的复杂演进:传统声学场景分析多假设声源稀疏或单源主导,而现实世界的声音环境往往交织着语音、音乐、音效及人声爆发等异构信号,且存在动态响度变化、时长不均及重叠密度非对称等问题,这直接对模型的源分离能力、多标签语义理解及跨场景泛化提出了更高要求。其次,在数据集构建过程中亦遭遇多重技术瓶颈:合成阶段的CPU-only流水线虽保证了处理的确定性,却限制了大规模实时迭代的效率;源数据采样需要平衡多语言比例并规避重复片段,同时维护音乐、音效等版权素材的许可合规性;此外,如何通过精确的配方参数(如事件时间轴、说话人ID、重叠设置)生成物理上可信的混合信号,并在无标注缺失的字段中后续借助Gemma-4-12B等语言模型补全描述,这均构成了从模拟到真实对齐的严苛考验。这些挑战不仅关乎数据集自身的质量与规模,更影响着下游模型在真实嘈杂环境中的鲁棒性评估与迁移学习效果。
常用场景
经典使用场景
该数据集专为多源音频场景理解与合成而设计,经典使用场景聚焦于声学事件的精细建模与多模态音频表征学习。研究者和工程师可利用其中包含的语音、音乐、音效及人声爆发片段,联合相应的元数据与配方信息,构建能够解析复杂声景组成成分的深度学习模型。数据集以带时间线的事件序列和精确响度层级为结构,为音频场景分割、源分离与事件检测等任务提供了坚实的基础训练资源,尤其适用于探索可控声景合成的前沿方向。
解决学术问题
在学术研究层面,该数据集有效回应了自然声景中多源信号交织带来的标注困难和模型泛化瓶颈。传统音频数据集多局限于单一类型或简单叠加,而本数据集通过系统化的配方原型设计与源数据精细调度,为音频场景的组成拆解与因果推理提供了高保真训练素材。其提供的精确事件时间戳和响度控制参数,能够支撑对音频场景构成机制进行定量分析,推动声源分离、音频描述生成以及多语言声景理解等任务的学术进展,具有重要的方法论价值。
衍生相关工作
该数据集的衍生影响体现在催生了一系列围绕可控声景合成与理解的研究工作。LAION通用音频注释管线的提出,为大规模合成音频数据集的生产建立了标准化流程。后续研究工作可基于此数据集探索声学事件的关系建模、跨语言音频内容的统一表征以及利用大语言模型进行音频场景描述的自动化生成。此外,数据集的模块化设计思路也启发了更具扩展性的多源音频数据集构建范式,促进了音频生成与理解领域的交叉融合与范式革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务