遇见数据集

soundscape-bench

收藏
Hugging Face2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

SoundScape-Bench 是一个专为评估通用音频标注任务而设计的多语言声景基准数据集。该任务要求模型全面描述音频片段中的所有可听内容,包括语音(谁在何时、以何种语言、如何说话)、声音效果、音乐和人声爆发,并将这些信息组织成一个结构化的 JSON 列表。本数据集是 LAION 通用音频标注流程(UAAP)的配套基准。数据集包含 200 个精心构建的声景音频片段(格式为 16 kHz 单声道 MP3),每个片段时长在 10 至 60 秒之间(平均 35 秒)。其核心特点是所有片段均由已知且已理解的音频元素(来自特定源数据集的语音、音效、音乐、人声爆发片段)在时间线上组合而成。因此,每个片段都拥有一个精确的、由构建过程决定的完美答案,使得评分可以完全自动化,无需人工或大语言模型评判。数据内容统计如下:总计 796 个标注事件,包括 342 个语音事件、199 个声音事件、140 个人声爆发事件和 115 个音乐事件。语音覆盖六种语言:英语、德语、法语、中文(各 69 个片段)、西班牙语(54 个)和荷兰语(12 个)。约 18% 的片段包含时间上重叠的语音轮次,增加了任务复杂性。每个音频片段都配有一个结构化的 JSON 答案文件。答案遵循统一的 UAAP 模式,包含片段 ID、时长、说话人数量、语言列表以及事件列表。事件分为四种类型(speech, vocal_burst, sound_event, music),每种类型都包含精确的时间戳(start_time, end_time)和丰富的属性描述。例如,语音事件包含转录文本、说话人 ID、语言、情感、年龄、性别、音色和说话风格;声音事件和音乐事件包含自然语言描述和响度;人声爆发事件包含爆发类型和情感。所有片段的答案也整合在一个 `answers.jsonl` 文件中。数据集的评估采用Reward指标,该指标通过匈牙利算法在预测事件和答案事件之间进行按类型匹配。每个匹配对的得分是时间重叠度(IoU)与内容相似度的乘积。对于语音,内容相似度是情感/风格描述余弦相似度与转录词错误率(WER)得分的加权组合;对于其他类型,则使用描述文本的余弦相似度。该指标旨在全面衡量模型在识别、定位和描述复杂音频场景中各类事件的能力。数据集音频内容来源于多个公开数据集:语音来自 EmoIA-HQ、Multilingual LibriSpeech 和 Emilia-Dataset;声音效果来自 AudioSet with grounded captions;音乐来自 Captioned AI Music Snippets;人声爆发来自 Improved Synthetic Vocal Bursts。数据集整体的包装和答案密钥以 CC-BY-4.0 许可发布,但提醒用户注意底层源数据集的许可,并强调该基准主要用于研究和评估目的。

SoundScape-Bench is a multilingual soundscape benchmark dataset specifically designed for evaluating general audio captioning tasks. This task requires models to comprehensively describe all audible content in an audio clip, including speech (who spoke when, in what language and how they spoke), sound effects, music, and vocal bursts, and organize this information into a structured JSON list. This dataset is a companion benchmark to the LAION Universal Audio Annotation Pipeline (UAAP). The dataset contains 200 meticulously constructed soundscape audio clips formatted as 16 kHz mono MP3, with each clip lasting between 10 and 60 seconds (averaging 35 seconds). The core characteristic of this dataset is that all clips are temporally assembled from known and well-characterized audio elements: speech, sound effects, music, and vocal burst segments sourced from specific upstream datasets. Thus, each clip has a precise ground truth answer determined by the construction process, enabling fully automated evaluation without requiring human or large language model (LLM) judgment. The dataset's content statistics are as follows: a total of 796 annotated events, including 342 speech events, 199 sound events, 140 vocal burst events, and 115 music events. Speech events cover six languages: English, German, French, and Chinese (69 clips each), Spanish (54 clips), and Dutch (12 clips). Approximately 18% of the clips contain temporally overlapping speech turns, increasing the task's complexity. Each audio clip is paired with a structured JSON answer file. The answers follow a unified UAAP schema, including clip ID, duration, number of speakers, language list, and event list. Events are categorized into four types: speech, vocal_burst, sound_event, and music, with each type containing precise timestamps (start_time, end_time) and rich attribute descriptions. For example, speech events include transcript text, speaker ID, language, emotion, age, gender, timbre, and speaking style; sound and music events include natural language descriptions and loudness; vocal burst events include burst type and emotion. The answers for all clips are also consolidated into a single `answers.jsonl` file. The dataset uses the Reward metric for evaluation, which performs type-wise matching between predicted events and ground truth events via the Hungarian algorithm. The score for each matched pair is the product of temporal intersection over union (IoU) and content similarity. For speech events, content similarity is a weighted combination of the cosine similarity of emotion/style descriptions and the word error rate (WER) score of the transcript; for other event types, cosine similarity of the descriptive text is used instead. This metric is designed to comprehensively evaluate a model's ability to identify, localize, and describe various events in complex audio scenes. The audio content of the dataset is sourced from multiple public datasets: speech segments are taken from EmoIA-HQ, Multilingual LibriSpeech, and Emilia-Dataset; sound effects from AudioSet with grounded captions; music from Captioned AI Music Snippets; and vocal bursts from Improved Synthetic Vocal Bursts. The overall packaging and answer keys of the dataset are released under the CC-BY-4.0 license, but users are reminded to adhere to the licenses of the underlying source datasets, and the benchmark is primarily intended for research and evaluation purposes.

提供机构:
LAION eV
创建时间:
2026-06-11
原始信息汇总

数据集概述:SoundScape-Bench

SoundScape-Bench 是一个用于评估“通用音频标注”(universal audio annotation)任务的多语言基准数据集。该任务要求模型将音频片段中所有可听见的内容(包括语音、说话人信息、时间、语言、表达方式、音效、音乐和声音爆发)描述为一个结构化的JSON列表。

核心特性

  • 设计目标:为自动化的音频标注系统提供精确、可自动评分的参考答案,避免人工评分或LLM评判的偏差。
  • 构建方式:每个音频片段由已知的语音、音效、音乐和声音爆发片段拼接而成,因此其“完美答案”在构建时即可确定,支持100%自动化评分。
  • 许可证:CC-BY-4.0(数据集打包和答案键);内源数据集保留各自原始许可,适用于研究/评估用途。

数据集内容

  • 音频数量:200个测试片段(clips/clip_NNN.mp3,16 kHz单声道)。
  • 持续时间:10-60秒(平均35秒),时长分布均匀。
  • 事件数量:包含342个语音事件、199个音效事件、140个声音爆发事件、115个音乐事件。
  • 语音语言:英语、德语、法语、中文各69个,西班牙语54个,荷兰语12个。
  • 特殊性质:约18%的片段包含时间上重叠的语音。

文件结构

  • clips/clip_NNN.mp3:音频文件。
  • clips/clip_NNN.json:每个片段的单独答案键。
  • answers.jsonl:合并后的答案文件,每行一个JSON对象,包含audio字段指向对应mp3。
  • PROTOCOL.md:构建日志。

答案键格式(UAAP模式)

每个剪辑的JSON包含clip_iddurationnum_speakerslanguagesevents字段。事件分为四种类型,示例如下:

  • 语音(speech):包含开始/结束时间、转录文本、说话人ID、语言、情绪、年龄、性别、音色、说话风格。
  • 声音爆发(vocal_burst):包含开始/结束时间、说话人ID、爆发类型、情绪。
  • 音效(sound_event):包含开始/结束时间、描述、响度。
  • 音乐(music):包含开始/结束时间、描述、响度。

评分机制(Reward指标)

  • 过程:对每种事件类型,在预测事件与答案键事件之间进行匈牙利匹配。
  • 分数计算:每对匹配事件的得分为 IoU(时间) × 内容,其中:
    • 语音的内容分 = 0.5 × 情绪/风格标题的余弦相似度 + 0.5 × (1 - 转录的WER,中文用字符级WER)
    • 音乐、音效、声音爆发的内容分 = 标题的余弦相似度(使用google/embedding-gemma-300m
    • WER计算使用jiwer
  • 最终分数:在所有答案键事件上的平均分(遗漏事件得0分)。

排行榜(Reward分数,完整200个测试集)

排名 系统 Reward
1 Gemini 3.1 Pro (omni) 0.297
2 Gemini 3.5 Flash (omni) 0.256
3 UAAP Gemma-12B + DiCoW(pipeline默认) 0.253
4 UAAP Nemotron+VibeVoice → Gemma (MOSS-free) 0.236
5 UAAP Gemma + DiCoW 0.233
6 Gemini 3 Flash (omni) 0.212
7 UAAP legacy triple-ASR ensemble 0.196
8 GPT-Audio 1.5 (omni) 0.097

数据来源与许可

  • 语音:来自 laion/emolia-hq(英语/德语/法语)、facebook/multilingual_librispeech(西班牙语/荷兰语)、amphion/Emilia-Dataset(中文);语音“表达方式”标题由 laion/BUD-E-Whisper_V1.21 重新生成。
  • 音效:来自 mitermix/audioset-with-grounded-captions(源自YouTube,AudioSet)。
  • 音乐:来自 laion/captioned-ai-music-snippets
  • 声音爆发:来自 laion/improved_synthetic_vocal_burts

使用方式(Python)

python from datasets import load_dataset ds = load_dataset("laion/soundscape-bench", split="test") # 读取answers.jsonl ex = ds[0]; print(ex["clip_id"], ex["duration"], ex["languages"], len(ex["events"]))

音频文件:ex["audio"] -> clips/clip_000.mp3(需同时下载clips/文件夹)

搜集汇总
数据集介绍
soundscape-bench 数据集图片
构建方式
SoundScape-Bench的构建基于一种精巧的合成策略,将已知的语音片段、音效、音乐片段及人声爆发等音频元素按照精准的时间线拼接成200个多语种声景片段。每个片段均源自已标注或已理解的数据源,包括来自多个公开数据集的语音、音效、音乐和人声爆发。通过这种受控的组装方式,数据集的真实答案由构建过程天然生成,无需人工标注或大语言模型参与评分,从而实现完全自动化的评估。
使用方法
使用SoundScape-Bench时,可通过HuggingFace的datasets库加载数据集,直接读取测试集并获取每个片段的音频文件及结构化答案。评分采用匈牙利算法对预测事件与答案键事件进行逐类型匹配,并基于时间交并比与内容相似度计算奖励得分,其中语音内容评估结合情感描述余弦相似度与转录词错误率,其他事件则依赖嵌入向量余弦相似度。该基准设计的评分机制支持自动执行,便于系统性能的快速比较与迭代优化。
背景与挑战
背景概述
SoundScape-Bench 是由 LAION 研究团队于近期构建的基准数据集,旨在评估“通用音频标注”任务——即从混合语音、声效、音乐及人声爆发等维度,对一段音频进行结构化 JSON 描述。该数据集通过拼接已知语音片段、声效、音乐和爆发音生成 200 个多语种声景片,时长 10 至 60 秒,涵盖英语、德语、法语、中文等六种语言。其核心创新在于利用已知组装元件自动生成完美答案,消除了人工评分的主观偏差,为自动语音识别、声事件检测、说话人日志及情感识别等研究领域提供了可重复、量化的评测基准。该数据集已在多模态音频理解领域引发关注,其提出的“Reward”指标结合了时序交并比与内容相似度,推动了音频标注系统向细粒度、高精度方向发展。
当前挑战
SoundScape-Bench 面临的核心挑战在于解决真实场景中多源音频叠加的复杂性问题。首先,音频标注任务需同时处理语音、声效、音乐和人声爆发等异质事件,并精确捕捉其时间边界、语种、说话人身份及情感特质,这对多任务联合建模能力提出极高要求。其次,数据集中约 18% 的样本包含时间重叠的语音轮次,重叠语音的分割与标注是当前技术的瓶颈,易引发混淆和漏检。在构建过程中,研究团队需确保拼接片段的自然性与现实噪声分布的一致性,并平衡多语种、多事件的共现频率以避免数据集偏差。此外,自动评分机制中嵌入式模型对情感和风格描述的语义匹配能力尚不完善,限制了评测的全面性和鲁棒性。
常用场景
经典使用场景
SoundScape-Bench作为通用音频标注(Universal Audio Annotation)领域的标杆性评估基准,其最经典的使用场景在于系统性地评测模型对复杂音频场景中多维度声学信息的解析能力。该数据集精心构造了200条多语言音景片段,每条音频都融合了语音、声效、音乐和发声爆发四种事件类型,并伴有精确的时间戳、说话人身份、语言、情感、音色等结构化标注。研究者可利用此基准对模型进行全自动评分,无需人工评审或大语言模型辅助判断,从而客观衡量模型在说话人日记化、情感识别、声音事件检测、语种识别以及跨模态内容理解等任务上的综合表现。
解决学术问题
SoundScape-Bench主要解决了音频理解领域中缺乏高质量、多维度、可自动评估的基准数据集这一长期困扰学界的核心难题。现有数据集多聚焦单一任务(如仅语音识别或仅环境声音分类),难以支撑对通用音频理解模型的全面评估。该基准通过合成已知来源的音频片段,天然拥有完美标注,消除了人工标注的不一致性和成本,使研究者能够精准诊断模型在复杂重叠场景下的缺陷所在。其意义在于推动了从孤立任务向统一音频理解的范式转变,并提供了可复现、可比较的评估标准,为构建真正理解人类听觉场景的智能系统奠定了坚实基础。
实际应用
在实际应用层面,SoundScape-Bench为多种音频智能系统提供技术验证与迭代优化平台。智能会议系统可借此基准验证其同时追踪多语种说话人、识别说话人情绪状态以及捕捉背景环境声事件的能力;智能家居场景中,该基准有助于评估设备区分命令语音与背景音乐或宠物叫声的精确度;在辅助听力技术领域,它可用于测试音频描述系统为听障用户提供完整声学场景描述的准确性。此外,内容审核和媒体分析工具也能利用此基准优化其对混有多语种语音和复杂音效的长音频的自动化标注与索引能力,从而提升实际部署中的鲁棒性与泛化性能。
数据集最近研究
最新研究方向
SoundScape-Bench作为首个面向通用音频标注任务的全面基准,正推动多模态语言模型在复杂声场景理解领域的评估范式革新。该数据集通过巧妙构造已知音频片段的时间拼接,实现了完全自动化的评分机制,无需人工标注或大语言模型判断,为评估模型在重叠语音、多语种、情感识别、声事件检测及音乐描述等综合任务上的表现提供了精准标尺。结合LAION通用音频标注管线的评比结果,当前前沿研究聚焦于提升模型在细粒度语音属性(如说话人身份、情感强度、嗓音特质)与结构化事件序列联合建模上的能力,尤其是如何弥合单模态与全模态系统间的性能鸿沟,这一方向有望深刻影响智能听觉感知系统在人机交互、多媒体内容分析与无障碍技术中的应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务