SonicBench
收藏资源简介:
SonicBench是一个基于心理物理学的基准测试,旨在探测物理音频感知而非语义理解。它包括12个核心属性×5个感知维度×2种范式(识别与比较)= 2,400个问题-音频对。现有的大型音频语言模型在语义和副语言表现上虽强,但在物理感知上表现接近随机,且未能显示出在比较任务上的人类优势。
SonicBench is a psychophysics-based benchmark designed to probe physical audio perception rather than semantic understanding. It includes 12 core attributes × 5 perceptual dimensions × 2 paradigms (recognition and comparison), totaling 2,400 question-audio pairs. While existing large audio language models perform strongly in semantic and paralinguistic tasks, their performance on physical perception-related tasks is close to random, and they fail to exhibit the human advantage in comparison tasks.
SonicBench 数据集概述
数据集简介
SonicBench 是一个基于心理物理学的基准测试,旨在探究大型音频语言模型(LALMs)的物理音频感知能力,而非语义理解能力。该数据集包含 2,400 个问题-音频对,用于系统评估模型对音频信号内在物理属性的感知。
核心构成
- 物理属性:涵盖 12 个核心物理属性,分为 5 个感知维度。
- 任务范式:包含两种互补的心理物理范式。
- 数据规模:12 个属性 × 2 种任务类型 × 100 个项目 = 2,400 个问题-音频对。
感知维度与属性
- 频谱与振幅维度
- 属性:
pitch(音高)、brightness(亮度)、loudness(响度)、velocity(速度)。
- 属性:
- 时间维度
- 属性:
duration(时长)、tempo(速度)。
- 属性:
- 空间与环境维度
- 属性:
direction(方向)、distance(距离)、reverberation(混响)。
- 属性:
- 音色维度
- 属性:
timbre(音色)、texture(纹理)。
- 属性:
- 场景级别维度
- 属性:
counting(计数)。
- 属性:
任务范式
-
识别任务(绝对判断)
- 输入:单个 4 秒音频片段。
- 任务:在两个物理类别之间做出绝对决策。
- 输出:
"A"或"B"。
-
比较任务(相对判断)
- 输入:两个 4 秒音频片段,中间以 0.5 秒静音连接。
- 任务:判断哪个片段在给定属性上具有更大的值。
- 输出:
"A"(若第一段更大)或"B"。
关键发现
- 现有模型在物理感知任务上表现接近随机猜测。
- 模型在比较任务上未表现出类似人类的优势。
- 推理时链式思考带来的改进有限。
- 编码器感知到的信息多于完整模型所能利用的信息。
主要用途
- 评估 LALMs、LARMs 和 OLMs 的物理基础能力。
- 进行属性级和维度级诊断。
- 研究识别与比较任务的行为差异。
- 进行编码器探测和架构分析。
数据访问
- 所有数据集文件托管于 Hugging Face:https://huggingface.co/datasets/YirongSun/SonicBench
- 本仓库提供 SonicBench 工具箱和 36 个系统的完整推理输出。
引用
如使用 SonicBench,请引用相关论文。




