ParaPairAudioBench
收藏资源简介:
ParaPairAudioBench是一个用于LALM-as-a-Judge评估的副语言成对音频基准数据集,包含5,175个成对音频样本,涵盖年龄、性别、语速、强调和风格五个副语言维度,旨在支持多维度、校准感知的评估。
ParaPairAudioBench is a paralinguistic paired audio benchmark dataset for LALM-as-a-Judge evaluation. It contains 5,175 paired audio samples covering five paralinguistic dimensions including age, gender, speech rate, emphasis, and style, and is designed to support multi-dimensional, calibrated perceptual assessments.
数据集概述:ParaPairAudioBench
ParaPairAudioBench 是一个用于评估大型音频语言模型(LALM)作为评判者的副语言成对音频基准测试集。该研究将在 Interspeech 2026 上发表,重点关注细粒度的副语言区分能力,而非整体的自然度。
数据集规模与结构
数据集包含 5,175 对音频样本,沿三个独立轴组织:属性 (Attribute)、平局条件 (Tie condition) 和 转录本 (Transcript)。总体非平局样本占 53.3%,平局样本占 46.7%,旨在同时测试模型的区分能力和避免幻觉(错误平局)的能力。
样本数量分布
| 标准 (Criterion) | 总数 | 非平局 | 平局 | 相同转录本 | 不同转录本 | 数据来源 |
|---|---|---|---|---|---|---|
| 年龄 (Age) | 1,500 | 750 | 750 | — | — | SVC |
| 性别 (Gender) | 1,000 | 500 | 500 | — | — | SVC + LibriTTS |
| 语速 (Speech Rate) | 375 | 375 | 0 | 375 | 0 | EARS |
| 重音 (Emphasis) | 860 | 415 | 445 | 445 | 415 | Expresso |
| 风格 (Style) | 1,440 | 720 | 720 | 362 | 1,078 | Expresso |
| 总计 | 5,175 | 2,760 | 2,415 |
评估标准
| 标准 | 描述 | 标签 | 来源数据集地址 |
|---|---|---|---|
| 🧓 年龄 | 区分说话者的年龄段 | Child · Teen · Adult · MiddleAged · Elderly | SVC |
| 🚻 性别 | 识别说话者性别的一致性 | Male · Female | SVC + LibriTTS |
| ⏱️ 语速 | 比较说话的相对速度 | slower · faster | EARS |
| 🔊 重音 | 识别词汇重音和焦点突出 | word-level | Expresso |
| 🎭 风格 | 表达情感和说话风格的丰富度 | confused · default · enunciated · happy · laughing · sad · whisper | Expresso |
基准测试结果
在五个评估标准上,比较了五种LALM模型和人类的表现。结果显示,所有模型与人类表现之间存在约20个百分点的差距。目前表现最好的模型是 Gemini 2.5 Flash,平均准确率为 61.5%,而人类平均准确率为 79.2%。其他模型表现如下:
- GPT-4o Audio: 平均 46.4%
- Kimi-Audio-7B: 平均 50.2%
- Qwen2.5-Omni-7B: 平均 44.0%
- SpeechJudge-7B: 平均 33.8%
数据文件与使用
已可直接使用的基准测试
数据集的语速 (rate)、重音 (emphasis) 和风格 (style) 基准测试文件已准备就绪,位于 data/benchmarks/ 目录下,包含配对文件和用于位置偏差评估的交换位置版本文件 (_swap)。
需自行构建的基准测试
年龄 (age) 和性别 (gender) 基准测试需要从SVC数据集构建,该数据集的访问需手动申请。构建过程使用提供的Python脚本 (scripts/build_age.py 和 scripts/build_gender.py) 完成。
数据格式
所有基准文件使用统一的JSON格式,包含 id、audio_a、audio_b、answer ([[A]], [[B]], 或 [[Tie]])、difficulty、target_label 和 meta_info(包含任务类型、是否为平局、转录本是否匹配等元信息)字段。
第三方数据集归属与许可
| 数据集 | 贡献标准 | 许可协议 |
|---|---|---|
| SVC Bias Assessment | 年龄, 性别 | 非商业学术研究 |
| LibriTTS | 性别 | CC BY 4.0 |
| EARS | 语速 | CC BY-NC 4.0 |
| Expresso | 重音, 风格 | CC BY-NC 4.0 |





