遇见数据集

ParaPairAudioBench

收藏
github2026-06-16 更新2026-07-03 收录
官方服务:

资源简介:

ParaPairAudioBench是一个用于LALM-as-a-Judge评估的副语言成对音频基准数据集,包含5,175个成对音频样本,涵盖年龄、性别、语速、强调和风格五个副语言维度,旨在支持多维度、校准感知的评估。

ParaPairAudioBench is a paralinguistic paired audio benchmark dataset for LALM-as-a-Judge evaluation. It contains 5,175 paired audio samples covering five paralinguistic dimensions including age, gender, speech rate, emphasis, and style, and is designed to support multi-dimensional, calibrated perceptual assessments.

创建时间:
2026-06-16
原始信息汇总

数据集概述:ParaPairAudioBench

ParaPairAudioBench 是一个用于评估大型音频语言模型(LALM)作为评判者的副语言成对音频基准测试集。该研究将在 Interspeech 2026 上发表,重点关注细粒度的副语言区分能力,而非整体的自然度。

数据集规模与结构

数据集包含 5,175 对音频样本,沿三个独立轴组织:属性 (Attribute)平局条件 (Tie condition)转录本 (Transcript)。总体非平局样本占 53.3%,平局样本占 46.7%,旨在同时测试模型的区分能力和避免幻觉(错误平局)的能力。

样本数量分布

标准 (Criterion) 总数 非平局 平局 相同转录本 不同转录本 数据来源
年龄 (Age) 1,500 750 750 SVC
性别 (Gender) 1,000 500 500 SVC + LibriTTS
语速 (Speech Rate) 375 375 0 375 0 EARS
重音 (Emphasis) 860 415 445 445 415 Expresso
风格 (Style) 1,440 720 720 362 1,078 Expresso
总计 5,175 2,760 2,415

评估标准

标准 描述 标签 来源数据集地址
🧓 年龄 区分说话者的年龄段 Child · Teen · Adult · MiddleAged · Elderly SVC
🚻 性别 识别说话者性别的一致性 Male · Female SVC + LibriTTS
⏱️ 语速 比较说话的相对速度 slower · faster EARS
🔊 重音 识别词汇重音和焦点突出 word-level Expresso
🎭 风格 表达情感和说话风格的丰富度 confused · default · enunciated · happy · laughing · sad · whisper Expresso

基准测试结果

在五个评估标准上,比较了五种LALM模型和人类的表现。结果显示,所有模型与人类表现之间存在约20个百分点的差距。目前表现最好的模型是 Gemini 2.5 Flash,平均准确率为 61.5%,而人类平均准确率为 79.2%。其他模型表现如下:

  • GPT-4o Audio: 平均 46.4%
  • Kimi-Audio-7B: 平均 50.2%
  • Qwen2.5-Omni-7B: 平均 44.0%
  • SpeechJudge-7B: 平均 33.8%

数据文件与使用

已可直接使用的基准测试

数据集的语速 (rate)、重音 (emphasis) 和风格 (style) 基准测试文件已准备就绪,位于 data/benchmarks/ 目录下,包含配对文件和用于位置偏差评估的交换位置版本文件 (_swap)。

需自行构建的基准测试

年龄 (age) 和性别 (gender) 基准测试需要从SVC数据集构建,该数据集的访问需手动申请。构建过程使用提供的Python脚本 (scripts/build_age.pyscripts/build_gender.py) 完成。

数据格式

所有基准文件使用统一的JSON格式,包含 idaudio_aaudio_banswer ([[A]], [[B]], 或 [[Tie]])、difficultytarget_labelmeta_info(包含任务类型、是否为平局、转录本是否匹配等元信息)字段。

第三方数据集归属与许可

数据集 贡献标准 许可协议
SVC Bias Assessment 年龄, 性别 非商业学术研究
LibriTTS 性别 CC BY 4.0
EARS 语速 CC BY-NC 4.0
Expresso 重音, 风格 CC BY-NC 4.0
搜集汇总
数据集介绍
ParaPairAudioBench 数据集图片
构建方式
ParaPairAudioBench 的构建旨在弥补现有 LALM-as-a-Judge 方法仅聚焦整体自然度而忽略细粒度副语言区分的不足。该数据集整合了 SVC、LibriTTS、EARS 和 Expresso 四个公开语音数据集,从中精心筛选并构造了 5,175 对音频样本,覆盖年龄、性别、语速、强调和风格五个副语言维度。每对样本依据“属性”、“平局条件”和“文本一致性”三个独立轴进行组织,其中非平局与平局样本的比例接近平衡(53.3% 对 46.7%),以有效测试模型的判别能力与幻觉规避能力。对于年龄和性别任务,需通过访问受控的 SVC 数据集并运行提供的构建脚本来生成基准文件;而语速、强调和风格基准则直接可用。
特点
该数据集的核心特色在于其多维度的设计与校准感知的评估框架。ParaPairAudioBench 不仅覆盖了年龄、性别、语速、强调和风格五个副语言属性,还通过引入平局样本(Tie)全面评估模型在模糊情况下的判断能力与幻觉倾向,这与仅关注二元胜负的传统基准形成鲜明对比。此外,数据集通过控制音频对是否共享相同文本来分离声学特征与词汇信息的影响,支持对模型判断鲁棒性的细粒度分析。实验表明,当前最优 LALM 在该基准上的平均准确率仅为 61.5%,相较于人类表现存在约 20 个百分点的显著差距,且普遍存在严重的位置偏差与一致性不足问题,凸显了该基准在揭示模型短板方面的独特价值。
使用方法
ParaPairAudioBench 的使用流程简洁而灵活。研究者可直接使用 data/benchmarks 目录下预先构建好的语速、强调和风格基准 JSON 文件,每个文件均包含原始排序与位置交换两种变体以评估位置偏差。对于年龄和性别基准,需先申请获取 SVC 数据集的访问权限,并执行 scripts 目录下对应的构建脚本(如 build_age.py)以生成所需的 JSON 文件。所有基准文件均采用统一的 JSON 结构,内含音频路径、正确答案(A/B/Tie)、难度标注及丰富的元信息,便于直接集成到各类 LALM 评估流水线中。评估时,模型需根据给定的成对音频输出比较结果,系统会自动计算各维度下的准确率、一致性与偏差指标。
背景与挑战
背景概述
在听觉智能领域,大型音频语言模型(LALM)作为裁判的评估范式正日益受到关注。然而,既往研究多聚焦于音频的整体自然度评判,忽视了细粒度副语言特征的甄别能力。为填补这一空白,Jisu Jeon等研究团队于2025年(Interspeech 2026发表)构建了ParaPairAudioBench数据集,系统性地针对年龄、性别、语速、重音及风格五种副语言维度,设计了5,175对成对音频样本。该工作为LALM裁判在多元副语言属性上的校准感知评估提供了标准化测试平台,揭示了现有模型与人类表现之间约20%的显著差距,对语音交互系统的公平性与鲁棒性研究具有重要推动价值。
当前挑战
该数据集所应对的核心挑战在于,当前LALM裁判在细粒度副语言属性判别上存在严重不足,尤其在平局情形下难以正确执行“弃权”判断,暴露出模型对听觉特征差异的敏感性弱与决策偏差问题。构建过程中,研究者需调配来自SVC、LibriTTS、EARS及Expresso等多源异构语音库,确保成对样本在属性和平局条件上的均衡分布(平局占比46.7%),同时控制转录文本的一致性以分离声学与词汇影响。此外,部分数据集(如SVC)需要手动申请授权,访问周期长达数日,显著增加了基准复现的工程难度。
常用场景
经典使用场景
ParaPairAudioBench的核心应用在于系统性地评估大型音频语言模型(LALM)作为裁判时的细粒度副语言感知能力。该数据集精心构建了5175对配对音频样本,横跨年龄、性别、语速、重音和风格五大副语言维度,并创新性地引入了平局条件与文本匹配与否的控制轴。研究者通过计算模型在区分这两段音频优劣时的准确率,并辅以位置偏差与一致性度量,得以在标准化协议下精准剖析模型在解译说话人身份特征、情感韵律及表达风格等微妙副语言线索时的表现边界。这一任务设定不仅突破了既往仅关注整体自然度评价的局限,更将评测粒度提升至属性级别,为揭示模型与人类感知之间的关键差距提供了坚实的实验框架。
实际应用
在实际应用中,ParaPairAudioBench所评测的能力直接服务于对感知质量与人机交互体验有着严苛要求的场景。例如,智能语音助手需要根据用户的年龄与性别调整响应策略,阅后即焚的语音社交应用需精准捕捉情感风格,而有声书或播客生成工具则依赖对语速与重音的自然控制来提升内容表现力。通过本数据集的筛选与指导,开发者可以识别并纠正现有LALM在这些维度上的感知偏差与决策误差,从而优化语音多模态服务中的情感计算能力、对话拟人度以及用户个性化适配的准确率。此外,其在医疗康复领域的异常语音检测、教育领域的口语韵律评估等潜力场景中同样具有重要的借鉴价值,推动了从单纯语音识别向深度语音理解与合成的技术演进。
衍生相关工作
ParaPairAudioBench的发布激发了若干衍生研究方向。其多维度评测框架直接启发了更全面的LALM-as-a-Judge方法论研究,例如在判断任务中引入显式的平局与置信度校准机制,以缓解模型决策中的位置偏差与幻觉。基于该数据集中发现的性能鸿沟,已有工作探索如何通过属性感知的对比学习或偏好优化策略来增强副语言判别能力,催生了诸如SpeechJudge等后续针对性地提升特定副语言维度(如风格与语速)评测精度的基准扩展。此外,该数据在构建过程中对平局样本的严谨控制与文本匹配/差异条件的设定,也为未来研究听觉与语义信息在感知判断中的交互作用提供了可复现的数据基础,助力社区更好地理解LALM在处理多模态副语言线索时的鲁棒性与局限性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务