遇见数据集

A2 MUSHRA Listening Test Raw Data

收藏
github2026-06-02 更新2026-06-04 收录
官方服务:

资源简介:

该数据集包含105,842个评分,来自1,184名参与者,收集于2026年4月18日至2026年5月29日。这是一个正式的大规模盲测MUSHRA(隐藏参考和锚点的多刺激)听力测试数据,用于评估音频质量。数据集中包含37种音色的评分,每个评分为0-100的分数,表示模型对原始录音的匹配程度。数据以CSV格式存储,包含评分ID、用户ID、音色、模型标识、分数等列。

This dataset contains 105,842 ratings collected from 1,184 participants between April 18, 2026 and May 29, 2026. It is a formal large-scale blind MUSHRA (Multiple Stimuli with Hidden Reference and Anchor) listening test dataset for audio quality assessment. The dataset includes ratings for 37 timbres, with each score ranging from 0 to 100, representing the degree of match between the model's output and the original recording. The data is stored in CSV format, with columns including rating ID, user ID, timbre, model identifier, score, etc.

创建时间:
2026-06-02
原始信息汇总

数据集概述

本数据集为 A2 MUSHRA 听力测试的原始数据,包含来自 1,184 名参与者的 105,842 条评分数据,数据收集时间为 2026年4月18日至2026年5月29日。

测试方法

采用 MUSHRA(带隐藏参考和锚点的多刺激)方法论,这是一种由 BBC 和 EBU 等广播机构使用的标准音频感知质量评估方法。在每个试次中,参与者首先听到真实设备录制的参考音频,然后对同一音色由不同建模系统处理后的多个版本进行盲评,评分范围为 0-100(分数越高表示越接近原始录音)。每个试次中包含两个质量控制音频:隐藏参考(原录音副本,预期高分)和低通锚点(故意劣化版本,预期低分)。

数据内容

数据文件为 data/a2-mushra-data.csv,包含单行评分的原始、未经筛选的数据。列字段如下:

列名 类型 描述
id integer 唯一评分 ID
user_id string 匿名参与者 ID
tone string 源音色名称(如 GA-1、FRG-12)
figure integer 该音色下的具体音频样本序号
model_id string 内部模型代号
model_label string 模型名称
model_letter string 参与者在试次中看到的随机标签(A-I)
score integer 评分(0-100)
created_at timestamp 评分创建时间(UTC)
updated_at timestamp 评分最后更新时间(UTC)
version string 测试构建版本标识(均为 a2-listening-15

评估模型

数据集包含 7 个被评估的模型和 2 个质量控制选项:

模型标签 说明
recorded 隐藏参考(原始录音副本,质量控制)
anchor 低通锚点(质量控制)
a2-full NAM A2 完整模型
a2-lite NAM A2 精简模型
a1-standard NAM A1 旧版标准模型
a1-nano NAM A1 旧版纳米模型
qc-v2 Neural DSP Neural Capture V2
tonex IK Multimedia TONEX
proxy Line 6 Proxy

注意:并非所有模型出现在每个试次中,proxy 仅在一部分音色上评估,部分音色缺少 tonexqc-v2

音色分类

来自 39 音色评估集的 37 个音色被纳入听力测试(2 个音色因渲染问题被排除)。音色按设备类型分组:

前缀 音色数量 设备类别
GA 8 吉他放大器
BA 4 贝斯放大器
P 6 踏板 / 外部设备
PA 5 踏板 + 放大器链
FRG 10 完整配置(吉他)
FRB 2 完整配置(贝斯)
PB 2 踏板 / 外部设备(贝斯)

数据筛选建议

原始数据中包含所有评分,用户可根据 MUSHRA 规范自行筛选。示例筛选标准:排除在超过 15% 的项目中将隐藏参考评分低于 90,或将锚点评分高于 90 的参与者。

许可与引用

  • 许可协议:Creative Commons Attribution 4.0 International (CC BY 4.0)
  • 引用:使用数据时请引用 CITATION.cff 文件并链接回本仓库

相关链接

  • 测试代码仓库:https://github.com/tone-3000/t3k-mushra
  • 数据集指南与初步分析:https://www.tone3000.com/guides/nam-a2-the-complete-guide
搜集汇总
数据集介绍
A2 MUSHRA Listening Test Raw Data 数据集图片
构建方式
在音频感知质量评估领域,MUSHRA(带隐藏参考与锚点的多刺激测试)是广播机构如BBC和EBU广泛采纳的标准化方法。该数据集源于一次大规模盲听测试,旨在评估多种吉他音箱与效果器建模技术的音质还原能力。研究团队从39种音色构成的评估集中精选出37种,排除了因商用建模器渲染问题而无法使用的2种音色。每位受试者在每次试验中首先聆听真实录制的设备作为参考,随后对A2-Full、A2-Lite、A1-Standard、A1-Nano、Neural DSP Neural Capture V2、IK Multimedia TONEX和Line 6 Proxy等模型的版本进行0-100分的评分,且全程不知道各版本的对应关系。试验中嵌入了隐藏参考(原始录音副本)和低通锚点(刻意降质版本)作为质量控制手段。共有1,184名参与者提供了105,842条评分记录,时间跨度为2026年4月18日至5月29日。原始数据以单个CSV文件存储,每行对应一条评分,列字段包括匿名用户ID、音色标识符、音色样本编号、模型内部代号与可读标签、参与者看到的随机字母标识以及评分值等。
特点
该数据集的核心价值在于其大规模、高保真与标准化设计的结合。作为目前公开可用的最大规模MUSHRA听力测试原始数据之一,它容纳了超过十万条来自千余名参与者的评分,为音频建模技术的比较提供了坚实的统计基础。数据集采用严格的盲测设计,每个模型在每次试验中被分配随机字母标签,有效消除了受试者的预期偏差。质量控制机制是另一亮点:隐藏参考与锚点的存在使得事后筛选成为可能,研究者可根据自定义标准排除无效数据,而本仓库保留原始未筛选评分,赋予用户灵活应用不同筛选阈值的自由。数据涵盖七种代表性模型,涵盖了从紧凑型(A1-Nano)到全规模(A2-Full)的多种技术路径,以及商业软件如Neural DSP、TONEX和Proxy,便于横向对比。音色来源覆盖吉他音箱、贝斯音箱、单块效果器、箱体与效果器链以及完整设备系统,多元的装备类型确保了评估的全面性。此外,数据集明确指出部分模型(如Proxy)仅在部分音色上出现,提示用户进行均衡统计设计时需考虑缺失数据的影响。
使用方法
使用该数据集的第一步是加载标准UTF-8编码的CSV文件,推荐利用Python的pandas库执行读取与预处理。研究者可直接调用pd.read_csv函数,并设置parse_dates参数将时间戳列解析为日期时间格式,便于时序分析。基础分析可通过groupby操作按模型标签聚合评分,计算均值、中位数与计数等统计量,快速洞察不同模型的感知质量表现。更为关键的是执行MUSHRA标准后筛选:首先生成每个音色与样本组合的项目键,随后计算每位参与者对隐藏参考评分低于90的项目占比以及锚点评分高于90的项目占比,剔除任一比率超过15%的参与者,从而确保分析基于可靠数据。筛选后的数据可用于深入的统计检验,如方差分析或非参数比较,以评估模型间差异的显著性。由于实验设计非完全平衡,建议针对每个模型实际出现的试验子集计算特定统计量,避免因缺失值导致的偏差。研究者还可根据自身需求调整筛选阈值或探索其他质量控制策略,灵活利用原始数据的丰富信息进行再分析。
背景与挑战
背景概述
该数据集源自于2026年4月至5月期间由Tone 3000团队发起的大规模音频感知质量评估实验,旨在系统性地比较神经音频建模领域多种前沿模型在吉他、贝斯等乐器音色还原中的表现。研究基于严格的盲听MUSHRA测试范式,共收集来自1184名参与者的105842条评分数据,覆盖了37种不同音色样本。核心研究问题聚焦于评估A2系列全参数与轻量化模型相较于历史版本(A1系列)及商业竞品(如Neural DSP、IK Multimedia、Line 6)在主观听感上的匹配程度。该数据集为神经音频模型的主观音质比较提供了标准化的大规模原始评分库,对音频信号处理与机器学习交叉领域具有重要参考价值。
当前挑战
该领域面临的挑战首先在于主观听感评价的高度个体差异性,实验需通过隐藏参考与降质锚点机制对参与者进行筛选,但原始数据中未做预处理,保留了潜在的不可靠评分,要求后续分析自行设定筛选阈值以权衡数据量与纯度。构建过程中遇到的挑战包括:商业模型在部分音色上存在渲染错误导致两个样本被剔除,使得评测集不完整;不同模型在不同音色中的出现频率不均衡(如Proxy模型仅覆盖部分音色),要求统计时必须考虑条目不匹配问题以避免比较偏差。
常用场景
经典使用场景
在音频质量感知评估领域,A2 MUSHRA听力测试原始数据集广泛应用于对比不同吉他放大器与效果器建模算法的音质相似度。该数据集遵循MUSHRA标准,包含105,842次来自1,184名参与者的盲听评分,覆盖37种音色样本与7种主流建模模型。研究者通过分析原始评分数据,可揭示不同模型在主观听感上逼近真实录音设备的程度,这一场景已成为评估神经音频建模效果的核心基准。
解决学术问题
该数据集有效解决了音频建模领域长期存在的主观评价标准缺失问题。以往模型对比多依赖客观指标,但无法反映人耳感知差异。通过大规模双盲实验与内置隐藏参考、低通锚点的质量控制机制,该数据为建立可重复、可筛选的主观评价体系提供了原始样本,支撑了关于听觉感知阈值、评分偏差修正及参与者筛选准则的学术探讨,显著提升了模型间比较的统计严谨性。
衍生相关工作
该数据集已催生多项衍生研究,包括改进型参与者筛选算法(如基于隐藏参考评分阈值的自适应剔除)、针对不平衡试验设计的统计补偿方法,以及结合客观指标与主观评分的多模态建模工作。同时,原始数据被用于训练预测听力偏好的人工神经网络,进而发展出能够近似人类评分结果的代理模型。这些工作进一步拓展了MUSHRA方法论在神经音频建模中的适用范围,并促进了可复现的主观评价标准在科研社区的建立。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务