MOS-Bench
收藏资源简介:
MOS-Bench是一个用于训练和评估主观语音质量评估模型泛化能力的数据集集合,由名古屋大学开发。该数据集包含七个训练集和十二个测试集,涵盖不同的采样频率、语言和语音类型,包括由文本到语音(TTS)、语音转换(VC)、语音增强(SE)系统生成的合成语音,以及非合成语音如传输、噪声和混响语音。数据集的创建过程包括对多个听觉测试数据集的整合和处理,旨在解决语音质量评估模型在未见数据上的泛化能力问题。MOS-Bench广泛应用于语音处理领域,特别是主观语音质量评估的研究。
MOS-Bench is a collection of datasets developed by Nagoya University for training and evaluating the generalization ability of subjective speech quality assessment models. This collection comprises seven training sets and twelve test sets, covering diverse sampling frequencies, languages and speech categories, including synthetic speech produced by text-to-speech (TTS), voice conversion (VC) and speech enhancement (SE) systems, as well as non-synthetic speech such as transmitted, noisy and reverberant speech. The development of MOS-Bench involved integrating and processing multiple auditory test datasets, with the core objective of addressing the generalization issue of speech quality assessment models on unseen data. MOS-Bench is widely used in the field of speech processing, particularly in research on subjective speech quality assessment.
🗣️ SHEET / MOS-Bench 🎧
数据集概述
- MOS-Bench 是一个用于评估主观语音质量评估(SSQA)模型泛化能力的基准。
- SHEET 是一个用于与 MOS-Bench 进行研究实验的工具包。
关键特性
- MOS-Bench 是首个大规模的 SSQA 训练和测试数据集集合,涵盖了广泛的领域,包括文本到语音(TTS)、语音转换(VC)、歌唱语音合成(SVS)系统生成的合成语音,以及带有人工和真实噪声、剪辑、传输、混响等的失真语音。
- 该仓库旨在提供训练配方。虽然有许多现成的语音质量评估工具,如 DNSMOS、SpeechMOS 和 speechmetrics,但大多数不提供训练配方,因此不适合研究。
MOS-Bench 概览
- MOS-Bench 目前包含 7 个训练集和 12 个测试集。
支持的模型和特性
模型
- LDNet
- 原始仓库链接: https://github.com/unilight/LDNet
- 论文链接: arXiv
- 示例配置:
egs/bvcc/conf/ldnet-ml.yaml
- SSL-MOS
- 原始仓库链接: https://github.com/nii-yamagishilab/mos-finetune-ssl/tree/main
- 论文链接: arXiv
- 示例配置:
egs/bvcc/conf/ssl-mos-wav2vec2.yaml - 备注: 对原始实现进行了一些修改。
- UTMOS (Strong learner)
- 原始仓库链接: https://github.com/sarulab-speech/UTMOS22/tree/master/strong
- 论文链接: arXiv
- 示例配置:
egs/bvcc/conf/utmos-strong.yaml - 备注: 未实现 UTMOS strong 的所有组件。
- Modified AlignNet
- 原始仓库链接: https://github.com/NTIA/alignnet
- 论文链接: arXiv
- 示例配置:
egs/bvcc+nisqa+pstn+singmos+somos+tencent+tmhint-qi/conf/alignnet-wav2vec2.yaml
特性
- 建模
- 听众建模
- 基于自监督学习(SSL)的编码器,由 S3PRL 支持
- 训练
- 自动保存最佳模型和早期停止
- 可视化,包括预测分数分布、话语和系统级别分数的散点图
- 模型平均
- 通过堆叠进行模型集成
使用指南
- 新用户:提供完整的实验配方,包括下载和处理数据集、训练和评估模型的脚本。
- 已有模型用户:提供方便的测试集收集脚本。
- 使用预训练模型:通过
torch.hub提供加载预训练 SSQA 模型并预测分数的功能。
安装
- 通过
git clone和make命令进行可编辑安装,自动构建虚拟环境。
信息
- 引用:如果使用该项目中的训练脚本、基准测试脚本或预训练模型,请引用相关论文。
- 致谢:该项目受到 ESPNet 和 ParallelWaveGAN 等仓库的启发。
- 作者:Wen-Chin Huang,Toda Labotorary, Nagoya University。




