tts-zh-clone-bench-4model
收藏官方服务:
资源简介:
tts-zh-clone-bench-4model 是一个专为中文(普通话)文本转语音(TTS)语音克隆任务设计的基准测试数据集。该数据集旨在系统性地比较和评估四种主流TTS模型(MOSS-TTS v1.5、OmniVoice、Qwen3-TTS和VoxCPM2)在语音克隆任务上的性能。数据以表格形式组织,核心为参考-克隆配对。每个配对包含原始参考音频及其对应的克隆音频,并确保对于同一段文本(通过`index`标识),所有四个模型都生成了对应的克隆结果,从而便于进行直接的模型间A/B比较。数据集提供了丰富的元数据和评估指标:音频采样率为24 kHz;包含参考文本(`ref_text`)和目标克隆文本(`clone_text`);使用DNSMOS P.835 OVRL分数(`ref_dnsmos`, `clone_dnsmos`)客观评估音频质量(分数越高越好,范围约1-5);使用基于Qwen3-ASR-1.7B模型计算的字符错误率(`clone_asr_cer`)来评估克隆语音的内容准确性(错误率越低越好,接近0表示与目标文本完全一致)。README中提供了每个模型在50个样本上的平均DNSMOS质量和ASR CER分数,为研究人员和开发者提供了清晰的性能基准。该数据集适用于TTS模型评估、语音克隆技术对比、合成语音质量分析等研究与应用场景。
创建时间:
2026-06-15
原始信息汇总
数据集概述
- 数据集名称:tts-zh-clone-bench-4model
- 许可证:Apache-2.0
- 任务类别:文本转语音(Text-to-Speech)
- 语言:中文(普通话)
- 标签:TTS、语音克隆、合成、基准测试
数据集内容
该数据集用于比较4个模型在中文(普通话)语音克隆任务上的表现。每一行对应一个“参考音频 → 克隆音频”对;相同的 index 代表 同一段文本 在4个模型上的克隆结果(按 index 排序,同一段文本的4个模型行相邻,便于A/B对比)。
字段说明
index:索引,相同索引对应相同文本model:模型名称ref_text:参考文本ref_audio:参考音频ref_dnsmos:参考音频的DNSMOS P.835 OVRL分数(越高越好,范围约1-5)clone_text:克隆文本(目标文本)clone_audio:克隆音频clone_dnsmos:克隆音频的DNSMOS P.835 OVRL分数(越高越好)clone_asr_cer:克隆音频与clone_text的字错误率(越低越好,接近0表示克隆完全准确),使用 Qwen3-ASR-1.7B 测量
音频采样率为24 kHz。
模型平均性能
| 模型 | clone_dnsmos | clone_asr_cer | 样本数 |
|---|---|---|---|
| MOSS-TTS v1.5 | 3.28 | 0.010 | 50 |
| OmniVoice | 3.09 | 0.016 | 50 |
| Qwen3-TTS | 3.38 | 0.009 | 50 |
| VoxCPM2 | 2.79 | 0.009 | 50 |
涉及的模型
搜集汇总
数据集介绍

构建方式
该数据集专为中文语音克隆任务设计,旨在系统性地比较四种主流文本转语音模型的克隆性能。构建过程中,研究团队选取了统一的参考音频与文本对,确保每条数据均包含原始参考语音作为基线。随后,利用MOSS-TTS v1.5、OmniVoice、Qwen3-TTS及VoxCPM2这四种模型,基于相同的文本内容生成克隆语音,形成一一对应的参考-克隆对。所有生成的音频均统一采样至24kHz,并标注了DNSMOS P.835 OVRL评分以衡量语音质量,同时借助Qwen3-ASR-1.7B自动语音识别系统计算字符错误率,以此评估克隆内容的准确性。数据集按索引排序,使得同一文本下四种模型的克隆结果相邻排列,便于直观比较。
特点
本数据集的核心特色在于其精细的多维度评价体系与高对比性设计。每个样本不仅提供了参考音频与克隆音频的成对数据,还附带了DNSMOS评分与ASR字符错误率两项关键指标,分别从听觉质量与内容保真度两个层面刻画模型性能。DNSMOS评分越高代表语音自然度与清晰度越佳,而字符错误率越低则说明克隆文本的还原度越高。数据集覆盖了四种代表性模型,每个模型均包含50个样本,赋予了统计意义上的可靠性。通过相同文本跨模型的并列排列方式,用户能够极为便捷地进行横向对比,快速识别不同模型在克隆任务中的优劣。
使用方法
用户可直接从Hugging Face平台下载该数据集,并利用其中提供的'index'、'model'、'ref_audio'、'clone_audio'等字段进行分析。推荐的使用场景包括评估和挑选适合中文语音克隆任务的模型,或作为模型训练与调优的基准测试集。研究者可依据'dnsmos'与'asr_cer'两列数据,快速筛选出质量与准确性俱佳的克隆结果,亦可通过对比同一文本下不同模型的音频特征,深入挖掘模型间的差异。由于数据格式简洁统一,仅需少量代码即可完成加载与可视化分析,适用于学术研究及工程实践中的模型评测环节。
背景与挑战
背景概述
文本到语音(TTS)合成技术近年来取得了显著进展,尤其在中文(普通话)领域,以语音克隆为代表的高保真、个性化语音生成成为研究热点。tts-zh-clone-bench-4model数据集应运而生,由HuggingFace社区于2025年发布,旨在系统评估多种前沿TTS模型在中文语音克隆任务上的表现。该数据集围绕一个核心研究问题展开:不同模型在克隆语音的质量与内容准确性上是否存在显著差异?通过整合MOSS-TTS v1.5、OmniVoice、Qwen3-TTS及VoxCPM2四种代表性模型,数据集提供了同一文本、统一参考音频下的平行对比,对推动中文TTS模型性能评估标准化及跨模型比较具有重要参考价值。其引入的DNSMOS和ASR字符错误率(CER)双重指标,为合成语音的自然度与可懂度提供了量化依据,影响深远。
当前挑战
该数据集面临的首要领域挑战是中文语音克隆中语音质量与文本复制准确性的兼顾,即如何在保持高自然度(如DNSMOS评分)的同时,确保克隆内容零错误(如极低CER)。另一方面,数据集构建过程遭遇多重困难:各模型生成音频时长和采样率不一,需统一至24kHz;参考音频的原始质量参差不齐,需依赖DNSMOS进行筛选以控制变量;ASR评估依赖于第三方模型(Qwen3-ASR-1.7B),其自身识别误差可能干扰克隆准确性的度量。此外,数据集规模较小(仅50组对比),限制了统计显著性和模型泛化性的深入分析,而不同模型间基线与优化策略的差异也为公平对比带来了噪声挑战。
常用场景
经典使用场景
在语音合成与克隆领域,tts-zh-clone-bench-4model数据集承载着汉语普通话语音克隆模型对比评测的核心使命。该数据集精心设计了由参考语音到克隆语音的成对样本,每条数据均包含一致的文本内容,并以四种主流模型(MOSS-TTS v1.5、OmniVoice、Qwen3-TTS、VoxCPM2)生成的克隆音频为对照。研究者可通过索引轻松定位同一文本下不同模型的克隆结果,结合DNSMOS评分与词错率指标,系统性地评估各模型在语音质量与内容保真度上的表现差异,从而为汉语语音克隆技术的横向比较提供了标准化基准。
解决学术问题
该数据集直面汉语语音克隆研究中评价体系不统一、对比实验难以复现的学术痛点。通过构建一个包含参考音频、克隆音频及其客观质量指标的标准化评测集,它解决了跨模型比较时因测试文本、评测指标差异而导致的结论偏差问题。研究者得以基于统一的DNSMOS(感知质量评分)与ASR词错率(内容正确性量化指标)两大维度,精准量化不同模型在保留说话人音色、韵律及文本准确发音方面的能力。这一平台的建立,为汉语语音克隆领域提供了可重复、可量化的学术参照,推动了语音合成技术评估从主观经验向客观标准的范式转型。
衍生相关工作
围绕tts-zh-clone-bench-4model数据集,研究社区已衍生出一系列富有启发性的经典工作。一方面,学者们基于该基准对现有汉语语音克隆模型进行细粒度剖析,例如分析不同模型在特定声调、多音字或方言口音上的克隆偏差,进而提出针对性的韵律优化策略。另一方面,数据集的标准化评测框架被广泛借鉴,催生了面向多语种、多情感语音克隆的扩展基准数据集。此外,结合数据集中DNSMOS与词错率的关联分析,研究者尝试构建融合感知质量与语义保真度的联合优化目标函数,推动了新一代端到端语音克隆模型的设计范式发展。
以上内容由遇见数据集搜集并总结生成




