CSEMOTIONS
收藏资源简介:
我们构建了CSEMOTIONS,一个高质量的情感语音数据集,包含大约10小时的普通话语音,来自六位专业母语者(三男三女),所有参与者都有丰富的配音经验。数据集涵盖七种不同的情感类别。所有录音均在专业录音室进行,以确保高音频质量和一致的情感表达。
We have constructed CSEMOTIONS, a high-quality emotional speech dataset containing approximately 10 hours of Mandarin speech from six professional native speakers (three males and three females), all of whom have extensive voice dubbing experience. The dataset covers seven distinct emotion categories. All recordings were conducted in professional recording studios to ensure high audio quality and consistent emotional expression.
Marco-Voice数据集概述
数据集基本信息
- 名称: Marco-Voice
- 类型: 语音合成与语音克隆数据集
- 语言: 主要支持中文(普通话),部分支持英文
- 许可证: Apache License 2.0
核心数据集CSEMOTIONS
基本规格
| 属性 | 规格 |
|---|---|
| 时长 | ~10小时 |
| 说话人 | 10位专业人士(5男,5女) |
| 情感类别 | 中性、快乐、愤怒、悲伤、惊讶、戏谑、恐惧 |
| 采样率 | 48kHz/16bits |
| 录音环境 | 专业录音棚 |
| 评估提示句 | 每种情感100句(中英文) |
情感分布
| 情感标签 | 时长 | 句子数量 |
|---|---|---|
| 悲伤 | 1.73h | 546 |
| 愤怒 | 1.43h | 769 |
| 快乐 | 1.51h | 603 |
| 惊讶 | 1.25h | 508 |
| 恐惧 | 1.92h | 623 |
| 戏谑 | 1.23h | 621 |
| 中性 | 1.14h | 490 |
| 总计 | 10.24h | 4160 |
集成公开数据集
| 数据集 | 时长 | 说话人数量 | 语言 | 情感类型 |
|---|---|---|---|---|
| ESD | 29h | 20 | 中/英文 | 5种 |
| LibriTTS | 585+h | 2,456 | 英文 | 中性 |
| AISHELL-3 | 85h | 218 | 中文 | 中性 |
评估指标
客观评估
-
情感分类准确率(ECA)
- 工具: emotion2vec模型
- 方法: 比较合成语音与真实语音的情感标签一致性
-
词错误率(WER)
- 英文ASR: Whisper-large-v3
- 中文ASR: Paraformer-zh
- 支持语言: 主要中英文
-
说话人相似度(SIM)
- 主要工具: SpeechBrain
- 方法: 计算余弦相似度
-
语音质量(DNS-MOS)
- 工具: DNSMOS
- 范围: 0-5分
主观评估(人工评测)
- 评估维度: 语音清晰度、节奏速度、自然度、整体满意度
- 评分尺度: 1-5分(说话人相似度0-1分)
基准性能
语音克隆评估
| 指标 | Marco-Voice得分 |
|---|---|
| 语音清晰度 | 4.545 |
| 节奏速度 | 4.290 |
| 自然度 | 4.205 |
| 整体满意度 | 4.430 |
| 说话人相似度 | 0.8275 |
情感语音生成评估
| 指标 | Marco-Voice得分 |
|---|---|
| 情感表达 | 4.225 |
| 语音清晰度 | 4.545 |
音频样本
提供7种情感类型的语音样本,包含3位不同说话人演示:
- 中性、快乐、悲伤、愤怒、恐惧、惊讶、戏谑
引用格式
bibtex @article{tian2024marcovoice, title={Marco-Voice Technical Report}, author={Tian, Fengping and Lyu, Chenyang and Ni, Xuanfan and Sun, Haoqin and Li, Qingjuan and Qian, Zhiqiang and Li, Haijun and Wang, Longyue and Xu, Zhao and Luo, Weihua and Zhang, Kaifu}, year={2025}, note={Technical Report}, }




