MSceneSpeech
收藏资源简介:
MSceneSpeech是由浙江大学和华为云联合创建的高质量普通话语音合成数据集,旨在支持富有表现力的语音合成研究。该数据集包含约15小时的音频,涵盖聊天、新闻、问答和讲故事四种日常场景,每个场景包含多个发言者和多样化的韵律风格。数据集通过精心策划的脚本和专业录音艺术家的表演录制,以增强韵律建模和转换。MSceneSpeech主要应用于多风格语音合成和跨发言者风格转换,解决现有数据集在韵律控制上的局限性。
MSceneSpeech is a high-quality Mandarin speech synthesis dataset co-created by Zhejiang University and Huawei Cloud, aimed at supporting expressive speech synthesis research. The dataset encompasses approximately 15 hours of audio, covering four daily scenarios: chat, news, question-answering, and storytelling, with multiple speakers and diverse rhythmic styles in each scenario. The dataset was recorded with meticulously crafted scripts and performances by professional voice actors to enhance rhythmic modeling and transformation. MSceneSpeech is primarily applied to multi-style speech synthesis and cross-speaker style conversion, addressing the limitations of existing datasets in rhythmic control.
MSceneSpeech 数据集概述
数据集简介
MSceneSpeech 是一个高质量的单语种普通话多场景语音数据集,旨在为富有表现力的语音合成提供资源。该数据集包含了多个音频录制和文本,根据日常生活场景进行表演和录制。每个场景包括多个发言者和多样化的韵律风格,适合进行多发言者风格和韵律建模的语音合成。
数据集详情
场景分类
MSceneSpeech 数据集包含四个主要场景,具体描述如下:
- Chat:非正式对话,互动讨论和相声。
- QA:来自在线购物平台的问题和回答,以及与网站建设相关的问题。
- News:中国国家电视台的新闻片段。
- Story:面向儿童和成人的故事,包含多样化的讲述风格和主题。
请注意,前两个类别虽然是两人互动,但由一个发言者录制。
数据集统计
详细的数据集统计如下:
| 场景 | 发言者数量 | 总时长(小时) | 片段数量 |
|---|---|---|---|
| Chat | 4 | 5.32 | 2162 |
| News | 2 | 2.06 | 747 |
| QA | 3 | 2.22 | 907 |
| Story | 4 | 3.35 | 1286 |
音频属性
不同场景的音频属性在速度、音高和能量上具有高度变异性,这些属性可以作为高度变异韵律的显著指标。
数据集演示
MSceneSpeech 的实用性不仅在于其韵律的丰富性,还在于不同韵律情境下声音音色的均匀性。这种双重特性使得 TTS 模型能够生成具有解耦音色和韵律的多样化语音输出。以下是不同场景的演示音频:

- 1MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis浙江大学, 华为云 · 2024年



