NaturalVoices
收藏资源简介:
NaturalVoices是一个由卡内基梅隆大学语言技术研究所创建的大规模自然语音数据集,包含5049小时的自然播客录音,涵盖了数千位说话者和多样化的对话场景。该数据集提供了自动标注的情感(类别和基于属性)、语音质量、转录、说话者身份和声音事件等信息。数据集捕捉了丰富的情感和风格变化,为语音转换任务提供了多样化的自然语音资源。
NaturalVoices is a large-scale natural speech dataset developed by the Language Technologies Institute of Carnegie Mellon University. It consists of 5,049 hours of natural podcast recordings, covering thousands of speakers and diverse conversational scenarios. This dataset provides automatically annotated information including emotion (both categorical and attribute-based), speech quality, transcripts, speaker identities, and sound events. The dataset captures rich emotional and stylistic variations, serving as a diverse natural speech resource for speech conversion tasks.
NaturalVoices 数据集概述
数据集简介
NaturalVoices 是一个用于语音转换的自然语音数据集,通过创新的数据采集流程构建。该数据集具有自发性、表达性和情感丰富性的特点,专门针对语音转换应用优化。
数据集特点
- 大规模自然语音数据
- 包含自发性和情感丰富的语音内容
- 适用于语音转换应用
- 经过客观和主观评估验证有效性
数据内容
音频文件
- 提供两种采样率版本:16kHz 和原始采样率
- 文件格式为 FLAC(为节省空间)
- 每个压缩文件约 40GB
- 音频文件批量提供
元数据
元数据包含以下处理结果:
- 自动语音识别(ASR):使用 Faster-Whisper
- 说话人日志:使用 PyAnnote
- 语音活动检测
- 说话人重叠检测
- 信号噪声比(SNR)
- 年龄和性别信息
- 情感预测(分类和属性)
- 声音事件预测
文件结构
NaturalVoices ├── vad │ ├── MSP-PODCAST_0001 │ └── ... ├── pyannote │ ├── MSP-PODCAST_0001 │ └── ... ├── faster-whisper │ ├── MSP-PODCAST_0001 │ └── ... └── all_data.json
数据处理流程
数据处理流程分为三个主要步骤:
1. 播客级别处理
- Faster-Whisper 语音识别
- PyAnnote 说话人日志
- 语音活动检测
2. 话语生成
- 基于 Whisper 分段定义话语
3. 话语级别处理
- 年龄和性别检测
- 情感属性预测
- 情感分类预测
- 性别过滤
- 信噪比计算
- 事件分类
- 语音/音乐分类
使用说明
- 元数据文件为 pickle 格式,可通过 Python 加载
- 提供示例代码说明如何访问元数据
- 使用前需更新配置文件中的路径和认证密钥
引用信息
如需引用本数据集,请使用提供的 BibTeX 条目,该工作发表于 Interspeech 2024 会议。
数据来源
数据来源于原始播客数据,已上传版权信息。
- 1NaturalVoices: A Large-Scale, Spontaneous and Emotional Podcast Dataset for Voice ConversionCarnegie Mellon University, Pittsburgh PA-15213USA · 2025年



