Env-TTS-Clean
收藏资源简介:
Env-TTS-Clean是一个用于环境感知文本到语音(TTS)模型训练的清洁发布语料库,其核心设计是让模型能够学习生成同时具有指定说话人声音和指定声学环境特征的语音。每个数据样本包含四个对齐的24 kHz单声道FLAC音频片段及其对应的转录文本:环境样本(来自同一会话中不同说话人,代表目标声学场景)、说话人参考样本(与目标语音同一说话人,用于声音建模)、说话人参考样本的增强版本(使用MossFormer2语音增强模型处理)以及需要合成的目标语音。数据集总计包含189,918个样本,占用约119 GB磁盘空间,目标语音总时长约428.6小时(1,542,868.6秒),所有音频片段(环境、说话人参考、目标语音)总时长约1,252.1小时(4,507,421.5秒)。数据来源于六个公开的多说话人会议或对话数据集:M3SD(108,708行)、AISHELL-4(27,924行)、AliMeeting(25,087行)、AMI(13,207行)、MSDWILD(9,676行)和CHiME-6(5,316行),支持中文(zh)和英文(en)。数据集模式包含丰富的元数据,如音频片段、时长、转录文本(原始或使用Qwen3-ASR自动生成)、语言标签、来源数据集标识、会话ID、说话人ID、环境ID、文本来源、ASR置信度分数等。该数据集适用于环境感知TTS、说话人日志化、语音合成等研究任务。发布遵循CC-BY-SA-4.0许可,但使用者需注意部分上游数据集(如M3SD、MSDWILD)可能存在仅限学术或非商业研究使用的附加限制。
Env-TTS-Clean is a clean released corpus for training environment-aware text-to-speech (TTS) models. Its core design enables models to learn to generate speech that combines the specified speaker's timbre and target acoustic environment features. Each data sample contains four aligned 24 kHz mono FLAC audio clips and their corresponding transcriptions: an environmental sample (from different speakers in the same session, representing the target acoustic scene), a speaker reference sample (from the same speaker as the target speech for voice modeling), an enhanced version of the speaker reference sample (processed using the MossFormer2 speech enhancement model), and the target speech to be synthesized. The dataset contains a total of 189,918 samples, occupying approximately 119 GB of disk space. The total duration of the target speech is about 428.6 hours (1,542,868.6 seconds), and the total duration of all audio clips (environmental, speaker reference, and target speech) is approximately 1,252.1 hours (4,507,421.5 seconds). The data is sourced from six public multi-speaker meeting or conversation datasets: M3SD (108,708 lines), AISHELL-4 (27,924 lines), AliMeeting (25,087 lines), AMI (13,207 lines), MSDWILD (9,676 lines), and CHiME-6 (5,316 lines). It supports both Chinese (zh) and English (en). The dataset schema includes rich metadata, such as audio clips, duration, transcriptions (either original or automatically generated using Qwen3-ASR), language tags, source dataset identifiers, session IDs, speaker IDs, environment IDs, text sources, ASR confidence scores, and more. This dataset is applicable to research tasks such as environment-aware TTS, speaker diarization, and speech synthesis. It is released under the CC-BY-SA-4.0 license, but users should note that some upstream datasets (such as M3SD and MSDWILD) may have additional restrictions allowing only academic or non-commercial research use.
数据集概述:Env-TTS-Clean
Env-TTS-Clean 是一个面向环境感知文本转语音(Environment-aware TTS)的训练语料库。该数据集旨在让模型能够学习生成具有指定说话人音色和指定声学环境的语音。
核心特性
- 数据规模:包含 189,918 行数据,总时长约为 428.6 小时(仅目标语音),所有音频总时长(环境 + 说话人 + 目标语音)约为 1,252.1 小时。
- 音频格式:所有音频片段均为 24 kHz 单声道 FLAC 格式。
- 数据对结构:每行数据包含四个配对的短音频片段及其对齐文本:
- 环境样本:来自不同说话人,但处于相同声学场景。
- 说话人参考:与目标语音来自同一说话人。
- 增强后的说话人参考:使用 MossFormer2 对说话人参考进行增强后的版本。
- 目标语音:需要合成的最终语音。
- 语言:支持 英语 (en) 和 中文 (zh)。
数据来源与分布
数据集由以下六个来源语料库整合而成:
| 来源数据集 | 行数 | 主要语言 |
|---|---|---|
| M3SD | 108,708 | 中英混合 |
| AISHELL-4 | 27,924 | 中文 |
| AliMeeting | 25,087 | 中文 |
| AMI | 13,207 | 英语 |
| MSDWILD | 9,676 | 中英混合 |
| CHiME-6 | 5,316 | 英语 |
数据模式 (Schema)
数据集包含 17 个字段,关键字段如下:
environment_audio_source&speaker_audio_source&speech:分别为环境音频、说话人参考音频和目标语音的二进制 FLAC 数据。text:目标语音的文本转录。language:语言标识,值为zh、en或auto。dataset:标识该行数据来自哪个源语料库。conversation_id&speaker_id&env_id:会话、说话人和声学场景的唯一标识符。asr_token_count&asr_mean_logprob:使用 Qwen3-ASR 模型对目标语音进行识别后的 token 数量和平均对数概率。
数据处理流程
数据处理采用流式管道,分为三个阶段:
- 下载:从各源流式下载音频数据。
- 处理:将音频重采样至 24 kHz,根据说话人日志切割出目标语音、说话人参考和环境音频片段。对于缺失或分割的文本,使用 Qwen3-ASR-1.7B 模型进行重新标注。结果以 snappy 压缩的 parquet 分片形式写入。
- 上传:将处理后的数据分批次上传至 Hugging Face。
- 增强(第二轮):对已发布的数据,使用 MossFormer2_SE_48K 模型增强说话人参考音频。
许可与引用
- 许可协议:CC-BY-SA-4.0。需注意,部分源数据集(如 M3SD、MSDWILD)仅限学术/非商业研究使用。
- 引用:使用该数据集时,建议引用 M3SD、AISHELL-4、MSDWILD、CHiME-6 等源论文。




