data
收藏资源简介:
越南语TTS多项目数据集是目前规模最大的越南语文本到语音(TTS)数据集,包含118GB的高质量音频和相应的文本数据,数据来源于网络文学和翻译故事项目。该数据集专为训练现代TTS模型(如Matcha-TTS、F5-TTS和Piper)而设计。数据集总容量约为118GB(解压后),包含超过1000小时的纯净音频,格式为22k-44k Hz的单声道/立体声.wav文件和.csv格式的元数据。数据集分为三个主要部分:1) Thế Giới Hoàn Mỹ(完美世界),包含武侠风格的朗读音频;2) Án Sát(案察),包含侦探题材的多样化角色对话;3) Ngạo Thế Cửu Trọng Thiên(傲世九重天),已降噪并标准化为22050Hz的音频,可直接用于训练。所有元数据文件遵循LJSpeech风格的标准化格式:`wav_path | transcript`。由于Hugging Face的50GB限制,大文件被分割为多个部分,需使用提供的命令进行合并和解压。
数据集概述
- 数据集名称: Vietnamese TTS Multi-Project Dataset (118GB)
- 数据集地址: https://huggingface.co/datasets/Cong123779/data
- 语言: 越南语 (vi)
- 许可证: 其他 (other)
- 任务类别: 文本转语音 (text-to-speech)
- 标签: tts, vietnamese, audio, speech-dataset, multi-project
基本信息
- 总容量: 约118GB(解压后)
- 音频格式: .wav(单声道/立体声,采样率22k-44k Hz)
- 元数据格式: .csv(遵循LJSpeech风格,格式为
wav_path | transcript) - 音频时长: 超过1000小时纯净语音
项目构成
数据集分为三个主要子项目:
-
Thế Giới Hoàn Mỹ (The Gioi Hoan My)
- 存档文件:
the_gioi_hoan_my.tar.zst(分片为多个小文件) - 描述: 武侠风格朗读,语气慷慨激昂,适合故事类TTS。
- 存档文件:
-
Án Sát (An Sat)
- 存档文件:
an_sat.tar.zst - 描述: 侦探类数据,包含多样化的角色对话。
- 存档文件:
-
Ngạo Thế Cửu Trọng Thiên (Ngao Thế Cửu Trọng Thiên)
- 存档文件:
Ngao_The_Cuu_Trong_Thien_Phong_Lang_Thien_Ha_mono22050.tar.zst - 描述: 已去噪并标准化为22050Hz,可直接用于训练。
- 存档文件:
使用说明
由于Hugging Face单文件大小限制为50GB,大文件被拆分为带有.part_aa、.part_ab后缀的小文件。合并与解压命令示例:
bash
合并Thế Giới Hoàn Mỹ文件
cat the_gioi_hoan_my.tar.zst.part_* > the_gioi_hoan_my.tar.zst
解压(需安装zstd)
tar --use-compress-program=zstd -xvf the_gioi_hoan_my.tar.zst
元数据格式
所有 metadata_aligned.csv 文件遵循标准LJSpeech格式:
wav_path | transcript
管理与联系
- 维护者: @Cong123779
- 联系途径: 通过Hugging Face个人主页获取更多详情。




