遇见数据集

zuhri025/high-quality-unified

收藏
Hugging Face2026-05-12 更新2026-05-31 收录
官方服务:

资源简介:

Audio Token Unified 是一个统一合并的数据集,专门用于文本转语音(TTS)训练。该数据集由三个来源合并而成:humair025/Magpie-Speech-Orpheus-125k-annotated、humair025/DeepDialogue-orpheus-Kanade-Annotated 和 humair025/DeepDialogue-xtts-K-Annotated。数据集包含以下列:audio_duration(音频时长)、text(文本)、audio_global_embedding(音频全局嵌入)、audio_content_token_indices(音频内容令牌索引)和audio_token_len(音频令牌长度)。格式为单个parquet文件,针对TTS训练进行了优化,并减少了不必要的元数据,以提高训练效率和性能。数据集支持英语和乌尔都语,适用于多语言文本转语音任务。

Audio Token Unified is a unified merged dataset specifically designed for text-to-speech (TTS) training. It is created by merging three sources: humair025/Magpie-Speech-Orpheus-125k-annotated, humair025/DeepDialogue-orpheus-Kanade-Annotated, and humair025/DeepDialogue-xtts-K-Annotated. The dataset includes the following columns: audio_duration, text, audio_global_embedding, audio_content_token_indices, and audio_token_len. It is formatted as a single parquet file, optimized for TTS training, and reduces unnecessary metadata to enhance training efficiency and performance. The dataset supports English and Urdu languages, making it suitable for multilingual text-to-speech tasks.

提供机构:
zuhri025
二维码
社区交流群
二维码
科研交流群
商业服务