YT-Data/ja-en-syn-qwen3-mimi
收藏资源简介:
该数据集是一个用于文本到语音(TTS)任务的数据集,专门为OrpheusPlus训练设计。它基于YT-Data/ja-en-syn数据,使用Qwen3-4B模型进行文本编码,并结合Mimi音频标记,按照Orpheus提示布局组织成单列input_ids。数据集支持英语(en)和日语(ja)两种语言,数据以.parquet格式存储,分片放置在data/、data2/和data3/目录中,以避免超过HuggingFace Hub的文件数量限制。数据集通过encode_mimi.py脚本构建,旨在为语音合成模型训练提供预处理数据。
This dataset is designed for text-to-speech (TTS) tasks, specifically encoded for OrpheusPlus training. It is based on YT-Data/ja-en-syn data, utilizing Qwen3-4B text tokens and Mimi audio tokens, organized in the Orpheus prompt layout with a single column input_ids. The dataset supports English (en) and Japanese (ja) languages, stored in .parquet format and sharded across data/, data2/, and data3/ directories to comply with HuggingFace Hubs file limit. It is built via the encode_mimi.py script, aiming to provide preprocessed data for speech synthesis model training.



