multi_lingo_data
收藏资源简介:
该数据集是一个用于训练富有表现力的多语言语音克隆模型的大规模跨语言及同语言文本转语音语料库。它覆盖了四种目标语言:英语、日语、韩语和中文。数据集的核心内容由bosonai/higgs-tts-3-4b模型通过sglang-omni合成。数据集包含五个主要配置:1)samples_showcase:包含40个来自主数据集的随机跨语言样本对,每个样本都配有其用于语音克隆的参考音频,便于进行音色对比。2)samelang_expressive:主数据集(正在上传中),规模约为478万行,总音频数据量约3.3TB。该数据集基于1200个说话者,为每个说话者在每种目标语言上合成了1000个文本,总计约480万个克隆音频。数据以分片Parquet文件形式组织,每个语言有240个分片。每条数据记录包含音频(自动转换为HuggingFace Audio特征)、文本、语言代码、参考ID、说话者ID、文本ID、时长、采样率、参考音频路径、参考文本、合成引擎和原始文本等字段。3)references:包含1200个精选的单语言真实说话者音频片段。4)audio_prompts:包含14400个跨语言合成音频,由每个真实的Emilia说话者克隆到4种目标语言,每种语言3个文本生成。5)audio_prompts_expressive:与audio_prompts类似,但采用了表现力提示选择,这些音频作为伪参考用于生成主数据集samelang_expressive。该数据集适用于多语言文本转语音、语音克隆和富有表现力的语音合成等任务。
This dataset is a large-scale cross-lingual and monolingual text-to-speech corpus for training expressive multilingual speech cloning models. It covers four target languages: English, Japanese, Korean, and Chinese. The core content of the dataset is synthesized by the bosonai/higgs-tts-3-4b model via sglang-omni. The dataset includes five main configurations: 1) samples_showcase: Contains 40 random cross-lingual sample pairs from the main dataset, each paired with a reference audio for speech cloning to facilitate timbre comparison. 2) samelang_expressive: The main dataset (currently under upload) has a scale of approximately 4.78 million rows and a total audio data volume of about 3.3 TB. Based on 1200 speakers, this dataset synthesizes 1000 texts for each speaker in each target language, totaling approximately 4.8 million cloned audios. The data is organized into sharded Parquet files, with 240 shards per language. Each data record contains fields including audio (automatically converted to HuggingFace Audio features), text, language code, reference ID, speaker ID, text ID, duration, sampling rate, reference audio path, reference text, synthesis engine, and original text. 3) references: Contains 1200 curated monolingual real speaker audio clips. 4) audio_prompts: Contains 14,400 cross-lingual synthesized audios, generated by cloning each real Emilia speaker to the four target languages with 3 texts per language. 5) audio_prompts_expressive: Similar to audio_prompts, but uses expressive prompt selection; these audios serve as pseudo-references for generating the main dataset samelang_expressive. This dataset is suitable for tasks such as multilingual text-to-speech, speech cloning, and expressive speech synthesis.
数据集概述:Multi-lingual TTS Data (leeoxiang/multi_lingo_data)
该数据集是一个大规模、多语种的文本转语音(TTS)语料库,旨在训练具有表现力的多语种语音克隆模型。数据集支持 英语(en)、日语(ja)、韩语(ko)和中文(zh) 四种目标语言,音频由 bosonai/higgs-tts-3-4b 模型通过 sglang-omni 合成。
数据集配置与内容
数据集包含以下五个配置(config),分别服务于不同的用途:
| 配置名称 | 描述 | 数据规模 |
|---|---|---|
samples_showcase |
包含40个随机挑选的跨语言样本对(每种语言10个),每个样本对提供用于语音克隆的参考音频,便于对比音色。 | 40个样本 |
samelang_expressive |
主语料库,同语言扩展生成。基于每个伪参考音频,合成1000段目标语言文本,总计约480万条克隆音频。 | 约478万行,≈3.3 TB音频数据,约11,000小时 |
references |
包含1200条经过筛选的Emilia单语言真人语音片段。 | 1200条 |
audio_prompts |
包含14,400条跨语言合成音频,来自步骤1:每个Emilia真实说话人被克隆到4种目标语言,每种语言3段文本。 | 14,400条 |
audio_prompts_expressive |
与audio_prompts相同,但使用了表现力提示选择,这些音频作为audio_prompts_expressive的伪参考。 |
14,400条 |
主要语料库:samelang_expressive 详细说明
- 生成逻辑:从
audio_prompts_expressive中选取伪参考音频(真实Emilia说话人跨语言克隆至目标语言),然后对每个伪参考合成1000段目标语言文本,形成1200 个说话人 × 4 种语言 × 1000 段文本 ≈ 480万条克隆音频。 - 数据分片:按语言分片存储,格式为
data/samelang/<语言代码>/train-XXXXX-of-00240.parquet,每种语言240个分片,每个分片约5000行数据。 - 数据行模式:每行包含以下字段:
audio:音频结构(包含字节和路径,可自动转换为Hugging FaceAudio特征)text:文本内容lang:语言ref_id:参考音频IDspeaker_id:说话人IDtext_id:文本IDduration:音频时长sample_rate:采样率ref_audio_path:参考音频路径ref_text:参考文本engine:合成引擎original_text:原始文本
- 合成引擎:
sglang-omni-higgs-audio-v3,使用基于表现力重标签的提示(从每个源说话人的高质量池中选取)。
使用方式
-
流式加载(推荐):适用于约3.3 TB的音频数据,避免本地下载。 python from datasets import load_dataset ds = load_dataset("leeoxiang/multi_lingo_data", "samelang_expressive", split="train", streaming=True) row = next(iter(ds))
-
加载单一语言:例如仅加载中文数据。 python from datasets import load_dataset ds = load_dataset("leeoxiang/multi_lingo_data", data_files="data/samelang/zh/train-*.parquet", split="train", streaming=True)
-
完整下载:通过
huggingface_hub下载所有音频数据。 bash hf download leeoxiang/multi_lingo_data --repo-type dataset --include data/samelang/** --local-dir ./multi_lingo_data
数据集许可证与标签
- 许可证:cc-by-nc-4.0
- 任务类别:text-to-speech, audio-to-audio
- 数据规模:1M < n < 10M (约478万行)
- 默认配置:
samples_showcase




