遇见数据集

multi_lingo_data

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

该数据集是一个用于训练富有表现力的多语言语音克隆模型的大规模跨语言及同语言文本转语音语料库。它覆盖了四种目标语言:英语、日语、韩语和中文。数据集的核心内容由bosonai/higgs-tts-3-4b模型通过sglang-omni合成。数据集包含五个主要配置:1)samples_showcase:包含40个来自主数据集的随机跨语言样本对,每个样本都配有其用于语音克隆的参考音频,便于进行音色对比。2)samelang_expressive:主数据集(正在上传中),规模约为478万行,总音频数据量约3.3TB。该数据集基于1200个说话者,为每个说话者在每种目标语言上合成了1000个文本,总计约480万个克隆音频。数据以分片Parquet文件形式组织,每个语言有240个分片。每条数据记录包含音频(自动转换为HuggingFace Audio特征)、文本、语言代码、参考ID、说话者ID、文本ID、时长、采样率、参考音频路径、参考文本、合成引擎和原始文本等字段。3)references:包含1200个精选的单语言真实说话者音频片段。4)audio_prompts:包含14400个跨语言合成音频,由每个真实的Emilia说话者克隆到4种目标语言,每种语言3个文本生成。5)audio_prompts_expressive:与audio_prompts类似,但采用了表现力提示选择,这些音频作为伪参考用于生成主数据集samelang_expressive。该数据集适用于多语言文本转语音、语音克隆和富有表现力的语音合成等任务。

This dataset is a large-scale cross-lingual and monolingual text-to-speech corpus for training expressive multilingual speech cloning models. It covers four target languages: English, Japanese, Korean, and Chinese. The core content of the dataset is synthesized by the bosonai/higgs-tts-3-4b model via sglang-omni. The dataset includes five main configurations: 1) samples_showcase: Contains 40 random cross-lingual sample pairs from the main dataset, each paired with a reference audio for speech cloning to facilitate timbre comparison. 2) samelang_expressive: The main dataset (currently under upload) has a scale of approximately 4.78 million rows and a total audio data volume of about 3.3 TB. Based on 1200 speakers, this dataset synthesizes 1000 texts for each speaker in each target language, totaling approximately 4.8 million cloned audios. The data is organized into sharded Parquet files, with 240 shards per language. Each data record contains fields including audio (automatically converted to HuggingFace Audio features), text, language code, reference ID, speaker ID, text ID, duration, sampling rate, reference audio path, reference text, synthesis engine, and original text. 3) references: Contains 1200 curated monolingual real speaker audio clips. 4) audio_prompts: Contains 14,400 cross-lingual synthesized audios, generated by cloning each real Emilia speaker to the four target languages with 3 texts per language. 5) audio_prompts_expressive: Similar to audio_prompts, but uses expressive prompt selection; these audios serve as pseudo-references for generating the main dataset samelang_expressive. This dataset is suitable for tasks such as multilingual text-to-speech, speech cloning, and expressive speech synthesis.

创建时间:
2026-07-13
原始信息汇总

数据集概述:Multi-lingual TTS Data (leeoxiang/multi_lingo_data)

该数据集是一个大规模、多语种的文本转语音(TTS)语料库,旨在训练具有表现力的多语种语音克隆模型。数据集支持 英语(en)、日语(ja)、韩语(ko)和中文(zh) 四种目标语言,音频由 bosonai/higgs-tts-3-4b 模型通过 sglang-omni 合成。


数据集配置与内容

数据集包含以下五个配置(config),分别服务于不同的用途:

配置名称 描述 数据规模
samples_showcase 包含40个随机挑选的跨语言样本对(每种语言10个),每个样本对提供用于语音克隆的参考音频,便于对比音色。 40个样本
samelang_expressive 主语料库,同语言扩展生成。基于每个伪参考音频,合成1000段目标语言文本,总计约480万条克隆音频。 约478万行,≈3.3 TB音频数据,约11,000小时
references 包含1200条经过筛选的Emilia单语言真人语音片段。 1200条
audio_prompts 包含14,400条跨语言合成音频,来自步骤1:每个Emilia真实说话人被克隆到4种目标语言,每种语言3段文本。 14,400条
audio_prompts_expressive audio_prompts相同,但使用了表现力提示选择,这些音频作为audio_prompts_expressive的伪参考。 14,400条

主要语料库:samelang_expressive 详细说明

  • 生成逻辑:从audio_prompts_expressive中选取伪参考音频(真实Emilia说话人跨语言克隆至目标语言),然后对每个伪参考合成1000段目标语言文本,形成 1200 个说话人 × 4 种语言 × 1000 段文本 ≈ 480万 条克隆音频。
  • 数据分片:按语言分片存储,格式为 data/samelang/<语言代码>/train-XXXXX-of-00240.parquet,每种语言240个分片,每个分片约5000行数据。
  • 数据行模式:每行包含以下字段:
    • audio:音频结构(包含字节和路径,可自动转换为Hugging Face Audio 特征)
    • text:文本内容
    • lang:语言
    • ref_id:参考音频ID
    • speaker_id:说话人ID
    • text_id:文本ID
    • duration:音频时长
    • sample_rate:采样率
    • ref_audio_path:参考音频路径
    • ref_text:参考文本
    • engine:合成引擎
    • original_text:原始文本
  • 合成引擎sglang-omni-higgs-audio-v3,使用基于表现力重标签的提示(从每个源说话人的高质量池中选取)。

使用方式

  • 流式加载(推荐):适用于约3.3 TB的音频数据,避免本地下载。 python from datasets import load_dataset ds = load_dataset("leeoxiang/multi_lingo_data", "samelang_expressive", split="train", streaming=True) row = next(iter(ds))

  • 加载单一语言:例如仅加载中文数据。 python from datasets import load_dataset ds = load_dataset("leeoxiang/multi_lingo_data", data_files="data/samelang/zh/train-*.parquet", split="train", streaming=True)

  • 完整下载:通过 huggingface_hub 下载所有音频数据。 bash hf download leeoxiang/multi_lingo_data --repo-type dataset --include data/samelang/** --local-dir ./multi_lingo_data


数据集许可证与标签

  • 许可证:cc-by-nc-4.0
  • 任务类别:text-to-speech, audio-to-audio
  • 数据规模:1M < n < 10M (约478万行)
  • 默认配置samples_showcase
搜集汇总
数据集介绍
multi_lingo_data 数据集图片
构建方式
multi_lingo_data数据集由leeoxiang团队构建,旨在为多语言语音克隆模型提供大规模训练语料。其核心构建流程分为两个阶段:首先,基于1200条来自Emilia数据集的真实单语说话人音频,利用bosonai/higgs-tts-3-4b模型通过sglang-omni引擎进行跨语言合成,生成14.4K条具有表现力的音频提示。随后,以这些提示为伪参考,对每位说话人在每种目标语言(英语、日语、韩语、中文)上合成1000条同语言文本的语音,形成约4.78M条、总时长约11,000小时的语音样本。整个数据集以Parquet分片形式存储,每个语言包含240个分片,每个分片约5000条记录。
特点
该数据集的核心特点在于其大规模与跨语言设计,覆盖四种目标语言,总计约3.3TB的音频数据,为多语言语音克隆研究提供了丰厚的资源。每条记录包含音频、文本、语言标签、参考音频路径等丰富字段,便于模型训练和评估。数据集的构建注重表现力,通过表现力重标签提示从高质量池中选取音频,使得合成的语音在情感和风格上更为自然。此外,数据集支持流式加载,能够高效处理海量数据,降低本地存储压力。
使用方法
用户可通过HuggingFace的datasets库便捷使用该数据集。对于主语料samelang_expressive,推荐采用流式加载方式,通过load_dataset函数指定配置名和streaming=True参数,即可迭代获取海量数据。若需仅使用单一语言,可通过data_files参数指定对应语言的Parquet文件路径。对于完整下载,可使用huggingface-cli的hf download命令。数据集还提供了samples_showcase配置,包含40个样本对用于快速预览和音色对比,适合初期探索和验证。
背景与挑战
背景概述
近年来,跨语言语音克隆与表现力增强语音合成(text-to-speech, TTS)成为人工智能语音领域的研究热点,但在构建高质量、多说话人、多语种标注语料库方面始终面临数据稀缺与标注成本高昂的瓶颈。由研究者leeoxiang主导构建的multi_lingo_data数据集正是在此背景下应运而生,旨在为训练具有表现力的多语言语音克隆大模型提供规模化训练资源。该数据集覆盖英语、日语、韩语与中文四大目标语言,利用bosonai/higgs-tts-3-4b模型通过sglang-omni框架合成生成,整体规模接近480万条语音样本(约3.3TB音频数据,折合约1.1万小时),是目前同领域内规模较大的公开跨语言语料库之一。其发布填补了单一语对数据集中表现力不足、说话人身份稀疏的空白,为多语言、多说话人零样本语音克隆研究提供了关键支撑。
当前挑战
该数据集所解决的领域问题主要集中于两重核心挑战。其一,跨语言与同语言语音克隆在真实场景中常面临表现力退化与音色不稳定问题,传统训练语料多局限于单一语言或少量说话人,无法支撑模型在大规模语种间实现稳健的说话人身份迁移。multi_lingo_data通过构建4种语言、1200位说话人的大规模克隆合成数据,为模型提供了充足的表现力参考样本。其二,数据集构建过程本身亦面临巨大挑战:将1200位真实说话人通过四语三文本方式生成语音提示语,再对每位说话人按目标语言合成1000句文本,总计生成近480万条样本;每条样本需严格保持音频、文本、说话人身份、参考音频路径等十多个字段的一致性与完整性,对数据流水线与存储管理提出了极高要求。此外,由于数据量高达3.3TB,采用分片parquet格式分批上传与支持流式读取的设计是应对传输与存储瓶颈的关键技术策略。
常用场景
经典使用场景
在跨语言与同语言文本到语音合成研究领域,multi_lingo_data数据集堪称一座里程碑式的资源宝库。该数据集由约478万条高质量音频-文本对构成,覆盖英语、日语、韩语和汉语四种目标语言,总时长逾11000小时,规模宏大且结构精良。其最经典的用途在于训练具备表现力的多语言语音克隆模型,尤其是将单一说话人的音色跨语言迁移至不同语种的文本内容,同时保留自然韵律与情感表达。研究者可借助该数据集探索语音合成中的“音色保持”与“语言泛化”双重挑战,为构建真正流畅、逼真的多语言语音助手奠定数据基础。
实际应用
在实际产业应用中,multi_lingo_data为构建全球化语音交互产品提供了坚实的数据支撑。借助该数据集训练的模型,可赋能智能音箱、车载语音系统、有声书制作及虚拟主播等场景,实现用户自定义音色在多种语言间的无缝切换。例如,一位中文使用者可拥有同一声线的英语、日语或韩语数字分身,极大提升跨文化交流的自然感与亲和力。此外,该数据集的高质量音频与精细标注文本,还可用于教育领域的多语言发音示范、用户定制化语音助手以及无障碍语音辅助系统,展现出广泛的社会价值与商业前景。
衍生相关工作
围绕multi_lingo_data数据集,一系列后续经典工作应运而生。在模型架构层面,研究者基于该数据集提出了面向多语言表现力语音合成的混合注意力机制与韵律控制模块,显著提升了跨语言音色迁移的稳定性。在训练策略方面,涌现出与该数据集紧密配合的渐进式多阶段微调方法,有效缓解了大规模合成数据引入的伪影问题。更值得关注的是,该数据集催生了多语言零样本语音克隆的基准评测体系,相关论文在顶级语音和AI会议上频繁引用此数据,并围绕其开展鲁棒性分析、说话人嵌入泛化等前沿探索,形成了活跃的学术生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务