遇见数据集

synthetic_S2S

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

Synthetic S2S 数据集是一个面向语音到语音翻译(S2S)任务的合成平行数据集,覆盖10种语言:英语、西班牙语、法语、荷兰语、日语、阿拉伯语、中文、印地语、泰卢固语和泰米尔语。该数据集旨在为自动语音识别(ASR)、机器翻译(MT)、文本到语音合成(TTS)以及语音到语音翻译提供训练数据。数据构建以真实印地语音频(来自 ai4bharat/SeamlessAlign 数据集的印地语部分)为起点,通过翻译生成其他9种语言的文本,再使用基于同一印地语说话人语音克隆的 TTS 生成对应音频,确保每个样本中所有语言的说话人身份一致。每个原始印地语句子生成9个平行(文本,音频)对,其中印地语为真实录音,其余8种语言为合成数据。通过任意组合两个语言对,可以得到所有45个语言方向(共90个有向对),而无需额外生成。数据集以 parquet 格式存储,每个语言方向(如 hi-en、hi-es 等)对应一个子文件夹,每个子文件夹包含多个分片文件,每个分片包含500行。数据字段包括:row_id(跨语言对的关联键)、source_lang/target_lang(源/目标语言代码)、source_audio/target_audio(源/目标音频,wav 格式)、source_text/target_text(源/目标文本)、gender_label(基于音高的性别标签:male/female/unknown)以及 reference_audio(原始印地语音频,用于语音克隆的参考)。翻译方法:英语文本直接取自源数据集,泰卢固语和泰米尔语使用 IndicTrans2 模型,其余语言使用 Google Translate。所有合成音频通过 Fish Audio 的语音克隆服务生成。该数据集适用于多语言语音翻译、跨语言语音克隆、多语言 TTS 等研究。

Synthetic S2S is a synthetic parallel dataset for speech-to-speech translation (S2S) tasks, covering 10 languages: English, Spanish, French, Dutch, Japanese, Arabic, Chinese, Hindi, Telugu, and Tamil. It is designed to provide training data for automatic speech recognition (ASR), machine translation (MT), text-to-speech synthesis (TTS), and speech-to-speech translation. The data construction starts with real Hindi audio (from the Hindi part of the ai4bharat/SeamlessAlign dataset), generates text in the other 9 languages via translation, and then uses TTS with voice cloning from the same Hindi speaker to produce corresponding audio, ensuring consistent speaker identity across all languages in each sample. Each original Hindi sentence yields 9 parallel (text, audio) pairs, with Hindi being real recordings and the other 8 languages being synthetic. By combining any two language pairs, all 45 language directions (90 directed pairs) can be obtained without additional generation. The dataset is stored in parquet format, with each language direction (e.g., hi-en, hi-es) in a subfolder containing multiple shards, each shard having 500 rows. Fields include: row_id (cross-language pair key), source_lang/target_lang (source/target language codes), source_audio/target_audio (source/target audio in wav format), source_text/target_text (source/target text), gender_label (pitch-based gender: male/female/unknown), and reference_audio (original Hindi audio for voice cloning). Translation methods: English text is taken directly from the source dataset, Telugu and Tamil use IndicTrans2, and other languages use Google Translate. All synthetic audio is generated via Fish Audios voice cloning service. The dataset is suitable for research in multilingual speech translation, cross-lingual voice cloning, and multilingual TTS.

创建时间:
2026-07-29
原始信息汇总

数据集概述

数据集名称: Synthetic S2S Dataset

覆盖语言(10种): 英语、西班牙语、法语、荷兰语、日语、阿拉伯语、中文、印地语、泰卢固语、泰米尔语

数据集用途

该数据集支持自动语音识别(ASR)、机器翻译(MT)、文本转语音(TTS)以及语音到语音翻译(speech-to-speech translation)的训练,覆盖上述10种语言。

数据生成机制

  1. 基础数据来源于 ai4bharat/SeamlessAlign(Indic SeamlessAlign)的印地语部分,提供真实的印地语音频、印地语文本和英语文本(源数据中已翻译)。
  2. 每一条印地语记录会额外生成8个目标语言的文本和8个目标语言的音频(通过语音克隆TTS生成,始终以原始真实印地语音频为条件,避免克隆的克隆造成的质量损失)。
  3. 每条记录最终包含9个平行的(文本,音频)元组——1个真实(印地语)+ 8个合成(英语文本来自源数据,但音频为生成)。
  4. 任意2个元组可组合成一个训练对(例如 es→ja),在读取时动态组装,无需额外调用翻译或TTS。
  5. 每行9个生成结果可产生全部45个语言对(90个有向对),组合步骤无需额外计算成本。

所有合成音频共享同一印地语说话人的克隆声音和性别标签(gender_label),每个印地语行计算一次,不会为每个语言对重新计算。

数据集结构

oscowlai/synthetic_S2S/ └── indic_seamlessalign/ ├── hi-en/ ├── hi-es/ ├── hi-fr/ ├── hi-nl/ ├── hi-ja/ ├── hi-ar/ ├── hi-zh/ ├── hi-te/ ├── hi-ta/ └── [其余36个组合语言对在读取时动态组装,不单独存储]

每个 hi-X/ 文件夹包含 parquet 分片文件(如 generated-00000.parquet,每个分片500行)。

数据字段说明

字段 类型 描述
row_id int 所有 hi-X/ 文件夹共享的关联键——相同的 row_id 始终对应同一条原始印地语句子
source_lang string 该行的源语言代码
target_lang string 该行的目标语言代码
source_audio bytes (wav) 源侧音频
target_audio bytes (wav) 目标侧音频(除真实录音外均为语音克隆TTS)
source_text string 源侧转写文本
target_text string 目标侧翻译文本
gender_label string male / female / unknown——基于音高的启发式判断(librosa YIN),每个印地语行计算一次
reference_audio bytes (wav) 用于语音克隆的原始真实印地语音频。对 hi-X 行与 source_audio 相同;对组合的非印地语对(如 es-ja),仍为原始印地语剪辑

翻译方法

目标语言 方法
英语 源数据集自带,无需翻译
泰卢固语、泰米尔语 IndicTrans2(ai4bharat/indictrans2-indic-indic-dist-320M),本地运行
西班牙语、法语、荷兰语、日语、阿拉伯语、中文 Google Translate

数据来源

  • 真实基础数据: Indic SeamlessAlign(ai4bharat/SeamlessAlignindic2en配置,hindi分割),属于 BhasaAnuvaad 项目(AI4Bharat)
  • 合成音频生成: Fish Audio(s2.1-pro-free
搜集汇总
数据集介绍
synthetic_S2S 数据集图片
构建方式
该数据集基于AI4Bharat的SeamlessAlign印地语真实语音片段构建,通过将真实印地语语音经语音克隆技术生成其余九种语言的语音,同时利用多种翻译引擎(如IndicTrans2和Google Translate)生成对应文本。具体而言,每条印地语样本被翻译为英语、西班牙语、法语、荷兰语、日语、阿拉伯语、中文、泰卢固语和泰米尔语九种语言,并采用同一声纹的克隆语音输出,确保说话人身份在全部语言间保持一致。数据集最终提供45种语言对(90个方向)的平行语料,所有非印地语语音均以真实印地语音频为条件生成,避免级联克隆带来的质量损耗。
特点
该数据集的核心特色在于其多语言一致性和生成策略的创新。所有合成语音共享同一说话人特征,为跨语言语音转换提供了理想的研究条件。数据集不仅覆盖主要语系,还包含了低资源语言如泰卢固语和泰米尔语。此外,每条数据均包含参考音频、性别标签(基于音高启发式算法)及源文本和译文,便于进行细粒度的语音和文本分析。其无重复存储的设计,通过实时组合生成45种语言对,大幅提升了存储和计算效率。
使用方法
使用该数据集时,用户可根据需求从九个基础目录(hi-X)中选取任意两个语向的元组,在运行时组装成训练对,实现任意语言间的语音到语音翻译。每条数据以parquet分片存储,每片包含500行,且带有统一的row_id用于跨语向关联。数据集的加载可借助HuggingFace datasets库直接访问,支持ASR、MT、TTS及S2S等任务的模型训练与评估,尤其适合多语言语音生成和翻译模型的研究。
背景与挑战
背景概述
synthetic_S2S数据集由AI4Bharat团队于2024年创建,旨在解决多语言语音到语音翻译(S2S)中平行语料稀缺的问题。该数据集基于Indic SeamlessAlign的印地语真实语音,通过语音克隆和机器翻译技术,生成覆盖10种语言(英语、西班牙语、法语、荷兰语、日语、阿拉伯语、中文、印地语、泰卢固语、泰米尔语)的合成平行语料,每条数据均保持同一说话人身份。其核心创新在于利用单一真实语音源,通过级联生成和组合策略,高效构建90个有向语言对的训练数据,极大促进了跨语言语音翻译、多语言语音合成及语音识别等领域的研究。该数据集的发布填补了同说话人多语言S2S语料的空白,为低资源语言对的模型训练提供了新思路,对多语言语音技术研究具有重要推动作用。
当前挑战
该数据集所应对的核心挑战在于多说话人一致的语音到语音翻译语料极度匮乏,真实世界中难以获取同一说话人跨10种语言的平行录音,传统方法依赖多步级联(ASR→MT→TTS)导致错误累积与说话人特征丢失。构建过程中,首要挑战是确保语音克隆质量,避免因克隆链式传播而衰退,因此设计为始终以真实印地语音频为条件,杜绝克隆克隆。其次,跨语言文本翻译需平衡质量与成本,采用IndicTrans2处理低资源印度语言,Google Translate覆盖其他语言,但翻译误差可能影响语音与文本对齐。此外,生成900万行(500行/分片)的合成音频消耗大量API计算资源,同时性别标签基于音高启发式算法,对部分语音可能误判,影响下游任务公平性。数据集的合成性质也带来领域适配问题,模型可能对TTS语音过拟合,需谨慎处理域偏移,确保在真实语音场景中的泛化能力。
常用场景
经典使用场景
该数据集为多语言语音到语音翻译(S2ST)研究提供了独特的训练资源。其核心设计在于利用真实印地语语音作为声纹锚点,通过语音克隆技术生成其余九种语言的高保真平行语音,从而构建出同一说话人跨语言的一致声学特征。这种构造方式解决了真实语料库中难以获取同说话人多语对录音的瓶颈,使得研究人员能够在控制的实验条件下,系统地训练和评估端到端S2ST模型,该数据集包含45种语言对(90个方向),支持从任意源语言到目标语言的映射,为跨语种语音转换、语音翻译及多语语音合成等任务提供了坚实基础。
解决学术问题
此数据集针对多语语音翻译领域长期存在的训练数据稀缺问题,特别是缺乏同一说话人跨语言平行语音的困境。通过合成方式大规模扩展了平行数据,使模型能够学习到跨语言声学特征的一致性映射,促进了端到端S2ST模型的稳健训练。其统一声纹设计减少了说话人变异性干扰,有助于深入研究纯语言转换机制,并为低资源语言(如泰卢固语、泰米尔语)提供了宝贵训练样本,显著拓宽了语音翻译的研究边界,对提升多语种沟通智能化水平具有重要学术意义。
衍生相关工作
基于此数据集,研究者得以探索一系列创新性工作。例如,开发更为精细的语音到语音翻译模型,利用其多方向对数据优化模型的语言无关表征。同时,它促进了跨语言语音转换、多语种文本到语音合成(TTS)的联合训练研究,并催生了对语音克隆鲁棒性和音色保持技术的改进工作。此外,数据集独特的设计启发研究者重新审视说话人身份在语音翻译中的作用,推动了身份解耦与泛化性能提升等前沿课题,包括制定相应的评估基准,以全面衡量系统在多种语言对上的表现,为后续研究奠定坚实基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务