synthetic_S2S
收藏资源简介:
Synthetic S2S 数据集是一个面向语音到语音翻译(S2S)任务的合成平行数据集,覆盖10种语言:英语、西班牙语、法语、荷兰语、日语、阿拉伯语、中文、印地语、泰卢固语和泰米尔语。该数据集旨在为自动语音识别(ASR)、机器翻译(MT)、文本到语音合成(TTS)以及语音到语音翻译提供训练数据。数据构建以真实印地语音频(来自 ai4bharat/SeamlessAlign 数据集的印地语部分)为起点,通过翻译生成其他9种语言的文本,再使用基于同一印地语说话人语音克隆的 TTS 生成对应音频,确保每个样本中所有语言的说话人身份一致。每个原始印地语句子生成9个平行(文本,音频)对,其中印地语为真实录音,其余8种语言为合成数据。通过任意组合两个语言对,可以得到所有45个语言方向(共90个有向对),而无需额外生成。数据集以 parquet 格式存储,每个语言方向(如 hi-en、hi-es 等)对应一个子文件夹,每个子文件夹包含多个分片文件,每个分片包含500行。数据字段包括:row_id(跨语言对的关联键)、source_lang/target_lang(源/目标语言代码)、source_audio/target_audio(源/目标音频,wav 格式)、source_text/target_text(源/目标文本)、gender_label(基于音高的性别标签:male/female/unknown)以及 reference_audio(原始印地语音频,用于语音克隆的参考)。翻译方法:英语文本直接取自源数据集,泰卢固语和泰米尔语使用 IndicTrans2 模型,其余语言使用 Google Translate。所有合成音频通过 Fish Audio 的语音克隆服务生成。该数据集适用于多语言语音翻译、跨语言语音克隆、多语言 TTS 等研究。
Synthetic S2S is a synthetic parallel dataset for speech-to-speech translation (S2S) tasks, covering 10 languages: English, Spanish, French, Dutch, Japanese, Arabic, Chinese, Hindi, Telugu, and Tamil. It is designed to provide training data for automatic speech recognition (ASR), machine translation (MT), text-to-speech synthesis (TTS), and speech-to-speech translation. The data construction starts with real Hindi audio (from the Hindi part of the ai4bharat/SeamlessAlign dataset), generates text in the other 9 languages via translation, and then uses TTS with voice cloning from the same Hindi speaker to produce corresponding audio, ensuring consistent speaker identity across all languages in each sample. Each original Hindi sentence yields 9 parallel (text, audio) pairs, with Hindi being real recordings and the other 8 languages being synthetic. By combining any two language pairs, all 45 language directions (90 directed pairs) can be obtained without additional generation. The dataset is stored in parquet format, with each language direction (e.g., hi-en, hi-es) in a subfolder containing multiple shards, each shard having 500 rows. Fields include: row_id (cross-language pair key), source_lang/target_lang (source/target language codes), source_audio/target_audio (source/target audio in wav format), source_text/target_text (source/target text), gender_label (pitch-based gender: male/female/unknown), and reference_audio (original Hindi audio for voice cloning). Translation methods: English text is taken directly from the source dataset, Telugu and Tamil use IndicTrans2, and other languages use Google Translate. All synthetic audio is generated via Fish Audios voice cloning service. The dataset is suitable for research in multilingual speech translation, cross-lingual voice cloning, and multilingual TTS.
数据集概述
数据集名称: Synthetic S2S Dataset
覆盖语言(10种): 英语、西班牙语、法语、荷兰语、日语、阿拉伯语、中文、印地语、泰卢固语、泰米尔语
数据集用途
该数据集支持自动语音识别(ASR)、机器翻译(MT)、文本转语音(TTS)以及语音到语音翻译(speech-to-speech translation)的训练,覆盖上述10种语言。
数据生成机制
- 基础数据来源于
ai4bharat/SeamlessAlign(Indic SeamlessAlign)的印地语部分,提供真实的印地语音频、印地语文本和英语文本(源数据中已翻译)。 - 每一条印地语记录会额外生成8个目标语言的文本和8个目标语言的音频(通过语音克隆TTS生成,始终以原始真实印地语音频为条件,避免克隆的克隆造成的质量损失)。
- 每条记录最终包含9个平行的(文本,音频)元组——1个真实(印地语)+ 8个合成(英语文本来自源数据,但音频为生成)。
- 任意2个元组可组合成一个训练对(例如
es→ja),在读取时动态组装,无需额外调用翻译或TTS。 - 每行9个生成结果可产生全部45个语言对(90个有向对),组合步骤无需额外计算成本。
所有合成音频共享同一印地语说话人的克隆声音和性别标签(gender_label),每个印地语行计算一次,不会为每个语言对重新计算。
数据集结构
oscowlai/synthetic_S2S/ └── indic_seamlessalign/ ├── hi-en/ ├── hi-es/ ├── hi-fr/ ├── hi-nl/ ├── hi-ja/ ├── hi-ar/ ├── hi-zh/ ├── hi-te/ ├── hi-ta/ └── [其余36个组合语言对在读取时动态组装,不单独存储]
每个 hi-X/ 文件夹包含 parquet 分片文件(如 generated-00000.parquet,每个分片500行)。
数据字段说明
| 字段 | 类型 | 描述 |
|---|---|---|
row_id |
int | 所有 hi-X/ 文件夹共享的关联键——相同的 row_id 始终对应同一条原始印地语句子 |
source_lang |
string | 该行的源语言代码 |
target_lang |
string | 该行的目标语言代码 |
source_audio |
bytes (wav) | 源侧音频 |
target_audio |
bytes (wav) | 目标侧音频(除真实录音外均为语音克隆TTS) |
source_text |
string | 源侧转写文本 |
target_text |
string | 目标侧翻译文本 |
gender_label |
string | male / female / unknown——基于音高的启发式判断(librosa YIN),每个印地语行计算一次 |
reference_audio |
bytes (wav) | 用于语音克隆的原始真实印地语音频。对 hi-X 行与 source_audio 相同;对组合的非印地语对(如 es-ja),仍为原始印地语剪辑 |
翻译方法
| 目标语言 | 方法 |
|---|---|
| 英语 | 源数据集自带,无需翻译 |
| 泰卢固语、泰米尔语 | IndicTrans2(ai4bharat/indictrans2-indic-indic-dist-320M),本地运行 |
| 西班牙语、法语、荷兰语、日语、阿拉伯语、中文 | Google Translate |
数据来源
- 真实基础数据: Indic SeamlessAlign(
ai4bharat/SeamlessAlign,indic2en配置,hindi分割),属于 BhasaAnuvaad 项目(AI4Bharat) - 合成音频生成: Fish Audio(
s2.1-pro-free)




