遇见数据集

XVSS-X

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

XVSS-X(CVSS-X)是一个面向28种目标语言的大规模多语言语音到语音翻译(S2ST)语料库,是对原始CVSS语料库的扩展与方向反转(英语→28种语言)。该数据集旨在实现英语与多种语言之间的双向语音翻译,并支持以英语为枢轴进行任意语言对的间接翻译。XVSS-X基于Mozilla Common Voice 17英语语音数据,包含约240,192个英语话语,经过文本对齐、使用NLLB-200(蒸馏版600M)翻译为28种目标语言文本,再通过OmniVoice零样本跨语言语音合成生成目标语音。数据集提供两种变体:XVSS-X-C(规范型)使用每语言两个固定参考声音(一男一女)生成语音,约6,730小时;XVSS-X-T(音色迁移型)保留原始英语说话人的声学特征,约9,340小时。总音频时长约16,070小时,包含超过1,340万平行语音对。每个语言的数据划分为训练集222,349条、开发集10,000条、测试集7,843条。目标语言覆盖12个语系,包括罗曼语族(葡萄牙语、西班牙语、法语、意大利语、罗马尼亚语、加泰罗尼亚语)、日耳曼语族(德语、荷兰语、瑞典语、丹麦语、挪威语)、斯拉夫语族(俄语、波兰语、捷克语、乌克兰语)、汉日韩语(汉语、日语、韩语)、乌拉尔语族(芬兰语、匈牙利语)、印度-伊朗语族(印地语、波斯语)以及其他语言(希腊语、希伯来语、土耳其语、泰语、印度尼西亚语、越南语)。该语料库适用于语音到语音翻译、文本到语音、跨语言语音克隆、语音翻译评估等任务。合成译文和语音对采用CC-BY-NC 4.0许可证。

XVSS-X (CVSS-X) is a large-scale multilingual speech-to-speech translation (S2ST) corpus targeting 28 languages, extending and reversing the direction of the original CVSS corpus (English → 28 languages). This dataset aims to enable bidirectional speech translation between English and multiple languages, and supports indirect translation between any language pair using English as a pivot. XVSS-X is based on Mozilla Common Voice 17 English speech data, containing approximately 240,192 English utterances. After text alignment, the texts are translated into 28 target languages using NLLB-200 (distilled 600M), and target speech is generated via OmniVoice zero-shot cross-lingual speech synthesis. The dataset provides two variants: XVSS-X-C (canonical) uses two fixed reference voices (one male, one female) per language, totaling about 6,730 hours; XVSS-X-T (timbre transfer) retains the original English speakers acoustic characteristics, totaling about 9,340 hours. The total audio duration is approximately 16,070 hours, containing over 13.4 million parallel speech pairs. Each languages data is split into 222,349 training, 10,000 development, and 7,843 test samples. The target languages cover 12 language families, including Romance (Portuguese, Spanish, French, Italian, Romanian, Catalan), Germanic (German, Dutch, Swedish, Danish, Norwegian), Slavic (Russian, Polish, Czech, Ukrainian), Sino-Tibetan/Japanese/Korean (Chinese, Japanese, Korean), Uralic (Finnish, Hungarian), Indo-Iranian (Hindi, Persian), and others (Greek, Hebrew, Turkish, Thai, Indonesian, Vietnamese). The corpus is applicable to tasks such as speech-to-speech translation, text-to-speech, cross-lingual voice cloning, and speech translation evaluation. The synthesized translations and speech pairs are licensed under CC-BY-NC 4.0.

创建时间:
2026-09-08
原始信息汇总

XVSS-X 数据集概述

基本信息

  • 数据集名称:XVSS-X: A Multilingual Speech-to-Speech Translation Corpus for 28 Languages
  • 数据集地址:https://huggingface.co/datasets/lgris/XVSS-X
  • 许可证:CC-BY-NC-4.0
  • 任务类别:audio-to-audio、text-to-speech、translation
  • 数据规模:10M < n < 100M
  • 标签:speech-to-speech-translation、speech-translation、common-voice、cross-lingual-tts、voice-cloning

数据集简介

XVSS-X(CVSS-X)是一个大规模合成语音到语音翻译(S2ST)语料库,是对原始 CVSS 数据集的补充与扩展,将翻译方向反转为英语 → 28 种目标语言。结合 CVSS,XVSS-X 可实现:

  1. 双向语音到语音翻译(英语 ↔ 28 种语言)。
  2. 以英语为枢纽的任意语言对之间的多语言翻译(X → EN → Y)。
  3. 语音到语音任务中跨语言语音保持能力的直接评估。

数据变体

  • XVSS-X-C(Canonical):目标语音使用每种语言两个固定的高清晰度参考声音(一男一女)合成,声音选择依据源说话人的性别元数据(男性 81.4%,女性 18.6%)。
  • XVSS-X-T(Timbre-Transferred):通过 OmniVoice 的零样本跨语言语音克隆,在目标语音中保留原始英语说话人的说话人特征。

语料库统计

指标 数值
源语言 英语(Common Voice 17)
目标语言 28
语系 12(7 个宏语系)
每种语言名义样本数 240,192
数据划分(每种语言) Train: 222,349 • Dev: 10,000 • Test: 7,843
总平行语音对 6,725,176(Canonical)+ 6,724,326(Timbre)= 13,449,502 个音频文件
XVSS-X-C 时长 ~6,730 小时(平均 3.6 秒/句)
XVSS-X-T 时长 ~9,340 小时(平均 5.0 秒/句)
总音频时长 ~16,070 小时(比 CVSS 大 8 倍)

目标语言

XVSS-X 覆盖 12 个类型学语系的 28 种语言:

语系 数量 语言(ISO 代码)
Romance 6 Portuguese (pt), Spanish (es), French (fr), Italian (it), Romanian (ro), Catalan (ca)
Germanic 5 German (de), Dutch (nl), Swedish (sv), Danish (da), Norwegian (no)
Slavic 4 Russian (ru), Polish (pl), Czech (cs), Ukrainian (uk)
CJK 3 Chinese (zh), Japanese (ja), Korean (ko)
Uralic 2 Finnish (fi), Hungarian (hu)
Indo-Iranian 2 Hindi (hi), Persian (fa)
Other 6 Greek (el), Hebrew (he), Turkish (tr), Thai (th), Indonesian (id), Vietnamese (vi)

数据集生成流程

  1. 源数据与对齐:来自 Common Voice 17 的英语录音,通过归一化文本匹配与原始 CVSS 语料库对齐(恢复 91.0% 样本)。dev 集从训练划分补充至恰好 10,000 个样本。
  2. 文本翻译:使用 facebook/nllb-200-distilled-600M 翻译转录文本,该模型经 7 个翻译模型广泛基准测试后因最佳质量/吞吐量权衡而被选用。
  3. 语音合成:使用 k2-fsa/OmniVoice 生成,这是一个多语言 transformer TTS 引擎,具备零样本跨语言合成能力,且不传递源口音痕迹。

质量评估结果

评估在 dev 集中每种语言 200 句的分层随机样本上进行(每个变体 5,600 个样本,通过统计功效分析确定)。

按语系评估(CVSS-X)

语系 (N) WER/CER (C) WER/CER (T) ASR-BLEU (C) ASR-BLEU (T) UTMOS (C) UTMOS (T)
Romance (6) 5.8 8.2 90.3 88.0 3.54 3.27
Germanic (5) 9.5 12.2 85.3 81.1 3.62 3.27
Slavic (4) 7.0 7.7 86.9 85.9 3.48 3.17
CJK (3)* 5.0 10.2 75.2 67.9 3.56 3.20
Uralic (2) 10.3 14.3 84.0 78.3 3.54 3.21
Indo-Iranian (2) 22.5 23.0 63.7 60.0 3.61 3.20
Other (6) 24.8 24.8 65.0 64.9 3.53 3.14
Average 12.1 14.1 82.4 79.4 3.55 3.21

*对于无分词 CJK 语言(ZH、JA、KO),报告字符错误率(CER)和字符级 BLEU。

与 CVSS 的总体比较(使用相同流程重新评估)

指标 XVSS-X-C XVSS-X-T CVSS-C CVSS-T
UTMOS (1–5) 3.55 3.21 4.43 3.61
ASR-BLEU 82.4 79.4 94.2 93.8
WER/CER (%) 12.1 14.1 3.5 4.0
Speaker Similarity (ECAPA-TDNN) -- 0.607 -- --

数据集配置

数据集提供以下配置,每个配置均包含 train、dev、test 三个划分:

  • en-pt(英语-葡萄牙语)
  • en-es(英语-西班牙语)
  • en-fr(英语-法语)
  • en-it(英语-意大利语)
  • en-ro(英语-罗马尼亚语)
  • en-ca(英语-加泰罗尼亚语)
  • en-de(英语-德语)
  • en-nl(英语-荷兰语)
  • en-sv(英语-瑞典语)
  • en-da(英语-丹麦语)
  • en-no(英语-挪威语)
  • en-ru(英语-俄语)
  • en-pl(英语-波兰语)
  • en-cs(英语-捷克语)

使用方式

完整数据集(约 2.7 TB,覆盖 28 个语言对,13.4M+ 音频文件)正在镜像至 Hugging Face Hub 的 lgris/XVSS-X 账户下。可通过 datasets 库直接加载和流式读取子集。

路线图:版本 2(开发中)

XVSS-X v2 计划的主要改进包括:

  • TranslateGemma-12B 集成:用 Google 的 TranslateGemma-12B 替换 NLLB-200,以显著提升翻译保真度、自然措辞,并通过过渡到 Apache 2.0 许可证消除商业限制。
  • Common Voice 26 与 Spontaneous Speech 4.0:从 CV17 扩展至 Common Voice 26 并集成 Spontaneous Speech 4.0,提供更丰富的会话语音、更真实的非流利现象和更大的说话人多样性。
  • 端到端 LLM 基线:训练和评估原生离散音频 token 语音到语音翻译基线。

许可证说明

  • 音频与源转录:继承自 Mozilla Common Voice(CC0 1.0 Universal)。
  • 合成翻译与语音对:由于底层 facebook/nllb-200-distilled-600M 模型许可证,采用 Creative Commons Attribution-NonCommercial 4.0 International(CC-BY-NC 4.0)分发。
  • 代码库与脚本:采用宽松的 MIT 许可证发布。

引用

bibtex @inproceedings{gris2026cvssx, title={{CVSS-X: A Multilingual Speech-to-Speech Translation Corpus for 28 Languages}}, author={Gris, Lucas Rafael Stefanel and Ferreira, Alef Iury Siqueira and de Oliveira, F. S. and da Rosa, Augusto Seben and Ferro Filho, Alexandre Costa and Galv{~a}o Filho, Arlindo Rodrigues and Soares, Anderson da Silva}, booktitle={Proceedings of the Annual Meeting of the Association for Computational Linguistics (ACL)}, year={2026} }

搜集汇总
数据集介绍
XVSS-X 数据集图片
构建方式
在语音到语音翻译研究领域,构建大规模、多语言且高质量的平行语料库始终是一项核心挑战。XVSS-X的构建以Common Voice 17英文录音为源数据,经由规范化文本匹配与原始CVSS语料库对齐,保留222,349条训练样本、10,000条开发样本及7,843条测试样本。转录文本借助facebook/nllb-200-distilled-600M模型翻译为28种目标语言,继以k2-fsa/OmniVoice合成引擎生成目标语音。该引擎支持零样本跨语言合成,并提供两种变体:XVSS-X-C采用每语言固定的高清晰参考语音,而XVSS-X-T则通过零样本跨语言声音克隆保留源说话人的音色特征。
特点
XVSS-X在语料规模与语言覆盖度上呈现出显著优势。其涵盖28种目标语言,横跨12个语系,总计生成逾1,344万条平行语音对,音频总时长约16,070小时,体量约为原始CVSS语料库的八倍。该数据集提供规范合成与音色迁移两种互补变体,后者通过ECAPA-TDNN评估的说话人相似度达到0.607,有效支持跨语言声音保持研究。语料库按训练、开发、测试三划分严格组织,每个语言对的开发集与测试集样本量固定,为模型评估提供了可复现的基准。合成语音以24kHz采样率存储,元数据与清单文件完备,便于直接加载与流式传输。
使用方法
XVSS-X面向语音到语音翻译、跨语言文本到语音合成及声音克隆等任务,可通过Hugging Face数据集库直接加载与流式访问。用户指定语言配置(如en-pt)与划分(train、dev或test)后,即可获取包含源文本、目标文本及对应音频的样本。数据集仓库同时提供模块化生成管线与完整评估套件,涵盖基于Whisper large-v3的ASR-BLEU计算、UTMOS自然度评分以及ECAPA-TDNN说话人相似度度量。研究人员既可沿用官方预计算清单快速复现实验,也可从原始Common Voice数据重新执行对齐、翻译与合成流程,实现端到端的可定制化数据生成。
背景与挑战
背景概述
语音到语音翻译(S2ST)旨在打破语言壁垒,实现跨语言的口语交流。然而,该领域长期受限于高质量平行语音数据的稀缺,尤其是从英语到多语种方向的语料。原有的CVSS语料库仅支持21种源语言翻译为英语(多对一),无法满足反向翻译与双向交流的需求。为填补这一空白,研究人员构建了XVSS-X语料库,涵盖英语到28种类型学多样语言的翻译,覆盖12个语系,总音频时长约16,070小时,规模为CVSS的八倍。该数据集由巴西联邦大学等机构的研究者创建,通过合成语音技术扩展了S2ST的资源边界,为多语言翻译、跨语言声音克隆等研究提供了关键基础设施。
当前挑战
XVSS-X所应对的核心挑战在于多语种语音翻译中高质量平行数据的生成与评估。构建过程中,需解决源语音与文本的对齐、翻译质量与合成自然度的平衡、跨语言音色保持等难题。具体而言,从Common Voice 17中对齐源语音时,仅能恢复91.0%的样本;翻译环节需在7个模型中权衡质量与效率;合成阶段则需在规范语音与音色迁移两种模式下,分别应对清晰度与说话人相似度的取舍。评估结果显示,不同语系性能差异显著,如印欧语系和“其他”语系的词错误率高达22.5%和24.8%,远高于罗曼语系的5.8%,揭示了类型学距离对翻译质量的深刻影响。
常用场景
经典使用场景
在语音到语音翻译(S2ST)与跨语言语音合成的学术探索中,XVSS-X数据集构筑了一座连接英语与二十八种类型学迥异语言的桥梁。其最经典的使用场景在于,研究者可借助该语料开展以英语为枢轴的任意语言对之间的语音翻译实验,即先将源语言语音译为英语文本,再合成目标语言语音,从而绕过直接平行语音数据稀缺的瓶颈。同时,该数据集提供的规范版本与音色迁移版本,使得语音翻译系统在保持语义准确性的同时,亦能兼顾说话人音色特征的跨语言保留,为多语言语音交互系统的端到端训练与评估提供了不可多得的基准资源。
解决学术问题
长久以来,语音翻译研究受制于多语言平行语音语料的匮乏,尤其缺乏从英语到众多低资源语言的直接语音对。XVSS-X通过大规模合成管线,系统性地解决了英语至二十八种目标语言的双向语音翻译数据缺失问题,使得研究者得以在同一框架下探究语言家族、类型学距离对翻译质量与语音自然度的影响。该数据集还回应了跨语言音色保留这一核心学术挑战,其音色迁移版本为零样本跨语言声音克隆的评价提供了标准化测试平台,推动了语音翻译系统在语义忠实度与说话人身份一致性之间的平衡研究,对多语言语音处理领域具有显著的奠基意义。
衍生相关工作
XVSS-X的问世催生了一系列围绕多语言语音翻译与跨语言语音合成的衍生研究。基于该数据集,研究者得以训练并评估以英语为枢轴的多跳语音翻译系统,探索语音到语音直接建模与级联建模的优劣。音色迁移版本的发布激发了零样本跨语言声音克隆技术的对比研究,推动了说话人相似度评价指标的标准化。此外,该数据集与原始CVSS语料共同构成了双向语音翻译的完整生态,为多语言语音翻译基准的建立、离散语音标记大模型基线的发展以及翻译模型(如NLLB与TranslateGemma)在语音任务中的适配研究提供了关键数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务