bismarck91/sm-cv-ca-en
收藏资源简介:
该数据集是一个多语言语音翻译数据集,包含源语言和目标语言的配对数据。每个样本包括唯一标识符(id)、语言对名称(pair)、源语言代码(src_lang)、目标语言代码(tgt_lang)、源语言音频(src_audio,采样率16000Hz)、目标语言音频(tgt_audio,采样率16000Hz)、源语言文本token序列(src_tokens)和目标语言文本token序列(tgt_tokens)。数据集仅提供训练集,共3155个样本,适用于语音到语音或语音到文本的翻译任务。
This dataset is a multilingual speech translation dataset containing paired data for source and target languages. Each sample includes a unique identifier (id), language pair name (pair), source language code (src_lang), target language code (tgt_lang), source language audio (src_audio, sampling rate 16000Hz), target language audio (tgt_audio, sampling rate 16000Hz), source language text token sequence (src_tokens), and target language text token sequence (tgt_tokens). The dataset only provides a training set with 3155 samples, suitable for speech-to-speech or speech-to-text translation tasks.




