bismarck91/sm-cv-en-fi
收藏资源简介:
该数据集是一个多语言语音翻译数据集,包含源语言和目标语言的音频和文本数据。每个样本具有唯一标识符(id)、语言对(pair)、源语言(src_lang)和目标语言(tgt_lang)代码,以及源音频(src_audio)和目标音频(tgt_audio)文件,音频采样率为16000 Hz。此外,还包括源语言文本的token序列(src_tokens)和目标语言文本的token序列(tgt_tokens),支持语音到文本或文本到语音的翻译任务。数据集仅包含训练集,共有9004个样本,总大小约为3.59GB,适用于机器翻译、语音识别和语音合成等NLP研究。
This dataset is a multilingual speech translation dataset containing audio and text data for source and target languages. Each sample includes a unique identifier (id), language pair (pair), source language (src_lang) and target language (tgt_lang) codes, along with source audio (src_audio) and target audio (tgt_audio) files with a sampling rate of 16000 Hz. Additionally, it includes token sequences for source language text (src_tokens) and target language text (tgt_tokens), supporting tasks such as speech-to-text or text-to-speech translation. The dataset consists only of a training set with 9004 examples and a total size of approximately 3.59GB, suitable for NLP research in machine translation, speech recognition, and speech synthesis.




