bismarck91/sm-cv-en-pl
收藏资源简介:
这是一个多语言语音翻译数据集,包含源语言和目标语言的配对数据。每个样本包括:唯一标识符(id)、语言对标识(pair)、源语言代码(src_lang)、目标语言代码(tgt_lang)、源语言音频(src_audio,采样率16000Hz)、目标语言音频(tgt_audio,采样率16000Hz)、源语言文本token序列(src_tokens)和目标语言文本token序列(tgt_tokens)。数据集仅包含训练集,共48683个样本,适用于语音翻译、语音识别或多语言语音处理任务。
This is a multilingual speech translation dataset containing paired data between source and target languages. Each sample includes: unique identifier (id), language pair identifier (pair), source language code (src_lang), target language code (tgt_lang), source language audio (src_audio, sampling rate 16000Hz), target language audio (tgt_audio, sampling rate 16000Hz), source language text token sequence (src_tokens), and target language text token sequence (tgt_tokens). The dataset only contains a training split with 48,683 samples, suitable for speech translation, speech recognition, or multilingual speech processing tasks.




