bismarck91/sm-cv-en-id
收藏资源简介:
这是一个多语言语音翻译数据集,包含源语言和目标语言的成对数据。每个样本包括:唯一标识符(id)、语言对标识(pair)、源语言代码(src_lang)、目标语言代码(tgt_lang)、源语言音频(src_audio,采样率16kHz)、目标语言音频(tgt_audio,采样率16kHz)、源语言文本标记(src_tokens)和目标语言文本标记(tgt_tokens)。数据集仅包含训练集,共21781个样本,用于语音到语音或语音到文本的翻译任务。
This is a multilingual speech translation dataset containing paired data for source and target languages. Each sample includes: unique identifier (id), language pair identifier (pair), source language code (src_lang), target language code (tgt_lang), source language audio (src_audio, 16kHz sampling rate), target language audio (tgt_audio, 16kHz sampling rate), source language text tokens (src_tokens), and target language text tokens (tgt_tokens). The dataset only contains a training split with 21,781 examples, intended for speech-to-speech or speech-to-text translation tasks.




