MLC-SLM
收藏资源简介:
MLC-SLM数据集是一个包含约1604小时多语言对话语音数据的真实世界数据集,包含11种语言,包括英语、法语、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、俄语、泰语和越南语。数据集分为训练集、开发集、评估集1和评估集2,每个集合包含大约1507小时、32小时、32小时和32小时的语音数据。数据集旨在用于构建多语言对话语音语言模型,解决语言多样性、说话者变化和上下文挑战。数据集的创建过程包括录制、标注、分割和转录等步骤。该数据集的应用领域包括语音识别、语音分割和说话人识别,旨在解决多语言对话中的语言识别、说话人识别和语音识别等问题。
The MLC-SLM dataset is a real-world multilingual conversational speech dataset containing approximately 1,604 hours of data across 11 languages, namely English, French, German, Italian, Portuguese, Spanish, Japanese, Korean, Russian, Thai, and Vietnamese. The dataset is split into four subsets: training set, development set, evaluation set 1, and evaluation set 2, which hold approximately 1,507 hours, 32 hours, 32 hours, and 32 hours of speech data respectively. This dataset is intended for constructing multilingual conversational speech language models, with the goal of addressing challenges such as language diversity, speaker variability, and contextual complexities. The dataset creation process includes steps like recording, annotation, segmentation, and transcription. Its application domains cover speech recognition, speech segmentation, and speaker recognition, aiming to solve core problems including language recognition, speaker recognition, and speech recognition in multilingual conversational scenarios.




