diaslmb/KSC2
收藏官方服务:
资源简介:
该数据集是一个音频-文本对齐数据集,主要用于语音处理任务,如语音识别或语音合成。它包含406138个训练样本,每个样本包括音频文件(audio)、对应的文本转录(text)、说话者标识(speaker)、音频片段的开始时间(start)和结束时间(end),以及音频时长(audio_duration)。数据集结构设计为支持时间对齐分析,适用于训练和评估语音相关模型。
This dataset is an audio-text alignment dataset, primarily designed for speech processing tasks such as speech recognition or speech synthesis. It contains 406,138 training examples, each comprising an audio file (audio), corresponding text transcription (text), speaker identifier (speaker), start time (start) and end time (end) of the audio segment, and audio duration (audio_duration). The dataset structure is tailored to support temporal alignment analysis, making it suitable for training and evaluating speech-related models.
提供机构:
diaslmb


