tricky-tts-mistral
收藏资源简介:
该数据集包含文本到语音生成任务的相关数据,主要特征包括:文本提示(text_prompt)、生成的音频数据(generated_audio,采样率24kHz)、音频持续时间(duration_s)、音频标记数量(num_audio_tokens)、自动语音识别的转录文本(asr_transcription)及其词错误率(asr_wer)和字错误率(asr_cer)。数据集仅包含训练集(train),共4个样本,总大小约2.21MB。适用于语音合成、语音质量评估等研究任务。
This dataset contains data related to text-to-speech generation tasks. Its main features are as follows: text prompts (field: text_prompt), generated audio data (field: generated_audio, sampling rate: 24 kHz), audio duration (field: duration_s), number of audio tokens (field: num_audio_tokens), automatic speech recognition (ASR) transcription (field: asr_transcription), together with its corresponding word error rate (asr_wer) and character error rate (asr_cer). The dataset only includes a training split named train, with a total of 4 samples and an overall size of approximately 2.21 MB. It is suitable for research tasks such as speech synthesis and speech quality assessment.




