DewiBrynJones/evals-speech-recognition-cy-en-2605
收藏资源简介:
该数据集是一个多配置数据集,专注于威尔士语和英语的语音或文本处理任务,可能用于语音识别、语言建模或风格预测。它包括五个主要配置:1) cymen_arfor__lleisiau_arfor:包含句子、口音、语言等特征,涉及3735个示例;2) techiaith__banc_trawsgrifiadau_bangor:类似特征,3899个示例;3) techiaith__commonvoice_23_0_cy:基于CommonVoice 23.0的威尔士语数据,包含年龄、性别、口音等元数据,5408个示例;4) techiaith__commonvoice_23_0_cy_en:威尔士语-英语双语数据,增加英语句子特征,5408个示例;5) techiaith__commonvoice_23_0_en__GB_IE:英语数据(英国和爱尔兰口音),包含丰富元数据,9732个示例。每个配置分为两个分割,分别对应techiaith__kaldi_cy__main和techiaith__whisper_large_ft_cy_en__main处理模型,总数据大小约数MB到数MB不等。数据集可能用于评估或训练语音识别系统,如Kaldi和Whisper模型。
This dataset is a multi-configuration dataset focused on Welsh and English speech or text processing tasks, likely for speech recognition, language modeling, or style prediction. It includes five main configurations: 1) cymen_arfor__lleisiau_arfor: contains features such as sentence, accent, language, etc., with 3735 examples; 2) techiaith__banc_trawsgrifiadau_bangor: similar features, 3899 examples; 3) techiaith__commonvoice_23_0_cy: Welsh-language data based on CommonVoice 23.0, including metadata like age, gender, accents, etc., 5408 examples; 4) techiaith__commonvoice_23_0_cy_en: bilingual Welsh-English data, with added English sentence features, 5408 examples; 5) techiaith__commonvoice_23_0_en__GB_IE: English data (with British and Irish accents), containing rich metadata, 9732 examples. Each configuration is split into two partitions, corresponding to the techiaith__kaldi_cy__main and techiaith__whisper_large_ft_cy_en__main processing models, with total dataset sizes ranging from approximately 1 MB to 9 MB. The dataset may be used for evaluating or training speech recognition systems, such as Kaldi and Whisper models.




