bob80333/doreco_southengland
收藏资源简介:
该数据集是DoReCo South England数据集的对齐音素子集,用于语音识别模型的微调,特别是针对音素识别。数据集根据停顿长度/总长度分割为话语和音素转录,目标是创建小于30秒的话语。数据集已随机预分为训练集、开发集和测试集,分别占80%、10%和10%。
该数据集是DoReCo South England数据集的对齐音素子集,用于语音识别模型的微调,特别是针对音素识别。数据集根据停顿长度/总长度分割为话语和音素转录,目标是创建小于30秒的话语。数据集已随机预分为训练集、开发集和测试集,分别占80%、10%和10%。
数据集概述
数据集描述
该数据集是DoReCo South England数据集的对齐音素子集,根据停顿长度/总长度分割成话语和音素转录,旨在创建时长小于30秒的话语,用于在音素识别上微调语音识别模型,不是逐个音素识别,而是针对整个话语进行识别。
数据集划分
数据集已经随机预先划分为训练集、开发集和测试集,其中80%在训练集,10%在开发集,最后的10%在测试集。
原始数据集引用
@incollection{doreco-sout3282, address = {Berlin & Lyon}, author = {Schiborr, Nils Norman}, booktitle = {Language Documentation Reference Corpus (DoReCo) 1.2}, editor = {Seifart, Frank and Paschen, Ludger and Stave, Matthew}, publisher = {Leibniz-Zentrum Allgemeine Sprachwissenschaft & laboratoire Dynamique Du Langage (UMR5596, CNRS & Université Lyon 2)}, title = {English (Southern England) DoReCo dataset}, url = {https://doreco.huma-num.fr/languages/sout3282}, doi = {10.34847/nkl.9c271u5g}, urldate = {16/01/2024}, year = {2022} }



