2XIth/ViMD_Dataset_Merged2026
收藏官方服务:
资源简介:
该数据集包含中文方言语音录音,每个样本包括音频文件、对应的文本转录、说话人ID、性别、所属省份等信息。数据集分为训练集(15023个样本)、测试集(2026个样本)和验证集(1900个样本),可用于语音识别、说话人识别或方言分类等任务。
This dataset contains Chinese dialect speech recordings, each sample includes an audio file, corresponding text transcription, speaker ID, gender, province information, etc. The dataset is split into training (15023 samples), test (2026 samples), and validation (1900 samples) sets, suitable for tasks such as speech recognition, speaker identification, or dialect classification.
提供机构:
2XIth


