遇见数据集

2XIth/ViMD_Dataset_Merged2026

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含中文方言语音录音,每个样本包括音频文件、对应的文本转录、说话人ID、性别、所属省份等信息。数据集分为训练集(15023个样本)、测试集(2026个样本)和验证集(1900个样本),可用于语音识别、说话人识别或方言分类等任务。

This dataset contains Chinese dialect speech recordings, each sample includes an audio file, corresponding text transcription, speaker ID, gender, province information, etc. The dataset is split into training (15023 samples), test (2026 samples), and validation (1900 samples) sets, suitable for tasks such as speech recognition, speaker identification, or dialect classification.

提供机构:
2XIth
二维码
社区交流群
二维码
科研交流群
商业服务