ilsp/cretan-extended-speech-corpus
收藏资源简介:
--- dataset_info: features: - name: audio dtype: audio: sampling_rate: 16000 - name: raw_text dtype: string - name: normalized_text dtype: string - name: speaker_id dtype: string splits: - name: train num_bytes: 358616284.5015568 num_examples: 5517 - name: validation num_bytes: 46396160.359721616 num_examples: 690 - name: test num_bytes: 47617549.359721616 num_examples: 690 download_size: 450537681 dataset_size: 452629994.221 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* ---
数据集信息: 1. 特征字段: - 音频(Audio):数据类型为音频,采样率为16000Hz - 原始文本(raw_text):数据类型为字符串 - 归一化文本(normalized_text):数据类型为字符串 - 说话人ID(speaker_id):数据类型为字符串 2. 数据划分: - 训练集(train):占用字节数为358616284.5015568,样本总数为5517 - 验证集(validation):占用字节数为46396160.359721616,样本总数为690 - 测试集(test):占用字节数为47617549.359721616,样本总数为690 3. 整体参数: - 下载大小:450537681 - 数据集总大小:452629994.221 4. 配置信息: - 默认配置(default):数据文件路径对应如下 - 训练集:data/train-* - 验证集:data/validation-* - 测试集:data/test-*



