Porameht/processed-voice-th-169k
收藏资源简介:
--- dataset_info: features: - name: sentence dtype: string - name: audio dtype: audio splits: - name: train num_bytes: 3978867550.27 num_examples: 149953 - name: dev num_bytes: 205068304.552 num_examples: 7614 - name: test num_bytes: 327345090.887 num_examples: 11983 download_size: 11966433213 dataset_size: 4511280945.709 configs: - config_name: default data_files: - split: train path: data/train-* - split: dev path: data/dev-* - split: test path: data/test-* task_categories: - automatic-speech-recognition language: - th size_categories: - 100K<n<1M tags: - croissant ---
数据集信息: 数据特征: - 字段名:sentence,数据类型:字符串 - 字段名:audio,数据类型:音频 数据集拆分: - 拆分名称:训练集(train),字节数:3978867550.27,样本数:149953 - 拆分名称:验证集(dev),字节数:205068304.552,样本数:7614 - 拆分名称:测试集(test),字节数:327345090.887,样本数:11983 下载总大小:11966433213 数据集总大小:4511280945.709 配置项: - 配置名称:默认配置(default),数据文件: - 训练集:路径为data/train-* - 验证集:路径为data/dev-* - 测试集:路径为data/test-* 任务分类:自动语音识别(automatic-speech-recognition) 语言:泰语(th) 样本规模区间:10万 < 样本数 < 100万 标签:croissant
数据集概述
数据集特征
- sentence:字符串类型
- audio:音频类型
数据集分割
- train:
- 示例数量:149953
- 数据大小:3978867550.27字节
- dev:
- 示例数量:7614
- 数据大小:205068304.552字节
- test:
- 示例数量:11983
- 数据大小:327345090.887字节
数据集大小
- 下载大小:11966433213字节
- 数据集大小:4511280945.709字节
配置信息
- config_name:default
- data_files:
- train:路径为
data/train-* - dev:路径为
data/dev-* - test:路径为
data/test-*
- train:路径为
任务类别
- automatic-speech-recognition
语言
- th
大小类别
- 100K<n<1M




