rashmi035/dataset_whisper
收藏资源简介:
--- dataset_info: features: - name: audio dtype: audio - name: transcription dtype: string - name: set dtype: string splits: - name: train num_bytes: 35817014.0 num_examples: 100 - name: validation num_bytes: 15314681.0 num_examples: 50 - name: test num_bytes: 7381857.0 num_examples: 29 download_size: 55480724 dataset_size: 58513552.0 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* --- # Dataset Card for "dataset_whisper" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
--- 数据集信息: 特征字段: - 名称:音频(audio),数据类型:音频(audio) - 名称:转录文本(transcription),数据类型:字符串(string) - 名称:拆分标识(set),数据类型:字符串(string) 数据拆分: - 名称:训练集(train),字节占用量:35817014.0,样本数量:100 - 名称:验证集(validation),字节占用量:15314681.0,样本数量:50 - 名称:测试集(test),字节占用量:7381857.0,样本数量:29 下载总大小:55480724,数据集总占用大小:58513552.0 配置项: - 配置名称:默认(default),数据文件配置: - 训练集(train)拆分:对应路径为 data/train-* - 验证集(validation)拆分:对应路径为 data/validation-* - 测试集(test)拆分:对应路径为 data/test-* --- # 「dataset_whisper」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集概述
数据集信息
特征
- audio: 音频数据
- transcription: 文字转录
- set: 数据集分类
数据分割
- train: 训练集,包含35817014字节,100个样本
- validation: 验证集,包含15314681字节,50个样本
- test: 测试集,包含7381857字节,29个样本
数据大小
- 下载大小: 55480724字节
- 数据集大小: 58513552字节
配置
- default: 默认配置
- train: 数据路径为
data/train-* - validation: 数据路径为
data/validation-* - test: 数据路径为
data/test-*
- train: 数据路径为



