DTU54DL/librispeech-augmentated-validation-prepared
收藏资源简介:
--- dataset_info: features: - name: file dtype: string - name: audio dtype: audio: sampling_rate: 16000 - name: text dtype: string - name: speaker_id dtype: int64 - name: chapter_id dtype: int64 - name: id dtype: string - name: input_features sequence: sequence: float32 - name: labels sequence: int64 splits: - name: validation num_bytes: 3218361347.125 num_examples: 2703 download_size: 1286686337 dataset_size: 3218361347.125 --- # Dataset Card for "librispeech-augmentated-validation-prepared" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
--- 数据集信息: 特征字段: - 文件名(file):数据类型为字符串 - 音频(audio):数据类型为音频格式,采样率为16000Hz - 文本(text):数据类型为字符串 - 说话人ID(speaker_id):数据类型为int64 - 章节ID(chapter_id):数据类型为int64 - 样本ID(id):数据类型为字符串 - 输入特征(input_features):由float32类型构成的二维序列 - 标签(labels):由int64类型构成的序列 数据集拆分: - 验证集(validation):占用字节数为3218361347.125,样本总量为2703 下载大小:1286686337字节 数据集总大小:3218361347.125字节 --- # "librispeech-augmentated-validation-prepared"数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集概述
数据集信息
- 特征列表:
- file: 文件名,数据类型为字符串。
- audio: 音频数据,采样率为16000。
- text: 文本数据,数据类型为字符串。
- speaker_id: 说话者ID,数据类型为整数64位。
- chapter_id: 章节ID,数据类型为整数64位。
- id: 标识符,数据类型为字符串。
- input_features: 输入特征,序列类型,数据类型为浮点32位。
- labels: 标签,序列类型,数据类型为整数64位。
数据分割
- validation: 验证集,包含3218361347.125字节的数据和2703个样本。
数据集大小
- 下载大小: 1286686337字节
- 数据集大小: 3218361347.125字节



