PranavJosh/500_improvement_data
收藏资源简介:
--- dataset_info: features: - name: audio dtype: audio - name: transcript dtype: string - name: recording_id dtype: string - name: call_id dtype: string - name: start dtype: float64 - name: end dtype: float64 - name: duration_sec dtype: float64 - name: target_words dtype: string - name: num_target_words dtype: int32 - name: corpus_index dtype: int32 splits: - name: train num_examples: 21612 --- # 500_improvement_data Hindi ASR targeted retraining dataset. - **Clips**: 21612 - **Hours**: 51.80 - **Unique recordings**: 6880
数据集信息: 特征: - 名称:音频(audio),数据类型:音频 - 名称:转录文本(transcript),数据类型:字符串 - 名称:录音编号(recording_id),数据类型:字符串 - 名称:通话编号(call_id),数据类型:字符串 - 名称:起始时间(start),数据类型:64位浮点型(float64) - 名称:结束时间(end),数据类型:64位浮点型(float64) - 名称:秒级时长(duration_sec),数据类型:64位浮点型(float64) - 名称:目标词(target_words),数据类型:字符串 - 名称:目标词数量(num_target_words),数据类型:32位整型(int32) - 名称:语料库索引(corpus_index),数据类型:32位整型(int32) 数据集划分: - 名称:训练集(train),样本数量:21612 # 500_改进数据集(500_improvement_data) 印地语自动语音识别(Automatic Speech Recognition,ASR)定向再训练数据集。 - **语音片段(Clips)**:21612条 - **总时长**:51.80小时 - **唯一录音数**:6880条



