遇见数据集

ilprl-docse/Nwacha_Muna_A_Newari_ASR_Dataset

收藏
Hugging Face2026-03-28 更新2026-03-29 收录
官方服务:

资源简介:

--- dataset_info: features: - name: utterance_id dtype: string - name: audio dtype: audio: sampling_rate: 16000 - name: sentence dtype: string splits: - name: train num_bytes: 1751559504 num_examples: 4575 - name: validation num_bytes: 261615407 num_examples: 576 - name: test num_bytes: 250945060 num_examples: 576 download_size: 2680379252 dataset_size: 2264119971 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* ---

### 数据集信息 #### 数据特征 - 话语标识符(utterance_id):数据类型为字符串 - 音频(Audio):对应字段的数据格式为采样率(sampling_rate)16000Hz的音频数据 - 语句(sentence):数据类型为字符串 #### 数据集划分 - 训练集(train):占用字节数1751559504,包含4575个样本 - 验证集(validation):占用字节数261615407,包含576个样本 - 测试集(test):占用字节数250945060,包含576个样本 该数据集的整体下载大小为2680379252字节,总占用大小为2264119971字节。 #### 配置信息 默认配置(default)下的数据文件路径如下: - 训练集对应路径:`data/train-*` - 验证集对应路径:`data/validation-*` - 测试集对应路径:`data/test-*`

提供机构:
ilprl-docse
二维码
社区交流群
二维码
科研交流群
商业服务