thinkKenya/kenyan_audio_datasets
收藏资源简介:
--- dataset_info: - config_name: Kalenjin features: - name: audio dtype: audio - name: text dtype: string - name: speaker_id dtype: int64 - name: original_language dtype: string - name: language dtype: string - name: gender dtype: string - name: dialect dtype: string - name: county dtype: string - name: constituency dtype: string - name: education_level dtype: string - name: employment_state dtype: string - name: sample_rate dtype: int64 - name: duration dtype: float64 - name: rms_level_db dtype: float64 - name: peak_level_db dtype: float64 - name: dc_offset dtype: float64 - name: rms_amplitude dtype: float64 - name: peak_amplitude dtype: float64 - name: num_samples dtype: int64 splits: - name: train num_bytes: 28481083567.42 num_examples: 54645 - name: test num_bytes: 9600807760.69 num_examples: 18215 download_size: 35171021568 dataset_size: 38081891328.11 - config_name: Kikuyu features: - name: audio dtype: audio - name: text dtype: string - name: speaker_id dtype: int64 - name: original_language dtype: string - name: language dtype: string - name: gender dtype: string - name: dialect dtype: string - name: county dtype: string - name: constituency dtype: string - name: education_level dtype: string - name: employment_state dtype: string - name: sample_rate dtype: int64 - name: duration dtype: float64 - name: rms_level_db dtype: float64 - name: peak_level_db dtype: float64 - name: dc_offset dtype: float64 - name: rms_amplitude dtype: float64 - name: peak_amplitude dtype: float64 - name: num_samples dtype: int64 splits: - name: train num_bytes: 44190236815.28 num_examples: 98206 - name: test num_bytes: 14282277094.848 num_examples: 32736 download_size: 54199752816 dataset_size: 58472513910.128 - config_name: MAXA_TIRI features: - name: audio dtype: audio - name: text dtype: string - name: speaker_id dtype: int64 - name: original_language dtype: string - name: language dtype: string - name: gender dtype: string - name: dialect dtype: string - name: county dtype: string - name: constituency dtype: string - name: education_level dtype: string - name: employment_state dtype: string - name: sample_rate dtype: int64 - name: duration dtype: float64 - name: rms_level_db dtype: float64 - name: peak_level_db dtype: float64 - name: dc_offset dtype: float64 - name: rms_amplitude dtype: float64 - name: peak_amplitude dtype: float64 - name: num_samples dtype: int64 splits: - name: train num_bytes: 4565884.0 num_examples: 6 - name: test num_bytes: 903383.0 num_examples: 1 download_size: 5321983 dataset_size: 5469267.0 - config_name: Nandi features: - name: audio dtype: audio - name: text dtype: string - name: speaker_id dtype: int64 - name: original_language dtype: string - name: language dtype: string - name: gender dtype: string - name: dialect dtype: string - name: county dtype: string - name: constituency dtype: string - name: education_level dtype: string - name: employment_state dtype: string - name: sample_rate dtype: int64 - name: duration dtype: float64 - name: rms_level_db dtype: float64 - name: peak_level_db dtype: float64 - name: dc_offset dtype: float64 - name: rms_amplitude dtype: float64 - name: peak_amplitude dtype: float64 - name: num_samples dtype: int64 splits: - name: train num_bytes: 353075.0 num_examples: 1 - name: test num_bytes: 353023.0 num_examples: 1 download_size: 652152 dataset_size: 706098.0 configs: - config_name: Kalenjin data_files: - split: train path: Kalenjin/train-* - split: test path: Kalenjin/test-* - config_name: Kikuyu data_files: - split: train path: Kikuyu/train-* - split: test path: Kikuyu/test-* - config_name: MAXA_TIRI data_files: - split: train path: MAXA_TIRI/train-* - split: test path: MAXA_TIRI/test-* - config_name: Nandi data_files: - split: train path: Nandi/train-* - split: test path: Nandi/test-* ---
数据集信息: - 配置名称:卡伦金语(Kalenjin) 特征: - 名称:音频(audio),数据类型:音频 - 名称:文本(text),数据类型:字符串(string) - 名称:说话人ID(speaker_id),数据类型:64位整数(int64) - 名称:原始语言(original_language),数据类型:字符串(string) - 名称:语言(language),数据类型:字符串(string) - 名称:性别(gender),数据类型:字符串(string) - 名称:方言(dialect),数据类型:字符串(string) - 名称:郡(county),数据类型:字符串(string) - 名称:选区(constituency),数据类型:字符串(string) - 名称:受教育水平(education_level),数据类型:字符串(string) - 名称:就业状态(employment_state),数据类型:字符串(string) - 名称:采样率(sample_rate),数据类型:64位整数(int64) - 名称:时长(duration),数据类型:64位浮点数(float64) - 名称:均方根电平分贝(rms_level_db),数据类型:64位浮点数(float64) - 名称:峰值电平分贝(peak_level_db),数据类型:64位浮点数(float64) - 名称:直流偏移(dc_offset),数据类型:64位浮点数(float64) - 名称:均方根振幅(rms_amplitude),数据类型:64位浮点数(float64) - 名称:峰值振幅(peak_amplitude),数据类型:64位浮点数(float64) - 名称:采样点数(num_samples),数据类型:64位整数(int64) 数据集划分: - 名称:训练集(train),字节数:28481083567.42,样本数量:54645 - 名称:测试集(test),字节数:9600807760.69,样本数量:18215 下载大小:35171021568 数据集总大小:38081891328.11 - 配置名称:基库尤语(Kikuyu) 特征: - 名称:音频(audio),数据类型:音频 - 名称:文本(text),数据类型:字符串(string) - 名称:说话人ID(speaker_id),数据类型:64位整数(int64) - 名称:原始语言(original_language),数据类型:字符串(string) - 名称:语言(language),数据类型:字符串(string) - 名称:性别(gender),数据类型:字符串(string) - 名称:方言(dialect),数据类型:字符串(string) - 名称:郡(county),数据类型:字符串(string) - 名称:选区(constituency),数据类型:字符串(string) - 名称:受教育水平(education_level),数据类型:字符串(string) - 名称:就业状态(employment_state),数据类型:字符串(string) - 名称:采样率(sample_rate),数据类型:64位整数(int64) - 名称:时长(duration),数据类型:64位浮点数(float64) - 名称:均方根电平分贝(rms_level_db),数据类型:64位浮点数(float64) - 名称:峰值电平分贝(peak_level_db),数据类型:64位浮点数(float64) - 名称:直流偏移(dc_offset),数据类型:64位浮点数(float64) - 名称:均方根振幅(rms_amplitude),数据类型:64位浮点数(float64) - 名称:峰值振幅(peak_amplitude),数据类型:64位浮点数(float64) - 名称:采样点数(num_samples),数据类型:64位整数(int64) 数据集划分: - 名称:训练集(train),字节数:44190236815.28,样本数量:98206 - 名称:测试集(test),字节数:14282277094.848,样本数量:32736 下载大小:54199752816 数据集总大小:58472513910.128 - 配置名称:MAXA_TIRI 特征: - 名称:音频(audio),数据类型:音频 - 名称:文本(text),数据类型:字符串(string) - 名称:说话人ID(speaker_id),数据类型:64位整数(int64) - 名称:原始语言(original_language),数据类型:字符串(string) - 名称:语言(language),数据类型:字符串(string) - 名称:性别(gender),数据类型:字符串(string) - 名称:方言(dialect),数据类型:字符串(string) - 名称:郡(county),数据类型:字符串(string) - 名称:选区(constituency),数据类型:字符串(string) - 名称:受教育水平(education_level),数据类型:字符串(string) - 名称:就业状态(employment_state),数据类型:字符串(string) - 名称:采样率(sample_rate),数据类型:64位整数(int64) - 名称:时长(duration),数据类型:64位浮点数(float64) - 名称:均方根电平分贝(rms_level_db),数据类型:64位浮点数(float64) - 名称:峰值电平分贝(peak_level_db),数据类型:64位浮点数(float64) - 名称:直流偏移(dc_offset),数据类型:64位浮点数(float64) - 名称:均方根振幅(rms_amplitude),数据类型:64位浮点数(float64) - 名称:峰值振幅(peak_amplitude),数据类型:64位浮点数(float64) - 名称:采样点数(num_samples),数据类型:64位整数(int64) 数据集划分: - 名称:训练集(train),字节数:4565884.0,样本数量:6 - 名称:测试集(test),字节数:903383.0,样本数量:1 下载大小:5321983 数据集总大小:5469267.0 - 配置名称:南迪语(Nandi) 特征: - 名称:音频(audio),数据类型:音频 - 名称:文本(text),数据类型:字符串(string) - 名称:说话人ID(speaker_id),数据类型:64位整数(int64) - 名称:原始语言(original_language),数据类型:字符串(string) - 名称:语言(language),数据类型:字符串(string) - 名称:性别(gender),数据类型:字符串(string) - 名称:方言(dialect),数据类型:字符串(string) - 名称:郡(county),数据类型:字符串(string) - 名称:选区(constituency),数据类型:字符串(string) - 名称:受教育水平(education_level),数据类型:字符串(string) - 名称:就业状态(employment_state),数据类型:字符串(string) - 名称:采样率(sample_rate),数据类型:64位整数(int64) - 名称:时长(duration),数据类型:64位浮点数(float64) - 名称:均方根电平分贝(rms_level_db),数据类型:64位浮点数(float64) - 名称:峰值电平分贝(peak_level_db),数据类型:64位浮点数(float64) - 名称:直流偏移(dc_offset),数据类型:64位浮点数(float64) - 名称:均方根振幅(rms_amplitude),数据类型:64位浮点数(float64) - 名称:峰值振幅(peak_amplitude),数据类型:64位浮点数(float64) - 名称:采样点数(num_samples),数据类型:64位整数(int64) 数据集划分: - 名称:训练集(train),字节数:353075.0,样本数量:1 - 名称:测试集(test),字节数:353023.0,样本数量:1 下载大小:652152 数据集总大小:706098.0 配置项: - 配置名称:卡伦金语(Kalenjin),数据文件: - 划分:训练集(train),路径:Kalenjin/train-* - 划分:测试集(test),路径:Kalenjin/test-* - 配置名称:基库尤语(Kikuyu),数据文件: - 划分:训练集(train),路径:Kikuyu/train-* - 划分:测试集(test),路径:Kikuyu/test-* - 配置名称:MAXA_TIRI,数据文件: - 划分:训练集(train),路径:MAXA_TIRI/train-* - 划分:测试集(test),路径:MAXA_TIRI/test-* - 配置名称:南迪语(Nandi),数据文件: - 划分:训练集(train),路径:Nandi/train-* - 划分:测试集(test),路径:Nandi/test-*



