charris/raw_train_dev_test_spotify
收藏资源简介:
--- dataset_info: features: - name: audio dtype: audio - name: 'Unnamed: 0' dtype: int64 - name: transcription dtype: string - name: annotator_id dtype: float64 - name: filename dtype: string - name: num_speakers dtype: float64 - name: aave dtype: float64 - name: aave_speaker_count dtype: float64 - name: chicano_english dtype: float64 - name: ce_speaker_count dtype: float64 - name: spanglish dtype: float64 - name: spanglish_speaker_count dtype: float64 - name: sae dtype: float64 - name: sae_speaker_count dtype: float64 - name: codeswitching dtype: float64 - name: other_dialect_accent dtype: float64 - name: women dtype: float64 - name: women_speaker_count dtype: float64 - name: men dtype: float64 - name: men_speaker_count dtype: float64 - name: demographic_info_correct dtype: float64 - name: demographic_group dtype: class_label: names: '0': Black Men '1': Black Women '2': Black Womnen '3': Latinx Men '4': Latinx Men and Women '5': Latinx Women '6': Men '7': White Men '8': White Men and Women '9': White Women '10': white Women splits: - name: train num_bytes: 339599275.463 num_examples: 1183 - name: test num_bytes: 75753666.09704141 num_examples: 253 - name: dev num_bytes: 72862156.30295858 num_examples: 254 download_size: 489552236 dataset_size: 488215097.86300004 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* - split: dev path: data/dev-* ---
数据集信息: 特征列表: - 特征名:音频(audio),数据类型:音频 - 特征名:无标题列_0,数据类型:64位整数型(int64) - 特征名:转录文本(transcription),数据类型:字符串型 - 特征名:标注者ID(annotator_id),数据类型:64位浮点型(float64) - 特征名:文件名(filename),数据类型:字符串型 - 特征名:说话者数量(num_speakers),数据类型:浮点型 - 特征名:非洲裔美国英语(AAVE),数据类型:浮点型 - 特征名:AAVE说话者数量(aave_speaker_count),数据类型:浮点型 - 特征名:奇卡诺英语(Chicano English),数据类型:浮点型 - 特征名:奇卡诺英语说话者数量(ce_speaker_count),数据类型:浮点型 - 特征名:西英混合语(Spanglish),数据类型:浮点型 - 特征名:西英混合语说话者数量(spanglish_speaker_count),数据类型:浮点型 - 特征名:标准美国英语(SAE),数据类型:浮点型 - 特征名:标准美国英语说话者数量(sae_speaker_count),数据类型:浮点型 - 特征名:语码转换(codeswitching),数据类型:浮点型 - 特征名:其他方言口音(other_dialect_accent),数据类型:浮点型 - 特征名:女性占比(women),数据类型:浮点型 - 特征名:女性说话者数量(women_speaker_count),数据类型:浮点型 - 特征名:男性占比(men),数据类型:浮点型 - 特征名:男性说话者数量(men_speaker_count),数据类型:浮点型 - 特征名:人口统计信息正确性(demographic_info_correct),数据类型:浮点型 - 特征名:人口统计分组(demographic_group),其数据类型为类别标签,类别映射如下: '0': 黑人男性 '1': 黑人女性 '2': 黑人女性(原标识存在拼写笔误,原文为Black Womnen) '3': 拉丁裔男性 '4': 拉丁裔男女 '5': 拉丁裔女性 '6': 男性 '7': 白人男性 '8': 白人男女 '9': 白人女性 '10': 白人女性(原标识存在拼写笔误,原文为white Women) 数据集划分: - 训练集(train):字节数为339599275.463,样本数为1183 - 测试集(test):字节数为75753666.09704141,样本数为253 - 验证集(dev,开发集):字节数为72862156.30295858,样本数为254 下载总大小:489552236字节 数据集总大小:488215097.86300004字节 配置项: - 默认配置(default):数据文件路径对应如下: 训练集:data/train-* 测试集:data/test-* 验证集:data/dev-*
数据集概述
数据集特征
- audio: 音频数据
- Unnamed: 0: 整数类型
- transcription: 文本类型
- annotator_id: 浮点数类型
- filename: 文本类型
- num_speakers: 浮点数类型
- aave: 浮点数类型
- aave_speaker_count: 浮点数类型
- chicano_english: 浮点数类型
- ce_speaker_count: 浮点数类型
- spanglish: 浮点数类型
- spanglish_speaker_count: 浮点数类型
- sae: 浮点数类型
- sae_speaker_count: 浮点数类型
- codeswitching: 浮点数类型
- other_dialect_accent: 浮点数类型
- women: 浮点数类型
- women_speaker_count: 浮点数类型
- men: 浮点数类型
- men_speaker_count: 浮点数类型
- demographic_info_correct: 浮点数类型
- demographic_group: 分类标签,包括以下类别:
- 0: Black Men
- 1: Black Women
- 2: Black Womnen
- 3: Latinx Men
- 4: Latinx Men and Women
- 5: Latinx Women
- 6: Men
- 7: White Men
- 8: White Men and Women
- 9: White Women
- 10: white Women
数据集分割
- train: 1183个样本,占用339599275.463字节
- test: 253个样本,占用75753666.09704141字节
- dev: 254个样本,占用72862156.30295858字节
数据集大小
- 下载大小: 489552236字节
- 数据集大小: 488215097.86300004字节
配置文件
- config_name: default
- data_files:
- train: data/train-*
- test: data/test-*
- dev: data/dev-*




