遇见数据集

charris/raw_train_dev_test_spotify

收藏
Hugging Face2024-04-10 更新2024-06-11 收录
官方服务:

资源简介:

--- dataset_info: features: - name: audio dtype: audio - name: 'Unnamed: 0' dtype: int64 - name: transcription dtype: string - name: annotator_id dtype: float64 - name: filename dtype: string - name: num_speakers dtype: float64 - name: aave dtype: float64 - name: aave_speaker_count dtype: float64 - name: chicano_english dtype: float64 - name: ce_speaker_count dtype: float64 - name: spanglish dtype: float64 - name: spanglish_speaker_count dtype: float64 - name: sae dtype: float64 - name: sae_speaker_count dtype: float64 - name: codeswitching dtype: float64 - name: other_dialect_accent dtype: float64 - name: women dtype: float64 - name: women_speaker_count dtype: float64 - name: men dtype: float64 - name: men_speaker_count dtype: float64 - name: demographic_info_correct dtype: float64 - name: demographic_group dtype: class_label: names: '0': Black Men '1': Black Women '2': Black Womnen '3': Latinx Men '4': Latinx Men and Women '5': Latinx Women '6': Men '7': White Men '8': White Men and Women '9': White Women '10': white Women splits: - name: train num_bytes: 339599275.463 num_examples: 1183 - name: test num_bytes: 75753666.09704141 num_examples: 253 - name: dev num_bytes: 72862156.30295858 num_examples: 254 download_size: 489552236 dataset_size: 488215097.86300004 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* - split: dev path: data/dev-* ---

数据集信息: 特征列表: - 特征名:音频(audio),数据类型:音频 - 特征名:无标题列_0,数据类型:64位整数型(int64) - 特征名:转录文本(transcription),数据类型:字符串型 - 特征名:标注者ID(annotator_id),数据类型:64位浮点型(float64) - 特征名:文件名(filename),数据类型:字符串型 - 特征名:说话者数量(num_speakers),数据类型:浮点型 - 特征名:非洲裔美国英语(AAVE),数据类型:浮点型 - 特征名:AAVE说话者数量(aave_speaker_count),数据类型:浮点型 - 特征名:奇卡诺英语(Chicano English),数据类型:浮点型 - 特征名:奇卡诺英语说话者数量(ce_speaker_count),数据类型:浮点型 - 特征名:西英混合语(Spanglish),数据类型:浮点型 - 特征名:西英混合语说话者数量(spanglish_speaker_count),数据类型:浮点型 - 特征名:标准美国英语(SAE),数据类型:浮点型 - 特征名:标准美国英语说话者数量(sae_speaker_count),数据类型:浮点型 - 特征名:语码转换(codeswitching),数据类型:浮点型 - 特征名:其他方言口音(other_dialect_accent),数据类型:浮点型 - 特征名:女性占比(women),数据类型:浮点型 - 特征名:女性说话者数量(women_speaker_count),数据类型:浮点型 - 特征名:男性占比(men),数据类型:浮点型 - 特征名:男性说话者数量(men_speaker_count),数据类型:浮点型 - 特征名:人口统计信息正确性(demographic_info_correct),数据类型:浮点型 - 特征名:人口统计分组(demographic_group),其数据类型为类别标签,类别映射如下: '0': 黑人男性 '1': 黑人女性 '2': 黑人女性(原标识存在拼写笔误,原文为Black Womnen) '3': 拉丁裔男性 '4': 拉丁裔男女 '5': 拉丁裔女性 '6': 男性 '7': 白人男性 '8': 白人男女 '9': 白人女性 '10': 白人女性(原标识存在拼写笔误,原文为white Women) 数据集划分: - 训练集(train):字节数为339599275.463,样本数为1183 - 测试集(test):字节数为75753666.09704141,样本数为253 - 验证集(dev,开发集):字节数为72862156.30295858,样本数为254 下载总大小:489552236字节 数据集总大小:488215097.86300004字节 配置项: - 默认配置(default):数据文件路径对应如下: 训练集:data/train-* 测试集:data/test-* 验证集:data/dev-*

提供机构:
charris
原始信息汇总

数据集概述

数据集特征

  • audio: 音频数据
  • Unnamed: 0: 整数类型
  • transcription: 文本类型
  • annotator_id: 浮点数类型
  • filename: 文本类型
  • num_speakers: 浮点数类型
  • aave: 浮点数类型
  • aave_speaker_count: 浮点数类型
  • chicano_english: 浮点数类型
  • ce_speaker_count: 浮点数类型
  • spanglish: 浮点数类型
  • spanglish_speaker_count: 浮点数类型
  • sae: 浮点数类型
  • sae_speaker_count: 浮点数类型
  • codeswitching: 浮点数类型
  • other_dialect_accent: 浮点数类型
  • women: 浮点数类型
  • women_speaker_count: 浮点数类型
  • men: 浮点数类型
  • men_speaker_count: 浮点数类型
  • demographic_info_correct: 浮点数类型
  • demographic_group: 分类标签,包括以下类别:
    • 0: Black Men
    • 1: Black Women
    • 2: Black Womnen
    • 3: Latinx Men
    • 4: Latinx Men and Women
    • 5: Latinx Women
    • 6: Men
    • 7: White Men
    • 8: White Men and Women
    • 9: White Women
    • 10: white Women

数据集分割

  • train: 1183个样本,占用339599275.463字节
  • test: 253个样本,占用75753666.09704141字节
  • dev: 254个样本,占用72862156.30295858字节

数据集大小

  • 下载大小: 489552236字节
  • 数据集大小: 488215097.86300004字节

配置文件

  • config_name: default
  • data_files:
    • train: data/train-*
    • test: data/test-*
    • dev: data/dev-*
搜集汇总
数据集介绍
charris/raw_train_dev_test_spotify 数据集图片
构建方式
在语音与方言研究的交叉领域中,数据集的构建需兼顾声学特征与人口统计学信息的精确标注。charris/raw_train_dev_test_spotify数据集源自Spotify平台的音频资源,通过系统化的采集与标注流程形成。其构建过程首先对原始音频文件进行分割与整理,确保每个样本包含清晰的语音片段。随后,由多位标注员对每个样本进行多维度标注,涵盖方言类型(如非裔美国人英语、奇卡诺英语、西班牙语混合语等)、说话者性别、说话者数量,以及人口统计学信息的正确性。最终,数据集被划分为训练集(1183例)、测试集(253例)和开发集(254例),以支持模型的训练与评估。
特点
该数据集的核心特色在于其精细的方言与人口统计学标注体系,为多语言变体研究提供了宝贵资源。每个样本均附带音频文件、转录文本及一系列数值型标签,包括六种方言类别的存在概率及其对应的说话者计数,同时记录了男女说话者的分布比例。尤其值得注意的是,数据集包含一个多类别的人口统计学分组标签,涵盖“黑人男性”、“拉丁裔女性”等11个细分类别,这为探究语言变体与社会身份之间的关联提供了独特视角。此外,数据集中还设有质量控制字段(demographic_info_correct),用于标识标注信息的可靠性,从而提升数据集的整体可信度。
使用方法
该数据集可通过HuggingFace Datasets库便捷加载,用户只需指定数据集名称charris/raw_train_dev_test_spotify即可获取默认配置下的数据。加载后,数据集包含三个标准分割(train、test、dev),每个样本以字典形式呈现,包含音频张量、采样率、转录文本以及所有标注字段。研究人员可直接利用音频字段进行声学特征提取,或结合转录文本与方言标签进行语音识别与方言分类任务。人口统计学标签则支持交叉分析,例如探究不同性别或种族群体在方言使用上的差异。对于需要自定义分割或数据过滤的场景,用户可依据数值型标签设置阈值,筛选出符合特定方言或人口统计学条件的子集进行实验。
背景与挑战
背景概述
在语音识别与方言多样性研究的交汇处,数据集的构建往往承载着对语言平等与包容性的深刻追求。由研究者charris主导的raw_train_dev_test_spotify数据集,诞生于对非标准英语变体(如非裔美国人白话英语、奇卡诺英语、西班牙英语及语码转换现象)的细致关注之中。该数据集以Spotify音频为原始素材,通过精细的标注体系,不仅记录了语音转录文本,还量化了说话者的方言属性、性别分布及人口统计信息的正确性,从而为探究社会语言学特征与语音识别系统性能之间的复杂关联提供了宝贵资源。其核心研究问题聚焦于如何在高保真音频数据中系统性捕捉并分析多元语言变体,进而推动语音技术向着更加公平、无偏见的方向演进,对计算社会语言学和包容性人工智能领域产生了深远影响。
当前挑战
该数据集面临的挑战首先体现在所解决的领域问题上:语音识别系统在标准美式英语上表现优异,却对非裔美国人白话英语、奇卡诺英语等边缘化方言存在显著的性能退化,这暴露了现有模型在语言多样性面前的脆弱性。构建过程中,挑战更为棘手:音频原始素材来自Spotify平台,其非实验室环境下的噪声、口音混杂及语码转换的连续性使得准确标注转录文本与方言标签极为困难;人口统计信息的正确性标注依赖主观判断,可能导致标签噪声;此外,各方言群体的样本数量不均(如“Black Men”与“Latinx Women”类别的平衡性不足),增加了模型泛化的难度。这些障碍共同构成了研究者在利用此数据集时需谨慎应对的核心难题。
常用场景
经典使用场景
在语音与语言技术交叉领域,charris/raw_train_dev_test_spotify数据集为方言与口音感知研究提供了宝贵的多模态资源。其核心应用场景聚焦于基于音频信号与文本转录的方言识别与分类任务,尤其针对非裔美国人英语(AAVE)、奇卡诺英语、西班牙英语及标准美式英语(SAE)等变体。研究者可借助该数据集训练声学模型与语言模型,系统性地探究不同方言在声学特征、韵律模式及词汇语法层面的差异性,为构建更具包容性的语音系统奠定数据基础。
解决学术问题
该数据集直面语言技术中方言多样性被系统性忽视的学术困境,解决了长期困扰学界的数据稀缺与标注不均衡问题。通过提供细粒度的方言标注(如AAVE、Spanglish)及说话人人口统计学信息(性别、族群),它使研究者能够量化分析主流语音识别模型在非标准方言上的性能衰减,揭示算法偏见的技术根源。其深远意义在于推动公平性评估框架的建立,促使学界重新审视‘标准语言’的技术霸权,为语言技术向语言正义演进提供实证支撑。
衍生相关工作
围绕该数据集已衍生出多项关键学术工作,包括构建方言感知的端到端语音识别模型、探索对比学习框架下的方言不变特征提取方法,以及设计基于人口统计学信息的公平性正则化技术。研究者还利用其多说话人对话标注,开展了跨方言语音转换与方言自适应合成的研究。这些工作不仅深化了对语言变异与语音技术交互机制的理解,更催生了诸如‘方言公平性排行榜’等评估基准,推动学界形成可复现的方言技术评估范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务