遇见数据集

Subhadeep/common_voice_11_0_hi_pseudo_labelled

收藏
Hugging Face2023-11-22 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: config_name: hi features: - name: client_id dtype: string - name: path dtype: string - name: audio dtype: audio: sampling_rate: 16000 - name: sentence dtype: string - name: up_votes dtype: int64 - name: down_votes dtype: int64 - name: age dtype: string - name: gender dtype: string - name: accent dtype: string - name: locale dtype: string - name: segment dtype: string - name: whisper_transcript sequence: int64 splits: - name: train num_bytes: 131053542.138 num_examples: 4361 - name: validation num_bytes: 64148344.509 num_examples: 2179 - name: test num_bytes: 100961651.174 num_examples: 2894 download_size: 260542039 dataset_size: 296163537.821 configs: - config_name: hi data_files: - split: train path: hi/train-* - split: validation path: hi/validation-* - split: test path: hi/test-* ---

数据集信息: 配置名称:hi 特征: - 名称:client_id(客户端ID),数据类型:字符串 - 名称:path(路径),数据类型:字符串 - 名称:audio(音频),数据类型:音频格式,采样率为16000赫兹 - 名称:sentence(语句文本),数据类型:字符串 - 名称:up_votes(点赞票数),数据类型:64位整数 - 名称:down_votes(点踩票数),数据类型:64位整数 - 名称:age(年龄),数据类型:字符串 - 名称:gender(性别),数据类型:字符串 - 名称:accent(口音),数据类型:字符串 - 名称:locale(语言区域),数据类型:字符串 - 名称:segment(语音片段),数据类型:字符串 - 名称:whisper_transcript(Whisper语音转录序列,Whisper),数据类型:64位整数序列 数据集划分: - 名称:train(训练集),数据字节数:131053542.138,样本数量:4361 - 名称:validation(验证集),数据字节数:64148344.509,样本数量:2179 - 名称:test(测试集),数据字节数:100961651.174,样本数量:2894 下载大小:260542039字节 数据集总大小:296163537.821字节 配置项: - 配置名称:hi 数据文件: - 划分集:train(训练集),数据路径:hi/train-* - 划分集:validation(验证集),数据路径:hi/validation-* - 划分集:test(测试集),数据路径:hi/test-*

提供机构:
Subhadeep
原始信息汇总

数据集概述

配置名称

  • config_name: hi

特征信息

  • client_id: 字符串类型
  • path: 字符串类型
  • audio: 音频类型,采样率为16000
  • sentence: 字符串类型
  • up_votes: 64位整数类型
  • down_votes: 64位整数类型
  • age: 字符串类型
  • gender: 字符串类型
  • accent: 字符串类型
  • locale: 字符串类型
  • segment: 字符串类型
  • whisper_transcript: 序列类型,64位整数

数据分割

  • train:
    • 字节数: 131053542.138
    • 样本数: 4361
  • validation:
    • 字节数: 64148344.509
    • 样本数: 2179
  • test:
    • 字节数: 100961651.174
    • 样本数: 2894

数据大小

  • 下载大小: 260542039 字节
  • 数据集大小: 296163537.821 字节

配置文件路径

  • config_name: hi
    • train: hi/train-*
    • validation: hi/validation-*
    • test: hi/test-*
搜集汇总
数据集介绍
构建方式
Subhadeep/common_voice_11_0_hi_pseudo_labelled数据集基于Mozilla Common Voice 11.0语料库构建,专门针对印地语(Hindi)语音数据进行伪标签化处理。该数据集保留了原始Common Voice中的音频文件及其元数据,包括说话人标识、年龄、性别、口音和地区信息,同时利用Whisper模型对每条语音样本生成伪转录标签(whisper_transcript),以扩充标注数据规模。数据集划分为训练集(4361条)、验证集(2179条)和测试集(2894条),音频统一以16kHz采样率存储,确保与下游语音模型输入的兼容性。
使用方法
用户可通过Hugging Face Datasets库加载该数据集,指定配置名'hi'即可获取训练、验证和测试分片。加载后,每条样本包含音频路径、语音数组(16kHz)、原始句子、伪转录标签及元数据字段。使用时可结合Whisper转录序列进行监督学习,也可利用投票字段过滤低质量样本。建议在训练前对音频进行归一化或增强处理,并注意伪标签可能存在的噪声,可设计置信度阈值或结合人工校对策略提升模型鲁棒性。
背景与挑战
背景概述
在自动语音识别(ASR)领域,低资源语言的数据稀缺始终是制约模型性能提升的关键瓶颈。Subhadeep/common_voice_11_0_hi_pseudo_labelled数据集由研究团队基于Mozilla Common Voice 11.0语料库构建,专注于印地语(Hindi)这一全球使用广泛但语音资源相对匮乏的语言。该数据集于近期发布,核心研究问题在于如何通过伪标签技术(pseudo-labelling)利用大规模无标注语音数据来扩充训练样本,从而改善印地语ASR系统的鲁棒性与准确率。数据集包含训练、验证和测试三个划分,共计9434条音频片段,并提供了Whisper模型生成的伪转录文本(whisper_transcript)作为额外监督信号。这一工作不仅为印地语语音识别研究提供了标准化评测基准,更推动了低资源场景下半监督学习范式的实践探索,对多语言ASR领域具有重要参考价值。
当前挑战
该数据集面临的核心挑战首先源自印地语自身的语言复杂性:其音系结构包含丰富的送气音、卷舌音和鼻化元音,且存在大量方言变体与代码混合现象,导致声学模型难以准确捕捉发音差异。在构建过程中,伪标签技术的引入带来了噪声累积风险——Whisper模型在低资源语言上的转录错误会通过迭代训练被放大,影响后续模型泛化能力。此外,数据集规模有限(训练集仅4361条样本),且音频来源主要依赖众包平台,背景噪声、录音设备差异及说话人年龄、性别分布不均等问题显著增加了特征空间的不一致性。标注质量方面,原始Common Voice语料中的拼写错误与伪标签中的语义偏差共同构成了数据层面的挑战,需借助鲁棒的噪声过滤策略与领域自适应技术加以缓解。
常用场景
经典使用场景
Subhadeep/common_voice_11_0_hi_pseudo_labelled数据集是印地语自动语音识别(ASR)研究中的一项重要资源。该数据集基于Mozilla Common Voice 11.0语料库,通过伪标签技术为无标注音频赋予了高质量的文本转录,从而扩展了印地语语音数据的可用性。其经典使用场景集中于训练和评估端到端语音识别模型,例如基于Transformer的Whisper架构,研究者可借助该数据集探索低资源语言场景下的半监督学习方法,推动印地语ASR系统性能的持续提升。
解决学术问题
该数据集有效缓解了印地语作为低资源语言在语音识别领域面临的标注数据匮乏问题。通过引入伪标签策略,它解决了学术研究中因人工标注成本高昂而导致的语料规模受限困境,为半监督学习、自训练及知识蒸馏等范式提供了可靠的实验基准。其意义在于证明了伪标签技术在低资源语言上的可行性,促进了多语言ASR系统的公平性研究,并推动了跨语言迁移学习方法的创新。
实际应用
在实际应用中,该数据集可支撑印地语语音助手的开发、智能客服系统的本地化部署以及语音转写服务的精准度优化。例如,基于该数据训练的ASR模型能够赋能印度地区的教育平台实现实时课堂转录,或为医疗问诊系统提供方言友好的语音输入支持。此外,其伪标签特性降低了企业构建定制化语音应用的门槛,加速了印地语自然语言处理技术在移动端和物联网场景中的落地。
数据集最近研究
最新研究方向
该数据集聚焦于印地语自动语音识别(ASR)的前沿探索,通过引入伪标签技术(Whisper模型生成的transcript)来应对低资源语言标注稀缺的挑战。当前研究热点在于利用大规模预训练模型(如OpenAI Whisper)对未标注语音进行半监督学习,从而在保持高识别精度的同时大幅降低人工成本。这一方向与多语言语音技术普惠化的全球趋势紧密相连,尤其在印度等印地语使用人口庞大的地区,推动了智能语音助手、实时翻译和无障碍通信等应用的发展。该数据集的发布为评估伪标签策略在低资源场景下的有效性提供了标准化基准,其包含的年龄、性别、口音等元数据更支持公平性与鲁棒性研究,对缩小数字鸿沟具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务