遇见数据集

severo/speech-rj-hi

收藏
Hugging Face2024-02-08 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: audio dtype: audio - name: sentence dtype: string splits: - name: train num_bytes: 3672926800.4989805 num_examples: 422603 - name: test num_bytes: 36510981.394019544 num_examples: 4269 download_size: 2808288472 dataset_size: 3709437781.893 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* license: mit task_categories: - text-to-speech - automatic-speech-recognition language: - hi pretty_name: Rajasthani Speech Dataset size_categories: - 100K<n<1M --- # Rajasthani Hindi Speech Dataset <!-- Provide a quick summary of the dataset. --> This dataset consists of audio recordings of participants reading out stories in Rajasthani Hindi, one sentence at a time. We had 98 participants from Soda, Rajasthan. Each participant read 30 stories. In total, we have 426873 recordings in this dataset. We had roughly 58 male participants and 40 female participants. > **Point to Note:** > While random sampling suggests that most users have to their best effort tried to accurately read out the sentences, we have not performed any quality analysis on the data. There could be errors in some of the recordings. <!-- Provide a longer summary of what this dataset is. --> ### Dataset Sources <!-- Provide the basic links for the dataset. --> - **Link:** [Download](https://www.microsoft.com/en-gb/download/details.aspx?id=105385) - **Curated By:** [Kalika Bali](https://www.microsoft.com/en-us/research/people/kalikab/downloads/) ## Dataset Structure <!-- This section provides a description of the dataset fields, and additional information about the dataset structure such as criteria used to create the splits, relationships between data points, etc. --> Contains two headers: audio and sentence containing the Audio file and sentence respectively.

数据集信息: 特征: - 名称:audio(音频),数据类型:音频 - 名称:sentence(句子),数据类型:字符串 划分集: - 名称:训练集(train),字节数:3672926800.4989805,样本数:422603 - 名称:测试集(test),字节数:36510981.394019544,样本数:4269 下载大小:2808288472,数据集总大小:3709437781.893 配置项: - 配置名称:default(默认配置),数据文件: - 划分集:训练集,路径:data/train-* - 划分集:测试集,路径:data/test-* 许可证:MIT许可证 任务类别: - 文本转语音(text-to-speech) - 自动语音识别(automatic-speech-recognition) 语言:印地语(hi) 数据集名称:拉贾斯坦语语音数据集(Rajasthani Speech Dataset) 样本量区间:100K < n < 1M # 拉贾斯坦语印地语语音数据集 <!-- 提供数据集简要概述 --> 本数据集收录了参与者逐句朗读拉贾斯坦语印地语故事的音频录音。我们招募了来自拉贾斯坦邦索达的98名参与者,每名参与者朗读30个故事,总计收录426873条音频录音。参与者群体中约有58名男性与40名女性。 > **注意事项:** > 尽管随机抽样结果显示绝大多数参与者均已尽力准确朗读对应句子,但我们未对该数据集开展任何质量校验工作,部分录音可能存在错误。 <!-- 提供数据集的详细概述 --> ### 数据集来源 <!-- 提供数据集的基础链接 --> - **下载链接**:[下载](https://www.microsoft.com/en-gb/download/details.aspx?id=105385) - **整理方**:[卡莉卡·巴利(Kalika Bali)](https://www.microsoft.com/en-us/research/people/kalikab/downloads/) ## 数据集结构 <!-- 本节描述数据集字段,以及划分集创建标准、数据点间关联等额外结构信息 --> 本数据集包含两个字段:`audio`(音频)与`sentence`(句子),分别对应音频文件与对应的句子文本。

提供机构:
severo
原始信息汇总

Rajasthani Hindi Speech Dataset

数据集概述

该数据集包含参与者在拉贾斯坦语(Rajasthani Hindi)中逐句朗读故事的音频记录。共有98名来自Soda, Rajasthan的参与者,每位参与者朗读了30个故事。总计有426873条录音,其中约58名男性参与者和40名女性参与者。

数据集结构

数据集包含两个字段:

  • audio: 音频文件
  • sentence: 句子文本

数据分割

数据集分为训练集和测试集:

  • train: 包含422603个样本,总大小为3672926800.4989805字节
  • test: 包含4269个样本,总大小为36510981.394019544字节

数据集大小

  • 下载大小:2808288472字节
  • 数据集总大小:3709437781.893字节

配置

  • 默认配置(default)包含训练集和测试集的数据文件路径:
    • 训练集路径:data/train-*
    • 测试集路径:data/test-*

许可证

MIT许可证

任务类别

  • 文本到语音转换
  • 自动语音识别

语言

  • 拉贾斯坦语(hi)

数据集名称

Rajasthani Speech Dataset

数据集规模

100K<n<1M

搜集汇总
数据集介绍
severo/speech-rj-hi 数据集图片
构建方式
在语音技术领域,高质量的多语言数据集是推动自动语音识别与文本转语音系统发展的基石。该数据集源自印度拉贾斯坦邦索达地区的98名参与者,他们以拉贾斯坦印地语逐句朗读故事。每位参与者贡献了30个故事朗读,共计生成426,873条录音。参与者性别分布均衡,包含约58名男性和40名女性,确保了语音样本的多样性。数据集按比例划分为训练集(422,603条)和测试集(4,269条),以支持模型训练与评估。
特点
该数据集的核心特色在于其地域性和语言特异性,聚焦于拉贾斯坦印地语这一低资源语言,为方言语音研究提供了珍贵资源。每条数据包含音频文件及其对应文本,结构简洁明了。数据集规模介于10万至100万之间,属于中等规模,但覆盖了98位不同说话者的声音,体现了丰富的声学特征。需注意,数据集未经严格质量审核,部分录音可能存在朗读误差,这既是局限性也是真实场景的反映。
使用方法
数据集以HuggingFace格式发布,采用MIT许可证开放使用,便于集成到主流机器学习框架中。用户可通过`datasets`库直接加载,指定`severo/speech-rj-hi`名称即可获取训练与测试分片。数据包含`audio`和`sentence`两个字段,前者为音频张量,后者为对应文本。适用于微调自动语音识别模型或训练文本转语音系统,尤其适合处理低资源语言的场景。建议在使用前对音频进行预处理,如重采样或降噪,以优化模型性能。
背景与挑战
背景概述
拉贾斯坦印地语语音数据集(Rajasthani Hindi Speech Dataset)由微软研究院的Kalika Bali团队于近年创建,旨在填补低资源印地语方言语音数据的空白。该数据集包含来自印度拉贾斯坦邦索达地区98名参与者(58名男性,40名女性)的426,873条录音,每条录音对应一个故事句子。核心研究问题聚焦于为自动语音识别和文本转语音系统提供大规模、多说话人的方言语音资源,尤其针对拉贾斯坦印地语这一缺乏标准语料库的变体。该数据集因其规模(超过42万条)和方言特异性,对推动印度次大陆低资源语言语音技术发展具有重要影响力,为跨方言语音建模和鲁棒性研究奠定了基础。
当前挑战
当前数据集面临的核心挑战包括:1) 领域问题层面,拉贾斯坦印地语作为低资源方言,缺乏标准化正字法和语言学标注,导致语音识别模型在声学特征与文本映射上存在显著歧义,同时多说话人(98人)的年龄、口音差异增加了声学建模的复杂性;2) 构建过程中,数据集明确声明未进行质量分析,随机抽样虽表明大多数录音准确,但无法排除部分录音存在朗读错误、背景噪声或设备差异,这可能导致训练数据中包含噪声标签,进而影响下游任务的鲁棒性;此外,性别分布不均衡(男58:女40)可能引入说话人偏差,需在模型训练中采用特定平衡策略以缓解泛化风险。
常用场景
经典使用场景
在低资源语言语音处理领域,severo/speech-rj-hi数据集为拉贾斯坦印地语的语音识别与合成研究提供了宝贵的语料基础。该数据集采集自印度拉贾斯坦邦索达地区的98位参与者,包含超过42万条自然阅读故事的录音,覆盖了58位男性和40位女性的语音样本,展现了丰富的地域口音与性别差异。研究者常利用该数据集训练端到端的自动语音识别模型,或构建基于深度学习的文本到语音系统,尤其适用于探索数据稀疏条件下的迁移学习与多任务学习策略。
实际应用
在实际应用中,该数据集支撑了面向印度农村地区的语音交互系统开发,例如农业信息查询、教育辅助工具等场景。基于该数据训练的语音模型可部署于智能音箱或移动终端,帮助拉贾斯坦语使用者通过语音获取天气、市场价格等实用信息。此外,该资源还促进了方言语音转写服务的商业化落地,为地方政务热线、医疗咨询等公共服务提供了技术基础,弥合了数字鸿沟。
衍生相关工作
该数据集衍生了一系列代表性研究,包括基于卷积神经网络的方言语音识别框架、结合自监督学习的低资源语音预训练模型,以及针对口音适应的对抗训练方法。微软研究院团队利用该数据发布了多说话人语音合成基线系统,后续工作进一步引入了说话人嵌入与韵律控制技术。这些成果在Interspeech、ICASSP等顶级会议中发表,推动了低资源语音技术从实验室走向实际部署的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务