遇见数据集

kupe-tts

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

kupe-tts 是一个自包含的印地语/印地英语(Hinglish)文本转语音(TTS)数据集,以 Parquet 集群格式存储。数据集包含嵌入的音频字节(WAV 格式)、对应的转录文本以及完整的语音转文本(STT)字符级时间戳。该数据集由 Soniox 生成,语言涵盖印地语和英语混合。数据规模约为 10,000 到 100,000 个样本,默认提供训练分割,包含 10 个 Parquet 文件。每个样本包含以下字段:audio(音频字节,采样率 24000 Hz)、text(话语转录文本)、index(语料索引)、meta_json(完整生成参数和时间戳 JSON)、characters_json(字符级 STT 时间戳)、word_timestamps_json(词级时间戳)、duration_sec(音频时长)、sample_rate(采样率)、language、voice、model(生成参数)以及 coverage_pct(时间戳覆盖率)。该数据集适用于训练 TTS 模型,特别是针对印地语和印地英语场景,也可用于语音识别时间戳分析。

kupe-tts is a self-contained Hindi/Hinglish Text-to-Speech (TTS) dataset in Parquet cluster format. It contains embedded audio bytes (WAV format), corresponding transcriptions, and full STT character-level timestamps. Generated by Soniox, the dataset covers mixed Hindi and English. The data size is approximately 10,000 to 100,000 samples, with a default training split of 10 Parquet files. Each sample includes fields: audio (audio bytes, sample rate 24000 Hz), text (utterance transcript), index (corpus index), meta_json (full generation parameters and timestamps JSON), characters_json (character-level STT timestamps), word_timestamps_json (word-level timestamps), duration_sec (audio duration), sample_rate, language, voice, model (generation parameters), and coverage_pct (timestamp coverage). The dataset is suitable for training TTS models, especially for Hindi and Hinglish scenarios, and can also be used for speech recognition timestamp analysis.

创建时间:
2026-08-21
原始信息汇总

kupe-tts 数据集概述

基本信息

  • 许可协议:Apache 2.0
  • 任务类型:文本转语音(Text-to-Speech)
  • 语言:印地语(hi)、英语(en),支持印地英语混合(Hinglish)
  • 数据集规模:10,000 < 样本数 < 100,000
  • 标签:hindi、hinglish、tts、soniox、kupe

数据格式与结构

  • 默认分割:仅提供 train 分割
  • 存储格式:Parquet 集群文件(data/clusters/cluster-*.parquet
  • 集群数量:10 个集群,共 30 行 数据
  • 音频参数:采样率 24000 Hz,音频以 WAV 字节形式嵌入 Parquet 文件中

数据列说明

列名 类型 描述
audio Audio 嵌入的 WAV 音频字节
text string 话语转录文本
index int64 语料索引
meta_json string 完整的 Soniox 生成与时间戳 JSON
characters_json string 字符级语音识别(STT)时间戳
word_timestamps_json string 词级时间戳
duration_sec float 音频时长(秒)
sample_rate int64 采样率(24000 Hz)
language / voice / model string 生成参数
coverage_pct float 时间戳覆盖率

使用说明

  • 数据集可直接通过 Hugging Face datasets 库加载,使用 split="train" 参数即可访问。
  • 数据中的所有信息(音频、文本、时间戳)均嵌入 Parquet 文件内,适合用于训练及数据集可视化。
  • 遗留的松散 audio/ 文件可能存在,但官方推荐使用 Parquet 集群进行访问。
搜集汇总
数据集介绍
kupe-tts 数据集图片
构建方式
在语音合成领域,面向印度语言的高质量数据资源长期匮乏,印地语与英语混用的Hinglish场景更因语言边界模糊而对数据标注提出更高要求。kupe-tts数据集以自包含的parquet集群形式组织,将音频字节、转写文本及逐字符级时间戳统一封装于单一文件之中。其构建过程依托Soniox语音识别引擎生成完整的生成参数与时间戳JSON,并据此切分为10个集群、共计30行样本,每行均嵌入可播放的wav音频数据,辅以语料索引、时长、采样率及语言、语音、模型等元信息,从而确保训练数据的完整性与可追溯性。
使用方法
使用该数据集时,可借助HuggingFace datasets库以load_dataset接口直接加载train划分,返回的每条样本包含音频数组、采样率、转写文本及多个JSON字符串字段。通过json.loads解析meta_json、characters_json与word_timestamps_json,即可获取Soniox生成参数、字符级与词级时间戳,进而用于TTS训练、语音对齐或时间戳预测任务。由于所有内容均已封装于parquet集群内,建议优先采用该格式进行训练与浏览,遗留的audio/目录文件仅作兼容用途,不再作为主要数据来源。
背景与挑战
背景概述
在 multilingual 语音合成领域,印度语言尤其是印地语及其混合语(Hinglish)的资源长期匮乏,制约了包容性语音技术的发展。kupe-tts 数据集于2024年由匿名研究者或机构(HuggingFace 用户名 anuj-inavlabs)发布,旨在为印地语和 Hinglish 文本到语音任务提供自包含的 parquet 数据簇。该数据集包含10个集群、30条样本,嵌入音频字节与完整的 STT 字符时间戳,采用 Apache-2.0 许可。核心研究问题在于为低资源语言提供高质量、可复现的 TTS 训练资源,其影响力在于推动印度语言语音合成及跨语言迁移研究。
当前挑战
kupe-tts 数据集所应对的领域挑战在于印地语和 Hinglish 语音合成中存在的资源稀缺、口音多样以及文本与语音对齐困难等问题。构建过程中,研究者需处理音频嵌入、字符级时间戳生成以及多语言混合文本的对齐,确保时间戳覆盖率高且数据格式统一。此外,数据集规模较小(仅30条样本),可能限制模型泛化能力,同时 Hinglish 的语码混合现象对语音合成系统提出了更高的鲁棒性要求。这些挑战共同构成了该数据集在推动低资源 TTS 研究中的核心难点。
常用场景
经典使用场景
在语音合成与语音识别联合建模的研究中,kupe-tts数据集凭借其内嵌音频字节、转录文本以及词级与字符级时间戳的完整结构,成为训练和评估印地语及Hinglish语音合成系统的经典资源。研究者常将其用于端到端TTS模型的声学建模与时长预测任务,借助精确的时间对齐信息优化声码器与声学特征生成,同时利用多说话人参数探索音色可控的合成方案,为低资源语言语音生成提供标准化的实验基准。
解决学术问题
针对印地语与Hinglish语音资源稀缺、时间戳标注不完整以及多语言混合场景下声学建模困难等学术问题,kupe-tts通过提供涵盖字符级与词级时间戳的细粒度标注,有效支撑了语音合成中的对齐学习、韵律建模与跨语言迁移研究。该数据集缓解了低资源语言TTS系统在训练数据不足时的性能退化问题,并为语音识别与合成联合优化提供了可复现的实验平台,推动了多语言语音处理技术的均衡发展。
实际应用
在工业级语音交互系统中,kupe-tts可服务于印地语与Hinglish智能助手、有声内容创作及无障碍阅读等场景。开发者利用其内嵌音频与时间戳信息,能够快速构建高自然度的语音合成模块,并实现精确的口型同步与字幕对齐。该数据集亦适用于呼叫中心语音播报、教育类口语评测以及跨语言语音转换等实际任务,为南亚语言市场的语音产品落地提供了可靠的数据支撑。
数据集最近研究
最新研究方向
在印度多语言语音合成领域,印地语与英语混合(Hinglish)的韵律建模和音素对齐正成为前沿探索方向。kupe-tts数据集以其内嵌音频字节与完整语音识别字符时间戳的parquet簇结构,为端到端TTS模型提供了细粒度监督信号,推动了对混合语言场景下声学-文本对齐稳定性的研究。该数据集支持从字符级到词级的时序标注,使得研究者能够深入探究跨语言音素映射与时长预测的准确性,从而提升合成语音的自然度与可懂度。当前热点集中于利用此类时间戳信息优化非自回归TTS模型的训练效率,并评估其在低资源混合语言环境中的泛化能力,对多语言语音交互系统的公平性与包容性具有积极意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务