kupe-tts
收藏资源简介:
kupe-tts 是一个自包含的印地语/印地英语(Hinglish)文本转语音(TTS)数据集,以 Parquet 集群格式存储。数据集包含嵌入的音频字节(WAV 格式)、对应的转录文本以及完整的语音转文本(STT)字符级时间戳。该数据集由 Soniox 生成,语言涵盖印地语和英语混合。数据规模约为 10,000 到 100,000 个样本,默认提供训练分割,包含 10 个 Parquet 文件。每个样本包含以下字段:audio(音频字节,采样率 24000 Hz)、text(话语转录文本)、index(语料索引)、meta_json(完整生成参数和时间戳 JSON)、characters_json(字符级 STT 时间戳)、word_timestamps_json(词级时间戳)、duration_sec(音频时长)、sample_rate(采样率)、language、voice、model(生成参数)以及 coverage_pct(时间戳覆盖率)。该数据集适用于训练 TTS 模型,特别是针对印地语和印地英语场景,也可用于语音识别时间戳分析。
kupe-tts is a self-contained Hindi/Hinglish Text-to-Speech (TTS) dataset in Parquet cluster format. It contains embedded audio bytes (WAV format), corresponding transcriptions, and full STT character-level timestamps. Generated by Soniox, the dataset covers mixed Hindi and English. The data size is approximately 10,000 to 100,000 samples, with a default training split of 10 Parquet files. Each sample includes fields: audio (audio bytes, sample rate 24000 Hz), text (utterance transcript), index (corpus index), meta_json (full generation parameters and timestamps JSON), characters_json (character-level STT timestamps), word_timestamps_json (word-level timestamps), duration_sec (audio duration), sample_rate, language, voice, model (generation parameters), and coverage_pct (timestamp coverage). The dataset is suitable for training TTS models, especially for Hindi and Hinglish scenarios, and can also be used for speech recognition timestamp analysis.
kupe-tts 数据集概述
基本信息
- 许可协议:Apache 2.0
- 任务类型:文本转语音(Text-to-Speech)
- 语言:印地语(hi)、英语(en),支持印地英语混合(Hinglish)
- 数据集规模:10,000 < 样本数 < 100,000
- 标签:hindi、hinglish、tts、soniox、kupe
数据格式与结构
- 默认分割:仅提供
train分割 - 存储格式:Parquet 集群文件(
data/clusters/cluster-*.parquet) - 集群数量:10 个集群,共 30 行 数据
- 音频参数:采样率 24000 Hz,音频以 WAV 字节形式嵌入 Parquet 文件中
数据列说明
| 列名 | 类型 | 描述 |
|---|---|---|
audio |
Audio | 嵌入的 WAV 音频字节 |
text |
string | 话语转录文本 |
index |
int64 | 语料索引 |
meta_json |
string | 完整的 Soniox 生成与时间戳 JSON |
characters_json |
string | 字符级语音识别(STT)时间戳 |
word_timestamps_json |
string | 词级时间戳 |
duration_sec |
float | 音频时长(秒) |
sample_rate |
int64 | 采样率(24000 Hz) |
language / voice / model |
string | 生成参数 |
coverage_pct |
float | 时间戳覆盖率 |
使用说明
- 数据集可直接通过 Hugging Face
datasets库加载,使用split="train"参数即可访问。 - 数据中的所有信息(音频、文本、时间戳)均嵌入 Parquet 文件内,适合用于训练及数据集可视化。
- 遗留的松散
audio/文件可能存在,但官方推荐使用 Parquet 集群进行访问。





