sinhala-tts-dataset
收藏资源简介:
Sinhala TTS数据集是一个干净、分段的僧伽罗语语音数据集,来源于YouTube系列节目Unlimited History(由@sunchare制作)。该数据集专为文本到语音(TTS)和自动语音识别(ASR)任务设计,适用于僧伽罗语相关的语音处理研究。数据集包含218个语音片段,总时长为0.51小时,平均每个片段时长为8.5秒,采样率为22050 Hz。数据集分为训练集(208个片段)和验证集(10个片段)。数据经过多步处理流程,包括音频分离、语音修复、说话人分离、语音活动检测、自动语音识别和质量过滤(SNR≥20.0dB)。数据集格式采用LJSpeech标准,包含WAV格式的音频文件(22050 Hz单声道)和metadata.csv文件(包含文件名、文本和标准化文本)。
数据集概述
Sinhala TTS Dataset 是一个用于文本转语音(TTS)和自动语音识别(ASR)任务的单说话人僧伽罗语语音数据集。数据来源于 YouTube 系列视频 "Unlimited History",由 @sunchare 制作。
基本信息
| 属性 | 内容 |
|---|---|
| 语言 | 僧伽罗语 (si) |
| 许可证 | CC-BY-4.0 |
| 任务类别 | 文本转语音、自动语音识别 |
| 标签 | sinhala, tts, speech |
数据集版本
数据集提供两个版本:
1. cc_v1 — 完整数据集(63个视频)
| 指标 | 数值 |
|---|---|
| 话语数 | 22,441 |
| 训练集/验证集 | 21,319 / 1,122 |
| 总时长 | 23.23 小时 |
| 平均时长 | 3.73 秒 |
| 时长范围 | 3.0 秒 – 19.74 秒 |
| 采样率 | 22,050 Hz |
| 处理视频数 | 63 |
| 平均保留率 | 84.4% |
2. cc_v1_tenvideo_baseline — 10个视频的基线数据集
| 指标 | 数值 |
|---|---|
| 话语数 | 3,772 |
| 训练集/验证集 | 3,584 / 188 |
| 总时长 | 3.91 小时 |
| 平均时长 | 3.73 秒 |
| 时长范围 | 3.0 秒 – 19.74 秒 |
| 采样率 | 22,050 Hz |
数据处理流程
YouTube 自动生成的僧伽罗语字幕 → 文本对齐 → 音频分割 → 质量过滤(时长、重复、字符率) → 输出 22050Hz 单声道 WAV 文件
数据格式
采用 LJSpeech 风格格式:
wavs/*.wav— 22050 Hz、16位、单声道音频文件metadata.csv— 以竖线分隔、无表头的三列文件:filename|text|normalized_text
完整数据集 cc_v1 的音频文件按编号子目录组织(wavs/00/, wavs/01/ 等),10视频基线数据集的音频文件位于扁平目录 wavs/ 中。
每个视频的原始数据
10个基线视频各自保留原始(未分割)处理输出,位于 videos/<video_id>/ 目录下,包含:
- 字幕分割前的原始长形式话语
manifest_kept.json/rejected_utterances.json— 完整过滤日志run_info.json— 处理元数据
使用示例
python import pandas as pd
加载10视频基线数据集
df = pd.read_csv( "hf://datasets/outlawmold/sinhala-tts-dataset/cc_v1_tenvideo_baseline/metadata_train.csv", sep="|", header=None, names=["id", "text", "normalized"] ) print(f"训练话语数: {len(df)}")
后续计划
- [x] 10视频 CC 基线数据集(3.91小时)
- [x] 完整 63 视频 CC 处理流程(23.23小时)
- [ ] 下一批 10 个视频处理
- [ ] TTS 模型微调(F5-TTS)




