indic-tts-en-hi-60min
收藏资源简介:
一个从YouTube音频构建的精选TTS训练数据集,包含约30分钟印地语和30分钟印度英语,经过转录、质量检查和发布到HuggingFace。数据集中包含2位印地语说话者的110个片段(33.6分钟)和3位印度英语说话者的152个片段(37.6分钟),总计5位说话者、262个片段、71.2分钟音频。
A curated TTS training dataset constructed from YouTube audio, which includes approximately 30 minutes of Hindi and 30 minutes of Indian English content. The dataset has undergone transcription and quality inspection, and is published on HuggingFace. Specifically, it contains 110 audio segments (totaling 33.6 minutes) from 2 Hindi speakers, and 152 audio segments (totaling 37.6 minutes) from 3 Indian English speakers. In total, the dataset encompasses 5 speakers, 262 audio segments, and 71.2 minutes of audio.
数据集概述:Indic TTS Dataset Pipeline
本数据集是一个从YouTube音频构建的、经过策划的TTS(文本转语音)训练数据集。数据集的最终版本已发布至HuggingFace平台。
数据集基本信息
- 总时长: 约71.2分钟
- 总音频片段: 262个
- 总说话人数: 5人
- 语言:
- 印地语 (hi-IN): 2位说话人,110个片段,33.6分钟
- 印度英语 (en-IN): 3位说话人,152个片段,37.6分钟
- 数据来源: YouTube音频(YouTube标准许可,用于研究/教育目的)
数据处理流程
数据集通过一个包含6个步骤的pipeline生成,所有步骤均基于config.yaml配置运行:
- 下载: 使用
yt-dlp下载音频并保存元数据。 - 分段: 基于静音检测进行切分,每个片段时长控制在4-29秒。
- 转写: 使用Sarvam Saaras v3模型进行语音转文字。
- 归一化: 统一转换为24kHz单声道,-23 LUFS音量标准,并修剪静音。
- 情感标注: 使用Sarvam LLM(sarvam-30b模型)进行情感标签识别。
- 上传: 构建并推送数据集至HuggingFace。
质量控制
- 审核机制: 原始片段共334个,其中72个(约21.6%)被拒绝。拒绝原因主要为语句边界截断问题,无音频噪杂或次要声音片段通过审核。
- 人工审核产物: 包含详细的听录笔记(
qc/listening_log.md)、统计与修正信息(qc/stats.md)以及按来源分类的拒绝列表(data/segments/*/reject.txt)。
已知发现与优化
- 分段优化: 为避免静音分段在最大时长(29秒)限制下切断单词,采用了
soft_split()方法,在边界处回溯最多8秒寻找最近安静点。 - API限制: Sarvam的同步STT API有30秒硬限制,因此将最大分段时长设为29秒。
- 转写误差: 转写错误主要集中在特定领域术语(如英语技术讲座中的SQL术语)。印地语表现更优,但中英混杂句子中英文单词的转写存在不一致。
- 情感分布: 情感标签以中性(54%)和冷静(31%)为主,这与数据源(励志演讲、技术讲座)的演讲风格相符。
设置与运行
- 依赖: 需要Python虚拟环境、
requirements.txt中的依赖包以及ffmpeg。 - 环境变量: 需要设置Sarvam API密钥、HuggingFace Token及目标仓库名称。
- 运行命令: 按步骤顺序执行对应脚本,支持通过
--dry-run预检最后的上传步骤。
数据集地址




