ghananlpcommunity/new-twi-tts-aligned
收藏资源简介:
Twi TTS数据集是一个从加纳新闻媒体广播中提取的Twi(Akan)语音数据集,专门用于训练和微调文本到语音(TTS)模型。数据集包含音频片段及其对应的Twi文本转录,音频采样率为24 kHz,单声道WAV格式,并提供了音频时长等统计信息。数据集结构包括audio(音频)、text(文本转录)和duration(时长)列,总剪辑数161,398个,总时长172.44小时,平均剪辑时长3.85秒,词汇量64,812个独特单词。适用于构建TTS模型、Twi语音学研究和低资源非洲语言自动语音识别基准测试。
--- 配置项: - 配置名称:default 数据文件: - 拆分方式:训练集(train) 路径:data/train-* - 拆分方式:测试集(test) 路径:data/test-* 数据集信息: 特征: - 名称:audio(音频) 数据类型: audio: 采样率:24000 Hz - 名称:text(文本) 数据类型:字符串 拆分情况: - 名称:train(训练集) 总字节数:26963764996 样本数量:145258 - 名称:test(测试集) 总字节数:2884516661 样本数量:16140 下载总大小:29817514008 字节 数据集总大小:29848281657 字节 --- # 特维语(Twi)文本转语音(Text-To-Speech, TTS)数据集 本数据集为从加纳新闻媒体广播中提取的特维语(阿坎语)语音数据集,旨在用于训练与微调文本转语音(Text-To-Speech, TTS)模型。 ## 📂 数据集结构 | 列名 | 数据类型 | 描述 | |--------|------|-------------| | `audio` | 音频 | 24 kHz 单声道WAV音频片段 | | `text` | 字符串 | 音频片段的逐字特维语转写内容 | | `duration` | 浮点数 | 音频片段的时长,单位为秒 | ## 📊 统计信息 | 指标 | 数值 | |--------|-------| | 总音频片段数 | 161,398 | | 总时长 | 172.44 小时 | | 平均单片段时长 | 3.85 秒 | | 单片段时长最小值/最大值 | 0.10 s / 29.82 s | | 平均每片段词数 | 11.5 | | 单片段词数最小值/最大值 | 1 / 81 | | 词汇表规模 | 64,812 个独特词汇 | | 采样率 | 24,000 Hz(单声道) | ## 🚀 使用方式 python from datasets import load_dataset dataset = load_dataset("ghananlpcommunity/new-twi-tts-aligned") train = dataset["train"] example = train[0] print("Transcription:", example["text"]) print("Duration (s):", example["duration"]) print("Audio array shape:", example["audio"]["array"].shape) print("Sample rate:", example["audio"]["sampling_rate"]) ## 🎯 适用场景 * 从零构建特维语(阿坎语)TTS模型,或对现有模型进行微调 * 针对特维语语音学与韵律学的语言学研究 * 低资源非洲语言自动语音识别(Automatic Speech Recognition, ASR)基准测试 ## 📜 引用格式 bibtex @dataset{twi_tts, author = {Owusu, Mich-Seth}, title = {Twi TTS Dataset}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/ghananlpcommunity/new-twi-tts-aligned} } ## 🙏 致谢 本数据集由Mich-Seth Owusu为加纳自然语言处理社区创建。



