遇见数据集

daremc86/serbian_common_voice

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个塞尔维亚语单说话者语音数据集,采用Common Voice数据集格式风格,专门用于文本到语音(TTS)训练。数据集包含高质量的塞尔维亚语音录音,配有手动创建并以西里尔文字母编写的文本转录。语言为塞尔维亚语,使用西里尔文字母,格式与Common Voice兼容,适用于TTS任务。音频格式为WAV,采样率为22050 Hz,说话者为单一女性声音。数据集约8小时语音,经过清理和归一化处理,数字已从转录中移除,并已手动验证对齐。它兼容Coqui TTS、VITS、XTTS预处理管道和自定义PyTorch TTS管道,基于CC-BY-4.0许可证发布。

A Serbian single-speaker speech dataset prepared for Text-to-Speech (TTS) training using the Common Voice dataset formatting style. The dataset contains high-quality Serbian speech recordings paired with manually created text transcripts written in Cyrillic script. Language is Serbian, script is Cyrillic, format is Common Voice compatible, use case is Text-to-Speech, audio format is WAV, sampling rate is 22050 Hz, and speaker type is single-speaker female voice. Approximately 8 hours of speech, with cleaned and normalized transcripts, numbers removed, and manually verified alignments. Compatible with Coqui TTS, VITS, XTTS preprocessing pipelines, and custom PyTorch TTS pipelines, released under the CC-BY-4.0 license.

提供机构:
daremc86
搜集汇总
数据集介绍
构建方式
该数据集专为塞尔维亚语文本转语音(TTS)模型训练而构建,遵循Mozilla Common Voice的格式化风格。数据集中包含约8小时的高质量单说话人语音录音,均由一名女性说话者自愿录制并授权公开使用。所有文本转录均以塞尔维亚语西里尔字母手动编写而成,确保内容的原创性与独立性,未从任何现有数据集、有声读物或书籍中复制或提取。语音文件以WAV格式存储,采样率为22050 Hz,并经过手动对齐验证,保障语音与文本的精准匹配。
特点
数据集的特点在于其高度的专业性与可控性:采用单说话人设计,语音风格一致,适用于稳定的TTS模型训练;西里尔字母文本经过清洗与归一化处理,移除数字以简化学习任务;数据量约8小时,规模适中,便于快速迭代实验。此外,数据集遵循CC-BY-4.0许可证,完全开放用于研究和开源项目,兼容Coqui TTS、VITS等主流TTS框架,并支持Common Voice格式化工具直接处理。
使用方法
使用该数据集时,可直接加载`clips/`目录下的WAV文件与`clean.tsv`元数据文件,其中路径与文本一一对应。推荐通过Coqui TTS或VITS的预处理管线进行特征提取,例如使用Common Voice格式化器完成数据过滤与拆分为训练、验证集。开发者需注意数据集仅覆盖西里尔字母文本,且不包含数字,适合基础TTS模型的训练,但在处理罕见词汇或方言时可能泛化能力有限。
背景与挑战
背景概述
塞尔维亚语作为南斯拉夫语支的重要语言,其语音合成技术的发展长期受限于高质量开源数据集的匮乏。由研究者Darko Milošević于近期创建的serbian_common_voice数据集,遵循Mozilla Common Voice格式,专为文本转语音(TTS)任务设计,涵盖约8小时、22.05kHz采样的单人女性语音及手工标注的西里尔文转录文本。该数据集以CC-BY-4.0许可发布,旨在填补塞尔维亚语TTS领域的空白,为Coqui TTS、VITS等主流框架提供标准化训练资源,对推动低资源语言语音合成研究具有重要价值。
当前挑战
该数据集面临的核心挑战包括:1)领域问题层面,塞尔维亚语TTS需应对西里尔字母拼写与语音变体的复杂性,尤其罕见词和方言的泛化能力不足;2)构建过程中,需规避版权文本复用,全部转录文本由人工独立创作以确保合法性;3)数据规模(1K-10K样本)和单说话人设置限制了多说话人建模与音色多样性;4)预处理时须剔除数字、规范化对齐,且仅支持西里尔文,后续扩展至拉丁文或混合文场景存在兼容性瓶颈。
常用场景
经典使用场景
该数据集专为塞尔维亚语文本转语音(TTS)任务而设计,其经典使用场景在于训练基于神经网络的单说话人语音合成模型。凭借约8小时的女性高清录音、西里尔字母转录文本及与Common Voice兼容的格式,研究人员可借助Coqui TTS、VITS等框架,构建发音清晰、韵律自然的塞尔维亚语语音生成系统。数据集的单说话人特性使其尤其适合研究音色一致性、文本-语音对齐优化及低资源语言的声学建模,为小语种TTS开发提供了标准化的训练与评估基准。
解决学术问题
该数据集有效解决了塞尔维亚语语音合成研究中高质量标注数据匮乏的核心瓶颈。其手动编写的转录文本避开了版权语料库的伦理争议,为小规模、可控条件的TTS模型训练提供了可靠的数据基础。学术上,它推动了对西里尔字母音素-声学映射规律的挖掘,支持研究数据增强、迁移学习和条件生成等策略以克服单说话人泛化局限。这一资源填补了塞尔维亚语在开源TTS领域的空白,强化了低资源语言在语音技术研究中的可及性与公平性。
衍生相关工作
该数据集衍生了多个关键研究方向与技术成果。其格式设计直接借鉴Mozilla Common Voice框架,间接鼓励了更多类似TTS数据集的创建,如克罗地亚语或斯洛文尼亚语的单说话人语料库。基于此数据,研究者探索了使用VITS的端到端声码器架构和Coqui TTS的多说话人扩展方案,并尝试利用音色转换或说话人嵌入技术来突破单说话人局限。此外,数据集的规范性清理流程和手动对齐策略为其他低资源语言的数据构建提供了可复现的范本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务