遇见数据集

kenpath/svara-customvoice-text-v1

收藏
Hugging Face2026-05-13 更新2026-05-31 收录
官方服务:

资源简介:

这是一个多语言、多说话人的语音数据集,包含文本转录、音频文件以及丰富的元数据特征,如语音时长、语速、语言、说话人信息、口音、音频质量分类(如信噪比、混响、音高、PESQ等)。数据集总大小约90.8GB,包含567,421个示例,分为12个训练分割,适用于语音识别、语音合成、音频分析等自然语言处理任务。

This is a multilingual, multi-speaker speech dataset that includes text transcripts, audio files, and rich metadata features such as speech duration, speaking rate, language, speaker information, accent, and audio quality classifications (e.g., SNR, reverberation, pitch, PESQ). The total dataset size is approximately 90.8GB, containing 567,421 examples divided into 12 training splits, suitable for natural language processing tasks like speech recognition, speech synthesis, and audio analysis.

提供机构:
kenpath
二维码
社区交流群
二维码
科研交流群
商业服务