相关数据集
meetween/mumospee_librispeech
该数据集是LibriSpeech语料库的修改版本,转换为parquet格式以提高高性能计算环境中的I/O效率。LibriSpeech广泛用于语音识别研究,包含超过1,000小时的英语朗读语音。此修改保留了原始数据属性,同时改进了大规模模型分布式训练的数据处理。
Hugging Face2024-11-25 更新160
meetween/mumospee_small
--- license: cc0-1.0 task_categories: - text-to-speech - automatic-speech-recognition language: - en - de - fr - bg - ar pretty_name: Mumospee_small tags: - Speech - Video --- # Mumospee: A MUltiMOd
Hugging Face2024-11-19 更新130
meetween/mumospee_gigaspeech
该数据集是gigaspeech语料库的修改版本,已转换为parquet格式,以便在高性能和分布式计算环境中优化I/O操作。GigaSpeech是一个不断发展的多领域英语语音识别语料库,包含10,000小时的高质量标注音频,适用于监督训练。转录的音频数据收集自有声读物、播客和YouTube,涵盖朗读和自发说话风格,以及多种主题,如艺术、科学、体育等。
Hugging Face2026-06-29 更新40
meetween/mumospee_libritts
该数据集是LibriTTS语料库的衍生版本,已转换为更大的parquet文件,以在高性能计算集群上优化I/O性能。它保持了LibriTTS的高质量、多说话人、文本到语音对齐特性,包含超过585小时的英语有声读物录音和相应转录,适用于语音合成和TTS任务的大规模训练。数据集采用parquet文件格式,采样率为24 kHz,包含超过2400个独特说话人,男女声音平衡,总共有375,086个音频片段。
Hugging Face2026-06-30 更新140
meetween/mumospee_v1_fix
Mumospee是一个全面的多语言语音元数据语料库,支持Meetween项目实现跨虚拟环境的包容性、语言无关协作。该数据集提供了来自公开可用数据集的语音音频元数据和下载URL的精选集合,优化了高性能计算集群的处理。它包括140,084小时的语音元数据,涵盖53,983,241个样本,覆盖25种欧盟语言及其他语言,平均每个样本时长9.34秒,平均转录长度16.5个单词。数据集结构包含音频路径、URL
Hugging Face2026-06-08 更新50



