相关数据集
quranic-universal-ayahs
Qur'anic Universal Ayahs 数据集是一个包含古兰经经文(ayah)的音频数据集,具有从音素级强制对齐中提取的精确时间戳。数据集包含300多位诵经者的录音,涵盖14种不同的诵读方式(riwayat)。每个数据行代表一节经文,包含以下内容:修剪至语音边界的音频片段、以毫秒为单位的单词级时间戳(相对于音频片段)、基于停顿的分段(显示诵经时自然停顿的分割)、以及对齐匹配的阿拉伯文本(
Hugging Face2026-04-02 更新160
dev-ahmedhany/quran-wbw-audio
该数据集名为“Quran Word-by-Word Audio (Alafasy)”,包含古兰经中每个Uthmani单词的逐词音频,由Sheikh Mishary Rashid Alafasy录制,总计约77,433个条目。数据经过跨CDN审核,对比了`audio.qurancdn.com/wbw/`和`resources.surahpedia.com/Word_by-Word/`两个来源,当哈希
Hugging Face2026-05-26 更新30
abosalah/filtered_dataset_Quran_recitations_30_seconds_or_less
该数据集包含13,999个训练示例,每个示例由音频文件(采样率为16000Hz)、朗读者信息、对应文本和音频时长组成。音频特征以音频格式存储,朗读者和文本为字符串类型,时长为浮点数。数据集总大小约为2.5GB,下载大小约为2.47GB,适用于语音处理或文本-音频对齐任务,但具体应用领域未在README中明确描述。
Hugging Face2026-05-29 更新20
zaibihassan/Quranic-Word-By-Word-Audio-Data
《古兰经》逐词音频数据集(Muallim 和 Mujawwad)是一个包含《古兰经》两种完整逐词诵读风格的数据集,专为边缘交付、移动流媒体和机器学习管道优化。数据集包括:1. Muallim(教师风格):针对慢速、教育和可重复聆听优化;2. Mujawwad(塔吉威德风格):针对具有完整塔吉威德流程的自然节奏诵读优化。原始音频大小约为2.0-2.3GB,通过优化的OPUS工作流重新编码,压缩至约4
Hugging Face2026-05-23 更新40
dev-ahmedhany/everyayah-wav
everyayah-wav是一个古兰经朗诵音频数据集,作为古兰经朗诵音频的镜像资源。它包含完整的古兰经朗诵音频,以16 kHz单声道16位WAV格式重新编码,源自everyayah.com,专为机器学习和自动语音识别研究设计。该数据集仅包含音频数据,无转录文本或对齐时间戳,用户可结合广泛可用的古兰经文本(如Tanzil)使用。数据集包含约44位不同朗诵者(如AbdulBaset_Murattal、
Hugging Face2026-05-30 更新20



