遇见数据集

quran_nemotron_dual_v5_npl

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集名为 Quran Nemotron Dual V5 Assets,是用于阿拉伯语古兰经(Hafs 诵读风格)双输出训练管线的重现性资产。数据集包含两个独立存储的目标:声学 RNNT 目标和基于 Quran-Lab 的 `tj1` 音素 CTC 目标,分别用于不同的训练任务。数据集中每个样本都记录了其来源仓库和固定修订版本,以确保可追溯性。数据集遵循 NPL-1.1(非营利/共享许可)及源特定许可条款。`bootstrap_v4` 目录包含经过验证、说话人无重叠的 v4 语料库(已转换为 Schema 版本 5)。电话录音及其他新增数据源仅在通过访问、许可、去重和泄漏检测后的安全条件下发布。评估基准音频从不包含在训练分片中,以保证评估的公正性。

This dataset is named Quran Nemotron Dual V5 Assets, which is a reproducible asset for dual output training pipeline of the Arabic Quran (Hafs recitation style). It contains two independently stored targets: acoustic RNNT targets and tj1 phoneme CTC targets based on Quran-Lab, for different training tasks. Each sample records its source repository and fixed revision for traceability. The dataset is licensed under NPL-1.1 (Non-Profit/Share Alike) and source-specific licenses. The bootstrap_v4 directory contains a validated, speaker-disjoint v4 corpus (converted to Schema version 5). Telephone recordings and other additional data sources are only released under security conditions after access, licensing, deduplication, and leakage detection. Evaluation benchmark audio is never included in training splits to ensure unbiased evaluation.

创建时间:
2026-08-18
原始信息汇总

数据集概述

该数据集为《古兰经》尼莫创双输出模型的复现资产,专注于阿拉伯语哈夫斯(Hafs)古兰经的语音训练流水线。

核心内容

  • 双输出目标:包含基于声学 RNNT 的预测目标和基于古兰经实验室 tj1 音素 CTC 的预测目标,两者独立存储。
  • 数据来源:每条数据记录均包含源仓库及固定的修订版本号,不授予源录音的新许可,需遵循源特定条款及古兰经实验室 NPL-1.1 非营利/共享署名限制。
  • 数据版本bootstrap_v4 目录为经过验证的说话人分离 v4 语料库,已转换为 schema 版本 5。新增的电话录音等数据仅在访问、许可、去重和泄漏检查通过后发布。
  • 评估安全:评估基准音频从不包含在训练分片(shards)中。
搜集汇总
数据集介绍
quran_nemotron_dual_v5_npl 数据集图片
构建方式
该数据集作为阿拉伯语哈夫斯古兰经诵读双输出训练流程的可复现性资产,精心构建了声学RNNT目标与Quran-Lab `tj1`音素CTC目标两套独立标注体系。每一数据行均携带其来源仓库与固定修订版本,确保了数据溯源透明度。构建流程历经严格的门控验证,涵盖访问权限、许可合规、去重与防泄漏等环节,语音录音等新增来源仅在通过全部校验后发布。评估基准音频被严格排除在训练分片之外,保证了数据集的纯净性与评估的公正性。
特点
数据集的核心特点在于其双目标架构与严格的知识产权管理。声学与音素双标签设计支持了多任务学习,提升了模型对古兰经诵读的细粒度表征能力。来源特定条款与NPL-1.1非盈利/共享限制的延续,彰显了对原始录音版权的尊重。speaker-disjoint的v4语料库经过schema ver5转换,确保了说话人独立性,降低了过拟合风险。固定修订版本的记录机制,为研究可重复性与数据版本追溯提供了坚实基础。
使用方法
使用此数据集时,研究者需严格遵守NPL-1.1及来源特定许可条款,特别关注非商业用途与分享约束。数据以bootstrap_v4目录提供,适用于训练阿拉伯语语音识别或诵读对齐模型,尤其适合采用RNNT与CTC混合解码策略的架构。建议将训练数据与评估分片严格分离,以确保基准结果的可比性。数据加载时需解析每行的来源与修订信息,以利合规审查与实验记录。对于涉及多重来源的整合使用,应优先进行许可兼容性验证,避免法律风险。
背景与挑战
背景概述
古兰经语音识别作为阿拉伯语自然语言处理的重要分支,其研究长期受限于高质量、多层级标注数据的稀缺。该数据集由Quran-Lab团队于近期创建,旨在突破这一瓶颈,专注于Hafs诵读风格的阿拉伯语音系建模。其核心研究问题在于构建一个双输出的语音识别训练管线,同时优化声学RNNT目标与基于`tj1`音素标签的CTC目标,以捕捉古兰经诵读中细微的发音差异。数据集严格遵循源录音的许可协议,并强调说话人分离、去重及泄漏门控,保障了数据纯净性与可复现性。这一资产为阿拉伯语语音识别及宗教文本语音处理领域提供了标准化基准,对推动低资源语言语音技术具有重要影响力。
当前挑战
该数据集面临的挑战是多维度的。在领域层面,古兰经识别需解决古典阿拉伯语中复杂的音位系统、长时依赖的韵律特征及变体诵读声学差异,超越了一般现代标准阿拉伯语的技术难题。在构建过程中,挑战尤为艰巨:需要从多个源仓库收集录音,并逐一核对许可证与修订版本,确保符合NPL-1.1非商业用途及分享一致条款;实现说话人无关的验证与去重,防止训练与评估集间的数据泄漏;同时,需平衡稀疏的语音资源与严格的门控流程,直至全部通过才能发布新增数据。此外,双目标标注(RNNT与CTC)的独立存储要求精细的同步与规范性,而确保评估基准音频绝不混入训练分片,更是对数据管理流程的极致考验。
常用场景
经典使用场景
该数据集为阿拉伯语《古兰经》诵读语音识别与语音合成研究提供了高质量的双语标签训练资源。其经典使用场景聚焦于构建Hafs风格诵经语音的声学模型,特别是融合RNNT与CTC的多任务学习框架。研究者可借助其独立存储的声学RNNT目标与基于Quran-Lab tj1音素的CTC目标,开展端到端语音识别、音素级对齐及韵律建模等实验,以提升对古典阿拉伯语语音的识别精度与鲁棒性。
实际应用
在实际应用中,该数据集可支撑开发面向《古兰经》学习者的智能辅助工具,如实时语音纠错、诵读评分系统及个性化跟读学习平台。同时,它也可赋能清真寺文化语音助手、无障碍阅读系统及教育软件,实现自动化吟诵质检与语音导航。源于其非营利共享的限制,其应用场景多集中于教育公益与文化传承领域,助力阿拉伯语语音技术的人文落地。
衍生相关工作
该数据集的复现资产催生了多类延伸研究,如基于v4语料库的跨版本迁移学习、多源数据融合下的鲁棒特征提取,以及针对长时音频的韵律与停顿预测。其双目标结构启发了联合优化RNNT与CTC的混合架构创新,以及说话人分离与语音增强的预处理工作。间接地,其授权管理策略亦成为数据合规研究中的经典案例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务