MasriSpeech
收藏资源简介:
MasriSpeech是一个大型埃及阿拉伯语(Masri)语音数据集,旨在为自动语音识别(ASR)、文本到语音(TTS)和方言NLP研究提供支持。该数据集包含超过50,000条埃及阿拉伯语语音样本,并带有高质量的转录和注释,支持阿拉伯语音技术的研究。
MasriSpeech is a large-scale Egyptian Arabic (Masri) speech dataset designed to support research in automatic speech recognition (ASR), text-to-speech (TTS), and dialectal natural language processing (NLP). The dataset contains over 50,000 Egyptian Arabic speech samples paired with high-quality transcriptions and annotations, which facilitates research on Arabic speech technology.
MasriSpeech: 埃及阿拉伯语语音数据集概述
数据集基本信息
- 名称: MasriSpeech
- 类型: 音频数据集
- 任务类别: 自动语音识别(ASR)、文本转语音(TTS)
- 语言: 埃及阿拉伯语(ar, arz)
- 格式: Parquet
- 标签: 埃及阿拉伯语、阿拉伯语、方言、语音识别、ASR、音频、NLP、口语阿拉伯语、会话、低资源
- 许可证: Apache-2.0
- 多语言性: 单语
- 源数据集: 原创
- 规模: 100K<n<1M
- 模态: 音频、文本
数据集描述
MasriSpeech是一个大规模埃及阿拉伯语(Masri)语音数据集,专为自动语音识别(ASR)、文本转语音(TTS)和方言NLP设计。包含超过50,000条高质量转录和标注的埃及阿拉伯语语音,支持阿拉伯语音技术研究。
数据集结构
- 总样本量: 50,715(训练集), 2,199(适配集)
- 采样率: 16 kHz
- 格式: WAV音频 + CSV元数据
- 标注: 转录文本、说话人ID、性别(如可用)
文件结构
train.csv: 训练集元数据adapt.csv: 适配集元数据train/: 训练音频文件adapt/: 适配音频文件
数据统计
| 集 | 样本数 | 小时数 | 说话人 | 性别(M/F) | 平均时长(s) | 平均词数 | 空转录 | 非阿拉伯语 |
|---|---|---|---|---|---|---|---|---|
| 训练集 | 50,715 | N/A | N/A | N/A | N/A | 13.34 | 6 | 13 |
| 适配集 | 2,199 | N/A | N/A | N/A | N/A | 9.60 | 0 | 1 |
显著发现
训练集
- 最常见单词: في, و, أنا, يعني, من
- 最常见双词组合: (إن, أنا), (و, لا), (زي, ما)
- 转录质量: 空转录6条,非阿拉伯语转录13条
适配集
- 最常见单词: في, أنا, يا, اللي
- 最常见双词组合: (شاء, الله), (إن, شاء), (يا, جماعه)
- 转录质量: 非阿拉伯语转录1条
使用场景
- 埃及阿拉伯语ASR模型训练和评估
- 领域适配和迁移学习
- 埃及方言语言学研究
- 语音助手、转录工具开发
引用
bibtex @misc{masrispeech, title={MasriSpeech: Egyptian Arabic Speech Corpus}, author={Yahya Muhammad Alnwsany}, year={2024}, url={https://huggingface.co/datasets/NightPrince/MasriSpeech} }
许可证
Apache-2.0




