相关数据集
GRDD: A Dataset for Greek Dialectal NLP
GRDD数据集由克里特大学创建,旨在为现代希腊方言的自然语言处理提供资源。该数据集包含来自四种现代希腊方言(克里特、庞蒂克、北部希腊和塞浦路斯希腊)的原始文本数据,总计约230万字,尽管存在不平衡。数据集的创建过程涉及从互联网上自由获取的方言数据,包括博客、网站和文学文本,并进行了基本的预处理。该数据集主要用于方言识别任务,展示了即使是简单的机器学习模型也能有效区分这些方言。
arXiv2023-11-25 更新460
farsi-asr/farsi-asr-dataset
Farsi ASR Dataset是最大的开源波斯语自动语音识别(ASR)数据集,从各种来源收集而成。该数据集包含了大量的波斯语音频转录数据,用于自动语音识别研究。
Hugging Face2025-03-13 更新190
asas-ai/DART
DART数据集是一个用于文本分类任务的数据集,特别关注方言识别。数据集包含阿拉伯语的推文文本和对应的标签,分为训练集和测试集。训练集包含1323个样本,测试集包含500个样本。数据集的总大小为267723字节,下载大小为162379字节。
Hugging Face2024-05-13 更新130
hf-audio/asr-leaderboard-longform
该数据集名为ASR Leaderboard: Longform Test Sets,包含三个长格式自动语音识别(ASR)基准测试集:Earnings-21、Earnings-22和TED-LIUM。这些数据集用于评估在现实条件下(如长时间音频片段、重叠说话人和特定领域语言)的长格式ASR模型性能。数据集以标准化的Parquet格式提供,包含音频、文本以及根据数据集不同而异的额外元数据。README
Hugging Face2026-06-11 更新330
M2LabOrg/jwlang
JWLang Corpus是一个多语言的音频和文本数据集,源自jw.org网站上的JW Broadcasting视频,用于训练和微调自动语音识别(ASR)模型,特别是OpenAI Whisper。数据集存储在Hugging Face上,采用Parquet格式,原始音频文件为MP3格式,对应文本文件。该数据集适用于训练、验证和测试ASR模型,数据下载于2024年6月。
Hugging Face2024-06-24 更新170



