相关数据集
hf-audio/asr-leaderboard-longform
该数据集名为ASR Leaderboard: Longform Test Sets,包含三个长格式自动语音识别(ASR)基准测试集:Earnings-21、Earnings-22和TED-LIUM。这些数据集用于评估在现实条件下(如长时间音频片段、重叠说话人和特定领域语言)的长格式ASR模型性能。数据集以标准化的Parquet格式提供,包含音频、文本以及根据数据集不同而异的额外元数据。README
Hugging Face2026-06-11 更新330
M2LabOrg/jwlang
JWLang Corpus是一个多语言的音频和文本数据集,源自jw.org网站上的JW Broadcasting视频,用于训练和微调自动语音识别(ASR)模型,特别是OpenAI Whisper。数据集存储在Hugging Face上,采用Parquet格式,原始音频文件为MP3格式,对应文本文件。该数据集适用于训练、验证和测试ASR模型,数据下载于2024年6月。
Hugging Face2024-06-24 更新170
thinhkosay/asr-test-new
该数据集包含音频数据和对应的文本转录,主要用于测试目的。数据集仅包含一个测试集,共有3个样本,总大小为255283字节。
Hugging Face2024-04-26 更新80
farsi-asr/farsi-asr-dataset
Farsi ASR Dataset是最大的开源波斯语自动语音识别(ASR)数据集,从各种来源收集而成。该数据集包含了大量的波斯语音频转录数据,用于自动语音识别研究。
Hugging Face2025-03-13 更新190
Arabic Call Benchmark Dataset
Arabic Call Benchmark Dataset是由Maqsam公司创建的一个专注于阿拉伯语电话通话自动语音识别(ASR)的基准数据集。该数据集包含来自13个不同国家的电话通话记录,涵盖教育、娱乐和电子商务等多个领域,特别关注客户支持和销售职位。数据集标准化为16kHz采样率,单声道,16位精度,包含从清晰到嘈杂环境的不同音频质量。通过41名注释者和13名审阅者的严格手工转录,形成了13
arXiv2024-03-07 更新110



