相关数据集
hf-audio/asr-leaderboard-longform
该数据集名为ASR Leaderboard: Longform Test Sets,包含三个长格式自动语音识别(ASR)基准测试集:Earnings-21、Earnings-22和TED-LIUM。这些数据集用于评估在现实条件下(如长时间音频片段、重叠说话人和特定领域语言)的长格式ASR模型性能。数据集以标准化的Parquet格式提供,包含音频、文本以及根据数据集不同而异的额外元数据。README
Hugging Face2026-06-11 更新330
M2LabOrg/jwlang
JWLang Corpus是一个多语言的音频和文本数据集,源自jw.org网站上的JW Broadcasting视频,用于训练和微调自动语音识别(ASR)模型,特别是OpenAI Whisper。数据集存储在Hugging Face上,采用Parquet格式,原始音频文件为MP3格式,对应文本文件。该数据集适用于训练、验证和测试ASR模型,数据下载于2024年6月。
Hugging Face2024-06-24 更新170
polish_presidential_debate
波兰总统辩论自动语音识别数据集,包含13位候选人在辩论中的15个音频样本,每个音频样本都有对应的文本字幕。数据集适用于自动语音识别任务,特别是针对波兰语言在政治领域的应用。
Hugging Face2025-05-28 更新80
farsi-asr/farsi-asr-dataset
Farsi ASR Dataset是最大的开源波斯语自动语音识别(ASR)数据集,从各种来源收集而成。该数据集包含了大量的波斯语音频转录数据,用于自动语音识别研究。
Hugging Face2025-03-13 更新190
Donate Speech Corpus: Training data (100h)
This resource is available for download in Kielipankki - The Language Bank of Finland as part of "Donate Speech: Selected dataset", http://urn.fi/urn:nbn:fi:lb-2022060127. The resource contains a subs
Mendeley Data2024-01-31 更新160



