s512757/polish-tedx-asr-eval
收藏资源简介:
Polish-TEDx-ASR-Eval是一个用于评估波兰语自动语音识别(ASR)系统的数据集,专注于TEDx公共演讲领域。该数据集包含来自YouTube的波兰语TEDx演讲音频片段(采用CC BY-NC-ND 4.0许可证)和使用KugelAudio(MIT许可证)生成的合成语音,所有音频均带有手动创建和交叉验证的转录。数据集由5名注释者独立工作,并经过交叉验证以确保准确性。统计信息显示,总共有428个音频片段,总时长约4011秒(约67分钟),其中378个片段来自YouTube,50个片段来自文本到语音合成。音频特征包括16 kHz单声道WAV格式,涵盖自发性和计划性公共演讲以及合成语音,声学环境包括会议厅/剧院厅、混响和观众反应。数据集是在“Workshops on Evaluation of Speech Recognition Systems”(ZWESUI, AMU 2026)课程中由第一组创建的,旨在支持ASR系统的评估和开发。
A dataset for evaluating automatic speech recognition (ASR) systems for Polish in the domain of TEDx public talks. Contains audio segments from Polish TEDx talks available on YouTube (CC BY-NC-ND 4.0) and synthetic speech generated with KugelAudio (MIT), with manually created and cross-verified transcriptions. Created as part of the course Workshops on Evaluation of Speech Recognition Systems (ZWESUI, AMU 2026) by Group 1.




