polish_presidential_debate
收藏资源简介:
波兰总统辩论自动语音识别数据集,包含13位候选人在辩论中的15个音频样本,每个音频样本都有对应的文本字幕。数据集适用于自动语音识别任务,特别是针对波兰语言在政治领域的应用。
Polish Presidential ASR Dataset 数据集概述
基本信息
- 许可证: Apache-2.0
- 任务类别: 自动语音识别 (Automatic Speech Recognition)
- 语言: 波兰语 (pl)
- 标签: 政治 (politics)
- 数据集名称: Polish Presidential ASR Dataset
- 规模类别: n<1K
数据来源
- 来源: DEBATA PREZYDENCKA TVP | 12.05.2025
- 链接: https://www.youtube.com/watch?v=bvlzQvdgqLU
数据集描述
- 内容: 13位波兰总统辩论候选人的录音,每位候选人提供15个音频样本(朗读或即兴)。
- 音频格式: 16 kHz WAV格式。
- 用途: 专为自动语音识别(ASR)任务设计,特别适用于波兰语政治领域的语音处理。
文件结构
text ├── README.md ├── audio/ │ └── pl/ │ └── <NN-name>/ │ ├── <name>_0.wav │ ├── <name>_1.wav │ └── … (15 files per speaker) └── transcript/ └── pl/ └── test.tsv
- 说明: 每个发言者文件夹以两位数字前缀和发言者标识符命名(例如
01-bartoszewicz_artur)。
元数据 (test.tsv)
- TSV 表头:
path: 音频文件的相对路径sentence: 口语文本age: 发言者年龄gender: 发言者性别locale: 录音地点(例如 "studio")speech_type: 语音类型(例如 "read" 或 "spontaneous")source: 音频来源(例如 "youtube")
使用方法
-
加载数据集: python from datasets import load_dataset ds = load_dataset("directtt/polish_presidential_debate", split="test") print(ds[0])
-
流式加载: python from datasets import load_dataset ds = load_dataset("directtt/polish_presidential_debate", split="test", streaming=True) print(next(iter(ds)))
引用
bibtex @misc{polish_presidential_debate, title = {Polish Presidential Debate ASR Dataset}, author = {Dudek Marcel, Jerzykiewicz Sebastian, Rybczyński Jędrzej, Solarski Antoni}, year = {2025} }




