Yehor/voa-uk-transcriptions
收藏官方服务:
资源简介:
--- language: - uk license: cc-by-4.0 --- This repository contains transcriptions with other metadata for the VOA Ukrainian dataset (~398h). Usage: ```python from datasets import load_dataset ds = load_dataset('Yehor/voa-uk-transcriptions', split='train') for row in ds: print(row['text']) ```
--- language: - 乌克兰语(uk) license: CC BY 4.0(知识共享署名4.0国际许可协议) --- 本仓库收录了美国之音(VOA)乌克兰语数据集(时长约398小时)的转录文本及其他元数据。 使用方法: python from datasets import load_dataset ds = load_dataset('Yehor/voa-uk-transcriptions', split='train') for row in ds: print(row['text'])
提供机构:
Yehor原始信息汇总
数据集概述
数据集名称
- 名称: VOA Ukrainian Transcriptions
数据集内容
- 描述: 包含约398小时VOA乌克兰语数据集的转录文本及其他元数据。
数据集使用示例
python from datasets import load_dataset
ds = load_dataset(Yehor/voa-uk-transcriptions, split=train)
for row in ds: print(row[text])
数据集语言
- 语言: 乌克兰语
数据集许可证
- 许可证: CC-BY-4.0
搜集汇总
数据集介绍

背景与挑战
背景概述
该数据集是一个用于自动语音识别任务的乌克兰语语音转录数据集,基于VOA乌克兰数据集构建,包含约398小时的音频转录和元数据。数据集采用CC BY 4.0许可证,并已用于训练多个语音识别模型,如w2v-bert-uk-v2.1系列。
以上内容由遇见数据集搜集并总结生成



