kencorpus_sw_culture
收藏资源简介:
KenCorpus Swahili Culture Subset 是从 KenCorpus_audio 数据集中筛选出的子集,仅包含语言为斯瓦希里语(Swahili)且类型为文化(Culture)的音频片段,共37个片段。音频文件存放于 audio/ 目录下,索引文件 kencorpus_sw_culture.jsonl 记录了每个片段的文件路径和时长,数据布局遵循 DailyTalkContiguous 格式。该数据集适用于斯瓦希里语文化相关的音频处理、语音识别、文化研究等任务。
KenCorpus Swahili Culture Subset is a subset filtered from the KenCorpus_audio dataset, containing only audio clips in Swahili language and of type Culture, totaling 37 clips. The audio files are stored in the audio/ directory, and the index file kencorpus_sw_culture.jsonl records the file path and duration of each clip. The data layout follows the DailyTalkContiguous format. This dataset is suitable for tasks such as audio processing, speech recognition, and cultural research related to Swahili culture.
KenCorpus 斯瓦希里语文化子集
数据集概述
该数据集是 Kencorpus/KenCorpus_audio 的筛选子集,仅包含 语言=斯瓦希里语(Swahili) 且 体裁=文化(Culture) 的音频片段,共计 37 个音频片段。
数据内容
- 语言:斯瓦希里语(Kiswahili)
- 领域/体裁:文化(Culture)
- 音频格式:音频文件存放在
audio/目录下
文件结构
- 索引文件:
kencorpus_sw_culture.jsonl,每条记录包含path(音频路径)和duration(音频时长)字段,遵循 kyutai/DailyTalkContiguous 的数据布局格式。
许可证
- CC-BY-4.0(知识共享署名 4.0 国际许可协议)




