Titung/seke-nepali-dataset
收藏资源简介:
Seke(SKJ)语言数据集是一个关于濒危语言的音频语料库,主要收集了尼泊尔上木斯塘地区及纽约市散居社区中约700人使用的Sino-Tibetan语系濒危语言Seke的录音。数据集包含529个音频片段,总时长为17.8分钟,涉及2名说话者。音频格式为16kHz单声道WAV文件,并附有英语翻译、音标、语法类别等标注信息。数据集分为A、B、C三个质量等级,分别代表不同的录音质量和环境。该数据集旨在支持Seke语言的保护和学术研究,强调伦理使用和语言保护的重要性。
The Seke (SKJ) Language Dataset is an audio corpus of a critically endangered Sino-Tibetan language spoken by approximately 700 people in Upper Mustang, Nepal, and NYC diaspora communities. It includes 529 audio clips totaling 17.8 minutes, featuring 2 speakers. The audio is in 16kHz mono WAV format, accompanied by annotations such as English translations, IPA phonemes, and grammatical categories. The dataset is categorized into three quality tiers (A, B, C) based on recording conditions. It is intended for language preservation and academic research, with a strong emphasis on ethical use and community support.




