遇见数据集

Tengger–Indonesian Digital Corpus: A Lexical Dataset for Local Language Revitalization and NLP Development

收藏
Zenodo2026-05-12 更新2026-05-26 收录
官方服务:

资源简介:

Dataset ini merupakan korpus digital Bahasa Tengger–Indonesia yang memuat kosakata, padanan Bahasa Indonesia, kategori linguistik, serta keterangan budaya yang berkaitan dengan masyarakat Tengger di kawasan Wonokitri, Bromo, Kabupaten Pasuruan, Jawa Timur. Dataset disusun sebagai bagian dari upaya dokumentasi, revitalisasi, dan saintifikasi bahasa daerah melalui pendekatan etnolinguistik dan Natural Language Processing (NLP). Korpus ini dirancang untuk mendukung penelitian bahasa daerah, pengembangan model penerjemahan otomatis Tengger–Indonesia, pengembangan sistem NLP untuk bahasa sumber daya rendah (low-resource language), serta pelestarian Objek Pemajuan Kebudayaan (OPK) masyarakat Tengger. Data dikurasi dari sumber ilmiah, referensi kebahasaan, dokumentasi struktur Bahasa Jawa Dialek Tengger, serta pengayaan berbasis konteks sosial-budaya masyarakat Tengger. Dataset ini dapat digunakan untuk penelitian linguistik, digital humanities, machine translation, kamus digital, pendidikan bahasa daerah, dan pengembangan teknologi bahasa lokal Indonesia.

提供机构:
Zenodo
创建时间:
2026-05-12
二维码
社区交流群
二维码
科研交流群
商业服务