Korpus Paralel Dwibahasa Indonesia–Minang: Dataset Terjemahan Kalimat Lintas Domain
收藏资源简介:
Korpus paralel dwibahasa yang dirancang secara sistematis untuk mendukung kajian linguistik, penerjemahan berbasis mesin (machine translation), serta pemrosesan bahasa alami (Natural Language Processing / NLP) antara bahasa Indonesia dan bahasa Minang. Dokumen ini merekam korpus teks paralel berskala menengah dengan total entri data valid sebanyak 4.000 pasang kalimat lintas domain. Diorganisasikan ke dalam format tabel empat kolom dengan rincian variabel sebagai berikut: Kolom Indeks ( ): Memuat nomor urut entri data dari baris pertama hingga baris ke-4.000, yang berfungsi sebagai pengenal unik (identifier) untuk setiap pasangan kalimat. Kolom Sumber (Kalimat Bahasa Indonesia): Berisi korpus kalimat rujukan dalam bahasa Indonesia baku maupun semi-formal yang mencakup beragam topik, mulai dari geografi, sejarah, biografi, hingga konteks sosial-budaya modern. Kolom Sasaran (Translasi): Menyajikan hasil terjemahan paralel dari kalimat bahasa Indonesia tersebut ke dalam padanan bahasa Minang yang gramatikal dan kontekstual. Kolom Validasi (Unnamed: 3): Memuat catatan validasi tambahan atau teks pembanding.



