遇见数据集

Korpus Paralel Dwibahasa Indonesia–Minang: Dataset Terjemahan Kalimat Lintas Domain

收藏
Zenodo2026-09-06 更新2026-10-01 收录
官方服务:

资源简介:

Korpus paralel dwibahasa yang dirancang secara sistematis untuk mendukung kajian linguistik, penerjemahan berbasis mesin (machine translation), serta pemrosesan bahasa alami (Natural Language Processing / NLP) antara bahasa Indonesia dan bahasa Minang. Dokumen ini merekam korpus teks paralel berskala menengah dengan total entri data valid sebanyak 4.000 pasang kalimat lintas domain. Diorganisasikan ke dalam format tabel empat kolom dengan rincian variabel sebagai berikut: Kolom Indeks ( ): Memuat nomor urut entri data dari baris pertama hingga baris ke-4.000, yang berfungsi sebagai pengenal unik (identifier) untuk setiap pasangan kalimat. Kolom Sumber (Kalimat Bahasa Indonesia): Berisi korpus kalimat rujukan dalam bahasa Indonesia baku maupun semi-formal yang mencakup beragam topik, mulai dari geografi, sejarah, biografi, hingga konteks sosial-budaya modern. Kolom Sasaran (Translasi): Menyajikan hasil terjemahan paralel dari kalimat bahasa Indonesia tersebut ke dalam padanan bahasa Minang yang gramatikal dan kontekstual. Kolom Validasi (Unnamed: 3): Memuat catatan validasi tambahan atau teks pembanding.

提供机构:
Zenodo
创建时间:
2026-09-06
二维码
社区交流群
二维码
科研交流群
商业服务