Dataset: Komparasi BM25 dan TF-IDF pada Corpus Abstrak Akademik Ilmu Komputer Berbahasa Indonesia
收藏资源简介:
Dataset penelitian untuk eksperimen komparasi algoritma BM25 dan TF-IDFdalam sistem temu kembali informasi (information retrieval). Isi dataset:- documents/ : 20 abstrak dokumen akademik ilmu komputer dan sistem informasi berbahasa Indonesia (format .txt, UTF-8). Panjang 157-352 kata, rata-rata 228 kata, tiga kelompok: pendek (doc_001-007), sedang (doc_008-014), panjang (doc_015-020).- data/queries.json : 5 query pencarian dalam bahasa Indonesia.- data/qrels.json : Relevance judgment graded (grade 0/1/2) untuk 100 pasangan query-dokumen, dikonstruksi secara manual.- src/ : Implementasi TF-IDF dan BM25 dari scratch dalam Python 3.13 (tanpa sklearn), beserta modul preprocessing, evaluasi, dan visualisasi. Dataset ini digunakan dalam paper: "Komparasi Algoritma BM25 dan TF-IDFdalam Penentuan Relevansi Dokumen Akademik" (JANAPATI, 2025).



