遇见数据集

Dataset: Komparasi BM25 dan TF-IDF pada Corpus Abstrak Akademik Ilmu Komputer Berbahasa Indonesia

收藏
Zenodo2026-06-27 更新2026-06-28 收录
官方服务:

资源简介:

Dataset penelitian untuk eksperimen komparasi algoritma BM25 dan TF-IDFdalam sistem temu kembali informasi (information retrieval). Isi dataset:- documents/ : 20 abstrak dokumen akademik ilmu komputer dan sistem informasi berbahasa Indonesia (format .txt, UTF-8). Panjang 157-352 kata, rata-rata 228 kata, tiga kelompok: pendek (doc_001-007), sedang (doc_008-014), panjang (doc_015-020).- data/queries.json : 5 query pencarian dalam bahasa Indonesia.- data/qrels.json : Relevance judgment graded (grade 0/1/2) untuk 100 pasangan query-dokumen, dikonstruksi secara manual.- src/ : Implementasi TF-IDF dan BM25 dari scratch dalam Python 3.13 (tanpa sklearn), beserta modul preprocessing, evaluasi, dan visualisasi. Dataset ini digunakan dalam paper: "Komparasi Algoritma BM25 dan TF-IDFdalam Penentuan Relevansi Dokumen Akademik" (JANAPATI, 2025).

提供机构:
Zenodo
创建时间:
2026-06-27
二维码
社区交流群
二维码
科研交流群
商业服务