Chẩn đoán khoảng cách mô phỏng–thực tế trong phát hiện tin nhắn lừa đảo tiếng Việt bằng can thiệp đối chứng — mã nguồn, dữ liệu và minh chứng
收藏资源简介:
Gói tái lập đi kèm bài báo "Diagnosing the sim-to-real gap in Vietnamese smishing detection with controlled interventions". Nghiên cứu đo khoảng cách giữa hiệu năng trên benchmark tổng hợp và hành vi trên tin nhắn SMS thật, rồi phân rã nguyên nhân bằng năm can thiệp đối chứng phía huấn luyện, tổng cộng ba mươi lượt, mỗi can thiệp thay đổi đúng một biến thiết kế dữ liệu rồi chấm lại trên cùng tập mẫu. Gói này chứa: Bốn phiên bản ngữ liệu mô phỏng 1.077 mẫu (không dấu, có dấu, trộn quy ước, chuẩn hoá thực thể) kèm bộ sinh.Tập kiểm thử ngoài phân bố gồm 37 tin nhắn SMS thật đã ẩn danh, mỗi mẫu kèm source_url.Trọng số mô hình PhoBERT của hạt giống đại diện 42, cho phép tái lập trực tiếp Mục 5.4 và 5.5 mà không phải huấn luyện lại.Kết quả thô của bốn phiên thí nghiệm kèm log môi trường (GPU, phiên bản thư viện, mã băm dữ liệu đầu vào).Tám script đối chiếu số liệu: mỗi script đọc thẳng file kết quả gốc và so với từng con số in trong bản thảo, in TAT CA KHOP và trả mã thoát 0 khi khớp.Thủ tục đo chỉ số sàng lọc benchmark R = G/C, dùng lại được cho ngữ liệu khác. Lưu ý về giấy phép: mã nguồn theo MIT, dữ liệu và kết quả theo CC BY 4.0. Riêng hai file tập kiểm thử thật chứa nội dung trích từ nguồn công khai của bên thứ ba — xem file LICENSE mục 3 trước khi sử dụng lại.



