遇见数据集

BanglaPSG: A Bangla Public Service Grievance Dataset for Category and Severity Classification

收藏
Mendeley Data2026-08-09 收录
官方服务:

资源简介:

This dataset, BanglaPSG, contains 6,105 manually annotated Bangla public service grievance texts collected from publicly available social media platforms in Bangladesh, including Facebook, YouTube, Instagram, Reddit, and other online sources. Each grievance is labeled with one of six public service categories (Food, Road & Transport, Water, Waste, Electricity, and Healthcare) and one of three severity levels (Low, Medium, High). The dataset was collected between December 2025 and June 2026, cleaned, anonymized, and annotated by native Bangla speakers following predefined annotation guidelines. BanglaPSG is designed to support research in Natural Language Processing (NLP), text classification, public grievance analysis, civic computing, and smart governance. It also includes benchmark-ready annotations for category and severity classification tasks, making it a valuable resource for developing and evaluating machine learning and deep learning models for low-resource Bangla language processing.

本数据集为BanglaPSG,包含6105条经人工标注的孟加拉语公共服务投诉文本。这些文本采集自孟加拉国境内的公开社交媒体平台及其他在线资源,涵盖Facebook、YouTube、Instagram、Reddit等平台。每条投诉文本均被标注至六大公共服务类别之一,分别为食品、道路与交通、供水、垃圾处理、电力及医疗保健,同时对应低、中、高三个严重程度等级之一。该数据集采集于2025年12月至2026年6月期间,经孟加拉语母语使用者依照预设标注规范完成清洗、匿名化与标注工作。BanglaPSG旨在支撑自然语言处理(Natural Language Processing, NLP)、文本分类、公共投诉分析、公民计算以及智能治理领域的研究。其还配备了可直接用于基准测试的类别与严重程度分类任务标注集,可作为开发与评估面向低资源孟加拉语处理的机器学习、深度学习模型的宝贵资源。

创建时间:
2026-07-21
二维码
社区交流群
二维码
科研交流群
商业服务