Kiuyha/surabaya-ner-dataset
收藏资源简介:
--- dataset_info: features: - name: text dtype: string - name: label list: - name: end dtype: int64 - name: label dtype: string - name: start dtype: int64 splits: - name: train num_bytes: 1935486.6313549015 num_examples: 6577 - name: validation num_bytes: 241899.04378496716 num_examples: 822 - name: test num_bytes: 242193.32486013137 num_examples: 823 download_size: 1397404 dataset_size: 2419579 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* license: apache-2.0 task_categories: - text-classification language: - id size_categories: - 1K<n<10K --- # Surabaya Opinion & Complaint NER Dataset ## Dataset Description This dataset contains labeled Named Entity Recognition (NER) data focusing on public opinions, complaints, and social issues in Surabaya, Indonesia. The data was scraped from social media platforms (Nitter/X and Reddit) and manually labeled for entities relevant to city administration and public sentiment analysis. ## Dataset Details - **Language:** Indonesian (id) - **License:** Apache-2.0 - **Task:** Token Classification (NER) - **Tags:** ner, surabaya, social-media, complaints - **Size:** 1K < n < 10K samples ## Dataset Statistics The dataset is split into three parts: | Split | Count | |-------|-------| | Train | 6,577 | | Validation | 822 | | Test | 823 | | **Total** | **8,222** | ## Data Collection The data was collected using specific keyword queries targeting common urban issues in Surabaya, such as traffic, flooding, public services, and crime. The source text includes informal Indonesian, Suroboyoan slang, and mixed-language text common on social media. ### Scraping Configuration The following keywords and logic were used to gather the raw text from Nitter (X) and Reddit: #### Nitter (X) Queries 1. **General Complaints:** ``` (Surabaya OR Suroboyo) (keluhan OR lapor OR aduan OR masalah OR parah OR buruk OR mengecewakan OR sulit OR lambat OR tidak beres) lang:id -filter:retweets ``` 2. **Infrastructure & Traffic:** ``` (Surabaya OR Suroboyo) (macet OR jalanan rusak OR parkir liar OR angkot OR bemo OR "suroboyo bus" OR "traffic light" OR lampu merah OR trotoar) lang:id -filter:retweets ``` 3. **Utilities (Water/Power):** ``` (Surabaya OR Suroboyo) (PLN OR listrik padam OR mati lampu OR PDAM OR air mati OR air keruh OR tagihan bengkak) lang:id -filter:retweets ``` 4. **Flooding & Waste:** ``` (Surabaya OR Suroboyo) (banjir OR genangan OR sampah OR "bau tidak sedap" OR got mampet OR sungai kotor OR tumpukan sampah) lang:id -filter:retweets ``` 5. **Public Services:** ``` (@sapawargasby OR @banggasurabaya OR pemkot sby OR kelurahan OR kecamatan) (layanan OR pengurusan OR e-ktp OR kk OR izin OR respon lambat) lang:id -filter:retweets ``` 6. **Safety & Crime:** ``` (Surabaya OR Suroboyo) (aman OR tidak aman OR begal OR curanmor OR maling OR tawuran OR kejahatan OR gangster) lang:id -filter:retweets ``` 7. **Positive Feedback:** ``` (Surabaya OR Suroboyo) (terima kasih OR keren OR mantap OR bagus OR apresiasi OR cepat OR solutif OR membantu) (@pemkotsby OR @sapawargasby OR layanan) lang:id -filter:retweets ``` #### Reddit Queries 1. `surabaya traffic` 2. `surabaya flood` 3. `surabaya criminal` 4. `suroboyo` ## Usage You can load this dataset directly using the Hugging Face `datasets` library: ```python from datasets import load_dataset dataset = load_dataset("Kiuyha/surabaya-ner-dataset") print(dataset['train'][0]) ``` ## Use Cases - Named Entity Recognition model training for Indonesian social media text - Public sentiment analysis for city administration - Urban issue detection and classification - Social media monitoring for local government - Dialect-aware NLP research (Suroboyoan slang) ## Citation If you use this dataset in your research, please cite it appropriately and acknowledge the source. ## Contact For questions or issues regarding this dataset, please open an issue on the dataset repository page.
数据集信息: 特征字段: - 字段名:text 数据类型:字符串 - 字段名:label 嵌套字段: - 字段名:end 数据类型:64位整数 - 字段名:label 数据类型:字符串 - 字段名:start 数据类型:64位整数 数据集划分: - 划分名:训练集(train) 字节数:1935486.6313549015 样本数量:6577 - 划分名:验证集(validation) 字节数:241899.04378496716 样本数量:822 - 划分名:测试集(test) 字节数:242193.32486013137 样本数量:823 下载总大小:1397404 数据集总大小:2419579 配置项: - 配置名称:default 数据文件: - 划分:train 路径:data/train-* - 划分:validation 路径:data/validation-* - 划分:test 路径:data/test-* 许可证:Apache-2.0 任务类别: - 文本分类 语言: - id(印度尼西亚语) 样本规模分类: - 1K<n<10K # 泗水市舆情与投诉命名实体识别(Named Entity Recognition, NER)数据集 ## 数据集说明 本数据集包含标注完成的命名实体识别(NER)数据,聚焦印度尼西亚泗水市的公众舆情、投诉及社会议题。数据采集自社交媒体平台(Nitter/X与Reddit),并针对城市治理与公众情感分析相关实体开展人工标注工作。 ## 数据集详情 - **语言**:印度尼西亚语(id) - **许可证**:Apache-2.0 - **任务**:令牌分类(Token Classification,即NER) - **标签**:ner、surabaya、social-media、complaints - **样本规模**:1000 < 样本量 < 10000 ## 数据集统计信息 本数据集划分为三部分: | 划分名称 | 样本数量 | |---------|---------| | 训练集 | 6577 | | 验证集 | 822 | | 测试集 | 823 | | **总计** | **8222** | ## 数据采集 本数据集通过针对泗水市常见城市议题的关键词查询采集而来,涵盖交通、洪涝、公共服务与犯罪等领域。源文本包含非正式印度尼西亚语、泗水本地俚语(Suroboyoan slang)以及社交媒体常见的混合语言文本。 ### 爬取配置 以下关键词与检索逻辑用于从Nitter/X与Reddit采集原始文本: #### Nitter/X 查询 1. **通用投诉类**: (Surabaya OR Suroboyo) (keluhan OR lapor OR aduan OR masalah OR parah OR buruk OR mengecewakan OR sulit OR lambat OR tidak beres) lang:id -filter:retweets 2. **基础设施与交通类**: (Surabaya OR Suroboyo) (macet OR jalanan rusak OR parkir liar OR angkot OR bemo OR "suroboyo bus" OR "traffic light" OR lampu merah OR trotoar) lang:id -filter:retweets 3. **公用事业(水电)类**: (Surabaya OR Suroboyo) (PLN OR listrik padam OR mati lampu OR PDAM OR air mati OR air keruh OR tagihan bengkak) lang:id -filter:retweets 4. **洪涝与垃圾处理类**: (Surabaya OR Suroboyo) (banjir OR genangan OR sampah OR "bau tidak sedap" OR got mampet OR sungai kotor OR tumpukan sampah) lang:id -filter:retweets 5. **公共服务类**: (@sapawargasby OR @banggasurabaya OR pemkot sby OR kelurahan OR kecamatan) (layanan OR pengurusan OR e-ktp OR kk OR izin OR respon lambat) lang:id -filter:retweets 6. **安全与犯罪类**: (Surabaya OR Suroboyo) (aman OR tidak aman OR begal OR curanmor OR maling OR tawuran OR kejahatan OR gangster) lang:id -filter:retweets 7. **正面反馈类**: (Surabaya OR Suroboyo) (terima kasih OR keren OR mantap OR bagus OR apresiasi OR cepat OR solutif OR membantu) (@pemkotsby OR @sapawargasby OR layanan) lang:id -filter:retweets #### Reddit 查询 1. `surabaya traffic` 2. `surabaya flood` 3. `surabaya criminal` 4. `suroboyo` ## 使用方法 您可通过Hugging Face `datasets`库直接加载本数据集: python from datasets import load_dataset dataset = load_dataset("Kiuyha/surabaya-ner-dataset") print(dataset['train'][0]) ## 应用场景 - 面向印度尼西亚社交媒体文本的命名实体识别(NER)模型训练 - 面向城市治理的公众情感分析 - 城市议题检测与分类 - 地方政府社交媒体监测 - 支持本地俚语的自然语言处理研究(泗水本地俚语Suroboyoan) ## 引用说明 若您在研究中使用本数据集,请进行恰当引用并注明来源。 ## 联系方式 若对本数据集有疑问或问题,请在数据集仓库页面提交Issue。



