Exqrch/IndoToxic2024
收藏官方服务:
资源简介:
IndoToxic2024是一个在2024年印度尼西亚总统选举前后收集的印度尼西亚语数据集。数据来源于社交媒体,并由19位不同背景的注释者进行标注。该数据集支持的任务是围绕仇恨言论和有毒内容的文本分类。
IndoToxic2024 is an Indonesian dataset collected before and during the 2024 Indonesia presidential election, focusing on text classification tasks around hate speech and toxic content. The data are sourced from social media and annotated by 19 annotators with diverse backgrounds. The dataset includes two configurations: main and annotator, corresponding to different data files.
提供机构:
Exqrch原始信息汇总
IndoToxic2024 数据集概述
基本信息
- 许可证: Apache 2.0
- 任务类别: 文本分类
- 语言: 印度尼西亚语
- 标签:
- 仇恨言论分类
- 毒性分类
- 人口统计信息
- 数据规模: 10K<n<100K
配置
- 配置名称: main
- 数据文件:
- 分割: main
- 路径: indotoxic2024_annotated_data.jsonl
- 数据文件:
- 配置名称: annotator
- 数据文件:
- 分割: annotator
- 路径: indotoxic2024_annotator_data.jsonl
- 数据文件:
数据集描述
- 来源: 2024年印度尼西亚总统选举前后从社交媒体收集的数据。
- 标注: 由19位背景多样的标注者进行标注。
- 任务: 支持围绕仇恨言论和有毒内容的文本分类任务。
引用
- 文献:
- 作者: Susanto, L., Wijanarko, M. I., Pratama, P. A., Hong, T., Idris, I., Aji, A. F., & Wijaya, D.
- 标题: IndoToxic2024: A Demographically-Enriched Dataset of Hate Speech and Toxicity Types for Indonesian Language
- 出版日期: 2024年6月27日
- 来源: arXiv.org
- URL: https://arxiv.org/abs/2406.19349
搜集汇总
数据集介绍
构建方式
IndoToxic2024数据集由Exqrch团队构建,专注于印尼语文本的毒性分类任务。其构建过程基于对社交媒体平台上的用户生成内容进行采集与标注,涵盖了多种毒性表现形式。数据集包含两个主要配置:主数据集(main)包含经过严格注释的毒性样本,而注释者数据集(annotator)则记录了标注过程中的个体差异信息。数据以JSONL格式存储,便于高效加载与处理,总计样本量介于1万至10万之间,确保了数据规模的适中性与代表性。
特点
该数据集的核心特点在于其细粒度的毒性分类与人口统计学信息的整合。除了传统的毒性识别,数据还包含了标注者的背景特征,如年龄、性别等,这使得研究者能够探索不同群体对毒性内容感知的差异性。此外,数据集采用Apache-2.0许可证,鼓励学术与工业界的开放使用。然而,需注意该数据集已被标记为弃用,其最新版本已迁移至IndoDiscourse项目,以避免版本混淆。
使用方法
使用IndoToxic2024时,研究者可通过HuggingFace的datasets库直接加载,通过指定配置名称(如'main'或'annotator')来获取对应数据。数据适用于文本分类任务的训练与评估,特别是针对印尼语环境下的毒性检测模型开发。由于数据集已弃用,建议用户转而使用其替代版本IndoDiscourse,该版本提供了更完善的注释体系与持续维护。加载示例代码为:`load_dataset('Exqrch/IndoToxic2024', 'main')`。
背景与挑战
背景概述
在自然语言处理领域,毒性内容检测是保障在线社区健康交流的关键任务,尤其在多语言环境中面临独特挑战。Exqrch/IndoToxic2024数据集由印度尼西亚的研究团队于2024年创建,聚焦于印尼语文本的毒性分类问题,核心研究目标在于构建能够识别并区分不同毒性类型(如仇恨言论、侮辱、挑衅等)的分类器,同时整合人口统计学信息以探究社会文化背景对语言表达的影响。该数据集包含超过一万条人工标注样本,为印尼语毒性检测研究提供了标准化基准,推动了低资源语言在内容审核技术上的发展。由于其在多语言毒性研究中的开创性贡献,IndoToxic2024成为印尼语自然语言处理领域的重要资源,促进了相关模型在社交媒体监控、公共论坛管理等实际场景中的应用。
当前挑战
IndoToxic2024数据集所解决的领域问题在于印尼语毒性内容检测的复杂性,包括语言中隐含的文化隐喻、讽刺表达以及非正式用语的多样性,导致传统基于关键词的过滤方法效果欠佳。构建过程中面临的主要挑战包括:其一,标注一致性难以保证,由于毒性定义受主观判断影响,不同标注者对同一文本可能产生分歧;其二,人口统计学信息的引入增加了数据隐私保护的难度,需在收集用户背景时平衡研究需求与伦理规范;其三,数据不平衡问题显著,某些毒性类别(如极端仇恨言论)样本稀少,影响模型泛化能力;其四,印尼语方言及俚语的广泛存在使得标注标准难以统一,进一步加剧了数据质量控制的复杂性。这些挑战共同制约了数据集在跨领域应用中的鲁棒性。
常用场景
经典使用场景
IndoToxic2024数据集专为印度尼西亚语文本中的毒性分类任务而设计,其核心应用场景在于构建和评估能够精准识别网络言论中攻击性、侮辱性或仇恨性内容的文本分类模型。该数据集涵盖了丰富的毒性类别,并整合了人口统计学信息,为多标签分类与细粒度毒性分析提供了高质量的训练与评测基准。研究者常利用该数据集训练基于Transformer架构的预训练语言模型,如IndoBERT,以提升在低资源语言环境下的毒性检测性能。
实际应用
在实际应用中,IndoToxic2024可直接赋能印尼语社交媒体平台的内容审核系统,自动识别并过滤有害评论,降低人工审核成本。此外,该数据集还可用于构建教育领域的网络文明监测工具,辅助学校与社区识别欺凌性言论。人口统计学信息的纳入使得平台能够针对不同用户群体优化过滤策略,减少误判,从而在维护言论自由与净化网络环境之间取得平衡。
衍生相关工作
基于IndoToxic2024,研究者衍生出多项经典工作,例如利用该数据集训练轻量级毒性检测模型以部署于移动端应用,以及开发跨域适应方法以提升模型在不同社交媒体平台间的泛化能力。此外,该数据集还催生了关于人口统计学偏差对毒性分类公平性影响的研究,推动了基于对抗训练的去偏算法设计。尽管该数据集现已迁移至IndoDiscourse,但其作为印尼语毒性分析领域的里程碑资源,仍持续启发着后续的多语言与跨文化自然语言处理研究。
以上内容由遇见数据集搜集并总结生成



