遇见数据集

BanglaAbuseMeme

收藏
arXiv2023-10-18 更新2024-06-21 收录
官方服务:

资源简介:

BanglaAbuseMeme数据集由印度理工学院卡拉格普尔分校创建,旨在支持自动检测孟加拉语辱骂性表情包。该数据集包含4043个孟加拉语表情包,其中1515个被标记为辱骂性,其余为非辱骂性。每个表情包都附有详细标签,包括是否粗俗、是否讽刺、情感倾向(积极、中立、消极)以及目标社区。数据集通过关键词搜索和社交媒体平台收集,旨在帮助研究人员和开发者构建和评估检测辱骂性内容的模型,以提高网络环境的安全性。

The BanglaAbuseMeme dataset was developed by the Indian Institute of Technology Kharagpur to support automatic detection of Bengali abusive memes. It includes 4043 Bengali memes, of which 1515 are annotated as abusive and the remaining are categorized as non-abusive. Each meme is paired with detailed annotations covering whether it contains obscenity, whether it is sarcastic, its sentiment polarity (positive, neutral, negative), and the targeted communities. The dataset was collected via keyword searches and social media platforms, and aims to assist researchers and developers in constructing and evaluating abusive content detection models, thereby enhancing the safety of online environments.

创建时间:
2023-10-18
搜集汇总
数据集介绍
BanglaAbuseMeme 数据集图片
构建方式
在社交媒体上,滥用模因的传播对在线安全构成了严重威胁,尤其是在低资源语言如孟加拉语中,缺乏可用的基准数据集。为弥补这一空白,研究者构建了BanglaAbuseMeme数据集。首先,通过构建包含69个攻击性词汇的词典,对Google Images、Bing、Facebook和Instagram等平台进行关键词搜索,收集了4043个孟加拉语模因。随后,由五名母语为孟加拉语的本科生在详细标注手册指导下进行标注,每张模因由三位独立标注者评估,最终通过多数投票确定标签。标注内容包括是否滥用、是否粗俗、是否讽刺、情感倾向以及目标社区,最终实现了0.799的Fleiss’ κ一致性评分,确保了数据集的高质量。
特点
该数据集的核心特点在于其多维度的标注体系与丰富的语义覆盖。不仅将模因区分为1515个滥用样本与2528个非滥用样本,还额外标注了粗俗性、讽刺性、情感极性(积极、消极、中性)及七个目标社区类别(如宗教、性别、政治等),为深入理解孟加拉语模因的动态提供了全景视角。此外,数据集全部源于真实社交媒体内容,避免了合成数据的偏差,并通过Empath分析揭示了滥用模因中‘仇恨’、‘犯罪’等高频主题,而非滥用模因则更倾向于‘成就’与‘娱乐’。图像分析进一步发现,滥用模因中女性面孔比例是非滥用模因的两倍,暗示了性别化的滥用模式。
使用方法
该数据集适用于多模态滥用模因检测模型的训练与评估,研究者可基于文本、图像或融合特征进行分类实验。例如,使用Easy-OCR提取文本后,可结合m-BERT、XLM-Roberta等文本模型;图像方面可采用VIT、ResNet-152等视觉模型;多模态方法则通过CLIP等预训练模型实现文本与图像特征的拼接或晚期融合。数据集划分为70%训练、10%验证和20%测试,采用5折分层交叉验证评估性能。最佳模型CLIP(L)在宏F1上达到70.51%,显著优于单模态模型,尤其适用于捕捉文本与图像间的隐含关联。此外,零样本目标社区实验可测试模型对未见社区的泛化能力,而跨语言迁移实验则揭示了模型在孟加拉语与印地语之间的性能差距,为低资源语言研究提供了重要基准。
背景与挑战
背景概述
随着社交媒体平台在信息传播中的主导地位日益凸显,网络滥用现象亦随之急剧攀升。作为一种融合图像与简短文字的复合媒介,模因(meme)因其易于传播且成本低廉的特性,成为施虐者攻击个体或群体的有效工具。然而,现有研究多聚焦于英语模因的检测,对于孟加拉语等低资源语言的探索尚属空白。为弥合这一鸿沟,印度理工学院卡哈拉格普尔分校的Mithun Das与Animesh Mukherjee于2023年发布了BanglaAbuseMeme数据集。该数据集包含4,043条真实世界的孟加拉语模因,并对其进行了虐待性、低俗性、讽刺性、情感倾向及目标社群等多维度标注,旨在推动低资源语言环境下多模态滥用模因自动检测的研究发展。该数据集不仅填补了孟加拉语领域基准数据的缺失,也为跨语言模因分析提供了重要参考。
当前挑战
BanglaAbuseMeme数据集所面临的挑战主要体现在领域问题与构建过程两个方面。在领域问题层面,核心挑战在于如何有效检测隐含的虐待性模因,这类模因缺乏显式侮辱性词汇,依赖复杂的推理能力与背景知识,导致多模态模型亦难以准确识别。此外,模型在零样本场景下对未见目标社群的泛化能力不足,宏F1分数常低于50%,凸显了跨社群检测的脆弱性。在构建过程中,挑战则源于数据采集与标注的复杂性:基于关键词的爬取策略可能引入采样偏差,而人工标注涉及对敏感内容的心理负担,需通过多轮培训与定期心理疏导来保证标注质量。同时,孟加拉语内部存在显著方言差异,不同地域的仇恨词汇与目标社群各异,进一步增加了标注一致性与模型适配的难度。
常用场景
经典使用场景
在社交媒体内容安全领域,该数据集为孟加拉语滥用模因检测提供了首个公开基准。研究者可利用其4,043条真实标注样本(含1,515条滥用模因)训练多模态分类模型,系统评估文本、图像及融合模型在低资源语言场景下的表现。数据集涵盖侮辱性、讽刺性、粗俗性及情感倾向等多元标签,为探索模因中视觉与文本线索的协同作用提供了标准化测试平台。
衍生相关工作
该数据集催生了多项衍生研究:其一,基于CLIP的多模态融合框架被验证为最优基线(宏F1达70.51%),推动了视觉语言模型在低资源语言滥用检测中的应用;其二,零样本目标社区实验揭示了模型对未见过群体的泛化瓶颈,启发了跨语言迁移学习研究;其三,多任务学习尝试(联合粗俗性、讽刺性检测)为构建更鲁棒的审核系统提供了新思路。这些工作共同推进了多模态有害内容检测的边界。
数据集最近研究
最新研究方向
在社交媒体内容安全领域,随着多模态信息传播的激增,针对低资源语言的滥用模因检测成为前沿热点。BanglaAbuseMeme数据集聚焦于孟加拉语滥用模因,涵盖4043条真实社交媒体模因,并细粒度标注了粗俗、讽刺、情感及攻击目标等维度。该研究不仅推动了多模态融合模型(如CLIP)在资源匮乏语言中的性能突破,还揭示了跨语言迁移的局限性——模型在孟加拉语与印地语间的泛化能力显著不足。这一工作呼应了全球网络仇恨言论治理的紧迫需求,为东南亚地区数字安全建设提供了关键基准,同时凸显了方言差异、隐晦滥用等复杂挑战,引领后续研究向更深层的语义推理与跨文化适应方向演进。
相关研究论文
  • 1
    BanglaAbuseMeme: A Dataset for Bengali Abusive Meme Classification印度理工学院卡拉格普尔分校 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务