遇见数据集

FigSIM

收藏
arXiv2026-06-02 更新2026-06-03 收录
数据链接:
官方服务:

资源简介:

FigSIM是由墨尔本大学等机构联合创建的首个细粒度自杀迷因数据集,旨在支持对自杀相关网络内容的深度分析与自动化审核。该数据集包含1049条多模态迷因样本,每条均标注了比喻现象、自杀严重性等级及自杀相关内容等维度,数据来源于Reddit的r/SuicideMeme子社区2018年至2022年的英文帖子。构建过程基于临床评估量表与在线安全指南,由心理学与计算领域专家通过多轮标注与仲裁完成。该数据集主要应用于心理健康计算与社会媒体内容审核领域,致力于解决自杀迷因的细粒度风险识别、比喻语言理解及精准干预策略开发等关键问题。

FigSIM is the first fine-grained suicide meme dataset jointly created by the University of Melbourne and other institutions, aiming to support in-depth analysis and automated moderation of suicide-related online content. This dataset contains 1,049 multimodal meme samples, each annotated with dimensions such as metaphorical phenomena, suicide severity level, and suicide-related content. The data is sourced from English posts in the r/SuicideMeme subreddit on Reddit from 2018 to 2022. Its construction process is based on clinical assessment scales and online safety guidelines, and was completed by experts in psychology and computing through multiple rounds of annotation and arbitration. This dataset is mainly applied in the fields of mental health computing and social media content moderation, and is dedicated to solving key issues including fine-grained risk identification of suicide memes, figurative language understanding, and development of precise intervention strategies.

创建时间:
2026-06-02
原始信息汇总

FigSIM 数据集概述

FigSIM 是一个用于研究自杀梗图细粒度自杀严重程度自杀相关内容比喻性语言的研究数据集。

数据集内容

  • 标注与元数据:提供 JSON 格式的标注文件(位于 data/annotations/)。
  • 数据划分:训练/验证/测试集的 ID 文件(位于 data/splits/)。
  • 示例:展示标注格式的说明性示例(位于 data/examples/,仅供参考,并非数据集实际图像)。
  • 无效图像索引:记录无法访问的 URL(文件 data/invalid_image_indices.csv)。
  • 文档:标注方案和标签定义(位于 docs/)。

数据集访问

  • 图像不包含在此仓库中。受控访问,需向研究人员提供图像 URL。
  • 申请地址:https://forms.gle/ShXCH7fw55YTu1nb8
  • 审批通过后,将收到包含 image_indexdownload_url 的 CSV 文件。
  • 处理时间:约 5–7 个工作日。
  • 联系人:liuliuc@student.unimelb.edu.au

数据可用性

  • 截至 2026-04-14,1049 个 URL 中有 61 个无法访问(因帖子删除或内容移除)。
  • 不可访问的图像索引列表位于 data/invalid_image_indices.csv,下载脚本会排除这些图像。

快速使用

下载图像(获得访问权限后):

python scripts/download_images.py --url_path SuicideMeme_download_urls.csv --output_dir ./data/images

标注格式(JSON)

每条梗图以 image_index 为键,包含以下字段:

  • figurative:比喻性现象(多标签)
  • suicide_scale:自杀严重程度(单标签有序)
  • suicide_related:自杀相关内容(多标签)
  • modality:模态(单标签)
  • context:上下文需求(单标签)
  • image_descriptionannotation_note:仅用于试点标注,正式标注中为空。

标注类别

  • 比喻性现象(多标签):Metaphor、Pun/Double meaning、Irony/sarcasm、None
  • 自杀严重程度(单标签有序):None、Wish to be dead、Suicide ideation、Suicide planning、Suicide attempts、Suicide death
  • 自杀相关内容(多标签):Suicide methods/locations: stylized depiction、Suicide methods/locations: naturalistic depiction、Protective factors、Harmful factors、None
  • 模态(单标签):Text、Image、Complementary
  • 上下文需求(单标签):Context-required、No-context-required

引用

如使用 FigSIM,请引用: bibtex @inproceedings{chen-2026-figsim, title = {FigSIM: A Dataset for Fine-grained Suicide Risk and Figurative Language in Suicide Memes}, author = {Chen, Liuliu and Carrotte, Elise and Chapman, Brian E. and Robinson, Jo and Conway, Mike}, booktitle = {Findings of the Association for Computational Linguistics: ACL 2026}, year = {2026} }

注意事项

  • ⚠️ 内容警告:本数据集包含自杀和自残相关内容,请谨慎使用。
  • 图像仅供获批研究人员使用,以减少误用风险。
搜集汇总
数据集介绍
FigSIM 数据集图片
构建方式
FigSIM数据集以Reddit平台上的r/SuicideMeme子版块为数据源,利用Pushshift Reddit API爬取2018年4月至2022年12月间发布的帖子,经OCR文本过滤、去重后获得1967张自杀相关模因,并随机抽取1050张进行人工标注。标注方案基于哥伦比亚自杀严重程度评定量表、在线自杀沟通指南及修辞语言理论,由青年自杀预防领域的心理学家和计算研究人员共同开发。最终数据集包含1049条有效样本,每条样本在五个维度上获得标注:修辞现象、自杀严重程度、自杀相关内容、模态和语境。标注过程包括两轮试点标注以完善方案,随后由两名标注者独立完成大规模标注,不一致处由第三名标注者仲裁。
特点
FigSIM是首个面向自杀模因的细粒度多模态数据集,其核心特色在于多维度的标注体系:修辞现象涵盖隐喻、双关和反讽,自杀严重程度基于C-SSRS临床量表划分为六个等级,自杀相关内容则包含方法描绘、保护因子和有害因子等五类标签。数据集同时标注了模态类型和语境需求,为分析不同信息表达方式的影响提供了依据。标注一致性分析显示,自杀严重程度和自杀相关内容达到实质性一致,而修辞现象和语境则属于中等一致,反映了模因解读中固有的主观性。跨类别关联分析揭示了修辞表达与自杀严重程度之间的复杂交互关系。
使用方法
FigSIM为自杀模因研究提供了三项基础任务:修辞现象检测、自杀严重程度分类和自杀相关内容识别。数据集按60:20:20划分为训练集、验证集和测试集,支持有监督学习和多模态大语言模型的评估。研究者在论文中基准测试了16种单模态与多模态模型,包括文本模型(BERT、MentalBERT)、图像模型(ResNet-50、ViT)以及多模态模型(CLIP、BLIP-2和多个MLLM),评估指标采用宏平均F1和加权平均F1。值得注意的是,由于类别极度不平衡,自杀尝试和自杀死亡在分类时被合并为同一类别,而自杀相关内容中的第三人称描述标签则被排除。数据集及分析所用的数据划分均可通过GitHub获取。
背景与挑战
背景概述
FigSIM数据集由墨尔本大学、Orygen国家青年心理健康卓越中心及德克萨斯大学西南医学中心的研究团队于2025年联合创建。该数据集聚焦于社交媒体中日益泛滥却鲜有深入研究的自杀迷因(suicide memes),旨在填补现有研究在细粒度自杀风险分级与比喻性语言识别方面的空白。通过整合哥伦比亚自杀严重程度评定量表(C-SSRS)、在线安全传播指南及比喻语言理论,团队构建了包含1049条手工标注样本的多标签数据集。FigSIM的发布为计算社会语言学、多模态内容理解及自杀预防领域提供了关键基准资源,其跨学科协作模式也为敏感内容研究树立了方法论范例。
当前挑战
FigSIM面临的挑战具有双重性。在领域问题层面,自杀迷因中幽默与严肃意图的模糊性导致现有二元分类模型难以精准评估其伤害性,而比喻性表达(如反讽、隐喻)的普遍存在进一步加剧了自杀严重性的低估倾向。在数据集构建层面,跨学科标注团队面临主观性认知差异——比喻现象与上下文依赖的标注一致性仅达中等水平(Cohen's κ分别为0.56与0.58),且临床量表映射至模因表达时需平衡严谨性与生态效度。此外,样本源自单一Reddit社区导致文化泛化性受限,而细粒度等级标签的长尾分布(如自杀实施类样本稀缺)对模型鲁棒性构成显著考验。
常用场景
经典使用场景
在网络迷因与精神健康交叉研究领域,FigSIM数据集为细粒度自杀严重性分析提供了开创性基准。该数据集最经典的使用场景在于对自杀类迷因进行多维标注与分类任务,涵盖比喻、双关、反讽等修辞现象识别,基于哥伦比亚自杀严重性评定量表的风险等级划分,以及自杀相关内容(如方法描述、保护性因素、有害因素)的检测。通过整合视觉与文本模态信息,研究者能够在非文字传播的复杂语境中辨明自杀信号的真伪与强度,弥补了传统文本分析在幽默与隐喻面前失效的空白。
解决学术问题
FigSIM数据集有效回应了自杀类迷因在计算语言学与社交媒体安全领域长期悬而未决的学术挑战。此前研究多聚焦于二元自杀检测任务,而忽视了自杀风险轻重缓急的递进性。该数据集首次引入基于临床量表(C-SSRS)的细粒度风险等级标注,使模型能够区分死亡愿望、自杀意念、计划、企图与死亡。同时,针对修辞现象的特殊性,它量化了隐喻与反讽如何导致严重性被低估的偏差,推动了基于上下文感知的内容审核理论研究,为构建更具适应性的自杀风险分层模型奠定了实证基础。
衍生相关工作
FigSIM数据集的发布催生了若干方向性的研究工作。在模型层面,研究者基于该数据集评估了视觉-语言大模型(如CLIP、BLIP-2、Gemini及Claude系列)在自杀迷因理解上的迁移能力,揭示出当前MLLM在隐喻情境中系统性地低估自杀风险的现象。在理论层面,该工作与先前发布的FigMemes、Hateful Memes等数据集形成互补,拓展了迷因研究中“情感危害”的边界。此外,M3H等心理迷因检测框架的引入,显示出融合常识与修辞信号在自杀风险建模中的潜力,激发了后续构建领域自适应审核模型的新思路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务