遇见数据集

CNSocialDepress (CNSD)

收藏
github2026-05-11 更新2026-05-14 收录
官方服务:

资源简介:

CNSocialDepress是一个用于抑郁症风险检测和结构化心理分析的中文社交媒体数据集。该数据集旨在支持中文自然语言处理、心理健康相关语言分析、抑郁症风险检测、结构化心理画像、可解释性分类以及大型语言模型评估或微调的研究。数据集包含来自新浪微博的用户级数据,每个用户样本包括多条微博帖子和一个结构化心理分析,提供二元用户级抑郁症风险标签、多维结构化心理分析、基于帖子索引的证据解释以及用户级社交媒体文本集合。

CNSocialDepress is a Chinese social media dataset developed for depression risk detection and structured psychological analysis. This dataset is intended to support research across multiple domains, including Chinese natural language processing, mental health-oriented linguistic analysis, depression risk detection, structured psychological profiling, interpretable classification, as well as large language model (LLM) evaluation and fine-tuning. It encompasses user-level data sourced from Sina Weibo. Each user sample includes multiple Weibo posts and a structured psychological analysis, offering binary user-level depression risk labels, multi-dimensional structured psychological analyses, evidence explanations indexed by post indices, and a user-level collection of social media texts.

创建时间:
2026-05-11
原始信息汇总

CNSocialDepress (CNSD) 数据集详情

基本信息

CNSocialDepress 是一个面向中文社交媒体抑郁症风险检测与结构化心理分析的数据集,旨在支持中文自然语言处理、心理健康相关语言分析、抑郁症风险检测、结构化心理画像、可解释分类以及大语言模型评估或微调等研究。

来源与构建

  • 数据来源:原始数据源自新浪微博抑郁症数据集(SWDD),CNSocialDepress 在此基础上增加了结构化心理标注和用户级分析。
  • 论文:该数据集关联的论文为《CNSocialDepress: A Chinese Social Media Dataset for Depression Risk Detection and Structured Analysis》,arXiv 地址为 https://arxiv.org/abs/2510.11233
  • 下载地址:https://drive.google.com/file/d/1QCRZJAJsESg9WB6pmLqnDtbmASNhHaaN/view?usp=sharing

数据集规模

项目 数量
总用户数 233
阳性(抑郁症风险)用户 116
阴性(非抑郁症风险)用户 117
总帖子/文本数 44,178
抑郁相关标注片段 10,306

数据格式

数据集以 JSON 文件形式提供,文件名为 CNSD_dataset.json,采用用户级字典结构:

  • 键为匿名化用户ID(p_user_x 表示阳性用户,n_user_x 表示阴性用户)
  • 每个键对应包含 inpput(用户微博文本集合)和 output(用户级二元标签与六维结构化心理分析)

output 字段结构

output 以中文自然语言注释字符串形式存储,包含一个二元判断和六个分析维度:

中文维度 英文描述 角色
负面情绪 Negative emotions 次要判断标准
抑郁心理状态 Depressive psychological state 主要判断标准
抑郁相关的临床症状 Clinical symptoms related to depression 主要判断标准
造成抑郁的潜在外因 Potential external causes of depression 次要判断标准
抑郁相关的医疗表达 Medical expressions related to depression 主要判断标准
抑郁相关的语言表达模式 Language use patterns related to depression 次要判断标准

标注方案

标注过程采用专家参与设计,包含两个层级:

  1. 用户级二元风险标签(抑郁症风险用户)或 (非抑郁症风险用户)
  2. 六维结构化分析:对每个用户进行六个抑郁相关维度的分析,标注证据时会引用对应帖子索引(如 text_12

标注由四位具有心理学和抑郁量表专业知识的高级研究员进行,标注者在对原始标签不知情的情况下重新标注,并定期交叉检查重叠样本。

预期用途

  • 中文抑郁症风险检测
  • 心理健康相关自然语言处理
  • 用户级社交媒体分析
  • 结构化心理画像
  • 可解释抑郁症风险分类
  • 基于证据的心理健康文本分析
  • 大语言模型评估与微调

伦理考量与限制

禁止用途:临床诊断、医疗决策、心理咨询替代、治疗建议、自动分诊、个人监控、商业用户画像、保险/就业/教育/信贷相关决策。

局限性

  • 平台特异性偏差(仅来自新浪微博)
  • 样本量有限(233个用户)
  • 语言覆盖范围有限
  • 标注主观性
  • 仅聚焦抑郁相关信号
  • 社交媒体文本不能作为临床证据
搜集汇总
数据集介绍
CNSocialDepress (CNSD) 数据集图片
构建方式
CNSocialDepress数据集构建于新浪微博用户级社交媒体数据之上,其原始数据源自Sina Weibo Depression Dataset(SWDD)。研究团队在此基础上,依据心理学与抑郁症相关量表领域的专业知识,采用专家介入的标注流程,由四位资深研究者对每个用户样本进行二元抑郁风险标签(是/否)与六维度结构化心理分析的双重标注。标注过程中,标注者对原始标签保持盲态,并通过交叉检验与讨论不断修订标注指南,以确保标注的一致性与准确性。最终,数据集包含了233位用户、44,178条微博文本以及10,306个与抑郁相关的标注片段,形成了兼具广度与深度的结构化资源。
特点
该数据集的核心特色在于其多维度、可解释的结构化心理分析框架。它不仅提供用户级的二元抑郁风险判断,还深入剖析了负面情绪、抑郁心理状态、抑郁相关临床症状、潜在外因、医疗表达及语言表达模式等六个关键维度,并为每个结论附加了基于具体微博文本索引的证据支持。这种设计突破了传统仅提供二元标签的数据集局限,使得抑郁信号的识别更具精细度和解释性,有力支撑了可解释分类、结构化心理画像及大语言模型评估等前沿研究。
使用方法
数据集以JSON格式存储,用户可通过标准的Python json库加载。使用时,研究者需注意数据字段名为'inpput',并可从'output'字段提取二元标签与六维度分析文本。推荐任务包括基于用户微博文本的二分类抑郁风险检测、六维度结构化心理分析生成、基于证据的解释生成等。预训练或微调大语言模型时,建议对输入文本按'text_i'标记进行分割,并从标注中解析出情绪、症状、外因及语言模式等细粒度信息。在划分训练、开发与测试集时,必须保持用户级别的分组,防止数据泄露现象的发生。
背景与挑战
背景概述
CNSocialDepress(CNSD)是由徐金源等研究人员于2026年构建的中文社交媒体抑郁风险检测数据集,依托于新浪微博平台,在原始SWDD数据集基础上增添了结构化心理分析注释。该数据集聚焦于通过用户发布的社交媒体文本进行抑郁风险二元分类与多维心理剖析,涵盖负面情绪、抑郁心理状态、临床症状、潜在外因、医疗表达及语言模式六个维度。数据集包含233名用户样本,其中116名抑郁风险用户与117名非风险用户,共收集44,178条微博文本及10,306段抑郁相关标注片段。其发布对中文自然语言处理在心理健康领域的应用、可解释性分类模型发展以及大型语言模型的评估与微调具有重要推动意义,为学术界提供了精细化的抑郁信号分析资源。
当前挑战
CNSocialDepress面临多重挑战。领域问题方面,社交媒体文本并非临床诊断依据,用户表达受平台特性、文化背景及语言风格影响,模型难以泛化至其他平台或线下场景,且数据对焦虑症、双相情感障碍等其他精神健康问题覆盖不足。构建过程中,数据集仅含233个用户样本,样本量有限限制了大规模深度学习模型的训练与广泛人群推广;中文社交媒体语言包含方言、隐喻、表情符号及网络新词,现有数据未能完全覆盖地域与社群语言差异;此外,抑郁风险分析依赖专家主观判断,即使经过交叉验证,标注仍可能受语境与个体解读偏差影响,同时需严格防范数据被滥用于用户画像或监控等非学术目的。
常用场景
经典使用场景
在中文社交媒体抑郁风险检测领域,CNSocialDepress数据集被广泛用于用户级别的抑郁倾向识别任务。研究者可将每位用户发布的多条微博文本作为输入,利用该数据集提供的二分类标签(抑郁风险/非抑郁风险)训练分类模型。该数据集的独特价值在于其包含经过专家标注的六维结构化心理分析,使得模型不仅能够判断风险标签,还能从负面情绪、抑郁心理状态、临床症状、潜在外因、医疗表达和语言模式等维度进行细粒度推理。这种多维度标注设计为开发可解释的抑郁检测系统提供了黄金标准数据支撑,尤其适合需要输出证据性解释的深度学习与大型语言模型研究。
实际应用
在实际应用场景中,CNSocialDepress为构建基于社交媒体的心理健康监测系统提供了重要基础。基于该数据集训练的模型可用于开发在线抑郁风险预警平台,通过分析用户在微博等平台上的公开文本,识别可能存在心理困扰的人群并引导其寻求专业帮助。该数据集还能赋能心理健康服务机构的预筛查工具,辅助心理咨询师快速了解来访者在社交媒体上反映的心理状态特征。此外,数据集的结构化分析范式可被整合到校园心理健康教育平台中,用于早期识别学业压力与社交孤立等潜在风险因素,从而促进及时的心理支持介入。这些应用始终强调辅助而非替代临床诊断的伦理边界。
衍生相关工作
围绕CNSocialDepress数据集衍生了多项开创性研究工作,推动了中文心理健康自然语言处理的发展。研究者基于该数据集探索了利用大型语言模型进行结构化心理分析生成的方法,评估了诸如GPT系列和文心一言等模型在六维心理健康分析任务上的表现。该数据集还被用于开发基于注意力机制的可解释抑郁检测模型,通过计算不同维度对分类结果的贡献权重,实现了类似临床诊断报告的风险分析流程。另有一些工作将其与跨平台迁移学习结合,验证了该数据集在抖音和微信公众号等社交媒体文本上的泛化能力。在提示学习领域,该数据集被用作基准评估中文提示设计对抑郁检测任务的影响,推动了零样本和少样本心理状态推断方法的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务