CNSocialDepress (CNSD)
收藏资源简介:
CNSocialDepress是一个用于抑郁症风险检测和结构化心理分析的中文社交媒体数据集。该数据集旨在支持中文自然语言处理、心理健康相关语言分析、抑郁症风险检测、结构化心理画像、可解释性分类以及大型语言模型评估或微调的研究。数据集包含来自新浪微博的用户级数据,每个用户样本包括多条微博帖子和一个结构化心理分析,提供二元用户级抑郁症风险标签、多维结构化心理分析、基于帖子索引的证据解释以及用户级社交媒体文本集合。
CNSocialDepress is a Chinese social media dataset developed for depression risk detection and structured psychological analysis. This dataset is intended to support research across multiple domains, including Chinese natural language processing, mental health-oriented linguistic analysis, depression risk detection, structured psychological profiling, interpretable classification, as well as large language model (LLM) evaluation and fine-tuning. It encompasses user-level data sourced from Sina Weibo. Each user sample includes multiple Weibo posts and a structured psychological analysis, offering binary user-level depression risk labels, multi-dimensional structured psychological analyses, evidence explanations indexed by post indices, and a user-level collection of social media texts.
CNSocialDepress (CNSD) 数据集详情
基本信息
CNSocialDepress 是一个面向中文社交媒体抑郁症风险检测与结构化心理分析的数据集,旨在支持中文自然语言处理、心理健康相关语言分析、抑郁症风险检测、结构化心理画像、可解释分类以及大语言模型评估或微调等研究。
来源与构建
- 数据来源:原始数据源自新浪微博抑郁症数据集(SWDD),CNSocialDepress 在此基础上增加了结构化心理标注和用户级分析。
- 论文:该数据集关联的论文为《CNSocialDepress: A Chinese Social Media Dataset for Depression Risk Detection and Structured Analysis》,arXiv 地址为 https://arxiv.org/abs/2510.11233
- 下载地址:https://drive.google.com/file/d/1QCRZJAJsESg9WB6pmLqnDtbmASNhHaaN/view?usp=sharing
数据集规模
| 项目 | 数量 |
|---|---|
| 总用户数 | 233 |
| 阳性(抑郁症风险)用户 | 116 |
| 阴性(非抑郁症风险)用户 | 117 |
| 总帖子/文本数 | 44,178 |
| 抑郁相关标注片段 | 10,306 |
数据格式
数据集以 JSON 文件形式提供,文件名为 CNSD_dataset.json,采用用户级字典结构:
- 键为匿名化用户ID(
p_user_x表示阳性用户,n_user_x表示阴性用户) - 每个键对应包含
inpput(用户微博文本集合)和output(用户级二元标签与六维结构化心理分析)
output 字段结构
output 以中文自然语言注释字符串形式存储,包含一个二元判断和六个分析维度:
| 中文维度 | 英文描述 | 角色 |
|---|---|---|
| 负面情绪 | Negative emotions | 次要判断标准 |
| 抑郁心理状态 | Depressive psychological state | 主要判断标准 |
| 抑郁相关的临床症状 | Clinical symptoms related to depression | 主要判断标准 |
| 造成抑郁的潜在外因 | Potential external causes of depression | 次要判断标准 |
| 抑郁相关的医疗表达 | Medical expressions related to depression | 主要判断标准 |
| 抑郁相关的语言表达模式 | Language use patterns related to depression | 次要判断标准 |
标注方案
标注过程采用专家参与设计,包含两个层级:
- 用户级二元风险标签:
是(抑郁症风险用户)或否(非抑郁症风险用户) - 六维结构化分析:对每个用户进行六个抑郁相关维度的分析,标注证据时会引用对应帖子索引(如
text_12)
标注由四位具有心理学和抑郁量表专业知识的高级研究员进行,标注者在对原始标签不知情的情况下重新标注,并定期交叉检查重叠样本。
预期用途
- 中文抑郁症风险检测
- 心理健康相关自然语言处理
- 用户级社交媒体分析
- 结构化心理画像
- 可解释抑郁症风险分类
- 基于证据的心理健康文本分析
- 大语言模型评估与微调
伦理考量与限制
禁止用途:临床诊断、医疗决策、心理咨询替代、治疗建议、自动分诊、个人监控、商业用户画像、保险/就业/教育/信贷相关决策。
局限性:
- 平台特异性偏差(仅来自新浪微博)
- 样本量有限(233个用户)
- 语言覆盖范围有限
- 标注主观性
- 仅聚焦抑郁相关信号
- 社交媒体文本不能作为临床证据




