遇见数据集

mangoesai/DepressionDetection

收藏
Hugging Face2023-04-05 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: clean_text dtype: string - name: is_depression dtype: int64 splits: - name: train num_bytes: 2020382.4309921097 num_examples: 5411 - name: test num_bytes: 866251.5690078903 num_examples: 2320 download_size: 1709340 dataset_size: 2886634.0 --- # Dataset Card for "DepressionDetection" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征字段: - 名称:清洗后文本(clean_text),数据类型:字符串 - 名称:抑郁标识(is_depression),数据类型:64位整数 数据集划分: - 名称:训练集(train),字节大小:2020382.4309921097,样本数量:5411 - 名称:测试集(test),字节大小:866251.5690078903,样本数量:2320 下载总大小:1709340 数据集总存储大小:2886634.0 # "抑郁症检测(DepressionDetection)"数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
mangoesai
原始信息汇总

数据集概述

特征信息

  • clean_text: 数据类型为字符串。
  • is_depression: 数据类型为整数(int64)。

数据分割

  • train: 包含5411个样本,大小为2020382.43字节。
  • test: 包含2320个样本,大小为866251.57字节。

数据大小

  • 下载大小: 1709340字节。
  • 数据集总大小: 2886634.0字节。
搜集汇总
数据集介绍
mangoesai/DepressionDetection 数据集图片
构建方式
抑郁症作为一种日益受到关注的心理健康问题,其早期识别与干预对于改善患者预后至关重要。在此背景下,DepressionDetection数据集应运而生,为基于自然语言处理的抑郁检测研究提供了宝贵资源。该数据集通过收集社交平台等渠道的文本数据,经过严格的清洗与标注流程构建而成。具体而言,原始文本首先经过预处理以去除噪声信息,得到clean_text字段;随后由专业标注人员根据文本内容是否体现抑郁倾向进行二元标注,生成is_depression标签,其中1表示抑郁,0表示非抑郁。最终形成包含5411条训练样本和2320条测试样本的标注数据集,总样本量达7731条。
特点
该数据集在设计上展现出鲜明的特点。首先,其结构简洁而高效,仅包含clean_text和is_depression两个核心字段,便于研究者快速上手并聚焦于抑郁检测任务本身。其次,数据集划分为训练集和测试集两个部分,其中训练集样本量约为测试集的两倍,这种比例既保证了模型有充足的训练数据,又保留了独立的评估集以客观衡量模型性能。此外,数据集规模适中,总大小约为2.88MB,在提供足够信息量的同时避免了过大的存储和计算开销,适合用于快速原型开发与算法验证。
使用方法
使用该数据集进行抑郁检测研究时,研究者可直接加载Hugging Face Datasets库中的mangoesai/DepressionDetection数据集。具体操作上,通过load_dataset函数即可获取训练集和测试集,其中每条数据包含清洗后的文本(clean_text)及其对应的抑郁标签(is_depression)。研究者可将clean_text作为模型输入特征,is_depression作为监督信号,训练分类模型以判断给定文本是否反映抑郁倾向。该数据集适用于多种自然语言处理范式,包括基于传统机器学习的方法(如TF-IDF结合分类器)以及基于深度学习的方法(如BERT等预训练语言模型的微调)。
背景与挑战
背景概述
抑郁症作为一种常见的精神障碍,其早期识别与干预对于改善患者预后至关重要。近年来,自然语言处理技术的迅猛发展为从社交媒体文本中自动检测抑郁倾向提供了新的可能。在此背景下,mangoesai团队构建了DepressionDetection数据集,旨在推动基于文本的抑郁症检测研究。该数据集包含从社交平台收集的文本样本,经清洗后标注了是否具有抑郁倾向,共划分为训练集(5411条)和测试集(2320条)。其创建聚焦于如何利用机器学习模型捕捉语言中的抑郁信号,为心理健康领域的自动化筛查工具开发奠定了数据基础,对计算精神病学与情感计算领域产生了重要影响。
当前挑战
DepressionDetection数据集面临的核心挑战之一在于抑郁症检测本身的领域复杂性:抑郁情绪表达具有高度主观性和文化差异性,文本中隐晦、反讽或间接的表述方式使得准确分类极为困难。此外,构建过程中,数据来源的隐私保护与伦理合规性是一大难题,需在获取足够样本的同时确保用户匿名化处理。数据集规模相对有限(总计7731条),可能制约深度学习模型的泛化能力,且正负样本分布不均衡的风险进一步增加了模型训练的难度。如何从噪声文本中提取稳健的抑郁特征,仍是当前研究亟待突破的瓶颈。
常用场景
经典使用场景
在情感计算与心理健康交叉研究领域,mangoesai/DepressionDetection数据集凭借其精心标注的文本样本,成为抑郁倾向检测任务中的标杆性资源。该数据集包含5411条训练样本与2320条测试样本,每条数据均由原始文本经清洗后形成的clean_text字段以及二分类标签is_depression组成,为构建高效、鲁棒的抑郁检测模型提供了标准化的训练与评估基准。研究者常利用该数据集训练基于深度学习的文本分类器,如BERT、RoBERTa或LSTM等架构,以捕捉语言中隐含的抑郁信号,推动自然语言处理技术在心理健康早期预警中的深度应用。
解决学术问题
该数据集的核心学术贡献在于为抑郁倾向的自动识别提供了可复现、可比较的标准化测试床,解决了此前心理健康文本分析中因数据稀缺、标注不一致而导致的模型泛化困难与结果可信度不足的难题。通过提供大规模、高质量的中文抑郁相关文本,它使得研究者能够系统性地探索语言特征与抑郁状态之间的映射关系,推动了对抑郁症语言标记(如消极情感词频、第一人称代词使用模式等)的实证验证。这一数据资源显著提升了抑郁检测模型的准确性与稳定性,为后续跨语言、跨文化的抑郁识别研究奠定了坚实的实验基础。
衍生相关工作
围绕mangoesai/DepressionDetection数据集,学术界已衍生出一系列经典工作,包括基于对比学习的抑郁文本表示方法、融合情感词典与深度特征的混合模型、以及利用多任务学习同时预测抑郁程度与情感极性的创新框架。部分研究进一步探索了该数据集与外部知识图谱(如心理健康词库)的结合,以增强模型对隐喻性抑郁表达的理解能力。此外,该数据集还被用作迁移学习的源域数据,推动抑郁症检测模型从公开社交媒体向临床诊断文本的跨域适应,显著拓展了计算精神病学的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务