遇见数据集

mental_health_social_media_dataset.csv

收藏
github2026-05-12 更新2026-05-26 收录
官方服务:

资源简介:

该数据集包含10,000个合成的社交媒体帖子,具有真实的结构和噪声。特征包括:post_id(每个帖子的唯一标识符)、text(模拟的社交媒体帖子文本)、label(0表示正常,1表示心理困扰)、date(帖子的时间戳,时间序列格式)、likes(模拟的参与度指标)、shares(模拟的参与度指标)。数据集特点包括:真实的情绪语言(压力、焦虑、快乐等)、表情符号和标签以增强真实性、基于时间的分布(120天窗口)、参与度偏差(正常帖子平均获得更高参与度)。

This dataset contains 10,000 synthetic social media posts with realistic structures and inherent noise. The included features are as follows: post_id (unique identifier for each individual post), text (simulated text content of social media posts), label (0 stands for normal posts, 1 represents posts related to psychological distress), date (timestamp of the post in time-series format), likes (simulated engagement metric), shares (simulated engagement metric). The characteristics of this dataset are: authentic emotional language covering emotions such as stress, anxiety, joy, etc., emojis and hashtags added to enhance realism, a time-based distribution spanning a 120-day window, and engagement bias where normal posts achieve higher average engagement levels.

创建时间:
2026-04-25
原始信息汇总

数据集概述

该数据集名为 Mental Health Trend Detection from Social Media,是一个用于从社交媒体帖子中检测和分析心理健康趋势的合成数据集。

数据集规模与形式

  • 包含 10,000 条合成的社交媒体帖子数据,存储在文件 mental_health_social_media_dataset.csv 中。
  • 数据为结构化表格,涵盖时间序列信息,模拟了 120 天的时间窗口。

数据字段与标签

字段 描述
post_id 帖子的唯一标识符
text 模拟的社交媒体帖子文本内容
label 分类标签:0 表示正常心理状态,1 表示心理困扰迹象
date 帖子的时间戳(时间序列格式)
likes 模拟的点赞数(互动指标)
shares 模拟的分享数(互动指标)

数据特点

  • 包含真实感的情感语言(如压力、焦虑、快乐等)。
  • 为增加真实性,融入表情符号和话题标签。
  • 带有互动偏差:正常帖子的平均互动量更高。

项目用途与技术方法

  • 任务类型:二分类文本分类。
  • 核心算法:逻辑回归,使用 TF-IDF 向量化进行特征工程。
  • 处理流程:数据生成 → 文本预处理(小写化、去噪、清除URL和符号) → 特征提取 → 模型训练 → 评估(精确率、召回率、F1分数) → 趋势检测(按日聚合预测结果)。
  • 输出:模型分类报告、趋势分析表格、时间序列可视化图(展示120天内心理困扰率的变化)。

重要说明

  • 数据集为完全合成,不涉及真实用户数据,仅用于教育、研究原型和作品集展示。
  • 项目未来计划包括:替换为BERT等Transformer模型、引入情感评分、部署为Streamlit仪表盘等。
搜集汇总
数据集介绍
mental_health_social_media_dataset.csv 数据集图片
构建方式
在社交媒体日益成为公众情绪表达重要载体的背景下,该数据集通过模拟真实社交平台中用户的心理健康表达行为而构建。研究团队生成包含10,000条合成帖子的数据集,每条帖子均配备唯一标识符、文本内容、二元标签(0表示正常状态,1表示心理困扰)、时间戳以及点赞与分享等互动指标。使用自然语言处理技术,将文本进行小写化、噪声去除和URL清洗等预处理,进而通过TF-IDF向量化提取特征,最后借助逻辑回归模型进行二元文本分类,以识别心理健康状态。
特点
该数据集的核心特征在于其高度仿真的合成设计,既模拟了现实社交媒体中压力、焦虑与快乐等情感语言的多样性,又通过加入表情符号与话题标签增强了内容的真实感。数据覆盖120天的时间窗口,允许分析心理困扰随时间演变的趋势模式。此外,数据集引入互动偏置机制,即正常帖子的点赞与分享数量普遍高于心理困扰帖子,更贴近真实社交平台中用户互动行为的非对称性。
使用方法
使用者可基于该数据集开展心理健康趋势检测实验。首先通过pip安装pandas、numpy、scikit-learn及matplotlib等依赖库,然后运行mental_health_trend.py脚本自动完成数据处理、模型训练与评估。脚本将输出包含精确率、召回率及F1分数的分类报告,生成每日心理困扰率的时间序列分析表,并绘制120天内的心理状态波动可视化图。该流程不仅支持二分类模型的验证,还为心理健康趋势的检测提供了可复现的基准框架。
背景与挑战
背景概述
随着社交媒体平台的蓬勃发展,用户生成内容已成为洞察公众心理状态的重要数据源。该数据集由Buka Jonah于近年创建,聚焦于通过自然语言处理与机器学习技术,从模拟社交媒体帖子中检测心理健康趋势。核心研究问题在于如何从文本中有效区分正常心理状态与心理困扰迹象,并追踪其随时间演变的模式。数据集包含10,000条合成帖子,涵盖文本、标签、时间戳及互动指标,为心理健康的时序分析提供了基准资源,对计算社会科学与数字健康领域具有重要推动作用。
当前挑战
该领域面临的主要挑战包括:首先,从非结构化社交媒体文本中准确捕捉心理困扰的细微表达,需要克服情感歧义与语境依赖性,传统TF-IDF向量化难以充分表征语义深度。其次,构建过程中需平衡合成数据的真实性与隐私保护,避免引入人工偏差,同时模拟现实世界的互动机制(如点赞和分享的不均衡分布),这对数据生成算法的设计提出了高要求。此外,时间序列分析需处理噪声与稀疏反馈,以确保趋势检测的稳健性,为未来引入更先进模型(如BERT)和实时数据整合奠定基础。
常用场景
经典使用场景
在心理健康与社交媒体交叉研究领域,该数据集被广泛应用于基于自然语言处理的文本分类与时间序列趋势分析任务。其核心价值在于模拟社交平台中海量短文本的情感表达,通过标签‘0’(正常心理状态)与‘1’(心理困扰信号)的二元标注,为研究者提供了训练和评估机器学习模型的基准资源。经典的场景是结合TF-IDF特征提取与逻辑回归模型,对用户生成内容进行心理状态实时判别,并基于时间戳聚合计算每日心理困扰率,进而描绘出120天内心理健康水平的波动曲线。这一范式不仅验证了传统NLP方法在小规模合成数据上的可行性,也为后续引入深度学习模型(如BERT)提供了对比基线,成为心理语言学与计算社会科学领域实验课堂的典型教学工具。
实际应用
在实际应用层面,该数据集及其配套分析框架为数字健康平台和社交媒体运营方提供了可落地的心理状态监测原型。例如,通过部署训练好的分类模型,在线社区可以实时标记包含潜在心理困扰的帖子,并在不暴露个体隐私的前提下以聚合看板形式呈现区域或时段性的心理波动热力图,从而指导干预资源的精准投放(如在高心理困扰时段推送咨询服务)。教育领域同样受益良多:校园社交论坛可利用该方案匿名分析学生情绪动态,辅助心理咨询中心识别群体性压力高峰(如期末周)。此外,科技公司常将该数据集作为A/B测试的基准,对比不同NLP模型在情感趋势捕捉上的性能,为产品功能迭代(如‘情绪日记’或‘心情趋势’等用户界面组件)提供数据驱动的设计依据。
衍生相关工作
围绕该数据集已衍生出一系列经典学术工作,推动了技术方法的持续演进。初期工作集中于改进特征表示,例如从TF-IDF过渡到预训练词向量(如Word2Vec)或基于Transformer的上下文编码(如BERT、RoBERTa),显著提升了短文本中俚语与隐晦表达(如‘I’m fine’的反讽含义)的分类精度。其后,研究者引入时间序列预测模型(如LSTM、Prophet)替代简单滑动平均聚合,实现了对未来3-7天心理困扰率的超前预报,将趋势检测任务升级为预警任务。还有工作探索了多模态扩展,将文本特征与模拟的社交互动指标(点赞数、转发率)进行联合建模,揭示社会支持(如高点赞对痛苦发帖的缓冲作用)与心理健康之间的动态关系。这些衍生工作不仅验证了合成数据的可迁移性,更催化了‘合成数据+迁移学习’范式的成熟,为在真实社交数据上微调模型提供了低成本验证渠道。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务